资讯动态

没有发布会的发布:上海AI实验室把744B智能体模型悄悄挂上ModelScope,3小时冲进热榜前五

发布时间:2026/10/9 22:26:00 来源:尧图企业网站定制
没有发布会的发布上海AI实验室把744B智能体模型悄悄挂上ModelScope3小时冲进热榜前五【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview当整个AI圈还在消化各家旗舰模型的发布节奏时上海人工智能实验室做了一件反常规的事9月11日一个名为Atria Dawn Preview的 744B 参数智能体大模型没有发布会、没有预告推文、没有媒体通稿权重就这样静默挂上了 Hugging Face、GitHub 与 ModelScope。三天后关于它的深度长文开始在中文技术社区密集出现而上架当天它已经在 ModelScope 热榜上冲进前五。这不是一次失败的传播恰恰相反——它可能是一场精心设计的无发布会发布。本文结合社区传播轨迹与仓库源码拆解这次静默上架背后的时间线、产品策略与技术含量。复盘一次没有发布会的发布从权重上架到社区自传播先还原时间线。9月11日Atria Dawn Preview 的权重在 Hugging Face 与 GitHub 仓库先后可见仓库首页 同时挂出 ModelScope 模型页没有官方公告没有发布会直播。真正的传播是从二传手开始的9月14日CSDN 上出现首篇破圈长文《上海人工智能实验室刚刚开源Atria Dawn五项基准第一》阅读量在同期相关文章中最高社区第一次系统性地知道这是一个 744B 参数的 MoE 智能体模型16 项基准拿下 5 项第一9月15日沐曦股份宣布完成 Day 0 适配国产 GPU 的适配速度成为第二波话题9月16日至18日传播进入工具化阶段1 亿 token 免费额度体验、Codex CLI 接入教程、Kimi Code 接入教程、长程 Agent 实测、wire API 兼容性分析接连出现讨论从这是什么转向我怎么用。这种传播曲线很典型没有发布会意味着没有官方叙事来定义这模型的想象空间于是社区用动手实验填补了叙事真空。而动手实验恰恰是这个模型最擅长引发的行为——它是一个为持续调用工具、执行多步任务而生的智能体模型天然适合被写进各种接入教程里。为什么是预览版 静默上架官方在试探什么静默上架的不是正式版而是Preview。这个命名本身就是策略信号。结合源码与社区情报可以拆出三层试探第一层用免费额度换真实工作负载。预览期间官方给出 1 亿 token 免费额度与 256K 上下文窗口模型只接受纯文本输入单次输出上限 65,536 token并存在账户级 RPM 限速。这是一套典型的压力测试配置额度给得慷慨但限速与配额共享机制确保了服务不被滥用让官方在正式商业化前拿到真实的使用曲线与故障样本。第二层用工具生态验证智能体定位。打开 README_CN.md你会发现接入文档的密度远超一般模型仓库——Codex、Claude Code、Kimi Code 三种主流编程代理的配置教程一应俱全甚至细致到input_modalities: [text]规避 400 多模态报错、max_output_size 65536匹配接口上限这类细节。这不是顺手写的文档而是把能跑通主流 Agent 框架当成了产品验收标准。第三层用真实的人机协作数据反哺研究。论文同步公开了 769 条人机协作任务记录96.5% 的任务启用了 AI但人类仍主导目标设定93.4%、最终决策85.5%与关键干预76% 的困难任务由人推动。预览版的静默上架本质上也是这套人机协作观测实验的规模化延伸——发布本身即数据采集。源码里藏着的硬实力1.5TB 权重的 MoE 巨兽仓库本身是理解这次发布为何值得关注的最好证据。打开 config.json模型架构一目了然模型类型glm_moe_dsa基于 GLM-5.2 基座训练78 层 TransformerMoE 配置256 个路由专家n_routed_experts: 256每个 token 激活 8 个专家num_experts_per_tok: 8专家粒度细化到每层独立路由长上下文预留max_position_embeddings高达 1,048,576对外提供 256K 上下文说明架构本身为百万级 token 做了位置编码预留配套推理协议chat_template.jinja 中内置了think推理标记、Reasoning Effort 控制low/medium/high/max以及 XML 格式的工具调用协议把思考-工具调用-观察的 Agent 循环写进了模板层。权重规模上model.safetensors.index.json 显示总权重约 1.5 TBBF16 精度被切分为 353 个分片。官方同时提供了 BF16 与 FP8 两个版本FP8 量化版显著降低部署门槛这解释了为什么 Day 0 就能完成国产 GPU 适配。热榜前五意味着什么社区用接入教程投票回到标题里的那个结果3 小时冲进 ModelScope 热榜前五。热榜算法通常同时加权浏览量、下载量与收藏量744B 的权重动辄以 GB 计前五的成绩说明社区关注度是真实的且转化为了实际下载行为。更值得注意的是关注度的结构。围绕 Atria Dawn 的社区内容里占比最高的是接入与实战教程而非单纯的资讯转发Codex CLI 接入教程专门解决is not a multimodal model的 400 报错与 context_window 配置Kimi Code 接入教程拆解了 thinking 模式的 effort 五档控制与 5 个常见配置坑Cherry Studio、Claude Code、TaoToken 中转等路径也被逐一验证。这种教程密度是智能体类模型独有的传播信号——大家不是围观它而是真的在拿它干活。基准成绩则为这种热情提供了支撑16 项评测中AutomationBench 53.8、BFCL v4 77.0、CyberGym 86.5、DeepSearchQA 96.0、BrowseComp 92.5 五项登顶SkillsBench 等 3 项位居第二而在 GDPval、JobBench、SWE-bench Pro 等长程专业任务上仍有明显提升空间。有趣的是社区对此并非一边倒吹捧有文章直接指出 SkillsBench 输给 Qwen 零点几分、GDPval 排名靠后八张图只拿了两张第一。正是这种敢于公开弱项的态度让五项第一的含金量显得更高——评测表格完整保留了对标模型的全部成绩没有选择性隐藏。正式版预期预览版在替谁探路从预览版的种种迹象看正式版的轮廓已经相当清晰模型即产品官方提供国内discovery.intern-ai.org.cn Token 计划与海外api.atria-asi.ai两条 API 通道一套模型 ID 同时兼容 OpenAI / Anthropic / Gemini 三套 wire API说明商业化通道早已铺好Preview 只是在积累用量数据Agent 优先的评测体系AutomationBench、CyberGym、BrowseComp、DeepSearchQA 这些基准全部是智能体干活类任务说明官方对模型的定位不是聊天模型而是科研与工程场景的端到端执行者MIT 许可 双精度版本彻底的开源姿态代码与权重均 MIT 协议 FP8 量化版为大规模私有化部署和国产算力生态留足了空间。一次没有发布会的发布反而让社区用 3 小时的热榜前五和随后一周的教程潮替官方完成了最真实的市场调研。当正式版到来时它要回答的问题只剩下一个在长程专业任务上的短板能否补上。对于 744B 参数、拥有 769 条人机协作观测数据做后盾的 Atria Dawn 来说这或许是所有预期里最值得等待的一个。【免费下载链接】Atria-Dawn-Preview项目地址: https://ai.gitcode.com/InternLM/Atria-Dawn-Preview创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑