人工智能
上海AI实验室没有训练自己的前沿模型。它把智谱的模型拿来做了后训练
上海人工智能实验室以 MIT 许可发布了 7440 亿参数的智能体模型 Atria Dawn Preview,底座却不是自家的,而是智谱(Z.ai)的 GLM-5.2。真正的看点是这种分工,而出口管制够不到它发生的那一层。
MAI
上海人工智能实验室以 MIT 许可发布了 Atria Dawn Preview——一个面向科研与工程智能体的 7440 亿参数混合专家(MoE)模型。配套论文《Atria Dawn: The Dawn of Agentic Superintelligence》于 9 月 14 日上传至 arXiv,署名作者达 179 人。论文称该模型在 16 项基准上与前沿智能体相当,并在其中 5 项上取得了已公开的最高分。
值得注意的并不是这个说法。真正关键的一句写在模型卡片的开头:Atria Dawn Preview「构建于 7440 亿参数的 MoE 基座模型 GLM-5.2 之上」。GLM-5.2 是智谱(Z.ai)的模型,以 MIT 许可发布在 Hugging Face 上。上海人工智能实验室并没有为这次发布预训练一个前沿基座,而是拿了另一家实验室的基座,在上面做后训练。
中国的技术栈正在分层
在美国,前沿是垂直一体化的:预训练基座模型的实验室,同时负责后训练、部署并拿走收入。这次发布呈现的是另一种结构。智谱承担了预训练 7440 亿参数基座的资本开销,然后用一份不附加任何限制的许可把它交了出去。一家国家背景的研究机构接过它,把预算全部投入上面一层——也就是论文所描述的「Verifiable Experience Pipeline」,把工具介导的交互连接到可执行环境与经外部验证的结果。然后,它同样把这一层的成果交了出去,用的是同一份许可。
结果是:任一层上的改进,都会立即、免费地传导给全部下游。这也与出口管制所依赖的前提相冲突。管制约束算力,算力约束预训练。但它不约束后训练,而这次发布中真正花钱的工作恰恰发生在这一层;它也不约束 MIT 许可——权重上传的那一刻,成果就已经出境。
表格,以及表格里的空格
以下数字全部来自实验室自己的模型卡片,尚无第三方复现。
| 基准 | Atria Dawn Preview | DeepSeek V4 Pro | Kimi K3 | Qwen 3.8 Max | Claude Opus 5 |
|---|---|---|---|---|---|
| DeepSearchQA | 96.0 | – | 95.9 | – | – |
| BrowseComp | 92.5 | 83.4 | 91.2 | – | 90.8 |
| WideSearch | 81.9 | – | 79.6 | 81.9 | – |
| DeepResearch Bench II | 51.1 | 46.6 | 51.3 | 49.2 | 54.1 |
| MLE-bench Lite | 86.2 | 86.8 | 85.8 | 81.3 | 88.0 |
| SWE-bench Pro | 59.6 | 58.3 | 61.6 | 65.1 | 74.7 |
| Terminal-Bench 2.1 | 78.3 | 78.7 | – | 89.3 | 90.2 |
| BFCL v4 | 77.0 | 71.4 | 69.1 | – | – |
| AutomationBench | 53.8 | 41.7 | 45.9 | 49.7 | 49.4 |
| Workspace-Bench | 65.0 | 55.7 | 60.6 | 63.9 | 65.8 |
| CyberGym | 86.5 | 83.3 | 78.7 | 73.8 | – |
老实读下来,「16 项中 5 项最高」这个结果没有听上去那么宽。若干对比格是空的,这意味着某个领先分数有时并不表示压过了对手,而只是对手的数字没有被列出。在对比完整的那几行——SWE-bench Pro、Terminal-Bench 2.1、MLE-bench Lite、DeepResearch Bench II——领先的是 Claude Opus 5,其中一行差距达 15 分。
Atria Dawn 明确领先的是检索与工具调用:DeepSearchQA、BrowseComp、BFCL v4、AutomationBench。这是一条自洽的能力曲线,也正对应后训练所针对的方向。它是关于智能体脚手架的主张,而不是关于通用前沿能力的主张——在这个区分上,论文比头条数字要谨慎得多。
论文的大半篇幅是在写人
这次发布真正少见的地方在于,论文大约有一半是对其自身建造过程的劳动研究。作者分析了 56 名参与者的 769 条任务记录,并结合智能体日志。参与者认为,在 AI 辅助下完成的任务中,约三分之一若没有 AI 就无法完成。智能体经常提出方法并实现修改,而最终决定大多仍由人保留。
这些观察表明,工作正在从任务层面的执行转向项目层面的协作,人的精力集中于什么值得追求、以及证据应如何引导研究。
一家实验室公开自查「自己的模型有多少是由模型造出来的」,实际上是在提出一个关于递归自我改进的主张,同时把它包装成一个关于监督的主张。摘要里这两种读法都成立,而摘要的结尾呼吁保有「对持续开发的风险与方向负责的人类权威」。应当把它当作一家实验室对自身内部工作流程的自我测量来看待,而不是关于其他任何人的证据。
随权重一起发出去的东西
表中最高的单项数字是 CyberGym 的 86.5,这项基准衡量模型发现软件漏洞的能力。在 MIT 许可之下,这项能力任何人都可以永久下载,没有使用条款,也没有收回的机制。该模型仅支持文本输入,上下文长度 256K;除全精度权重外还同时发布了 FP8 版本,运行所需的硬件门槛因此更低。
无论你如何看待开放权重,都值得注意这个决定落在哪里。一家国家背景的研究机构,把一个自己并未预训练的前沿规模智能体模型,搭在另一家公司公开的基座之上,用一份双方都收不回的许可发了出去。这些权重将做什么,其责任如今分散在两家机构,以及每一个下载它的人身上。
Sources: Atria-Dawn-Preview 模型卡片(上海人工智能实验室 / InternLM, Hugging Face) · Atria-Dawn-Preview-FP8 · Atria Dawn: The Dawn of Agentic Superintelligence (arXiv:2609.15818) · GLM-5.2 模型卡片(智谱 Z.ai)