人工知能
上海AI研究所は自前のフロンティアモデルを訓練しなかった。Z.ai のモデルを事後学習したのだ
上海人工智能実験室が、7,440億パラメータのエージェント向け MoE モデル「Atria Dawn Preview」を MIT ライセンスで公開した。ただしベースは自前ではなく Z.ai の GLM-5.2 である。焦点はこの分業にあり、輸出規制はそれが起きた層には届かない。
MAI
上海人工智能実験室(Shanghai Artificial Intelligence Laboratory)が、研究・エンジニアリング用エージェント向けの7,440億パラメータの Mixture-of-Experts モデル「Atria Dawn Preview」を MIT ライセンスで公開した。裏づけとなる論文「Atria Dawn: The Dawn of Agentic Superintelligence」は9月14日に arXiv に掲載され、著者は179名に及ぶ。論文は、16のベンチマークでフロンティア級エージェントと競合し、うち5つで報告済み最高スコアを得たと主張している。
だが、注目すべき主張はそこではない。重要なのはモデルカードの冒頭にある一文で、Atria Dawn Preview は「7,440億パラメータの MoE である GLM-5.2 基盤モデルの上に構築された」と書かれている。GLM-5.2 は Z.ai(智譜 / Zhipu)のモデルであり、Hugging Face 上で MIT ライセンスで公開されているものだ。上海AI研究所は、今回のリリースのためにフロンティア級のベースモデルを事前学習したわけではない。他の研究所のものを取り、事後学習を施したのである。
中国のスタックは層に分かれつつある
米国では、フロンティアは垂直統合されている。ベースモデルを事前学習した研究所が、そのまま事後学習を行い、提供し、収益を得る。今回のリリースが示すのは別の構図だ。Z.ai が7,440億パラメータのベースを事前学習する資本コストを負担し、それを何の制約も付けないライセンスで手放した。国家系の研究機関がそれを拾い上げ、予算のすべてをその上の層に注いだ——論文が記述する「Verifiable Experience Pipeline」、すなわちツールを介した操作を実行可能な環境と外部検証された結果に接続する仕組みである。そしてその成果もまた、同じライセンスで手放した。
その帰結として、どちらの層での改善も、下流のすべてに無償かつ即座に波及する。これは輸出規制の前提とも噛み合わない。規制は計算資源を縛り、計算資源は事前学習を縛る。しかし事後学習は縛らない。今回のリリースで費用のかかる作業が実際に行われたのは、まさにその層だ。そして MIT ライセンスも縛らない。重みがアップロードされた瞬間に、成果は国外へ運び出される。
表と、その空欄
以下の数値はすべて研究所自身のモデルカードによるものであり、第三者による再現は行われていない。
| ベンチマーク | Atria Dawn Preview | DeepSeek V4 Pro | Kimi K3 | Qwen 3.8 Max | Claude Opus 5 |
|---|---|---|---|---|---|
| DeepSearchQA | 96.0 | – | 95.9 | – | – |
| BrowseComp | 92.5 | 83.4 | 91.2 | – | 90.8 |
| WideSearch | 81.9 | – | 79.6 | 81.9 | – |
| DeepResearch Bench II | 51.1 | 46.6 | 51.3 | 49.2 | 54.1 |
| MLE-bench Lite | 86.2 | 86.8 | 85.8 | 81.3 | 88.0 |
| SWE-bench Pro | 59.6 | 58.3 | 61.6 | 65.1 | 74.7 |
| Terminal-Bench 2.1 | 78.3 | 78.7 | – | 89.3 | 90.2 |
| BFCL v4 | 77.0 | 71.4 | 69.1 | – | – |
| AutomationBench | 53.8 | 41.7 | 45.9 | 49.7 | 49.4 |
| Workspace-Bench | 65.0 | 55.7 | 60.6 | 63.9 | 65.8 |
| CyberGym | 86.5 | 83.3 | 78.7 | 73.8 | – |
正直に読めば、「16のうち5つで最高」という結果は、聞こえるほど広いものではない。比較欄のいくつかは空白であり、首位のスコアは競合の数値を打ち負かしたことではなく、単にその数値が公表されていないことを意味する場合がある。比較が揃っている行——SWE-bench Pro、Terminal-Bench 2.1、MLE-bench Lite、DeepResearch Bench II——では Claude Opus 5 が先行しており、そのうち1つでは15ポイントの差がついている。
Atria Dawn が明確に先行しているのは検索とツール利用だ。DeepSearchQA、BrowseComp、BFCL v4、AutomationBench。これは一貫したプロファイルであり、事後学習が狙ったものと合致している。エージェント的な足場に関する主張であって、汎用的なフロンティア性能の主張ではない。この区別については、見出しの数字よりも論文のほうが慎重である。
論文の大半は人間についてのものだ
今回のリリースで異例なのは、論文のおよそ半分が、自らの構築過程についての労働研究になっている点だ。著者らは56名の参加者による769件のタスク記録を、エージェントのログとあわせて分析した。参加者は、AI支援で完了したタスクのおよそ3分の1を、AIなしでは実行不可能だったと評価している。エージェントはしばしば手法を提案し、修正を実装した。一方で最終判断の大半は人間が保持していた。
これらの観察は、タスク単位の実行からプロジェクト単位の協働への移行を示している。人間の労力は、何を追求する価値があるのか、そして証拠がどのように研究を導くべきかに集中していく。
自らのモデルがどの程度モデルによって作られたかを自己調査して公表する研究所は、再帰的な性能向上についての主張を、監督についての主張として枠づけていることになる。どちらの読み方も要旨から可能であり、その要旨は「継続的な開発のリスクと方向性に対する、説明責任を伴う人間の権限」を保つよう求めて締めくくられている。これは一つの研究所の内部ワークフローを、その研究所自身が測定した結果として受け取るべきものであって、他の誰かについての証拠ではない。
重みとともに配られるもの
表の中で最も高い単独の数値は、ソフトウェアの脆弱性を発見する能力を測るベンチマーク CyberGym の86.5である。MIT ライセンスの下では、この能力は誰でも恒久的にダウンロードでき、利用条件も撤回手段も存在しない。モデルはテキスト入力のみで、コンテキスト長は256Kトークン。フル精度の重みと並んで FP8 ビルドも公開されており、実行に必要なハードウェアの敷居が下がっている。
オープンウェイトについてどう考えるにせよ、決定がどこで下されたかは見ておく価値がある。国家系の研究機関が、自ら事前学習していないフロンティア規模のエージェントモデルを、別の企業が公開したベースの上に構築し、どちらも取り消せないライセンスで公開した。この重みが何をするかについての責任は、いまや二つの組織と、ダウンロードするすべての人に分散している。
Sources: Atria-Dawn-Preview モデルカード(上海人工智能実験室 / InternLM, Hugging Face) · Atria-Dawn-Preview-FP8 · Atria Dawn: The Dawn of Agentic Superintelligence (arXiv:2609.15818) · GLM-5.2 モデルカード(Z.ai)