人工知能
Mistral の Large 4 は、ソフトウェアの脆弱性を再現する能力で世界最高である。その重みは月末に公開される
Mistral が、1.05 兆パラメータのオープンウェイトモデル Large 4 をプレビュー公開した。そして同社が先頭に立つと謳う能力は、Claude Opus 5.5 と GPT-6 Astra が拒否するセキュリティ作業である。脆弱性の再現を測るテストで、その二つがほぼゼロのところ Mistral は 82 パーセントを出した——そして重みは三週間のうちに公開するという。
MAI
Mistral は火曜、Mistral Large 4 をプレビュー公開した。総パラメータ 1.05 兆、トークンあたりのアクティブパラメータ 490 億、粒度の細かい Mixture of Experts モデルで、コンテキストウィンドウは 100 万トークン、ビジョンエンコーダは 16 億パラメータ。Mistral の API で mistral-large-4-0 として研究用パブリックプレビューに入っており、価格は入力 100 万トークンあたり 1.36 ドル、出力 100 万トークンあたり 4.18 ドル。重みは 10 月末までに続くと同社は述べている。
誰もが飛びついた見出しはパラメータ数だった。面白いのはそこではない。面白いのは、Mistral がどの能力を先頭に立てて見せたか、そしてその重みが外に出るということが何を意味するかである。
Mistral が売っている差は、能力の差ではなく方針の差である
Artificial Analysis Cyber Index——モデルが実在するソフトウェアの欠陥をどれだけうまく見つけ、直せるかを測る独立した評価——において、Large 4 は世界の上位五位に入り、中国以外で開発されたオープンウェイトモデルを大きく引き離して首位だと Mistral は言う。その構成要素のひとつ——欠陥が実在することを示すために脆弱性を再現する課題——では 82 パーセントを記録し、これは全モデル中で最高だと同社は述べる。そして、肝心の一文が続く。
Claude Opus 5.5 と GPT-6 Astra を含むいくつかの主要なクローズドモデルは、同じテストでほぼゼロのスコアになる。タスクの実行を拒否するからである。
ほぼゼロは無能ではない。意図して置かれた拒否の境界である。Anthropic と OpenAI はおそらくこの作業ができるのに、自社のモデルにはやらせないと決めたのだ。その線を越えることについての Mistral の論は防御側の論であり、一見したところ理のあるものである。
ソフトウェアを守る仕事は、欠陥が実在することを証明するところから始まることが多い。それはまさに、クローズドなモデルの安全フィルタが遮りうる類の作業である。
これは本当だ。セキュリティチームは正当な業務で実際に拒否に突き当たるし、Cybench——セキュリティ競技から採られた 40 題の演習——で 93 パーセントを解くモデルは、誰かより先に穴を見つけるのが仕事の人々にとって有用である。共同創業者の Guillaume Lample は、これを主権の言葉で枠付けた。企業と政府が自らを守れるようにするサイバー防御能力だ、と。
問題はその次の一歩である。拒否の境界は、提供側のスタックに住む制御である。調整でき、監査でき、記録でき、取り消せる。重みがダウンロード可能になれば、そのどれも残らない。この点を問われた科学担当副社長の Pierre Stock は、TechCrunch にこう語った。
我々は信頼できるパートナーと政府と協働し、オープンソースの重みが防御のために使われ、悪意ある攻撃の実行には使われないようにする。
それを成り立たせる仕組みは存在しない。重みの公開は提携ではない。ファイルである。Mistral は Large 4 がどのライセンスで出るのかをまだ明らかにしておらず、そもそもライセンスは法的な道具であって技術的な道具ではない。この立場を正直に言い直せば、Mistral は防御上の価値が拡散に見合うと判断した、そしてオープンウェイトのサイバー用途の道具立てを中国のラボに譲るより、欧州がこの能力を持つほうがよいと考えている、ということである。それは擁護できる賭けだ。安全装置と同じものではない。そしてプレビューから重み公開までの三週間が、反対する者が物を言わなければならない窓である。
ほかの数字は Mistral 自身のものである
以下はすべて Mistral の図表から来ており、独立した再現を経ていない。そのつもりで扱うべきである。
| ベンチマーク | Large 4 | 挙げられた比較対象 |
|---|---|---|
| DeepSWE v1.1(エージェント的コーディング) | 61.7% | GLM-5.3 61%、DeepSeek-V4-Pro 57% |
| FinWorkBench(金融) | 67% | DeepSeek-V4-Pro 67% |
| Harvey Legal Agent | 15% | Kimi K3 13%、GPT-6 Astra 5% |
| DIOR-RSVG(視覚的接地) | 73% | GPT-6 Astra 68% |
| Terminal-Bench 4.0 | 28.3% | — |
| Cybench | 93% | — |
VentureBeat は当然の留保を指摘している。ベンチマークの構成はベンダー間で異なり、公開リーダーボードでは GLM-5.3 の DeepSWE スコアは、Mistral の図表が示す 61 パーセントよりも 69 パーセント寄りである。Artificial Analysis は自前のハーネスで Large 4 を Intelligence Index 38 と採点し、これによってフランスが再び米国と中国の外で最も有能なモデルの地であると述べた。これが手放さずにおくべき数字である。Mistral が出したものではないからだ。
効率の主張も同じく自己申告であり、同じく興味深い。Mistral によれば、Large 4 は欧州にある自社データセンターで、Nvidia Grace Blackwell GPU 3,800 基を用いて約 2 か月でゼロから訓練され、消費電力は約 10 メガワットだった。Stock は比較の形でこう置いた。およそ 4,000 基の GPU、「我々の中国の競合より 2 倍から 3 倍少なく、クローズドソースの競合よりは大幅に少ない」。重みが出たあとにこれが保つなら、これはリストにあるどのベンチマークよりも重い結果である——Meta や OpenAI が口にするものより一桁小さいクラスタで訓練されたフロンティア級のモデル、しかも研究者が三人だった会社が今は約三百人になり、先月の 30 億ユーロ調達を経て 210 億ユーロの評価額をつけている。
追うべきところ
ライセンスが、名を明かされたとき。Artificial Analysis の Cyber Index のスコアが、公開された重みに対する第三者の再実行を生き延びるかどうか。そして他のラボが追うかどうか——なぜなら、上位五位のサイバー能力を持つオープンウェイトモデルがダウンロードできて、目に見えて悪いことが何も起きないのであれば、Anthropic と OpenAI の拒否の境界は、安全上の立場ではなく競争上の不利に見えはじめる。それが、Mistral がいま他の全員に強いた議論である。
Sources: Mistral AI: Introducing Mistral Large 4, TechCrunch: Mistral's new 1T model aims to leapfrog closed and open rivals, VentureBeat: Mistral debuts Large 4 'Le Chonk', The Next Web: Europe's Mistral launches Large 4 to challenge China's lead in open AI models, MarkTechPost: Mistral AI releases Mistral Large 4 (Le Chonk), Artificial Analysis on X: Mistral Large 4 scores 38 on the Intelligence Index