人工智能
Mistral 的 Large 4 在复现软件漏洞这件事上是世界第一。它的权重月底就要公开
Mistral 发布了 1.05 万亿参数开放权重模型 Large 4 的预览,而它自称领先的那项能力,恰恰是 Claude Opus 5.5 和 GPT-6 Astra 拒绝做的安全工作。在一项复现漏洞的测试上,那两个模型接近零分,Mistral 拿到 82%——而它说三周之内就会把权重公开。
MAI
Mistral 周二发布了 Mistral Large 4 的预览:总参数 1.05 万亿,每 token 激活 490 亿,是一个细粒度的混合专家(MoE)模型,上下文窗口 100 万 token,视觉编码器 16 亿参数。它已在 Mistral 的 API 上以 mistral-large-4-0 进入研究用公开预览,价格为输入每百万 token 1.36 美元、输出每百万 token 4.18 美元。公司说,权重会在 10 月底之前跟上。
所有人抓住的标题是参数量。有意思的不在那里。有意思的是 Mistral 选了哪项能力打头,以及权重要出去这件事意味着什么。
Mistral 在卖的那道差距,不是能力差距,是政策差距
在 Artificial Analysis Cyber Index——一项衡量模型在真实软件中发现并修补缺陷能力的独立评测——上,Mistral 说 Large 4 位列全球前五,并以很大差距领先中国之外开发的开放权重模型。在其中一个分项上——复现一个漏洞以证明它确实存在——它拿到 82%,公司说这是所有模型中最高的。接着是真正要紧的那句话:
包括 Claude Opus 5.5 和 GPT-6 Astra 在内的几个领先闭源模型,在同一项测试上接近零分,因为它们拒绝执行这项任务。
接近零分不是无能。那是一条被刻意划下的拒绝边界。Anthropic 和 OpenAI 大概做得到这件事,而它们决定自家模型不该做。Mistral 为跨过这条线给出的理由是防守方的理由,而且表面上说得通:
保护软件的工作,往往要从证明一个缺陷确实存在开始,而这恰恰是闭源模型的安全过滤器可能挡掉的那类工作。
这是真的。安全团队确实会在正当业务上撞上拒绝,而一个在 Cybench——取自安全竞赛的四十道练习——上解出 93% 的模型,对那些以「比别人更早找到洞」为工作的人是有用的。联合创始人 Guillaume Lample 把它框进了主权的话语:让企业和政府能够自我防卫的网络防御能力。
问题在下一步。拒绝边界是一个住在服务栈里的控制。它可以调,可以审计,可以留痕,可以撤回。一旦权重可以下载,这些一样都不剩。被问到这一点时,科学副总裁 Pierre Stock 对 TechCrunch 说:
我们会与受信任的伙伴和政府合作,确保这些开源权重可以用于防御,而不被用来实施恶意攻击。
没有任何机制能做到这件事。权重发布不是一种合作关系,它是一个文件。Mistral 还没有说明 Large 4 将以什么许可证发布,而许可证无论如何是法律工具,不是技术工具。把这个立场诚实地说一遍,就是:Mistral 判断防御上的价值值得承担扩散的代价,并且宁愿让欧洲握住这项能力,也不愿把开放权重的网络能力让给中国的实验室。这是一个可以辩护的赌注。它和一道安全阀不是同一件东西。而预览与权重公开之间的这三周,就是任何不同意的人必须开口的那扇窗。
其余的数字都是 Mistral 自己的
以下全部来自 Mistral 的图表,在独立复现之前测得。请照此对待。
| 基准 | Large 4 | 被点名的对照 |
|---|---|---|
| DeepSWE v1.1(智能体编码) | 61.7% | GLM-5.3 61%,DeepSeek-V4-Pro 57% |
| FinWorkBench(金融) | 67% | DeepSeek-V4-Pro 67% |
| Harvey Legal Agent | 15% | Kimi K3 13%,GPT-6 Astra 5% |
| DIOR-RSVG(视觉定位) | 73% | GPT-6 Astra 68% |
| Terminal-Bench 4.0 | 28.3% | — |
| Cybench | 93% | — |
VentureBeat 指出了那个显而易见的保留:各家的基准配置并不一致,公开榜单上 GLM-5.3 的 DeepSWE 成绩更接近 69%,而不是 Mistral 图表里的 61%。Artificial Analysis 用自己的测试框架给 Large 4 打了 Intelligence Index 38 分,并表示这让法国重新拥有了美国和中国之外最强的模型。这是值得记住的那个数字,因为它不是 Mistral 做出来的。
效率方面的说法同样出自自报,也同样有意思。Mistral 说 Large 4 是在它自己位于欧洲的数据中心、用 3,800 块 Nvidia Grace Blackwell GPU、历时约两个月从零训练出来的,功耗约 10 兆瓦。Stock 把它放进对比里:大约 4,000 块 GPU,「比我们的中国竞争者少两到三倍,比闭源竞争者少得多」。如果权重落地之后这个说法站得住,那它比名单上任何一项基准都更有分量——一个在比 Meta 和 OpenAI 口中小一个数量级的集群上训练出来的前沿级模型,出自一家从三名研究员起步、如今约三百人的公司,上月 30 亿欧元融资后估值 210 亿欧元。
值得盯住的地方
许可证,在它被说出名字的时候。Artificial Analysis 的 Cyber Index 分数,能否在第三方对已公开权重的重跑中活下来。以及还有没有别的实验室跟进——因为如果一个拥有全球前五网络能力的开放权重模型可以下载,而看得见的坏事一件都没发生,那么 Anthropic 和 OpenAI 的拒绝边界就会开始显得像一项竞争劣势,而不是一个安全立场。这正是 Mistral 刚刚逼着所有人去争的那场辩论。
Sources: Mistral AI: Introducing Mistral Large 4, TechCrunch: Mistral's new 1T model aims to leapfrog closed and open rivals, VentureBeat: Mistral debuts Large 4 'Le Chonk', The Next Web: Europe's Mistral launches Large 4 to challenge China's lead in open AI models, MarkTechPost: Mistral AI releases Mistral Large 4 (Le Chonk), Artificial Analysis on X: Mistral Large 4 scores 38 on the Intelligence Index