← 全部文章

人工智能

Anthropic 的中端模型在智能体编程上击败了六天前发布的旗舰,价格只有一半。所谓分级已经不再说明任何问题

9 月 28 日发布的 Claude Sonnet 5.5 价格未变,在 Anthropic 自家的基准测试中以一半的价格在智能体编程上超过了旗舰 Opus 5.5。更安静的一条消息,是一个用来阻止他人提取模型推理过程的分类器。

MAI
Anthropic 为 Claude Sonnet 5.5 发布所公开的官方宣传图。

9 月 28 日,Anthropic 发布了 Claude Sonnet 5.5,价格与 Sonnet 5 完全相同:每百万输入 token 2 美元,每百万输出 token 10 美元。在该公司自己公布的基准表中,这款新的中端模型在 Terminal-Bench 4.0 上取得 70.6%。而六天前发布、定价 4 美元与 20 美元的旗舰 Claude Opus 5.5,成绩是 66.4%。

这一条对比比发布文案里的任何内容都更值得琢磨。Anthropic 卖的是 Haiku、Sonnet、Opus 三级阶梯,这架阶梯本应在能力与成本之间做交换。但在 Anthropic 自己选择重点展示的智能体编程基准上,中间那一级如今站在了最高一级之上,价格只有一半。

数字说明了什么

以下全部数据均来自 Anthropic。截至本文写作时,尚不存在对 Sonnet 5.5 的独立第三方评测。

基准Sonnet 5Sonnet 5.5Opus 5.5
Terminal-Bench 4.0(智能体编程)10.3%70.6%66.4%
CursorBench 4.0—55.5%57.8%
GDPval-AA v2.1(知识工作)144918441846
AA-Briefcase—18111822
OSWorld 2.1(计算机操作)57%80.1%81.8%
模型输入 / 百万 token输出 / 百万 token
Claude Opus 5.5$4$20
Claude Sonnet 5.5$2$10
Claude Sonnet 5$2$10

请仔细看 GDPval-AA 这一行:1844 对 1846 不是差距,而是测量噪声。在五项基准中的四项上,Sonnet 5.5 与一款贵一倍的模型相差不过两三分,在第五项上则胜出。

Terminal-Bench 那一行值得怀疑,而不是鼓掌。一次小版本更新里从 10.3% 跳到 70.6%,这不是能力曲线,而是一个不为该测试框架而造的模型被一个为之而造的模型替换掉了。Sonnet 5 的分数说明的是它在特定智能体脚手架上表现得有多糟,而不是它的能力有多差。应当把 70.6% 理解为:Anthropic 针对它如今所测量的对象做了优化。

效率方面的说法立足于同样的基础。Anthropic 称 Sonnet 5.5 的输出生成比 Sonnet 5 快约 30%,并通过更短的输出和更少的工具调用把单任务成本降低最多 30%,同时公布了配套的客户数据:Box 称运行速度提升 2.4 倍、token 减少 12%,Slack 称输出 token 减少 14%,Lovable 称工具调用减少约三分之一,Base44 称完成任务需要 3.6 轮迭代,而 Opus 5 需要 7.7 轮。这些都是设计合作伙伴在发布前提供给厂商的数字。它们指向一致的方向,这本身有一定价值,但没有一项是独立测量。

Opus 这一级现在还剩下什么

如果中端模型在通用知识工作上与旗舰持平、在智能体编程上还领先,那么多付的 2 美元和 10 美元究竟买到了什么,就是个绕不开的问题。按 Anthropic 自己公布的价格表,答案正在收窄:Opus 5.5 保留了更便宜的缓存读取倍率,拥有 8 美元与 40 美元的 "fast mode",并在 CursorBench、AA-Briefcase 和 OSWorld 上略微领先。这些理由真实存在,但很单薄。

更诚实的读法是:前沿这一级已经变成了一个临时位置,用来安放那些尚未便宜到可以规模化供应的能力,而两者之间的间隔如今以天计而非以季度计。Opus 5.5 与一款价格更低、成绩更好的模型之间只隔了六天。任何因为"不在乎成本"而把系统建在 Opus 这一级上的团队,都该重新跑一遍自己的评测,而不是继续相信这架阶梯。

没有人放在标题里的那个分类器

埋在安全说明里的,是这次发布的第二个故事。Sonnet 5.5 是第一款带有 Anthropic 网络安全防护的 Sonnet 模型,高风险请求会被回退给 Sonnet 5 处理。它同时还搭载了用于阻止提取模型推理过程的分类器。

最后这一项并不是通常意义上的安全功能。推理轨迹是蒸馏的原材料——用昂贵模型的输出去训练廉价模型的手法,也正是催生出若干如今在价格上逼迫 Anthropic 的开放权重竞争者的手法。Anthropic 正把自家的思维链当作需要防守的资产,而且现在把这一点写进了产品发布文里。

这一切发生在 OpenAI 因安全测试出现退步而撤下 GPT-6.1 Astra 的同一周。一家实验室按住了前沿模型,另一家发出了更便宜的模型,同时锁上了推理的门。两者都是在回应同一种压力:稀缺的东西已经不再是能力,而是交付成本。

Sources: Introducing Claude Sonnet 5.5 — Anthropic · Claude Platform pricing · Anthropic launches Claude Sonnet 5.5 with 30% cost reduction per task — VentureBeat · Anthropic Releases Claude Sonnet 5.5 at Unchanged Sonnet 5 Pricing — Unite.AI · Anthropic releases Claude Sonnet 5.5: 70.6% on Terminal-Bench 4.0 — MarkTechPost

继续阅读