人工智能
Anthropic 的新旗舰用更低的价格打赢了自家最大的模型。但网络安全的活儿,交给的是一个更旧的模型
在 Anthropic 公布的多数基准上,Claude Opus 5.5 都胜过 Mythos 级的 Fable 5.1,而每 token 的价格比它取代的 Opus 5 低 20%。更要紧的细节藏在公告下半部分:大多数网络安全类请求会被改道到 Opus 4.8。你调用的那串模型名,已经不再是「由哪个模型作答」的承诺。
MAI
Anthropic 在周二上午发布了 Claude Opus 5.5,而这次发布的形状颇不寻常。在该公司公布的多数基准上,这个模型胜过了高它一档、体量最大也最贵的 Fable 5.1,同时每 token 的价格比它所取代的 Opus 5 低 20%。这是标题,而且站得住。更有分量的细节在公告的下半部分,写在安全防护那一节里:你把一项网络安全任务交给 Opus 5.5,回答你的并不是 Opus 5.5。
小模型吃掉大模型
Anthropic 公布的对比表,在代理式编码、计算机操作和知识工作上都把 Opus 5.5 排在 Fable 5.1 之前。
| 基准 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — |
| GDPval-AA v2.1 | 1846 Elo | 1735 | 1708 | 1542 |
| Humanity's Last Exam | 67.7% | 65.6% | 63.6% | 57.2% |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | — |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
其中两行是输给 OpenAI 的 Astra,而 Anthropic 照登不误——Terminal-Bench-Science 上六个百分点的落差,不是厂商会顺手带进表里的那种数字。这份克制值得记一笔,因为它让表格其余部分更容易被相信。真正在商业上起作用的,是 Terminal-Bench 4.0 上比 Fable 5.1 高出十一个百分点这一项:Opus 与 Mythos 级模型之间那条档位分界线,已经不再是四个月前的那个意思。
价格就是论点
| 每百万 token | Opus 5.5 | Opus 5 |
|---|---|---|
| 输入 | $4 | $5 |
| 输出 | $20 | $25 |
| 缓存读取 | $0.20 | $0.50 |
| 缓存写入 | $5 | $6.25 |
| Fast mode 输入 / 输出 | $8 / $40 | — |
标价降幅是 20%,但 Anthropic 的说法更大:「Claude Opus 5.5 在代理式编码和知识工作上处于领先,在典型工作负载下运行成本比 Opus 5 低 40%」——理由是它走到答案所花的 token 更少。在发布报道中被引用的 Box 表示,在自家评测里它消耗的 token 约为 Opus 5 的三分之一,输出还少了 40% 的赘语。The New Stack 的文章则称,Opus 5.5 以大约 20% 的单任务成本超过了 GPT-6 Astra。
对大规模跑代理的人来说,啰嗦就是账单本身。单价降 20% 只是明细里的一行;但完成一项任务所耗 token 降到三分之一,改变的是哪些工作负载根本跑不跑得起来。
你调用的模型,未必就是真正在跑的那个
这里是应该被注意、却大概不会被注意的部分。Anthropic 的公告写得很直白:
用户将能够在常规软件开发生命周期中识别并修复自己代码里的缺陷,但大多数网络安全任务会被改道到 Opus 4.8。
不是拒绝,是改道——而且改到一个隔了两代的模型上。同样的机制本月早些时候随 Fable 5.1 一起出现:渗透测试、漏洞利用代码生成、基于二进制的漏洞扫描,不是被拒绝,而是被转给 Opus 系列的模型。Opus 5.5 继承了它,Anthropic 表示将把 Cyber Verification Program 的覆盖范围扩展到这个新模型,面向提出申请并获批的防守方。
The New Stack 点出了其中的含义:发给 Opus 5.5 的一次请求,可能视防护是否触发而由 Opus 4.8 或 Opus 5 来处理。对一次聊天来说这只是趣闻。但对一个多步骤的代理而言,这意味着同一次运行可能横跨三个能力不同、失败方式不同、成本也不同的模型版本,而开发者拿不到任何明确信号说明接缝落在哪里。在这套 API 之上搭评测体系的人,从此多了一个看不见的变量。
能力正在与访问权解绑
把这些防护措施放在一起读,一个模式就浮现出来。生物学能力被挡在 Life Sciences Verification Program 之后。网络安全能力被挡在 Cyber Verification Program 之后。蒸馏被随 Fable 5.1 引入的对抗措施「preserved thinking」堵住,适用于 2026 年 8 月 31 日之后创建的 API 账户。而 Opus 5.5「也不再支持在关闭『thinking』模式的情况下使用」——这是直接移除了一个配置项,而不是把它标为弃用。
一个模型能做什么,和你的账户能够到什么,已经不再是同一个问题。前沿正在按客户而非按模型设闸,API 里的那串名字变成了一次请求,而不是一份规格。对于 Anthropic 今年公开处理过的滥用来说,这是一个说得通的回应;同时它也实实在在地改变了「购买一个模型的访问权」意味着什么。基准会在一周之内被第三方复现。而路由行为从外部更难度量,偏偏正是它,将决定这些模型实际上会被怎么用。
Sources: Introducing Claude Opus 5.5 (Anthropic) · Anthropic releases Opus 5.5 with lower prices and Fable-level performance (TechCrunch) · Anthropic releases Opus 5.5 and cuts pricing by 20% (The New Stack) · Google, Anthropic, and OpenAI Unveil Cyber AI Models, Safeguards, and Access Programs (The Hacker News)