← 全部文章

人工智能

Anthropic 把 Haiku 的价格砍到与 GPT-6 Luna 分毫不差。两者分道扬镳的地方,是 10 万 token 的那行小字

Claude Haiku 5.5 的输入价格为每百万 token 0.10 美元,是上一代的十分之一,也与 OpenAI 的 GPT-6 Luna 基准费率完全相同。但新增的两档定价,以及基准表上缺席的那几家实验室,让这个标题没那么简单。

MAI
Anthropic 在自家发布页面上使用的 Claude Haiku 5.5 公告配图。

Anthropic 于周三发布 Claude Haiku 5.5,而真正值得注意的数字不是跑分。这款模型的基准费率为每百万输入 token 0.10 美元、输出 0.50 美元——是 Haiku 4.5 的十分之一,也与 OpenAI 为 GPT-6 Luna 定下的价格分毫不差。两家在几乎其他所有方面都在竞争的实验室,在小模型的价格下限上落到了同一个点。

价格

每百万 tokenHaiku 5.5(≤10 万)Haiku 5.5(>10 万)Haiku 4.5Sonnet 5.5
输入$0.10$0.50$1.00$2.00
输出$0.50$2.50$5.00$10.00
缓存读取$0.01$0.05$0.10$0.10
缓存写入$0.125$0.625$1.25$2.50

标题是降价 90%。更诚实的数字出自 Anthropic 自己:在平均工作负载上大约降低 75% 的成本。同一份公告中,Sonnet 5.5 的缓存读取价格也减半至 0.10 美元,Anthropic 估计这能让典型的智能体负载省下约 20%。Max 与 Team 订阅用户本周起开始获得每月 API 额度——分别为 100 美元、200 美元,以及团队共享的最高 500 美元。

Haiku 多了一道台阶

Haiku 4.5 无论请求多大都是同一个费率。Haiku 5.5 在输入超过 10 万 token 后收费翻五倍。Anthropic 表示,Haiku 4.5 约 90% 的请求都低于这一门槛,这正是 75% 这个平均值的算法来源——同时也意味着剩下那一成既有流量拿到的折扣要小得多。一个每项任务消耗 token 略多的新分词器,也被计入了同一份估算。

与 GPT-6 Luna 的"一致"就在这里失效。Luna 的高档费率从 27.2 万输入 token 开始,而 Haiku 从 10 万开始。两款模型共享的是标价,不是成本曲线;而最可能感受到差别的工作负载,恰恰是廉价模型被派去做的那些:长文档摘要、大上下文检索、会不断累积历史的智能体循环。按标题数字估算迁移成本的团队,会得到错误的答案。

对比对象止步于 OpenAI

Anthropic 的评测表只把 Haiku 5.5 与 Haiku 4.5、GPT-6 Luna 和 Sonnet 5.5 摆在一起,别无其他。以下全部是该公司自行公布的结果,并未经独立复现。

评测Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
GDPval-AA v2.11,6207351,4371,840
OSWorld 2.1(离线子集)72.4%15.7%48.9%83.9%
Terminal-Bench 4.039.2%0.0%16.4%70.6%
FrontierCode 1.146.4%—42.4%52.1%
Humanity's Last Exam(无工具)45.9%10.2%—56.9%

代际提升本身就足够有意思——Haiku 4.5 在 Terminal-Bench 4.0 上是零分,新模型跨过了 39%。但那 39.2% 是最高 effort 档位下的成绩。在默认的中档 effort 下,按 Anthropic 自己的数字只有约 20%。标题上的智能体成绩,并不是大多数开发者实际会跑的配置。

表中缺席的是中国的几家实验室。The New Stack 指出,Z.ai 的 GLM-5.3-Flash 在 GDPval-AA v2.1 上得分 1,647,高于 Haiku 5.5 的 1,620;阿里巴巴通义千问的 Qwen3.7 Flash 每 token 更便宜。两者都没有出现在 Anthropic 的对比里。前沿实验室当然有权挑选自己的参照点,但一场以"最便宜、最强"为框架的小模型发布,对这两点的主张都不如那张表所暗示的那么稳固。

它实际用来做什么

Anthropic 并没有把 Haiku 5.5 包装成"大模型干活时它负责分类和路由"的角色,而是把它定位为与 Opus 5.5、Sonnet 5.5 并行运行的子智能体——上下文压缩、数据库查询、浏览器操作、实时客服。它是 Haiku 系列第一款带可调 effort 设置的模型,Python 与 TypeScript SDK 也新增了计算机操作与浏览器操作的 beta 支持。Box 报告称其得分比 Haiku 4.5 高出 11 分,延迟约为一半;HubSpot 报告其 CRM 评测三轮平均为 92.8%。

安全防护则朝着与价格相反的方向移动。网络安全方面的限制比 Haiku 4.5 更严,标准配置下渗透测试被阻断,更宽的权限需通过 Anthropic 的验证计划申请。对于一款明确瞄准高频自动化的模型,这是一个有意的取舍:产品线里最便宜的模型,同时也是在攻击性安全工作上余地最小的那一款。

怎么看

90% 的降价不是一场伪装成定价公告的能力公告。它就是定价公告。小模型如今是智能体生意胜负所系的那一层——在一项任务中被调用上千次的正是它们——而两家领先实验室各自独立地认定,这一层值每百万 token 0.10 美元。利润是被主动放弃的。Anthropic 想用它换来的,是每一处 Opus 与 Sonnet 部署内部的子智能体席位;而 10 万 token 那行小字,就是它希望把一部分收回来的地方。

Sources: Anthropic — Introducing Claude Haiku 5.5 · VentureBeat · The New Stack

继续阅读