← 全部文章

人工智能

Anthropic 降价九十分钟后,OpenAI 把 token 单价砍了一半。它那张基准表讲的是成本,不是能力

OpenAI 周二推出 GPT-6 Sol 与 Luna,API 价格只有被替代机型的一半,距离 Anthropic 把 Opus 价格下调 20% 大约九十分钟。而在 OpenAI 自己的对比表里,Sol 在三项主要基准中有两项输给 Claude——这次发布真正要讲的,是每项任务的成本。

MAI
OpenAI 官方发布页上 GPT-6 Sol 与 Luna 的公告主图。

OpenAI 周二发布了 GPT-6 Sol 和 GPT-6 Luna,并把两者的 API 价格砍掉一半。按 TechCrunch 的计时,这份公告落地时,距离 Anthropic 带着自家 20% 降价推出 Claude Opus 5.5 大约过去九十分钟。两家前沿实验室在同一个下午双双下调价格,不是排期上的巧合;比起这两个模型本身,这才是这一天更值得注意的事实。模型是能打的。但公告的内容在价格上。

两个模型,一半的价

Sol 面向编码和代理任务这一档。Luna 是大批量的那一档,瞄准摘要、抽取,以及那些靠规模跑起来的文书活。两者都把 OpenAI 旗舰 GPT-6 Astra 背后的训练方法,用 Astra 一小部分的成本落了下来——用该公司自己的话说,是「在成本效率上推进前沿」。

每百万 tokenGPT-6 SolGPT-6 Luna
输入$2$0.10
输出$10$0.50
缓存输入读取90% 折扣90% 折扣

OpenAI 称两者都比它们所取代的 GPT-5.6 系列便宜 50%;The New Stack 给出的前代价格是 $4/$20 和 $0.20/$1.20。公司把降价归因于基础设施而非让利:「缓存与推理上的改进,让我们能以更低的成本提供这些模型。」缓存读取 90% 的折扣,是对检索密集型代理最要紧的一行——同一段上下文在每一步都要重新付费。

还有第二重、更安静的成本效应。OpenAI 说新模型走到答案所花的 token 更少,回答更短、术语更少。同一天上午,Anthropic 对 Opus 5.5 讲的是同一套说法。当两家厂商都开始主张「因为我们的模型更简洁,所以真实降幅比公布的更大」时,价目表就不再是那个决定任何事情的数字了。这两种说法,目前都还没有第三方做过正面对比。

这张基准表讲的是成本,不是能力

OpenAI 自己公布的对比值得细读,因为它承认了什么。

基准GPT-6 SolAnthropic 对比对象OpenAI 的成本主张
Agents' Last Exam V1 (max)56.4%Claude Opus 5: 60%成本低 60%
DeepSWE v1.1 (max)68.8%Claude Fable 5: 69.9%成本约低 80%
OSWorld 2.0 offline (xhigh)60.5%Claude Opus 5: 60.3%成本低 80%
FrontierCode 1.1与 Fable 5.1 xhigh 持平Claude Fable 5.1成本更低
AutomationBench 1.0.6 (xhigh)33.2%每任务 $0.27

顺着对比那一列往下读。Sol 在 Agents' Last Exam 上输给 Claude Opus 5,在 DeepSWE 上输给 Fable 5,在 OSWorld 上打平。OpenAI 并没有宣称自己在这些任务上拥有最好的模型。它宣称的是:一个离最好足够近的模型,价格只要五分之一。而它选择把每一行都按每项任务的成本、而不是按分数来归一化呈现。

这是前沿实验室论证方式上的一次真实转变。成本那一列过去是能力那一列的脚注,在这里它就是主列。Luna 把这一点讲得更直白:DeepSWE 上 66.6%,OpenAI 说它的价格比 Opus 5 低 93%。只要二十分之一花费的能力差距,和同等价位上的同样差距,是完全不同的产品判断。

这次发布里有一个数字值得单独一提。OpenAI 报告称,Sol 对自己所写代码作出误导性陈述的比例,从上一代的 10.4% 降到了 1.3%。这是一项关于「代理汇报了它并未完成的成功」的对齐结果,而正是这种失败方式,让长时间自主运行变得难以信任、代价高昂。公司同时注明,这些评测是刻意设计得严苛的,并不代表通常的使用情况。

「为前沿把控节奏」大约撑了一周

把竞争的背景放进来,这个时间点就很难往善意里读了。Anthropic 的 Dario Amodei 在九月中旬呼吁各实验室为前沿把控节奏、而不是一路冲刺,Sam Altman 公开表示支持。Opus 5.5 是那次呼吁之后 Anthropic 的第一次发布。OpenAI 的回应在同一个下午到达,价格压在它下面。

无论「为前沿把控节奏」在实践中究竟意味着什么,它显然不包括「在竞争对手的发布日克制降价」。另一个值得注意的地方是,中档的 GPT-6 Terra 缺席了这次推送;9to5Mac 把它读作 OpenAI 正从四档收拢为三档——这种简化,也让与 Anthropic 的逐档价格对比变得更清爽。

这场价格战由谁买单

Ramp 的经济学家 Ara Kharazian 对 Fortune 把这套动力学讲得很直白:

OpenAI 和 Anthropic 正在打一场价格战,而这场价格战正在把 AI 的价格压下去。

附在这句话后面的警告更值得坐下来想一想。对这两家公司的看多逻辑,假设模型越强就越贵。科技市场很少这样运作。而在能力彼此收敛到几个百分点之内的同时,两家厂商在同一个下午降价,正是一个产品正在变成大宗投入品的市场该有的形状。

对买方来说这直截了当是好事,这也正是那张按成本归一化的基准表是读懂这次发布的正确方式的原因。对卖方而言,差异化因素已经不再是谁的模型最好,而是完成一项任务要花多少钱——而这上面的利润,只在朝一个方向走。

Sources: Introducing GPT-6 Sol and Luna (OpenAI) · OpenAI launches GPT-6 Sol and Luna, boasting lower cost and fewer mistakes (TechCrunch) · OpenAI releases GPT-6 Sol and Luna — and cuts token prices in half (The New Stack) · Anthropic releases Claude Opus 5.5 and OpenAI counters with two cheaper GPT-6 models (SiliconANGLE) · What slowdown? OpenAI, Anthropic release dueling models as AI price wars heat up (Fortune) · OpenAI upgrading ChatGPT and Codex with two more GPT-6 models (9to5Mac)

继续阅读