← 全部文章

人工智能

Astra 干的活更少。这既是卖点,也正是抱怨

上线两周,OpenAI 的 Astra 在独立智能榜单上并列第一,而且只用了最接近的对手约三分之一的输出token。但让它把任务提前收尾的那个习惯,也正是用户抱怨的内容。

MAI
OpenAI 为其 2026 年前沿模型 Astra 发布的官方公告图片。

Astra 正式开放大约两周了——这段时间足够让上线时的benchmark和用户的抱怨在同一周内一起到齐。而两者指向的是同一个特征。

独立评测机构 Artificial Analysis 给出的 Intelligence Index,Astra 是 53 分,与 Claude Fable 5.1 并列第一,比 GPT‑5.6 Sol 高 6 分。不寻常的不是这个分数,而是 Astra 达到它所花的输出token大约只有 Fable 5.1 的三分之一:在最大努力档下,每个任务约 27,000 token 对 78,000 token。这道算术题就是这个产品的全部。

你买到的是什么

Astra(gpt-6-astra
正式开放2026年9月4日
输入上下文110万 token
最大输出128K token
知识截止2026年4月
输入每百万 token $10(缓存 $1)
输出每百万 token $50
模态输入支持文本与图像,输出为文本
首个token时延(p95)8.75 秒

标价是 GPT‑5.6 Sol 的 2.5 倍,大多数人首先反应的也是这个数字。但这是个不该拿来反应的数字。因为 Astra 用远少的token就把任务做完,Artificial Analysis 测得它在 Intelligence Index 上的每任务成本是 $3.26,而 Fable 5.1 是 $7.63——约四成;在 Coding Agent Index 上约为 Fable 的六成。按token算它贵。按做完一件活算,它目前是前沿里最便宜的。

领先是真实的地方

提升集中在智能体式的工作上:模型自己驱动终端、浏览器或工具链,长时间跑下去的那类任务。

BenchmarkAstra最强对手GPT‑5.6 Sol
Terminal-Bench v4.059%Claude Fable 5.1,52%40%
AutomationBench-AA69%Grok 4.6,67%60%
Coding Agent Index(Codex)62Claude Fable 5.1,62

在 Terminal-Bench 上比 Sol 高 19 个百分点,这不是一次小幅迭代的数字。在benchmark够不到的地方,一线使用者的反馈也指向同一方向:异常宽的网络调研——有开发者数出它收集的信息源是竞品的三到五倍——以及 3D 与空间推理上的明显跃升,好几个人专门点名了 Blender 和游戏引擎里的工作。

同一个习惯付出代价的地方

Artificial Analysis 同时发现,在 GDPval-AA v2 上 Astra 比 Sol 约 45 个 Elo 点,并把原因直接归到轮次上:Astra 每个任务用了 24 轮,竞品用 45 到 60 轮。在演示呈现质量上,Sol 依然领先。

这跟token效率是同一种行为,只是从另一面看。一个提前收尾的模型,在任务本来就做得完时是省钱,在做不完时就是敷衍。用户描述的形状正是这样——在不合直觉的时刻中途停住,需要人推一把才继续。一份针对游戏引擎工作的实测评测发现,全自动运行反复消耗计划重置,产出却并不比有人监督的运行更好,结论是人的引导仍然比原始能力更重要。

换之前还有几个坑值得知道。Astra 不支持原生视频输入,所以时序和渲染上的bug,没人盯着就会溜过去。在逆向工程和安全类工作上,测试者反馈专用的 GPT‑5.6 Cyber 依然更强。还有好几个人形容它过度谨慎,把请求读得像法律条文。

关于"变笨了"的投诉

上线大约一周后,开始有人报告 Astra 变差了:代码质量下降、回答更快但更单薄、更爱堆项目符号。两位研究者把相同的提示分别投给上线当天的版本和当前版本,报告说新的那版结果更差。

"我们拿到的不是 AGI,是一次回退。" —— Pranjal Paliwal,开发者

但这件事要谨慎对待。上线后"感觉变笨"是一个反复出现的体裁——7 月 GPT‑5.6 Sol 也吃过同样的抱怨——而要把"模型变了"、"期待变了"和"在不同服务配置之间路由"区分开来非常困难。截至发稿,OpenAI 尚未就此表态。真正该记在公司账上的是这份沉默,而指控本身还没有被坐实。

结论

要做智能体类的活,买。长时间自主编码、浏览器与终端自动化、看重信息源广度的深度调研。按完成一件任务的成本算,它目前是前沿最划算的选择,而 Terminal-Bench 上的差距大到足以在生产环境里产生实际影响。

但不要把它当成起草、排版,或任何"仔细跑一遍胜过快速跑一遍"的工作的无脑升级。演示呈现上 Sol 更好,单位token更便宜,也更不急着宣布活干完了。如果你的工作是安全专向的,专用模型仍然赢。

有一件事这篇评测刻意没有下结论:Astra 把一部分推理放在潜空间而不是可读文本里,而且它是 OpenAI 按自家框架把网络能力评为"关键级"的第一个模型。那场争论是另一篇文章,我们已经写过。

参考资料: Artificial Analysis — Benchmarking GPT-6 Astra · OpenAI — The path to Astra · OpenRouter — gpt-6-astra · LLM-Stats — GPT-6 Astra · Decrypt — Users say OpenAI's newest model got dumber · MindStudio — GPT-6 Astra hands-on · Hacker News — Initial thoughts on GPT-6 Astra · CNBC — OpenAI begins rolling out Astra

继续阅读