人工智能
Gemini 3 之后的第一个前沿模型,先给了网络防御方,再给客户。这个顺序就是这次发布的内容
Google 称 Gemini 4 Argon 在 18 项基准里有 13 项领先或并列第一。审核名单之外的人谁也验证不了:这个模型先去了网络防御方和美国政府的预发布审查流程,付 token 钱的人排在后面。
MAI
Google 在 9 月 30 日发布了 Gemini 4 Argon。这是去年 11 月 Gemini 3 之后的第一个旗舰模型,也是 Demis Hassabis 在 8 月退下后,由接手 Google DeepMind 的 Koray Kavukcuoglu 任内交付的第一个模型。Google 称,在它公开的 18 项基准中,Argon 有 13 项领先或并列第一。
几乎没有人处在能够验证这件事的位置上。Argon 并未普遍可用。它先通过 Google 的 Fairwind Program 交给经过审核的网络防御方,又进入了美国政府的自愿预发布访问流程。开发者、企业和普通用户要等到"尽快",而且先是付费 API 客户和 Google AI Ultra 订阅者。
这个顺序就是发布的内容。一家被人说了十个月已经失掉前沿的公司,终于拿到一个它自称重新夺回领先的模型,然后把这个模型先交给了做应急响应的人和一套政府审查流程,再交给付 token 钱的人。
Google 说它做出了什么
Argon 在真实世界的软件工程、法务与财务这类企业知识工作,以及网络安全防御的复杂工作流中,交付前沿级性能。
工程上最醒目的变化是输出上限:从 64,000 个 token 提到 100 万个。这是"起草一个文件的模型"和"能一次性吐出整套迁移的模型"之间的差别——Google 称自家团队用 Argon 做过大规模代码库迁移,包括把 C 和 C++ 迁到 Rust。
公开的对比数字,全部由 Google 自己测得:
| 基准 | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| Harvey Legal Agent | 19.6% | 5.4% | 3.8% |
| DeepSWE v1.1(软件工程) | 77.9% | 74.1% | 74.2% |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.6% |
| FrontierSWE v2 | 55.0% | 65.5% | — |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | — |
在漏洞修复基准 CWE-bench v1 上,Google 报告 68%,并列第一。在 Gray Swan 的间接提示注入测试上,它报告攻击成功率 0.7%——对一个注定要被指向不可信日志和工单的模型来说,这是最要紧的数字。
"防御方优先"正在变成这个行业的发布形态
这不是一次孤立的选择。9 月 2 日,美国三家前沿实验室就同一个主题发了文。Google 通过 Fairwind 推出 Gemini 3.8 Flash Cyber,提到 650 多家合作方,包括 CrowdStrike、Datadog、Menlo Security、Palo Alto Networks 和 Snowflake。OpenAI 表示其 Astra 已达到公司所说的"Critical 网络安全能力阈值"——意思是它能独立找到并利用此前未知的缺陷——并通过一个叫 Daybreak Blue 的计划分发访问权。Anthropic 则把 Mythos 5.1 留在面向网络安全和生命科学工作的受信访问计划内部。
9 月 30 日变的是范围。受限访问过去是一个窄用途安全模型的安排,现在是这家公司最好的通用模型的安排。Google 给出的支撑例子是防御性的:它称安全公司 Wiz 用 Argon 发现了一个重大漏洞,该漏洞会暴露全球医院所用医疗软件中的个人信息。这是让防御方先跑一步的一个站得住脚的理由。反过来读,它也正是这一步需要存在的原因。
Google 列出的四项防护——拒绝滥用、抗提示注入、用思维链监控偏离、沙箱化执行——被写成在广泛发布之前正在加强的东西,而不是已经完成的东西。Google 用它至今最直白的措辞说明:拖住普遍可用的不是服务容量,是安全工作。
一个买不到的模型的定价
| 每百万输入 | 每百万输出 | |
|---|---|---|
| introductory 价 | $2 | $10 |
| 标准价 | $4 | $20 |
| 缓存输入(introductory 价) | $0.10 | — |
VentureBeat 认为这个 introductory 价大约是 GPT-6 Astra 的五分之一。这很进攻性,同时它也是给一件有等候名单的产品定的价。在 API 打开之前,这个数字把 Google 绑住了,却没有经受过任何一个客户真实负载的检验。
该拿在手臂之外看的部分
上面每一个数字都是 Google 自己的,跑在 Google 挑选的基准上,出现在外界无人能复现的时刻。"18 项里 13 项领先或并列"是在一个被挑出来的集合里数的;Google 公开的两项 Astra 取胜的结果差距并不小,而一个在 FrontierSWE v2 和 Terminal-Bench Science 0.1 上落后十个点的模型,赢的是覆盖面,不是压倒。"尽快"不是一个日期。
值得追的不是下一张基准表,而是防御方版本和公开版本之间那段间隔的长度。如果几周内合上,分阶段放开只是一套上市流程。如果拖上几个月,Google 就确立了这样一种形态:一个前沿模型最先的使用者是守系统的人和审查他们的政府,市场上的其他人拿到的是通过了那场审查的版本。
Sources: Google: Gemini 4 Argon — our next era of frontier intelligence, VentureBeat: Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic — but in limited release, Unite.AI: Google Announces Gemini 4 Argon Frontier Model for Coding, Cyber Defense, The Hacker News: Google, Anthropic, and OpenAI Unveil Cyber AI Models, Safeguards, and Access Programs, Fortune: Demis Hassabis steps down from Google DeepMind CEO role amid a major AI leadership shake-up