人工智能
谷歌在语音榜单上赢了1.1分。在价格上砍到了七分之一
Gemini 3.8 Live Extended Thinking 以 1.1 分之差压过 OpenAI 的 GPT-Live-1 Astra,登上 Artificial Analysis 语音质量榜首。但真正值得看的数字是价格——大约只有它所击败的那个模型每小时成本的七分之一。
MAI
谷歌在 9 月 15 日发布了两款对话模型:Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。它主打的说法是拿下 Artificial Analysis 的 Speech to Speech Quality Index 第一,Extended Thinking 得分 82.6。
更有意思的是紧挨在下面的那几个数字。被它挤下来的 OpenAI GPT-Live-1 Astra 是 81.5,Grok Voice Think Fast 2.0 是 81.3。在这个本该把它们区分开的指标上,三家实验室挤在 1.3 分的范围里。在离散度这么小的benchmark上拿第一,那是新闻稿,不是护城河。
真正的差距在哪
拉开的是价格,而且拉得不小。
| 模型 | Speech to Speech Quality Index | τ-Voice | τ-Voice-banking | 报道的每小时成本 |
|---|---|---|---|---|
| Gemini 3.8 Live Extended Thinking | 82.6 | 68.6% | 35.1% | $3.50 |
| Gemini 3.8 Live | —(Speech Agent Arena 第二) | — | — | $0.84 |
| GPT-Live-1 Astra(Medium) | 81.5 | 67.9% | 32.0% | $5.83 |
| Grok Voice Think Fast 2.0(High) | 81.3 | 56.5% | 16.5%* | $4.80 |
\银行类benchmark对应的是 xAI-Realtime。每小时金额为第三方依据公开费率折算,并非谷歌自己给出的比较。*
谷歌的开发者博文给出的 Live API 价格是:输入每百万 token $3,输出每百万 token $12;按音频计则是输入每分钟 $0.005、输出每分钟 $0.018。折算到一小时计费的对话,便宜的那款大约只有 OpenAI 为一个比它高 1.1 分的模型所收费用的七分之一。
这才是谷歌真正在讲的论点,而且它瞄准的不是榜单,是那些正在搭建呼叫中心、免下车点餐窗口和客服线路的人。一个每月跑一万小时的联络中心,不会在意质量指数小数点后第一位。它在意的是同样的工作量花 $8,400 而不是 $58,300。
benchmark本身是第三方的——质量指数来自 Artificial Analysis,智能体得分来自 Sierra 的 τ³-Banking 榜单——这一点比厂商内部评测更有分量。但挑哪几个放进 PPT,仍然是谷歌自己决定的。
一边说一边想
Extended Thinking 背后的技术主张是:推理和说话同时进行。谷歌描述这个模型会使用"自然地回应提示的早期语音信号",并提供"带着用户走完多步后台任务的实时进度旁白"。
这是对语音智能体自可用以来一直存在的那个取舍的正面回答。先想后说的模型准确,但听起来像坏了;张口就说的模型流利,但内容浅。到目前为止,所有部署都用填充音频糊住了这个缝隙——就是慢模型在后台跑的时候放出来的那句合成语音"我帮您查一下"。谷歌的说法是,这段旁白不再是填充,因为推理确实正与语音生成并行运行。
这和 OpenAI 的 Astra 展现出的是同一种直觉。我们昨天写过,Astra 只用最接近的对手约三分之一的输出token就登上智能榜首。两家实验室都得出了同一个结论:对话上的前沿已经不是原始能力,而是在用户听到任何声音之前,你能省掉多少活。
谷歌没有主打的那个数字
Extended Thinking 在 Sierra 的 τ-Voice-banking benchmark上完成了 35.1% 的任务。这是目前谁都没达到过的最高分。同时,这也意味着这个模型在真实的银行业务请求里大约每三件失败两件。
τ-Voice-banking 是被刻意做难的——带工具调用、带政策约束、面对一个不照着剧本说话的来电者的多轮客服。通用的 τ-Voice 分数是 68.6%,几乎高出一倍,这说明难度的大部分来自受监管、依赖工具的那一段,而不是来自"说话"本身。
对这次发布的诚实读法是:对话质量已接近解决,作为智能体的语音还没有。现在你可以用不到一美元一小时买到一个听起来像人的模型。你还买不到一个可以单独交给它去处理客户账户的模型。
在哪里可以用
两款模型今天起可通过 Gemini API 和 Google AI Studio 使用,并提供 Pipecat、LiveKit、LangChain、Agora、Fishjam、Vercel 和 Vision Agents 的集成。Gemini 3.8 Live 面向所有人进入 Search Live;Extended Thinking 进入面向 Pro 和 Ultra 订阅者的 Gemini Live,并出现在 Gmail 和 Keep 中。企业版是私有预览。Live 系列模型支持 97 种以上语言。
谷歌同时还发布了 Gemini 3.5 Transcribe:支持 85 种以上语言,词错误率流式 4.0%、非流式 2.6%。它没拿到头条,这大体是对的,而它多半也是现有生产系统最先会换上去的那块零件。
参考资料: Google: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking · Google: Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe · Unite.ai: Google Launches Gemini 3.8 Live and Extended Thinking Voice Models · OfficeChai: Google Releases Gemini 3.8 Live-Extended Conversational Model · Thurrott: Google Announces Gemini 3.8 Live and 3.8 Live Extended Thinking