← 全部文章

人工智能

阿里全模态模型输入价格只有 Gemini 的五分之一。它同时没有放出权重

阿里巴巴周五发布 Qwen3.8-Omni-Flash,输入每百万 token 0.15 美元,为 Gemini 3.8 Flash 现行价格的五分之一。权重没有随之开放,而按阿里自己的评测,这个模型在音频上领先,在智能体化的视频任务上落后。

MAI
通义千问官方的 Qwen3-Omni 介绍图,展示单一模型接收文本、图像、音频和视频输入并返回文本与语音。

阿里巴巴通义千问团队在北京时间周五上午发布了 Qwen3.8-Omni-Flash,一个原生全模态模型:输入可以是文本、图像、音频和视频,输出为文本或语音。上下文约一百万 token,支持 113 种语言和方言,同时还有面向实时流式交互的第二个版本 Qwen3.8-Omni-Flash-Realtime。该模型已在阿里云的北京、新加坡、香港、东京、法兰克福和弗吉尼亚区域上线。

值得看的不是规格。值得看的是两个数字:价格,以及没有权重下载这件事。

价格就是产品

Qwen3.8-Omni-Flash 的定价是输入每百万 token 0.15 美元,命中缓存的输入每百万 token 0.016 美元,输出每百万 token 0.47 美元——无论输入是文本、图像、音频片段还是视频,都是同一个价格。阿里选为对标对象的 Gemini 3.8 Flash,谷歌公布的 standard 档价格是输入每百万 token 0.75 美元、输出 3.75 美元;谷歌自己的价格页写明这是截至 2026 年 12 月 31 日的促销价,2027 年 1 月 1 日将翻倍至 1.50 美元和 7.50 美元。

每百万 tokenQwen3.8-Omni-FlashGemini 3.8 Flash(standard)
输入(所有模态)$0.15$0.75 → 2027 年 1 月 1 日起 $1.50
缓存命中输入$0.016
输出$0.47$3.75 → 2027 年 1 月 1 日起 $7.50

按当前价格,输入便宜五倍,输出便宜八倍;等谷歌的促销窗口关闭,就是十倍和十六倍。但阿里自己并不是这样讲的:它把这次降价对标的是自家上一代模型,称音频输入成本相比 Qwen3.5-Omni-Plus 下降超过 98%,音频加视频的混合输入下降超过 93%。

这个叙述方向本身有意义。阿里主张的与其说是"比谷歌更便宜的模型",不如说是"更便宜地把模型跑起来的办法"。多模态推理真正烧钱的地方就是音频和视频——一分钟语音消耗的 token 远多于一段文字——所以音频输入降价 98% 是关于服务栈、tokenizer 和编码器的论断,而不是关于模型质量的论断。这也是阿里以外的人无从审计的一类论断。

评测描述的是一个音频模型

阿里公布了与 Gemini 3.8 Flash 的对比。别只看标题,要看完整张表——表说的事情和发布稿说的不一样。

评测Qwen3.8-Omni-FlashGemini 3.8 Flash
SpotSoundBench67.239.7
WildClawBench-MM71.058.9
MMAU81.876.9
DailyOmni85.184.0
OmniGAIA74.078.6
AgenticVBench36.845.0

这些数字全部出自阿里之手、由阿里自己跑出,截至本文发布尚无独立复现。若按其字面理解:在本质上属于"听"的任务上——声音识别、音频理解——它明显领先;在音视频混合理解上大致持平;而在两个要求模型针对视频进行多步操作的评测上落后。阿里自己的总结也承认音视频性能"接近"Gemini,只有纯音频超过它。这张表支持的是更收敛的读法:这是一个也能看的音频模型,不是一个已经超过谷歌的通用全模态模型。

其中有一个数字格外值得怀疑。阿里报告 AliMeeting 上的说话人日志错误率在两代之间从 88.11% 降到 3.35%。88% 的错误率意味着上一代模型基本无法把语音归到说话人身上。这一"提升"的大部分是修复,不是进步——而且 AliMeeting 是阿里自己的数据集。

权重留在了家里

通义千问的声望是靠开放权重建立的。上一代 Qwen3-Omni 以可下载模型的形式发布在 GitHub 和 Hugging Face 上,架构公开。Qwen3.8-Omni-Flash 没有。阿里放出了围绕它的多模态插件和开发工具,但模型本体只通过 API 提供,而 Hugging Face 上已有两周以上没有通义千问的新上传。

这不矛盾,反而前后一致。如果卖的是服务效率,权重证明不了它——98% 的成本下降没法靠下载一个 checkpoint 来验证,只能靠付账单来验证。而效率优势的价值,恰好等于你有多少云可以拿它来计费。开放权重让竞争者可以在别人的硬件上跑通义千问,API 不会。阿里在这个模型上线的那几个区域里,正有一份云业务要守。

那套让通义千问成为中国 AI 默认参照点的开放权重策略,从来不是目的。它是阿里在还提不出前沿主张时用来积累开发者的手段。现在它有一个价格可以提了。

Sources: Qwen3.8-Omni-Flash announcement (Qwen) · 阿里发布 Qwen3.8-Omni-Flash 全模态模型 (IT之家) · Qwen3.8-Omni-Flash benchmark and pricing detail (AIbase) · Gemini Developer API pricing (Google) · Alibaba's Qwen3.8-Omni-Flash undercuts Gemini on audio (Neowin) · Qwen3-Omni (GitHub) · Qwen3-Omni-Flash model documentation (Alibaba Cloud Model Studio)

继续阅读