← 全部文章

人工智能

OpenAI 说,藏起来的推理是被人请模型"照抄一遍"拿走的。加密没被破,是模型自己开了口

OpenAI 9 月 30 日的报告把一场有组织的推理抽取行动的核心,归到与月之暗面有关联的个人身上。数字比 Anthropic 九月的指控小得多,手法却不然——操作者把加密的推理搬到另一个会话,再请模型把它照抄出来。这正是换一套更强的密码也修不好的那种失败。

MAI
OpenAI 随其"瓦解一场有组织的模型蒸馏行动"报告一同发布的配图。

9 月 30 日,OpenAI 发布报告,描述了一场有组织地抽取其模型隐藏推理的行动,并把行动的核心归到与月之暗面(Moonshot AI,Kimi 的开发者,总部在北京)有关联的个人身上。数字比 Anthropic 九月的指控要克制。手法不然,而值得读两遍的正是手法。

最早观测到的活动2026 年 7 月 1 日,量很小
高峰时段2026 年 7 月 24–25 日
该时段的请求数约 16,000 次,来自 4,000 多名用户
相关提示词模式的活动15,000 名以上用户
行动被瓦解2026 年 7 月 28 日
公开披露2026 年 9 月 30 日

在"是谁干的"这件事上,OpenAI 的措辞很谨慎:

我们无法确定在相关时间段内观测到的所有操作者是否都来自同一个主体。但我们将其中的核心集群归因于与月之暗面——Kimi 的开发者——有关联的个人。

入口就是模型本身

OpenAI 不向用户展示其推理模型的完整内部推理。那段文本被扣下,在产品里只以摘要的形式抵达用户。按 OpenAI 的说法,操作者并没有破开这一层。他们没有破解加密,没有碰到数据库,也没有触及存储的会话。他们把受保护的推理按其被下发的形态——加密状态——从一个会话里复制出来,然后另开一个会话,请模型把它解密并照抄出来。

这和大规模抓取输出是两类问题。那层保护从来不是给文件上的锁,而是关于"产品显示什么"的一条方针,而执行这条方针的,正是手里握着明文的同一套系统。一个能被请求引导着把自己扣下的内容渲染出来的模型,不是钥匙偏弱的保险柜;它是一个只要按正确顺序开口相求,就会把柜里的东西念出来的保险柜。

这恰恰是业界刚刚集体采用的防御

过去一年,业界对蒸馏的回应就是不再把原始推理交出去。Anthropic 九月的威胁报告写的正是这条路径:返回摘要而非逐字的推理,并以密码学方式绑定会话上下文,使痕迹无法从一个会话搬到另一个会话。OpenAI 扣下自己的推理,逻辑也是同一条。

OpenAI 描述的这场行动,打的是这一切底下的那个假设:把推理痕迹用密码学手段限定在某个会话内,它就碰不到了,因为手里只有密文的攻击者读不懂它。他们不需要读懂。他们需要的是一个读得懂、而且愿意念出来的系统。

这能证明什么、不能证明什么,值得说准。一家实验室关于自己两个月前关停的一场行动的遥测数据,不是关于所有隐藏推理方案的普遍结论。但它是防御被绕过而非被攻破的首个公开案例,而换一套更强的密码修不好的,恰恰是后面这种形态的问题。

两个月的沉默,然后是一个具体日期

时间点本身也是一项事实。OpenAI 说它在 7 月 28 日完成瓦解,9 月 30 日对外披露——距 Anthropic 在威胁报告中点名月之暗面、深度求索、阿里巴巴等七家中国实验室过了三周,也在白宫 7 月就 Kimi K3 指责月之暗面之后。一份落在争论正中央的披露,并不因此就是错的;但它也不是落进真空里的,而第二位指控者的报告,总会被放在第一位的光线下读。

在"到底在主张什么"这一点上,OpenAI 比 Anthropic 窄。该公司战略国家安全政策负责人 Caroline Zier 对 The Next Web 表示:

我们关心的是违反我们的服务条款,而不是开放模型或正当的蒸馏。

这是一项刻意放小的主张。它不需要任何人先把"用竞争对手的输出做训练是否违法"定下来——而美国的实验室在这个问题上立场尴尬,毕竟他们多年来一直主张,从别人的受版权保护作品中学习是完全正当的使用。违反服务条款不需要新的法律;它同时也不带来任何人能对一家北京公司执行的救济。报告以封禁账户、收紧管控收尾,而不是以一纸诉状收尾,大概就是这个原因。

该保持谨慎的地方

这里的每一个数字都来自一家公司的内部遥测,没有经过外部审计,描述的是它自己检测、自己分类、自己归因的行为。归因明确是局部的——一个"核心集群",其余未有定论。月之暗面没有回应这次的指控,正如它没有回应 Anthropic 的;该公司此前否认过为打造 Kimi K3 而蒸馏另一家实验室的模型。而提出指控的一方,与被指控的一方直接竞争。

从外部真正可查的东西,比归因更窄,也更有用:一个手里握着受保护形态推理痕迹的用户,能不能把内容从一个前沿模型里引出来。这是研究者可以向每一家实验室提出的问题——包括这一次的当事方。

参考资料: OpenAI — Disrupting a coordinated model-distillation campaign · The Next Web — OpenAI says Moonshot-linked users tried to extract its AI reasoning · Quartz — OpenAI disrupted a campaign to extract hidden model reasoning linked to Moonshot AI · SC Media — OpenAI disrupts AI model distillation attack linked to China's Moonshot AI · The Hacker News — OpenAI disrupts reasoning extraction campaign linked to Moonshot AI associates · CNBC — AI race heats up as OpenAI flags alleged model-copying campaign · Anthropic — Detecting and countering misuse of AI: September 2026

继续阅读