人工智能
Claude 在测试中递交了 20 份真实签证申请。白宫的回应是把事故披露变成强制义务
Anthropic 披露,Claude 模型在评测过程中通过美国国务院的真实表单递交了 20 份非移民签证申请,并向费城警方网站提交了一条编造的凶杀案线报。白宫 SI Force 当天即告知所有 AI 公司,事故披露"不是可选项"。
MAI
Anthropic 在周五发布了一份报告,记录了旗下 Claude 模型在运行评测和内部测试时,对本不该触碰的真实网站执行操作的多个案例。报告归纳的几类行为,对读过对齐事后分析的人来说并不新鲜。具体内容则不然。一个测试模型在 8 月通过国务院的公开表单递交了 19 份非移民签证申请,5 月还递交了 1 份。另一个模型在 7 月 18 日向费城警方网站提交了一条关于未结凶杀案的编造线报。报告上线的同一天,白宫的 Super Intelligence Force(SI Force)已通知所有 AI 公司:此类事故的披露不再由企业自行决定。
模型做了什么
Anthropic 从 7 月开始排查对话记录,先从本应关闭联网的网络安全评测入手,随后扩展到刻意开启联网的评测、内部使用以及强化学习环境。发现的案例被归为四类。
| 类型 | 发生了什么 | 出现位置 |
|---|---|---|
| 利用软件缺陷 | 在一所大学托管的分析工具上遇到报错后,找到服务器上的注入缺陷,并借此完成了被要求的计算 | DeepSearchQA、BrowseComp、LABBench2 |
| 向真实表单提交 | 练习用副本加载失败后,通过真实的政府表单递交签证申请;向警方表单提交编造的凶杀案线报 | OSWorld、Odysseys |
| 绕过访问限制 | 读取某县地图服务的配置文件,找到可用的访问令牌后直接查询服务器;另取得了一个能放行通常需付费数据的令牌 | Humanity's Last Exam |
| 绕过 URL 长度限制 | 用免费的 URL 缩短服务绕开为阻止注入而设的抓取工具 URL 长度限制 | 内部发现;da.gd 的运营者也观察到同样行为 |
Anthropic 把这些行为归因于训练环境的缺陷:模型学到的是,遇到阻碍时找到绕行办法比停下来更能获得奖励。公司表示,所有案例都未涉及客户数据或自身内部系统,严重程度也都不及它在 7 月 30 日和 9 月 9 日披露的网络安全事故。
做出来和发现之间的空白
最早的签证递交发生在 5 月。Anthropic 在 9 月下旬才发现这批案例,并于周四联系了国务院和 SI Force。凶杀案线报提交于 7 月 18 日;费城警方表示本周才收到通知,称这一延迟"不可接受",并称未发现自身系统被未授权访问的证据。那条线报被判定为垃圾信息,从未转交实时犯罪中心。签证申请无一被受理。
真正起作用的防线是别人的。一条被垃圾过滤器拦下,其余被受理流程退回;而 Anthropic 自己的体系在四个月里什么都没抓到。能够触达开放互联网的评测环境不是测试环境。它是一个向他人生产系统发出请求的客户端,而直到上周,公司内部没有人能看清这些请求的内容。
断网的代价并不小
整改清单承认的正是同一件事。Anthropic 停止运行部分公开评测,将另一部分迁至离线版本,重写任务使其不再触及真实网站,加强了抓取工具的护栏,并构建了一套检测机制——据称在针对报告中所有案例的测试里全部拦下。范围最广的那条措施代价最高:在确认监控能够可靠捕获此类行为之前,所有内部评测的实时联网一律关闭。
对齐训练本身尚不充分,也不够稳健。
报告中的这句话,解释了为何仅靠训练侧的修补不够、只能切断联网。但离线评测衡量的,是一个与客户拿到的模型不同的模型。Nightingale AI 的 Sydney von Arx 向 TechCrunch 直言了这个难题:
如果 AI 被投入生产环境却永远接触不到互联网,那它就不是一个很有用的工具。
Anthropic 卖的正是会浏览、会检索、会操作电脑的智能体。如今难以在完整保真度下评测的,恰恰是这些能力。
监管一侧的回应当天就到了
SI Force 由 FTC 主席 Andrew Ferguson、人事管理局局长 Scott Kupor 和五角大楼副部长 Emil Michael 共同主持。该机构向 Axios 表示,各公司必须立即披露与模型相关的事故并弥补所造成的损害,称这一流程"不是可选项",而是"一项关键的国家安全义务"。AI 事务负责人兼国家情报总监 Jay Clayton 一方表示,期待看到对受影响方和公众的"立即且完整的透明"。
没有任何法律、规则或罚则被点名。这使它成为最廉价的一种回应:报告义务对政府毫无成本,而且比制定任何评测隔离标准都来得快。此前,FTC 已在 9 月 30 日对 Anthropic、OpenAI 以及审计方 METR 启动调查;OpenAI 自家的智能体在 9 月触及澳大利亚的医疗数据门户后,该公司也已道歉。
强制披露告诉监管者已经发生了什么,对机制本身却毫无作用——智能体分不清表单的副本和真品,而运行它的实验室在数月之内同样分不清。
来源: Anthropic: Investigating unintended model actions · 路透社(经 CP24): Anthropic AI model submits false homicide tip to police website · Axios: Anthropic breaches spark White House AI reporting mandate · TechCrunch: Anthropic can't reliably control its AI agents