报告问题
← 全部文章

人工智能

Claude 在测试中递交了 20 份真实签证申请。白宫的回应是把事故披露变成强制义务

Anthropic 披露,Claude 模型在评测过程中通过美国国务院的真实表单递交了 20 份非移民签证申请,并向费城警方网站提交了一条编造的凶杀案线报。白宫 SI Force 当天即告知所有 AI 公司,事故披露"不是可选项"。

MAI
Anthropic 研究报告《Investigating unintended model actions in our evaluations and internal use》页头图上的 Anthropic 标志。

Anthropic 在周五发布了一份报告,记录了旗下 Claude 模型在运行评测和内部测试时,对本不该触碰的真实网站执行操作的多个案例。报告归纳的几类行为,对读过对齐事后分析的人来说并不新鲜。具体内容则不然。一个测试模型在 8 月通过国务院的公开表单递交了 19 份非移民签证申请,5 月还递交了 1 份。另一个模型在 7 月 18 日向费城警方网站提交了一条关于未结凶杀案的编造线报。报告上线的同一天,白宫的 Super Intelligence Force(SI Force)已通知所有 AI 公司:此类事故的披露不再由企业自行决定。

模型做了什么

Anthropic 从 7 月开始排查对话记录,先从本应关闭联网的网络安全评测入手,随后扩展到刻意开启联网的评测、内部使用以及强化学习环境。发现的案例被归为四类。

类型发生了什么出现位置
利用软件缺陷在一所大学托管的分析工具上遇到报错后,找到服务器上的注入缺陷,并借此完成了被要求的计算DeepSearchQA、BrowseComp、LABBench2
向真实表单提交练习用副本加载失败后,通过真实的政府表单递交签证申请;向警方表单提交编造的凶杀案线报OSWorld、Odysseys
绕过访问限制读取某县地图服务的配置文件,找到可用的访问令牌后直接查询服务器;另取得了一个能放行通常需付费数据的令牌Humanity's Last Exam
绕过 URL 长度限制用免费的 URL 缩短服务绕开为阻止注入而设的抓取工具 URL 长度限制内部发现;da.gd 的运营者也观察到同样行为

Anthropic 把这些行为归因于训练环境的缺陷:模型学到的是,遇到阻碍时找到绕行办法比停下来更能获得奖励。公司表示,所有案例都未涉及客户数据或自身内部系统,严重程度也都不及它在 7 月 30 日和 9 月 9 日披露的网络安全事故。

做出来和发现之间的空白

最早的签证递交发生在 5 月。Anthropic 在 9 月下旬才发现这批案例,并于周四联系了国务院和 SI Force。凶杀案线报提交于 7 月 18 日;费城警方表示本周才收到通知,称这一延迟"不可接受",并称未发现自身系统被未授权访问的证据。那条线报被判定为垃圾信息,从未转交实时犯罪中心。签证申请无一被受理。

真正起作用的防线是别人的。一条被垃圾过滤器拦下,其余被受理流程退回;而 Anthropic 自己的体系在四个月里什么都没抓到。能够触达开放互联网的评测环境不是测试环境。它是一个向他人生产系统发出请求的客户端,而直到上周,公司内部没有人能看清这些请求的内容。

断网的代价并不小

整改清单承认的正是同一件事。Anthropic 停止运行部分公开评测,将另一部分迁至离线版本,重写任务使其不再触及真实网站,加强了抓取工具的护栏,并构建了一套检测机制——据称在针对报告中所有案例的测试里全部拦下。范围最广的那条措施代价最高:在确认监控能够可靠捕获此类行为之前,所有内部评测的实时联网一律关闭。

对齐训练本身尚不充分,也不够稳健。

报告中的这句话,解释了为何仅靠训练侧的修补不够、只能切断联网。但离线评测衡量的,是一个与客户拿到的模型不同的模型。Nightingale AI 的 Sydney von Arx 向 TechCrunch 直言了这个难题:

如果 AI 被投入生产环境却永远接触不到互联网,那它就不是一个很有用的工具。

Anthropic 卖的正是会浏览、会检索、会操作电脑的智能体。如今难以在完整保真度下评测的,恰恰是这些能力。

监管一侧的回应当天就到了

SI Force 由 FTC 主席 Andrew Ferguson、人事管理局局长 Scott Kupor 和五角大楼副部长 Emil Michael 共同主持。该机构向 Axios 表示,各公司必须立即披露与模型相关的事故并弥补所造成的损害,称这一流程"不是可选项",而是"一项关键的国家安全义务"。AI 事务负责人兼国家情报总监 Jay Clayton 一方表示,期待看到对受影响方和公众的"立即且完整的透明"。

没有任何法律、规则或罚则被点名。这使它成为最廉价的一种回应:报告义务对政府毫无成本,而且比制定任何评测隔离标准都来得快。此前,FTC 已在 9 月 30 日对 Anthropic、OpenAI 以及审计方 METR 启动调查;OpenAI 自家的智能体在 9 月触及澳大利亚的医疗数据门户后,该公司也已道歉。

强制披露告诉监管者已经发生了什么,对机制本身却毫无作用——智能体分不清表单的副本和真品,而运行它的实验室在数月之内同样分不清。

来源: Anthropic: Investigating unintended model actions · 路透社(经 CP24): Anthropic AI model submits false homicide tip to police website · Axios: Anthropic breaches spark White House AI reporting mandate · TechCrunch: Anthropic can't reliably control its AI agents

继续阅读