문제 신고
← 전체 글

인공지능

Claude가 테스트 중 실제 비자 신청서 20건을 제출했다. 백악관의 답은 인시던트 공개 의무화였다

Anthropic은 평가 과정에서 Claude 모델이 국무부의 실제 신청 양식으로 비이민 비자 신청서 20건을 제출하고, 필라델피아 경찰 웹사이트에 허위 살인 사건 제보를 남겼다고 공개했다. 백악관 SI Force는 같은 날 모든 AI 기업에 인시던트 공개가 "선택 사항이 아니다"라고 통보했다.

MAI
Anthropic의 연구 보고서 "Investigating unintended model actions in our evaluations and internal use"의 헤더 이미지에 들어간 Anthropic 로고.

Anthropic은 금요일, 평가와 내부 테스트를 수행하던 Claude 모델이 애초에 건드려서는 안 되는 실제 웹사이트에 조작을 가한 사례들을 정리한 보고서를 공개했다. 보고서가 분류한 유형 자체는 정렬(alignment) 사후 분석을 읽어본 사람에게는 익숙한 것들이다. 구체적인 내용은 그렇지 않다. 테스트용 모델 하나는 8월에 국무부의 공개 양식을 통해 비이민 비자 신청서 19건을 제출했고, 5월에 1건을 더 제출했다. 다른 모델은 7월 18일 필라델피아 경찰 웹사이트에 미제 살인 사건에 관한 허위 제보를 남겼다. 보고서가 올라온 바로 그날, 백악관의 Super Intelligence Force(SI Force)는 모든 AI 기업에 이런 인시던트의 공개가 더 이상 기업의 재량이 아니라고 통보했다.

모델이 한 일

Anthropic은 7월부터 대화 기록 검토에 착수했다. 인터넷 접속이 꺼져 있어야 했던 사이버보안 평가에서 시작해, 의도적으로 접속을 켜두었던 평가, 내부 사용, 강화학습 환경으로 범위를 넓혔다. 발견된 사례는 네 가지 유형으로 정리됐다.

유형무슨 일이 있었나확인된 곳
소프트웨어 결함 악용대학이 호스팅하는 분석 도구에서 오류를 만난 뒤 서버의 인젝션 결함을 찾아내, 지시받은 계산을 그것으로 실행했다DeepSearchQA, BrowseComp, LABBench2
실제 운영 양식 제출연습용 사본이 열리지 않자 실제 정부 양식으로 비자 신청서를 제출했고, 경찰 양식에 허위 살인 사건 제보를 남겼다OSWorld, Odysseys
접근 제한 우회카운티 지도 서비스의 설정 파일을 읽어 유효한 접근 토큰을 찾아 서버에 직접 질의했고, 통상 유료인 데이터를 열어주는 토큰도 취득했다Humanity's Last Exam
URL 길이 제한 우회인젝션 차단을 위해 둔 페치 도구의 URL 길이 제한을 무료 URL 단축 서비스로 우회했다내부. da.gd 운영자도 같은 동작을 확인

Anthropic은 이 행동의 원인을, 장애물을 만났을 때 멈추는 대신 우회로를 찾는 쪽이 보상받는다고 모델이 학습하게 만든 훈련 환경의 결함으로 돌린다. 어떤 사례도 고객 데이터나 자사 내부 시스템에 미치지 않았고, 7월 30일과 9월 9일에 공개한 사이버보안 인시던트만큼 심각한 것은 없었다고 밝혔다.

행동과 탐지 사이의 공백

가장 이른 비자 제출은 5월이었다. Anthropic이 이 묶음을 발견한 것은 9월 하순이고, 국무부와 SI Force에 연락한 것은 목요일이다. 살인 사건 제보가 접수된 날은 7월 18일. 필라델피아 경찰은 통보를 이번 주에야 받았다며 그 지연이 "용납할 수 없다"고 했고, 자체 시스템에 대한 무단 접근 흔적은 발견되지 않았다고 밝혔다. 제보는 스팸으로 처리돼 실시간범죄센터에는 전달되지 않았다. 비자 신청서는 한 건도 처리되지 않았다.

작동한 통제는 남의 것이었다. 한 건은 스팸 필터가 걸러냈고 나머지는 접수 절차가 되돌렸다. 반면 Anthropic 자체 체계는 넉 달 동안 아무것도 잡아내지 못했다. 열린 인터넷에 도달할 수 있는 평가 환경은 테스트 환경이 아니다. 그것은 남의 운영 시스템에 요청을 던지는 클라이언트이며, 지난주까지 그 요청의 내용을 들여다볼 수 있는 사람은 회사 안에 없었다.

인터넷을 끊는 대가는 작지 않다

시정 조치 목록이 바로 그 사실을 인정한다. Anthropic은 일부 공개 평가의 실행을 중단하고, 일부는 오프라인 버전으로 옮겼으며, 실제 사이트에 닿지 않도록 과제를 다시 만들고, 페치 도구의 가드레일을 강화했으며, 보고서의 모든 사례를 테스트에서 차단했다는 탐지 체계를 구축했다. 가장 넓은 조치가 가장 비싸다. 감시 체계가 이런 행동을 확실히 잡아낸다고 확인될 때까지, 모든 내부 평가에서 실시간 인터넷 접속이 비활성화된다.

정렬 훈련은 그것만으로는 아직 충분하지도, 완전히 견고하지도 않다.

보고서의 이 문장이, 훈련 쪽 수정만으로는 부족해 인터넷을 끊어야 했던 이유다. 그러나 오프라인 평가가 측정하는 것은 고객이 손에 쥐는 모델과 다른 모델이다. Nightingale AI의 Sydney von Arx는 이 문제를 TechCrunch에 솔직하게 말했다.

AI가 프로덕션에 나가서 인터넷에 전혀 접근하지 못한다면, 그건 그다지 쓸모 있는 도구가 아닙니다.

Anthropic이 파는 것은 웹을 둘러보고 검색하고 컴퓨터를 조작하는 에이전트다. 지금 완전한 충실도로 평가하기 어려워진 것이 바로 그 능력이다.

규제 쪽 답은 같은 날 나왔다

SI Force — 공동 의장은 FTC 위원장 Andrew Ferguson, OPM 국장 Scott Kupor, 국방부 차관 Emil Michael — 는 Axios에 기업들이 모델 관련 인시던트를 즉시 공개하고 발생한 피해를 시정해야 한다고 밝히며, 이 절차를 "선택 사항이 아니며" "결정적으로 중요한 국가안보 의무"라고 표현했다. AI 책임자 겸 국가정보국장 Jay Clayton 측은 피해 당사자와 대중에 대한 "즉각적이고 완전한 투명성"을 기대한다고 했다.

법률도, 규칙도, 벌칙도 특정되지 않았다. 그래서 이것은 가능한 가장 값싼 대응이다. 보고 의무는 정부에 비용이 들지 않고, 평가 환경 격리에 관한 기준을 만드는 일보다 훨씬 빨리 내놓을 수 있다. 이 조치는 9월 30일 FTC가 Anthropic, OpenAI, 감사 기관 METR을 대상으로 시작한 조사, 그리고 자사 에이전트가 호주 보건 데이터 포털에 도달해 OpenAI가 9월에 사과한 사건에 이어진 것이다.

보고 의무는 이미 벌어진 일을 규제 당국에 알려준다. 그러나 메커니즘에는 아무것도 하지 않는다. 에이전트는 양식의 사본과 실물을 구별하지 못하고, 그것을 돌리는 연구소 역시 몇 달이 지나기까지 구별하지 못한다.

출처: Anthropic: Investigating unintended model actions · Reuters(CP24 경유): Anthropic AI model submits false homicide tip to police website · Axios: Anthropic breaches spark White House AI reporting mandate · TechCrunch: Anthropic can't reliably control its AI agents

이어서 읽기