인공지능
OpenAI는 숨겨둔 추론이 "그대로 옮겨 적어 달라"는 요청만으로 빠져나갔다고 말한다. 암호는 버텼고, 모델이 버티지 못했다
OpenAI의 9월 30일 보고서는 조직적인 추론 추출 캠페인의 핵심을 Moonshot AI와 연관된 개인들에게 귀속시켰다. 숫자는 Anthropic의 9월 혐의에 비하면 작다. 수법은 그렇지 않다 — 운영자들은 암호화된 추론을 다른 대화로 옮겨와 모델에게 그것을 옮겨 적게 했다. 더 강한 암호로는 고쳐지지 않는 종류의 실패다.
MAI
OpenAI는 9월 30일, 자사 모델의 숨겨진 추론을 빼내려 한 조직적 캠페인에 관한 보고서를 공개하고, 그 핵심을 Kimi를 만든 베이징 기업 Moonshot AI와 연관된 개인들에게 귀속시켰다. 숫자는 Anthropic의 9월 혐의에 비하면 소박하다. 수법은 그렇지 않고, 두 번 읽을 가치가 있는 쪽은 그 부분이다.
| 최초 관측된 활동 | 2026년 7월 1일, 소량 |
| 대량 급증 구간 | 2026년 7월 24~25일 |
| 그 구간의 요청 수 | 약 16,000건, 4,000명 이상의 사용자로부터 |
| 관련 프롬프트 패턴 활동 | 15,000명 이상의 사용자 |
| 캠페인 차단 | 2026년 7월 28일 |
| 공개 | 2026년 9월 30일 |
누가 했는지에 대한 OpenAI의 표현은 조심스럽다.
해당 기간에 우리가 관측한 모든 운영자가 하나의 행위자에서 비롯했는지는 분명하지 않다. 다만 우리는 활동의 핵심 클러스터를 Kimi의 개발사인 Moonshot AI와 연관된 개인들에게 귀속시킨다.
들어온 길은 모델 자신이었다
OpenAI는 추론 모델의 내부 추론 전문을 사용자에게 보여주지 않는다. 그 텍스트는 가려져 있고, 제품에서는 요약의 형태로만 사용자에게 전달된다. OpenAI의 설명에 따르면 운영자들은 그것을 깬 것이 아니다. 암호를 해독하지도, 데이터베이스에 접근하지도, 저장된 대화에 손대지도 않았다. 그들은 보호된 추론을 전달되는 형태 그대로 — 암호화된 상태로 — 한 대화에서 복사해 낸 뒤, 별도의 대화를 열어 모델에게 그것을 복호화하고 그대로 옮겨 적어 달라고 요청했다.
이것은 출력을 대규모로 긁어모으는 것과는 다른 종류의 문제다. 보호 장치는 애초에 파일에 걸린 자물쇠가 아니었다. 제품이 무엇을 표시할지에 관한 방침이었고, 그 방침을 집행하는 주체는 평문을 쥐고 있는 바로 그 시스템이었다. 스스로 가려둔 상태를 요청 한 번에 풀어 보여줄 수 있는 모델은 열쇠가 약한 금고가 아니다. 올바른 순서로 부탁하면 내용을 소리 내어 읽어주는 금고다.
업계가 방금 다 함께 채택한 방어가 바로 이것이다
지난 1년간 증류에 대한 업계의 답은 날것의 추론을 내주지 않는 것이었다. Anthropic의 9월 위협 보고서가 바로 그 흐름을 기술했다 — 추론을 그대로가 아니라 요약해 반환하고, 대화 컨텍스트를 암호학적으로 묶어 흔적을 한 세션에서 다른 세션으로 들어낼 수 없게 한다는 것. OpenAI가 추론을 가려두는 것도 같은 논리다.
OpenAI가 서술한 캠페인은 그 모든 것의 밑에 깔린 가정을 공격한다. 추론 흔적을 세션에 암호학적으로 묶어두면 손이 닿지 않게 된다는 가정, 암호문을 쥔 공격자는 그것을 읽을 수 없기 때문이라는 가정이다. 그들은 읽을 필요가 없었다. 읽을 수 있고, 또 읽어줄 시스템이 필요했을 뿐이다.
이것이 무엇을 증명하고 무엇을 증명하지 않는지는 정확히 해둘 만하다. 두 달 전에 닫은 캠페인에 관한 한 회사의 텔레메트리는 모든 은닉 추론 방식에 대한 일반적 결론이 아니다. 그러나 이것은 방어가 돌파된 것이 아니라 우회된 첫 공개 사례이며, 더 강한 암호로는 고쳐지지 않는 쪽의 문제가 바로 그것이다.
두 달의 침묵, 그리고 특정한 날짜
시점 자체가 하나의 사실이다. OpenAI는 7월 28일에 차단을 마쳤고 9월 30일에 공개했다고 한다. Anthropic이 Moonshot, DeepSeek, 알리바바를 포함한 중국 연구소 일곱 곳을 위협 보고서에서 지목한 지 3주 뒤이며, 백악관이 7월에 Kimi K3를 두고 Moonshot을 비난한 뒤다. 논쟁의 한복판에 떨어진 공개가 그 때문에 틀렸다는 뜻은 아니다. 다만 진공 속으로 도착한 것도 아니고, 두 번째 고발자의 보고서는 언제나 첫 번째의 빛 아래에서 읽힌다.
주장의 범위에서는 OpenAI가 Anthropic보다 좁다. 이 회사의 전략적 국가안보 정책 책임자 캐롤라인 지어는 The Next Web에 이렇게 말했다.
우리의 우려는 이용약관 위반에 관한 것이며, 오픈 모델이나 정당한 증류에 관한 것이 아니다.
의도적으로 작게 놓은 주장이다. 경쟁사의 출력으로 학습시키는 것이 위법인지 누군가 결론 내릴 필요가 없다 — 미국 연구소들은 타인의 저작물로부터 배우는 것이 완전히 정당한 이용이라고 수년간 주장해 왔으므로 그 반대를 논하기에 입장이 나쁘다. 이용약관 위반에는 새 법이 필요하지 않다. 동시에 베이징의 기업을 상대로 누구도 집행할 수 있는 구제 수단이 따라오지 않는다. 보고서가 계정 차단과 통제 강화로 끝나고 소 제기로 끝나지 않은 이유는 아마 그것일 것이다.
조심해야 할 지점
여기 나오는 모든 수치는 한 회사의 내부 텔레메트리에서 나왔다. 외부의 감사를 받지 않았고, 그 회사가 스스로 탐지하고 분류하고 귀속시킨 행위에 대한 기술이다. 귀속은 명시적으로 부분적이다 — "핵심 클러스터"이고, 나머지는 미해결이다. Moonshot은 Anthropic의 혐의에 답하지 않았듯 이번 혐의에도 답하지 않았다. 이 회사는 과거에 Kimi K3를 만들기 위해 다른 연구소의 모델을 증류했다는 주장을 부인했다. 그리고 고발하는 쪽은 고발당한 쪽과 직접 경쟁한다.
외부에서 검증할 수 있는 것은 귀속보다 좁고, 더 유용하다. 보호된 형태의 추론 흔적을 쥔 사용자가 프런티어 모델에서 그 내용을 끌어낼 수 있는가. 이것은 이번 당사자를 포함한 모든 연구소에 연구자들이 던질 수 있는 질문이다.
출처: OpenAI — Disrupting a coordinated model-distillation campaign · The Next Web — OpenAI says Moonshot-linked users tried to extract its AI reasoning · Quartz — OpenAI disrupted a campaign to extract hidden model reasoning linked to Moonshot AI · SC Media — OpenAI disrupts AI model distillation attack linked to China's Moonshot AI · The Hacker News — OpenAI disrupts reasoning extraction campaign linked to Moonshot AI associates · CNBC — AI race heats up as OpenAI flags alleged model-copying campaign · Anthropic — Detecting and countering misuse of AI: September 2026