인공지능
앤트로픽의 새 주력 모델은 자사 최대 모델을 더 싼값에 이겼다. 단, 사이버 작업은 더 오래된 모델이 받는다
Claude Opus 5.5는 앤트로픽이 공개한 벤치마크 대부분에서 Mythos급인 Fable 5.1을 앞서면서도 토큰 단가는 Opus 5보다 20% 싸다. 정작 더 중요한 대목은 발표문 아래쪽에 있다. 사이버보안 관련 요청은 대부분 Opus 4.8로 재라우팅된다. 당신이 호출한 모델 이름은 더 이상 어떤 모델이 답하는지에 대한 약속이 아니다.
MAI
앤트로픽이 화요일 오전 Claude Opus 5.5를 공개했다. 이 릴리스는 모양이 특이하다. 회사가 공개한 벤치마크 대부분에서 이 모델은 한 등급 위에 있는 가장 크고 가장 비싼 모델 Fable 5.1을 이기면서도, 자신이 대체하는 Opus 5보다 토큰 단가가 20% 싸다. 그것이 헤드라인이고, 그 주장은 버틴다. 더 결과가 큰 대목은 발표문 아래쪽 안전장치 항목에 있다. Opus 5.5에 사이버보안 작업을 보내도, 답하는 것은 Opus 5.5가 아니다.
작은 모델이 큰 모델을 먹는다
앤트로픽이 공개한 비교표는 에이전트형 코딩, 컴퓨터 사용, 지식 노동 전반에서 Opus 5.5를 Fable 5.1 앞에 놓는다.
| 벤치마크 | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — |
| GDPval-AA v2.1 | 1846 Elo | 1735 | 1708 | 1542 |
| Humanity's Last Exam | 67.7% | 65.6% | 63.6% | 57.2% |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | — |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
이 가운데 두 줄은 OpenAI의 Astra에 대한 패배이고, 앤트로픽은 그것을 그대로 실었다. Terminal-Bench-Science에서의 6포인트 격차는 공급사가 실수로 끼워 넣을 만한 숫자가 아니다. 이 절제는 기록해 둘 가치가 있다. 표의 나머지를 믿기 쉽게 만들어 주기 때문이다. 상업적으로 의미가 있는 결과는 Terminal-Bench 4.0에서 Fable 5.1을 11포인트 앞선 것이다. Opus와 Mythos급 모델을 가르던 등급의 경계는 넉 달 전에 지녔던 의미를 잃었다.
가격이 곧 논지다
| 100만 토큰당 | Opus 5.5 | Opus 5 |
|---|---|---|
| 입력 | $4 | $5 |
| 출력 | $20 | $25 |
| 캐시 읽기 | $0.20 | $0.50 |
| 캐시 쓰기 | $5 | $6.25 |
| Fast mode 입력 / 출력 | $8 / $40 | — |
표시가 기준 인하폭은 20%지만, 앤트로픽의 주장은 그보다 크다. "Claude Opus 5.5는 에이전트형 코딩과 지식 노동에서 앞서며, 일반적인 워크로드에서 Opus 5보다 40% 적은 비용으로 돌아간다." 답에 도달하기까지 쓰는 토큰이 더 적다는 논리다. 릴리스 보도에서 인용된 Box는 자체 평가에서 Opus 5의 약 3분의 1에 해당하는 토큰을 소비했고 출력은 40% 덜 장황했다고 보고했다. The New Stack의 기사는 Opus 5.5가 작업당 약 20%의 비용으로 GPT-6 Astra를 앞선다고 정리한다.
에이전트를 대량으로 돌리는 쪽에서 장황함은 곧 청구서 그 자체다. 20%의 단가 인하는 명세서의 한 줄이지만, 작업 하나를 끝내는 데 드는 토큰이 3분의 1로 줄어드는 것은 애초에 어떤 워크로드가 성립하는지를 바꾼다.
당신이 호출한 모델이 실제로 도는 모델은 아니다
주목받아야 하는데 아마 받지 못할 대목이 여기다. 앤트로픽의 발표문은 이렇게 못박는다.
사용자는 일상적인 소프트웨어 개발 라이프사이클의 일부로서 자기 코드의 버그를 찾아 고칠 수 있다. 그러나 대부분의 사이버보안 작업은 Opus 4.8로 재라우팅된다.
거절이 아니다. 재라우팅이다. 그것도 두 세대 전 모델로. 같은 메커니즘은 이달 초 Fable 5.1과 함께 등장했다. 침투 테스트, 익스플로잇 생성, 바이너리 기반 취약점 스캔을 거절하는 대신 Opus 계열 모델로 돌려보내는 방식이었다. Opus 5.5는 그것을 물려받았고, 앤트로픽은 신청해서 승인받은 방어 실무자들을 대상으로 Cyber Verification Program을 새 모델까지 확대하겠다고 밝혔다.
The New Stack은 그 함의를 끄집어낸다. Opus 5.5로 보낸 요청이, 안전장치가 작동하느냐에 따라 Opus 4.8이나 Opus 5에서 처리될 수 있다는 것이다. 한 번의 대화라면 흥밋거리에 그친다. 그러나 여러 단계를 도는 에이전트에게 이는 한 번의 실행이 능력도, 실패 방식도, 비용도 다른 세 가지 모델 버전에 걸칠 수 있다는 뜻이다. 게다가 개발자에게는 이음매가 어디서 생겼는지 알려 주는 명시적 신호가 없다. 이 API 위에 평가 체계를 세우는 사람은 이제 볼 수 없는 변수를 하나 떠안았다.
능력과 접근 권한이 분리되고 있다
안전장치들을 한데 놓고 읽으면 하나의 패턴이 드러난다. 생물학 능력은 Life Sciences Verification Program 뒤에 놓인다. 사이버 능력은 Cyber Verification Program 뒤에 놓인다. 증류는 Fable 5.1과 함께 도입된 대응책 "preserved thinking"으로 막히며, 2026년 8월 31일 이후 생성된 API 계정에 적용된다. 그리고 Opus 5.5는 "'thinking' 모드를 끈 상태로는 더 이상 이용할 수 없다" — 사용 중단 예고가 아니라 설정 항목 자체의 제거다.
모델이 무엇을 할 수 있는가와 당신의 계정이 무엇에 닿을 수 있는가는 더 이상 같은 질문이 아니다. 프런티어는 모델 단위가 아니라 고객 단위로 통제되고 있고, API 문자열은 명세가 아니라 요청이 되었다. 이는 올해 앤트로픽이 공개적으로 다뤄 온 오용에 대한 방어 가능한 대응이다. 동시에 모델 접근권을 산다는 것의 의미가 실제로 바뀌었다는 뜻이기도 하다. 벤치마크는 일주일 안에 제3자가 재현할 것이다. 라우팅 동작은 바깥에서 측정하기 어렵고, 이 모델들이 실제로 어떻게 쓰일지를 결정하는 것은 그쪽이다.
Sources: Introducing Claude Opus 5.5 (Anthropic) · Anthropic releases Opus 5.5 with lower prices and Fable-level performance (TechCrunch) · Anthropic releases Opus 5.5 and cuts pricing by 20% (The New Stack) · Google, Anthropic, and OpenAI Unveil Cyber AI Models, Safeguards, and Access Programs (The Hacker News)