← 전체 글

인공지능

Anthropic의 중급 모델이 엿새 전에 나온 최상위 모델을 에이전트 코딩에서 앞질렀다. 가격은 절반이다. 등급이라는 말이 의미를 잃었다

9월 28일 출시된 Claude Sonnet 5.5는 가격을 그대로 유지한 채, Anthropic 자체 벤치마크에서 에이전트 코딩 부문 Opus 5.5를 절반 가격으로 앞섰다. 더 조용한 소식은 모델의 추론 과정을 추출하지 못하도록 막는 분류기다.

MAI
Claude Sonnet 5.5 출시에 맞춰 Anthropic이 공개한 공식 발표 이미지.

9월 28일 Anthropic은 Claude Sonnet 5.5를 Sonnet 5와 똑같은 가격에 공개했다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러다. 회사가 직접 공개한 벤치마크 표에서 이 새 중급 모델은 Terminal-Bench 4.0에서 70.6%를 기록했다. 엿새 앞서 공개되어 4달러와 20달러가 매겨진 최상위 모델 Claude Opus 5.5는 66.4%다.

이 한 줄의 비교가 출시 자료의 그 어떤 대목보다 흥미롭다. Anthropic은 Haiku, Sonnet, Opus라는 세 단계 사다리를 판매하며, 그 사다리는 성능과 비용을 맞바꾸도록 설계되어 있다. 그런데 Anthropic이 직접 앞세운 에이전트 코딩 벤치마크에서는 중간 단이 꼭대기 단 위에, 그것도 절반 가격에 놓여 있다.

숫자가 말하는 것

아래 수치는 모두 Anthropic이 제시한 것이다. 이 글을 쓰는 시점에 Sonnet 5.5에 대한 독립적인 제3자 평가는 존재하지 않았다.

벤치마크Sonnet 5Sonnet 5.5Opus 5.5
Terminal-Bench 4.0 (에이전트 코딩)10.3%70.6%66.4%
CursorBench 4.0—55.5%57.8%
GDPval-AA v2.1 (지식 노동)144918441846
AA-Briefcase—18111822
OSWorld 2.1 (컴퓨터 조작)57%80.1%81.8%
모델입력 / 100만 토큰출력 / 100만 토큰
Claude Opus 5.5$4$20
Claude Sonnet 5.5$2$10
Claude Sonnet 5$2$10

GDPval-AA 행을 주의 깊게 읽어야 한다. 1844와 1846의 차이는 격차가 아니라 측정 잡음이다. 다섯 개 벤치마크 가운데 네 개에서 Sonnet 5.5는 두 배 비싼 모델과 2~3포인트 이내로 붙어 있고, 나머지 하나에서는 앞선다.

Terminal-Bench 행에는 박수보다 의심이 어울린다. 한 번의 포인트 릴리스에서 10.3%가 70.6%로 뛰는 것은 성능 곡선이 아니다. 그 하네스에 맞춰 만들어지지 않은 모델이 맞춰 만들어진 모델로 교체된 것이다. Sonnet 5의 점수는 그 모델의 능력이 얼마나 부족했는지가 아니라, 특정 에이전트 스캐폴드를 얼마나 서툴게 다뤘는지를 보여준다. 70.6%는 Anthropic이 지금 측정하는 대상에 맞춰 최적화했다는 증거로 읽는 편이 옳다.

효율성 주장도 같은 토대 위에 있다. Anthropic은 Sonnet 5.5가 Sonnet 5보다 출력 생성이 약 30% 빠르고, 출력 길이와 도구 호출을 줄여 작업당 비용을 최대 30% 낮춘다고 밝히면서 이를 뒷받침할 고객 수치도 함께 공개했다. Box는 2.4배 빠른 실행과 토큰 12% 감소, Slack은 출력 토큰 14% 감소, Lovable은 도구 호출 약 3분의 1 감소, Base44는 Opus 5의 7.7회에 비해 3.6회 반복으로 작업을 끝냈다는 것이다. 모두 출시 전 설계 파트너가 벤더에 제공한 숫자다. 방향이 일관된다는 점은 의미가 있지만, 어느 것도 독립적인 측정은 아니다.

Opus 등급은 이제 무엇을 위한 것인가

중급 모델이 일반 지식 노동에서 최상위 모델과 어깨를 나란히 하고 에이전트 코딩에서 앞선다면, 추가로 내는 2달러와 10달러가 무엇을 사는지 묻지 않을 수 없다. Anthropic이 공개한 가격표를 기준으로 보면 그 답은 좁아지고 있다. Opus 5.5는 캐시 읽기 배수가 더 저렴하고 8달러·40달러의 "fast mode"를 갖췄으며, CursorBench와 AA-Briefcase, OSWorld에서 근소하게 앞선다. 실재하는 이유이기는 하나 얇다.

더 솔직한 해석은 이렇다. 프런티어 등급은 이제 대량으로 제공할 만큼 저렴해지기 전의 성능을 잠시 올려두는 자리가 되었고, 그 간격은 분기가 아니라 날짜 단위로 측정된다. Opus 5.5와 그보다 싼 모델 사이는 엿새였다. 비용을 신경 쓰지 않아도 된다는 이유로 Opus 등급 위에 시스템을 올린 쪽이라면, 사다리를 믿을 것이 아니라 자체 평가를 다시 돌려봐야 한다.

아무도 앞세우지 않은 분류기

안전성 설명에 묻혀 있는 것이 이번 출시의 두 번째 이야기다. Sonnet 5.5는 Anthropic의 사이버보안 안전장치를 탑재한 첫 Sonnet 모델로, 고위험 요청은 Sonnet 5로 되돌려 처리한다. 여기에 더해 모델의 추론 과정 추출을 차단하는 분류기도 함께 실렸다.

마지막 항목은 통상적인 의미의 안전 기능이 아니다. 추론 흔적은 증류의 원재료다. 비싼 모델의 출력으로 값싼 모델을 학습시키는 기법이며, 지금 가격 면에서 Anthropic을 압박하는 오픈웨이트 경쟁자 여럿을 만들어낸 기법이기도 하다. Anthropic은 자사의 사고 연쇄를 지켜야 할 자산으로 취급하고 있고, 이제 그것을 제품 발표문에서 명시했다.

이 일은 OpenAI가 안전성 테스트 퇴행을 이유로 GPT-6.1 Astra를 거둬들인 주에 벌어졌다. 한 연구소는 프런티어 모델을 붙잡아 두었고, 다른 한 곳은 더 싼 모델을 내보내며 추론의 문을 잠갔다. 둘 다 같은 압력에 대한 대응이다. 희소한 것은 더 이상 성능이 아니라는 것, 전달 비용이라는 것이다.

Sources: Introducing Claude Sonnet 5.5 — Anthropic · Claude Platform pricing · Anthropic launches Claude Sonnet 5.5 with 30% cost reduction per task — VentureBeat · Anthropic Releases Claude Sonnet 5.5 at Unchanged Sonnet 5 Pricing — Unite.AI · Anthropic releases Claude Sonnet 5.5: 70.6% on Terminal-Bench 4.0 — MarkTechPost

이어서 읽기