인공지능
앤스로픽이 Haiku 가격을 GPT-6 Luna와 똑같이 맞췄다. 두 모델이 갈라지는 지점은 10만 토큰의 단서 조항이다
Claude Haiku 5.5의 입력 가격은 100만 토큰당 0.10달러다. 이전 세대의 10분의 1이자, OpenAI의 GPT-6 Luna와 동일한 기본 요율이다. 새로 생긴 2단 요금제와 벤치마크 표에서 빠진 경쟁사들이 이 헤드라인을 단순하지 않게 만든다.
MAI
앤스로픽이 수요일 Claude Haiku 5.5를 공개했다. 중요한 숫자는 벤치마크가 아니다. 이 모델의 기본 요율은 입력 100만 토큰당 0.10달러, 출력 0.50달러다. Haiku 4.5의 10분의 1이며, OpenAI가 GPT-6 Luna에 매긴 가격과 센트 단위까지 같다. 다른 거의 모든 영역에서 경쟁하는 두 연구소가 소형 모델의 바닥 가격에서는 동일한 지점에 도달했다.
가격
| 100만 토큰당 | Haiku 5.5 (10만 이하) | Haiku 5.5 (10만 초과) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 입력 | $0.10 | $0.50 | $1.00 | $2.00 |
| 출력 | $0.50 | $2.50 | $5.00 | $10.00 |
| 캐시 읽기 | $0.01 | $0.05 | $0.10 | $0.10 |
| 캐시 쓰기 | $0.125 | $0.625 | $1.25 | $2.50 |
헤드라인은 90% 인하다. 더 정직한 숫자는 앤스로픽이 직접 제시한 것으로, 평균적인 워크로드에서 약 75% 비용 절감이다. 같은 발표에서 Sonnet 5.5의 캐시 읽기 가격도 0.10달러로 절반이 됐고, 앤스로픽은 일반적인 에이전트 워크로드에서 약 20% 절감 효과를 추정한다. Max와 Team 가입자에게는 이번 주부터 월간 API 크레딧이 지급된다. 각각 100달러, 200달러, 팀 전체가 공유하는 최대 500달러다.
Haiku에 절벽이 생겼다
Haiku 4.5는 요청 크기와 무관하게 단일 요율을 적용했다. Haiku 5.5는 입력이 10만 토큰을 넘어서면 다섯 배를 청구한다. 앤스로픽은 Haiku 4.5 요청의 약 90%가 이 기준선 아래였다고 밝혔다. 그것이 75%라는 평균값의 근거이며, 동시에 남은 10% 트래픽은 할인 폭이 훨씬 작아진다는 뜻이기도 하다. 작업당 토큰을 조금 더 소비하는 새 토크나이저도 같은 추정치에 반영되어 있다.
GPT-6 Luna와의 일치가 일치가 아니게 되는 지점이 여기다. Luna의 상위 요율은 입력 27만 2000 토큰에서 시작하는데, Haiku는 10만에서 시작한다. 두 모델이 공유하는 것은 표시 가격이지 비용 곡선이 아니다. 그리고 차이를 가장 크게 체감할 작업은 바로 저렴한 모델이 투입되는 종류의 일이다. 장문 문서 요약, 대규모 컨텍스트 검색, 이력을 쌓아가는 에이전트 루프가 그렇다. 헤드라인 숫자로 이전 비용을 계산하는 팀은 틀린 답을 얻게 된다.
비교 대상이 OpenAI에서 멈춘다
앤스로픽의 평가 표는 Haiku 5.5를 Haiku 4.5, GPT-6 Luna, Sonnet 5.5와 나란히 놓을 뿐 그 외에는 없다. 아래는 모두 회사가 자체적으로 보고한 결과이며, 독립적으로 재현된 것이 아니다.
| 평가 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 | 1,620 | 735 | 1,437 | 1,840 |
| OSWorld 2.1 (오프라인 부분집합) | 72.4% | 15.7% | 48.9% | 83.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 | 46.4% | — | 42.4% | 52.1% |
| Humanity's Last Exam (도구 없음) | 45.9% | 10.2% | — | 56.9% |
세대 간 향상 폭은 그 자체로 충분히 흥미롭다. Haiku 4.5는 Terminal-Bench 4.0에서 0점이었는데 새 모델은 39%를 넘겼다. 다만 그 39.2%는 최대 노력(effort) 설정에서의 결과다. 기본값인 중간 설정에서는 앤스로픽 자체 수치로도 약 20%에 머문다. 헤드라인에 쓰인 에이전트 성능은 대다수 개발자가 실제로 돌릴 구성이 아니다.
표에서 빠진 것은 중국 연구소들이다. The New Stack은 Z.ai의 GLM-5.3-Flash가 GDPval-AA v2.1에서 1,647점을 받아 Haiku 5.5의 1,620점을 앞서고, 알리바바의 Qwen3.7 Flash가 토큰당 더 저렴하다는 점을 지적한다. 둘 다 앤스로픽의 비교에는 등장하지 않는다. 프런티어 연구소가 자기 기준점을 고를 권리는 있지만, '가장 저렴하고 가장 유능한'이라는 틀로 내놓은 소형 모델 발표는 그 표가 시사하는 것만큼 두 주장을 강하게 뒷받침하지 못한다.
실제 용도
앤스로픽은 Haiku 5.5를 큰 모델이 일하는 동안 분류와 라우팅을 처리하는 도구로 내세우지 않는다. Opus 5.5와 Sonnet 5.5 곁에서 함께 돌아가는 서브에이전트로 — 컨텍스트 압축, 데이터베이스 조회, 브라우저 조작, 실시간 고객 지원 — 포지셔닝한다. Haiku 계열 최초로 조절 가능한 노력 설정을 갖췄고, Python과 TypeScript SDK에는 컴퓨터 사용 및 브라우저 사용 베타 지원이 추가됐다. Box는 Haiku 4.5보다 11점 높은 점수를 지연 시간 절반 수준에서 얻었다고 보고했고, HubSpot은 자사 CRM 평가 3회 평균 92.8%를 보고했다.
안전장치는 가격과 반대 방향으로 움직였다. 사이버보안 제한은 Haiku 4.5보다 더 엄격해 표준 구성에서는 침투 테스트가 차단되며, 더 넓은 접근은 앤스로픽의 검증 프로그램을 통해야 한다. 대량 자동화를 명시적으로 겨냥한 모델로서는 의도적인 거래다. 라인업에서 가장 저렴한 모델이 공격적 보안 작업에 대한 재량은 가장 적은 모델이기도 하다.
해석
90% 가격 인하는 가격 발표로 포장한 성능 발표가 아니다. 그냥 가격 발표다. 소형 모델은 이제 에이전트 사업의 승패가 갈리는 계층이다. 한 작업에서 수천 번 호출되는 쪽이 바로 이 계층이다. 그리고 주요 연구소 둘이 그 계층의 값을 100만 토큰당 0.10달러로 각각 독립적으로 결정했다. 마진은 의도적으로 포기된 것이다. 앤스로픽이 그것으로 사려는 것은 모든 Opus와 Sonnet 배포 환경 안쪽의 서브에이전트 자리이며, 10만 토큰의 단서 조항은 그중 일부를 되찾으려는 지점이다.
Sources: Anthropic — Introducing Claude Haiku 5.5 · VentureBeat · The New Stack