← 전체 글

인공지능

앤트로픽이 값을 내린 지 90분 만에 OpenAI는 토큰 단가를 반으로 잘랐다. 그 벤치마크 표가 내세우는 것은 성능이 아니라 비용이다

OpenAI가 화요일 GPT-6 Sol과 Luna를, 이들이 대체하는 모델의 절반 가격으로 내놓았다. 앤트로픽이 Opus 가격을 20% 내린 지 약 90분 뒤였다. 정작 OpenAI 자신의 비교표에서 Sol은 주요 벤치마크 세 개 중 둘에서 Claude에 진다. 그럼에도 발표가 내세우는 것은 작업당 비용이다.

MAI
OpenAI 공식 발표 페이지에 실린 GPT-6 Sol과 Luna 안내 그래픽.

OpenAI가 화요일 GPT-6 Sol과 GPT-6 Luna를 내놓으면서 두 모델의 API 가격을 반으로 잘랐다. TechCrunch의 셈에 따르면 이 발표는 앤트로픽이 자체적으로 20%를 인하한 Claude Opus 5.5를 출시한 지 약 90분 뒤에 도착했다. 프런티어 연구소 두 곳이 같은 오후에 가격을 내리는 것은 일정의 우연이 아니며, 그날에 관해 두 모델 어느 쪽보다 흥미로운 사실이다. 모델은 유능하다. 다만 발표의 내용은 가격 쪽에 있다.

모델 둘, 값은 절반

Sol은 코딩과 에이전트 등급이다. Luna는 요약, 추출, 그리고 규모로 돌아가는 사무 작업을 겨냥한 대량 처리 등급이다. 둘 다 OpenAI의 주력 모델 GPT-6 Astra를 만든 학습 방식을, Astra 비용의 일부만으로 적용한다 — 회사 표현으로는 "비용 효율의 프런티어를 밀어올리는" 일이다.

100만 토큰당GPT-6 SolGPT-6 Luna
입력$2$0.10
출력$10$0.50
캐시된 입력 읽기90% 할인90% 할인

OpenAI는 두 모델 모두 이들이 대체하는 GPT-5.6 계열보다 50% 싸다고 설명한다. The New Stack은 그 전 세대 가격을 $4/$20과 $0.20/$1.20으로 적고 있다. 회사는 인하의 이유를 마진이 아니라 인프라로 돌린다. "캐싱과 추론의 개선 덕분에 이 모델들을 더 낮은 비용으로 서비스할 수 있게 되었다." 캐시 읽기 90% 할인은 같은 컨텍스트를 매 단계마다 지불하는 검색 중심 에이전트에게 가장 크게 작용하는 한 줄이다.

두 번째, 더 조용한 비용 효과가 있다. OpenAI는 새 모델들이 답에 이르기까지 쓰는 토큰이 더 적고, 응답이 짧으며 전문용어가 덜하다고 말한다. 앤트로픽도 같은 날 아침 Opus 5.5에 대해 같은 주장을 했다. 두 공급사가 나란히 "우리 모델이 덜 장황해졌으니 실제 인하폭은 공표한 것보다 크다"고 말하기 시작하면, 가격표는 더 이상 무언가를 결정하는 숫자가 아니다. 두 주장 모두 아직 제3자의 직접 비교를 거치지 않았다.

벤치마크 표가 내세우는 것은 성능이 아니라 비용이다

OpenAI가 스스로 공개한 비교는, 거기서 무엇을 인정하고 있는지 때문에 꼼꼼히 읽을 값어치가 있다.

벤치마크GPT-6 Sol앤트로픽 비교 대상OpenAI의 비용 주장
Agents' Last Exam V1 (max)56.4%Claude Opus 5: 60%비용 60% 절감
DeepSWE v1.1 (max)68.8%Claude Fable 5: 69.9%비용 약 80% 절감
OSWorld 2.0 offline (xhigh)60.5%Claude Opus 5: 60.3%비용 80% 절감
FrontierCode 1.1Fable 5.1 xhigh와 동급Claude Fable 5.1더 낮은 비용
AutomationBench 1.0.6 (xhigh)33.2%작업당 $0.27

비교 대상 열을 위에서 아래로 읽어보라. Sol은 Agents' Last Exam에서 Claude Opus 5에 지고, DeepSWE에서 Fable 5에 지며, OSWorld에서는 비긴다. OpenAI는 이 과제들에서 최고의 모델이라고 주장하지 않는다. 최고에 충분히 가까운 모델을 5분의 1 가격에 내놓는다고 주장할 뿐이며, 모든 행을 점수가 아니라 작업당 비용으로 정규화해 제시하기를 택했다.

이는 프런티어 연구소가 논증하는 방식의 실질적인 변화다. 비용 열은 예전에 성능 열에 달린 각주였다. 여기서는 그것이 본문의 열이다. Luna는 그 점을 더 노골적으로 보여준다. DeepSWE에서 66.6%, OpenAI에 따르면 이를 Opus 5보다 93% 싸게 제공한다. 20분의 1 값에 나는 성능 격차는, 같은 값에 나는 같은 격차와는 완전히 다른 제품 판단이다.

발표에서 따로 짚어둘 숫자가 하나 있다. OpenAI는 Sol이 자기가 쓴 코드에 대해 오해를 부르는 주장을 하는 비율이 이전 세대의 10.4%에서 1.3%로 떨어졌다고 보고한다. 달성하지 않은 성공을 보고해 버리는 에이전트에 관한 정렬(alignment) 결과이고, 긴 자율 실행을 믿는 비용을 비싸게 만드는 것이 바로 이 실패 유형이다. 회사는 이 평가들이 의도적으로 까다롭게 설계되었으며 일반적인 사용을 대표하지 않는다고 덧붙인다.

"프런티어 속도 조절"은 일주일쯤 갔다

경쟁의 맥락을 놓고 보면 이 타이밍을 선의로 읽기는 어려워진다. 앤트로픽의 다리오 아모데이는 9월 중순, 연구소들이 전력질주가 아니라 프런티어의 속도를 조절해야 한다고 촉구했고 샘 올트먼도 이를 공개적으로 지지했다. Opus 5.5는 그 촉구 이후 앤트로픽의 첫 릴리스였다. OpenAI의 답은 같은 날 오후에, 그보다 낮은 가격으로 도착했다.

프런티어의 속도를 조절한다는 것이 실제로 무엇을 뜻하든, 경쟁사의 출시일에 가격 인하를 삼가는 일은 거기 포함되지 않는 모양이다. 또 하나 눈에 띄는 것은 중간 등급 GPT-6 Terra가 이번 배포에서 빠졌다는 점이다. 9to5Mac은 이를 OpenAI가 네 개 등급에서 세 개로 정리하는 움직임으로 읽는다 — 앤트로픽과의 등급별 가격 비교를 더 깔끔하게 만드는 단순화이기도 하다.

가격 전쟁의 값은 누가 치르나

Ramp의 이코노미스트 아라 카라지언은 Fortune에 이 역학을 분명하게 정리했다.

OpenAI와 앤트로픽은 가격 전쟁을 벌이고 있고, 그것이 AI의 가격을 끌어내리고 있다.

거기에 붙은 경고 쪽이 더 곱씹을 만하다. 이 회사들에 대한 강세론은 모델이 유능해질수록 비싸진다는 전제 위에 서 있다. 기술 시장이 그렇게 움직이는 일은 드물다. 그리고 성능이 몇 포인트 차이로 수렴하는 와중에 두 공급사가 같은 오후에 값을 내리는 것은, 제품이 범용 투입재가 되어 가는 시장의 모양이다.

구매자에게 이는 그대로 좋은 일이고, 그래서 비용으로 정규화된 벤치마크 표는 이 릴리스를 읽는 올바른 방식이기도 하다. 판매자에게 차별화 요소는 더 이상 어느 모델이 최고인가가 아니다. 작업 하나를 끝내는 비용이며, 그 마진은 한 방향으로만 가고 있다.

Sources: Introducing GPT-6 Sol and Luna (OpenAI) · OpenAI launches GPT-6 Sol and Luna, boasting lower cost and fewer mistakes (TechCrunch) · OpenAI releases GPT-6 Sol and Luna — and cuts token prices in half (The New Stack) · Anthropic releases Claude Opus 5.5 and OpenAI counters with two cheaper GPT-6 models (SiliconANGLE) · What slowdown? OpenAI, Anthropic release dueling models as AI price wars heat up (Fortune) · OpenAI upgrading ChatGPT and Codex with two more GPT-6 models (9to5Mac)

이어서 읽기