人工知能
Anthropicの中位モデルが、6日前に出たばかりの最上位モデルをエージェント型コーディングで上回った。しかも価格は半分。階層という言葉は意味を失った
9月28日に登場したClaude Sonnet 5.5は価格を据え置いたまま、Anthropic自身のベンチマークでエージェント型コーディングにおいてOpus 5.5を上回った。価格は半分である。より静かなニュースは、モデルの推論内容の抽出を阻止するために組み込まれた分類器だ。
MAI
9月28日、AnthropicはClaude Sonnet 5.5を、Sonnet 5とまったく同じ価格で公開した。入力100万トークンあたり2ドル、出力100万トークンあたり10ドルである。同社自身のベンチマーク表では、この新しい中位モデルはTerminal-Bench 4.0で70.6%を記録している。その6日前に公開され、4ドルと20ドルの価格が付けられた最上位モデルClaude Opus 5.5は、66.4%だ。
この一つの比較は、発表文のどの部分よりも興味深い。AnthropicはHaiku、Sonnet、Opusという三階層のはしごを売っており、そのはしごは性能とコストを引き換えにするものであるはずだった。ところがAnthropic自身が前面に押し出したエージェント型コーディングのベンチマークでは、真ん中の段が最上段より上に、しかも半額で位置している。
数字が語ること
以下の数値はすべてAnthropicによるものである。本稿執筆時点で、Sonnet 5.5に対する第三者による独立した評価は存在しない。
| ベンチマーク | Sonnet 5 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|---|
| Terminal-Bench 4.0(エージェント型コーディング) | 10.3% | 70.6% | 66.4% |
| CursorBench 4.0 | — | 55.5% | 57.8% |
| GDPval-AA v2.1(知識労働) | 1449 | 1844 | 1846 |
| AA-Briefcase | — | 1811 | 1822 |
| OSWorld 2.1(コンピュータ操作) | 57% | 80.1% | 81.8% |
| モデル | 入力 / 100万トークン | 出力 / 100万トークン |
|---|---|---|
| Claude Opus 5.5 | $4 | $20 |
| Claude Sonnet 5.5 | $2 | $10 |
| Claude Sonnet 5 | $2 | $10 |
GDPval-AAの行を注意深く読んでほしい。1844と1846の差は差ではなく、測定上のノイズである。五つのベンチマークのうち四つで、Sonnet 5.5は二倍の価格のモデルの2〜3ポイント以内に収まり、残る一つでは上回っている。
Terminal-Benchの行については、称賛よりも懐疑が適切だ。一度のポイントリリースで10.3%から70.6%へ跳ね上がるのは性能の曲線ではない。そのハーネス向けに作られていなかったモデルが、作られたモデルに置き換わっただけである。Sonnet 5のスコアが示しているのは、特定のエージェント用スキャフォールドをどれほどうまく扱えなかったかであって、どれほど能力が低かったかではない。70.6%は、Anthropicがいま測っているものに向けて最適化したことの証拠として受け取るべきだ。
効率に関する主張も同じ土台の上にある。AnthropicはSonnet 5.5がSonnet 5より約30%速く出力を生成し、出力の短縮とツール呼び出しの削減によってタスクあたりのコストを最大30%削減すると述べ、それを裏づける顧客側の数値も公開した。Boxは2.4倍の高速化とトークン12%減、Slackは出力トークン14%減、Lovableはツール呼び出し約3分の1減、Base44はOpus 5の7.7回に対して3.6回の反復でタスクを完了したという。これらはいずれも、ローンチ前に設計パートナーがベンダーに提供した数値である。方向性は一貫しており、それ自体に価値はあるが、独立した測定ではない。
Opus階層はいま何のためにあるのか
中位モデルが一般的な知識労働で最上位モデルと並び、エージェント型コーディングで上回るのであれば、追加の2ドルと10ドルが何を買っているのかという問いは避けられない。Anthropic自身が公開している価格表に照らせば、その答えは狭まりつつある。Opus 5.5はキャッシュ読み取りの倍率がより安く、8ドルと40ドルの「fast mode」を備え、CursorBench、AA-Briefcase、OSWorldでわずかに先行している。実在する理由ではあるが、薄い。
より率直な読み方はこうだ。フロンティア階層は、能力を大量提供できるほど安くなる前に置いておく場所になり、両者の間隔はいまや四半期ではなく日数で測られる。Opus 5.5とそれを下回る価格のモデルの間は6日だった。コストを度外視できるという理由でOpus階層の上に構築している者は、はしごを信用するのではなく、自前の評価をやり直すべきである。
誰も見出しにしなかった分類器
安全性に関する注記に埋もれているのが、このローンチの第二の物語である。Sonnet 5.5は、Anthropicのサイバーセキュリティ保護を搭載した最初のSonnetモデルであり、高リスクの要求はSonnet 5へ差し戻される。さらに、モデルの推論内容の抽出を阻止する分類器も搭載されている。
この最後の一つは、通常の意味での安全機能ではない。推論の軌跡は蒸留の原材料である。高価なモデルの出力で安価なモデルを訓練する手法であり、いまAnthropicを価格面で圧迫しているオープンウェイトの競合の一部を生み出した手法でもある。Anthropicは自社の思考の連鎖を防衛すべき資産として扱っており、そのことを製品発表の中で明言した。
これは、OpenAIが安全性テストの後退を理由にGPT-6.1 Astraを取り下げた週の出来事である。一方の研究所はフロンティアモデルを差し止め、もう一方はより安いモデルを出荷して推論の扉に鍵をかけた。どちらも同じ圧力への応答だ。すなわち、希少なものはもはや能力ではない。提供コストである。
Sources: Introducing Claude Sonnet 5.5 — Anthropic · Claude Platform pricing · Anthropic launches Claude Sonnet 5.5 with 30% cost reduction per task — VentureBeat · Anthropic Releases Claude Sonnet 5.5 at Unchanged Sonnet 5 Pricing — Unite.AI · Anthropic releases Claude Sonnet 5.5: 70.6% on Terminal-Bench 4.0 — MarkTechPost