人工知能
Anthropicの新フラッグシップは、最大のモデルをより安く上回る。ただしサイバー関連の仕事では、古いモデルが返ってくる
Claude Opus 5.5は、Anthropicが公開したベンチマークの大半でMythos級のFable 5.1を上回り、しかもOpus 5よりトークン単価が20%安い。だが発表のさらに下にある一文の方が重い。サイバーセキュリティ関連の要求はほとんどがOpus 4.8へ再ルーティングされる。呼び出したモデル名は、もはや「どのモデルが答えるか」の約束ではない。
MAI
Anthropicが火曜日の朝、Claude Opus 5.5をリリースした。このリリースは奇妙な形をしている。同社が公開したベンチマークの大半で、このモデルは一段上の階層に位置する最大かつ最高価格のモデルFable 5.1を上回り、しかも置き換え対象であるOpus 5よりトークン単価が20%安い。それが見出しであり、中身も伴っている。より重大な事実は発表のさらに下、セーフガードの節にある。Opus 5.5にサイバーセキュリティの作業を投げても、答えを返すのはOpus 5.5ではない。
小さいモデルが大きいモデルを食う
Anthropicが公開した比較では、エージェント的コーディング、コンピュータ操作、知識労働のいずれでもOpus 5.5がFable 5.1を上回っている。
| ベンチマーク | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — |
| GDPval-AA v2.1 | 1846 Elo | 1735 | 1708 | 1542 |
| Humanity's Last Exam | 67.7% | 65.6% | 63.6% | 57.2% |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | — |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
このうち2行はOpenAIのAstraに対する敗北であり、Anthropicはそれをそのまま載せた。Terminal-Bench-Scienceでの6ポイント差は、ベンダーがうっかり混入させる類の数字ではない。この抑制は記しておく価値がある。表の残りを信用しやすくするからだ。商業的に効いてくるのは、Terminal-Bench 4.0でFable 5.1に11ポイント差をつけた結果である。OpusとMythos級モデルとを隔てていた階層の境界は、4か月前に持っていた意味を失った。
価格こそが主張である
| 100万トークンあたり | Opus 5.5 | Opus 5 |
|---|---|---|
| 入力 | $4 | $5 |
| 出力 | $20 | $25 |
| キャッシュ読み出し | $0.20 | $0.50 |
| キャッシュ書き込み | $5 | $6.25 |
| Fast mode 入力 / 出力 | $8 / $40 | — |
定価ベースの引き下げは20%だが、Anthropicの主張はもっと大きい。「Claude Opus 5.5はエージェント的コーディングと知識労働で先行し、一般的なワークロードではOpus 5より40%低いコストで動く」——答えに至るまでに費やすトークンが少ない、という理屈だ。リリース報道で引用されたBoxは、自社評価においてOpus 5の約3分の1のトークン消費で、出力は40%簡潔になったと報告している。The New Stackの記事は、Opus 5.5が1タスクあたり約20%のコストでGPT-6 Astraを上回るとしている。
エージェントを大量に走らせる側にとって、冗長さは請求額そのものである。20%の単価引き下げは明細の一行にすぎないが、1タスク完了あたりのトークンが3分の1になることは、そもそもどのワークロードが成立するのかを変える。
呼び出したモデルが、走るモデルとは限らない
注目されるべきなのに、おそらくされないであろう部分がここだ。Anthropicの発表はこう明言している。
ユーザーは通常のソフトウェア開発ライフサイクルの一環として、コード中のバグを特定し修正できるようになる。しかし、ほとんどのサイバーセキュリティ関連のタスクはOpus 4.8へ再ルーティングされる。
拒否ではない。再ルーティングである。しかも2世代前のモデルへ。同じ仕組みは今月初めのFable 5.1で導入された。ペネトレーションテスト、エクスプロイト生成、バイナリベースの脆弱性スキャンを、拒絶するのではなくOpus系のモデルへ振り向けるというものだ。Opus 5.5はそれを引き継ぎ、Anthropicは防御側の実務者向けに、申請し承認された利用者を対象としてCyber Verification Programを新モデルへ拡大すると述べている。
The New Stackはその含意を引き出している。Opus 5.5に送った要求が、セーフガードが作動するかどうかによってOpus 4.8やOpus 5で処理されうる、ということだ。チャットの一往復なら些事である。しかし多段のエージェントにとっては、ひとつの実行が能力も失敗の仕方もコストも異なる3つのモデル世代にまたがりうることを意味する。しかも開発者には、どこで継ぎ目が入ったのかを知る明示的な手がかりがない。このAPIの上に評価基盤を組む者は、見えない変数をひとつ抱え込んだことになる。
能力とアクセス権が切り離されつつある
セーフガードをまとめて読むと、ひとつのパターンが浮かぶ。生物学の能力はLife Sciences Verification Programの背後に置かれる。サイバーの能力はCyber Verification Programの背後に置かれる。蒸留はFable 5.1で導入された対策「preserved thinking」によって塞がれ、2026年8月31日以降に作成されたAPIアカウントに適用される。そしてOpus 5.5は「『thinking』モードをオフにした状態では利用できなくなった」——非推奨ではなく、設定項目そのものの削除である。
モデルに何ができるかと、あなたのアカウントが何に手を届かせられるかは、もはや同じ問いではない。フロンティアはモデル単位ではなく顧客単位でゲートされており、APIの文字列は仕様ではなく要求になった。これは今年Anthropicが公に対処してきた悪用への、擁護しうる応答である。同時に、モデルへのアクセスを買うことの意味が実際に変わったということでもある。ベンチマークは1週間以内に第三者が再現するだろう。ルーティングの挙動は外から測るのが難しく、そしてこれらのモデルが実際にどう使われるかを形づくるのは、そちらの方だ。
Sources: Introducing Claude Opus 5.5 (Anthropic) · Anthropic releases Opus 5.5 with lower prices and Fable-level performance (TechCrunch) · Anthropic releases Opus 5.5 and cuts pricing by 20% (The New Stack) · Google, Anthropic, and OpenAI Unveil Cyber AI Models, Safeguards, and Access Programs (The Hacker News)