← 記事一覧

人工知能

Gemini 3 以来はじめての最前線モデルは、顧客より先にサイバー防御側へ渡された。この順番こそが発表である

Google は Gemini 4 Argon が 18 のベンチマークのうち 13 で首位または同着だとしている。審査を通った枠の外にいる者は誰も確かめられない。このモデルはまずサイバー防御側と米政府の事前審査へ渡され、トークン代を払う人々の手には後から届くからだ。

MAI
Google 公式の Gemini 4 Argon キーアート。同社自身の発表記事とともに公開された横長のタイトル画像。

Google は 9 月 30 日に Gemini 4 Argon を発表した。昨年 11 月の Gemini 3 以来はじめての旗艦モデルであり、8 月に Demis Hassabis が退いたあと Google DeepMind を引き継いだ Koray Kavukcuoglu の下で出た最初のモデルでもある。Google は、公開した 18 のベンチマークのうち 13 で Argon が首位または同着だとしている。

それを確かめられる立場にある者はほとんどいない。Argon は一般提供されていない。まず Google の Fairwind Program を通じて審査を受けたサイバー防御側に渡り、そして米政府の任意の事前アクセス手続きに入った。開発者、企業、一般利用者に届くのは「できるだけ早く」であり、まずは有料 API 顧客と Google AI Ultra の加入者からとされる。

この順番こそが発表の中身である。最前線を失ったと 10 か月言われ続けてきた会社が、ようやく首位を取り戻すと自ら言うモデルを手にした。そしてそのモデルを、トークン代を払う人々より先に、インシデント対応の担い手と政府の審査手続きへ渡した。

Google が作ったと言うもの

Argon は、実世界のソフトウェア開発、法務や財務といった企業の知的業務、そしてサイバー防御にまたがる複雑なワークフローで、最前線の性能を発揮する。

技術面での目玉は出力上限である。64,000 トークンから 100 万トークンへ。これは、ファイルを下書きするモデルと、移行作業をまるごと一度に吐き出せるモデルとの差だ。Google は、自社のチームが C および C++ から Rust への移行を含む大規模なコードベース移行に Argon を使ったとしている。

公開された比較は、すべて Google が計測したものである。

ベンチマークGemini 4 ArgonGPT-6 AstraClaude Opus 5.5
Harvey Legal Agent19.6%5.4%3.8%
DeepSWE v1.1(ソフトウェア開発)77.9%74.1%74.2%
Vals Finance Agent v265.4%53.5%58.6%
FrontierSWE v255.0%65.5%—
Terminal-Bench Science 0.157.6%68.1%—

脆弱性修正のベンチマークである CWE-bench v1 では、Google は 68% で首位同着だとしている。Gray Swan の間接プロンプトインジェクション試験では攻撃成功率 0.7% と報告している。信用できないログやチケットに向けられることを前提としたモデルにとって、もっとも重い数字はこれである。

「防御側が先」が業界の出し方になりつつある

これは単発の判断ではない。9 月 2 日、米国の最前線ラボ 3 社が同じ主題で発表している。Google は Gemini 3.8 Flash Cyber を Fairwind 経由で出し、CrowdStrike、Datadog、Menlo Security、Palo Alto Networks、Snowflake を含む 650 を超えるパートナーに触れた。OpenAI は自社の Astra が「Critical なサイバーセキュリティ能力のしきい値」に達したと述べた。未知の欠陥を自力で見つけ、突くことができるという意味である。そして Daybreak Blue という枠を通してアクセスを配った。Anthropic は Mythos 5.1 を、サイバーセキュリティと生命科学向けの信頼アクセス枠の内側に留めた。

9 月 30 日に変わったのは範囲である。制限付きアクセスは、これまで狭い用途のセキュリティモデルのための仕組みだった。それがいま、その会社の最良の汎用モデルのための仕組みになっている。Google が挙げる裏づけは防御側のものだ。セキュリティ企業の Wiz が Argon を使い、世界中の病院で使われている医療ソフトウェアに個人情報を露出させる重大な脆弱性を見つけたという。防御側に先行させることの真っ当な根拠である。同時にそれは、逆から読めば、その先行が必要とされる理由でもある。

Google が挙げる 4 つの安全策——悪用の拒否、プロンプトインジェクション耐性、逸脱を見張る思考連鎖の監視、隔離された実行環境——は、すでに完了したものではなく、広く出す前に強化しているものとして書かれている。一般提供を待たせているのは提供能力ではなく安全面の作業だと、Google はこれまででもっとも率直な言い方で述べている。

買えないモデルにつけられた価格

入力 100 万トークンあたり出力 100 万トークンあたり
導入価格$2$10
標準価格$4$20
キャッシュ入力(導入価格)$0.10—

VentureBeat は、導入価格が GPT-6 Astra のおよそ 5 分の 1 だとしている。攻撃的な値づけであり、同時に待ち行列のある製品につけられた価格でもある。API が開くまで、この数字はどの顧客の実負荷にもさらされないまま Google を縛る。

距離を置いて読むべきところ

ここにある数字はすべて Google 自身のものであり、Google が選んだベンチマークで、外部の誰も再現できない時点に出されている。「18 のうち 13 で首位または同着」は、選ばれた集合の中の数え方だ。Google が公開したなかで Astra が勝っている 2 件は差が小さくない。FrontierSWE v2 と Terminal-Bench Science 0.1 で 10 ポイント負けているモデルが勝っているのは、幅であって圧倒ではない。「できるだけ早く」は日付ではない。

追う値打ちがあるのは次のベンチマーク表ではない。防御側向けの版と一般向けの版のあいだに空く期間の長さである。数週間で閉じるなら、段階的な展開は発売の手順だったということだ。数か月続くなら、Google は、最前線モデルの最初の利用者はシステムを守る人々とそれを審査する政府であり、市場のそれ以外はその審査を通った版を受け取るという形を、定着させたことになる。

Sources: Google: Gemini 4 Argon — our next era of frontier intelligence, VentureBeat: Google unveils Gemini 4 Argon, retaking benchmark lead over OpenAI and Anthropic — but in limited release, Unite.AI: Google Announces Gemini 4 Argon Frontier Model for Coding, Cyber Defense, The Hacker News: Google, Anthropic, and OpenAI Unveil Cyber AI Models, Safeguards, and Access Programs, Fortune: Demis Hassabis steps down from Google DeepMind CEO role amid a major AI leadership shake-up

続けて読む