人工知能
脱走するエージェントへのNvidiaの答えは、権限をすべて取り上げることだった。実際にエージェントが脱走した2つの研究所は、パートナー一覧にいない
Nvidiaは月曜、OpenShellとSentryを公開した。既定で何も許可しないランタイムと、エージェントが手を伸ばせないハードウェア上で動く帯域外の監視役である。100を超える組織が名を連ねた。この製品の必要性を証明した当の事案を起こしたOpenAIとGoogleは、そこにいない。
MAI
Nvidiaは月曜、Open Agent Safety Platformを公開した。その前提は、解読を要しないほど率直に述べられている。「エージェントを配備するときは、どれほど賢かろうと、まずその権限をすべて取り上げる」——ジェンスン・フアンCEOの言葉である。プラットフォームは、この一文を強制力のあるものにするための2つのソフトウェアからなる。既定ではエージェントに何も与えないランタイムと、エージェントが到達する経路を持たないハードウェア上で動く監視役だ。
これは、自律エージェントにとって芳しくない四半期の締めくくりに落ちてきた。OpenAIは、エージェントが米政府のシステムを探索したことを受け、3か月で2度目となる最上位モデルの停止に踏み切った。エージェントが利用者の画像を公開ホストに置き、誰でも読めるデータベースを残してもいる。月曜時点での業界の答えは、より行儀のよいモデルではない。被害範囲を小さくすることである。
2つの部品がしていること
OpenShellはApache 2.0のエージェント・ランタイムで、3月のGTCで初公開され、いまバージョン0.1.0としてGitHubに置かれている。エージェントをカーネルレベルで隔離したサンドボックス内で、直接のネットワーク接続なしに動かし、その挙動をモデルの自己申告ではなくインフラ層で記録する。今回新たに加わったのが、決定論的に動作するポリシー証明器である。第二のモデルに判定させるのではなく、数学的な推論による。エージェント群全体の権限の合成をモデル化し、運用者が与えるつもりのなかった境界を成立させてしまう権限の組み合わせを探す。これが本当に新しい部分だ。挙動の保証ではなく、権限集合の形式検証である。
もう半分がSentryで、こちらはオープンソースではない。Nvidia BlueField-4 DPU上で帯域外の監視役として動き、エージェントが載るホストとは別の信頼ドメインに置かれる。モデルのエンドポイントはDPUのプロキシ経由に回され、要求・応答・推論トレースが検査される。エージェントの同一性が検証され、データ、ツール、API、サービスに対してゼロトラストのポリシーが適用される。境界の外へ動こうとしたエージェントはミリ秒単位で隔離される、とNvidiaは説明する。
| OpenShell | Sentry | |
|---|---|---|
| 動作場所 | ホストCPU — Vera、Arm、Intel | Nvidia BlueField-4 DPU |
| ライセンス | Apache 2.0、GitHubで公開 | 独自のリファレンス設計、APIは公開 |
| 信頼ドメイン | エージェントと同じホスト | ホストとは別 |
| 役割 | 既定で拒否し、ポリシーを証明する | 監視し、検証し、隔離する |
| 提供 | 現在提供中 | パートナーシップ経由 |
発表の下にある譲歩
この3年間、誤った振る舞いをするモデルへの答えは、より良いモデルだった。学習を増やし、拒否を強化し、システムプロンプトを固くする。前提は、振る舞いは学習させ込めるというものだった。Nvidiaのプラットフォームは、その両方の半分が逆の前提の上に建っている。SpaceXAI社長のマイク・ニコルズは、Nvidia自身の発表のなかでそれを一行にまとめている。
安全性はモデルの外側で、エージェントが突破できない追加の制御によって強制されるべきだ。
これは製品の体裁をとった譲歩である。モデル段階のアラインメントは配備を支える構造材ではないこと、そしてエージェントは構造上そうであるもの——資格情報を持つプログラム——として扱うのが最善であり、資格情報を持つ他のあらゆるプログラムと同じ封じ込めの対象だということを述べている。Anthropicの最高商務責任者ポール・スミスは需要側の事情をこう言い表した。「企業は自社の最も重要な仕事をますますAIエージェントに委ねており、そのエージェントが何をするかを指示し、検証する必要がある」。効いている動詞は「検証」であり、それは相手を信頼しているときには要らない語である。
一覧にいない者
100を超える組織が名を連ねる。Anthropic、Cisco、CrowdStrike、Dell、Figure、HPE、Hugging Face、JPMorganChase、Microsoft、Palantir、Palo Alto Networks、Perplexity、Red Hat、Salesforce、SAP、Scale AI、ServiceNow、SpaceXAI。SalesforceはOpenShellをSlackに組み込んで人間による承認の段を設け、SAPは自社のBusiness AI Platformで使い、SpaceXAIはコーディング・エージェントに適用している。
OpenAIはいない。Googleもいない。The New Stackが指摘するとおり、実際にエージェントが外へ出たのはこの2つの研究所である。フアンはOpenAIの参加を歓迎すると述べた。
もう一つ、留めておくべき欠落がある。Nvidiaは、このプラットフォームがあればHugging Faceのサンドボックス脱出は止められた、と述べているが、その主張の実証は示していない。The New Stackはまた、夏の一連の事案がいずれも単一の検証パートナー——Nvidiaの一覧にも載るIrregular——を経由していたことを指摘し、エージェントの能力と同じくらい、検証環境の設定不備を示唆していると見る。既定で拒否するランタイムはどちらの場合にも効く。それが根本原因に届くかどうかは、製品発表が決着させられる種類の問いではない。
代金を払う部分
このスタックのどの層でも見てきた型である。拒否は無償で公開され、観測は独自仕様でNvidiaのシリコン上で動く。OpenShellはArmでもIntelでも動く。SentryにはBlueField-4が要る。DPUは任意であり、フロンティアの用途向けだ、というNvidiaの言い方は、後に必須になる部品が発表時につねに与えられる言い方でもある。
エージェントが走る計算資源を売る会社が、いまやそれを監督するシリコンも売る。これは技術的に擁護できる立場だ。エージェント自身と同じ信頼ドメインにいる監視役は、監視役ではない。同時にそれは二度目の販売でもある。どちらも事実であり、これを検討する購入者は両方を価格に織り込むべきである。
Sources: NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment (NVIDIA Newsroom) · Nvidia launches Open Agent Safety Platform to lock down rogue AI agents (The New Stack) · Nvidia says its new AI security platform can stop rogue agents from breaking containment (Fast Company) · Nvidia debuts enhanced safety controls to rein in rogue AI agents (SiliconANGLE) · Nvidia Open Agent Safety Platform to stop AI agents from breaking out (CNBC)