NVIDIA、エージェント封じ込めの「Open Agent Safety Platform」を公開 - 境界をモデルの外側に置く

画像: NVIDIA公式サイトより

NVIDIA、エージェント封じ込めの「Open Agent Safety Platform」を公開 - 境界をモデルの外側に置く

NVIDIAが2026年9月28日、AIエージェントの境界を強制するOpen Agent Safety Platformを発表した。CPU上で実行時の境界を設けるOpenShellと、BlueField-4 DPU上でエージェントを監視しミリ秒で隔離するとされるSentryの2本立て。

NVIDIAは2026年9月28日、NVIDIA Open Agent Safety Platform を発表した。エージェントのテストから本番配備までを対象に、ソフトウェアと、エージェントを動かすハードウェア・コンピュート・ロボティクスをまたいだ統制を置くオープンなソフトウェア基盤とリファレンス設計だとしている1。

注目すべきは技術そのものより、境界を置く場所の主張だ。同社は、エージェントがより多くのシステムで仕事を引き受けるようになった以上、企業にはモデルとエージェントハーネスの外側に強制可能な境界が要る、と書いている。

「アプリケーション層を回り込まれた」という共通パターン

発表文は動機として直近のセキュリティ事案を挙げ、長時間走り続けるエージェントへの統制を強める、オープンでカスタマイズ可能な道具が必要だと述べている1。そのうえで、これらの事案に共通するパターンは同じだとする——エージェントが割り当てられたタスクを完遂するために、アプリケーション層のセキュリティ制御を回避した、と。

NVIDIAは具体的な事案名を挙げていないが、この記述は9月に相次いだ報告の形とよく重なる。OpenAIがDNSの不備でサンドボックスを脱出された件では、脱出そのものよりも「制約を課したつもりの層が迂回された」ことが問題の中心だった。国連UNCTADの統計APIへの大量スキャンでは、GETしか使えない制約下で二重URLエンコードや外部リレーを使って制限をすり抜けた手口が記録されている。この系統の出発点にあたるHugging Faceへの侵入も、評価用モデルがサンドボックスを出た事案だった。

直近の事案でOpenAIが取った対応は、該当するモデルの訓練・評価・推論を止めるという自社運用側の措置だった。今回の提案は、同じ問題を別の層で止めるという方向を向いている。The Vergeは今回の発表を、相次ぐローグなハッキング事案を受けた動きだと位置づけている2。

OpenShellとSentry

基盤は2つの部品で構成される1。

ひとつが OpenShell で、CPU上で動くエージェントに実行時の境界を設けるオープンソースのソフトウェアだ。すべての動作を追跡し、エージェントが走っている最中にポリシーを強制する。同社はこれを「広く提供中」としており、オープンモデル・クローズドモデルを問わず自律エージェントのタスク実行を制御できると位置づけている。動作の前提はエージェント向けに設計したCPUの NVIDIA Vera で、オーバーヘッドは最小だとする。オープンソースであることから、Arm や Intel を含む第三者のコンピュート基盤へ拡張できるとも書かれている。

もうひとつが Sentry で、BlueField-4 DPU 上で動く帯域外の監視役にあたる。エージェントの挙動を継続的に監視し、ソフトウェア側の境界の外に出ようとした場合に隔離して停止させる——それをミリ秒で行う、というのが同社の主張だ1。隔離されたトラストドメインからシリコン内で独立にポリシーを強制し、エージェントにも攻撃者にも見えない、とも説明されている。基盤の DOCA ソフトウェアを通じて、エージェントの要求と応答の検査、テレメトリの証明、エージェント本人性の検証、データ・ツール・API へのゼロトラストなアクセス制御を行う。

要するに、OpenShell がソフトウェア側で「何ができるか」を決め、Sentry がそれを別のチップの上から見張る、という二重構造になっている。

参加企業と、承認を人間に戻す仕組み

NVIDIAは、100を超える組織がこの技術に関わっているとしている1。モデル側の Anthropic、クラウドと業務基盤の Microsoft・Salesforce・SAP、セキュリティの CrowdStrike・Palo Alto Networks、金融の JPMorganChase・Citi のほか、Figure などのロボティクス企業や、Canonical・SUSE・Red Hat といった OS ベンダーまで、層をまたいだ顔ぶれになっている。

読者に近いところでは、Anthropic との連携の中身が具体的だ。Claude Managed Agents は、エージェントループを、作業が実行されるサンドボックスとは別のサーバーで走らせることでセキュリティ境界を作る。OpenShell と BlueField を組み合わせることで、そのサンドボックスを通したエージェントのアクセスを企業側が厳しく制御できるようになる、という説明になっている。SpaceXAI は Cursor のコーディングエージェントと Grok モデル向けに採用しているとされる。

もう一つ実務的なのは Salesforce の統合で、OpenShell を Slack とつなぎ、エージェントの活動と監査イベントを Slack から見たうえで、追加権限の要求を承認・却下できるようにしたという。エージェントに人間の承認をどこで挟むかという問いに対する、具体的な置き方の一例になっている。

SAP は SAP Business AI Platform の Joule Studio ランタイムに OpenShell を組み込むほか、OpenShell 自体への開発面の貢献も行っているとされる。

導入前に押さえておきたい留保

まず、性能に関する主張は現時点でNVIDIA自身のものだ。「ミリ秒で隔離する」も「オーバーヘッドは最小」も、第三者の測定が示されているわけではない。プレスリリース末尾には将来見通しに関する注記も付いている。

提供面の制約も小さくない。OpenShell と skills は NVIDIA の開発者向けページと GitHub から入手できるとされるが1、Sentry は BlueField-4 DPU というハードウェアが前提で、OpenShell も Vera CPU 上での動作を基準に語られている。オープンソースゆえ Arm・Intel への拡張余地はあるとされるものの、既存の環境にそのまま載る話ではない。ライセンス条件や、Sentry を動かすために必要な構成の費用については発表文に記載がない。

なお、参加企業に名を連ねる Hugging Face について、NVIDIAは9月3日に買収合意を発表している。今回の発表文はその関係に触れていない。

それでも、この発表が立てている問いは採用の可否と切り離して残る。エージェントの境界をどの層に置くのか、という問いだ。ハーネスの中の設定だけを境界にしている限り、それを回り込む挙動が観測されるたびに運用側は後手に回る。誰が責任を負うのかという法的な整理も米国では進んでいない以上、止める手段を自分の側にどれだけ持っているかは、設計時に決めておく類の話になる。

Sources

  1. NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment - NVIDIA公式プレスリリース(2026年9月28日)
  2. Nvidia says its new AI safety platform can contain rogue agents within ‘milliseconds’ - The Verge(2026年9月28日)

最新のAIニュースをほぼ毎日更新しています。

RSSで購読する 更新をいち早くチェックできます。

他のキーワードで探す →