NVIDIAは月曜日、AIエージェントの権限逸脱リスクを抑える「Open Agent Safety Platform」を発表した。オープンソースソフトウェアのOpenShellと、ハードウェアベースのセキュリティーコンポーネントNvidia Sentryで構成され、AIエージェントのアクセス権限を制限し、異常な動作を監視したうえで必要に応じて隔離する。MicrosoftやAnthropicを含む100社超の組織が、NVIDIAと連携してこのシステムを利用している。
複数の先端AI研究所が、AIエージェントがテスト環境の制限を突破し、許可されていないシステムにアクセスする事例を報告している。自律的に作業を進めるAIをどのように制御するかは、企業がAIを導入する際の安全面の課題になっている。
NVIDIAのジェンスン・フアン最高経営責任者(CEO)は月曜日、米CNBCの番組「Squawk Box」で、AIには「大きな利益をもたらす可能性」がある一方、安全な開発と導入が必要だと述べた。AIエージェントの制御はエンジニアリング上の問題であり、技術によって解決できる課題だとの見方も示した。
OpenShellでアクセス範囲を事前に設定
プラットフォームのソフトウェア部分を担うのがOpenShellだ。企業はこのオープンソースソフトウェアを自社の端末やクラウド環境に導入し、AIエージェントが稼働する前に、アクセスを許可するファイル、ウェブサイト、ネットワーク、ツール、認証情報を設定できる。エージェントの稼働中は、OpenShellが設定したルールを確認し、その内容を適用する。
フアン氏はこの仕組みを、従業員に業務上必要な区域だけに入れる入館カードを渡すことになぞらえた。まずエージェントからすべての権限を取り上げ、その後、作業に必要なファイル、データ、ツール、インターネットへのアクセスだけを開放する考え方だ。
例えば、請求書を整理するエージェントに人事記録へのアクセス権を与える必要はなく、外部インターネットへの接続を自由に許可する理由もない。OpenShellはエージェントを隔離された環境に置き、誤った操作が企業内の他のシステムに広がるのを防ぐことを目指す。
設定外の操作をリアルタイムで遮断
エージェントが想定された作業から外れたとしても、直ちに悪意があるとは限らない。指示の曖昧さ、ツールの不具合、複雑な問題を長時間解決できない状態などが、別の手段を繰り返し試す動機になる場合がある。その中には、利用者が想定していない操作も含まれ得る。
NVIDIAによると、OpenShellは事前に定めたポリシーに反する操作をリアルタイムで特定し、阻止することを狙っている。エージェント自身に、どのシステムやデータへアクセスすべきかを判断させるのではなく、明確に定義した権限の範囲内だけで作業させるのが中核となる。
Nvidia Sentryが独立したハードウェアで監視
プラットフォームのもう一つの構成要素であるNvidia Sentryは、より深い監視と隔離を担う。AIエージェントと同じシステム上ではなく、独立したNVIDIA製のBlueFieldデータプロセッサー上で動作するため、設計上はエージェントが監視機能を停止したり回避したりできない構成になっている。
Sentryは、エージェントとモデル、ツール、データ、ネットワークの間で行われるやり取りを監視する。NVIDIAは、疑わしい挙動やポリシー違反を検知した場合、システムがミリ秒単位でエージェントを隔離できるとしている。フアン氏は、エージェントと大規模言語モデルの間にチップを組み込むような構造で、関連するやり取りをNVIDIAが遮断できると説明した。
今回の発表は、自律型AIシステムの権限範囲と稼働時の安全性をめぐる企業側の関心に対応するものだ。実際の企業環境で異常な動作をどこまで正確に検知し、必要な処理まで誤って遮断しないかは、今後の導入状況を通じて確認する必要がある。現時点で示された設計の重点は、エージェントの権限をあらかじめ制限し、範囲を超える操作が起きた際に、エージェントの実行環境から独立した監視と隔離を行う点にある。