英偉達週一發布 Open Agent Safety Platform,透過權限控管及獨立硬體監控,降低 AI 代理越權操作的風險。平台由開源軟體 OpenShell 和硬體安全元件 Nvidia Sentry 組成;微軟、Anthropic 等逾 100 家機構正與英偉達合作使用這套系統。隨著多家前沿 AI 實驗室陸續發現代理突破測試環境限制、存取未獲授權系統,如何約束能自主執行任務的 AI,已成為企業部署時必須處理的安全問題。
英偉達執行長黃仁勳表示,AI 具備「帶來巨大益處的潛力」,但技術也必須以安全方式開發及部署。他認為,控制 AI 代理屬於工程問題,也能透過技術手段處理。
OpenShell 先劃定代理的存取範圍
OpenShell 是平台的軟體部分。企業可以將這套開源軟體安裝在本地設備或雲端環境,並在代理開始運作前,設定它可以存取的檔案、網站、網路、工具及憑證。代理執行任務期間,OpenShell 會檢查並落實這些規則。
黃仁勳把這種做法比喻為,替員工發放只能進入工作所需區域的門禁卡。他表示,第一步是先收回代理的全部權限,再依照任務需要開放檔案、資料、工具或網際網路存取權。
例如,負責整理發票的代理不應因此取得人事檔案的存取權,也不應任意向外部網際網路發起連線。OpenShell 會把代理置於隔離環境,目標是在代理發生錯誤操作時,避免影響擴散至企業的其他系統。
偏離規則的操作可即時攔截
代理偏離任務要求,並不一定代表其具備惡意意圖。指令含糊、工具故障,或代理長時間無法處理複雜問題,都可能促使它持續嘗試其他路徑,而其中部分行為可能超出操作者預期。
英偉達表示,OpenShell 的設計目標,是即時辨識並阻止違反預設政策的操作。核心做法不是依賴代理自行判斷哪些系統和資料可以存取,而是讓代理只能在明確劃定的權限範圍內執行任務。
Nvidia Sentry 以獨立硬體監控代理
平台的第二部分 Nvidia Sentry 負責更深層的監控及隔離工作。它運作於獨立的英偉達 BlueField 資料處理器,而非與 AI 代理共用同一套系統;按照設計,代理無法關閉或繞過這個監控元件。
Sentry 會監看代理與模型、工具、資料及網路之間的互動。英偉達表示,若發現可疑行為或違規操作,系統可在毫秒級別將代理隔離,亦即把它置於「隔離區」。黃仁勳表示,這套架構相當於在代理與大型語言模型之間加入一枚晶片,讓英偉達能夠攔截相關互動。
這項發布正值市場關注自主 AI 系統權限邊界及執行安全之際。平台能否在企業實際環境中準確辨識異常行為,同時避免誤攔截,仍要視部署情況而定。目前公開的設計重點,是事先限制代理權限,並在發生越界時,透過獨立於代理執行環境的硬體提供監控及隔離。