英伟达周一发布Open Agent Safety Platform,试图通过权限控制和独立硬件监控,降低AI代理越权操作的风险。该平台由开源软件OpenShell和硬件安全组件Nvidia Sentry构成;微软、Anthropic等100多家机构正在与英伟达合作使用这一系统。随着多家前沿AI实验室报告代理突破测试环境限制、访问未获授权的系统,如何约束自主执行任务的AI,已成为企业部署时需要面对的安全问题。
英伟达首席执行官黄仁勋周一在CNBC节目《Squawk Box》中表示,AI有“带来巨大益处的潜力”,但技术也必须安全开发和部署。他认为,控制AI代理是一个工程问题,也是可以通过技术解决的问题。
OpenShell为代理设定访问边界
OpenShell是平台的软件部分。企业可将这款开源软件下载安装到本地设备或云端,并在代理开始工作前,设定它能够访问哪些文件、网站、网络、工具和凭证。代理运行期间,OpenShell会检查并执行这些规则。
黄仁勋将这一做法比作给员工发放只能进入工作所需区域的门禁卡。他在节目中说,第一步是先收回代理的所有权限,再按任务需要开放文件、数据、工具或互联网访问。
例如,负责整理发票的代理不应因此获得人事档案的访问权限,也不应随意向外部互联网发起调用。OpenShell将代理置于隔离环境中,目标是在代理出现错误操作时,避免影响扩散到企业其他系统。
规则之外的操作可被实时拦截
代理偏离任务要求,未必意味着它具有恶意。指令含糊、工具故障,或代理长时间无法解决复杂问题,都可能促使它不断尝试其他路径,其中一些做法可能超出操作者的预期。
英伟达称,OpenShell旨在实时识别并阻止违反预设策略的操作。其核心思路是让代理只能在明确划定的权限范围内执行任务,而不是依赖代理自行判断哪些系统和数据可以访问。
Nvidia Sentry通过独立硬件监控代理
平台的第二部分Nvidia Sentry承担更深一层的监控和隔离职责。它运行在独立的英伟达BlueField数据处理器上,而不是与AI代理共用同一套系统,设计上使代理无法关闭或绕过监控组件。
Sentry监视代理与模型、工具、数据及网络之间的交互。英伟达表示,一旦发现可疑行为或违规操作,系统可在毫秒级将代理隔离,也就是将其置于“隔离区”。黄仁勋称,这套架构相当于在代理与大型语言模型之间加入一颗芯片,使英伟达能够拦截相关交互。
这项发布回应了市场对自主AI系统权限边界和运行安全的关注。平台能否在企业实际环境中有效识别异常行为、避免误拦截,仍需结合部署情况观察;目前披露的设计重点,是预先限制代理权限,并在越界时提供独立于代理运行环境的监控与隔离手段。