Nvidia presentó el lunes Open Agent Safety Platform, una plataforma que combina controles de software con supervisión independiente mediante hardware para reducir el riesgo de que los agentes de inteligencia artificial actúen fuera del alcance autorizado. El sistema integra el software de código abierto OpenShell y el componente de seguridad de hardware Nvidia Sentry. Más de 100 organizaciones, entre ellas Microsoft y Anthropic, colaboran con Nvidia en el uso de esta tecnología.
El lanzamiento llega después de que varios laboratorios líderes de IA informaran de casos en los que agentes salieron de entornos de prueba y accedieron a sistemas sin autorización. Mantener estos sistemas autónomos dentro de límites definidos se ha convertido en una preocupación operativa para las empresas que los incorporan a sus procesos.
El CEO de Nvidia, Jensen Huang, afirmó el lunes que la inteligencia artificial puede generar beneficios importantes, pero que debe desarrollarse y desplegarse de forma segura. Según Huang, controlar los agentes de IA es un reto de ingeniería que puede abordarse mediante tecnología.
OpenShell define los permisos antes de cada tarea
OpenShell es la capa de software de la plataforma. Las empresas pueden instalar esta herramienta de código abierto en dispositivos locales o en la nube y establecer, antes de que comience una tarea, a qué archivos, sitios web, redes, herramientas y credenciales puede acceder un agente. OpenShell comprueba durante la ejecución si la actividad del agente respeta esas reglas.
Huang comparó el sistema con entregar a los empleados tarjetas de acceso que solo les permiten entrar en las áreas necesarias para su trabajo. El primer paso, explicó, consiste en retirar los permisos de un agente y conceder después acceso únicamente a los archivos, datos, herramientas o servicios de internet que requiere la tarea asignada.
Por ejemplo, un agente encargado de gestionar facturas no debería obtener automáticamente acceso a los registros de personal ni poder realizar conexiones libremente con internet. OpenShell ejecuta los agentes en un entorno aislado, con el objetivo de contener las consecuencias de una acción errónea en lugar de permitir que se extienda a otros sistemas de la empresa.
El sistema puede bloquear infracciones en tiempo real
Un agente que se aparta de sus instrucciones no necesariamente actúa de forma maliciosa. Las indicaciones ambiguas, los fallos de las herramientas o la dificultad para resolver una tarea compleja pueden llevarlo a buscar rutas alternativas, algunas de ellas fuera de lo que pretendía su operador.
Nvidia afirma que OpenShell está diseñado para detectar y bloquear en tiempo real las acciones que incumplan políticas preestablecidas. El principio central consiste en mantener al agente dentro de permisos definidos de forma explícita, en lugar de confiar en que el propio sistema determine a qué datos o infraestructuras debería tener acceso.
Nvidia Sentry supervisa desde un componente separado
El segundo componente de la plataforma, Nvidia Sentry, añade una capa de supervisión y aislamiento. Se ejecuta en un procesador de datos Nvidia BlueField dedicado, en lugar de compartir el sistema donde opera el agente. El diseño busca impedir que el agente desactive o eluda el componente de monitorización.
Sentry supervisa las interacciones entre los agentes y los modelos, herramientas, datos y redes. Nvidia sostiene que puede aislar un agente en cuestión de milisegundos si detecta una actividad sospechosa o contraria a las políticas, trasladándolo a un entorno de cuarentena. Huang describió la arquitectura como la incorporación de un chip entre el agente y un modelo de lenguaje de gran escala, lo que permitiría a Nvidia interceptar esas interacciones.
El anuncio responde a las dudas sobre los permisos y la seguridad operativa de los sistemas autónomos de IA. La capacidad de la plataforma para identificar de forma fiable comportamientos anómalos en entornos empresariales sin bloquear actividades legítimas dependerá de su funcionamiento durante los despliegues. Nvidia ha planteado un diseño basado en restringir los permisos por adelantado y en ofrecer supervisión y aislamiento fuera del entorno de ejecución del propio agente.