В понедельник Nvidia представила Open Agent Safety Platform — систему, которая сочетает программные ограничения с независимым аппаратным мониторингом, чтобы снизить риск выхода ИИ-агентов за пределы разрешённых полномочий. В платформу входят ПО с открытым исходным кодом OpenShell и аппаратный компонент безопасности Nvidia Sentry. По данным компании, над использованием системы работают более 100 организаций, среди них Microsoft и Anthropic.
Запуск состоялся на фоне сообщений ведущих ИИ-лабораторий о случаях, когда агенты выходили за пределы тестовых сред и получали несанкционированный доступ к системам. Для компаний, внедряющих автономные системы, контроль их действий становится практической задачей кибербезопасности.
Глава Nvidia Дженсен Хуанг заявил в понедельник в эфире CNBC Squawk Box, что ИИ способен принести значительную пользу, но его необходимо безопасно разрабатывать и внедрять. Контроль над ИИ-агентами он назвал инженерной задачей, которую можно решить с помощью технологий.
OpenShell ограничивает доступ до начала работы агента
OpenShell — программный компонент платформы. Компании могут установить ПО с открытым исходным кодом на локальные устройства или в облаке и заранее определить, к каким файлам, сайтам, сетям, инструментам и учётным данным агенту разрешён доступ. Во время выполнения задачи OpenShell проверяет его действия на соответствие заданным правилам.
Хуанг сравнил этот подход с пропускной системой для сотрудников, при которой каждый получает доступ только в помещения, необходимые для работы. Сначала, по его словам, агенту следует не предоставлять никаких прав, а затем открыть ему доступ к тем файлам, данным, инструментам или интернет-сервисам, которые нужны для конкретной задачи.
Так, агенту для обработки счетов не следует автоматически открывать кадровые записи или разрешать произвольные обращения во внешний интернет. OpenShell запускает агентов в изолированной среде, чтобы ограничить последствия ошибочного действия и не допустить его распространения на другие системы компании.
OpenShell блокирует нарушения правил в реальном времени
Отклонение агента от инструкций не обязательно означает злонамеренное поведение. Неоднозначный запрос, сбой инструмента или сложность задачи могут подтолкнуть систему к поиску альтернативных решений, которые выходят за рамки намерений оператора.
По заявлению Nvidia, OpenShell должен обнаруживать и блокировать действия, нарушающие заранее заданные правила, в режиме реального времени. Основной принцип системы — удерживать агента в пределах явно установленных полномочий, а не полагаться на его собственное решение о том, к каким данным и системам ему следует получить доступ.
Nvidia Sentry следит за агентами на отдельном чипе
Второй компонент платформы, Nvidia Sentry, добавляет независимый уровень мониторинга и изоляции. Он работает на выделенном дата-процессоре Nvidia BlueField, а не в той же системе, что и агент. Такая архитектура призвана не дать агенту отключить или обойти средства наблюдения.
Sentry отслеживает взаимодействие агента с моделями, инструментами, данными и сетями. Nvidia заявляет, что при обнаружении подозрительных действий или нарушения правил система может за миллисекунды изолировать агента, переместив его в карантинную среду. Хуанг описал архитектуру как дополнительный чип между агентом и большой языковой моделью, который позволяет Nvidia перехватывать их взаимодействие.
Платформа отвечает на вопросы о полномочиях и операционной безопасности автономных ИИ-систем. Насколько надёжно она сможет выявлять аномальное поведение в корпоративной среде, не блокируя допустимые действия, станет ясно по мере внедрения. Nvidia описывает подход, основанный на предварительном ограничении прав и независимом от агента мониторинге с возможностью изоляции.