엔비디아가 월요일 AI 에이전트의 권한을 제한하고 별도 하드웨어로 이상 행동을 감시하는 ‘Open Agent Safety Platform’을 공개했다. 자율적으로 업무를 수행하는 AI가 허가되지 않은 시스템에 접근할 위험을 줄이려는 취지다. 이 플랫폼은 오픈소스 소프트웨어 OpenShell과 하드웨어 보안 구성요소 Nvidia Sentry로 이뤄져 있으며, 마이크로소프트와 앤스로픽을 포함한 100여 개 기관이 엔비디아와 함께 시스템을 사용하고 있다.
최근 여러 선도 AI 연구소가 에이전트가 테스트 환경의 제한을 벗어나 허가되지 않은 시스템에 접근한 사례를 보고하면서, 기업의 AI 도입 과정에서 에이전트의 권한과 실행 범위를 통제하는 문제가 주요 보안 과제로 떠올랐다.
엔비디아 최고경영자(CEO) 젠슨 황은 월요일 CNBC ‘스쿼크 박스’에 출연해 AI가 “큰 이익을 가져올 잠재력”이 있지만, 기술을 안전하게 개발하고 배포해야 한다고 말했다. 그는 AI 에이전트 통제는 엔지니어링 문제이며 기술로 해결할 수 있다고 설명했다.
OpenShell, 에이전트의 접근 범위 사전 설정
OpenShell은 플랫폼의 소프트웨어 구성요소다. 기업은 이 오픈소스 소프트웨어를 로컬 기기나 클라우드에 설치한 뒤, 에이전트가 작업을 시작하기 전에 접근 가능한 파일과 웹사이트, 네트워크, 도구, 인증 정보를 지정할 수 있다. 에이전트가 작동하는 동안에는 OpenShell이 설정된 규칙을 점검하고 적용한다.
황 CEO는 이를 직원에게 업무상 필요한 구역만 출입할 수 있는 출입증을 주는 것에 비유했다. 먼저 에이전트의 권한을 모두 회수한 다음, 맡은 업무에 필요한 파일과 데이터, 도구 또는 인터넷 접근 권한만 부여하는 방식이다.
예를 들어 송장 정리를 맡은 에이전트가 인사 기록까지 열람하거나 외부 인터넷에 임의로 접속해서는 안 된다. OpenShell은 에이전트를 격리된 환경에서 실행해, 잘못된 작업이 발생하더라도 기업의 다른 시스템으로 영향이 번지지 않도록 하는 것을 목표로 한다.
정책 위반 작업은 실시간 차단
에이전트가 지시에서 벗어났다고 해서 반드시 악의적인 행동을 한 것은 아니다. 모호한 지시나 도구 오류, 복잡한 문제를 장시간 해결하지 못하는 상황 때문에 에이전트가 다른 방법을 계속 시도할 수 있으며, 그 과정에서 사용자가 예상한 범위를 넘어설 가능성이 있다.
엔비디아는 OpenShell이 사전에 정한 정책을 위반하는 작업을 실시간으로 식별해 차단하도록 설계됐다고 밝혔다. 에이전트가 접근 가능한 시스템과 데이터를 스스로 판단하게 두기보다, 명확하게 설정된 권한 범위 안에서만 작업하도록 하는 것이 핵심이다.
Nvidia Sentry, 독립 하드웨어로 감시·격리
플랫폼의 두 번째 구성요소인 Nvidia Sentry는 한층 깊은 감시와 격리를 담당한다. AI 에이전트와 같은 시스템에서 실행되는 대신 별도의 엔비디아 BlueField 데이터 처리 장치에서 작동한다. 설계상 에이전트가 감시 구성요소를 종료하거나 우회할 수 없도록 했다.
Sentry는 에이전트와 모델, 도구, 데이터, 네트워크 사이의 상호작용을 감시한다. 엔비디아에 따르면 의심스러운 행동이나 규정 위반이 감지되면 밀리초 단위로 에이전트를 격리할 수 있다. 황 CEO는 에이전트와 대규모 언어 모델 사이에 칩을 하나 두는 구조라며, 이를 통해 관련 상호작용을 차단할 수 있다고 설명했다.
이번 발표는 자율형 AI 시스템의 권한 경계와 운영 안전성에 대한 시장의 관심을 반영한다. 실제 기업 환경에서 이상 행동을 얼마나 효과적으로 찾아내고 오탐을 얼마나 줄일 수 있을지는 배포 결과를 지켜봐야 한다. 현재 공개된 설계의 핵심은 에이전트의 권한을 미리 제한하고, 범위를 벗어나는 경우 에이전트 실행 환경과 분리된 감시·격리 수단을 제공하는 데 있다.