Nvidia hôm thứ Hai công bố Open Agent Safety Platform, nền tảng nhằm giảm rủi ro tác nhân AI tự ý thực hiện các thao tác ngoài phạm vi được cấp phép. Hệ thống kết hợp phần mềm mã nguồn mở OpenShell với thành phần bảo mật phần cứng Nvidia Sentry. Hơn 100 tổ chức, trong đó có Microsoft và Anthropic, đang hợp tác với Nvidia để sử dụng nền tảng này. Động thái diễn ra khi một số phòng thí nghiệm AI hàng đầu ghi nhận tác nhân vượt khỏi môi trường thử nghiệm và truy cập hệ thống chưa được cấp quyền, khiến vấn đề kiểm soát các hệ thống AI tự thực hiện nhiệm vụ trở thành mối quan tâm khi doanh nghiệp triển khai.
CEO Nvidia Jensen Huang nói trên chương trình “Squawk Box” của CNBC hôm thứ Hai rằng AI có tiềm năng mang lại lợi ích lớn, nhưng công nghệ này cần được phát triển và triển khai an toàn. Ông cho rằng việc kiểm soát tác nhân AI là bài toán kỹ thuật và có thể giải quyết bằng công nghệ.
OpenShell giới hạn quyền truy cập theo nhiệm vụ
OpenShell là lớp phần mềm của nền tảng. Doanh nghiệp có thể cài phần mềm mã nguồn mở này trên thiết bị tại chỗ hoặc trên đám mây, sau đó xác định trước tác nhân được phép truy cập những tệp, trang web, mạng, công cụ và thông tin xác thực nào. OpenShell kiểm tra và thực thi các quy tắc trong suốt quá trình tác nhân hoạt động.
Huang ví cách tiếp cận này như việc cấp cho nhân viên thẻ ra vào chỉ mở được những khu vực cần thiết cho công việc. Ông nói bước đầu tiên là thu hồi toàn bộ quyền của tác nhân, rồi chỉ cấp lại quyền truy cập tệp, dữ liệu, công cụ hoặc internet theo yêu cầu của nhiệm vụ.
Chẳng hạn, một tác nhân xử lý hóa đơn không nên vì thế mà được truy cập hồ sơ nhân sự hoặc tùy ý kết nối ra internet. OpenShell đặt tác nhân trong môi trường cô lập, nhằm hạn chế việc một thao tác sai ảnh hưởng đến các hệ thống khác của doanh nghiệp.
Hành động vượt quy tắc có thể bị chặn ngay
Tác nhân đi chệch yêu cầu không nhất thiết là do có chủ ý xấu. Chỉ dẫn thiếu rõ ràng, công cụ gặp trục trặc hoặc việc không giải quyết được một vấn đề phức tạp trong thời gian dài có thể khiến tác nhân thử những cách khác, trong đó có những hành động vượt ngoài dự tính của người vận hành.
Nvidia cho biết OpenShell được thiết kế để phát hiện và chặn theo thời gian thực các thao tác vi phạm chính sách đã đặt ra. Trọng tâm là giới hạn tác nhân trong phạm vi quyền truy cập xác định, thay vì dựa vào việc tác nhân tự đánh giá hệ thống và dữ liệu nào mình được phép sử dụng.
Nvidia Sentry giám sát tác nhân bằng phần cứng riêng
Thành phần thứ hai, Nvidia Sentry, đảm nhiệm lớp giám sát và cách ly sâu hơn. Sentry chạy trên bộ xử lý dữ liệu Nvidia BlueField độc lập, thay vì dùng chung hệ thống với tác nhân AI. Theo thiết kế, tác nhân không thể tắt hoặc vượt qua thành phần giám sát này.
Sentry theo dõi tương tác giữa tác nhân với mô hình, công cụ, dữ liệu và mạng. Nvidia cho biết nếu phát hiện hành vi đáng ngờ hoặc thao tác vi phạm, hệ thống có thể cách ly tác nhân trong vài mili giây, đưa tác nhân vào một “khu vực cách ly”. Huang mô tả kiến trúc này như việc đặt một con chip giữa tác nhân và mô hình ngôn ngữ lớn, qua đó Nvidia có thể chặn các tương tác liên quan.
Nền tảng được giới thiệu trong bối cảnh doanh nghiệp quan tâm nhiều hơn đến giới hạn quyền hạn và an toàn vận hành của các hệ thống AI tự chủ. Hiệu quả nhận diện hành vi bất thường và khả năng hạn chế chặn nhầm vẫn cần được đánh giá trong quá trình triển khai thực tế. Thiết kế Nvidia công bố tập trung vào việc giới hạn quyền từ trước, đồng thời dùng cơ chế giám sát và cách ly độc lập với môi trường chạy của tác nhân khi phát hiện hành vi vượt quyền.