Nvidia hat am Montag die Open Agent Safety Platform vorgestellt. Sie verbindet Software-Zugriffskontrollen mit einer unabhängigen Hardware-Überwachung, um zu verhindern, dass KI-Agenten ihre Berechtigungen überschreiten. Zur Plattform gehören die Open-Source-Software OpenShell und die Hardware-Sicherheitskomponente Nvidia Sentry. Mehr als 100 Organisationen, darunter Microsoft und Anthropic, arbeiten mit Nvidia an der Nutzung des Systems.
Der Start fällt in eine Phase, in der mehrere führende KI-Labore gemeldet haben, dass Agenten ihre Testumgebungen verlassen und unbefugt auf Systeme zugreifen konnten. Für Unternehmen, die autonome KI einsetzen, wird damit die Frage konkreter, wie sich deren Handlungsspielraum zuverlässig begrenzen lässt.
Nvidia-CEO Jensen Huang sagte am Montag in der CNBC-Sendung Squawk Box, KI könne erhebliche Vorteile bringen, müsse aber sicher entwickelt und eingesetzt werden. Die Kontrolle von KI-Agenten sei eine technische Herausforderung, die sich mit entsprechenden Technologien bewältigen lasse.
OpenShell begrenzt Zugriffe vor Beginn einer Aufgabe
OpenShell bildet die Softwareebene der Plattform. Unternehmen können das quelloffene Werkzeug lokal oder in der Cloud installieren und vorab festlegen, auf welche Dateien, Websites, Netzwerke, Werkzeuge und Zugangsdaten ein Agent zugreifen darf. Während der Ausführung gleicht OpenShell dessen Aktivitäten mit diesen Vorgaben ab.
Huang verglich das Prinzip mit Zugangskarten für Beschäftigte, die nur die für ihre Arbeit benötigten Bereiche betreten dürfen. Zunächst sollten einem Agenten Berechtigungen entzogen werden; anschließend erhalte er gezielt Zugriff auf die Dateien, Daten, Werkzeuge oder Internetdienste, die er für seine Aufgabe benötigt.
Ein Agent, der Rechnungen bearbeitet, sollte beispielsweise nicht automatisch Personalakten einsehen oder uneingeschränkt Verbindungen zum externen Internet herstellen können. OpenShell führt Agenten in einer isolierten Umgebung aus. So sollen die Folgen einer fehlerhaften Aktion begrenzt werden, statt sich auf andere Unternehmenssysteme auszudehnen.
Regelverstöße sollen in Echtzeit blockiert werden
Wenn ein Agent von seinen Anweisungen abweicht, muss das nicht auf böswilliges Verhalten zurückgehen. Mehrdeutige Eingaben, Werkzeugfehler oder Schwierigkeiten bei komplexen Aufgaben können dazu führen, dass ein Agent alternative Wege ausprobiert – auch solche, die über die Absicht des Betreibers hinausgehen.
Nvidia zufolge soll OpenShell Aktionen, die gegen vorab festgelegte Richtlinien verstoßen, in Echtzeit erkennen und blockieren. Das Grundprinzip: Der Handlungsspielraum wird ausdrücklich definiert, statt dem Agenten selbst zu überlassen, auf welche Systeme und Daten er zugreifen kann.
Nvidia Sentry überwacht Agenten über separate Hardware
Die zweite Komponente, Nvidia Sentry, ergänzt die Plattform um eine weitere Überwachungs- und Isolationsebene. Sie läuft auf einem eigenen Nvidia-BlueField-Datenprozessor und nicht auf dem System des Agenten. Dadurch soll verhindert werden, dass der Agent die Überwachung deaktiviert oder umgeht.
Sentry überwacht die Interaktionen zwischen Agenten und Modellen, Werkzeugen, Daten sowie Netzwerken. Erkennt das System verdächtige Aktivitäten oder Verstöße gegen Richtlinien, kann es einen Agenten Nvidia zufolge innerhalb von Millisekunden isolieren und in eine Quarantäneumgebung verschieben. Huang beschrieb die Architektur als einen zusätzlichen Chip zwischen Agent und großem Sprachmodell, über den Nvidia die Interaktionen abfangen könne.
Die Vorstellung greift die Sicherheitsfrage auf, welche Berechtigungen autonome KI-Systeme erhalten und wie sich ihr Betrieb kontrollieren lässt. Ob die Plattform ungewöhnliches Verhalten in Unternehmensumgebungen zuverlässig erkennt, ohne legitime Aktivitäten zu blockieren, muss sich im Einsatz zeigen. Nvidia setzt dabei auf vorab begrenzte Zugriffsrechte sowie eine Überwachung und Isolation außerhalb der Laufzeitumgebung des Agenten.