NVIDIA hat am 21. August 2026 eine technische Architektur veröffentlicht, die durchsetzbare Sicherheit für KI-Agenten in Laufzeit und Infrastruktur unterhalb des Agenten-Harness verortet. Die Kernaussage ist praktisch: Prompts und Harness-Regeln können beeinflussen, was ein Agent versucht. Nur eine externe Kontrollschicht kann jedoch bestimmen, was er tatsächlich tun darf.
Dies ist die Position von NVIDIA, kein neuer Standard und keine unabhängig validierte Sicherheitsgarantie. AI Understanding beschreibt den Vorschlag in einem separaten Bericht und weist ausdrücklich auf die fehlende unabhängige Validierung hin. Für Plattform- und Sicherheitsteams liefert die Veröffentlichung vor allem eine klarere Trennung zwischen Verhaltenssteuerung und durchsetzbarer Autorität.
Was die Sicherheitsarchitektur von NVIDIA vorschlägt
NVIDIA beschreibt einen Agenten-Stack aus Modell, Agenten-Harness, Orchestrierung, sicherer Laufzeit und Inferenzinfrastruktur. Modell und Harness liegen oberhalb einer Sicherheitsgrenze. Identität, Richtlinie, Zugangsdaten, Isolation und Audit liegen darunter.
Jede Anfrage mit externer Wirkung soll diese Grenze passieren. Dazu gehören Dateioperationen, Prozesse, Netzwerkanfragen, API-Aufrufe, Datenänderungen, Kommunikation und Ressourcenzuweisung. Komponenten oberhalb der Grenze dürfen sich selbst keine Autorität erteilen und die Entscheidung nicht umgehen können.
NVIDIA schlägt außerdem vier Arbeitsprofile vor:
| Profil | Typischer Einsatz | Schwerpunkt der Kontrolle |
|---|---|---|
| Isoliert | Vorproduktion mit entbehrlichen Daten | Keine Produktivzugänge, eingeschränktes Netz, Sitzungsaufzeichnung |
| Verbunden | Vorproduktion mit genehmigten Diensten | Kurzlebige Identität, maskierte Daten, Limits, vollständige Protokolle |
| Produktion | Änderungen an Systemen oder Geschäftsdaten | Aufgabenbezogener Zugriff, unabhängige Prüfungen, menschliche Prüfung bei hoher Auswirkung |
| Adversarial | Red-Team-Tests oder Prüfungen mit reduzierten Schutzmaßnahmen | Standardmäßig gesperrte Kommunikation, Quarantäne, stärkste Isolation |
Diese Profile sind Empfehlungen von NVIDIA. Sie beweisen nicht, dass NVIDIA OpenShell oder eine andere Implementierung jeden Agenten vollständig eindämmt oder jeden Fehler verhindert.
Warum Kontrollen im Harness nicht ausreichen
Ein Agenten-Harness steuert Arbeitszyklus, Werkzeuge, Kontext und Speicher. Er kann eine Anfrage ablehnen, eine Bestätigung verlangen oder das Modell zu einem sichereren Plan führen. Diese Kontrollen sind wertvoll. Der Harness ist jedoch ebenfalls Software, die verändert, falsch konfiguriert oder durch nicht vertrauenswürdige Eingaben beeinflusst werden kann.
NVIDIA nennt wiederkehrende Probleme wie langlebige Zugangsdaten, nicht vertrauenswürdige Dokumente als scheinbare Anweisungen, ungeprüfte externe Wirkungen und unvollständige Audit-Nachweise. Prompt Injection kann diese Schwächen ausnutzen, wenn derselbe Agent Inhalte interpretiert und entscheidet, ob die daraus folgende Aktion autorisiert ist.
Die Autorisierung sollte deshalb außerhalb dieses Pfads liegen. Eine Laufzeit kann eine Anfrage an eine Identität binden, eine Richtlinie auswerten, engen Zugriff erteilen und das Ergebnis protokollieren. Risikosignale dürfen Autorität reduzieren, aber nicht erweitern. Maetras Leitfaden zu Prompt-Injection-Kontrollen für KI-Agenten erklärt, warum Inhaltsprüfung und deterministische Aktionskontrolle unterschiedliche Teile des Problems lösen.
Sechs Prüfungen für Teams mit werkzeugnutzenden Agenten
Sicherheits- und Plattformverantwortliche können die Architektur als Prüfliste verwenden:
- Alle Wirkungspfade erfassen. Listen Sie Werkzeuge, APIs, Dateien, Netze, Identitäten, Datenspeicher sowie physische oder finanzielle Aktionen auf.
- Den verbindlichen Richtlinienpunkt bestimmen. Finden Sie die Komponente, die endgültig erlaubt, blockiert oder eine Prüfung verlangt. Bestätigen Sie, dass der Agent sie nicht verändern oder umgehen kann.
- Dauerhafte Autorität reduzieren. Ersetzen Sie breite, langlebige Zugangsdaten durch aufgabenbezogenen, kurzlebigen Zugriff, sofern die Plattform dies unterstützt.
- Steuerung und Durchsetzung trennen. Behalten Sie Prompts und Harness-Regeln bei, behandeln Sie diese aber nicht als letzte Sicherheitsgrenze.
- Fehler und Wiederherstellung testen. Prüfen Sie Prompt Injection, Werkzeugmissbrauch, Netzzugriff, Zugangsdaten, Delegation, Widerruf und unklare externe Ergebnisse.
- Entscheidungsnachweise aufbewahren. Erfassen Sie Identität, Richtlinienversion, angeforderte Aktion, Entscheidung, gegebenenfalls Prüfer, Ausführungsergebnis und Abgleichstatus. Der Leitfaden für KI-Audit-Protokolle bietet dafür eine Struktur.
Die Prüfung muss auch indirekte Pfade erfassen. Kann ein genehmigtes Werkzeug neue Zugangsdaten erstellen, Rechenleistung starten, Software installieren oder an einen anderen Agenten delegieren, ist die tatsächliche Autorität größer, als der Werkzeugname vermuten lässt.
Was unsicher bleibt
Der NVIDIA-Beitrag ist eine Architekturposition auf Grundlage der Arbeit mit OpenShell, Entwicklern, Open-Source-Projekten und Partnern. Er enthält keinen Vergleichstest, der eine Überlegenheit gegenüber anderen Sicherheitsdesigns belegt. Produktspezifisches Verhalten, Cloud-Berechtigungen, Netzwerkkontrollen und Vorfallreaktion müssen weiterhin geprüft werden.
Auch Infrastrukturkontrollen können versagen, wenn eine Richtlinie falsch ist, ein Wirkungspfad fehlt, eine Identität zu viele Rechte besitzt oder ein externes System ein unklares Ergebnis liefert. Menschliche Prüfung ist bei manchen folgenkritischen Aktionen sinnvoll. Sie sollte von Richtlinie und Auswirkung abhängen und nicht jede Aktion pauschal betreffen.
Maetra-Analyse: Autorität vor Autonomie festlegen
Die wichtigste Lehre lautet nicht, dass jedes Team dieselbe Laufzeit braucht. Entscheidend ist eine sichtbare Autoritätsgrenze, bevor ein Agent mehr Werkzeuge oder einen längeren Arbeitszeitraum erhält.
Beginnen Sie mit einem folgenkritischen Ablauf. Erfassen Sie Aufgabe, vorgeschlagene Aktion, betroffenes System, Zugangsdaten, Richtlinienentscheidung, beabsichtigte Wirkung und Nachweis. Testen Sie dann, ob ein Pfad die Wirkung erreicht, ohne den Kontrollpunkt zu passieren. Mit Maetra Secure können Teams verdächtige Prompts und Werkzeugaufrufe prüfen, während die endgültige Autorisierung in einer durchsetzbaren Richtlinienschicht bleibt.
Quellen
- NVIDIA: Where Security Fits in an AI Agent Stack, veröffentlicht am 21. August 2026.
- AI Understanding: NVIDIA says AI-agent security should sit below the harness, veröffentlicht am 21. August 2026.