29.03.2026
Aktualisiert 27.07.2026
Best Practice
Output Validation und Guardrails für KI-Agenten
Modellausgaben werden vor Anzeige, Speicherung oder Ausführung gegen Schema, Policy, Daten- und Aktionsgrenzen geprüft.
Worum es geht
Eine Modellausgabe ist zunächst nur ein Vorschlag. Vor Anzeige, Speicherung oder Side Effect muss eine deterministische Kontrollschicht Struktur, Inhalt, Ziel und erlaubte Wirkung prüfen.
Der Kontrollpfad
Kandidat erzeugen
Enges strukturiertes Schema
Struktur prüfen
Typen, Felder und Werte validieren
Wirkung prüfen
Ziel, Daten und Policy autorisieren
Kontrolliert nutzen
Anzeigen, speichern oder ausführen
Mögliche Folgen
Freigegeben
Bereinigt
Blockiert
Anzeige, Speicherung und Ausführung brauchen eigene Regeln: Ein sicherer UI-Text kann für Memory oder Shell ungeeignet sein.
Die drei wichtigsten Maßnahmen
Pflichtfelder, Typen, Enums und verbotene Zusatzfelder prüfen; Parse-Fehler fail closed behandeln.
Tool, Ziel, Empfänger, Datenmenge und Aktionsklasse serverseitig gegen den aktuellen Scope prüfen.
Externe, irreversible oder sensitive Aktionen blockieren, bereinigen oder bewusst freigeben lassen.
Manipulierter oder fehlerhafter Output kann nicht ungeprüft zu realer Wirkung werden.
Drei Umsetzungsmuster
Aufrufe vollständig prüfen
ToolsName, Parameter, Zielressource und Datenumfang müssen gemeinsam erlaubt sein.
Empfänger und Inhalte trennen
KommunikationGuardrails prüfen Empfänger, Secrets und PII; externer Versand erhält eine eigene Freigabe.
Artefakt vor Ausführung isolieren
CodeGenerierter Code wird statisch geprüft und in einer begrenzten Umgebung ausgeführt, nie direkt aus Freitext.
Minimalstandard und Tests
Minimalstandard
- Alle Outputs mit Anzeige-, Speicher- oder Ausführungswirkung sind inventarisiert.
- Strukturierte Ausgaben nutzen enge Schemas ohne unbekannte Zusatzfelder.
- Tool, Ziel, Parameter, Empfänger und Datenumfang werden serverseitig geprüft.
- UI, Memory, Logs und Execution besitzen getrennte Regeln.
- Parse-Fehler und unbekannte Varianten werden fail closed behandelt.
- Blocks, Bereinigungen und Freigaben sind mit Regelversion protokolliert.
Tests müssen Schema-Bypässe, Zusatzfelder, Zielwechsel, Datenexfiltration, Encoding, abgeschnittene Antworten, gefährliche Artefakte und Approval-Umgehung abdecken.
Quellen
Vorherige Best Practice
Multi-Agent Security für sichere KI-Agenten-Orchestrierung
Nächste Best Practice
Prompt Hardening für KI-Agenten