29.03.2026
Aktualisiert 27.07.2026
Best Practice
Prompt Hardening für KI-Agenten
Rolle, Grenzen und Tool-Regeln so formulieren, dass fremde Inhalte den Auftrag eines KI-Agenten nicht unbemerkt verändern.
Worum es geht
Ein gehärteter Prompt definiert Auftrag, Prioritäten, Grenzen und Eskalationswege eindeutig. Fremde Inhalte dürfen Fakten beitragen, aber weder die Rolle des Agenten noch seine Rechte oder Tool-Regeln verändern.
Der Kontrollpfad
Mission setzen
Rolle und erlaubten Scope festlegen
Kontext trennen
Regeln und Fremddaten klar kennzeichnen
Konflikt prüfen
Abweichen, ablehnen oder eskalieren
Aktion begrenzen
Tool-Regeln technisch durchsetzen
Mögliche Folgen
Stabiler Auftrag
Klare Eskalation
Begrenzte Wirkung
Prompt Hardening senkt die Wahrscheinlichkeit einer Fehlsteuerung. Es ist keine belastbare Autorisierungsgrenze.
Die drei wichtigsten Maßnahmen
Rolle, Ziel, erlaubte Aufgaben, harte Verbote und Abbruchkriterien kurz und widerspruchsfrei definieren.
Systemregeln, Nutzerauftrag, RAG-Inhalte und Tool-Ausgaben in getrennten Feldern mit klarer Vertrauensstufe führen.
Tool-Allowlist, Schemas, Freigaben und Least Privilege außerhalb des Modells erzwingen.
Manipulative Inhalte können das Modell irritieren, aber weder neue Befugnisse noch ungeprüfte Seiteneffekte erzeugen.
Drei Umsetzungsmuster
Dokumente als Daten markieren
RAGRetrieved Content bleibt zitierbare Evidenz und erhält keine Instruktionsautorität.
Scope und Verbote festlegen
Coding AgentShell, Netzwerk und produktive Änderungen sind explizit begrenzt oder freigabepflichtig.
Konflikte eskalieren
Browser & E-MailVersteckte Handlungsanweisungen lösen keine Kommunikation oder Datenfreigabe aus.
Minimalstandard und Tests
Minimalstandard
- Rolle, Scope, Verbote und Eskalationswege sind eindeutig dokumentiert.
- Regeln, Nutzereingaben und Fremdinhalte sind strukturell getrennt.
- Externe Inhalte sind ausdrücklich als nicht vertrauenswürdige Daten markiert.
- Riskante Aktionen benötigen technische Policy-Prüfung oder Freigabe.
- Prompts sind versioniert, reviewed und einer Laufzeit zuordenbar.
- Regressionstests prüfen direkte und indirekte Manipulationsversuche.
Testfälle müssen mindestens Zielüberschreibung, Rollenwechsel, verschachtelte Instruktionen, manipulierte RAG- und Tool-Inhalte sowie Versuche auf Tool- oder Datenzugriff abdecken.
Quellen
Vorherige Best Practice
Output Validation und Guardrails für KI-Agenten
Nächste Best Practice
Prompt Validation für KI-Agenten