Zum Inhalt springen
AI Agent Security
Kontakt
Menü

29.03.2026

Aktualisiert 27.07.2026

Best Practice

Prompt Hardening für KI-Agenten

Rolle, Grenzen und Tool-Regeln so formulieren, dass fremde Inhalte den Auftrag eines KI-Agenten nicht unbemerkt verändern.

Illustration zu Prompt Hardening für KI-Agenten

Worum es geht

Ein gehärteter Prompt definiert Auftrag, Prioritäten, Grenzen und Eskalationswege eindeutig. Fremde Inhalte dürfen Fakten beitragen, aber weder die Rolle des Agenten noch seine Rechte oder Tool-Regeln verändern.

Der Kontrollpfad

Von der Mission zur Aktion
1

Mission setzen

Rolle und erlaubten Scope festlegen

2

Kontext trennen

Regeln und Fremddaten klar kennzeichnen

3

Konflikt prüfen

Abweichen, ablehnen oder eskalieren

4

Aktion begrenzen

Tool-Regeln technisch durchsetzen

Mögliche Folgen

Stabiler Auftrag

Klare Eskalation

Begrenzte Wirkung

Prompt Hardening senkt die Wahrscheinlichkeit einer Fehlsteuerung. Es ist keine belastbare Autorisierungsgrenze.

Die drei wichtigsten Maßnahmen

Priorisierte Umsetzung
Schutzschicht 1
Auftrag präzisieren

Rolle, Ziel, erlaubte Aufgaben, harte Verbote und Abbruchkriterien kurz und widerspruchsfrei definieren.

Schutzschicht 2
Autorität sichtbar machen

Systemregeln, Nutzerauftrag, RAG-Inhalte und Tool-Ausgaben in getrennten Feldern mit klarer Vertrauensstufe führen.

Schutzschicht 3
Grenzen durchsetzen

Tool-Allowlist, Schemas, Freigaben und Least Privilege außerhalb des Modells erzwingen.

Manipulative Inhalte können das Modell irritieren, aber weder neue Befugnisse noch ungeprüfte Seiteneffekte erzeugen.

Drei Umsetzungsmuster

Dokumente als Daten markieren

RAG
Quelle
Datenblock
Antwort

Retrieved Content bleibt zitierbare Evidenz und erhält keine Instruktionsautorität.

Scope und Verbote festlegen

Coding Agent
Auftrag
Repo-Scope
Änderung

Shell, Netzwerk und produktive Änderungen sind explizit begrenzt oder freigabepflichtig.

Konflikte eskalieren

Browser & E-Mail
Fremdinhalt
Konflikt
Freigabe

Versteckte Handlungsanweisungen lösen keine Kommunikation oder Datenfreigabe aus.

Minimalstandard und Tests

Minimalstandard

  • Rolle, Scope, Verbote und Eskalationswege sind eindeutig dokumentiert.
  • Regeln, Nutzereingaben und Fremdinhalte sind strukturell getrennt.
  • Externe Inhalte sind ausdrücklich als nicht vertrauenswürdige Daten markiert.
  • Riskante Aktionen benötigen technische Policy-Prüfung oder Freigabe.
  • Prompts sind versioniert, reviewed und einer Laufzeit zuordenbar.
  • Regressionstests prüfen direkte und indirekte Manipulationsversuche.

Testfälle müssen mindestens Zielüberschreibung, Rollenwechsel, verschachtelte Instruktionen, manipulierte RAG- und Tool-Inhalte sowie Versuche auf Tool- oder Datenzugriff abdecken.

Quellen