31.03.2026
Aktualisiert 27.07.2026
Best Practice
Budget Control für KI-Agenten
Harte Limits für Tokens, Tool-Aufrufe, Laufzeit und Kosten stoppen Agentenschleifen, Denial of Wallet und unkontrollierten Ressourcenverbrauch.
Worum es geht
Budget Control begrenzt den Ressourcenverbrauch eines Agenten über den gesamten Lauf: Tokens, Modellaufrufe, Tool-Schritte, Zeit, Parallelität und Geld. Die Grenzen werden zentral erzwungen und dürfen nicht vom Modell selbst abhängen.
Der Kontrollpfad
Risiko bewerten
Workflow und Mandant klassifizieren
Budget zuweisen
Kosten, Zeit und Schritte festlegen
Verbrauch messen
Gesamte Kette zentral bilanzieren
Grenze erzwingen
Drosseln, degradieren oder stoppen
Mögliche Folgen
Ergebnis im Budget
Degradierter Modus
Sicherer Abbruch
Ein Kostenalarm nach dem Lauf ist keine Kontrolle. Wirksam sind atomare Zähler und harte Schranken vor dem nächsten teuren Schritt.
Die drei wichtigsten Maßnahmen
Begrenze Tokens, Requests, Tool-Aufrufe, Laufzeit, Parallelität und Geld pro Lauf, Nutzer und Mandant.
Zähle auch Retries, Subagenten und verschachtelte Tools in einem gemeinsamen, atomar aktualisierten Budget.
Wechsle auf kleinere Modelle, kürzere Kontexte oder einen Teilabschluss, bevor der Lauf kontrolliert endet.
Fehlpfade verbrauchen nur einen begrenzten Anteil der verfügbaren Ressourcen und enden nachvollziehbar.
Drei Umsetzungsmuster
Schrittbudget für Web und RAG
RechercheSuchläufe, Dokumentabrufe und Kontextgröße teilen sich ein Gesamtbudget; bei Knappheit entsteht eine belegte Teilantwort.
Budget vererben
Multi-AgentDelegierte Agenten erhalten Teilbudgets statt eigener unbeschränkter Quoten.
Schleifen hart stoppen
ToolsWiederholte Fehler und identische Calls lösen Backoff, Circuit Breaker und schließlich den sicheren Abbruch aus.
Minimalstandard und Tests
Budgetgrenzen müssen auch bei Parallelität und Ausfällen konsistent bleiben. Der Abbruch bewahrt Status und hinterlässt keine halbfertigen Seiteneffekte.
Minimalstandard
- Tokens, Laufzeit, Modell- und Tool-Aufrufe haben harte Obergrenzen.
- Budgets gelten pro Lauf, Nutzer und Mandant sowie global.
- Retries, Subagenten und parallele Schritte werden vollständig zugerechnet.
- Warnschwellen, Drosselung und Abbruch sind technisch getrennt.
- Budgeterschöpfung erzeugt einen sicheren, verständlichen Endzustand.
- Verbrauch, Abbruchgrund und verbleibendes Budget sind beobachtbar.
Testfälle müssen mindestens abdecken:
- Endlosschleifen, wiederholte Tool-Fehler und Retry-Stürme
- parallele Läufe und atomare Quotenüberschreitung
- verschachtelte Agenten und Umgehung über neue Sessions
- Abbruch während schreibender oder externer Aktionen
Quellen
Vorherige Best Practice
AI Sandboxing für sichere Agentenausführung
Nächste Best Practice
Context-aware Authentication für KI-Agenten