40M Tokens in einer Stunde: Nutzer berichtet von außer Kontrolle geratenen Subagenten mit OpenClaw

Ein Reddit-Nutzer auf r/openclaw berichtet, dass seine OpenClaw-Instanz 40 Millionen Tokens in einer Stunde verbraucht hat, nachdem Subagenten außer Kontrolle gerieten. Der Nutzer verwendete OpenRouter mit DeepSeek Flash und einem täglichen Budget, aber die Subagenten verbrannten das gesamte Budget, bevor er bemerkte, was geschah.
Was passiert ist
Der Nutzer gab eine einzige Anweisung, um ein Deployment-Problem zu beheben. Statt einer gezielten Lösung gerieten die Subagenten von OpenClaw in eine Rückkopplungsschleife, riefen rekursiv weitere Subagenten auf und verbrauchten Tokens in alarmierendem Tempo. Als das tägliche Budget erschöpft war, waren bereits 40M Tokens verbraucht – was die erwarteten Kosten des Nutzers um ein Vielfaches überstieg.
Setup des Nutzers
- Anbieter: OpenRouter
- Modell: DeepSeek Flash (wahrscheinlich DeepSeek V2 oder ähnlich)
- Budget: Tageslimit (unbekannte Höhe)
- Agentenkonfiguration: Standard- oder nahezu Standard-Einstellungen für die Erstellung von Subagenten
Warum es passiert ist
OpenClaws Agentenarchitektur kann Subagenten zur Bearbeitung von Teilaufgaben erstellen. In diesem Fall gerieten die Subagenten offenbar in eine Endlosschleife oder ein Überdelegationsmuster. Da es keine Ratenbegrenzung oder Ausgabenobergrenze für Tokens pro Sitzung gab, lief der Agent ungebremst. Der Nutzer entdeckte das Problem erst nachträglich, weil das Budget ausgeschöpft war.
Was der Nutzer möchte
Er sucht nach: besseren Schutzmaßnahmen, um die Vermehrung von Subagenten zu verhindern, Token-Limits pro Subagent, Ratenbegrenzungen, um den Tokenverbrauch pro Minute oder Aufgabe zu deckeln, und Echtzeitwarnungen bei Ausgabenspitzen. Er fragte die Community auch nach Tools oder Tricks, um unerwartete Kosten zu managen.
Lehren für OpenClaw-Nutzer
- Setzen Sie konservative Tagesbudgets und überwachen Sie den Tokenverbrauch nach Möglichkeit in Echtzeit.
- Erwägen Sie die Verwendung von Modellen mit niedrigeren Tokenkosten für Debug-Aufgaben – DeepSeek Flash ist günstig, kann aber dennoch eskalieren.
- Aktivieren Sie Ratenbegrenzung oder Beschränkungen der Agenten-Rekursionstiefe, falls verfügbar.
- Testen Sie das Agentenverhalten an einer kleinen Aufgabe, bevor Sie ihn unbeaufsichtigt laufen lassen.
Wenn Sie ähnliche Probleme erlebt haben oder Lösungen zur Kontrolle der OpenClaw-Subagentenkosten kennen, finden Sie im Originalthread auf r/openclaw eine aktive Diskussion.
📖 Vollständige Quelle lesen: r/openclaw
👀 Siehe auch

OpenClaw 5.4 fügt /steer- und /side-Befehle hinzu: Agent während der Aufgabe umleiten, ohne Kontext zu verlieren
OpenClaw 5.4 führt die Befehle /steer und /side ein, mit denen Sie die aktuelle Aufgabenrichtung eines Agenten umleiten oder eine Nebensächlichkeit beginnen können, ohne den Sitzungskontext zu verlieren.

Entwicklerperspektiven zu KI-Angst und 'KI-Psychose'
Eine Reddit-Diskussion offenbart weit verbreitete Ängste unter Entwicklern, die KI-Tools nutzen, wobei verschiedene Altersgruppen unterschiedliche Belastungen erfahren: Die 35- bis 45-Jährigen spüren einen ständigen Druck zur Neuerfindung, die 25- bis 35-Jährigen fürchten, dass ihre Fähigkeiten veralten, und Entwickler unter 25 Jahren laufen trotz KI-Kenntnissen Gefahr, auszubrennen.

Der IDP-Leaderboard-Benchmark zeigt, dass Claude Sonnet 4.6 bei Dokumenten-KI-Aufgaben mit Opus 4.6 gleichzieht.
Das IDP-Leaderboard testete 16 KI-Modelle an über 9.000 Dokumenten in den Bereichen OCR, Tabellenextraktion, Schlüsselextraktion, visuelle Fragenbeantwortung, Handschrift und lange Dokumente. Claude Sonnet 4.6 erzielte insgesamt 80,8 Punkte und lag damit im Wesentlichen gleichauf mit Opus 4.6 bei 80,3, während Haiku 4.5 auf 69,6 Punkte kam.

RTX 5000 PRO 48GB liefert 4400 Tok/s Präzisions-Caching für Qwen3.6-27B
Ein PC-Neuling berichtet von 4400 tok/s Promptverarbeitung und 80 tok/s Generierung mit Qwen3.6-27B-FP8 und vollpräzisem KV-Cache auf einer einzelnen RTX 5000 Pro 48GB, unter Verwendung von vLLM und Claude Code.