Wie ein inaktiver Agent 50 Millionen Token pro Tag verbrannte – und wie man das behebt

✍️ OpenClawRadar📅 Veröffentlicht: 30. Juni 2026🔗 Source
Wie ein inaktiver Agent 50 Millionen Token pro Tag verbrannte – und wie man das behebt
Ad

Ein OpenClaw-Nutzer auf Reddit berichtete, dass die LLM-API-Nutzung innerhalb von sechs Tagen von 11M auf 51M Token pro Tag anstieg – insgesamt 196M Token, die größtenteils von einem inaktiven Agenten verschwendet wurden. Die Ursache: Ein vergessener Agent namens "main" wurde alle 30 Minuten von OpenClaws Heartbeat angestoßen, der einen 225k-Token-Sitzungsverlauf lud, nur um "HEARTBEAT_OK" zu antworten.

Das Leck: cacheRead-Dominanz

Zwei Zahlen stachen aus der Transkriptanalyse hervor:

  • 95 % der Tokens waren cacheRead – das Modell las alten Gesprächsverlauf erneut, anstatt neue Arbeit zu leisten.
  • 56 % aller Tokens stammten von einem einzigen Agenten namens "main", der gar nicht mehr verwendet wurde.

Der Heartbeat lief 48 Mal täglich und lud jedes Mal eine monatealte Sitzung. Sogar eine leere HEARTBEAT.md – die den Heartbeat deaktivieren sollte – konnte ihn in dieser Version nicht stoppen.

Ad

Die Lösung: Zwei Schritte

  1. Die aufgeblähte Sitzung löschen. Die Sitzungsdatei des inaktiven Agenten entfernen. Der nächste Heartbeat startet mit einer leeren Sitzung. Nur unnötige Sitzungen löschen, echte DM-/Chat-Sitzungen behalten.
  2. Wiederbefüllung verhindern. Eine einmalige Löschung reicht nicht, da der Heartbeat die Sitzung weiterhin füllt. Konfigurationsänderungen vornehmen:
    • Setze heartbeat every: "0m", um den Heartbeat komplett zu deaktivieren, falls der Agent nichts tut, oder
    • Setze isolatedSession: true und lightContext: true, damit jeder Heartbeat mit einem frischen, winzigen Kontext (~2-5k Tokens) statt des vollen Verlaufs (~100k+) läuft.

Bonus: Andere Agenten nutzten eine ständig wachsende Sitzung, weil eine Sitzungs-ID in dieser Version nicht wirklich neu startete. Setze die Sitzung zwischen Aufgaben zurück, um jeden Durchlauf sauber zu halten.

Erkenntnisse

  • Inaktive Agenten sind nicht kostenlos – ein Heartbeat auf einer fetten Sitzung kann mehr kosten als echte Arbeit.
  • Wenn die meisten Tokens cacheRead sind, bezahlst du für das erneute Lesen des Verlaufs, nicht für neue Arbeit.
  • Überprüfe, ob "aus" wirklich aus ist – eine leere HEARTBEAT.md stoppte den Heartbeat in der gemeldeten Version nicht.
  • Lies die Transkripte pro Durchlauf; der Token-Verbrauch wird dort pro Input/Output/cacheRead aufgezeichnet.

Der Nutzer reduzierte seinen Token-Verbrauch mit diesen Konfigurationsänderungen um mehr als die Hälfte.

📖 Lies die vollständige Quelle: r/openclaw

Ad

👀 Siehe auch

Behebung der KV-Cache-Invalidierung von Claude Code mit lokalen Backends
Anleitungen

Behebung der KV-Cache-Invalidierung von Claude Code mit lokalen Backends

Claude Code Versionen 2.1.36+ fügen dynamische Telemetrie-Header und Git-Status-Updates in jede Anfrage ein, was Präfix-Matching unterbricht und eine vollständige Neuverarbeitung von Systemprompts mit 20K+ Token auf lokalen Backends wie llama.cpp erzwingt. Eine Konfigurationskorrektur in ~/.claude/settings.json kann die Verarbeitungszeit von 60+ Sekunden auf etwa 4 Sekunden reduzieren.

OpenClawRadar
"CludeCode mit Webanwendungen für automatisierte Interaktion verbinden"
Anleitungen

"CludeCode mit Webanwendungen für automatisierte Interaktion verbinden"

Erforschen Sie, wie CludeCode verwendet werden kann, um automatisch mit Webanwendungen zu interagieren, indem KI-Tools wie Browser und Scraping-Hilfsprogramme genutzt werden.

OpenClawRadar
OpenClaw 4.1 mit Gemma 4 Stack: Hybride Architektur und Setup-Korrekturen
Anleitungen

OpenClaw 4.1 mit Gemma 4 Stack: Hybride Architektur und Setup-Korrekturen

Ein Reddit-Beitrag beschreibt einen optimierten lokalen Agenten-Stack, der OpenClaw 4.1 mit Googles Gemma-4-Modell kombiniert und eine hybride Architektur, spezifische Konfigurationskorrekturen für Ollama-Tool-Calling sowie Anpassungen des Kontextfensters umfasst.

OpenClawRadar
Praktische Workflow-Muster für zuverlässige KI-Codierung in Mehrdatei-Projekten
Anleitungen

Praktische Workflow-Muster für zuverlässige KI-Codierung in Mehrdatei-Projekten

Ein Reddit-Nutzer teilt vier spezifische Workflow-Verbesserungen, die die Zuverlässigkeit von KI-Codierung bei Projekten mit mehreren Dateien erhöht haben: spezifikationsbasierte Starts, Aufgabenzerlegung mit Kontrollpunkten, stabile Arbeitsabläufe und signalbasierte Überprüfungen.

OpenClawRadar