Wie ein inaktiver Agent 50 Millionen Token pro Tag verbrannte – und wie man das behebt

Ein OpenClaw-Nutzer auf Reddit berichtete, dass die LLM-API-Nutzung innerhalb von sechs Tagen von 11M auf 51M Token pro Tag anstieg – insgesamt 196M Token, die größtenteils von einem inaktiven Agenten verschwendet wurden. Die Ursache: Ein vergessener Agent namens "main" wurde alle 30 Minuten von OpenClaws Heartbeat angestoßen, der einen 225k-Token-Sitzungsverlauf lud, nur um "HEARTBEAT_OK" zu antworten.
Das Leck: cacheRead-Dominanz
Zwei Zahlen stachen aus der Transkriptanalyse hervor:
- 95 % der Tokens waren cacheRead – das Modell las alten Gesprächsverlauf erneut, anstatt neue Arbeit zu leisten.
- 56 % aller Tokens stammten von einem einzigen Agenten namens "main", der gar nicht mehr verwendet wurde.
Der Heartbeat lief 48 Mal täglich und lud jedes Mal eine monatealte Sitzung. Sogar eine leere HEARTBEAT.md – die den Heartbeat deaktivieren sollte – konnte ihn in dieser Version nicht stoppen.
Die Lösung: Zwei Schritte
- Die aufgeblähte Sitzung löschen. Die Sitzungsdatei des inaktiven Agenten entfernen. Der nächste Heartbeat startet mit einer leeren Sitzung. Nur unnötige Sitzungen löschen, echte DM-/Chat-Sitzungen behalten.
- Wiederbefüllung verhindern. Eine einmalige Löschung reicht nicht, da der Heartbeat die Sitzung weiterhin füllt. Konfigurationsänderungen vornehmen:
- Setze
heartbeat every: "0m", um den Heartbeat komplett zu deaktivieren, falls der Agent nichts tut, oder - Setze
isolatedSession: trueundlightContext: true, damit jeder Heartbeat mit einem frischen, winzigen Kontext (~2-5k Tokens) statt des vollen Verlaufs (~100k+) läuft.
- Setze
Bonus: Andere Agenten nutzten eine ständig wachsende Sitzung, weil eine Sitzungs-ID in dieser Version nicht wirklich neu startete. Setze die Sitzung zwischen Aufgaben zurück, um jeden Durchlauf sauber zu halten.
Erkenntnisse
- Inaktive Agenten sind nicht kostenlos – ein Heartbeat auf einer fetten Sitzung kann mehr kosten als echte Arbeit.
- Wenn die meisten Tokens
cacheReadsind, bezahlst du für das erneute Lesen des Verlaufs, nicht für neue Arbeit. - Überprüfe, ob "aus" wirklich aus ist – eine leere
HEARTBEAT.mdstoppte den Heartbeat in der gemeldeten Version nicht. - Lies die Transkripte pro Durchlauf; der Token-Verbrauch wird dort pro Input/Output/cacheRead aufgezeichnet.
Der Nutzer reduzierte seinen Token-Verbrauch mit diesen Konfigurationsänderungen um mehr als die Hälfte.
📖 Lies die vollständige Quelle: r/openclaw
👀 Siehe auch

Java-Leistungsoptimierung: Acht Anti-Patterns, die Ihren Code verlangsamen
Eine Java-Bestellverarbeitungs-App verbesserte sich von 1.198 ms auf 239 ms Laufzeit, von 85.000 auf 419.000 Bestellungen pro Sekunde und von 1 GB auf 139 MB Heap-Verbrauch, indem acht häufige Anti-Patterns behoben wurden, die durch Java Flight Recording Profiling identifiziert wurden.

Einrichtung von Qwen3.5-27B lokal: Vergleich zwischen vLLM und llama.cpp
Ein Reddit-Nutzer teilt praktische Tipps zum lokalen Betrieb von Qwen3.5-27B, vergleicht llama.cpp- und vLLM-Backends mit spezifischen Konfigurationsempfehlungen und Benchmark-Ergebnissen.

Claude-Code-Struktur, die mehrere reale Projekte überstanden hat
Ein Entwickler teilt ein Claude Code-Setup, das sich bei 2-3 realen Projekten mit mehreren Skills, MCP-Servern und Agents bewährt hat. Zu den wichtigsten Erkenntnissen gehören die Verwendung von CLAUDE MD für Konsistenz, das Aufteilen von Skills nach Zweck, die Implementierung von Hooks und die Begrenzung der Kontextnutzung auf unter 60 %.

Zwei Telegram-Bots in einer Gruppe verbinden: Zustellungssemantik über HTTP
Ein Entwickler teilt einen praktischen Ansatz, um zwei unabhängige Telegram-Bots im selben Gruppenchat zu verbinden. Dabei werden die Lücken bei der Bot-zu-Bot-Zustellung von Telegram mit HTTP-Relays, ACKs, Deduplizierung und streng begrenzten Feeds überbrückt.