Wie ein /loop-Befehl über Nacht 6.000 Dollar in der Claude-API verbrannte

Ein Reddit-Nutzer berichtete, dass er aufwachte und feststellte, dass sein Claude-Nutzungslimit ausgeschöpft war, nachdem ein einzelner Befehl /loop 30m check my PRs 46 Mal in 26 Stunden unbeaufsichtigt auf claude-opus-4-7 lief und dabei rund 6.000 $ verbrauchte. Die Ursache: Prompt-Caching in Kombination mit einer langlebigen Sitzung.
Hier die technische Aufschlüsselung:
- Kontextfenster wächst mit jeder Iteration: Jeder API-Aufruf sendet den gesamten Gesprächsverlauf. Runde 1 mag ein paar hundert Token sein; Runde 46 sendet 800.000 Token. Sie bezahlen für alles, was in jeder Runde gesendet wird.
- Prompt-Caching läuft nach ~5 Minuten ab: Anthropic cached den Gesprächsverlauf mit einem Rabatt von 12,5×, wenn er innerhalb des Cache-Fensters wiederverwendet wird. Aber bei
/loop 30müberschreitet die 30-minütige Pause die 5-minütige Cache-TTL. Jede Iteration zahlt den teuren Schreibpreis, um den gesamten wachsenden Kontext von Grund auf neu zwischenzuspeichern. - Ausgabe erhöht den Kontext: Jede Schleifeniteration hängt ihre Ausgabe an das Gespräch an, was den nächsten Neucache noch größer macht. Nach 20 Stunden erreichte die Sitzung ~800.000 Token.
- Dashboard-Verzögerung versteckt den Schaden: Das Anthropic-Nutzungsdashboard hat eine mehrtägige Verzögerung bei der Berichterstattung. Das einzige Echtzeitsignal war die Benachrichtigungs-E-Mail zum Limit – zu diesem Zeitpunkt war das Geld bereits ausgegeben.
Die wichtigsten Empfehlungen des Nutzers, um dies zu vermeiden:
- Eine Stoppbedingung hinzufügen: Statt
/loop 30m check my PRsschreiben Sie/loop 30m check my PRs — stop when all are merged or after 3 hours. Claude beendet die Schleife, wenn die Bedingung erfüllt ist. - Sonnet für unbeaufsichtigte Aufgaben verwenden: Opus ist ~5× teurer pro Ausgabe-Token. Für Abfrageaufgaben wie PR-Checks ist Sonnet ausreichend. Reservieren Sie Opus für Sitzungen, bei denen Sie anwesend sind.
- Dem Dashboard nicht trauen: Es hinkt um Tage hinterher. Verlassen Sie sich für Echtzeit-Abrechnungssignale auf Nutzungslimit-E-Mails.
- Frische Sitzungen sind günstiger: Langlebige Sitzungen vervielfachen die Kosten, da jeder Aufruf mit einer Pause von >5 Minuten den vollen Kontext neu cachen muss. Eine neue Sitzung starten setzt den Kontext zurück und vermeidet dies.
max_turnsist kein Schleifenbegrenzer: Es begrenzt die Anzahl der Tool-Call-Ketten innerhalb einer einzelnen Iteration, nicht wie oft die Schleife feuert. Der einzige integrierte Ablauf von/loopist eine automatische Löschung nach 7 Tagen.
Die Schleife läuft im Hauptgespräch, sodass bei aktiver Sitzung jede Schleifenausführung weit mehr Token liest und schreibt als nötig – was die Kosten exponentiell vervielfacht.
Wenn Sie Claude mit /loop automatisieren, setzen Sie immer eine Stoppbedingung, verwenden Sie ein günstigeres Modell und überwachen Sie mit externen Tools. Der Cache-Rabatt hilft nur, wenn die Aufrufe häufig genug sind, um innerhalb der TTL zu bleiben.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Öffnen Sie Claw-Boot-Token um 43% durch Verschlankung von Tool- und Speicherdateien
Reduzierte Boot-Tokens von ~9.457 auf ~5.400 (43 % Rückgang), indem TOOLS.md in einen Index umgewandelt, Tool-Details in separate Dateien ausgelagert und ein gestaffeltes Memory-Promotion implementiert wurde.

Wenn OpenClaw noch Ihren nächsten Prompt benötigt, ist es noch nicht autonom – Ein Setup-Prompt für persistente Workflows
Behandle OpenClaw als Koordinator, nicht als Chat-Oberfläche. Nutze GOALS.md als gemeinsame Roadmap, ein Codex-Ziel nach dem anderen.

Agenten-Fähigkeiten: Stoppen Sie das Schreiben von SOPs, beginnen Sie mit dem Aufbau von Grenzsystemen
Ein Reddit-Beitrag argumentiert, dass das Hinzufügen von Fähigkeiten oder Tools zu einem KI-Agenten ihn fragiler macht. Die Lösung: minimales vollständiges Toolset, maximale Grenzklarheit.

Routing Agent Subtasks zu günstigeren Modellen senkte Kosten von $18 auf $4 bei gleicher Refaktorisierung
Ein Entwickler senkte die Kosten für Agentenläufe von 18 $ auf 4 $, indem er Routineaufgaben (Lint, Umbenennungen, Konfigurationsänderungen) an günstige Modelle wie DeepSeek V4 Pro und Tencent Hunyuan Hy3 weiterleitete und Opus 4.7 für komplexe Überlegungen reservierte.