Mönch: Eine Fähigkeit, die die Erzählung des Agenten stumm schaltet, um Kontext und Tokens zu sparen

Ein Reddit-Benutzer hat monk entwickelt, eine Fähigkeit, die KI-Agenten leise arbeiten lässt – indem Erzählungen, Einleitungen, Nachworte und Fortschrittskommentare aus den Antworten entfernt werden und nur die Ergebnisse erhalten bleiben. Der Effekt ist eine geschätzte Reduzierung der Ausgabe-Token pro Runde um 54 % (47 % bei Code, 65 % bei Chat, 54 % bei Recherche) sowie kumulative Kontexteinsparungen, die mit der Sitzungslänge wachsen.
Wie es funktioniert
monk unterdrückt alle „Ich mache jetzt X…“-Erzählungen, Aufgabenlisten-Widgets und Statusmeldungen. Der Agent gibt nur die standardmäßigen Ergebnisse am Ende jedes Schrittes aus. Die Fähigkeit ist auf GitHub verfügbar: github.com/marpxxx/skillz/tree/main/monk.
Benchmark-Ergebnisse
Tests verwendeten 30 Aufgaben (10 pro Kategorie: Code, Chat, Recherche) mit approximierter Ausführlichkeit über den cl100k_base-Tokenizer von OpenAI. Die wichtigsten Zahlen:
- Einzelrunden-Ausgabeeinsparungen: Code 47 %, Chat 65 %, Recherche 54 %, Gesamt 54 %.
- Kontextkapazitätssteigerung (kumulativ): Bei ~20 Runden (typische Sitzung): +13 % (Code), +14 % (Chat), +20 % (Recherche). Bei 100 Runden: +29 % (Code), +36 % (Chat), +39 % (Recherche).
- API-Kosten (Claude Sonnet 4.6, Prompt-Caching): ~19 % Kostenersparnis bei einer 10-Runden-Sitzung.
Der Test zählte keine Token, die in Tool-Use-Widgets oder Statusmeldungen unterdrückt wurden, daher könnten die realen Einsparungen höher sein.
Einschränkungen
Die ausführlichen Beispiele sind KI-generierte Näherungswerte. Ein gut abgestimmter Basis-Agent könnte bereits knapper sein; ein ausführlicher mit erzählungsreichen Fähigkeiten könnte mehr produzieren. Der Tokenizer ist der cl100k_base von OpenAI, nicht der von Anthropic. Die Annahme eines 8k-System-Prompts ist konservativ (viele Setups haben 15–30k). Die Ergebnisse sind Richtwerte, keine Produktions-Benchmarks.
Für Entwickler, die die Echtzeit-Ausgabe des Agenten selten lesen, kann diese Fähigkeit Rauschen reduzieren und das Kontextfenster deutlich erweitern.
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Kostenloser macOS-Menüleisten-Monitor für Claude AI-Nutzungslimits
Ein kostenloses, quelloffenes macOS-Tool, das die Sitzungsnutzungsprozent, wöchentliche Limits und Reset-Countdowns von Claude AI direkt in Ihrer Menüleiste anzeigt. Installation mit einem einzigen Homebrew-Befehl und nutzt bestehende Chrome-Sitzungen, ohne Daten zu speichern.

Speck-gesteuerter Entwicklungsworkflow für Claude Code: Dekomposition, Kontextbereinigung und Kostenkontrolle
Ein spezifikationsgetriebener Entwicklungsansatz für Claude Code, der zweidimensionale Zerlegung, Kontextlöschung zwischen Schritten und auf Disk geschriebene Spezifikationen nutzt, um die Agentenleistung zu verbessern und Kosten zu senken.

OpenClaw-Plugin verbindet KI-Agenten mit dem Meshtastic-Funknetz für den netzunabhängigen Betrieb
Ein neues Open-Source-Plugin verbindet das OpenClaw-Framework mit dem LoRa-Funkmaschenetzwerk von Meshtastic und ermöglicht KI-Gespräche, API-Abfragen und Gerätesteuerung ohne Internet- oder Mobilfunkverbindung.

Pepper MCP Server für iOS-Simulator-Interaktion und -Debugging
Pepper ist ein MCP-Server, der eine dylib über DYLD_INSERT_LIBRARIES in iOS-Simulator-Apps injiziert und Echtzeit-Interaktion, Bildschirmlesen, Button-Tippen, Variableninspektion und Netzwerkverkehrsüberwachung durch eine WebSocket-Brücke ermöglicht.