Agent-Frameworks verschwenden pro Sitzung über 350.000 Token durch erneutes Senden statischer Dateien.

Benchmark-Ergebnisse zum Token-Verschwendung
Messungen auf einem lokalen Qwen 3.5 122B-Setup ergaben, dass Agent-Frameworks pro Sitzung mehr als 350.000 Token verschwenden, indem sie statische Dateien wiederholt erneut senden. Die Quelle beschreibt diese Zahlen als "unrealistisch".
Optimierungsansatz
Es wurde ein Compile-Time-Ansatz entdeckt, der den Abfragekontext von 1.373 Token auf nur 73 Token reduziert. Dies entspricht einer Reduzierung der Token-Nutzung um 95 % für diesen spezifischen Kontext.
Der Benchmark ergab auch, dass eine naive JSON-Konvertierung das Problem um 30 % verschlimmert und die Token-Verschwendung über die Basiswerte hinaus erhöht.
Technischer Kontext
Agent-Frameworks enthalten typischerweise System-Prompts, Werkzeugdefinitionen und andere Konfigurationsdaten, die über mehrere Interaktionen innerhalb einer Sitzung statisch bleiben. Wenn diese Daten mit jeder Abfrage erneut gesendet werden, verbrauchen sie Token, ohne dem Modell neue Informationen zu liefern. Dies ist besonders kostspielig bei großen Modellen wie Qwen 3.5 122B, wo die Token-Verarbeitung sowohl die Leistung als auch die Kosten direkt beeinflusst.
Der Compile-Time-Ansatz beinhaltet wahrscheinlich die Vorverarbeitung statischer Elemente, sodass sie referenziert statt erneut gesendet werden, ähnlich wie moderne Webanwendungen statische Assets zwischenspeichern. Für Entwickler, die mit KI-Coding-Agenten arbeiten, kann die Reduzierung dieses Overheads die Antwortzeiten erheblich verbessern und die Betriebskosten senken.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Meta veröffentlicht Muse Code mit dem Muse-Spark-1.2-Modell
Metas neuer Muse Code Terminal-Coding-Agent, unterstützt von Muse Spark 1.2, bietet asynchrone Hintergrundagenten, eine replay-exakte Laufzeit und langfristige Codierfähigkeiten.

Zerro: Zeigen Sie auf Ihre Live-App, sprechen Sie und sehen Sie zu, wie Claude Code sie sofort bearbeitet
Zerro ist eine Mac-App, mit der Sie den Cursor auf eine laufende App richten, eine Änderung mündlich beschreiben und Claude Code die echten Dateien live bearbeiten lassen können. Sie erfasst Bewegungen, erkennt, welches Element Sie meinen, und erstellt vor jedem Durchlauf einen Prüfpunkt.

Nyx: Autonome Testumgebung für KI-Agenten
Nyx ist ein Blackbox-Test-Framework, das KI-Agenten auf Fehlermodi wie Logikfehler, Denkfehler und Sicherheitslücken durch mehrstufige adaptive Gespräche prüft. Es deckt in unter 10 Minuten auf, wofür manuelle Audits Stunden benötigen.

ToolLoop: Open-Source Agenten-Framework für Claude-ähnliche Tools mit beliebigen Modellen
ToolLoop ist ein Open-Source-Python-Framework mit 11 Tools für Dateioperationen, Codesuche, Shell-Zugriff und Sub-Agenten, das über LiteLLM mit jedem LLM funktioniert. Das 2.700-Zeilen-Framework ermöglicht den Wechsel von Modellen mitten im Gespräch mit gemeinsamem Kontext.