Benchmark zeigt: CLI-Tool reduziert Claude-Code-Token-Kosten um 32 % durch strukturelle Navigation

Ein Entwickler hat ein CLI-Tool namens Scope quelloffen gemacht, das Claude-Code-Agenten strukturelle Code-Navigationsfähigkeiten bietet, ähnlich wie IDE-Funktionen wie "Referenzen finden" und "Zur Definition springen". Das Tool wurde in Rust mit tree-sitter und SQLite entwickelt.
Was das Tool leistet
Das Tool gibt Agenten Befehle wie:
- "zeige mir eine 180-Token-Zusammenfassung dieser 6.000-Token-Klasse"
- "suche nach dem, was der Code tut, nicht nach seinem Namen"
Es unterstützt derzeit TypeScript und C# mit dem Ziel, Agenten dabei zu helfen, Code effizienter zu navigieren als mit ihrem standardmäßigen grep-basierten Ansatz.
Benchmark-Methodik
Der Entwickler führte 54 automatisierte Durchläufe mit Sonnet 4.6 über eine 181-Dateien umfassende C#-Codebasis durch mit:
- 6 Aufgabenkategorien
- 3 Bedingungen: Baseline, Tool verfügbar, Architektur vorab in CLAUDE.md geladen
- 3 Wiederholungen pro Bedingung
Bei jedem Durchlauf wurde eine vollständige NDJSON-Aufzeichnung erstellt, um Token in neue Eingaben, Cache-Erstellung, Cache-Lesevorgänge und Ausgaben zu zerlegen. Der Benchmark-Runner und die Telemetrie-Erfassung sind im Repository enthalten.
Wichtige Erkenntnisse
Entgegen den Erwartungen lasen Agenten mit dem Tool mehr Dateien (6,8 bis 9,7 im Durchschnitt vs. Baseline), führten aber 67 % mehr Codeänderungen pro Sitzung durch und beendeten Aufgaben in weniger Runden.
Die Einsparungen resultierten aus kürzeren Konversationen, die die Cache-Akkumulation reduzierten. Etwa 90 % der Token-Kosten entfallen auf die Cache-Akkumulation.
Gesamtergebnisse:
- 32 % niedrigere Kosten pro Aufgabe
- 2-fache Navigationseffizienz (Navigationsaktionen pro Änderung)
- Navigations-zu-Änderungs-Verhältnis verbesserte sich von 25:1 (Baseline) auf 13:1 (mit Tool) und 12:1 (mit vorab geladener Architektur)
Die Ergebnisse variierten je nach Aufgabentyp:
- Fehlerbehebungen: -62 % Kosten
- Neue Funktionen: -49 % Kosten
- Übergreifende Änderungen: -46 % Kosten
- Entdeckungs- und Refactoring-Aufgaben: kein Vorteil (Baseline-Agenten navigieren hier bereits gut)
Wichtige Einschränkungen
Der Entwickler weist auf mehrere Einschränkungen hin:
- p-Werte erreichen bei n=6 gepaarten Beobachtungen nicht 0,05 (die Richtung ist konsistent, aber die Stichprobe ist für statistische Signifikanz zu klein)
- Bisher nur mit C# getestet (TypeScript-Unterstützung existiert, wurde aber noch nicht benchmarked)
- Kostenberechnung verwendet aktuelle Sonnet 4.6 API-Preise: neue Eingabe $3/M, Cache-Schreiben $3,75/M, Cache-Lesen $0,30/M, Ausgabe $15/M
Das Tool ist quelloffen und verfügbar unter github.com/rynhardt-potgieter/scope für Entwickler, die experimentieren möchten, um die Token-Effizienz von Agenten zu verbessern.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Prime Agent: Ein selbstverbesserndes RLM-Coding-Harness mit persistentem REPL und Agent-CRUD
Prime Agent ist ein Open-Source-Coding-Harness, der auf einem persistenten IPython-Kernel und einem rekursiven Sprachmodell basiert und es Agenten ermöglicht, ihren eigenen Kontext und Sub-Agenten zu verwalten.

Solitaire: Open-Source Identitätsinfrastruktur für KI-Agenten
Solitaire ist eine Open-Source-Identitätsinfrastruktur für KI-Agenten, die sich darauf konzentriert, wie Agenten ihre Arbeitsbeziehung mit Nutzern im Laufe der Zeit verbessern, nicht nur auf Erinnerungsabruf. Es ist lokal-first, modellunabhängig und verfügbar über pip install solitaire-ai.

devopsiphai: Open-Source-Claude-Code prüft die Betriebsgesundheit in 6 Phasen
devopsiphai ist eine Open-Source-Claude-Code-Fähigkeit, die die Betriebsbereitschaft von Produktionsprojekten mithilfe eines 6-Phasen-Prozesses und des ARC-Frameworks überprüft und dabei Buchstabennoten sowie eine strukturierte TODO.md mit aufwandgeschätzten Aufgaben ausgibt.

YantrikClaw Fork fügt ZeroClaw kognitive Erinnerung, Begleitermodus und stufenbewusste Werkzeuge hinzu.
YantrikClaw ist ein Fork von ZeroClaw, der drei Hauptfunktionen einführt: Kognitives Gedächtnis mit YantrikDB für persistente semantische Erinnerung, Begleitermodus mit Bindungsverfolgung und proaktivem Verhalten sowie größenabhängige Werkzeugauswahl, die sich an die Modellgröße von Raspberry Pi bis zu großen Clustern anpasst.