Benchmark zeigt: CLI-Tool reduziert Claude-Code-Token-Kosten um 32 % durch strukturelle Navigation

Ein Entwickler hat ein CLI-Tool namens Scope quelloffen gemacht, das Claude-Code-Agenten strukturelle Code-Navigationsfähigkeiten bietet, ähnlich wie IDE-Funktionen wie "Referenzen finden" und "Zur Definition springen". Das Tool wurde in Rust mit tree-sitter und SQLite entwickelt.
Was das Tool leistet
Das Tool gibt Agenten Befehle wie:
- "zeige mir eine 180-Token-Zusammenfassung dieser 6.000-Token-Klasse"
- "suche nach dem, was der Code tut, nicht nach seinem Namen"
Es unterstützt derzeit TypeScript und C# mit dem Ziel, Agenten dabei zu helfen, Code effizienter zu navigieren als mit ihrem standardmäßigen grep-basierten Ansatz.
Benchmark-Methodik
Der Entwickler führte 54 automatisierte Durchläufe mit Sonnet 4.6 über eine 181-Dateien umfassende C#-Codebasis durch mit:
- 6 Aufgabenkategorien
- 3 Bedingungen: Baseline, Tool verfügbar, Architektur vorab in CLAUDE.md geladen
- 3 Wiederholungen pro Bedingung
Bei jedem Durchlauf wurde eine vollständige NDJSON-Aufzeichnung erstellt, um Token in neue Eingaben, Cache-Erstellung, Cache-Lesevorgänge und Ausgaben zu zerlegen. Der Benchmark-Runner und die Telemetrie-Erfassung sind im Repository enthalten.
Wichtige Erkenntnisse
Entgegen den Erwartungen lasen Agenten mit dem Tool mehr Dateien (6,8 bis 9,7 im Durchschnitt vs. Baseline), führten aber 67 % mehr Codeänderungen pro Sitzung durch und beendeten Aufgaben in weniger Runden.
Die Einsparungen resultierten aus kürzeren Konversationen, die die Cache-Akkumulation reduzierten. Etwa 90 % der Token-Kosten entfallen auf die Cache-Akkumulation.
Gesamtergebnisse:
- 32 % niedrigere Kosten pro Aufgabe
- 2-fache Navigationseffizienz (Navigationsaktionen pro Änderung)
- Navigations-zu-Änderungs-Verhältnis verbesserte sich von 25:1 (Baseline) auf 13:1 (mit Tool) und 12:1 (mit vorab geladener Architektur)
Die Ergebnisse variierten je nach Aufgabentyp:
- Fehlerbehebungen: -62 % Kosten
- Neue Funktionen: -49 % Kosten
- Übergreifende Änderungen: -46 % Kosten
- Entdeckungs- und Refactoring-Aufgaben: kein Vorteil (Baseline-Agenten navigieren hier bereits gut)
Wichtige Einschränkungen
Der Entwickler weist auf mehrere Einschränkungen hin:
- p-Werte erreichen bei n=6 gepaarten Beobachtungen nicht 0,05 (die Richtung ist konsistent, aber die Stichprobe ist für statistische Signifikanz zu klein)
- Bisher nur mit C# getestet (TypeScript-Unterstützung existiert, wurde aber noch nicht benchmarked)
- Kostenberechnung verwendet aktuelle Sonnet 4.6 API-Preise: neue Eingabe $3/M, Cache-Schreiben $3,75/M, Cache-Lesen $0,30/M, Ausgabe $15/M
Das Tool ist quelloffen und verfügbar unter github.com/rynhardt-potgieter/scope für Entwickler, die experimentieren möchten, um die Token-Effizienz von Agenten zu verbessern.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Erkennung stiller Werkzeugausfälle in KI-Codierungsagenten mit Vibeyard
Vibeyard ist ein Tool, das erkennt, wenn KI-Coding-Agenten stille Tool-Fehler erleben – Situationen, in denen Agenten auf alternative Strategien zurückgreifen, ohne Entwickler zu benachrichtigen – und diese Ineffizienzen während der Sitzungen sichtbar macht. Es kann Korrekturen vorschlagen, um wiederholte ineffiziente Arbeitsabläufe zu verhindern.

Torrix: LLM-Beobachtbarkeit selbst gehostet ohne Postgres oder Redis
Torrix ist ein selbst gehostetes LLM-Beobachtungstool, das als einzelner Docker-Container mit SQLite-Backend läuft. Installation mit docker compose up; protokolliert LLM-Aufrufe via HTTP-Proxy oder SDK – Token, Kosten, Latenz, vollständige Traces, PII-Maskierung, Kostenprognose.

Claude Code Production Grade Plugin v3.0 veröffentlicht: Autonome Softwareentwicklungs-Pipeline
Production Grade Plugin v3.0 für Claude Code ist jetzt als freie Open-Source-Software unter MIT-Lizenz verfügbar. Das Plugin erstellt eine vollständige Entwicklungspipeline von den Anforderungen bis zur Bereitstellung mit 13 KI-Fähigkeiten, die als Ingenieurteam fungieren.

Sonarly: KI-gesteuerte Produktionswarnungs-Triage und -Lösung
Sonarly verbindet sich mit Observability-Tools, um Produktionswarnungen zu priorisieren und zu beheben, Geräusche zu reduzieren und sich auf kritische Probleme zu konzentrieren.