Benchmark zeigt: CLI-Tool reduziert Claude-Code-Token-Kosten um 32 % durch strukturelle Navigation

✍️ OpenClawRadar📅 Veröffentlicht: 24. März 2026🔗 Source
Benchmark zeigt: CLI-Tool reduziert Claude-Code-Token-Kosten um 32 % durch strukturelle Navigation
Ad

Ein Entwickler hat ein CLI-Tool namens Scope quelloffen gemacht, das Claude-Code-Agenten strukturelle Code-Navigationsfähigkeiten bietet, ähnlich wie IDE-Funktionen wie "Referenzen finden" und "Zur Definition springen". Das Tool wurde in Rust mit tree-sitter und SQLite entwickelt.

Was das Tool leistet

Das Tool gibt Agenten Befehle wie:

  • "zeige mir eine 180-Token-Zusammenfassung dieser 6.000-Token-Klasse"
  • "suche nach dem, was der Code tut, nicht nach seinem Namen"

Es unterstützt derzeit TypeScript und C# mit dem Ziel, Agenten dabei zu helfen, Code effizienter zu navigieren als mit ihrem standardmäßigen grep-basierten Ansatz.

Benchmark-Methodik

Der Entwickler führte 54 automatisierte Durchläufe mit Sonnet 4.6 über eine 181-Dateien umfassende C#-Codebasis durch mit:

  • 6 Aufgabenkategorien
  • 3 Bedingungen: Baseline, Tool verfügbar, Architektur vorab in CLAUDE.md geladen
  • 3 Wiederholungen pro Bedingung

Bei jedem Durchlauf wurde eine vollständige NDJSON-Aufzeichnung erstellt, um Token in neue Eingaben, Cache-Erstellung, Cache-Lesevorgänge und Ausgaben zu zerlegen. Der Benchmark-Runner und die Telemetrie-Erfassung sind im Repository enthalten.

Ad

Wichtige Erkenntnisse

Entgegen den Erwartungen lasen Agenten mit dem Tool mehr Dateien (6,8 bis 9,7 im Durchschnitt vs. Baseline), führten aber 67 % mehr Codeänderungen pro Sitzung durch und beendeten Aufgaben in weniger Runden.

Die Einsparungen resultierten aus kürzeren Konversationen, die die Cache-Akkumulation reduzierten. Etwa 90 % der Token-Kosten entfallen auf die Cache-Akkumulation.

Gesamtergebnisse:

  • 32 % niedrigere Kosten pro Aufgabe
  • 2-fache Navigationseffizienz (Navigationsaktionen pro Änderung)
  • Navigations-zu-Änderungs-Verhältnis verbesserte sich von 25:1 (Baseline) auf 13:1 (mit Tool) und 12:1 (mit vorab geladener Architektur)

Die Ergebnisse variierten je nach Aufgabentyp:

  • Fehlerbehebungen: -62 % Kosten
  • Neue Funktionen: -49 % Kosten
  • Übergreifende Änderungen: -46 % Kosten
  • Entdeckungs- und Refactoring-Aufgaben: kein Vorteil (Baseline-Agenten navigieren hier bereits gut)

Wichtige Einschränkungen

Der Entwickler weist auf mehrere Einschränkungen hin:

  • p-Werte erreichen bei n=6 gepaarten Beobachtungen nicht 0,05 (die Richtung ist konsistent, aber die Stichprobe ist für statistische Signifikanz zu klein)
  • Bisher nur mit C# getestet (TypeScript-Unterstützung existiert, wurde aber noch nicht benchmarked)
  • Kostenberechnung verwendet aktuelle Sonnet 4.6 API-Preise: neue Eingabe $3/M, Cache-Schreiben $3,75/M, Cache-Lesen $0,30/M, Ausgabe $15/M

Das Tool ist quelloffen und verfügbar unter github.com/rynhardt-potgieter/scope für Entwickler, die experimentieren möchten, um die Token-Effizienz von Agenten zu verbessern.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

Erkennung stiller Werkzeugausfälle in KI-Codierungsagenten mit Vibeyard
Werkzeuge

Erkennung stiller Werkzeugausfälle in KI-Codierungsagenten mit Vibeyard

Vibeyard ist ein Tool, das erkennt, wenn KI-Coding-Agenten stille Tool-Fehler erleben – Situationen, in denen Agenten auf alternative Strategien zurückgreifen, ohne Entwickler zu benachrichtigen – und diese Ineffizienzen während der Sitzungen sichtbar macht. Es kann Korrekturen vorschlagen, um wiederholte ineffiziente Arbeitsabläufe zu verhindern.

OpenClawRadar
Torrix: LLM-Beobachtbarkeit selbst gehostet ohne Postgres oder Redis
Werkzeuge

Torrix: LLM-Beobachtbarkeit selbst gehostet ohne Postgres oder Redis

Torrix ist ein selbst gehostetes LLM-Beobachtungstool, das als einzelner Docker-Container mit SQLite-Backend läuft. Installation mit docker compose up; protokolliert LLM-Aufrufe via HTTP-Proxy oder SDK – Token, Kosten, Latenz, vollständige Traces, PII-Maskierung, Kostenprognose.

OpenClawRadar
Claude Code Production Grade Plugin v3.0 veröffentlicht: Autonome Softwareentwicklungs-Pipeline
Werkzeuge

Claude Code Production Grade Plugin v3.0 veröffentlicht: Autonome Softwareentwicklungs-Pipeline

Production Grade Plugin v3.0 für Claude Code ist jetzt als freie Open-Source-Software unter MIT-Lizenz verfügbar. Das Plugin erstellt eine vollständige Entwicklungspipeline von den Anforderungen bis zur Bereitstellung mit 13 KI-Fähigkeiten, die als Ingenieurteam fungieren.

OpenClawRadar
Sonarly: KI-gesteuerte Produktionswarnungs-Triage und -Lösung
Werkzeuge

Sonarly: KI-gesteuerte Produktionswarnungs-Triage und -Lösung

Sonarly verbindet sich mit Observability-Tools, um Produktionswarnungen zu priorisieren und zu beheben, Geräusche zu reduzieren und sich auf kritische Probleme zu konzentrieren.

OpenClawRadar