Messung des Claude Code MCP-Stacks: Cache-Freundlichkeit vs. Byte-Ersparnis und eine 2-Zeilen-Korrektur für den Prompt-Cache

Bei der Optimierung eines Claude Code MCP-Stacks konzentriert man sich leicht auf eine einzige Metrik: Byte-Einsparungen. Aber Greg Shevchenkos neue Analyse zeigt, dass ein eindimensionaler Benchmark ein System empfehlen kann, das in der Produktion streng schlechter abschneidet. Die fehlende Achse: Cache-Freundlichkeit, d. h., ob dieselbe Eingabe über mehrere Durchläufe hinweg byteidentische Ausgaben erzeugt, sodass Anthropics Prompt-Cache trifft.
Shevchenkos größter Byte-Sparer – ein Retrieval-MCP, das den Kontext um 60–70 % reduzierte – hat tatsächlich den 5-Minuten-TTL-Prompt-Cache bei jedem Aufruf ausgehebelt. Zwei Durchläufe derselben Abfrage erzeugten unterschiedliche Bytes, weil die Ausgabereihenfolge von rg --files-with-matches durch eine Map-Einfügungssequenz in den endgültigen Kontext durchsickerte. Der Fix bestand aus zwei Zeilen: Sortieren der rg-Treffer vor dem Kürzen und Sortieren der Map-Einträge nach Pfad. Nach der Änderung blieben die Byte-Einsparungen unverändert, aber cache_friendly_score stieg von ~0 % auf 100 %.
Was der Harness misst
Shevchenko veröffentlichte einen Open-Source-Benchmark-Harness (nur Standardbibliothek Python, offline), der Folgendes misst:
- Mittleres Verhältnis + CV über N≥5 Durchläufe pro Fixture → Byte-Einsparungsachse
- Prüfung auf eindeutige MD5-Anzahl == 1 → Cache-Freundlichkeitsachse (0–100 %)
- 12-Anti-Pattern-Audit für Tool-Definitionen (DSA-Referenz)
Jeder Kompressor als (str) -> str kann eingesteckt werden. Der Harness verwendet Cluster-Bootstrap-KIs, Wilson-KIs, Vorregistrierung und Cohen's κ mit echten Daten.
Übersicht öffentlicher Alternativen
Shevchenko untersuchte öffentliche Dokumentationen zu: Cursor Codebase Index, Sourcegraph Cody, Aider Repo-Map, Microsoft LLMLingua/LLMLingua-2, Firecrawl/Jina Reader, RouteLLM/Martian (Stand Mai 2026). Keine offenbarte Cache-Freundlichkeitsmetriken.
Einschränkungen
Er vermutete, dass die Vorbereitungsschicht nachfolgende Cache-Treffer bei nachfolgenden Runden auslöst, aber es wurde keine Signifikanz erreicht (Welch p=0,32, Cohen's d≈0,18, N=137). Cohen's κ zwischen zwei Gutachtern lag bei 0,5955 (mäßig, unter dem Schwellenwert von 0,7), wobei 4 von 5 Meinungsverschiedenheiten auf eine einzelne mehrdeutige Aufgabe entfielen – ein Fix der Spezifikation würde κ auf ~0,83 heben.
Der Harness steht unter der MIT-Lizenz. Wenn Sie einen Claude Code MCP-Stack betreiben, ist die Messung von cache_friendly_score jetzt ein konkretes, umsetzbares Ziel.
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Heartbeat-Gateway: Ereignisgesteuerter Ersatz für Cron-Abfragen in OpenClaw
Heartbeat-gateway ist ein Open-Source-Python-Tool, das cron-basiertes Polling durch Webhook-gesteuerte Ereignisse für OpenClaw ersetzt. Es reduziert die API-Kosten von ~86 $/Monat auf ~4,50 $/Monat und verbessert die Latenz von bis zu 30 Minuten auf unter 2 Sekunden.

Open-Source-Claude-Code-Fähigkeiten für personalisierte Social-Media-Inhalte
Ein Entwickler hat 13 Claude Code Skills als Open Source veröffentlicht, die Claude dabei helfen, Social-Media-Inhalte in Ihrer eigenen Stimme zu verfassen. Die Skills umfassen Kontextdefinition, Strategie, Erstellung und Analyse-Tools für LinkedIn, Twitter/X, Threads und Bluesky.

Benchmark zeigt: KI-Browser-Automatisierungstools variieren um das 2,6-fache bei den Token-Kosten trotz identischer Genauigkeit
Ein Benchmark von 4 CLI-Browser-Automatisierungstools mit Claude Sonnet 4.6 bei 6 realen Aufgaben ergab, dass alle 100% Genauigkeit erreichten, aber openbrowser-ai 36.010 Tokens verwendete, während andere 77.123–94.130 Tokens benötigten. Die Anzahl der Tool-Aufrufe war der stärkste Prädiktor für die Token-Kosten.

Automatisierte .xcstrings-Lokalisierung mit Claude Code
Eine neue Claude Code Fähigkeit automatisiert die Lokalisierung von Xcode .xcstrings-Dateien mit fünf Pipeline-Stufen: Domain-Scanning, Kommentargenerierung, Übersetzung mit CLDR-Pluralformen, Grammatikprüfung und Plural-Korrektur.