Behebung der KV-Cache-Invalidierung von Claude Code mit lokalen Backends

✍️ OpenClawRadar📅 Veröffentlicht: 31. März 2026🔗 Source
Behebung der KV-Cache-Invalidierung von Claude Code mit lokalen Backends
Ad

Claude Code Versionen 2.1.36 und höher injizieren bei jeder Anfrage dynamische Inhalte in Systemprompts, was bei der Verwendung lokaler Inferenz-Backends wie llama.cpp, llama-server oder LM Studio zu einer Invalidierung des KV-Caches führt. Dies zwingt die Hardware dazu, 20K+ Token umfassende Systemprompts für geringfügige Tool-Aufrufe von Grund auf neu zu verarbeiten.

Das Problem

llama.cpp verlässt sich auf exakte Zeichenkettenübereinstimmung für die Wiederverwendung des KV-Caches. Wenn sich der Anfang eines Prompts ändert, wird der gesamte Cache geleert und der vollständige Prompt muss neu verarbeitet werden. Claude Code führt zwei dynamische Elemente ein, die Prompts bei jedem Zugriff verändern:

  • Telemetrie-Hash: Injiziert einen Abrechnungs-/Telemetrie-Header (x-anthropic-billing-header: cch=xxxxx) mit einem Hash, der sich bei jeder Anfrage ändert
  • Git-Snapshot: Injiziert git status-Ausgabe in den Umgebungsblock, wodurch sich der Prompt ändert, sobald Dateien modifiziert werden

Dies führt dazu, dass Server-Logs "erzwinge vollständige Prompt-Neuverarbeitung aufgrund fehlender Cache-Daten" anzeigen und Verarbeitungszeiten von 60+ Sekunden für Operationen, die eigentlich geringfügig sein sollten.

Ad

Die Lösung

Konfigurieren Sie Claude Code so, dass dynamische Prompt-Elemente deaktiviert werden und die Anfragen an Ihre lokale Hardware geroutet werden. Öffnen Sie ~/.claude/settings.json (oder Ihre lokale Projektkonfiguration) und stellen Sie sicher, dass folgende Konfiguration vorhanden ist:

{
  "includeGitInstructions": false,
  "env": {
    "ANTHROPIC_BASE_URL": "<your-llama-server-here>",
    "ANTHROPIC_API_KEY": "<any-string>",
    "CLAUDE_CODE_ATTRIBUTION_HEADER": "0",
    "DISABLE_TELEMETRY": "1",
    "DISABLE_ERROR_REPORTING": "1",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
  }
}

Nach einem Neustart von Claude Code sollten llama-server-Logs eine verbesserte Cache-Erkennung anzeigen. Anstatt 24.000 Token zu verarbeiten, werden Sie Meldungen wie "selected slot by LCP similarity, sim_best = 0.973" gefolgt von "prompt processing progress, n_tokens = 24270, batch.n_tokens = 4" sehen – was darauf hinweist, dass nur 600 Token als Delta verarbeitet werden, anstatt einer vollständigen Neuverarbeitung.

Dies reduziert die lokalen Tool-Aufrufzeiten von über einer Minute auf etwa 4 Sekunden auf Hardware wie der Turing-Ära Quadro RTX-8000.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Mit OpenClaws sieben Optimierungstechniken Token-Kosten um 95 % senken
Anleitungen

Mit OpenClaws sieben Optimierungstechniken Token-Kosten um 95 % senken

Ein umfassender Leitfaden, der sieben Techniken zur Reduzierung des KI-Agenten-Tokenverbrauchs um über 95% beschreibt, darunter baumstrukturierte Boot-Dateien, KI-Auto-Kompression, lokale Modellauslagerung und cron-basierte CPU-Aufgaben.

OpenClawRadar
Was bricht, wenn man Codierungsagenten auf kleinen lokalen Modellen ausführt
Anleitungen

Was bricht, wenn man Codierungsagenten auf kleinen lokalen Modellen ausführt

Reale Fehlerpunkte aus dem Testen von Multi-Datei-Aufgaben an Sub-7B-Modellen: Markdown-Fences, Zuverlässigkeit strukturierter Ausgaben, Dateibearbeitungsfehler und Klassifizierung von Lese- vs. Schreibaktionen.

OpenClawRadar
Claude Code Workflow Visual: Speicherhierarchie, Fähigkeiten, Hooks und Schleife
Anleitungen

Claude Code Workflow Visual: Speicherhierarchie, Fähigkeiten, Hooks und Schleife

Ein Reddit-Beitrag teilt eine Workflow-Visualisierung für Claude Code, die CLAUDE.md-Speicherschichtung (global → Repo → bereichsbezogen), Fähigkeiten als wiederverwendbare Muster in .claude/skills/ und einen empfohlenen Workflow-Loop (Planen → Beschreiben → Akzeptieren → Committen) abdeckt.

OpenClawRadar
RAG-Chatbot-Evaluierung: Wie ein Modell-Sweep und Retrieval-Fixes Kosten um 79% senkten und die Qualität um 19% steigerten
Anleitungen

RAG-Chatbot-Evaluierung: Wie ein Modell-Sweep und Retrieval-Fixes Kosten um 79% senkten und die Qualität um 19% steigerten

Ein Entwickler evaluierte einen RAG-Chatbot für den Kundensupport und stellte Fehlkonfigurationen bei der Abfrage, Mängel bei heuristischen Bewertern und ein günstigeres Modell fest, das das Produktionsmodell übertraf. Die Qualität verbesserte sich von 6,62 auf 7,88, während die Kosten pro Sitzung von 0,002420 $ auf 0,000509 $ sanken.

OpenClawRadar