Correction de l'invalidation du cache KV de Claude Code avec des backends locaux

✍️ OpenClawRadar📅 Publié: March 31, 2026🔗 Source
Correction de l'invalidation du cache KV de Claude Code avec des backends locaux
Ad

Les versions 2.1.36 et supérieures de Claude Code injectent du contenu dynamique dans les prompts système à chaque requête, provoquant une invalidation du cache KV lors de l'utilisation de backends d'inférence locaux comme llama.cpp, llama-server ou LM Studio. Cela force le matériel à retraiter les prompts système de plus de 20 000 tokens depuis le début pour des appels d'outils mineurs.

Le Problème

llama.cpp repose sur une correspondance exacte des chaînes pour la réutilisation du cache KV. Lorsque le début d'un prompt change, le cache entier est vidé et le prompt complet doit être retraité. Claude Code introduit deux éléments dynamiques qui modifient les prompts à chaque tour :

  • Hachage de Télémétrie : Injecte un en-tête de facturation/télémétrie (x-anthropic-billing-header: cch=xxxxx) avec un hachage qui change à chaque requête
  • Instantané Git : Injecte la sortie de git status dans le bloc d'environnement, modifiant le prompt dès que des fichiers sont modifiés

Cela se traduit par des journaux serveur affichant "forçant le retraitement complet du prompt en raison d'un manque de données de cache" et des temps de traitement de plus de 60 secondes pour ce qui devrait être des opérations mineures.

Ad

La Solution

Configurez Claude Code pour désactiver les éléments de prompt dynamiques et acheminer vers votre matériel local. Ouvrez ~/.claude/settings.json (ou la configuration locale de votre projet) et assurez-vous de la configuration suivante :

{
  "includeGitInstructions": false,
  "env": {
    "ANTHROPIC_BASE_URL": "<your-llama-server-here>",
    "ANTHROPIC_API_KEY": "<any-string>",
    "CLAUDE_CODE_ATTRIBUTION_HEADER": "0",
    "DISABLE_TELEMETRY": "1",
    "DISABLE_ERROR_REPORTING": "1",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
  }
}

Après avoir redémarré Claude Code, les journaux de llama-server devraient montrer une meilleure reconnaissance du cache. Au lieu de traiter 24 000 tokens, vous verrez des messages comme "selected slot by LCP similarity, sim_best = 0.973" suivis de "prompt processing progress, n_tokens = 24270, batch.n_tokens = 4" - indiquant seulement 600 tokens de traitement delta au lieu d'un retraitement complet.

Cela réduit les temps d'appel d'outils locaux de plus d'une minute à environ 4 secondes sur du matériel comme le Quadro RTX-8000 de l'ère Turing.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Conseils de configuration d'OpenClaw tirés de l'expérience d'un utilisateur : MCP Gmail, drapeaux de profil et problèmes de réseau
Guides

Conseils de configuration d'OpenClaw tirés de l'expérience d'un utilisateur : MCP Gmail, drapeaux de profil et problèmes de réseau

Un utilisateur exécutant OpenClaw sur un Mac via UTM avec une machine virtuelle Ubuntu partage des problèmes de configuration spécifiques rencontrés : le serveur MCP Gmail nécessite le paramètre html_body au lieu de body, le drapeau --profile prod est nécessaire pour éviter une identité dev codée en dur, et les clés API doivent être placées dans auth-profiles.json via la commande paste-token.

OpenClawRadar
Configuration OpenClaw pour l'automatisation de navigateur avec intervention humaine, utilisant Docker, Chromium et noVNC
Guides

Configuration OpenClaw pour l'automatisation de navigateur avec intervention humaine, utilisant Docker, Chromium et noVNC

Un développeur partage sa configuration de conteneur Docker qui permet à OpenClaw de gérer les CAPTCHAs et les approbations en cours d'exécution en utilisant Chromium avec noVNC pour un accès à distance, nécessitant environ 300 Mo de RAM et des démarrages à froid de 3 secondes.

OpenClawRadar
Tarification des agents IA : Leçons tirées de la vente d'OpenClaw aux petites entreprises
Guides

Tarification des agents IA : Leçons tirées de la vente d'OpenClaw aux petites entreprises

Après des mois à vendre des agents OpenClaw à des cabinets d'avocats et agences immobilières, un développeur partage des stratégies de pricing éprouvées : le prix par siège ne fonctionne pas, le cadrage en « employé IA » gagne, et les coûts LLM refacturés évitent l'érosion des marges.

OpenClawRadar
Exécuter OpenClaw avec un LLM local sur macOS – Guide pour 16 à 24 Go de RAM
Guides

Exécuter OpenClaw avec un LLM local sur macOS – Guide pour 16 à 24 Go de RAM

Guide pratique pour configurer un modèle Qwen 3.5 quantifié avec OpenClaw sur macOS (16–24 Go de RAM), incluant une compétence de test pour la vérification.

OpenClawRadar