Correction de l'invalidation du cache KV de Claude Code avec des backends locaux

✍️ OpenClawRadar📅 Publié: March 31, 2026🔗 Source
Correction de l'invalidation du cache KV de Claude Code avec des backends locaux
Ad

Les versions 2.1.36 et supérieures de Claude Code injectent du contenu dynamique dans les prompts système à chaque requête, provoquant une invalidation du cache KV lors de l'utilisation de backends d'inférence locaux comme llama.cpp, llama-server ou LM Studio. Cela force le matériel à retraiter les prompts système de plus de 20 000 tokens depuis le début pour des appels d'outils mineurs.

Le Problème

llama.cpp repose sur une correspondance exacte des chaînes pour la réutilisation du cache KV. Lorsque le début d'un prompt change, le cache entier est vidé et le prompt complet doit être retraité. Claude Code introduit deux éléments dynamiques qui modifient les prompts à chaque tour :

  • Hachage de Télémétrie : Injecte un en-tête de facturation/télémétrie (x-anthropic-billing-header: cch=xxxxx) avec un hachage qui change à chaque requête
  • Instantané Git : Injecte la sortie de git status dans le bloc d'environnement, modifiant le prompt dès que des fichiers sont modifiés

Cela se traduit par des journaux serveur affichant "forçant le retraitement complet du prompt en raison d'un manque de données de cache" et des temps de traitement de plus de 60 secondes pour ce qui devrait être des opérations mineures.

Ad

La Solution

Configurez Claude Code pour désactiver les éléments de prompt dynamiques et acheminer vers votre matériel local. Ouvrez ~/.claude/settings.json (ou la configuration locale de votre projet) et assurez-vous de la configuration suivante :

{
  "includeGitInstructions": false,
  "env": {
    "ANTHROPIC_BASE_URL": "<your-llama-server-here>",
    "ANTHROPIC_API_KEY": "<any-string>",
    "CLAUDE_CODE_ATTRIBUTION_HEADER": "0",
    "DISABLE_TELEMETRY": "1",
    "DISABLE_ERROR_REPORTING": "1",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
  }
}

Après avoir redémarré Claude Code, les journaux de llama-server devraient montrer une meilleure reconnaissance du cache. Au lieu de traiter 24 000 tokens, vous verrez des messages comme "selected slot by LCP similarity, sim_best = 0.973" suivis de "prompt processing progress, n_tokens = 24270, batch.n_tokens = 4" - indiquant seulement 600 tokens de traitement delta au lieu d'un retraitement complet.

Cela réduit les temps d'appel d'outils locaux de plus d'une minute à environ 4 secondes sur du matériel comme le Quadro RTX-8000 de l'ère Turing.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Résolution des problèmes de déconnexion dans l'interface de contrôle OpenClaw
Guides

Résolution des problèmes de déconnexion dans l'interface de contrôle OpenClaw

Apprenez à résoudre l'erreur 'Déconnecté (1008) : l'interface de contrôle nécessite HTTPS ou localhost' lors de l'utilisation d'OpenClaw sur un VPS Hostinger.

OpenClawRadar
Utilisez des exécuteurs de tâches pour les tâches de codage courantes
Guides

Utilisez des exécuteurs de tâches pour les tâches de codage courantes

Ham Vocke explique comment utiliser de simples scripts bash ou Makefiles comme exécuteurs de tâches pour standardiser les commandes courantes comme build, test et format à travers les référentiels.

OpenClawRadar
Guide pratique d'installation et de configuration pour l'agent IA auto-hébergé OpenClaw
Guides

Guide pratique d'installation et de configuration pour l'agent IA auto-hébergé OpenClaw

OpenClaw est un agent IA auto-hébergé qui s'intègre aux applications de messagerie et conserve une mémoire persistante via un système basé sur des fichiers. Les recommandations clés de configuration incluent de commencer par l'interface terminal, de ne connecter qu'un seul canal de messagerie initialement, et de configurer correctement le fichier SOUL.md pour la personnalité et les règles de sécurité.

OpenClawRadar
OpenClaw 4.1 avec Gemma 4 Stack : Architecture Hybride et Corrections de Configuration
Guides

OpenClaw 4.1 avec Gemma 4 Stack : Architecture Hybride et Corrections de Configuration

Un post Reddit détaille une pile d'agents locaux optimisée combinant OpenClaw 4.1 avec le modèle Gemma 4 de Google, présentant une architecture hybride, des correctifs de configuration spécifiques pour l'appel d'outils Ollama, et des ajustements de fenêtre contextuelle.

OpenClawRadar