Correction de l'invalidation du cache KV de Claude Code avec des backends locaux

Les versions 2.1.36 et supérieures de Claude Code injectent du contenu dynamique dans les prompts système à chaque requête, provoquant une invalidation du cache KV lors de l'utilisation de backends d'inférence locaux comme llama.cpp, llama-server ou LM Studio. Cela force le matériel à retraiter les prompts système de plus de 20 000 tokens depuis le début pour des appels d'outils mineurs.
Le Problème
llama.cpp repose sur une correspondance exacte des chaînes pour la réutilisation du cache KV. Lorsque le début d'un prompt change, le cache entier est vidé et le prompt complet doit être retraité. Claude Code introduit deux éléments dynamiques qui modifient les prompts à chaque tour :
- Hachage de Télémétrie : Injecte un en-tête de facturation/télémétrie (
x-anthropic-billing-header: cch=xxxxx) avec un hachage qui change à chaque requête - Instantané Git : Injecte la sortie de
git statusdans le bloc d'environnement, modifiant le prompt dès que des fichiers sont modifiés
Cela se traduit par des journaux serveur affichant "forçant le retraitement complet du prompt en raison d'un manque de données de cache" et des temps de traitement de plus de 60 secondes pour ce qui devrait être des opérations mineures.
La Solution
Configurez Claude Code pour désactiver les éléments de prompt dynamiques et acheminer vers votre matériel local. Ouvrez ~/.claude/settings.json (ou la configuration locale de votre projet) et assurez-vous de la configuration suivante :
{
"includeGitInstructions": false,
"env": {
"ANTHROPIC_BASE_URL": "<your-llama-server-here>",
"ANTHROPIC_API_KEY": "<any-string>",
"CLAUDE_CODE_ATTRIBUTION_HEADER": "0",
"DISABLE_TELEMETRY": "1",
"DISABLE_ERROR_REPORTING": "1",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}Après avoir redémarré Claude Code, les journaux de llama-server devraient montrer une meilleure reconnaissance du cache. Au lieu de traiter 24 000 tokens, vous verrez des messages comme "selected slot by LCP similarity, sim_best = 0.973" suivis de "prompt processing progress, n_tokens = 24270, batch.n_tokens = 4" - indiquant seulement 600 tokens de traitement delta au lieu d'un retraitement complet.
Cela réduit les temps d'appel d'outils locaux de plus d'une minute à environ 4 secondes sur du matériel comme le Quadro RTX-8000 de l'ère Turing.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Résolution des problèmes de déconnexion dans l'interface de contrôle OpenClaw
Apprenez à résoudre l'erreur 'Déconnecté (1008) : l'interface de contrôle nécessite HTTPS ou localhost' lors de l'utilisation d'OpenClaw sur un VPS Hostinger.

Utilisez des exécuteurs de tâches pour les tâches de codage courantes
Ham Vocke explique comment utiliser de simples scripts bash ou Makefiles comme exécuteurs de tâches pour standardiser les commandes courantes comme build, test et format à travers les référentiels.

Guide pratique d'installation et de configuration pour l'agent IA auto-hébergé OpenClaw
OpenClaw est un agent IA auto-hébergé qui s'intègre aux applications de messagerie et conserve une mémoire persistante via un système basé sur des fichiers. Les recommandations clés de configuration incluent de commencer par l'interface terminal, de ne connecter qu'un seul canal de messagerie initialement, et de configurer correctement le fichier SOUL.md pour la personnalité et les règles de sécurité.

OpenClaw 4.1 avec Gemma 4 Stack : Architecture Hybride et Corrections de Configuration
Un post Reddit détaille une pile d'agents locaux optimisée combinant OpenClaw 4.1 avec le modèle Gemma 4 de Google, présentant une architecture hybride, des correctifs de configuration spécifiques pour l'appel d'outils Ollama, et des ajustements de fenêtre contextuelle.