Исправление недействительности кэша KV в Claude Code с использованием локальных бэкендов

Версии Claude Code 2.1.36 и выше внедряют динамический контент в системные промпты при каждом запросе, вызывая инвалидацию KV-кэша при использовании локальных бэкендов вывода, таких как llama.cpp, llama-server или LM Studio. Это заставляет оборудование заново обрабатывать системные промпты размером 20K+ токенов с нуля для незначительных вызовов инструментов.
Проблема
llama.cpp полагается на точное строковое сопоставление для повторного использования KV-кэша. Когда начало промпта меняется, весь кэш сбрасывается и полный промпт должен быть обработан заново. Claude Code вводит два динамических элемента, которые изменяют промпты на каждом шаге:
- Хэш телеметрии: Внедряет заголовок биллинга/телеметрии (
x-anthropic-billing-header: cch=xxxxx) с хэшем, который меняется при каждом запросе - Снимок Git: Внедряет вывод
git statusв блок окружения, изменяя промпт при модификации файлов
Это приводит к тому, что логи сервера показывают "принудительную полную переобработку промпта из-за отсутствия данных кэша" и время обработки 60+ секунд для операций, которые должны быть незначительными.
Решение
Настройте Claude Code на отключение динамических элементов промпта и маршрутизацию на ваше локальное оборудование. Откройте ~/.claude/settings.json (или локальную конфигурацию вашего проекта) и убедитесь в следующей конфигурации:
{
"includeGitInstructions": false,
"env": {
"ANTHROPIC_BASE_URL": "<your-llama-server-here>",
"ANTHROPIC_API_KEY": "<any-string>",
"CLAUDE_CODE_ATTRIBUTION_HEADER": "0",
"DISABLE_TELEMETRY": "1",
"DISABLE_ERROR_REPORTING": "1",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}После перезапуска Claude Code логи llama-server должны показывать улучшенное распознавание кэша. Вместо обработки 24 000 токенов вы увидите сообщения вроде "selected slot by LCP similarity, sim_best = 0.973", за которыми следует "prompt processing progress, n_tokens = 24270, batch.n_tokens = 4" — что указывает на обработку всего 600 токенов разницы вместо полной переобработки.
Это сокращает время локальных вызовов инструментов с более минуты до примерно 4 секунд на оборудовании вроде Quadro RTX-8000 эпохи Turing.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Структура кода Claude, проверенная в нескольких реальных проектах
Разработчик делится настройкой Claude Code, которая выдержала 2-3 реальных проекта с несколькими навыками, MCP-серверами и агентами. Ключевые выводы включают использование CLAUDE MD для согласованности, разделение навыков по назначению, внедрение хуков и поддержание использования контекста ниже 60%.

Запись на Reddit: Разработчикам нужны лучшие практики работы с ИИ, а не просто лучшие инструменты
В посте на Reddit утверждается, что недовольство разработчиков инструментами ИИ для написания кода проистекает из плохих практик составления промптов, а именно из использования «сырых промптов» без контекста или структуры. Автор рекомендует использовать каркасы, такие как CLAUDE.md, и структурированные рабочие процессы для получения готового к производству кода от Claude.

Практические уроки по инженерии промптов из опыта работы с Claude Code
Менеджер проекта делится конкретными техниками, которые улучшили результаты Claude Code: двухфазные промпты, промпты с одной целью и очень специфичные определения ролей.

Базовые модели маршрутизации для использования Claude и OpenAI
Разработчик делится своей стратегией маршрутизации моделей, используя Claude Haiku 4.5, Sonnet 4.6, Opus 4.6 и ChatGPT 5.3 Codex для различных типов задач, с резервными вариантами GPT-5 Mini и GPT-5.4 при необходимости.