Исправление недействительности кэша KV в Claude Code с использованием локальных бэкендов

✍️ OpenClawRadar📅 Опубликовано: 31 марта 2026 г.🔗 Source
Исправление недействительности кэша KV в Claude Code с использованием локальных бэкендов
Ad

Версии Claude Code 2.1.36 и выше внедряют динамический контент в системные промпты при каждом запросе, вызывая инвалидацию KV-кэша при использовании локальных бэкендов вывода, таких как llama.cpp, llama-server или LM Studio. Это заставляет оборудование заново обрабатывать системные промпты размером 20K+ токенов с нуля для незначительных вызовов инструментов.

Проблема

llama.cpp полагается на точное строковое сопоставление для повторного использования KV-кэша. Когда начало промпта меняется, весь кэш сбрасывается и полный промпт должен быть обработан заново. Claude Code вводит два динамических элемента, которые изменяют промпты на каждом шаге:

  • Хэш телеметрии: Внедряет заголовок биллинга/телеметрии (x-anthropic-billing-header: cch=xxxxx) с хэшем, который меняется при каждом запросе
  • Снимок Git: Внедряет вывод git status в блок окружения, изменяя промпт при модификации файлов

Это приводит к тому, что логи сервера показывают "принудительную полную переобработку промпта из-за отсутствия данных кэша" и время обработки 60+ секунд для операций, которые должны быть незначительными.

Ad

Решение

Настройте Claude Code на отключение динамических элементов промпта и маршрутизацию на ваше локальное оборудование. Откройте ~/.claude/settings.json (или локальную конфигурацию вашего проекта) и убедитесь в следующей конфигурации:

{
  "includeGitInstructions": false,
  "env": {
    "ANTHROPIC_BASE_URL": "<your-llama-server-here>",
    "ANTHROPIC_API_KEY": "<any-string>",
    "CLAUDE_CODE_ATTRIBUTION_HEADER": "0",
    "DISABLE_TELEMETRY": "1",
    "DISABLE_ERROR_REPORTING": "1",
    "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
  }
}

После перезапуска Claude Code логи llama-server должны показывать улучшенное распознавание кэша. Вместо обработки 24 000 токенов вы увидите сообщения вроде "selected slot by LCP similarity, sim_best = 0.973", за которыми следует "prompt processing progress, n_tokens = 24270, batch.n_tokens = 4" — что указывает на обработку всего 600 токенов разницы вместо полной переобработки.

Это сокращает время локальных вызовов инструментов с более минуты до примерно 4 секунд на оборудовании вроде Quadro RTX-8000 эпохи Turing.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Структура кода Claude, проверенная в нескольких реальных проектах
Гайды

Структура кода Claude, проверенная в нескольких реальных проектах

Разработчик делится настройкой Claude Code, которая выдержала 2-3 реальных проекта с несколькими навыками, MCP-серверами и агентами. Ключевые выводы включают использование CLAUDE MD для согласованности, разделение навыков по назначению, внедрение хуков и поддержание использования контекста ниже 60%.

OpenClawRadar
Запись на Reddit: Разработчикам нужны лучшие практики работы с ИИ, а не просто лучшие инструменты
Гайды

Запись на Reddit: Разработчикам нужны лучшие практики работы с ИИ, а не просто лучшие инструменты

В посте на Reddit утверждается, что недовольство разработчиков инструментами ИИ для написания кода проистекает из плохих практик составления промптов, а именно из использования «сырых промптов» без контекста или структуры. Автор рекомендует использовать каркасы, такие как CLAUDE.md, и структурированные рабочие процессы для получения готового к производству кода от Claude.

OpenClawRadar
Практические уроки по инженерии промптов из опыта работы с Claude Code
Гайды

Практические уроки по инженерии промптов из опыта работы с Claude Code

Менеджер проекта делится конкретными техниками, которые улучшили результаты Claude Code: двухфазные промпты, промпты с одной целью и очень специфичные определения ролей.

OpenClawRadar
Базовые модели маршрутизации для использования Claude и OpenAI
Гайды

Базовые модели маршрутизации для использования Claude и OpenAI

Разработчик делится своей стратегией маршрутизации моделей, используя Claude Haiku 4.5, Sonnet 4.6, Opus 4.6 и ChatGPT 5.3 Codex для различных типов задач, с резервными вариантами GPT-5 Mini и GPT-5.4 при необходимости.

OpenClawRadar