Исправление замедления OpenClaw в длительных сессиях: contextInjection continuation-skip для кэша llama.cpp

✍️ OpenClawRadar📅 Опубликовано: 30 июня 2026 г.🔗 Source
Исправление замедления OpenClaw в длительных сессиях: contextInjection continuation-skip для кэша llama.cpp
Ad

Если ваш локальный OpenClaw с llama.cpp со временем замедляется по мере роста сессий свыше 90k токенов, виновником может быть одна настройка OpenClaw, которая молча инвалидирует кэш промптов каждый ход. Пользователь на r/openclaw проследил проблему и нашел простое исправление.

Настройка

  • Qwen3.6-27B-Q8_0 на двух RTX 3090 (тензорный параллелизм)
  • llama-server с --cache-prompt, --ctx-size 400000, --parallel 2
  • OpenClaw, подключенный через локальную сеть

Симптомы

Логи llama-server показывали каждый ход:

forcing full prompt re-processing due to lack of cache data
erased invalidated context checkpoint (pos_min = 57172)
erased invalidated context checkpoint (pos_min = 60139)
erased invalidated context checkpoint (pos_min = 91076)
prompt eval time = 130511 ms / 91403 tokens

91k токенов обрабатывалось заново каждый ход — 130 секунд. Кэш был включен, точки сохранения существовали, но llama.cpp не находил совпадений и возвращался к полной переобработке.

Причина

Настройка OpenClaw contextInjection (значение по умолчанию always) повторно внедряет все файлы рабочего пространства (AGENTS.md, SOUL.md, USER.md, TOOLS.md, MEMORY.md, HEARTBEAT.md, ~15kb) в системный промпт каждый ход — включая ходы продолжения. Это меняет последовательность токенов, поэтому кэш промптов llama.cpp (основанный на точном совпадении префикса) не может быть использован повторно.

Ad

Исправление

openclaw config set agents.defaults.contextInjection continuation-skip --merge

Затем перезапустите шлюз. continuation-skip внедряет файлы только при новых сообщениях пользователя, но не при ходах продолжения, сохраняя стабильность промпта и валидность кэша.

Результаты

До: 91 403 токена переобрабатывалось каждый ход, 130 с на оценку промпта, 0% повторного использования кэша, более 2 минут на ответ.

После: 513 новых токенов за ход, 1,3 с на оценку промпта, 99,7% повторного использования кэша, ~5 секунд на ответ. В 100 раз быстрее.

Диагностика

ssh your-server "journalctl -u llama.service --no-pager -n 50 | grep -iE 'cache|re-process|checkpoint'"

Признаки сломанного кэша: forcing full prompt re-processing due to lack of cache data, повторяющиеся erased invalidated context checkpoint, обработка промпта свыше 30 секунд. Признаки здорового кэша: restored context checkpoint, f_keep = 0.99+, большое число graphs reused =, обработка промпта менее 5 секунд.

Также настройте --ctx-size до 400k (200k на сессию), contextTokens OpenClaw до 200k и memoryFlush.softThresholdTokens с 30k до 10k для дополнительных улучшений.

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

🦀
Гайды

Исправление ошибки «Client disconnected» в LM Studio с OpenClaw: увеличьте тайм-аут зависшего встроенного запуска

Локальные модели не падали — встроенный сторожевой таймер OpenClaw прерывал медленную генерацию до появления первого токена. Увеличьте порог прерывания, чтобы исправить проблему.

OpenClawRadar
Как запускать агентов OpenClaw бесплатно с использованием облачных API или локальных моделей
Гайды

Как запускать агентов OpenClaw бесплатно с использованием облачных API или локальных моделей

Подробное руководство объясняет, как запускать агентов OpenClaw с нулевой стоимостью, используя бесплатные облачные тарифы от OpenRouter, Gemini и Groq, или запуская локальные модели через Ollama с конкретными советами по настройке, чтобы избежать распространённых ошибок.

OpenClawRadar
Практические уроки по инженерии промптов из опыта работы с Claude Code
Гайды

Практические уроки по инженерии промптов из опыта работы с Claude Code

Менеджер проекта делится конкретными техниками, которые улучшили результаты Claude Code: двухфазные промпты, промпты с одной целью и очень специфичные определения ролей.

OpenClawRadar
Claude Code v2.1.36: Fast Mode теперь доступен для Opus 4.6
Гайды

Claude Code v2.1.36: Fast Mode теперь доступен для Opus 4.6

Anthropic выпускает Claude Code v2.1.36 с поддержкой Fast Mode для новейшей модели Opus 4.6, обеспечивая значительно более быструю генерацию и анализ кода.

OpenClaw Radar