Исправление замедления OpenClaw в длительных сессиях: contextInjection continuation-skip для кэша llama.cpp

Если ваш локальный OpenClaw с llama.cpp со временем замедляется по мере роста сессий свыше 90k токенов, виновником может быть одна настройка OpenClaw, которая молча инвалидирует кэш промптов каждый ход. Пользователь на r/openclaw проследил проблему и нашел простое исправление.
Настройка
- Qwen3.6-27B-Q8_0 на двух RTX 3090 (тензорный параллелизм)
- llama-server с
--cache-prompt,--ctx-size 400000,--parallel 2 - OpenClaw, подключенный через локальную сеть
Симптомы
Логи llama-server показывали каждый ход:
forcing full prompt re-processing due to lack of cache data
erased invalidated context checkpoint (pos_min = 57172)
erased invalidated context checkpoint (pos_min = 60139)
erased invalidated context checkpoint (pos_min = 91076)
prompt eval time = 130511 ms / 91403 tokens91k токенов обрабатывалось заново каждый ход — 130 секунд. Кэш был включен, точки сохранения существовали, но llama.cpp не находил совпадений и возвращался к полной переобработке.
Причина
Настройка OpenClaw contextInjection (значение по умолчанию always) повторно внедряет все файлы рабочего пространства (AGENTS.md, SOUL.md, USER.md, TOOLS.md, MEMORY.md, HEARTBEAT.md, ~15kb) в системный промпт каждый ход — включая ходы продолжения. Это меняет последовательность токенов, поэтому кэш промптов llama.cpp (основанный на точном совпадении префикса) не может быть использован повторно.
Исправление
openclaw config set agents.defaults.contextInjection continuation-skip --mergeЗатем перезапустите шлюз. continuation-skip внедряет файлы только при новых сообщениях пользователя, но не при ходах продолжения, сохраняя стабильность промпта и валидность кэша.
Результаты
До: 91 403 токена переобрабатывалось каждый ход, 130 с на оценку промпта, 0% повторного использования кэша, более 2 минут на ответ.
После: 513 новых токенов за ход, 1,3 с на оценку промпта, 99,7% повторного использования кэша, ~5 секунд на ответ. В 100 раз быстрее.
Диагностика
ssh your-server "journalctl -u llama.service --no-pager -n 50 | grep -iE 'cache|re-process|checkpoint'"Признаки сломанного кэша: forcing full prompt re-processing due to lack of cache data, повторяющиеся erased invalidated context checkpoint, обработка промпта свыше 30 секунд. Признаки здорового кэша: restored context checkpoint, f_keep = 0.99+, большое число graphs reused =, обработка промпта менее 5 секунд.
Также настройте --ctx-size до 400k (200k на сессию), contextTokens OpenClaw до 200k и memoryFlush.softThresholdTokens с 30k до 10k для дополнительных улучшений.
📖 Читать полный источник: r/openclaw
👀 Смотрите также

Руководство по настройке OpenClaw на VPS от Hostinger
Пошаговое руководство по развертыванию OpenClaw на VPS от Hostinger, подключению AI-API от OpenAI и Entropics, а также интеграции с Telegram для круглосуточной работы.

Структурирование кодовых агентов Claude с помощью шаблонов CLAUDE.md и директории .claude/
Разработчик делится своим подходом к запуску нескольких ИИ-агентов с помощью Claude Code, где каждый агент имеет свою собственную директорию с файлом CLAUDE.md и директорией .claude/ с правилами и навыками. Ключевая идея заключается в разделении постоянно активного контекста и рабочих процессов по требованию для оптимизации использования токенов и качества ответов.

Практическое руководство по самостоятельному размещению вашей первой языковой модели (LLM)
В посте на Reddit перечислены причины для самостоятельного хостинга языковых моделей, включая конфиденциальность для чувствительных данных, предсказуемость затрат для агентских рабочих нагрузок, улучшение производительности за счёт исключения API-запросов и кастомизацию через методы тонкой настройки, такие как LoRA и QLoRA.

Пользовательское приложение командного центра для OpenClaw: React PWA с WebSocket-прокси и Tailscale
Разработчик построил командный центр в виде React PWA для своей установки OpenClaw, включающий живую панель агентов, торговый терминал и push-уведомления, используя паттерн WebSocket-прокси для соединения шлюза OpenClaw, работающего только с локальной петлей, с устройствами в сети Tailscale.