Исправление замедления OpenClaw в длительных сессиях: contextInjection continuation-skip для кэша llama.cpp

✍️ OpenClawRadar📅 Опубликовано: 30 июня 2026 г.🔗 Source
Исправление замедления OpenClaw в длительных сессиях: contextInjection continuation-skip для кэша llama.cpp
Ad

Если ваш локальный OpenClaw с llama.cpp со временем замедляется по мере роста сессий свыше 90k токенов, виновником может быть одна настройка OpenClaw, которая молча инвалидирует кэш промптов каждый ход. Пользователь на r/openclaw проследил проблему и нашел простое исправление.

Настройка

  • Qwen3.6-27B-Q8_0 на двух RTX 3090 (тензорный параллелизм)
  • llama-server с --cache-prompt, --ctx-size 400000, --parallel 2
  • OpenClaw, подключенный через локальную сеть

Симптомы

Логи llama-server показывали каждый ход:

forcing full prompt re-processing due to lack of cache data
erased invalidated context checkpoint (pos_min = 57172)
erased invalidated context checkpoint (pos_min = 60139)
erased invalidated context checkpoint (pos_min = 91076)
prompt eval time = 130511 ms / 91403 tokens

91k токенов обрабатывалось заново каждый ход — 130 секунд. Кэш был включен, точки сохранения существовали, но llama.cpp не находил совпадений и возвращался к полной переобработке.

Причина

Настройка OpenClaw contextInjection (значение по умолчанию always) повторно внедряет все файлы рабочего пространства (AGENTS.md, SOUL.md, USER.md, TOOLS.md, MEMORY.md, HEARTBEAT.md, ~15kb) в системный промпт каждый ход — включая ходы продолжения. Это меняет последовательность токенов, поэтому кэш промптов llama.cpp (основанный на точном совпадении префикса) не может быть использован повторно.

Ad

Исправление

openclaw config set agents.defaults.contextInjection continuation-skip --merge

Затем перезапустите шлюз. continuation-skip внедряет файлы только при новых сообщениях пользователя, но не при ходах продолжения, сохраняя стабильность промпта и валидность кэша.

Результаты

До: 91 403 токена переобрабатывалось каждый ход, 130 с на оценку промпта, 0% повторного использования кэша, более 2 минут на ответ.

После: 513 новых токенов за ход, 1,3 с на оценку промпта, 99,7% повторного использования кэша, ~5 секунд на ответ. В 100 раз быстрее.

Диагностика

ssh your-server "journalctl -u llama.service --no-pager -n 50 | grep -iE 'cache|re-process|checkpoint'"

Признаки сломанного кэша: forcing full prompt re-processing due to lack of cache data, повторяющиеся erased invalidated context checkpoint, обработка промпта свыше 30 секунд. Признаки здорового кэша: restored context checkpoint, f_keep = 0.99+, большое число graphs reused =, обработка промпта менее 5 секунд.

Также настройте --ctx-size до 400k (200k на сессию), contextTokens OpenClaw до 200k и memoryFlush.softThresholdTokens с 30k до 10k для дополнительных улучшений.

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

Руководство по настройке OpenClaw на VPS от Hostinger
Гайды

Руководство по настройке OpenClaw на VPS от Hostinger

Пошаговое руководство по развертыванию OpenClaw на VPS от Hostinger, подключению AI-API от OpenAI и Entropics, а также интеграции с Telegram для круглосуточной работы.

OpenClawRadar
Структурирование кодовых агентов Claude с помощью шаблонов CLAUDE.md и директории .claude/
Гайды

Структурирование кодовых агентов Claude с помощью шаблонов CLAUDE.md и директории .claude/

Разработчик делится своим подходом к запуску нескольких ИИ-агентов с помощью Claude Code, где каждый агент имеет свою собственную директорию с файлом CLAUDE.md и директорией .claude/ с правилами и навыками. Ключевая идея заключается в разделении постоянно активного контекста и рабочих процессов по требованию для оптимизации использования токенов и качества ответов.

OpenClawRadar
Практическое руководство по самостоятельному размещению вашей первой языковой модели (LLM)
Гайды

Практическое руководство по самостоятельному размещению вашей первой языковой модели (LLM)

В посте на Reddit перечислены причины для самостоятельного хостинга языковых моделей, включая конфиденциальность для чувствительных данных, предсказуемость затрат для агентских рабочих нагрузок, улучшение производительности за счёт исключения API-запросов и кастомизацию через методы тонкой настройки, такие как LoRA и QLoRA.

OpenClawRadar
Пользовательское приложение командного центра для OpenClaw: React PWA с WebSocket-прокси и Tailscale
Гайды

Пользовательское приложение командного центра для OpenClaw: React PWA с WebSocket-прокси и Tailscale

Разработчик построил командный центр в виде React PWA для своей установки OpenClaw, включающий живую панель агентов, торговый терминал и push-уведомления, используя паттерн WebSocket-прокси для соединения шлюза OpenClaw, работающего только с локальной петлей, с устройствами в сети Tailscale.

OpenClawRadar