Отладка тайм-утов OpenClaw + Ollama (локальная модель): пять решений для тихих сбоев

Проблема: Агенты OpenClaw беззвучно зависают с локальными моделями Ollama
Разработчик, отлаживающий OpenClaw 2026.4.2 с Ollama 0.20.2 и моделью Gemma 4 26B-A4B Q8_0 на Mac Studio M4 Max, обнаружил, что агенты не отвечают после команды /new, несмотря на мгновенную работу модели через ollama run. В логах не появлялись ошибки, и агент не показывал индикатор набора текста.
Основные причины и исправления
- Основная причина №1: Блокировка генератором слагов: Хук
session-memoryв OpenClaw запускает генератор слагов, который отправляет запрос в Ollama с жёстко заданным таймаутом в 15 секунд. Если модель не успевает обработать системный промпт OpenClaw за это время, OpenClaw отменяет запрос, но Ollama продолжает его обработку, блокируя последующие запросы агентов.
Исправление:openclaw hooks disable session-memory - Основная причина №2: Большой системный промпт: OpenClaw добавляет примерно 38 500 символов системного промпта (идентификация, инструменты, загрузочные файлы) в каждый запрос. Локальным моделям требуется 40-60 секунд для фазы предварительного заполнения.
Исправление: Добавить в конфигурацию для пропуска загрузочной инъекции и ограничения символов:
Это сокращает промпт до ~19 тысяч символов.{ "agents": { "defaults": { "skipBootstrap": true, "bootstrapTotalMaxChars": 500 } } } - Основная причина №3: Скрытый таймаут простоя: В OpenClaw есть параметр
DEFAULT_LLM_IDLE_TIMEOUT_MSсо значением 60 секунд. Если модель не генерирует первый токен за это время, соединение разрывается, и происходит беззвучный переход на резервную модель (например, Claude Sonnet).
Исправление: Установить недокументированный ключ конфигурации:{ "agents": { "defaults": { "llm": { "idleTimeoutSeconds": 300 } } } } - Основная причина №4: Последовательная обработка в Ollama: Ollama обрабатывает запросы последовательно, поэтому отменённые запросы генератора слагов могут занимать слоты обработки.
Исправление: Добавить в конфигурацию службы/plist Ollama:OLLAMA_NUM_PARALLEL=4 - Основная причина №5: Задержка режима размышления: Gemma 4 по умолчанию использует фазу размышления/рассуждения, которая добавляет 20-30 секунд перед первым токеном.
Исправление: Отключить в конфигурации:{ "agents": { "defaults": { "thinkingDefault": "off" } } }
Полная рабочая конфигурация
Разработчик предоставил эту полную конфигурацию для рабочей настройки:
{ "agents": { "defaults": { "model": { "primary": "ollama/gemma4:26b-a4b-it-q8_0", "fallbacks": ["anthropic/claude-sonnet-4-6"] }, "thinkingDefault": "off", "timeoutSeconds": 600, "skipBootstrap": true, "bootstrapTotalMaxChars": 500, "llm": { "idleTimeoutSeconds": 300 } } } }Дополнительно, закрепите модель в памяти, чтобы предотвратить её выгрузку между запросами:
curl http://localhost:11434/api/generate -d '{"model":"gemma4:26b-a4b-it-q8_0","keep_alive":-1,"options":{"num_ctx":16384}}'Результаты и компромиссы
После применения исправлений первое сообщение после /new занимает около 60 секунд из-за предварительного заполнения системного промпта, что описывается как неизбежное для локальных моделей. Последующие сообщения выполняются быстро, потому что Ollama кэширует состояние KV. Настройка использует 31 ГБ видеопамяти, 100% GPU и окно контекста в 16 тысяч токенов, работая полностью локально без затрат на API.
Начальная задержка — это компромисс за полностью локальную работу, конфиденциальность и отсутствие затрат. Разработчик отмечает, что это того стоит, если эти факторы являются приоритетными.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Карты потока: обучение интегралу диффузионной модели для ускоренной выборки
Сандер Дилеман объясняет карты потоков — нейронные сети, которые напрямую предсказывают интеграл ОДУ диффузионной модели, обеспечивая более быструю семплировку, обучение на основе вознаграждения и управляемость.

Исправления вызова инструментов Qwen 3.5 для агентского использования: статус сервера и обходные решения на стороне клиента
Подробный анализ выявляет четыре ошибки, которые нарушают работу вызова инструментов Qwen 3.5 в агентских настройках, отслеживает исправления серверов по состоянию на апрель 2026 года и предоставляет клиентскую функцию на Python для парсинга XML-вызовов инструментов при сбоях серверов.

Разработчик iOS делится лучшими практиками написания кода для Claude после выпуска нескольких приложений
iOS-разработчик с опытом в кибербезопасности описывает конкретные практики эффективного использования Claude Code, включая разделение сред, настройку наблюдаемости и предотвращение накопления технического долга.
