Отладка тайм-утов OpenClaw + Ollama (локальная модель): пять решений для тихих сбоев

✍️ OpenClawRadar📅 Опубликовано: 15 апреля 2026 г.🔗 Source
Отладка тайм-утов OpenClaw + Ollama (локальная модель): пять решений для тихих сбоев
Ad

Проблема: Агенты OpenClaw беззвучно зависают с локальными моделями Ollama

Разработчик, отлаживающий OpenClaw 2026.4.2 с Ollama 0.20.2 и моделью Gemma 4 26B-A4B Q8_0 на Mac Studio M4 Max, обнаружил, что агенты не отвечают после команды /new, несмотря на мгновенную работу модели через ollama run. В логах не появлялись ошибки, и агент не показывал индикатор набора текста.

Основные причины и исправления

  • Основная причина №1: Блокировка генератором слагов: Хук session-memory в OpenClaw запускает генератор слагов, который отправляет запрос в Ollama с жёстко заданным таймаутом в 15 секунд. Если модель не успевает обработать системный промпт OpenClaw за это время, OpenClaw отменяет запрос, но Ollama продолжает его обработку, блокируя последующие запросы агентов.
    Исправление: openclaw hooks disable session-memory
  • Основная причина №2: Большой системный промпт: OpenClaw добавляет примерно 38 500 символов системного промпта (идентификация, инструменты, загрузочные файлы) в каждый запрос. Локальным моделям требуется 40-60 секунд для фазы предварительного заполнения.
    Исправление: Добавить в конфигурацию для пропуска загрузочной инъекции и ограничения символов:
    { "agents": { "defaults": { "skipBootstrap": true, "bootstrapTotalMaxChars": 500 } } }
    Это сокращает промпт до ~19 тысяч символов.
  • Основная причина №3: Скрытый таймаут простоя: В OpenClaw есть параметр DEFAULT_LLM_IDLE_TIMEOUT_MS со значением 60 секунд. Если модель не генерирует первый токен за это время, соединение разрывается, и происходит беззвучный переход на резервную модель (например, Claude Sonnet).
    Исправление: Установить недокументированный ключ конфигурации:
    { "agents": { "defaults": { "llm": { "idleTimeoutSeconds": 300 } } } }
  • Основная причина №4: Последовательная обработка в Ollama: Ollama обрабатывает запросы последовательно, поэтому отменённые запросы генератора слагов могут занимать слоты обработки.
    Исправление: Добавить в конфигурацию службы/plist Ollama: OLLAMA_NUM_PARALLEL=4
  • Основная причина №5: Задержка режима размышления: Gemma 4 по умолчанию использует фазу размышления/рассуждения, которая добавляет 20-30 секунд перед первым токеном.
    Исправление: Отключить в конфигурации:
    { "agents": { "defaults": { "thinkingDefault": "off" } } }
Ad

Полная рабочая конфигурация

Разработчик предоставил эту полную конфигурацию для рабочей настройки:

{ "agents": { "defaults": { "model": { "primary": "ollama/gemma4:26b-a4b-it-q8_0", "fallbacks": ["anthropic/claude-sonnet-4-6"] }, "thinkingDefault": "off", "timeoutSeconds": 600, "skipBootstrap": true, "bootstrapTotalMaxChars": 500, "llm": { "idleTimeoutSeconds": 300 } } } }

Дополнительно, закрепите модель в памяти, чтобы предотвратить её выгрузку между запросами:

curl http://localhost:11434/api/generate -d '{"model":"gemma4:26b-a4b-it-q8_0","keep_alive":-1,"options":{"num_ctx":16384}}'

Результаты и компромиссы

После применения исправлений первое сообщение после /new занимает около 60 секунд из-за предварительного заполнения системного промпта, что описывается как неизбежное для локальных моделей. Последующие сообщения выполняются быстро, потому что Ollama кэширует состояние KV. Настройка использует 31 ГБ видеопамяти, 100% GPU и окно контекста в 16 тысяч токенов, работая полностью локально без затрат на API.

Начальная задержка — это компромисс за полностью локальную работу, конфиденциальность и отсутствие затрат. Разработчик отмечает, что это того стоит, если эти факторы являются приоритетными.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Карты потока: обучение интегралу диффузионной модели для ускоренной выборки
Гайды

Карты потока: обучение интегралу диффузионной модели для ускоренной выборки

Сандер Дилеман объясняет карты потоков — нейронные сети, которые напрямую предсказывают интеграл ОДУ диффузионной модели, обеспечивая более быструю семплировку, обучение на основе вознаграждения и управляемость.

OpenClawRadar
Исправления вызова инструментов Qwen 3.5 для агентского использования: статус сервера и обходные решения на стороне клиента
Гайды

Исправления вызова инструментов Qwen 3.5 для агентского использования: статус сервера и обходные решения на стороне клиента

Подробный анализ выявляет четыре ошибки, которые нарушают работу вызова инструментов Qwen 3.5 в агентских настройках, отслеживает исправления серверов по состоянию на апрель 2026 года и предоставляет клиентскую функцию на Python для парсинга XML-вызовов инструментов при сбоях серверов.

OpenClawRadar
Разработчик iOS делится лучшими практиками написания кода для Claude после выпуска нескольких приложений
Гайды

Разработчик iOS делится лучшими практиками написания кода для Claude после выпуска нескольких приложений

iOS-разработчик с опытом в кибербезопасности описывает конкретные практики эффективного использования Claude Code, включая разделение сред, настройку наблюдаемости и предотвращение накопления технического долга.

OpenClawRadar
OpenClaw 101: краткое руководство для начинающих
Гайды

OpenClaw 101: краткое руководство для начинающих

u/mehdiweb