Совет по производительности: закрепите VRAM/RAM локальной модели с помощью LimitMEMLOCK=infinity
Если ваша локальная модель помещается в суммарную VRAM и RAM, можно удержать память провайдера модели в резидентном состоянии, добавив LimitMEMLOCK=infinity под заголовком [Service] в systemd-юните вашего провайдера. Тогда ядро перестанет выгружать веса модели на диск — а именно из-за этого возникает большая часть замедлений после загрузки модели.
Файл юнита
Опубликовано в r/openclaw как рабочий пример для LM Studio (замените пути и имена пользователей на свои):
[Unit] Description=LM Studio Server RequiresMountsFor=/home[Service] LimitMEMLOCK=infinity Type=oneshot RemainAfterExit=yes User=******** Environment="HOME=/home/" ExecStartPre=/home//.lmstudio/bin/lms daemon up ExecStartPre=/home//.lmstudio/bin/lms load text-embedding-bge-large-en-v1.5 --yes ExecStartPre=/home//.lmstudio/bin/lms load qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive --yes ExecStart=/home//.lmstudio/bin/lms server start ExecStop=/home//.lmstudio/bin/lms daemon down
[Install] WantedBy=multi-user.target
Что делает каждая часть
LimitMEMLOCK=infinity— снимает стандартный лимит mlock на процесс, поэтому загруженную модель можно удерживать вне swap/подкачки.ExecStartPreсlms daemon up— запускает демон LM Studio до всего остального.lms load <model> --yes— предзагружает каждую модель при старте службы. В примере загружаются модель эмбеддингов (text-embedding-bge-large-en-v1.5) и чат-модель (qwen3.6-35b-a3b-uncensored-hauhaucs-aggressive).lms server startкакExecStart— поднимает сервер, совместимый с OpenAI API.lms daemon downкакExecStop— завершает работу при остановке.RequiresMountsFor=/home— гарантирует, что раздел home с файлами моделей смонтирован до запуска службы.Type=oneshot+RemainAfterExit=yes— юнит считается активным после завершения стартовых команд, что подходит для демона, которым отдельно управляет CLIlms.
Оговорка
Совет явно предполагает, что модель помещается в VRAM+RAM. Если это не так, блокировка памяти — не тот рычаг: вы просто перенесёте проблему в другое место. А когда модель помещается, выигрыш в том, что удаётся избежать простоев вывода из-за подкачки.
Чтобы применить: вставьте блок в файл юнита, затем выполните systemctl daemon-reload и перезапустите службу. Целевая аудитория — разработчики, запускающие LM Studio без графического интерфейса как службу systemd; та же идея применима к любому процессу провайдера, чьи веса вы хотите закрепить в памяти.
📖 Читать полный источник: r/openclaw
👀 Смотрите также

Telegram: Неотвечающие агенты OpenClaw после первой недели: Проблемы интеграции?
Пользователь сообщает, что агенты OpenClaw замолкают после первой недели, подозревая проблемы с интеграцией Telegram или долгосрочной работой. Перезапуск временно помогает.

Раздувание токенов в фреймворках агентов: соотношение ввода к выводу 500:1 — это норма
Пользователь саморазмещенного фреймворка для агентов сообщает о ~21 тыс. входных токенов на сообщение и соотношении входных и выходных данных 500:1 из-за определений инструментов, системного промпта и памяти. Сообщество подтверждает, что базовый контекст в 15-25 тыс. токенов является обычным для агентов, использующих инструменты.
Остановить OpenClaw от создания нескольких локальных экземпляров LLM в LM Studio
Пользователь сообщает, что OpenClaw запускает дублирующиеся локальные экземпляры LLM (Qwen 3.5 9B через LM Studio) на 16GB Mac Mini M1, вызывая таймауты и истощение ресурсов. Ищет способ принудительно включить режим единой очереди.

Не просто вставляйте ИИ — напишите свою собственную версию
Прямое обращение к разработчикам: перестаньте копировать ответы AI-чатботов слово в слово. Используйте AI как черновик, а затем перепишите ответ своими словами.