oMLX представляет SSD KV кэширование для Apple Silicon, сокращая время ответа OpenClaw с 30-90 секунд до 5 секунд.

Что решает oMLX
Запуск OpenClaw локально обычно означает отправку одного и того же огромного системного промпта (20-30 тысяч токенов, охватывающих инструменты, навыки, контекст рабочей области) при каждом запросе. Хотя Ollama и LM Studio кэшируют KV-состояние, они инвалидируют весь кэш и пересчитывают его с нуля при смене контекста в середине сессии, что приводит к времени ответа в 30-90 секунд.
oMLX решает эту проблему, сохраняя блоки KV-кэша на SSD в формате safetensors. Когда возвращается ранее увиденный префикс, он восстанавливается с диска вместо пересчёта — это работает между запросами и перезапусками сервера. Поскольку системный промпт OpenClaw в основном статичен (меняются только временные метки и метаданные времени выполнения), кэширование на SSD означает, что пересчитываются только изменённые части.
Бенчмарки производительности
Протестировано на Qwen3.5-122B-A10B-4bit на M3 Ultra 512GB:
- Бенчмарки одиночного запроса:
- Контекст 1k: 768 ток/с обработки промпта, 56.6 ток/с генерации, пиковая память 65.5 ГБ
- Контекст 8k: 940 ток/с обработки промпта, 51.4 ток/с генерации, пиковая память 69.3 ГБ
- Контекст 32k: 764 ток/с обработки промпта, 42.4 ток/с генерации, пиковая память 73.4 ГБ
- Непрерывное батчирование (pp1024/tg128):
- Батч 1x: 56.6 ток/с, ускорение 1.00x
- Батч 2x: 92.1 ток/с, ускорение 1.63x
- Батч 4x: 135.1 ток/с, ускорение 2.39x
- Батч 8x: 190.2 ток/с, ускорение 3.36x
Настройка с OpenClaw
- Скачайте DMG из релизов и перетащите в Applications
- Укажите путь к каталогу с моделями (использует модели LM Studio, повторная загрузка не требуется)
- Добавьте oMLX как пользовательского провайдера в openclaw.json
- Веб-панель генерирует точную конфигурацию — терминал не нужен
Дополнительные возможности
- Обслуживание нескольких моделей: LLM + эмбеддинг + реранкер одновременно
- Вызов инструментов для всех основных форматов (JSON, Qwen, Gemma, GLM) + MCP
- Обрезка результатов инструментов — усекает слишком большие выходные данные инструментов
- Полная совместимость с OpenAI + Anthropic /v1/messages
- Нативное приложение для macOS в строке меню (не Electron)
- Лицензия Apache 2.0, 100% открытый исходный код
📖 Read the full source: r/openclaw
👀 Смотрите также

Библиотека ведения журналов с открытым исходным кодом для соответствия Статье 12 Закона ЕС об искусственном интеллекте
Бесплатная библиотека с открытым исходным кодом на TypeScript для приложений Node.js, использующих Vercel AI SDK, которая реализует требования к ведению журналов по Статье 12 с помощью журналов только для добавления в формате JSONL, цепочки хешей SHA-256 для обнаружения несанкционированных изменений и принудительного хранения в течение 180 дней.
Публикация сообщений Claude в LinkedIn прямо из чата: полное руководство
Пользователь Reddit делится рабочим процессом использования коннектора Contentdrips MCP для написания, оформления и публикации постов в LinkedIn прямо из чата Claude AI.

Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude
Разработчик создал tortuise — чисто терминальный 3D-рендерер, отображающий гауссовы сплаты с помощью символов Unicode и ASCII, построенный за 3 дня с использованием 70-80 ИИ-агентов, скоординированных через настройку Claude Code с подагентами внутри подагентов.

Превратите свою базу знаний в вики-сервер + MCP для Claude
Демонстрация того, как Akyn превращает базу знаний (URL, PDF, Notion) в вики и предоставляет ее в качестве MCP-сервера, позволяя Клоду запрашивать и записывать данные — с OAuth, контролем со стороны человека и автосинхронизацией.