Форк vllm-mlx добавляет вызов инструментов и кэширование промптов для локальных агентов ИИ в программировании.

Разработчик опубликовал модифицированную версию vllm-mlx, которая исправляет несколько проблем для запуска AI-агентов программирования, таких как OpenClaw, локально на Mac. Форк добавляет рабочий вызов инструментов и кэширование промптов в совместимый с OpenAI сервер для Apple Silicon.
Ключевые исправления и функции
Разработчик сделал 37 коммитов поверх основной версии vllm-mlx для решения конкретных проблем:
- Вызов инструментов: Добавлен флаг
--tool-call-parser hermes— вызовы инструментов Qwen3-Coder-Next работают из коробки - MiniMax-M2.5: Добавлен потоковый и непотоковый парсинг вызовов инструментов с точностью 4/4 в тестах на вызов функций (погода, поиск, выполнение кода, мультиинструменты)
- Кэш промптов: Добавлено постоянное KV-кэширование между запросами в SimpleEngine — одинаковый системный промпт и история диалога предзаполняют только новые токены
- Разделение рассуждений: Построен эвристический парсер для выводов MiniMax, где рассуждения были встроены без тегов — снижена частота утечек с 60% до 0%
Улучшения производительности
При контексте в 33K токенов время до первого токена (TTFT) улучшилось с 28 секунд до 0,3 секунды при попадании в кэш. Тесты на Mac Studio M3 Ultra 256GB:
- Qwen3-Coder-Next 4bit: 42 ГБ ОЗУ, 70 токенов/с декодирование, 1270 токенов/с предзаполнение
- Qwen3-Coder-Next 6bit: 60 ГБ ОЗУ, 65 токенов/с декодирование, 1090-1440 токенов/с предзаполнение
- Qwen3-Coder-Next 8bit: 75 ГБ ОЗУ, ~45 токенов/с декодирование, ~900 токенов/с предзаполнение
- MiniMax-M2.5 4bit: 120 ГБ ОЗУ, 33-38 токенов/с декодирование, 430-500 токенов/с предзаполнение
Разработчик рекомендует Qwen3-Coder-Next 6bit как оптимальный вариант для интерактивного программирования, отмечая, что качество заметно лучше, чем у 4bit (где иногда возникал искажённый вывод).
Инструкции по установке
pip install git+https://github.com/raullenchai/vllm-mlx.git
python -c "from mlx_lm import load; load('lmstudio-community/Qwen3-Coder-Next-MLX-6bit')"
python -m vllm_mlx.server \
--model lmstudio-community/Qwen3-Coder-Next-MLX-6bit \
--tool-call-parser hermes \
--prefill-step-size 8192 \
--kv-bits 8 \
--port 8000
Затем направьте OpenClaw или любой клиент OpenAI SDK на http://localhost:8000/v1.
Требования к оборудованию
- Qwen3-Coder-Next 4bit: 42 ГБ — помещается на M2 Pro 64 ГБ или лучше
- Qwen3-Coder-Next 6bit: 60 ГБ — требуется M2/M3/M4 Max 96 ГБ+ или Ultra
- MiniMax-M2.5: 120 ГБ — только Ultra 192 ГБ+
Что не сработало
- Спекулятивное декодирование с Qwen3-0.6B в качестве черновой модели — в mlx-lm есть известная ошибка с Qwen3 (пропуск токенов, issue #846)
- DeepSeek-R1-Distill-70B для OpenClaw — отлично справляется с рассуждениями, но вызов инструментов ненадёжен
Репозиторий содержит 1500+ тестов и лицензирован под Apache 2.0.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Гем Rails-AI-Context предоставляет коду Claude полную модель приложения Rails через MCP.
Гем rails-ai-context автоматически интроспектирует приложения на Rails и предоставляет 39 инструментов через MCP, позволяя Claude Code запрашивать конкретные детали приложения, такие как схема с зашифрованными столбцами, ассоциации моделей, маршруты, подключения Stimulus и сопоставления Turbo, вместо чтения всех файлов целиком.

Итан AI: Европейский хаб API для моделей ИИ — переориентируется как альтернатива OpenRouter
Eden AI предлагает единый унифицированный API для доступа к более чем 500 моделям ИИ (LLM, компьютерное зрение, OCR, речь) с умной маршрутизацией, механизмами отказоустойчивости и контролем региона. Позиционируется как европейская альтернатива OpenRouter.

Пользователь Reddit измеряет накладные расходы токенов MCP: 67 тысяч токенов потреблено ещё до постановки вопроса.
Разработчик измерил накладные расходы токенов своего MCP-сервера в 67 000 токенов, потреблённых до ввода первого вопроса, при этом Playwright MCP использовал 13 600 токенов, а GitHub MCP — 18 000 токенов в режиме простоя. Они заменили MCP на навыки и CLI-инструменты для снижения затрат контекста.

Клод Код Карма: Локальная панель мониторинга для сессий Claude Code
Claude Code Karma — это открытая локальная панель мониторинга, которая анализирует JSONL-файлы из ~/.claude/ для визуализации данных сессий Claude Code, отслеживания использования инструментов и мониторинга скрытых сбоев. Построенная на FastAPI, Svelte-Kit 2, Svelte 5 и SQLite, она предоставляет полные временные линии сессий и отслеживание в реальном времени.