Бенчмарк: MLX vs Ollama, запуск Qwen3-Coder-Next 8-Bit на MacBook Pro M5 Max

✍️ OpenClawRadar📅 Опубликовано: 16 апреля 2026 г.🔗 Source
Бенчмарк: MLX vs Ollama, запуск Qwen3-Coder-Next 8-Bit на MacBook Pro M5 Max
Ad

Был проведен бенчмарк, сравнивающий два локальных бэкенда для вывода — MLX (родной фреймворк машинного обучения Apple) и Ollama (основанный на llama.cpp) — работающие с одной и той же моделью Qwen3-Coder-Next в 8-битном квантовании на Apple Silicon. Целью было измерить чистую пропускную способность (токенов в секунду), время до первого токена (TTFT) и общую способность к программированию в реальных задачах.

Методология

Использовалась следующая настройка:

  • Бэкенд MLX: mlx-lm v0.29.1, обслуживающий mlx-community/Qwen3-Coder-Next-8bit через встроенный HTTP-сервер, совместимый с OpenAI, на порту 8080.
  • Бэкенд Ollama: Ollama, обслуживающий qwen3-coder-next:Q8_0 через свой API, совместимый с OpenAI, на порту 11434.

Оба бэкенда были доступны через один и тот же Python-скрипт для бенчмаркинга с использованием клиентской библиотеки OpenAI с включенной потоковой передачей. Каждый тест выполнялся по 3 итерации на промпт, результаты усреднялись, при этом первая итерация TTFT для начального промпта с холодным стартом (загрузка модели) исключалась.

Набор тестов

Шесть промптов охватывали спектр задач программирования:

  • Короткое завершение: Написать функцию проверки на палиндром (максимум 150 токенов)
  • Средняя генерация: Реализовать класс LRU-кэша с аннотацией типов (максимум 500 токенов)
  • Длинное рассуждение: Объяснить async/await в сравнении с потоками с примерами (максимум 1000 токенов)
  • Задача отладки: Найти и исправить ошибки в сортировке слиянием + бинарном поиске (максимум 800 токенов)
  • Сложное программирование: Потокобезопасная ограниченная блокирующая очередь с контекстным менеджером (максимум 1000 токенов)
  • Ревью кода: Проверить 3 функции на производительность/корректность/стиль (максимум 1000 токенов)
Ad

Результаты

Пропускная способность (токенов в секунду) на M5 Max с 128 ГБ ОЗУ:

  • Короткое завершение: Ollama 32.51 ток/с, MLX 69.62 ток/с (MLX +114%)
  • Средняя генерация: Ollama 35.97 ток/с, MLX 78.28 ток/с (MLX +118%)
  • Длинное рассуждение: Ollama 40.45 ток/с, MLX 78.29 ток/с (MLX +94%)
  • Задача отладки: Ollama 37.06 ток/с, MLX 74.89 ток/с (MLX +102%)
  • Сложное программирование: Ollama 35.84 ток/с, MLX 76.99 ток/с (MLX +115%)
  • Ревью кода: Ollama 39.00 ток/с, MLX 74.98 ток/с (MLX +92%)

Общий средний показатель: MLX достиг примерно 72 токенов в секунду, что примерно вдвое превышает пропускную способность Ollama. Измеряемые метрики включали токенов/сек (сгенерированные выходные токены в секунду, чем больше, тем лучше), TTFT (время от отправки запроса до получения первого токена, чем меньше, тем лучше), общее время (настенное время для полного ответа, чем меньше, тем лучше) и использование памяти, измеренное через psutil.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Солоноватый: Пусть два экземпляра Claude Code согласуют контракт API через OpenAPI 3.1
Инструменты

Солоноватый: Пусть два экземпляра Claude Code согласуют контракт API через OpenAPI 3.1

Brackish — это CLI-инструмент, который запускается между двумя сессиями Claude Code — одна на бэкенде (FastAPI), другая на фронтенде (React/TypeScript) — для согласования API-контракта через общий документ OpenAPI 3.1. Он выявляет разногласия до того, как будет написан код.

OpenClawRadar
Разработчик OpenClaw создает унифицированную систему памяти для ИИ-агентов.
Инструменты

Разработчик OpenClaw создает унифицированную систему памяти для ИИ-агентов.

Разработчик создал единую систему памяти из 15 инструментов для агентов OpenClaw AI, которая объединяет структурированные факты, векторный поиск, графы сущностей, временные линии эпизодов, иерархическое сжатие и событийную координацию. Система работает локально без зависимостей от облачных сервисов и ежемесячных платежей.

OpenClawRadar
Team Memory MCP: Открытый исходный код общей памяти для Claude Code с байесовской оценкой уверенности
Инструменты

Team Memory MCP: Открытый исходный код общей памяти для Claude Code с байесовской оценкой уверенности

Team Memory MCP — это инструмент с открытым исходным кодом, который предоставляет общую память для команды в Claude Code с байесовской оценкой уверенности. Он использует модель Бета-Бернулли для ранжирования паттернов, включает временное затухание с периодом полураспада 90 дней и может быть добавлен в Claude Code одной командой.

OpenClawRadar
BigNumberTheory: Сеть для обмена опытом между кодовыми агентами Claude
Инструменты

BigNumberTheory: Сеть для обмена опытом между кодовыми агентами Claude

BigNumberTheory — это сообщество, где агенты Claude Code делятся и получают уроки из реальных сессий отладки. Для настройки требуется одна команда, и в настоящее время сервис бесплатный: в сети уже опубликовано более 700 опытов, а доставлено — свыше 1100.

OpenClawRadar