Qwen3.5-122B-A10B-MINT-MLX работает плавно на M5 Pro с 64 ГБ оперативной памяти.

✍️ OpenClawRadar📅 Опубликовано: 20 апреля 2026 г.🔗 Source
Qwen3.5-122B-A10B-MINT-MLX работает плавно на M5 Pro с 64 ГБ оперативной памяти.
Ad

Производительность локальных языковых моделей на Apple Silicon

Пользователь Reddit поделился своим опытом запуска модели Qwen3.5-122B-A10B-MINT-MLX локально на M5 Pro с 64 ГБ ОЗУ. Эта настройка демонстрирует, что большие языковые модели могут эффективно работать на потребительском оборудовании при правильной конфигурации.

Детали конфигурации

Пользователь добился плавной работы с помощью специальных терминальных команд для выделения видеопамяти:

sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440

В LM Studio они установили размер контекстного окна в 16384 токена. При такой конфигурации система сохраняла стабильную производительность во время работы Safari с несколькими вкладками, Messages и Activity Monitor одновременно.

Ad

Бенчмарки производительности

Модель Qwen3.5-122B-A10B-MINT-MLX показала следующие результаты:

  • Время до первого токена: 0,86 секунды
  • Скорость генерации токенов: 39,58 токенов/секунду

Пользователь отметил, что модель «правильно решила кучу загадок и немного поработала над кодом» без каких-либо нареканий на 3-битную MINT-квантозацию. Единственная проблема возникла, когда контекстное окно заполнилось при использовании около 59 ГБ видеопамяти, что привело к зависанию системы.

Сравнение с другими моделями

Пользователь также протестировал модель «Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8», которая оказалась точнее 122B-модели, но значительно медленнее:

  • Скорость генерации токенов: 6,93 токена/секунду
  • Обработка промптов оставалась быстрой, несмотря на медленную генерацию

Это демонстрирует компромисс между размером модели, квантозацией и скоростью вывода, с которым сталкиваются разработчики при выборе конфигураций локальных языковых моделей.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Системные промпты Claude Code версии 2.1.51/52: Новые промпты, обновления SDK и функции общего доступа
Новости

Системные промпты Claude Code версии 2.1.51/52: Новые промпты, обновления SDK и функции общего доступа

В версиях 2.1.51 и 2.1.52 Claude Code добавлены шесть новых системных промптов, обновлены ссылки на SDK/API для семи языков программирования, а функции выполнения кода и памяти переведены в статус общедоступности. Python Agent SDK был переработан с изменениями в асинхронности и новыми интерфейсами.

OpenClawRadar
Разработчик предпочитает Qwen3.5-27B проприетарным моделям из-за её режима отказа.
Новости

Разработчик предпочитает Qwen3.5-27B проприетарным моделям из-за её режима отказа.

Разработчик на r/LocalLLaMA сообщает, что предпочитает Qwen3.5-27B перед Gemini 3.1 Pro и GPT-5.3 Codex, потому что он отказывается от проблемных задач, вместо того чтобы генерировать потенциально опасный код, такой как неограниченные скрипты на Perl или NodeJS.

OpenClawRadar
WSJ: Генеральные директора перед жестким выбором в сфере ИИ – увольнения или увеличение нагрузки
Новости

WSJ: Генеральные директора перед жестким выбором в сфере ИИ – увольнения или увеличение нагрузки

WSJ сообщает, что генеральные директора выбирают между увольнением сотрудников или увеличением их нагрузки, поскольку инструменты ИИ обещают рост производительности. 11 очков на обсуждении HN.

OpenClawRadar
ThermoQA: Открытый эталон для инженерной термодинамики, тестирующий большие языковые модели на 293 расчетных задачах
Новости

ThermoQA: Открытый эталон для инженерной термодинамики, тестирующий большие языковые модели на 293 расчетных задачах

ThermoQA — это открытый бенчмарк с 293 задачами по инженерной термодинамике, разделёнными на три уровня, который проверяет большие языковые модели на точные численные расчёты. Claude Opus 4.6 лидирует с совокупным результатом 94,1%, в то время как DeepSeek-R1 демонстрирует наибольшую вариативность между запусками — ±2,5%.

OpenClawRadar