Qwen3.5-122B-A10B-MINT-MLX работает плавно на M5 Pro с 64 ГБ оперативной памяти.

✍️ OpenClawRadar📅 Опубликовано: 20 апреля 2026 г.🔗 Source
Qwen3.5-122B-A10B-MINT-MLX работает плавно на M5 Pro с 64 ГБ оперативной памяти.
Ad

Производительность локальных языковых моделей на Apple Silicon

Пользователь Reddit поделился своим опытом запуска модели Qwen3.5-122B-A10B-MINT-MLX локально на M5 Pro с 64 ГБ ОЗУ. Эта настройка демонстрирует, что большие языковые модели могут эффективно работать на потребительском оборудовании при правильной конфигурации.

Детали конфигурации

Пользователь добился плавной работы с помощью специальных терминальных команд для выделения видеопамяти:

sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440

В LM Studio они установили размер контекстного окна в 16384 токена. При такой конфигурации система сохраняла стабильную производительность во время работы Safari с несколькими вкладками, Messages и Activity Monitor одновременно.

Ad

Бенчмарки производительности

Модель Qwen3.5-122B-A10B-MINT-MLX показала следующие результаты:

  • Время до первого токена: 0,86 секунды
  • Скорость генерации токенов: 39,58 токенов/секунду

Пользователь отметил, что модель «правильно решила кучу загадок и немного поработала над кодом» без каких-либо нареканий на 3-битную MINT-квантозацию. Единственная проблема возникла, когда контекстное окно заполнилось при использовании около 59 ГБ видеопамяти, что привело к зависанию системы.

Сравнение с другими моделями

Пользователь также протестировал модель «Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8», которая оказалась точнее 122B-модели, но значительно медленнее:

  • Скорость генерации токенов: 6,93 токена/секунду
  • Обработка промптов оставалась быстрой, несмотря на медленную генерацию

Это демонстрирует компромисс между размером модели, квантозацией и скоростью вывода, с которым сталкиваются разработчики при выборе конфигураций локальных языковых моделей.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Claude Code Opus выдает ошибку ограничения частоты запросов, несмотря на наличие доступной недельной квоты.
Новости

Claude Code Opus выдает ошибку ограничения частоты запросов, несмотря на наличие доступной недельной квоты.

Подписчик Claude Max сообщает, что Claude Code Opus возвращает ошибку 'API Error: Rate limit reached', несмотря на то, что на его панели использования отображается 97% неиспользованной еженедельной ёмкости 'Все модели'. Проблема возникает именно в Claude Code, в то время как Opus нормально работает на claude.ai с того же аккаунта.

OpenClawRadar
Зависимость от ИИ: почему чрезмерное использование LLM может подорвать базовые навыки
Новости

Зависимость от ИИ: почему чрезмерное использование LLM может подорвать базовые навыки

Контр-интуитивное мнение, утверждающее, что сильная зависимость от AI-чат-ботов приведет к атрофии навыков критического мышления, письма, исследования и обучения.

OpenClawRadar
Антропный Клод проводит 80 тысяч структурированных интервью в качестве альтернативы опросам.
Новости

Антропный Клод проводит 80 тысяч структурированных интервью в качестве альтернативы опросам.

Anthropic использовала Claude для проведения структурированных интервью с примерно 80 000 пользователей из более чем 150 стран и 70+ языков, при этом языковая модель выступала как в роли интервьюера, так и аналитика для сбора разговорных данных.

OpenClawRadar
OpenClaw 2026.4.29 нарушает настройки: скачки ЦП, ограничения инструментов и исправления
Новости

OpenClaw 2026.4.29 нарушает настройки: скачки ЦП, ограничения инструментов и исправления

OpenClaw 2026.4.29 вызывает скачки нагрузки CPU из-за активного управления очередями, ограниченные профили инструментов ломают команды exec/fs, а также ужесточение обработки групповых чатов. Откатитесь или примените точечные исправления.

OpenClawRadar