Тестирование 88 малых моделей GGUF на Mac Mini M4 с 16 ГБ памяти.

✍️ OpenClawRadar📅 Опубликовано: 2 марта 2026 г.🔗 Source
Тестирование 88 малых моделей GGUF на Mac Mini M4 с 16 ГБ памяти.
Ad

Был разработан автоматизированный конвейер для загрузки, тестирования, загрузки на сервер и удаления моделей GGUF партиями на Mac Mini M4 с 16 ГБ унифицированной памяти. Конвейер протестировал 88 моделей, чтобы найти подходящие локальные LLM для данной конфигурации оборудования.

Ключевые выводы

  • 9 из 88 моделей непригодны для использования на 16 ГБ ОЗУ — Любая модель, где веса плюс кэш KV превышают примерно 14 ГБ, вызывает интенсивное своппирование памяти, что приводит к TTFT > 10 секунд или < 0,1 токенов/секунду. Это включает все плотные модели 27B+.
  • Только 4 модели находятся на границе Парето по пропускной способности и качеству — Все они имеют архитектуру LFM2-8B-A1B (MoE от LiquidAI с 1 млрд активных параметров). Дизайн MoE означает, что на каждый токен активно только около 1 млрд параметров, достигая 12-20 токенов/секунду, тогда как плотные модели 8B достигают максимум 5-7 токенов/секунду.
  • Масштабирование контекста с 1k до 4k не влияет на производительность — Большинство моделей не показывают снижения пропускной способности, а некоторые варианты LFM2 даже ускоряются при контексте 4k.
  • Масштабирование параллелизма слабое (0.57x при параллелизме 2 против идеальных 2.0x) — Mac Mini ограничен пропускной способностью памяти, поэтому рекомендуется запускать один запрос за раз.
Ad

Модели на границе Парето

Эти четыре модели превосходят все остальные как по скорости, так и по качеству:

  • LFM2-8B-A1B-Q5_K_M (unsloth): 14.24 TPS в среднем, оценка качества 44.6
  • LFM2-8B-A1B-Q8_0 (unsloth): 12.37 TPS в среднем, оценка качества 46.2
  • LFM2-8B-A1B-UD-Q8_K_XL (unsloth): 12.18 TPS в среднем, оценка качества 47.9
  • LFM2-8B-A1B-Q8_0 (LiquidAI): 12.18 TPS в среднем, оценка качества 51.2

Оценка качества использовала компактные подмножества (20 вопросов GSM8K + 60 вопросов MMLU) — полезно для ранжирования, но не для публикации абсолютных чисел.

Рекомендации

Для лучшего качества: LFM2-8B-A1B-Q8_0. Для скорости: Q5_K_M. Для баланса: UD-Q6_K_XL.

Технические детали

  • Оборудование: Mac Mini M4, 16 ГБ унифицированной памяти, macOS 15.x
  • Программное обеспечение: llama-server (llama.cpp)
  • Методология: Числа пропускной способности — это p50 по нескольким запросам
  • Данные: Все данные воспроизводимы из артефактов в репозитории

Весь конвейер автоматизирован и имеет открытый исходный код. CSV-данные со всеми 88 моделями и скрипты для тестирования доступны в репозитории.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

PocketTeam: Конвейер кода Claude с безопасностью на основе хуков и обучающимися агентами
Инструменты

PocketTeam: Конвейер кода Claude с безопасностью на основе хуков и обучающимися агентами

PocketTeam — это конвейер Claude Code, который реализует 9 уровней безопасности на уровне вызова инструментов для блокировки опасных операций, таких как запись в .env или команды rm -rf. Система включает агента-наблюдателя, который анализирует выполненные задачи и записывает структурированные выводы для повышения производительности будущих агентов.

OpenClawRadar
Анализ цен на модели OpenRouter и эффективности затрат на интеллектуальные возможности
Инструменты

Анализ цен на модели OpenRouter и эффективности затрат на интеллектуальные возможности

Пользователь Reddit собрал данные о ценах API OpenRouter для 16 моделей ИИ и рассчитал показатели интеллекта на доллар, определив MiMo-V2-Flash как лучшую по соотношению цены и качества при $0,09/М токенов, а GPT-5.4 — как самую интеллектуальную при $2,50/М токенов.

OpenClawRadar
Агентный контекстный движок: Автоматизированный цикл улучшения агентов с приростом точности на 34,2%
Инструменты

Агентный контекстный движок: Автоматизированный цикл улучшения агентов с приростом точности на 34,2%

Инструмент с открытым исходным кодом автоматизирует весь цикл улучшения агентов — от анализа трассировок до внедрения исправлений, обеспечивая повышение точности на 34,2% на Tau-2 Bench за одну итерацию. Система использует Claude Code в REPL-среде для анализа сбоев и принятия решений о корректировках промптов или кода.

OpenClawRadar
Динамическая строка состояния для Claude Code показывает обновления в реальном времени
Инструменты

Динамическая строка состояния для Claude Code показывает обновления в реальном времени

Разработчик улучшил свою строку состояния Claude Code, превратив её из статического текста в динамическое отображение с обновлениями в реальном времени, показывающими, над чем работает Claude. Конфигурация доступна в виде GitHub gist.

OpenClawRadar