Тестирование 88 малых моделей GGUF на Mac Mini M4 с 16 ГБ памяти.

Был разработан автоматизированный конвейер для загрузки, тестирования, загрузки на сервер и удаления моделей GGUF партиями на Mac Mini M4 с 16 ГБ унифицированной памяти. Конвейер протестировал 88 моделей, чтобы найти подходящие локальные LLM для данной конфигурации оборудования.
Ключевые выводы
- 9 из 88 моделей непригодны для использования на 16 ГБ ОЗУ — Любая модель, где веса плюс кэш KV превышают примерно 14 ГБ, вызывает интенсивное своппирование памяти, что приводит к TTFT > 10 секунд или < 0,1 токенов/секунду. Это включает все плотные модели 27B+.
- Только 4 модели находятся на границе Парето по пропускной способности и качеству — Все они имеют архитектуру LFM2-8B-A1B (MoE от LiquidAI с 1 млрд активных параметров). Дизайн MoE означает, что на каждый токен активно только около 1 млрд параметров, достигая 12-20 токенов/секунду, тогда как плотные модели 8B достигают максимум 5-7 токенов/секунду.
- Масштабирование контекста с 1k до 4k не влияет на производительность — Большинство моделей не показывают снижения пропускной способности, а некоторые варианты LFM2 даже ускоряются при контексте 4k.
- Масштабирование параллелизма слабое (0.57x при параллелизме 2 против идеальных 2.0x) — Mac Mini ограничен пропускной способностью памяти, поэтому рекомендуется запускать один запрос за раз.
Модели на границе Парето
Эти четыре модели превосходят все остальные как по скорости, так и по качеству:
- LFM2-8B-A1B-Q5_K_M (unsloth): 14.24 TPS в среднем, оценка качества 44.6
- LFM2-8B-A1B-Q8_0 (unsloth): 12.37 TPS в среднем, оценка качества 46.2
- LFM2-8B-A1B-UD-Q8_K_XL (unsloth): 12.18 TPS в среднем, оценка качества 47.9
- LFM2-8B-A1B-Q8_0 (LiquidAI): 12.18 TPS в среднем, оценка качества 51.2
Оценка качества использовала компактные подмножества (20 вопросов GSM8K + 60 вопросов MMLU) — полезно для ранжирования, но не для публикации абсолютных чисел.
Рекомендации
Для лучшего качества: LFM2-8B-A1B-Q8_0. Для скорости: Q5_K_M. Для баланса: UD-Q6_K_XL.
Технические детали
- Оборудование: Mac Mini M4, 16 ГБ унифицированной памяти, macOS 15.x
- Программное обеспечение: llama-server (llama.cpp)
- Методология: Числа пропускной способности — это p50 по нескольким запросам
- Данные: Все данные воспроизводимы из артефактов в репозитории
Весь конвейер автоматизирован и имеет открытый исходный код. CSV-данные со всеми 88 моделями и скрипты для тестирования доступны в репозитории.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

PocketTeam: Конвейер кода Claude с безопасностью на основе хуков и обучающимися агентами
PocketTeam — это конвейер Claude Code, который реализует 9 уровней безопасности на уровне вызова инструментов для блокировки опасных операций, таких как запись в .env или команды rm -rf. Система включает агента-наблюдателя, который анализирует выполненные задачи и записывает структурированные выводы для повышения производительности будущих агентов.

Анализ цен на модели OpenRouter и эффективности затрат на интеллектуальные возможности
Пользователь Reddit собрал данные о ценах API OpenRouter для 16 моделей ИИ и рассчитал показатели интеллекта на доллар, определив MiMo-V2-Flash как лучшую по соотношению цены и качества при $0,09/М токенов, а GPT-5.4 — как самую интеллектуальную при $2,50/М токенов.

Агентный контекстный движок: Автоматизированный цикл улучшения агентов с приростом точности на 34,2%
Инструмент с открытым исходным кодом автоматизирует весь цикл улучшения агентов — от анализа трассировок до внедрения исправлений, обеспечивая повышение точности на 34,2% на Tau-2 Bench за одну итерацию. Система использует Claude Code в REPL-среде для анализа сбоев и принятия решений о корректировках промптов или кода.

Динамическая строка состояния для Claude Code показывает обновления в реальном времени
Разработчик улучшил свою строку состояния Claude Code, превратив её из статического текста в динамическое отображение с обновлениями в реальном времени, показывающими, над чем работает Claude. Конфигурация доступна в виде GitHub gist.