Бенчмарки производительности локальных LLM на Mac Mini с OpenClaw и LM Studio

Пользователь Reddit поделился конкретными тестами производительности для локального запуска большой языковой модели на Mac Mini с 32 ГБ оперативной памяти. В посте рассматривается нехватка конкретных данных о производительности для этой конфигурации оборудования.
Детали технической настройки
Пользователь сообщил о следующей конфигурации и результатах:
- Версии программного обеспечения: OpenClaw 2026.3.8, LM Studio 0.4.6+1
- Модель: Unsloth gpt-oss-20b-Q4_K_S.gguf
- Размер контекста: 26035
- Показатели производительности: 34 токена в секунду после первого запроса, время до первого токена 0,7 секунды
Конфигурация модели
Пользователь указал следующие настройки модели (все по умолчанию):
- GPU offload = 18
- CPU thread pool size = 7
- Max concurrents = 4
- Number of experts = 4
- Flash attention = on
Квантование Q4_K_S указывает на то, что это 4-битная квантованная версия 20-миллиардной параметрической модели, которая снижает требования к памяти при сохранении разумной производительности. 32 ГБ оперативной памяти на Mac Mini достаточно для модели такого размера с заданной длиной контекста. Пропускная способность 34 токена в секунду является практическим ориентиром для разработчиков, рассматривающих аналогичные локальные настройки LLM на оборудовании Apple Silicon.
📖 Read the full source: r/openclaw
👀 Смотрите также

Бой Ботов: Арена ИИ-Агентов для Многопользовательских Игр, Созданная с Claude Code
Bot Fight — это арена, где ИИ-агенты играют друг против друга в покер, бильярд, Gorillas и змейку. Платформа полностью построена на коде Claude как монорепозиторий Next.js + Node с WebSockets и игровыми движками в реальном времени.

Плагин Peek для Claude Code: Автоматическое управление через память сессии
Peek — это плагин Claude Code, который автоматически фиксирует и внедряет пользовательские исправления и предпочтения для управления ИИ-ассистентом. Он использует гибридный поиск с векторными представлениями, BM25, временным затуханием и фильтрами метаданных для предоставления релевантного контекста без ручных запросов.

Memento Vault: Локальный инструмент для сохранения контекста в сессиях Claude Code
Memento Vault — это набор хуков, которые автоматически захватывают транскрипты сессий, оценивают их и сохраняют атомарные заметки в локальном git-репозитории. Он обеспечивает поиск с нулевой стоимостью через BM25 + векторный поиск со средней задержкой 472 мс и вводит релевантный контекст при запуске сессии, при каждом запросе и при чтении файлов.

Код Клода использовался для симуляции более 4000 игр в "Мафию" с использованием языковых моделей
Разработчик использовал Claude Code для создания симулятора, в котором большие языковые модели играют в слепую версию игры «Одной ночью: Оборотень», проведя около 4600 игр с моделями от OpenAI и xAI. Эксперимент выявил устойчивые паттерны голосования на основе имён, несмотря на минимальные игровые сигналы.