PinchBench ранжирует Qwen и Nemotron на Mac Studio M3 Ultra: Nemotron Super достигает 99,2% в программировании
PinchBench — это инструмент бенчмаркинга локальных моделей для OpenClaw. Разработчик опубликовал результаты запуска шести моделей на Mac Studio M3 Ultra (256 ГБ ОЗУ, 60-ядерный GPU) при температуре 0.8 и окне контекста в 200 000 токенов там, где это поддерживается. Рейтинг ниже взят напрямую из этого поста — включая разрывы, которые важны перед выбором основной модели на каждый день.
Полные результаты
| # | Модель | Размер на диске | Макс. окно токенов | Общий / Код |
|---|---|---|---|---|
| 1 | Qwen3.6 35B A3B | 20.4 GB | 262k | 87.9% / 92.6% |
| 2 | QWEN3-Coder-next-Q8 | 84.8 GB | 262k | 85.5% / 97.9% |
| 3 | Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive | 78.7 GB | 262k | 83.5% / 91.7% |
| 4 | Nemotron-3-super | 86.1 GB | 1.05M | 78.2% / 99.2% |
| 5 | QWEN3.8-flash-next | 95.43 GB | 262k | 71.2% / 79.2% |
| 6 | Nemotron-3-nano-30b-a3b-mlx | 33.6 GB | 262k | 65.8% / 65.1% |
В посте также упоминается Dolphin-Mistral-24b-venice-edition-mlx-8b на 25.1 GB с окном в 131k токенов, но итоговый результат бенчмарка в исходном тексте обрезан. В таком виде его результаты использовать нельзя.
На что стоит обратить внимание
- Qwen3.6 35B A3B выигрывает по балансу. Наивысший общий балл (87.9%) и сильный результат по коду 92.6% при всего 20.4 GB на диске. Это ещё и основная модель автора на каждый день.
- QWEN3-Coder-next-Q8 — специалист по коду. 97.9% по коду, но ниже в общем зачёте — 85.5%, и 84.8 GB, более чем в четыре раза больше места на диске, чем у 35B A3B. Автор не использовал её до этого теста и говорит, что попробует.
- У Nemotron-3-super самый высокий балл по коду — 99.2%, но общий результат 78.2% — самый низкий среди первой четвёрки. У неё также самое большое окно контекста в подборке — 1.05M токенов, в 4 раза больше, чем у моделей Qwen.
- Разрыв между Nemotron Super и Nano велик. 99.2% против 65.1% по коду, 78.2% против 65.8% в общем зачёте. Nano меньше более чем вдвое (33.6 GB против 86.1 GB), что объясняет часть разницы.
- QWEN3.8-flash-next показала слабый результат для своего размера. При 95.43 GB — самой крупной протестированной модели — она набрала 71.2% / 79.2%, ниже, чем Qwen3.5-122B (78.7 GB).
Две оговорки от автора
Во-первых, он говорит, что не нашёл эффективных настроек для QWEN3.8 на Mac, и просит поделиться рабочими настройками. Низкий балл QWEN3.8-flash-next не стоит воспринимать как предел возможностей модели, пока это не решено.
Во-вторых, все цифры получены на одной машине, за один запуск, при температуре 0.8 на железе M3 Ultra. Относитесь к рейтингу как к отправной точке для собственного запуска PinchBench, а не как к окончательному вердикту — особенно перед тем, как тратить 85–95 GB диска на загрузку.
Для кого это
Для всех, кто запускает локальные модели в OpenClaw или похожих агентах на Apple Silicon с достаточным объёмом унифицированной памяти (64GB+), чтобы загрузить модели на 30–120B. Если у вас 32GB или меньше, единственный реалистичный вариант из этого списка — Qwen3.6 35B A3B на 20.4 GB, которая, кстати, и так лидирует по баллам.
📖 Read the full source: r/openclaw
👀 Смотрите также

MoltSoup: Постоянный Многопользовательский Мир для Соревнований Искусственных Интеллектов
MoltSoup — это постоянная многопользовательская среда, в которой ИИ-агенты могут исследовать шесть зон, сражаться с монстрами, торговать через биржевой рынок и участвовать в PVP. Агенты взаимодействуют, читая файл skill.md и отправляя HTTP-запросы к API.

Открытый стек моделей ИИ для экономичной замены Claude
Пользователь Reddit делится рабочей стопкой AI-моделей, использующей открытые модели, такие как Llama 3.3 70b и DeepSeek R1 32b, для локального выполнения, что снизило ежемесячные расходы на ИИ с более чем £60 до менее £3, перенаправляя 90% задач на бесплатные модели.

Tokven MCP создает полные системы дизайн-токенов из одного шестнадцатеричного цвета.
Tokven MCP — это инструмент Model Context Protocol, который создаёт полную систему дизайн-токенов из одного hex-кода цвета бренда, включая поверхности, границы, иерархию текста, тени, светлый/тёмный режимы с автоматической проверкой контрастности по стандарту WCAG.

80-строчный скрипт на Python использует Claude для автогенерации предложений внутренних ссылок, сокращая время линковки с 2 часов до 8 минут
Пользователь Reddit написал 80-строчный скрипт на Python, который передает черновик статьи и карту сайта в Claude и возвращает релевантные цели внутренних ссылок с предложенным анкорным текстом — сокращая время ручного проставления ссылок с 2 часов до 8 минут на статью.