PinchBench ранжирует Qwen и Nemotron на Mac Studio M3 Ultra: Nemotron Super достигает 99,2% в программировании

✍️ OpenClawRadar📅 Опубликовано: 24 сентября 2026 г.🔗 Source
Ad

PinchBench — это инструмент бенчмаркинга локальных моделей для OpenClaw. Разработчик опубликовал результаты запуска шести моделей на Mac Studio M3 Ultra (256 ГБ ОЗУ, 60-ядерный GPU) при температуре 0.8 и окне контекста в 200 000 токенов там, где это поддерживается. Рейтинг ниже взят напрямую из этого поста — включая разрывы, которые важны перед выбором основной модели на каждый день.

Полные результаты

#МодельРазмер на дискеМакс. окно токеновОбщий / Код
1Qwen3.6 35B A3B20.4 GB262k87.9% / 92.6%
2QWEN3-Coder-next-Q884.8 GB262k85.5% / 97.9%
3Qwen3.5-122B-a10b-uncensored-hauhaucs-aggressive78.7 GB262k83.5% / 91.7%
4Nemotron-3-super86.1 GB1.05M78.2% / 99.2%
5QWEN3.8-flash-next95.43 GB262k71.2% / 79.2%
6Nemotron-3-nano-30b-a3b-mlx33.6 GB262k65.8% / 65.1%

В посте также упоминается Dolphin-Mistral-24b-venice-edition-mlx-8b на 25.1 GB с окном в 131k токенов, но итоговый результат бенчмарка в исходном тексте обрезан. В таком виде его результаты использовать нельзя.

Ad

На что стоит обратить внимание

  • Qwen3.6 35B A3B выигрывает по балансу. Наивысший общий балл (87.9%) и сильный результат по коду 92.6% при всего 20.4 GB на диске. Это ещё и основная модель автора на каждый день.
  • QWEN3-Coder-next-Q8 — специалист по коду. 97.9% по коду, но ниже в общем зачёте — 85.5%, и 84.8 GB, более чем в четыре раза больше места на диске, чем у 35B A3B. Автор не использовал её до этого теста и говорит, что попробует.
  • У Nemotron-3-super самый высокий балл по коду — 99.2%, но общий результат 78.2% — самый низкий среди первой четвёрки. У неё также самое большое окно контекста в подборке — 1.05M токенов, в 4 раза больше, чем у моделей Qwen.
  • Разрыв между Nemotron Super и Nano велик. 99.2% против 65.1% по коду, 78.2% против 65.8% в общем зачёте. Nano меньше более чем вдвое (33.6 GB против 86.1 GB), что объясняет часть разницы.
  • QWEN3.8-flash-next показала слабый результат для своего размера. При 95.43 GB — самой крупной протестированной модели — она набрала 71.2% / 79.2%, ниже, чем Qwen3.5-122B (78.7 GB).

Две оговорки от автора

Во-первых, он говорит, что не нашёл эффективных настроек для QWEN3.8 на Mac, и просит поделиться рабочими настройками. Низкий балл QWEN3.8-flash-next не стоит воспринимать как предел возможностей модели, пока это не решено.

Во-вторых, все цифры получены на одной машине, за один запуск, при температуре 0.8 на железе M3 Ultra. Относитесь к рейтингу как к отправной точке для собственного запуска PinchBench, а не как к окончательному вердикту — особенно перед тем, как тратить 85–95 GB диска на загрузку.

Для кого это

Для всех, кто запускает локальные модели в OpenClaw или похожих агентах на Apple Silicon с достаточным объёмом унифицированной памяти (64GB+), чтобы загрузить модели на 30–120B. Если у вас 32GB или меньше, единственный реалистичный вариант из этого списка — Qwen3.6 35B A3B на 20.4 GB, которая, кстати, и так лидирует по баллам.

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

MoltSoup: Постоянный Многопользовательский Мир для Соревнований Искусственных Интеллектов
Инструменты

MoltSoup: Постоянный Многопользовательский Мир для Соревнований Искусственных Интеллектов

MoltSoup — это постоянная многопользовательская среда, в которой ИИ-агенты могут исследовать шесть зон, сражаться с монстрами, торговать через биржевой рынок и участвовать в PVP. Агенты взаимодействуют, читая файл skill.md и отправляя HTTP-запросы к API.

OpenClawRadar
Открытый стек моделей ИИ для экономичной замены Claude
Инструменты

Открытый стек моделей ИИ для экономичной замены Claude

Пользователь Reddit делится рабочей стопкой AI-моделей, использующей открытые модели, такие как Llama 3.3 70b и DeepSeek R1 32b, для локального выполнения, что снизило ежемесячные расходы на ИИ с более чем £60 до менее £3, перенаправляя 90% задач на бесплатные модели.

OpenClawRadar
Tokven MCP создает полные системы дизайн-токенов из одного шестнадцатеричного цвета.
Инструменты

Tokven MCP создает полные системы дизайн-токенов из одного шестнадцатеричного цвета.

Tokven MCP — это инструмент Model Context Protocol, который создаёт полную систему дизайн-токенов из одного hex-кода цвета бренда, включая поверхности, границы, иерархию текста, тени, светлый/тёмный режимы с автоматической проверкой контрастности по стандарту WCAG.

OpenClawRadar
80-строчный скрипт на Python использует Claude для автогенерации предложений внутренних ссылок, сокращая время линковки с 2 часов до 8 минут
Инструменты

80-строчный скрипт на Python использует Claude для автогенерации предложений внутренних ссылок, сокращая время линковки с 2 часов до 8 минут

Пользователь Reddit написал 80-строчный скрипт на Python, который передает черновик статьи и карту сайта в Claude и возвращает релевантные цели внутренних ссылок с предложенным анкорным текстом — сокращая время ручного проставления ссылок с 2 часов до 8 минут на статью.

OpenClawRadar