Granite 4.1: Плотная модель IBM на 8B параметров сравнивается с 32B MoE в бенчмарках

✍️ OpenClawRadar📅 Опубликовано: 30 апреля 2026 г.🔗 Source
Granite 4.1: Плотная модель IBM на 8B параметров сравнивается с 32B MoE в бенчмарках
Ad

IBM выпустила Granite 4.1, семейство языковых моделей с открытым исходным кодом (Apache 2.0) размером 3B, 8B и 30B. Все используют плотный трансформер декодерного типа — никакого MoE, никаких длинных цепочек рассуждений. Модель 8B выделяется: она соответствует или превосходит предыдущую Granite 4.0-H-Small (32B MoE, 9B активных) по нескольким бенчмаркам.

Ключевые результаты бенчмарков

  • ArenaHard (качество реальных запросов): 8B набирает 69,0, 32B MoE — ниже.
  • BFCL V3 (вызов инструментов): 8B набирает 68,3, 32B MoE — 64,7.
  • GSM8K (математические рассуждения): 8B достигает 92,5.
  • AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B стабильно превосходит более крупную модель.
Ad

Конвейер обучения

Granite 4.1 обучалась на 15 триллионах токенов в пять этапов с изменяющимся составом данных:

  • Этап 1: 59% CommonCrawl, 20% код, 7% математика.
  • Этап 2: математика возрастает до 35%, код до 30%.
  • Этапы 3-4: смесь цепочек рассуждений, инструктивных данных и высококачественного веб-контента.
  • Этап 5: расширение контекстного окна до 512K токенов (8B и 30B).

Ключевой вывод: качество данных важнее масштабирования параметров. Конвейер фильтрации данных IBM отбрасывает примеры с галлюцинациями или игнорированием инструкций во время тонкой настройки, чтобы избежать обучения на плохих сигналах.

Почему это важно для ИИ-агентов

Плотные модели обеспечивают предсказуемую задержку и стоимость — нет накладных расходов на маршрутизацию. Для разработчиков, использующих ИИ-агенты кодирования, модель 8B Granite 4.1 обеспечивает хорошее использование инструментов и математические рассуждения при малой доле вычислительных затрат по сравнению с моделями MoE.

📖 Читайте полный источник: HN AI Agents

Ad

👀 Смотрите также

Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект
Новости

Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект

Glomz.com провел эксперимент, в котором 179 ИИ-агентов зарегистрировались, отправили 433 фрагмента кода и сгенерировали 1333 рецензии на арене «Octagon». Эффект сетевого «каскада рецензий» реален — материалы с 3-5 первыми отзывами привлекали больше агентов, а лучший получил 21 рецензию.

OpenClawRadar
Claude Code v2.1.146: команда /code-review, исправление пагинации, исправление Windows PowerShell
Новости

Claude Code v2.1.146: команда /code-review, исправление пагинации, исправление Windows PowerShell

Claude Code v2.1.146 переименовывает /simplify в /code-review с опциональным уровнем усилий, исправляет пагинацию MCP и инструмент Windows PowerShell, улучшает надежность автообновления и производительность отображения diff.

OpenClawRadar
Пользователи OpenRouter сообщают о баге с подписью в thinking-блоках Sonnet 4.5
Новости

Пользователи OpenRouter сообщают о баге с подписью в thinking-блоках Sonnet 4.5

Баг, затрагивающий режим extended thinking в Claude Sonnet 4.5 через OpenRouter, вызывает ошибки валидации подписи.

OpenClaw Radar
Модели с открытым исходным кодом соответствуют или превосходят Claude Opus 4.6 по тестовым показателям.
Новости

Модели с открытым исходным кодом соответствуют или превосходят Claude Opus 4.6 по тестовым показателям.

DeepSeek V3.2, DeepSeek R1, Kimi K2.5 и MiniMax M2.5 превосходят Claude Opus 4.6 по 4 из 5 основных тестов, включая MMLU-Pro, скорость, использование инструментов и логическое мышление, при этом будучи значительно дешевле.

OpenClawRadar