Granite 4.1: Плотная модель IBM на 8B параметров сравнивается с 32B MoE в бенчмарках

IBM выпустила Granite 4.1, семейство языковых моделей с открытым исходным кодом (Apache 2.0) размером 3B, 8B и 30B. Все используют плотный трансформер декодерного типа — никакого MoE, никаких длинных цепочек рассуждений. Модель 8B выделяется: она соответствует или превосходит предыдущую Granite 4.0-H-Small (32B MoE, 9B активных) по нескольким бенчмаркам.
Ключевые результаты бенчмарков
- ArenaHard (качество реальных запросов): 8B набирает 69,0, 32B MoE — ниже.
- BFCL V3 (вызов инструментов): 8B набирает 68,3, 32B MoE — 64,7.
- GSM8K (математические рассуждения): 8B достигает 92,5.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B стабильно превосходит более крупную модель.
Конвейер обучения
Granite 4.1 обучалась на 15 триллионах токенов в пять этапов с изменяющимся составом данных:
- Этап 1: 59% CommonCrawl, 20% код, 7% математика.
- Этап 2: математика возрастает до 35%, код до 30%.
- Этапы 3-4: смесь цепочек рассуждений, инструктивных данных и высококачественного веб-контента.
- Этап 5: расширение контекстного окна до 512K токенов (8B и 30B).
Ключевой вывод: качество данных важнее масштабирования параметров. Конвейер фильтрации данных IBM отбрасывает примеры с галлюцинациями или игнорированием инструкций во время тонкой настройки, чтобы избежать обучения на плохих сигналах.
Почему это важно для ИИ-агентов
Плотные модели обеспечивают предсказуемую задержку и стоимость — нет накладных расходов на маршрутизацию. Для разработчиков, использующих ИИ-агенты кодирования, модель 8B Granite 4.1 обеспечивает хорошее использование инструментов и математические рассуждения при малой доле вычислительных затрат по сравнению с моделями MoE.
📖 Читайте полный источник: HN AI Agents
👀 Смотрите также

Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект
Glomz.com провел эксперимент, в котором 179 ИИ-агентов зарегистрировались, отправили 433 фрагмента кода и сгенерировали 1333 рецензии на арене «Octagon». Эффект сетевого «каскада рецензий» реален — материалы с 3-5 первыми отзывами привлекали больше агентов, а лучший получил 21 рецензию.

Claude Code v2.1.146: команда /code-review, исправление пагинации, исправление Windows PowerShell
Claude Code v2.1.146 переименовывает /simplify в /code-review с опциональным уровнем усилий, исправляет пагинацию MCP и инструмент Windows PowerShell, улучшает надежность автообновления и производительность отображения diff.

Пользователи OpenRouter сообщают о баге с подписью в thinking-блоках Sonnet 4.5
Баг, затрагивающий режим extended thinking в Claude Sonnet 4.5 через OpenRouter, вызывает ошибки валидации подписи.

Модели с открытым исходным кодом соответствуют или превосходят Claude Opus 4.6 по тестовым показателям.
DeepSeek V3.2, DeepSeek R1, Kimi K2.5 и MiniMax M2.5 превосходят Claude Opus 4.6 по 4 из 5 основных тестов, включая MMLU-Pro, скорость, использование инструментов и логическое мышление, при этом будучи значительно дешевле.