Granite 4.1: Плотная модель IBM на 8B параметров сравнивается с 32B MoE в бенчмарках

IBM выпустила Granite 4.1, семейство языковых моделей с открытым исходным кодом (Apache 2.0) размером 3B, 8B и 30B. Все используют плотный трансформер декодерного типа — никакого MoE, никаких длинных цепочек рассуждений. Модель 8B выделяется: она соответствует или превосходит предыдущую Granite 4.0-H-Small (32B MoE, 9B активных) по нескольким бенчмаркам.
Ключевые результаты бенчмарков
- ArenaHard (качество реальных запросов): 8B набирает 69,0, 32B MoE — ниже.
- BFCL V3 (вызов инструментов): 8B набирает 68,3, 32B MoE — 64,7.
- GSM8K (математические рассуждения): 8B достигает 92,5.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B стабильно превосходит более крупную модель.
Конвейер обучения
Granite 4.1 обучалась на 15 триллионах токенов в пять этапов с изменяющимся составом данных:
- Этап 1: 59% CommonCrawl, 20% код, 7% математика.
- Этап 2: математика возрастает до 35%, код до 30%.
- Этапы 3-4: смесь цепочек рассуждений, инструктивных данных и высококачественного веб-контента.
- Этап 5: расширение контекстного окна до 512K токенов (8B и 30B).
Ключевой вывод: качество данных важнее масштабирования параметров. Конвейер фильтрации данных IBM отбрасывает примеры с галлюцинациями или игнорированием инструкций во время тонкой настройки, чтобы избежать обучения на плохих сигналах.
Почему это важно для ИИ-агентов
Плотные модели обеспечивают предсказуемую задержку и стоимость — нет накладных расходов на маршрутизацию. Для разработчиков, использующих ИИ-агенты кодирования, модель 8B Granite 4.1 обеспечивает хорошее использование инструментов и математические рассуждения при малой доле вычислительных затрат по сравнению с моделями MoE.
📖 Читайте полный источник: HN AI Agents
👀 Смотрите также

Утечка кода Claude раскрывает систему KAIROS и пробел в верификации ИИ-агентов
Утечка карты исходного кода Claude Code показала 512 тысяч строк TypeScript, 44 флажка функций и KAIROS — фоновый агент, который консолидирует память в периоды простоя. Независимый разработчик создал аналогичный демон для объединения сессий в многодневные кампании, но обнаружил, что успешная компиляция не гарантирует работоспособность кода.

Неправительственные организации получают доступ к Claude Opus 4.6 в рамках командных и корпоративных планов.
Некоммерческие организации, использующие планы Team и Enterprise, теперь могут получить доступ к Claude Opus 4.6, последней модели ИИ от Anthropic, без каких-либо дополнительных затрат.

Выпуск Claude Code версии 2.1.77: Лимиты токенов, управление песочницей и исправления ошибок
Claude Code v2.1.77 увеличивает стандартные максимальные лимиты токенов вывода для Claude Opus 4.6 до 64 тысяч токенов и добавляет настройку песочницы allowRead для файловой системы. В релиз включено более 30 исправлений проблем, начиная от управления памятью до поведения терминального интерфейса.

Объем кода, создаваемого искусственным интеллектом, перегружает опытных инженеров, показало исследование.
Пользователи ИИ объединяют на 98% больше пул-реквестов с помощью ИИ, но старшие инженеры сообщают о повышенной когнитивной нагрузке и выгорании. Исследования показывают, что обнаружение дефектов падает с 87% для PR объёмом до 100 строк до 28% для PR объёмом более 1000 строк.