Granite 4.1: Плотная модель IBM на 8B параметров сравнивается с 32B MoE в бенчмарках

✍️ OpenClawRadar📅 Опубликовано: 30 апреля 2026 г.🔗 Source
Granite 4.1: Плотная модель IBM на 8B параметров сравнивается с 32B MoE в бенчмарках
Ad

IBM выпустила Granite 4.1, семейство языковых моделей с открытым исходным кодом (Apache 2.0) размером 3B, 8B и 30B. Все используют плотный трансформер декодерного типа — никакого MoE, никаких длинных цепочек рассуждений. Модель 8B выделяется: она соответствует или превосходит предыдущую Granite 4.0-H-Small (32B MoE, 9B активных) по нескольким бенчмаркам.

Ключевые результаты бенчмарков

  • ArenaHard (качество реальных запросов): 8B набирает 69,0, 32B MoE — ниже.
  • BFCL V3 (вызов инструментов): 8B набирает 68,3, 32B MoE — 64,7.
  • GSM8K (математические рассуждения): 8B достигает 92,5.
  • AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP: 8B стабильно превосходит более крупную модель.
Ad

Конвейер обучения

Granite 4.1 обучалась на 15 триллионах токенов в пять этапов с изменяющимся составом данных:

  • Этап 1: 59% CommonCrawl, 20% код, 7% математика.
  • Этап 2: математика возрастает до 35%, код до 30%.
  • Этапы 3-4: смесь цепочек рассуждений, инструктивных данных и высококачественного веб-контента.
  • Этап 5: расширение контекстного окна до 512K токенов (8B и 30B).

Ключевой вывод: качество данных важнее масштабирования параметров. Конвейер фильтрации данных IBM отбрасывает примеры с галлюцинациями или игнорированием инструкций во время тонкой настройки, чтобы избежать обучения на плохих сигналах.

Почему это важно для ИИ-агентов

Плотные модели обеспечивают предсказуемую задержку и стоимость — нет накладных расходов на маршрутизацию. Для разработчиков, использующих ИИ-агенты кодирования, модель 8B Granite 4.1 обеспечивает хорошее использование инструментов и математические рассуждения при малой доле вычислительных затрат по сравнению с моделями MoE.

📖 Читайте полный источник: HN AI Agents

Ad

👀 Смотрите также

Утечка кода Claude раскрывает систему KAIROS и пробел в верификации ИИ-агентов
Новости

Утечка кода Claude раскрывает систему KAIROS и пробел в верификации ИИ-агентов

Утечка карты исходного кода Claude Code показала 512 тысяч строк TypeScript, 44 флажка функций и KAIROS — фоновый агент, который консолидирует память в периоды простоя. Независимый разработчик создал аналогичный демон для объединения сессий в многодневные кампании, но обнаружил, что успешная компиляция не гарантирует работоспособность кода.

OpenClawRadar
Неправительственные организации получают доступ к Claude Opus 4.6 в рамках командных и корпоративных планов.
Новости

Неправительственные организации получают доступ к Claude Opus 4.6 в рамках командных и корпоративных планов.

Некоммерческие организации, использующие планы Team и Enterprise, теперь могут получить доступ к Claude Opus 4.6, последней модели ИИ от Anthropic, без каких-либо дополнительных затрат.

OpenClawRadar
Выпуск Claude Code версии 2.1.77: Лимиты токенов, управление песочницей и исправления ошибок
Новости

Выпуск Claude Code версии 2.1.77: Лимиты токенов, управление песочницей и исправления ошибок

Claude Code v2.1.77 увеличивает стандартные максимальные лимиты токенов вывода для Claude Opus 4.6 до 64 тысяч токенов и добавляет настройку песочницы allowRead для файловой системы. В релиз включено более 30 исправлений проблем, начиная от управления памятью до поведения терминального интерфейса.

OpenClawRadar
Объем кода, создаваемого искусственным интеллектом, перегружает опытных инженеров, показало исследование.
Новости

Объем кода, создаваемого искусственным интеллектом, перегружает опытных инженеров, показало исследование.

Пользователи ИИ объединяют на 98% больше пул-реквестов с помощью ИИ, но старшие инженеры сообщают о повышенной когнитивной нагрузке и выгорании. Исследования показывают, что обнаружение дефектов падает с 87% для PR объёмом до 100 строк до 28% для PR объёмом более 1000 строк.

OpenClawRadar