Granite 4.1 : Le modèle dense 8B d'IBM égale le MoE 32B dans les benchmarks

IBM a publié Granite 4.1, une famille de modèles de langage open source (Apache 2.0) avec des tailles de 3B, 8B et 30B. Tous utilisent un transformeur dense décodeur-only — pas de MoE, pas de longues chaînes de raisonnement. Le modèle 8B se démarque : il correspond ou surpasse le précédent Granite 4.0-H-Small (32B MoE, 9B actifs) sur plusieurs benchmarks.
Principaux résultats des benchmarks
- ArenaHard (qualité des prompts réels) : 8B obtient 69,0, le 32B MoE obtient un score inférieur.
- BFCL V3 (appel d'outils) : 8B obtient 68,3, le 32B MoE obtient 64,7.
- GSM8K (raisonnement mathématique) : 8B atteint 92,5.
- AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP : le 8B surpasse systématiquement le modèle plus grand.
Pipeline d'entraînement
Granite 4.1 a été entraîné sur 15 billions de tokens en cinq phases avec des mélanges de données changeants :
- Phase 1 : 59% CommonCrawl, 20% code, 7% mathématiques.
- Phase 2 : les mathématiques passent à 35%, le code à 30%.
- Phases 3-4 : mélange de raisonnement en chaîne de pensée, données d'instructions et contenu web de haute qualité.
- Phase 5 : extension de la fenêtre de contexte à 512K tokens (8B et 30B).
L'idée clé : la qualité des données prime sur le nombre de paramètres. Le pipeline de filtrage des données d'IBM rejette les exemples hallucinés ou ignorant les instructions pendant le fine-tuning pour éviter d'apprendre sur des signaux erronés.
Pourquoi c'est important pour les agents IA
Les modèles denses offrent une latence et un coût prévisibles — pas de surcharge de routage. Pour les développeurs utilisant des agents de codage IA, le modèle 8B de Granite 4.1 offre de solides capacités d'utilisation d'outils et de raisonnement mathématique pour une fraction du coût de calcul des modèles MoE.
📖 Lire la source complète : HN AI Agents
👀 See Also

Machine à flux d'état : l'architecture non-transformeuse maintient 62 % de précision sur les séquences longues, là où les transformateurs tombent à 2 %.
Un chercheur a développé State Flow Machine (SFM), une architecture alternative utilisant des emplacements de mémoire explicites au lieu de têtes d'attention, atteignant 62 % de précision sur une tâche synthétique de suivi d'état de programme à une longueur d'entraînement 4× où les transformateurs tombent à 1,9-3,1 %. Le modèle fonctionne sur un seul NPU Huawei Ascend 910 ProA.

L'Europe a une fenêtre de deux ans pour éviter la dépendance aux infrastructures d'IA américaines, prévient le PDG de Mistral
Le PDG de Mistral, Arthur Mensch, prévient que l'Europe a deux ans pour construire sa propre infrastructure IA — puces, énergie, calcul — ou risquer de devenir un « État vassal » permanent des géants technologiques américains.

Fondateur d'OpenClaw, Peter Steinberger, sous les projecteurs : Retour sur l'entretien YC
Le fondateur d'OpenClaw, Peter Steinberger, attire l'attention de YC, suscitant des discussions sur l'avenir des agents d'IA pour le codage. Plongez dans les points forts de cet entretien significatif qui promet d'influencer la trajectoire de l'automatisation et de l'intégration des agents d'IA.

Delve est accusé d'avoir forké SimStudio, le logiciel open-source de Sim.ai, et de le vendre sous le nom de Pathways.
La startup de conformité Delve aurait bifurqué l'outil open-source de création d'agents SimStudio de Sim.ai, l'aurait rebaptisé Pathways et l'aurait vendu sans attribution de licence appropriée ni accord monétaire avec Sim.ai, violant potentiellement les termes de la licence Apache.