Granite 4.1 : Le modèle dense 8B d'IBM égale le MoE 32B dans les benchmarks

✍️ OpenClawRadar📅 Publié: April 30, 2026🔗 Source
Granite 4.1 : Le modèle dense 8B d'IBM égale le MoE 32B dans les benchmarks
Ad

IBM a publié Granite 4.1, une famille de modèles de langage open source (Apache 2.0) avec des tailles de 3B, 8B et 30B. Tous utilisent un transformeur dense décodeur-only — pas de MoE, pas de longues chaînes de raisonnement. Le modèle 8B se démarque : il correspond ou surpasse le précédent Granite 4.0-H-Small (32B MoE, 9B actifs) sur plusieurs benchmarks.

Principaux résultats des benchmarks

  • ArenaHard (qualité des prompts réels) : 8B obtient 69,0, le 32B MoE obtient un score inférieur.
  • BFCL V3 (appel d'outils) : 8B obtient 68,3, le 32B MoE obtient 64,7.
  • GSM8K (raisonnement mathématique) : 8B atteint 92,5.
  • AlpacaEval, MMLU-Pro, BBH, EvalPlus, MBPP : le 8B surpasse systématiquement le modèle plus grand.
Ad

Pipeline d'entraînement

Granite 4.1 a été entraîné sur 15 billions de tokens en cinq phases avec des mélanges de données changeants :

  • Phase 1 : 59% CommonCrawl, 20% code, 7% mathématiques.
  • Phase 2 : les mathématiques passent à 35%, le code à 30%.
  • Phases 3-4 : mélange de raisonnement en chaîne de pensée, données d'instructions et contenu web de haute qualité.
  • Phase 5 : extension de la fenêtre de contexte à 512K tokens (8B et 30B).

L'idée clé : la qualité des données prime sur le nombre de paramètres. Le pipeline de filtrage des données d'IBM rejette les exemples hallucinés ou ignorant les instructions pendant le fine-tuning pour éviter d'apprendre sur des signaux erronés.

Pourquoi c'est important pour les agents IA

Les modèles denses offrent une latence et un coût prévisibles — pas de surcharge de routage. Pour les développeurs utilisant des agents de codage IA, le modèle 8B de Granite 4.1 offre de solides capacités d'utilisation d'outils et de raisonnement mathématique pour une fraction du coût de calcul des modèles MoE.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Comparaison de Référence des Modèles Qwen 3.5 avec les Principaux Modèles d'IA
News

Comparaison de Référence des Modèles Qwen 3.5 avec les Principaux Modèles d'IA

Un site web de comparaison de benchmarks inclut des scores vérifiés et des infographies comparatives pour les modèles Qwen 3.5 (122B, 35B, 27B, 397B) par rapport à des modèles comme GPT-5.2, Claude 4.5 Opus, Gemini-3 Pro, et d'autres.

OpenClawRadar
Changements fréquents de rupture d'OpenClaw : Procédures de mise à jour et problèmes actuels
News

Changements fréquents de rupture d'OpenClaw : Procédures de mise à jour et problèmes actuels

OpenClaw a publié 13 versions mineures en mars 2026 seulement, avec des changements cassants survenant toutes les 2-3 semaines. La source fournit des procédures de mise à jour spécifiques et détaille les problèmes actuels de la version 3.28, y compris les modifications d'authentification localhost et les régressions.

OpenClawRadar
Le libibverbs d'Apple masque les symboles GPUDirect RDMA ; le tampon Metal à copie zéro RDMA fonctionne sur macOS
News

Le libibverbs d'Apple masque les symboles GPUDirect RDMA ; le tampon Metal à copie zéro RDMA fonctionne sur macOS

Un développeur a découvert que le sous-système RDMA d'Apple accepte les tampons GPU Metal pour les transferts réseau sans copie et a trouvé des symboles ibv_reg_dmabuf_mr cachés suggérant que GPUDirect RDMA est possible sur macOS sans modification du noyau.

OpenClawRadar
🦀
News

Un ancien chercheur d'OpenAI quitte Anthropic en raison de craintes sur la sécurité de l'IA

Une ancienne chercheuse d'OpenAI a quitté Anthropic, citant des craintes de perdre le contrôle des systèmes d'IA. Cette démission souligne les préoccupations persistantes en matière de sécurité dans l'industrie de l'IA.

OpenClawRadar