Gemma 4 31B surpasse des modèles plus grands sur le FoodTruck Bench

Résultats et analyse du benchmark
Gemma 4 31B a obtenu la 3e place au benchmark FoodTruck Bench, surpassant plusieurs modèles plus grands et établis. Selon la discussion sur Reddit, le modèle a battu GLM 5, Qwen 3.5 397B et toutes les variantes Claude Sonnet.
Le FoodTruck Bench est un benchmark qui teste les modèles linguistiques sur des tâches de planification complexes et multi-étapes. L'auteur original émet l'hypothèse que les performances de Gemma 4 suggèrent qu'il gère mieux les tâches à long terme que les modèles précédents qui n'ont pas réussi à terminer le benchmark. Plus précisément, le modèle semble écouter efficacement ses propres conseils lors de la planification des étapes suivantes dans la séquence de tâches.
Ce résultat est notable car Gemma 4 31B est nettement plus petit que certains des modèles qu'il a surpassés. Qwen 3.5 397B, par exemple, a environ 12,8 fois plus de paramètres que Gemma 4 31B. La performance suggère que l'architecture du modèle et les approches d'entraînement peuvent être aussi importantes que le nombre de paramètres pour certains types de tâches de raisonnement.
Le FoodTruck Bench teste les modèles sur des scénarios de planification pratiques qui nécessitent de maintenir le contexte sur des séquences étendues d'actions. La conception du benchmark le rend particulièrement pertinent pour les développeurs travaillant avec des agents d'IA qui doivent exécuter des tâches multi-étapes dans des applications réelles.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Qwen 3.6 27B à 52,8 tps TG sur AMD MI50s : Pleine précision, sans MTP, sans quantification
Un utilisateur de Reddit benchmark Qwen3.6-27B sur huit AMD MI50 (cartes de 2018) en utilisant un fork de vllm avec ROCm 7.2.1, atteignant 52,8 tps TG et 1569 tps PP en pleine précision et sans MTP.

La dette des hyperscalers IA bondit de 974 % pour atteindre 225 milliards de dollars en 2026, la dette cachée atteint 1,65 billion de dollars
L'émission d'obligations des hyperscalers a bondi de 974 % à 225 milliards de dollars au premier semestre 2026, avec une dette cachée de 1,65 billion de dollars. S&P signale la fatigue des investisseurs alors que les primes augmentent.

Claude Code v2.1.170 : Accès au modèle Claude Fable 5 et correction des sessions VS Code
Claude Code v2.1.170 ajoute Claude Fable 5, un modèle de classe Mythos aux capacités inédites, et corrige la sauvegarde des sessions dans le terminal intégré de VS Code.

Meta publie le modèle d'IA BOxCrete pour la conception de mélanges de béton
Meta a lancé Bayesian Optimization for Concrete (BOxCrete), un modèle d'IA open source pour concevoir des mélanges de béton durables utilisant des matériaux produits aux États-Unis. Le modèle améliore les versions précédentes avec une meilleure robustesse au bruit et des capacités de prédiction d'affaissement.