Gemma 4 31B surpasse des modèles plus grands sur le FoodTruck Bench

✍️ OpenClawRadar📅 Publié: April 21, 2026🔗 Source
Gemma 4 31B surpasse des modèles plus grands sur le FoodTruck Bench
Ad
Ad

Résultats et analyse du benchmark

Gemma 4 31B a obtenu la 3e place au benchmark FoodTruck Bench, surpassant plusieurs modèles plus grands et établis. Selon la discussion sur Reddit, le modèle a battu GLM 5, Qwen 3.5 397B et toutes les variantes Claude Sonnet.

Le FoodTruck Bench est un benchmark qui teste les modèles linguistiques sur des tâches de planification complexes et multi-étapes. L'auteur original émet l'hypothèse que les performances de Gemma 4 suggèrent qu'il gère mieux les tâches à long terme que les modèles précédents qui n'ont pas réussi à terminer le benchmark. Plus précisément, le modèle semble écouter efficacement ses propres conseils lors de la planification des étapes suivantes dans la séquence de tâches.

Ce résultat est notable car Gemma 4 31B est nettement plus petit que certains des modèles qu'il a surpassés. Qwen 3.5 397B, par exemple, a environ 12,8 fois plus de paramètres que Gemma 4 31B. La performance suggère que l'architecture du modèle et les approches d'entraînement peuvent être aussi importantes que le nombre de paramètres pour certains types de tâches de raisonnement.

Le FoodTruck Bench teste les modèles sur des scénarios de planification pratiques qui nécessitent de maintenir le contexte sur des séquences étendues d'actions. La conception du benchmark le rend particulièrement pertinent pour les développeurs travaillant avec des agents d'IA qui doivent exécuter des tâches multi-étapes dans des applications réelles.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Le Pentagone fixe vendredi comme date limite pour qu'Anthropic abandonne ses règles d'éthique en matière d'IA
News

Le Pentagone fixe vendredi comme date limite pour qu'Anthropic abandonne ses règles d'éthique en matière d'IA

Le Pentagone a donné à Anthropic jusqu'à vendredi pour abandonner ses règles d'éthique en matière d'IA, selon un rapport de Politico. L'article a reçu 15 points et 3 commentaires sur Hacker News.

OpenClawRadar
Image Bonsaï 1-Bit 4B : Génération d’Images sur Appareil via FLUX.2 Binaire/Ternaire
News

Image Bonsaï 1-Bit 4B : Génération d’Images sur Appareil via FLUX.2 Binaire/Ternaire

PrismML publie Bonsai Image 4B, une variante binaire (1,125 bits) et ternaire (1,71 bits) de FLUX.2 Klein 4B qui réduit le transformateur de diffusion à 0,93 Go / 1,21 Go, permettant la génération d'images 512×512 sur iPhone 17 Pro Max en 9,4 secondes.

OpenClawRadar
Extension VS Code Claude cassé sur Windows après un chemin Linux codé en dur dans une mise à jour récente
News

Extension VS Code Claude cassé sur Windows après un chemin Linux codé en dur dans une mise à jour récente

La récente mise à jour de l'extension VS Code d'Anthropic code en dur un chemin Linux, ce qui casse l'extension sous Windows. Revenir à la version précédente rétablit les fonctionnalités.

OpenClawRadar
Critique de la frontière d'abstraction et de l'approche d'intégration des services du MCP
News

Critique de la frontière d'abstraction et de l'approche d'intégration des services du MCP

Une discussion sur Reddit critique le MCP pour avoir regroupé l'accès aux API, les outils efficaces et les connaissances du domaine en une seule couche, affirmant que cela crée des interfaces limitées par rapport aux API sous-jacentes. Le message utilise Lattice comme exemple où leur API publique ne couvre que les flux de travail d'administration des RH malgré une API GraphQL complète.

OpenClawRadar