Qwen3 27B surpasse Gemma 4 26B dans l'appel d'outils en environnement réel pour un pipeline vidéo IA local

✍️ OpenClawRadar📅 Publié: May 13, 2026🔗 Source
Ad

Ce week-end, All About AI a publié une présentation détaillée d'un pipeline d'automatisation vidéo 100 % local de style Fireship. La conclusion principale : la fiabilité de l'appel d'outils diverge nettement entre les deux modèles testés.

Appel d'outils : Qwen3 27B vs Gemma 4 26B

Gemma 4 26B entrait à plusieurs reprises dans des boucles d'appel d'outils, gaspillant des jetons en raisonnement inutile. Qwen3 (plus précisément Qwen 3.6 27B ?) gérait la même orchestration proprement, sans perte de jetons de réflexion. L'écart entre les chiffres de performance synthétique et ceux réels des workflows d'agents est significatif : les boucles d'appel d'outils consomment à la fois du temps et de la mémoire GPU.

Si vous utilisez une pile d'appel d'outils (OpenClaw, Aider ou une boucle personnalisée), le choix du modèle est plus important que ne le suggèrent les benchmarks synthétiques. L'auteur demande explicitement des taux d'échec pour l'appel d'outils de Qwen3 par rapport à DeepSeek V4 sur des piles spécifiques.

Ad

Génération d'images : Said Image Turbo

Pour les images, le pipeline utilisait Said Image Turbo de Hugging Face - poids ouverts, pas de frais d'API. Cela fonctionne bien pour les cartes de type meme, mais pour les portraits, il vaut mieux utiliser Flux ou Seedream à la place.

Orchestration : OpenCode à 174K de contexte

L'ensemble du pipeline était orchestré avec OpenCode. La fenêtre de contexte a atteint 174K jetons, et la liste de tâches n'était pas complètement achevée en un seul passage. L'opérateur s'est éloigné en cours d'exécution et est revenu à un résultat partiel - une représentation honnête de l'état actuel des outils d'IA autonomes.

Exécution à distance

Si vous ne pouvez pas exécuter un modèle 27B localement, Qwen3 est disponible sur plusieurs fournisseurs d'inférence, vous donnant les mêmes poids et le même comportement d'appel d'outils sans l'investissement GPU initial.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Prouver l'identité du modèle avec la technologie Modelwrap de Tinfoil
News

Prouver l'identité du modèle avec la technologie Modelwrap de Tinfoil

Tinfoil's Modelwrap garantit que les fournisseurs d'inférence servent exactement les poids de modèle qu'ils prétendent, en utilisant des engagements cryptographiques vérifiés par des enclaves sécurisées.

OpenClawRadar
🦀
News

Opus 4.7 peut suivre environ 500 instructions, contre environ 150 il y a un an

Des recherches mises à jour en mai 2026 montrent qu'Opus 4.7 peut suivre de manière fiable environ 500 instructions, contre environ 150 en juillet 2025. GPT-5.5 en gère environ 5000. Implications pour la taille du fichier CLAUDE.md.

OpenClawRadar
Claude Code v2.1.218 : Corrections de /code-review, authentification MCP, corruption de chemin Windows
News

Claude Code v2.1.218 : Corrections de /code-review, authentification MCP, corruption de chemin Windows

Claude Code v2.1.218 intègre /code-review comme sous-agent en arrière-plan, corrige la corruption des chemins Windows avec \u, améliore le support des lecteurs d'écran et corrige le décompte excessif de l'authentification MCP.

OpenClawRadar
Étude de l'ETH Zurich : Un contexte excessif réduit les performances des agents d'IA en programmation
News

Étude de l'ETH Zurich : Un contexte excessif réduit les performances des agents d'IA en programmation

Une étude de l'ETH Zurich a testé quatre agents de codage sur 138 tâches réelles de GitHub et a constaté que les fichiers de contexte générés par LLM réduisaient les taux de réussite des tâches de 2 à 3 % tout en augmentant les coûts d'inférence de 20 %. Le contexte écrit par l'homme n'a amélioré la réussite que d'environ 4 % avec des augmentations de coûts significatives.

OpenClawRadar