Le Benchmark OpenClaw Montre que Qwen3.5:27B Surpasse les Autres LLMs Locaux pour les Tâches d'Agent

✍️ OpenClawRadar📅 Publié: March 28, 2026🔗 Source
Le Benchmark OpenClaw Montre que Qwen3.5:27B Surpasse les Autres LLMs Locaux pour les Tâches d'Agent
Ad

Configuration et Résultats du Benchmark

Un utilisateur a testé 7 modèles locaux sur 22 tâches d'agent réelles en utilisant OpenClaw sur un Raspberry Pi 5 avec une RTX 3090 exécutant Ollama. Les tâches comprenaient la lecture d'e-mails, la planification de réunions, la création de tâches, la détection de phishing, la gestion d'erreurs et l'automatisation du navigateur.

Le gagnant, avec une avance considérable, était qwen3.5:27b-q4_K_M à 59,4 %. Le deuxième (qwen3.5:35b) n'a obtenu que 23,2 %. Tous les autres modèles ont obtenu moins de 5 %.

Ad

Principales Constatations

  • Le modèle quantifié 27B a battu la version plus grande 35B par 2,5 fois
  • Un modèle 30B s'est classé dernier avec 1,6 %
  • Une réflexion modérée a fonctionné le mieux - trop réfléchir a en fait nui aux performances
  • Aucun modèle n'a pu accomplir les tâches d'automatisation du navigateur
  • Le principal facteur différenciant les gagnants des perdants était la capacité du modèle à trouver et utiliser des outils en ligne de commande
  • La plupart des modèles n'ont même pas pu trouver des outils de base comme la fonction de messagerie

Ce benchmark fournit des données concrètes sur la performance de différents LLM locaux en tant qu'agents IA dans des scénarios pratiques. L'écart de performance significatif entre le meilleur modèle et les autres suggère que la capacité à trouver des outils est un goulot d'étranglement critique pour les agents LLM locaux.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Claudebin : Exportez et partagez vos sessions de code Claude
Tools

Claudebin : Exportez et partagez vos sessions de code Claude

Claudebin vous permet d'exporter des sessions entières de Claude Code, les rendant partageables et reprises via une seule URL.

OpenClawRadar
ShareMyClaudeMD : Outil Convertissant les Fichiers Markdown Générés par Claude en Pages Rendu Partageables
Tools

ShareMyClaudeMD : Outil Convertissant les Fichiers Markdown Générés par Claude en Pages Rendu Partageables

Un développeur a créé sharemyclaudemd.com, un outil gratuit qui convertit n'importe quel fichier Markdown en une page rendue en direct avec une URL partageable et un code QR. L'outil résout la difficulté de partager les fichiers Markdown générés par Claude, qui nécessitent souvent que les destinataires les ouvrent dans un éditeur spécifique ou les poussent sur GitHub juste pour obtenir une vue rendue.

OpenClawRadar
Discussion Reddit : Les fichiers Identity.md sont insuffisants pour la stabilité de la personnalité des employés IA sans une architecture de modèle appropriée.
Tools

Discussion Reddit : Les fichiers Identity.md sont insuffisants pour la stabilité de la personnalité des employés IA sans une architecture de modèle appropriée.

Une discussion sur Reddit soutient que l'ajustement des fichiers identity.md pour prévenir la contamination de personnalité dans les équipes d'employés IA est inefficace si l'architecture sous-jacente du modèle ne fait que simuler la séparation des rôles. Le post recommande d'utiliser le backend Minimax M2.7, qui a intégré la conscience des limites directement dans l'entraînement de base à travers plus de 100 cycles d'auto-évolution.

OpenClawRadar
Simplifier l'Automatisation avec les Wrappers OpenClaw
Tools

Simplifier l'Automatisation avec les Wrappers OpenClaw

Les Wrappers OpenClaw offrent un moyen efficace de gérer les agents de codage IA. Découvrez comment ces outils s'intègrent facilement dans les cadres existants avec des exemples de commandes spécifiques et les retours de la communauté.

OpenClawRadar