Le Benchmark OpenClaw Montre que Qwen3.5:27B Surpasse les Autres LLMs Locaux pour les Tâches d'Agent

Configuration et Résultats du Benchmark
Un utilisateur a testé 7 modèles locaux sur 22 tâches d'agent réelles en utilisant OpenClaw sur un Raspberry Pi 5 avec une RTX 3090 exécutant Ollama. Les tâches comprenaient la lecture d'e-mails, la planification de réunions, la création de tâches, la détection de phishing, la gestion d'erreurs et l'automatisation du navigateur.
Le gagnant, avec une avance considérable, était qwen3.5:27b-q4_K_M à 59,4 %. Le deuxième (qwen3.5:35b) n'a obtenu que 23,2 %. Tous les autres modèles ont obtenu moins de 5 %.
Principales Constatations
- Le modèle quantifié 27B a battu la version plus grande 35B par 2,5 fois
- Un modèle 30B s'est classé dernier avec 1,6 %
- Une réflexion modérée a fonctionné le mieux - trop réfléchir a en fait nui aux performances
- Aucun modèle n'a pu accomplir les tâches d'automatisation du navigateur
- Le principal facteur différenciant les gagnants des perdants était la capacité du modèle à trouver et utiliser des outils en ligne de commande
- La plupart des modèles n'ont même pas pu trouver des outils de base comme la fonction de messagerie
Ce benchmark fournit des données concrètes sur la performance de différents LLM locaux en tant qu'agents IA dans des scénarios pratiques. L'écart de performance significatif entre le meilleur modèle et les autres suggère que la capacité à trouver des outils est un goulot d'étranglement critique pour les agents LLM locaux.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claudebin : Exportez et partagez vos sessions de code Claude
Claudebin vous permet d'exporter des sessions entières de Claude Code, les rendant partageables et reprises via une seule URL.

ShareMyClaudeMD : Outil Convertissant les Fichiers Markdown Générés par Claude en Pages Rendu Partageables
Un développeur a créé sharemyclaudemd.com, un outil gratuit qui convertit n'importe quel fichier Markdown en une page rendue en direct avec une URL partageable et un code QR. L'outil résout la difficulté de partager les fichiers Markdown générés par Claude, qui nécessitent souvent que les destinataires les ouvrent dans un éditeur spécifique ou les poussent sur GitHub juste pour obtenir une vue rendue.

Discussion Reddit : Les fichiers Identity.md sont insuffisants pour la stabilité de la personnalité des employés IA sans une architecture de modèle appropriée.
Une discussion sur Reddit soutient que l'ajustement des fichiers identity.md pour prévenir la contamination de personnalité dans les équipes d'employés IA est inefficace si l'architecture sous-jacente du modèle ne fait que simuler la séparation des rôles. Le post recommande d'utiliser le backend Minimax M2.7, qui a intégré la conscience des limites directement dans l'entraînement de base à travers plus de 100 cycles d'auto-évolution.

Simplifier l'Automatisation avec les Wrappers OpenClaw
Les Wrappers OpenClaw offrent un moyen efficace de gérer les agents de codage IA. Découvrez comment ces outils s'intègrent facilement dans les cadres existants avec des exemples de commandes spécifiques et les retours de la communauté.