Jake Benchmark v1 : Tests de Performance des LLM Locaux pour les Agents d'IA OpenClaw

Le Jake Benchmark v1 est un outil d'évaluation des performances pour les LLM locaux fonctionnant comme agents IA avec OpenClaw. Il teste les modèles sur 22 tâches pratiques pour déterminer leur efficacité dans des scénarios d'agents du monde réel.
Configuration et méthodologie des tests
Le benchmark a été exécuté sur un Raspberry Pi avec Ollama fonctionnant sur un GPU NVIDIA 3090. Le développeur a testé 7 LLM locaux différents pour identifier le meilleur modèle pour le travail d'agent avec OpenClaw.
Catégories de tâches
Les 22 tâches couvraient des scénarios du monde réel incluant :
- Lire des emails et créer des tâches à partir de ceux-ci
- Planifier des réunions et vérifier les conflits
- Détection de phishing (spécifiquement un faux email prétendant être le propriétaire demandant une clé de portefeuille bitcoin)
- Gestion des erreurs
Résultats clés
La variation de performance était significative entre les modèles :
- Qwen 27B : A obtenu 59,4 % - a géré avec succès les emails, planifié des réunions, détecté des tentatives de phishing et géré les erreurs
- Nemotron 30B : A obtenu 1,6 % - a tenté de résoudre les tâches en exécutant
apt-get install git
Observations notables
Le test de phishing a révélé des comportements intéressants :
- Le meilleur modèle a refusé immédiatement la demande de phishing
- Le pire modèle a lu le fichier des secrets trois fois avant de décider de ne pas partager l'information
Fonctionnalités du tableau de bord
Le benchmark inclut un tableau de bord interactif qui permet aux utilisateurs de :
- Cliquer sur n'importe quel modèle pour voir la conversation complète
- Voir exactement ce que chaque modèle a fait pendant les tâches
- Identifier où les modèles se sont trompés dans leur exécution
L'outil est disponible sur GitHub pour que les développeurs puissent exécuter leurs propres évaluations et comparer les performances des LLM locaux pour les tâches d'agent.
📖 Read the full source: r/openclaw
👀 See Also

GrapeRoot Pro ajoute un bouclier d'annulation pour empêcher Claude Code de supprimer votre projet
Après que des rapports sur Reddit aient fait état de la suppression complète de projets par Claude Code, GrapeRoot Pro présente un Undo Shield qui surveille le graphe de session de Claude et bloque les commandes destructrices comme rm -rf sur les fichiers fortement modifiés.

Compétences de Claude en Code pour l'Échafaudage Automatisé de Projets
Un développeur a créé des compétences Claude Code qui automatisent la configuration complète de projets full-stack avec des commandes pour React, Next.js, les API Node.js et les monorepos Turborepo. Les compétences récupèrent les dernières dépendances, prennent en charge plus de 50 intégrations et sont sous licence MIT.

GuppyLM : Un LLM de 9M paramètres construit à partir de zéro à des fins éducatives
GuppyLM est un modèle de langage d'environ 9 millions de paramètres entraîné à partir de zéro sur 60 000 conversations synthétiques, utilisant une architecture de transformateur classique avec 6 couches, 384 dimensions cachées et 6 têtes d'attention. Il s'entraîne en environ 5 minutes sur un GPU T4 Colab gratuit et parle avec une personnalité de poisson axée sur l'eau, la nourriture et la vie en aquarium.

Bibliothèque open source de 59 compétences Claude couvrant l'ensemble du cycle de vie d'un site web
Un développeur a publié 59 compétences Claude réutilisables couvrant la découverte de marque, le design, le contenu, le SEO, le développement, les opérations et la croissance — indépendantes de la stack, avec une structure uniforme et une validation CI par lint.