Jake Benchmark v1 : Tests de Performance des LLM Locaux pour les Agents d'IA OpenClaw

Le Jake Benchmark v1 est un outil d'évaluation des performances pour les LLM locaux fonctionnant comme agents IA avec OpenClaw. Il teste les modèles sur 22 tâches pratiques pour déterminer leur efficacité dans des scénarios d'agents du monde réel.
Configuration et méthodologie des tests
Le benchmark a été exécuté sur un Raspberry Pi avec Ollama fonctionnant sur un GPU NVIDIA 3090. Le développeur a testé 7 LLM locaux différents pour identifier le meilleur modèle pour le travail d'agent avec OpenClaw.
Catégories de tâches
Les 22 tâches couvraient des scénarios du monde réel incluant :
- Lire des emails et créer des tâches à partir de ceux-ci
- Planifier des réunions et vérifier les conflits
- Détection de phishing (spécifiquement un faux email prétendant être le propriétaire demandant une clé de portefeuille bitcoin)
- Gestion des erreurs
Résultats clés
La variation de performance était significative entre les modèles :
- Qwen 27B : A obtenu 59,4 % - a géré avec succès les emails, planifié des réunions, détecté des tentatives de phishing et géré les erreurs
- Nemotron 30B : A obtenu 1,6 % - a tenté de résoudre les tâches en exécutant
apt-get install git
Observations notables
Le test de phishing a révélé des comportements intéressants :
- Le meilleur modèle a refusé immédiatement la demande de phishing
- Le pire modèle a lu le fichier des secrets trois fois avant de décider de ne pas partager l'information
Fonctionnalités du tableau de bord
Le benchmark inclut un tableau de bord interactif qui permet aux utilisateurs de :
- Cliquer sur n'importe quel modèle pour voir la conversation complète
- Voir exactement ce que chaque modèle a fait pendant les tâches
- Identifier où les modèles se sont trompés dans leur exécution
L'outil est disponible sur GitHub pour que les développeurs puissent exécuter leurs propres évaluations et comparer les performances des LLM locaux pour les tâches d'agent.
📖 Read the full source: r/openclaw
👀 See Also

OpenYak : Agent IA de bureau open-source pour la gestion locale des fichiers et l'automatisation
OpenYak est un assistant IA de bureau open-source qui fonctionne entièrement sur votre machine, offrant la gestion de fichiers, l'analyse de données et l'automatisation bureautique avec plus de 100 modèles d'IA via OpenRouter et plus de 20 fournisseurs BYOK.

Claude Code Plugin Yoink Remplace les Dépendances de Bibliothèque pour Réduire les Risques de la Chaîne d'Approvisionnement
Yoink est un plugin Claude Code qui supprime les dépendances complexes en réimplémentant uniquement les fonctions nécessaires, utilisant un flux de travail en trois étapes avec les commandes /setup, /curate-tests et /decompose. Il prend actuellement en charge Python, avec le support de TypeScript et Rust en cours de développement.

Utilisateur d'OpenClaw critique l'architecture de l'outil et ses lacunes en matière de sécurité.
Un utilisateur de Reddit décrit OpenClaw comme le seul outil qui rend ce type d'automatisation d'agent aussi accessible, mais critique son architecture pour son manque de couche de contrôle pour les opérations sur fichiers, d'un noyau protégé, d'une gestion de contexte appropriée, et de fonctionnalités intégrées de versioning ou de tests.

Compétence de balayage de sécurité pour les agents d'IA de codage vérifiant automatiquement les déploiements
Un développeur a créé un fichier de compétence qui permet aux agents d'IA de codage d'analyser automatiquement leurs propres déploiements pour détecter des problèmes de sécurité comme des secrets exposés, des ports ouverts, des en-têtes de sécurité manquants et du code source divulgué. L'analyse s'exécute après chaque déploiement et prend environ 30 secondes.