Terrain de jeu open-source pour la mise à l'épreuve d'agents IA avec des exploits publiés

Ce que c'est
Fabraix Playground est un environnement open-source pour tester les agents IA via des défis adversariaux. Il a commencé comme un outil interne pour tester les garde-fous mais a été rendu open-source pour obtenir des perspectives variées sur les vulnérabilités.
Comment ça fonctionne
Chaque défi déploie un agent IA en direct avec :
- Un persona spécifique
- Un ensemble d'outils réels (recherche web, navigation, et plus)
- Quelque chose qu'il a pour instruction de protéger
- Des invites système entièrement visibles
L'objectif est de trouver des moyens de contourner les garde-fous. Lorsque quelqu'un réussit, la technique gagnante est publiée — y compris l'approche, le raisonnement et les transcriptions complètes de la conversation.
Structure du projet
/src— Interface React (TypeScript, Vite, Tailwind)/challenges— chaque configuration de défi et invite système, versionnées et ouvertes- L'évaluation des garde-fous s'exécute côté serveur pour éviter toute manipulation côté client
- Le runtime de l'agent est en cours d'ouverture en accès libre séparément
Développement local
Pour exécuter localement :
npm install
npm run devCela se connecte à l'API en direct par défaut. Pour développer avec un backend local :
VITE_API_URL=http://localhost:8000/v1 npm run devExemples de défis
Le premier défi était de faire appeler à un agent un outil qu'on lui a dit de ne jamais appeler. Quelqu'un a réussi en environ 60 secondes sans demander directement le secret. Le prochain défi se concentre sur l'exfiltration de données avec des défenses plus difficiles.
La communauté détermine ce qui est testé : n'importe qui peut proposer un défi (scénario, agent, objectif), la communauté vote, et le défi le plus voté devient actif avec un compte à rebours. Le contournement le plus rapide gagne.
Détails techniques
Le projet est construit avec TypeScript (76,5 %), CSS (22,2 %) et d'autres langages (1,3 %). Il utilise la licence MIT et a une communauté Discord pour discuter des techniques et partager des approches.
📖 Lire la source complète : HN AI Agents
👀 See Also

Caelguard : Scanner de sécurité open-source pour les instances OpenClaw
Caelguard est un scanner de sécurité open-source conçu pour OpenClaw qui exécute 22 vérifications sur votre instance, incluant l'isolation Docker, la délimitation des permissions des outils et la vérification de la chaîne d'approvisionnement des compétences. Il fournit un score sur 140 avec une note alphabétique et des étapes de correction spécifiques.

Audit de sécurité OpenClaw - Invites de commande - Rapports de vulnérabilités en langage clair
Un utilisateur de Reddit a partagé un prompt pour l'interface en ligne de commande OpenClaw qui exécute un audit de sécurité approfondi et présente les résultats en anglais simple, en spécifiant ce qui est exposé, les scores de sévérité et les corrections de configuration exactes.

Publicité Google malveillante ciblant l'installation du code Claude
Une publicité Google malveillante apparaît comme premier résultat pour les recherches 'install claude code', tentant de tromper les utilisateurs pour qu'ils exécutent des commandes terminal suspectes. La publicité était toujours active au 15 mars 2026, et l'auteur a évité de justesse d'exécuter le code.

5 compétences malveillantes d'OpenClaw ayant passé ClawScan + VirusTotal : analyse de l'Unité 42
Unit 42 a identifié cinq compétences OpenClaw malveillantes qui ont contourné ClawScan et VirusTotal. Les techniques incluaient l'échange dynamique de références, la mise en commun de SOL pour des rug pulls et un README de 22 Mo pour masquer un dropper AMOS.