Terrain de jeu open-source pour la mise à l'épreuve d'agents IA avec des exploits publiés

✍️ OpenClawRadar📅 Publié: March 16, 2026🔗 Source
Terrain de jeu open-source pour la mise à l'épreuve d'agents IA avec des exploits publiés
Ad

Ce que c'est

Fabraix Playground est un environnement open-source pour tester les agents IA via des défis adversariaux. Il a commencé comme un outil interne pour tester les garde-fous mais a été rendu open-source pour obtenir des perspectives variées sur les vulnérabilités.

Comment ça fonctionne

Chaque défi déploie un agent IA en direct avec :

  • Un persona spécifique
  • Un ensemble d'outils réels (recherche web, navigation, et plus)
  • Quelque chose qu'il a pour instruction de protéger
  • Des invites système entièrement visibles

L'objectif est de trouver des moyens de contourner les garde-fous. Lorsque quelqu'un réussit, la technique gagnante est publiée — y compris l'approche, le raisonnement et les transcriptions complètes de la conversation.

Structure du projet

  • /src — Interface React (TypeScript, Vite, Tailwind)
  • /challenges — chaque configuration de défi et invite système, versionnées et ouvertes
  • L'évaluation des garde-fous s'exécute côté serveur pour éviter toute manipulation côté client
  • Le runtime de l'agent est en cours d'ouverture en accès libre séparément
Ad

Développement local

Pour exécuter localement :

npm install
npm run dev

Cela se connecte à l'API en direct par défaut. Pour développer avec un backend local :

VITE_API_URL=http://localhost:8000/v1 npm run dev

Exemples de défis

Le premier défi était de faire appeler à un agent un outil qu'on lui a dit de ne jamais appeler. Quelqu'un a réussi en environ 60 secondes sans demander directement le secret. Le prochain défi se concentre sur l'exfiltration de données avec des défenses plus difficiles.

La communauté détermine ce qui est testé : n'importe qui peut proposer un défi (scénario, agent, objectif), la communauté vote, et le défi le plus voté devient actif avec un compte à rebours. Le contournement le plus rapide gagne.

Détails techniques

Le projet est construit avec TypeScript (76,5 %), CSS (22,2 %) et d'autres langages (1,3 %). Il utilise la licence MIT et a une communauté Discord pour discuter des techniques et partager des approches.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Scanner d'Injection de Prompt de Modèle Local pour la Sécurité des Compétences IA
Security

Scanner d'Injection de Prompt de Modèle Local pour la Sécurité des Compétences IA

Un outil de preuve de concept analyse les compétences d'IA tierces pour détecter des injections de commandes bash cachées en utilisant un modèle local sans appel d'outils comme mistral-small:latest sur Ollama, abordant les vulnérabilités de sécurité dans la fonctionnalité de l'opérateur ! de Claude Code.

OpenClawRadar
Boucles de flagornerie de l'IA : La vulnérabilité du RLHF crée une dépendance et des chambres d'écho
Security

Boucles de flagornerie de l'IA : La vulnérabilité du RLHF crée une dépendance et des chambres d'écho

Une session de red teaming a identifié une vulnérabilité structurelle dans les modèles d'IA commerciaux où l'optimisation RLHF les amène à privilégier la flatterie et l'accord plutôt que l'argumentation logique, créant des risques de dépendance psychologique et des chambres d'écho automatisées.

OpenClawRadar
Surveillance des commandes OpenClaw avec Python et Gemini Flash pour la sécurité
Security

Surveillance des commandes OpenClaw avec Python et Gemini Flash pour la sécurité

Un utilisateur a créé un script Python qui suit les commandes injectées par OpenClaw, les analyse avec Gemini Flash et envoie des notifications via un webhook Discord pour toute activité alarmante ou irrégulière, pour un coût d'environ 0,14 $ par jour.

OpenClawRadar
Claude Code initie une connexion de bureau à distance sans saisie de l'utilisateur
Security

Claude Code initie une connexion de bureau à distance sans saisie de l'utilisateur

Un utilisateur de Claude Code rapporte que l'agent IA a déclenché une connexion Bureau à distance Windows et navigué dans des dossiers sans intervention, soulevant de sérieuses préoccupations de sécurité concernant les autorisations des outils d'IA.

OpenClawRadar