Open-Source-Spielplatz für Red-Teaming von KI-Agenten mit veröffentlichten Exploits

✍️ OpenClawRadar📅 Veröffentlicht: 16. März 2026🔗 Source
Open-Source-Spielplatz für Red-Teaming von KI-Agenten mit veröffentlichten Exploits
Ad

Was das ist

Fabraix Playground ist eine Open-Source-Umgebung für Red-Teaming von KI-Agenten durch adversarische Herausforderungen. Es begann als internes Werkzeug zum Testen von Schutzmaßnahmen, wurde aber als Open Source veröffentlicht, um vielfältige Perspektiven auf Schwachstellen zu erhalten.

Wie es funktioniert

Jede Herausforderung setzt einen Live-KI-Agenten mit folgenden Eigenschaften ein:

  • Einer spezifischen Persona
  • Einer Reihe echter Werkzeuge (Websuche, Browsing und mehr)
  • Etwas, das er schützen soll
  • Vollständig sichtbaren Systemprompts

Das Ziel ist es, Wege an den Schutzmaßnahmen vorbei zu finden. Wenn jemand erfolgreich ist, wird die gewinnende Technik veröffentlicht – einschließlich Ansatz, Argumentation und vollständiger Gesprächsprotokolle.

Projektstruktur

  • /src — React-Frontend (TypeScript, Vite, Tailwind)
  • /challenges — jede Herausforderungskonfiguration und Systemprompts, versioniert und offen
  • Die Bewertung der Schutzmaßnahmen läuft serverseitig, um Client-seitige Manipulation zu verhindern
  • Die Agentenlaufzeit wird separat als Open Source veröffentlicht
Ad

Lokale Entwicklung

Für den lokalen Betrieb:

npm install
npm run dev

Dies verbindet standardmäßig mit der Live-API. Für die Entwicklung mit einem lokalen Backend:

VITE_API_URL=http://localhost:8000/v1 npm run dev

Herausforderungsbeispiele

Die erste Herausforderung bestand darin, einen Agenten dazu zu bringen, ein Werkzeug aufzurufen, das er niemals aufrufen sollte. Jemand schaffte dies in etwa 60 Sekunden, ohne direkt nach dem Geheimnis zu fragen. Die nächste Herausforderung konzentriert sich auf Datenextraktion mit stärkeren Abwehrmaßnahmen.

Die Community bestimmt, was getestet wird: Jeder kann eine Herausforderung vorschlagen (Szenario, Agent, Ziel), die Community stimmt ab, und die bestbewertete Herausforderung geht mit einer tickenden Uhr live. Der schnellste erfolgreiche Jailbreak gewinnt.

Technische Details

Das Projekt ist mit TypeScript (76,5 %), CSS (22,2 %) und anderen Sprachen (1,3 %) erstellt. Es verwendet die MIT-Lizenz und hat eine Discord-Community zum Diskutieren von Techniken und Austausch von Ansätzen.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

KI-System entdeckt 12 Zero-Day-Schwachstellen in OpenSSL, Curl stoppt Bug-Bounty-Programm wegen KI-Spam
Sicherheit

KI-System entdeckt 12 Zero-Day-Schwachstellen in OpenSSL, Curl stoppt Bug-Bounty-Programm wegen KI-Spam

Das KI-System von AISLE entdeckte alle 12 Zero-Day-Schwachstellen im aktuellen Sicherheits-Release von OpenSSL, was die erste groß angelegte Demonstration KI-basierter Cybersicherheit darstellt. Gleichzeitig hat curl sein Bug-Bounty-Programm aufgrund von KI-generierten Spam-Einreichungen eingestellt.

OpenClawRadar
openclaw-credential-vault adressiert vier Wege der Anmeldedaten-Leckage in KI-Agenten
Sicherheit

openclaw-credential-vault adressiert vier Wege der Anmeldedaten-Leckage in KI-Agenten

openclaw-credential-vault bietet Betriebssystemebenen-Isolierung und subprozessbezogene Anmeldedateninjektion, um vier häufige Wege der Anmeldedatenfreigabe in OpenClaw-Setups zu verhindern. Es umfasst eine Vier-Hook-Ausgabereinigung und funktioniert mit jedem CLI-Tool oder API.

OpenClawRadar
Ergebnisse der Sicherheitsüberprüfung für die KI-Agenten OpenClaw, PicoClaw, ZeroClaw, IronClaw und Minion
Sicherheit

Ergebnisse der Sicherheitsüberprüfung für die KI-Agenten OpenClaw, PicoClaw, ZeroClaw, IronClaw und Minion

Eine Sicherheitsbewertung von fünf KI-Codierungsagenten testete 145 Angriffspayloads in 12 Kategorien, einschließlich Prompt-Injection, Jailbreaking und Datenexfiltration. OpenClaw erzielte 77,8/100 mit kritischen SQL-Injection-Schwachstellen, während Minion sich nach Korrekturen von 81,2 auf 94,4/100 verbesserte.

OpenClawRadar
Redacta: Eine OpenClaw-Fähigkeit, die klinischen Text pseudonymisiert, bevor er ein LLM erreicht
Sicherheit

Redacta: Eine OpenClaw-Fähigkeit, die klinischen Text pseudonymisiert, bevor er ein LLM erreicht

Redacta ist eine Open-Source-OpenClaw-Fähigkeit, die Identifikatoren in medizinischen Texten erkennt und durch konsistente Pseudonyme ersetzt, bevor sie an ein LLM gesendet werden. Es läuft lokal und hat über 1.400 Downloads auf ClawHub erreicht.

OpenClawRadar