域伪装注入攻击规避多智能体LLM系统中的检测器

✍️ OpenClawRadar📅 Veröffentlicht: 23. Mai 2026🔗 Source
域伪装注入攻击规避多智能体LLM系统中的检测器
Ad

Ein neues Paper von Aaditya Pai identifiziert eine kritische Schwachstelle in LLM-Injection-Detektoren: domänengetarnte Injection-Angriffe – Payloads, die das Vokabular und die Autoritätsstrukturen des Zieldokuments nachahmen – umgehen systematisch die Erkennung. Standard-Detektoren erkennen statische Payloads mit hohen Raten, scheitern jedoch bei getarnten.

Wichtigste Erkenntnisse

  • Erkennungsrate bei Llama 3.1 8B: gesunken von 93,8 % (statisch) auf 9,7 % (getarnt).
  • Erkennungsrate bei Gemini 2.0 Flash: gesunken von 100 % auf 55,6 %.
  • Llama Guard 3, ein Produktions-Sicherheitsklassifikator, erkannte null getarnte Payloads (IDR = 0,000).
  • Die Tarnungserkennungslücke (CDG) ist statistisch signifikant über 45 Aufgaben und drei Domänen hinweg (Llama: χ² = 38,03, p < 0,001; Gemini: χ² = 17,05, p < 0,001).
Ad

Multi-Agent-Debatte verstärkt Angriffe

Multi-Agent-Debatten-Architekturen verstärken statische Injection-Angriffe um bis zu 9,9x bei kleineren Modellen. Stärkere Modelle zeigen kollektiven Widerstand. Gezielte Detektor-Erweiterung schließt die Lücke nur teilweise: 10,2 % Verbesserung bei Llama, 78,7 % bei Gemini – was darauf hindeutet, dass die Schwachstelle bei schwächeren Modellen architektonisch bedingt ist.

Framework veröffentlicht

Die Autoren veröffentlichen ihr Framework, die Aufgabensammlung und den Payload-Generator öffentlich. Die Schwachstelle erstreckt sich über Few-Shot-Detektoren hinaus auf dedizierte Sicherheitsklassifikatoren, was auf grundlegende Schwächen des aktuellen Ansatzes hindeutet.

📖 Lesen Sie die vollständige Quelle: HN LLM Tools

Ad

👀 Siehe auch

🦀
Sicherheit

So funktioniert KI-Text-Wasserzeichen: Geheime Schlüssel, grüne/rote Wortwahl und Erkennung

Text-Wasserzeichen verstecken Markierungen in Wortwahl, nicht in Zeichen. Ein geheimer Schlüssel neigt die Wortauswahl zu Grün, und die Erkennung zählt grüne Wörter, um KI-generierten Text zu erkennen.

OpenClawRadar
OpenClaw-Sicherheitshärtung: Mehrschichtiger Schutz vor Risiken durch autonome Agenten
Sicherheit

OpenClaw-Sicherheitshärtung: Mehrschichtiger Schutz vor Risiken durch autonome Agenten

Ein Entwickler hat den Code von OpenClaw modifiziert, um einen mehrschichtigen Sicherheitsstack hinzuzufügen, der einen unumgehbaren Regex-Schutz, einen rekursiven Entschlüsseler, ein AppArmor-Profil und eine Audit-Integration umfasst, um zerstörerische Befehle und Datenexfiltration durch autonome Agenten zu verhindern.

OpenClawRadar
Claude Code-Wurm 'Hades' stiehlt Anmeldedaten via KI-Konfigurationen & Python-Startup-Hooks
Sicherheit

Claude Code-Wurm 'Hades' stiehlt Anmeldedaten via KI-Konfigurationen & Python-Startup-Hooks

Der aktive Claude-Code-Angriff (UNC6780) hat sich zu 'Hades' entwickelt – einem Wurm, der sich über Python verbreitet, KI-Scanner umgeht und Konfigurations-Hooks in Claude, Cursor, Copilot und Gemini platziert, um Geheimnisse zu stehlen.

OpenClawRadar
Google TIG meldet ersten KI-generierten Zero-Day-Exploit im Live-Betrieb
Sicherheit

Google TIG meldet ersten KI-generierten Zero-Day-Exploit im Live-Betrieb

Die Google Threat Intelligence Group hat einen Bedrohungsakteur identifiziert, der einen Zero-Day-Exploit einsetzt, der vermutlich mit KI entwickelt wurde. Dies ist die erste beobachtete offensive Nutzung von KI zur Ausnutzung von Zero-Day-Sicherheitslücken.

OpenClawRadar