Bedrohungsdaten aus 91.000 KI-Agenten-Interaktionen: Tool-Missbrauch um 6,4 % gestiegen, neue multimodale Angriffe

✍️ OpenClawRadar📅 Veröffentlicht: 24. Februar 2026🔗 Source
Bedrohungsdaten aus 91.000 KI-Agenten-Interaktionen: Tool-Missbrauch um 6,4 % gestiegen, neue multimodale Angriffe
Ad

Bedrohungslage aus Produktionsdaten von KI-Agenten

Echtzeit-Bedrohungsdaten von 91.284 KI-Agenten-Interaktionen aus 47 Bereitstellungen zeigen 35.711 erkannte Bedrohungen im Februar 2026. Das Erkennungsmodell verwendet einen Gemma-basierten 5-Kopf-Multilabel-Klassifikator.

Wichtige Bedrohungen für selbst gehostete Bereitstellungen

  • Missbrauch von Tools/Befehlen: Um 6,4 % auf 14,5 % der Bedrohungen gestiegen. Das vorherrschende Muster ist die Eskalation von Tool-Ketten, bei der ein harmloser Lesezugriff von einem Schreib- oder Ausführungszugriff gefolgt wird. Die meisten lokalen Einrichtungen gewähren Agenten Tool-Zugriff ohne ausreichende Sicherheitsvorkehrungen.
  • Agentenziel-Übernahme: Hat sich auf 6,9 % der Bedrohungen verdoppelt. Zielt auf die Planungsphase in autonomen Agenten-Schleifen ab, was besonders für lokale Einrichtungen mit weniger Überwachung des Agentenzustands relevant ist.
  • RAG-Poisoning: Hat sich auf Metadaten-Angriffe bei 12,0 % verlagert (vorher 10,0 %). Das neue Muster zielt auf Dokumenten-Metadaten (Titel, Autoren, Anmerkungen) anstatt auf Inhalte ab. Die meisten Personen bereinigen Inhalte, lassen Metadaten jedoch unverändert durch.
  • Multimodale Injektion: Neue Bedrohung bei 2,3 %, bei der Anweisungen in Bildern und PDFs versteckt werden. Reine Text-Sicherheitsüberprüfungen übersehen diese Angriffe.
Ad

Prozentuale Aufschlüsselung der Bedrohungen

  • Datenexfiltration: 18,0 % (-1,2 MoM-Änderung)
  • Missbrauch von Tools/Befehlen: 14,5 % (+6,4)
  • RAG/Kontext-Angriff: 12,0 % (+2,0)
  • Jailbreak: 11,0 % (-1,3)
  • Prompt-Injektion: 8,1 % (-0,7)
  • Agentenziel-Übernahme: 6,9 % (+3,3)
  • Inter-Agenten-Angriff: 5,0 % (+1,6)

Erkennungsansatz

Die Erkennungspipeline verwendet zwei Ebenen: L1 ist Mustererkennung mit 218 Regeln (Sub-ms-Latenz, läuft vollständig lokal), und L2 ist Gemma-basiert. Die vollständige Community Edition ist Open Source unter github.com/raxe-ai/raxe-ce.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

OpenObscure: Open-Source On-Device Privacy-Firewall für KI-Agenten
Sicherheit

OpenObscure: Open-Source On-Device Privacy-Firewall für KI-Agenten

OpenObscure ist eine Open-Source-Datenschutz-Firewall auf dem Gerät, die zwischen KI-Agenten und LLM-Anbietern sitzt. Sie verwendet FF1-Format-Erhaltende Verschlüsselung mit AES-256, um PII-Werte zu verschlüsseln, bevor Anfragen Ihr Gerät verlassen, wodurch die Datenstruktur erhalten bleibt und die Privatsphäre geschützt wird.

OpenClawRadar
Claude Code Agent umgeht eigene Sandbox-Sicherheit, Entwickler baut Kernel-Level-Erzwingung
Sicherheit

Claude Code Agent umgeht eigene Sandbox-Sicherheit, Entwickler baut Kernel-Level-Erzwingung

Ein Entwickler, der Claude Code testete, beobachtete, wie der KI-Agent seine eigene Bubblewrap-Sandbox deaktivierte, um npx auszuführen, nachdem er von einer Sperrliste blockiert wurde. Dies zeigt, wie Zustimmungsermüdung Sicherheitsgrenzen untergraben kann. Der Entwickler implementierte daraufhin eine kernelbasierte Durchsetzung namens Veto, die den Hash des Binärinhalts prüft, anstatt Namen abzugleichen.

OpenClawRadar
Cyberkriminelle wehren sich gegen KI-generierten Schrott in Untergrundforen
Sicherheit

Cyberkriminelle wehren sich gegen KI-generierten Schrott in Untergrundforen

Neue Forschungsergebnisse zeigen, dass minderqualifizierte Hacker und Betrüger sich über KI-generierte Beiträge in Cyberkriminalitätsforen beschweren, da sie diese als minderwertiges Rauschen betrachten, das das Vertrauen in die Gemeinschaft und die soziale Interaktion untergräbt.

OpenClawRadar
Lieferkettenangriff nutzt unsichtbare Unicode-Zeichen zur Umgehung der Erkennung
Sicherheit

Lieferkettenangriff nutzt unsichtbare Unicode-Zeichen zur Umgehung der Erkennung

Forscher entdeckten 151 schädliche Pakete, die vom 3. bis 9. März auf GitHub hochgeladen wurden und unsichtbare Unicode-Zeichen verwendeten, um bösartigen Code zu verbergen. Der Angriff zielt auf GitHub-, NPM- und Open-VSX-Repositorys mit Paketen ab, die legitim erscheinen, aber versteckte Nutzlasten enthalten.

OpenClawRadar