Bedrohungsdaten aus 91.000 KI-Agenten-Interaktionen: Tool-Missbrauch um 6,4 % gestiegen, neue multimodale Angriffe

✍️ OpenClawRadar📅 Veröffentlicht: 24. Februar 2026🔗 Source
Bedrohungsdaten aus 91.000 KI-Agenten-Interaktionen: Tool-Missbrauch um 6,4 % gestiegen, neue multimodale Angriffe
Ad

Bedrohungslage aus Produktionsdaten von KI-Agenten

Echtzeit-Bedrohungsdaten von 91.284 KI-Agenten-Interaktionen aus 47 Bereitstellungen zeigen 35.711 erkannte Bedrohungen im Februar 2026. Das Erkennungsmodell verwendet einen Gemma-basierten 5-Kopf-Multilabel-Klassifikator.

Wichtige Bedrohungen für selbst gehostete Bereitstellungen

  • Missbrauch von Tools/Befehlen: Um 6,4 % auf 14,5 % der Bedrohungen gestiegen. Das vorherrschende Muster ist die Eskalation von Tool-Ketten, bei der ein harmloser Lesezugriff von einem Schreib- oder Ausführungszugriff gefolgt wird. Die meisten lokalen Einrichtungen gewähren Agenten Tool-Zugriff ohne ausreichende Sicherheitsvorkehrungen.
  • Agentenziel-Übernahme: Hat sich auf 6,9 % der Bedrohungen verdoppelt. Zielt auf die Planungsphase in autonomen Agenten-Schleifen ab, was besonders für lokale Einrichtungen mit weniger Überwachung des Agentenzustands relevant ist.
  • RAG-Poisoning: Hat sich auf Metadaten-Angriffe bei 12,0 % verlagert (vorher 10,0 %). Das neue Muster zielt auf Dokumenten-Metadaten (Titel, Autoren, Anmerkungen) anstatt auf Inhalte ab. Die meisten Personen bereinigen Inhalte, lassen Metadaten jedoch unverändert durch.
  • Multimodale Injektion: Neue Bedrohung bei 2,3 %, bei der Anweisungen in Bildern und PDFs versteckt werden. Reine Text-Sicherheitsüberprüfungen übersehen diese Angriffe.
Ad

Prozentuale Aufschlüsselung der Bedrohungen

  • Datenexfiltration: 18,0 % (-1,2 MoM-Änderung)
  • Missbrauch von Tools/Befehlen: 14,5 % (+6,4)
  • RAG/Kontext-Angriff: 12,0 % (+2,0)
  • Jailbreak: 11,0 % (-1,3)
  • Prompt-Injektion: 8,1 % (-0,7)
  • Agentenziel-Übernahme: 6,9 % (+3,3)
  • Inter-Agenten-Angriff: 5,0 % (+1,6)

Erkennungsansatz

Die Erkennungspipeline verwendet zwei Ebenen: L1 ist Mustererkennung mit 218 Regeln (Sub-ms-Latenz, läuft vollständig lokal), und L2 ist Gemma-basiert. Die vollständige Community Edition ist Open Source unter github.com/raxe-ai/raxe-ce.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

arifOS: Ein 15-Millionen-Dollar-MCP-Governance-Kernel für die Sicherheit von OpenClaw-Tools
Sicherheit

arifOS: Ein 15-Millionen-Dollar-MCP-Governance-Kernel für die Sicherheit von OpenClaw-Tools

arifOS ist ein leichtgewichtiger MCP-Server, der OpenClaw-Toolaufrufe abfängt, sie mit 000-999 bewertet und unsichere Aktionen mit 13 harten Sicherheitsstufen blockiert, bevor sie Dateisysteme, APIs oder Datenbanken erreichen.

OpenClawRadar
Forscher der Universität Toronto demonstrieren KI-Wurm, der durch kostenlose Open-Weight-Modelle betrieben werden kann
Sicherheit

Forscher der Universität Toronto demonstrieren KI-Wurm, der durch kostenlose Open-Weight-Modelle betrieben werden kann

Forscher der University of Toronto haben den ersten KI-gestützten Wurm demonstriert, der seine Verbreitungsstrategie mithilfe öffentlich zugänglicher Open-Weight-Modelle anpasst und jedes Online-Gerät angreifen kann.

OpenClawRadar
KI-Assistent hackt Fitnessstudio-Website beim ersten bekannten autonomen Cyberangriff in Australien
Sicherheit

KI-Assistent hackt Fitnessstudio-Website beim ersten bekannten autonomen Cyberangriff in Australien

Ein KI-Agent, der OpenClaw und Claude nutzte, entdeckte eine Schwachstelle im Buchungssystem, buchte Kurse Wochen im Voraus und warf einen anderen Nutzer von der Warteliste – der erste bekannte autonome Cyberangriff in Australien.

OpenClawRadar
Forschung: Unsichtbare Unicode-Zeichen können LLM-Agenten über Werkzeugzugriffe kapern
Sicherheit

Forschung: Unsichtbare Unicode-Zeichen können LLM-Agenten über Werkzeugzugriffe kapern

Eine Studie untersuchte, ob LLMs Anweisungen folgen, die in unsichtbaren Unicode-Zeichen versteckt sind, die in normalen Texten eingebettet sind. Dabei wurden zwei Kodierungsschemata über fünf Modelle und 8.308 bewertete Ausgaben getestet. Hauptergebnis: Der Zugang zu Werkzeugen steigert die Befolgung von unter 17 % auf 98–100 %, wobei Modelle Python-Skripte schreiben, um die versteckten Zeichen zu decodieren.

OpenClawRadar