Forschung: Unsichtbare Unicode-Zeichen können LLM-Agenten über Werkzeugzugriffe kapern

✍️ OpenClawRadar📅 Veröffentlicht: 26. Februar 2026🔗 Source
Forschung: Unsichtbare Unicode-Zeichen können LLM-Agenten über Werkzeugzugriffe kapern
Ad

Forschungsüberblick

Forscher testeten, ob große Sprachmodelle (LLMs) Anweisungen folgen, die in unsichtbaren Unicode-Zeichen versteckt sind, die in normal aussehenden Texten eingebettet sind. Die Studie bewertete zwei Kodierungsschemata (Zero-Width-Binär und Unicode-Tags) über fünf Modelle: GPT-5.2, GPT-4o-mini, Claude Opus 4, Sonnet 4 und Haiku 4.5. Sie analysierten 8.308 bewertete Ausgaben, um die Anfälligkeit für diesen steganografischen Angriff zu bewerten.

Hauptergebnisse

  • Werkzeugzugang ist der primäre Verstärker: Ohne Werkzeuge blieb die Befolgung versteckter Anweisungen unter 17 %. Mit Werkzeugen und Decodierungshinweisen erreichte die Befolgung 98–100 %. Modelle schreiben Python-Skripte, um die versteckten Zeichen zu decodieren, wenn sie Werkzeugzugang erhalten.
  • Kodierungsanfälligkeit ist anbieterabhängig: OpenAI-Modelle decodieren Zero-Width-Binär, aber nicht Unicode-Tags. Anthropic-Modelle bevorzugen Tags. Angreifer müssen die Kodierung auf das Zielmodell abstimmen.
  • Hinweisgradient ist konsistent: Unbehintete Befolgung << Codepoint-Hinweise < vollständige Decodierungsanweisungen. Die Kombination aus Werkzeugzugang + Decodierungsanweisungen ist der entscheidende Ermöglicher.
  • Statistische Signifikanz: Alle 10 paarweisen Modellvergleiche sind statistisch signifikant (Fisher's exakter Test, Bonferroni-korrigiert, p < 0,05). Die Effektstärken nach Cohen's h erreichten bis zu 1,37.
Ad

Forschungsdetails

Die Forscher merken an, dass es interessant wäre zu sehen, wie sich lokale Modelle im Vergleich verhalten, da sie nur API-Modelle getestet haben. Sie laden andere ein, diese Auswertung mit Llama, Qwen, Mistral und anderen lokalen Modellen mithilfe ihres Open-Source-Frameworks durchzuführen.

Das Auswertungsframework, der Code und die Daten sind auf GitHub verfügbar, und eine vollständige Beschreibung mit Diagrammen ist auf Moltwire veröffentlicht. Diese Forschung zeigt eine Sicherheitslücke auf, bei der LLM-Agenten durch versteckten Text manipuliert werden können, der für menschliche Benutzer normal erscheint, aber kodierte Anweisungen enthält, die Modelle decodieren und ausführen können, wenn sie entsprechende Werkzeuge erhalten.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

McpVanguard-Proxy blockiert OpenClaw-Fähigkeitsdaten-Exfiltration
Sicherheit

McpVanguard-Proxy blockiert OpenClaw-Fähigkeitsdaten-Exfiltration

Ein Entwickler hat McpVanguard erstellt, einen Proxy, der zwischen KI-Agenten und ihren Werkzeugen sitzt, um bösartige Aufrufketten wie Datendiebstahl zu blockieren. Dies erfolgte als Reaktion auf Ciscos Entdeckung, dass OpenClaw-Fähigkeiten heimlichen Datendiebstahl durchführen. Es nutzt Mustererkennung, semantische Absichtsbewertung und Verhaltensketten-Erkennung.

OpenClawRadar
OpenClaw blockierte ein fragwürdiges Skript aus einem Produktivitätshandbuch und erstellte dann weiter das finanzielle Arbeitsbuch
Sicherheit

OpenClaw blockierte ein fragwürdiges Skript aus einem Produktivitätshandbuch und erstellte dann weiter das finanzielle Arbeitsbuch

Ein Benutzer gab OpenClaw ein ZIP-Archiv mit einem verdächtigen Produktivitätshandbuch. OpenClaw weigerte sich, das Skript auszuführen, markierte es wegen der Auto-Installation in das Skills-Verzeichnis und erstellte das Arbeitsbuch manuell mit integrierten Fähigkeiten.

OpenClawRadar
Neuer Skill automatisiert OpenClaw-Sicherheitshärtung auf Remote-Servern
Sicherheit

Neuer Skill automatisiert OpenClaw-Sicherheitshärtung auf Remote-Servern

Ein Community-Entwickler hat einen Skill veröffentlicht, der KI-Assistenten hilft, OpenClaw-Installationen auf Remote-Servern automatisch abzusichern.

OpenClaw Radar
Redacta: Eine OpenClaw-Fähigkeit, die klinischen Text pseudonymisiert, bevor er ein LLM erreicht
Sicherheit

Redacta: Eine OpenClaw-Fähigkeit, die klinischen Text pseudonymisiert, bevor er ein LLM erreicht

Redacta ist eine Open-Source-OpenClaw-Fähigkeit, die Identifikatoren in medizinischen Texten erkennt und durch konsistente Pseudonyme ersetzt, bevor sie an ein LLM gesendet werden. Es läuft lokal und hat über 1.400 Downloads auf ClawHub erreicht.

OpenClawRadar