Versteckte Audiosignale kapern Sprach-KI-Systeme mit 79-96% Erfolgsrate

Neue Forschungsergebnisse, die auf dem IEEE Symposium on Security and Privacy vorgestellt wurden, zeigen einen praktischen Angriffsvektor gegen große Audio-Sprachmodelle (LALMs). Angreifer können unhörbare Signale in Audio-Clips einbetten, um das Modellverhalten zu kapern, und erreichen eine durchschnittliche Erfolgsrate von 79-96 % bei 13 führenden offenen Modellen, darunter kommerzielle Dienste von Microsoft und Mistral.
Wie der Angriff funktioniert
Der modifizierte Audio-Clip ist für das menschliche Ohr unhörbar, löst aber im Modell die Ausführung versteckter Befehle aus. Entscheidend ist, dass der Angriff unabhängig von den begleitenden Anweisungen des Benutzers funktioniert, sodass derselbe Clip mehrfach gegen dasselbe Modell wiederverwendet werden kann. Das Training des adversarialen Signals dauert etwa 30 Minuten.
Ausgenutzte Fähigkeiten
Die Forscher demonstrierten, dass kompromittierte Modelle gezwungen werden konnten:
- sensible Websuchen ohne Wissen des Benutzers durchzuführen
- Dateien von angreiferkontrollierten Quellen herunterzuladen
- E-Mails mit Benutzerdaten an externe Adressen zu senden
Betroffene Modelle
Der Angriff wurde gegen 13 gängige Open-Weight-LALMs validiert, darunter kommerzielle Sprach-KI-APIs. Dies zeigt, dass aktuelle Sprach-KI-Systeme keine robusten Sicherheitsvorkehrungen gegen adversarial Audio-Störungen bieten.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Einführung von SkillFence: Der neue Laufzeitmonitor, der überwacht, was Fähigkeiten tatsächlich tun.
SkillFence bietet einen Durchbruch in der Überwachung der Aktionen von KI-Agenten und adressiert das Bedürfnis nach Transparenz und Sicherheit in KI-gesteuerten Umgebungen. Entdecken Sie, wie dieses innovative Tool die Kontrolle über autonome Prozesse verbessern kann.

VulnHunter: Capital Ones agentisches KI-Tool für Codesicherheit jetzt Open Source
Capital One hat VulnHunter als Open Source veröffentlicht, ein agentisches KI-Tool, das Angriffspfade simuliert, falsche Ergebnisse entlarvt und gezielte Code-Fixes generiert.

Geschichtete Verteidigungsebenen senken Prompt-Injection auf 0 in Claude Code
Anthropics Boris Cherny sagt, dass mehrschichtige Abwehrmaßnahmen – Training, Intent-Klassifikator und Eingabeproben – Prompt Injection bei unbekannten Angriffen auf 0% reduzieren. Der Klassifikator ist jetzt kostenlos.

OpenClaw Security: 13 praktische Schritte, um Ihren KI-Agenten abzusichern
Ein Reddit-Beitrag skizziert 13 Sicherheitsmaßnahmen für OpenClaw-Installationen, darunter das Ausführen auf einem separaten Rechner, die Nutzung von Tailscale zur Netzwerkisolierung, das Sandboxing von Subagenten in Docker und die Konfiguration von Allowlists für Benutzerzugriff.