Скрытые аудиосигналы взламывают голосовые AI-системы с успешностью 79-96%

Новое исследование, представленное на симпозиуме IEEE по безопасности и конфиденциальности, раскрывает практический вектор атаки на большие аудио-языковые модели (LALM). Злоумышленники могут встраивать незаметные сигналы в аудиоклипы, чтобы перехватить поведение модели, достигая 79–96% средней успешности на 13 ведущих открытых моделях, включая коммерческие сервисы от Microsoft и Mistral.
Как работает атака
Модифицированный аудиоклип неслышим для человеческого уха, но заставляет модель выполнять скрытые команды. Важно, что атака работает независимо от сопутствующих инструкций пользователя, что позволяет многократно использовать один и тот же клип против одной и той же модели. Обучение состязательного сигнала занимает примерно 30 минут.
Используемые возможности
Исследователи продемонстрировали, что скомпрометированные модели могут быть вынуждены:
- Выполнять конфиденциальный поиск в интернете без ведома пользователя
- Загружать файлы из источников, контролируемых злоумышленником
- Отправлять электронные письма, содержащие данные пользователя, на внешние адреса
Затронутые модели
Атака была проверена на 13 популярных открытых LALM, включая коммерческие API голосового ИИ. Это подчеркивает, что текущие системы голосового ИИ не имеют надежных защитных мер против состязательных аудио-возмущений.
📖 Read the full source: HN AI Agents
👀 Смотрите также

От фермы до кода: Как фермер создал защиту в реальном времени с открытым исходным кодом для OpenClaw
Узнайте, как фермер, не имея опыта в разработке, создал систему защиты с открытым исходным кодом для OpenClaw, используя несколько AI-кодовагентов всего за 12 часов.

Изоляция локальных ИИ-агентов с помощью микро-ВМ Firecracker
Разработчик создал песочницу, которая изолирует выполнение ИИ-агентов внутри микро-ВМ Firecracker, работающих на Alpine Linux, решая проблемы безопасности, связанные с выполнением команд агентами напрямую на хост-машине. Конфигурация использует vsock для связи и подключается к Claude Desktop через MCP.

Frontier AI сломал соревнования CTF — GPT-5.5 решает безумные задачи Pwn с первой попытки
Claude Opus 4.5 и GPT-5.5 могут автономно решать CTF-задачи средней и высокой сложности, превращая таблицы результатов в показатель организации и бюджета токенов, а не навыков безопасности.

Изменение SKILL.md — это производственное изменение, даже если код не менялся.
Рабочие навыки в OpenClaw могут переопределять встроенные версии и изменять поведение агента. Относитесь к файлам SKILL.md как к доверенному коду — проверяйте и версионируйте их как изменения в production.