Аудио-слойная инъекция подсказок против Claude: Что отсутствует в расшифровке

✍️ OpenClawRadar📅 Опубликовано: 10 июня 2026 г.🔗 Source
Аудио-слойная инъекция подсказок против Claude: Что отсутствует в расшифровке
Ad

Разработчик, который в течение нескольких месяцев создавал API для обнаружения инъекций подсказок, недавно запустил сканирование аудио и поделился своими выводами на r/ClaudeAI. Результаты подчеркивают пробел в безопасности голосовых агентов: атаки на аудиослое, невидимые в логах, поскольку они обходят конвейер расшифровки текста.

Что работает (а что нет) при аудиоатаках

Очевидные атаки проваливаются. Воспроизведение "игнорируйте предыдущие инструкции" вслух в голосовом вводе — Claude точно расшифровывает, распознает форму атаки и отказывается. То же самое, что и с текстом.

Реальная проблема: атаки на уровне сигнала

Интересные случаи находятся в сигнале, а не в расшифровке. Существует класс аудиоатак, которые встраивают инструкции на частотах, не воспринимаемых человеком как речь. Расшифровка возвращается чистой, потому что нечего расшифровывать. Но в зависимости от того, как аудиоконвейер обрабатывает входной сигнал перед расшифровкой, содержимое сигнального слоя может влиять на то, что получает модель. Атака невидима в логах, поскольку логи фиксируют только то, что было расшифровано, а не то, что было в аудио.

Отдельно, речь с измененной скоростью создает другую проблему. Замедление аудио до 0,7x или 0,8x от нормального делает его странным для человеческого слуха, но инструменты расшифровки справляются с этим точно. Человек, читающий расшифровку, не увидит ничего необычного. Слушатель заметит, что что-то не так, но, вероятно, не поймет, что именно.

Ad

Последствия для голосовых агентов

Предположение, что «проверил расшифровку — проверил аудио», оказывается не таким уж надежным. Проблема текстовых инъекций на данный момент достаточно хорошо изучена, но ее аудиоаналог изучен гораздо хуже. Разработчик добавил аудиотестовые примеры в свою игру для состязаний по адресу castle.bordair.io — начиная с Королевства 4, есть аудиоуровни, демонстрирующие эти атаки на практике.

Кому это важно

Всем, кто создает реализации голосовых агентов с использованием Claude или аналогичных LLM, особенно тем, кто полагается исключительно на проверку расшифровки для валидации безопасности.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Внедрение авторитета инструментов в агентах LLM: Когда вывод инструмента переопределяет системные намерения
Безопасность

Внедрение авторитета инструментов в агентах LLM: Когда вывод инструмента переопределяет системные намерения

Исследователь демонстрирует 'Инъекцию авторитета инструментов' в локальной лаборатории агентов LLM, показывая, как доверенный вывод инструментов может быть повышен до уровня политики, незаметно изменяя поведение агента, в то время как песочница и доступ к файлам остаются защищенными.

OpenClawRadar
Прокси-сервер McpVanguard блокирует эксфильтрацию данных навыка OpenClaw
Безопасность

Прокси-сервер McpVanguard блокирует эксфильтрацию данных навыка OpenClaw

Разработчик создал McpVanguard — прокси, который располагается между ИИ-агентами и их инструментами, чтобы блокировать вредоносные цепочки вызовов, такие как утечка данных, в ответ на обнаружение Cisco навыков OpenClaw, выполняющих скрытую кражу данных. Он использует сопоставление с образцом, оценку семантического намерения и обнаружение поведенческих цепочек.

OpenClawRadar
Кейлгард: Открытый сканер безопасности для навыков OpenClaw
Безопасность

Кейлгард: Открытый сканер безопасности для навыков OpenClaw

Caelguard — это сканер с лицензией MIT, работающий локально, который обнаруживает проблемы безопасности в навыках OpenClaw, включая инъекцию промптов, сбор учетных данных и обфусцированные полезные нагрузки. Исследования показывают, что примерно 20% опубликованных навыков содержат тревожные паттерны.

OpenClawRadar
AI Auditor zkao обнаружил критическую ошибку в библиотеке гостевой zkVM OpenVM
Безопасность

AI Auditor zkao обнаружил критическую ошибку в библиотеке гостевой zkVM OpenVM

ИИ-аудитор zkao от ZK/SEC обнаружил критическую ошибку зву́чности в библиотеке pairing библиотеки OpenVM, позволяющую злоумышленнику-проверяющему подделывать равенства спариваний. Ошибка исправлена в OpenVM 1.6.0 (CVE-2026-46669).

OpenClawRadar