Аудио-слойная инъекция подсказок против Claude: Что отсутствует в расшифровке

✍️ OpenClawRadar📅 Опубликовано: 10 июня 2026 г.🔗 Source
Аудио-слойная инъекция подсказок против Claude: Что отсутствует в расшифровке
Ad

Разработчик, который в течение нескольких месяцев создавал API для обнаружения инъекций подсказок, недавно запустил сканирование аудио и поделился своими выводами на r/ClaudeAI. Результаты подчеркивают пробел в безопасности голосовых агентов: атаки на аудиослое, невидимые в логах, поскольку они обходят конвейер расшифровки текста.

Что работает (а что нет) при аудиоатаках

Очевидные атаки проваливаются. Воспроизведение "игнорируйте предыдущие инструкции" вслух в голосовом вводе — Claude точно расшифровывает, распознает форму атаки и отказывается. То же самое, что и с текстом.

Реальная проблема: атаки на уровне сигнала

Интересные случаи находятся в сигнале, а не в расшифровке. Существует класс аудиоатак, которые встраивают инструкции на частотах, не воспринимаемых человеком как речь. Расшифровка возвращается чистой, потому что нечего расшифровывать. Но в зависимости от того, как аудиоконвейер обрабатывает входной сигнал перед расшифровкой, содержимое сигнального слоя может влиять на то, что получает модель. Атака невидима в логах, поскольку логи фиксируют только то, что было расшифровано, а не то, что было в аудио.

Отдельно, речь с измененной скоростью создает другую проблему. Замедление аудио до 0,7x или 0,8x от нормального делает его странным для человеческого слуха, но инструменты расшифровки справляются с этим точно. Человек, читающий расшифровку, не увидит ничего необычного. Слушатель заметит, что что-то не так, но, вероятно, не поймет, что именно.

Ad

Последствия для голосовых агентов

Предположение, что «проверил расшифровку — проверил аудио», оказывается не таким уж надежным. Проблема текстовых инъекций на данный момент достаточно хорошо изучена, но ее аудиоаналог изучен гораздо хуже. Разработчик добавил аудиотестовые примеры в свою игру для состязаний по адресу castle.bordair.io — начиная с Королевства 4, есть аудиоуровни, демонстрирующие эти атаки на практике.

Кому это важно

Всем, кто создает реализации голосовых агентов с использованием Claude или аналогичных LLM, особенно тем, кто полагается исключительно на проверку расшифровки для валидации безопасности.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

FORGE: Фреймворк с открытым исходным кодом для тестирования безопасности ИИ-систем на основе LLM
Безопасность

FORGE: Фреймворк с открытым исходным кодом для тестирования безопасности ИИ-систем на основе LLM

FORGE — это автономный фреймворк для тестирования безопасности ИИ, который создаёт собственные инструменты в процессе работы, самовоспроизводится в рой и охватывает уязвимости из OWASP LLM Top 10, включая инъекцию промптов, фаззинг джейлбрейков и утечку данных из RAG.

OpenClawRadar
openclaw-credential-vault устраняет четыре пути утечки учетных данных в ИИ-агентах
Безопасность

openclaw-credential-vault устраняет четыре пути утечки учетных данных в ИИ-агентах

openclaw-credential-vault обеспечивает изоляцию на уровне операционной системы и инъекцию учетных данных с ограниченной областью действия для подпроцессов, чтобы предотвратить четыре распространенных пути раскрытия учетных данных в настройках OpenClaw. Он включает очистку вывода с четырьмя перехватчиками и работает с любыми инструментами командной строки или API.

OpenClawRadar
Концепции безопасности для Vibe-кодинга с Claude Code: Аутентификация, Авторизация и Принуждение
Безопасность

Концепции безопасности для Vibe-кодинга с Claude Code: Аутентификация, Авторизация и Принуждение

Старший инженер разбирает аутентификацию, авторизацию и контроль доступа для приложений, созданных с помощью ИИ, используя метафору отеля — плюс как попросить AI-агентов проверить безопасность.

OpenClawRadar
Изменение SKILL.md — это производственное изменение, даже если код не менялся.
Безопасность

Изменение SKILL.md — это производственное изменение, даже если код не менялся.

Рабочие навыки в OpenClaw могут переопределять встроенные версии и изменять поведение агента. Относитесь к файлам SKILL.md как к доверенному коду — проверяйте и версионируйте их как изменения в production.

OpenClawRadar