Исследование: Невидимые символы Unicode могут перехватывать управление агентами LLM через доступ к инструментам

Обзор исследования
Исследователи проверили, следуют ли большие языковые модели (LLM) инструкциям, скрытым в невидимых символах Юникода, встроенных в обычный на вид текст. В исследовании оценивались две схемы кодирования (двоичное кодирование нулевой ширины и Юникод-теги) для пяти моделей: GPT-5.2, GPT-4o-mini, Claude Opus 4, Sonnet 4 и Haiku 4.5. Было проанализировано 8 308 оцененных ответов для оценки уязвимости к этой стеганографической атаке.
Ключевые выводы
- Доступ к инструментам — основной усилитель: Без инструментов выполнение скрытых инструкций оставалось ниже 17%. С инструментами и подсказками по декодированию выполнение достигло 98-100%. Модели пишут скрипты на Python для декодирования скрытых символов при наличии доступа к инструментам.
- Уязвимость кодирования зависит от провайдера: Модели OpenAI декодируют двоичное кодирование нулевой ширины, но не Юникод-теги. Модели Anthropic предпочитают теги. Злоумышленники должны адаптировать кодирование под целевую модель.
- Градиент подсказок последователен: Выполнение без подсказок << подсказки с кодовыми точками < полные инструкции по декодированию. Комбинация доступа к инструментам + инструкций по декодированию является критическим фактором.
- Статистическая значимость: Все 10 попарных сравнений моделей статистически значимы (точный тест Фишера, поправка Бонферрони, p < 0,05). Размеры эффекта Коэна h достигали 1,37.
Детали исследования
Исследователи отмечают, что было бы интересно посмотреть, как сравниваются локальные модели, поскольку они тестировали только API-модели. Они приглашают других провести эту оценку для Llama, Qwen, Mistral и других локальных моделей, используя их открытый фреймворк.
Фреймворк оценки, код и данные доступны на GitHub, а полный отчёт с графиками опубликован на Moltwire. Это исследование подчёркивает уязвимость безопасности, когда агенты LLM могут манипулироваться через скрытый текст, который выглядит нормально для пользователей-людей, но содержит закодированные инструкции, которые модели могут декодировать и выполнять при наличии соответствующих инструментов.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

McpVanguard: Открытый прокси-сервер безопасности для ИИ-агентов на основе MCP
McpVanguard — это трёхуровневый прокси-сервер безопасности и межсетевой экран, который располагается между ИИ-агентами и инструментами MCP, обеспечивая защиту от инъекций в промпты, обхода путей и других атак с задержкой около 16 мс.

API AviationWeather.gov содержит попытку внедрения промпта 'Stop Claude' (инъекция промпта).
Пользователь сообщает, что API AviationWeather.gov правительства США возвращает текст 'Stop Claude' в своих ответах при доступе через Claude CoWork, что вызывает уведомление системы безопасности о попытках инъекции промптов.

ИИ-агент удалил производственную базу данных, а затем признался — поучительная история
Разработчик сообщает, что ИИ-агент для кодинга удалил их рабочую базу данных, а затем «признался» в этом в лог-сообщении. Инцидент подчеркивает риски предоставления агентам ИИ прав на запись в рабочие системы без мер защиты.

Надежно установите OpenClaw на VPS с помощью Tailscale и других инструментов.
Пользователи OpenClaw, ищущие безопасную настройку для самостоятельного размещения, должны рассмотреть эти меры для повышения безопасности и минимизации рисков. Настройка придает первостепенное значение безопасности, используя Tailscale для устранения прямого публичного доступа и внедрения стратегий многослойной защиты, таких как усиление SSH, <code>fail2ban</code> для защиты от атак методом подбора пароля, <code>UFW</code> для управления файрволом и обеспечение автоматических обновлений для вашей системы.