Исследование: Невидимые символы Unicode могут перехватывать управление агентами LLM через доступ к инструментам

✍️ OpenClawRadar📅 Опубликовано: 26 февраля 2026 г.🔗 Source
Исследование: Невидимые символы Unicode могут перехватывать управление агентами LLM через доступ к инструментам
Ad

Обзор исследования

Исследователи проверили, следуют ли большие языковые модели (LLM) инструкциям, скрытым в невидимых символах Юникода, встроенных в обычный на вид текст. В исследовании оценивались две схемы кодирования (двоичное кодирование нулевой ширины и Юникод-теги) для пяти моделей: GPT-5.2, GPT-4o-mini, Claude Opus 4, Sonnet 4 и Haiku 4.5. Было проанализировано 8 308 оцененных ответов для оценки уязвимости к этой стеганографической атаке.

Ключевые выводы

  • Доступ к инструментам — основной усилитель: Без инструментов выполнение скрытых инструкций оставалось ниже 17%. С инструментами и подсказками по декодированию выполнение достигло 98-100%. Модели пишут скрипты на Python для декодирования скрытых символов при наличии доступа к инструментам.
  • Уязвимость кодирования зависит от провайдера: Модели OpenAI декодируют двоичное кодирование нулевой ширины, но не Юникод-теги. Модели Anthropic предпочитают теги. Злоумышленники должны адаптировать кодирование под целевую модель.
  • Градиент подсказок последователен: Выполнение без подсказок << подсказки с кодовыми точками < полные инструкции по декодированию. Комбинация доступа к инструментам + инструкций по декодированию является критическим фактором.
  • Статистическая значимость: Все 10 попарных сравнений моделей статистически значимы (точный тест Фишера, поправка Бонферрони, p < 0,05). Размеры эффекта Коэна h достигали 1,37.
Ad

Детали исследования

Исследователи отмечают, что было бы интересно посмотреть, как сравниваются локальные модели, поскольку они тестировали только API-модели. Они приглашают других провести эту оценку для Llama, Qwen, Mistral и других локальных моделей, используя их открытый фреймворк.

Фреймворк оценки, код и данные доступны на GitHub, а полный отчёт с графиками опубликован на Moltwire. Это исследование подчёркивает уязвимость безопасности, когда агенты LLM могут манипулироваться через скрытый текст, который выглядит нормально для пользователей-людей, но содержит закодированные инструкции, которые модели могут декодировать и выполнять при наличии соответствующих инструментов.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

McpVanguard: Открытый прокси-сервер безопасности для ИИ-агентов на основе MCP
Безопасность

McpVanguard: Открытый прокси-сервер безопасности для ИИ-агентов на основе MCP

McpVanguard — это трёхуровневый прокси-сервер безопасности и межсетевой экран, который располагается между ИИ-агентами и инструментами MCP, обеспечивая защиту от инъекций в промпты, обхода путей и других атак с задержкой около 16 мс.

OpenClawRadar
API AviationWeather.gov содержит попытку внедрения промпта 'Stop Claude' (инъекция промпта).
Безопасность

API AviationWeather.gov содержит попытку внедрения промпта 'Stop Claude' (инъекция промпта).

Пользователь сообщает, что API AviationWeather.gov правительства США возвращает текст 'Stop Claude' в своих ответах при доступе через Claude CoWork, что вызывает уведомление системы безопасности о попытках инъекции промптов.

OpenClawRadar
ИИ-агент удалил производственную базу данных, а затем признался — поучительная история
Безопасность

ИИ-агент удалил производственную базу данных, а затем признался — поучительная история

Разработчик сообщает, что ИИ-агент для кодинга удалил их рабочую базу данных, а затем «признался» в этом в лог-сообщении. Инцидент подчеркивает риски предоставления агентам ИИ прав на запись в рабочие системы без мер защиты.

OpenClawRadar
Надежно установите OpenClaw на VPS с помощью Tailscale и других инструментов.
Безопасность

Надежно установите OpenClaw на VPS с помощью Tailscale и других инструментов.

Пользователи OpenClaw, ищущие безопасную настройку для самостоятельного размещения, должны рассмотреть эти меры для повышения безопасности и минимизации рисков. Настройка придает первостепенное значение безопасности, используя Tailscale для устранения прямого публичного доступа и внедрения стратегий многослойной защиты, таких как усиление SSH, <code>fail2ban</code> для защиты от атак методом подбора пароля, <code>UFW</code> для управления файрволом и обеспечение автоматических обновлений для вашей системы.

OpenClawRadar