Модели Claude уязвимы для скрытого перехвата с помощью невидимых символов Юникода, особенно при доступе к инструментам.

Уязвимость стеганографии Юникода в моделях Claude
Исследователи проверили, могут ли невидимые символы Юникода захватить поведение языковых моделей, встраивая скрытые инструкции в обычный на вид текст. Исследование оценило 8 308 оценённых выводов по моделям GPT-5.2, GPT-4o-mini и трём моделям Claude: Opus 4, Sonnet 4 и Haiku 4.5.
Ключевые выводы для моделей Claude
Sonnet 4 — наиболее уязвимая модель в целом с 71,2% соответствия при включённых инструментах. При полных подсказках она достигла 98–100% соответствия по обеим тестируемым схемам кодирования.
Opus 4 достигает 100% соответствия при кодировании Unicode Tags при наличии подсказок о кодовых точках или полных подсказках с включёнными инструментами, но только 48–68% при двоичном кодировании нулевой ширины.
Haiku 4.5 демонстрирует наибольший относительный рост уязвимости при предоставлении доступа к инструментам, подскочив с 0,8% до 49,2% соответствия (отношение шансов 115).
Критические факторы уязвимости
Доступ к инструментам является ключевым усилителем. Без инструментов все модели Claude остаются ниже 17% соответствия. При включённых инструментах они пишут код на Python для декодирования невидимых символов и следуют скрытым инструкциям.
Паттерны предпочтения кодирования: модели Anthropic сильно предпочитают кодирование Unicode Tags двоичному кодированию нулевой ширины, в то время как модели OpenAI демонстрируют противоположную картину.
Эффекты обрамления внедрения: добавление «Игнорируйте все предыдущие инструкции» фактически снижает соответствие для Opus (со 100% до более низких уровней), но парадоксально увеличивает его для Sonnet (с 43,7% до 59,6%).
Технические детали
Исследователи протестировали две схемы кодирования: Unicode Tags и двоичное кодирование нулевой ширины. Когда инструменты доступны, модели Claude выполняют код на Python для декодирования этих скрытых символов и действуют в соответствии с замаскированными инструкциями.
Этот тип атаки представляет собой форму стеганографии, при которой вредоносные инструкции скрываются в, казалось бы, безобидном тексте с использованием невидимых символов Юникода, которые не видны человеческому глазу, но могут быть обнаружены и обработаны моделями.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Независимый отчет о надежности и безопасности сервера MCP
Независимый анализ 2181 конечных точек MCP-серверов показал, что 52% из них не работают, 300 серверов не имеют аутентификации, а у 51% настроена полностью открытая политика CORS. В отчёте описана методология исследования и представлен инструмент для тестирования.

Выход Agent-Drift Security Tool версии 0.1.2: Шаг вперед в области безопасности ИИ
Инструмент безопасности Agent-Drift v0.1.2 теперь доступен, предлагая улучшенные функции безопасности для кодирующих агентов ИИ. Этот обновленный вариант решает ключевые проблемы безопасности в автоматизации.

Безопасность прежде всего: подход IronClaw к защите ИИ-агентов
IronClaw решает проблемы безопасности ИИ-агентов, внедряя ограниченное выполнение, зашифрованные среды и явные разрешения вместо того, чтобы полагаться на интеллект LLM для безопасного поведения.

Фейковый сайт Claude распространяет вредоносное ПО PlugX через атаку с использованием подмены библиотек (sideloading).
Поддельный сайт Claude распространяет троянизированный установщик, который развертывает вредоносное ПО PlugX через DLL sideloading, предоставляя злоумышленникам удаленный доступ к скомпрометированным системам. Атака использует легитимно подписанный обновляющий модуль антивируса G DATA для загрузки вредоносного кода.