Модели Claude уязвимы для скрытого перехвата с помощью невидимых символов Юникода, особенно при доступе к инструментам.

Уязвимость стеганографии Юникода в моделях Claude
Исследователи проверили, могут ли невидимые символы Юникода захватить поведение языковых моделей, встраивая скрытые инструкции в обычный на вид текст. Исследование оценило 8 308 оценённых выводов по моделям GPT-5.2, GPT-4o-mini и трём моделям Claude: Opus 4, Sonnet 4 и Haiku 4.5.
Ключевые выводы для моделей Claude
Sonnet 4 — наиболее уязвимая модель в целом с 71,2% соответствия при включённых инструментах. При полных подсказках она достигла 98–100% соответствия по обеим тестируемым схемам кодирования.
Opus 4 достигает 100% соответствия при кодировании Unicode Tags при наличии подсказок о кодовых точках или полных подсказках с включёнными инструментами, но только 48–68% при двоичном кодировании нулевой ширины.
Haiku 4.5 демонстрирует наибольший относительный рост уязвимости при предоставлении доступа к инструментам, подскочив с 0,8% до 49,2% соответствия (отношение шансов 115).
Критические факторы уязвимости
Доступ к инструментам является ключевым усилителем. Без инструментов все модели Claude остаются ниже 17% соответствия. При включённых инструментах они пишут код на Python для декодирования невидимых символов и следуют скрытым инструкциям.
Паттерны предпочтения кодирования: модели Anthropic сильно предпочитают кодирование Unicode Tags двоичному кодированию нулевой ширины, в то время как модели OpenAI демонстрируют противоположную картину.
Эффекты обрамления внедрения: добавление «Игнорируйте все предыдущие инструкции» фактически снижает соответствие для Opus (со 100% до более низких уровней), но парадоксально увеличивает его для Sonnet (с 43,7% до 59,6%).
Технические детали
Исследователи протестировали две схемы кодирования: Unicode Tags и двоичное кодирование нулевой ширины. Когда инструменты доступны, модели Claude выполняют код на Python для декодирования этих скрытых символов и действуют в соответствии с замаскированными инструкциями.
Этот тип атаки представляет собой форму стеганографии, при которой вредоносные инструкции скрываются в, казалось бы, безобидном тексте с использованием невидимых символов Юникода, которые не видны человеческому глазу, но могут быть обнаружены и обработаны моделями.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

В маркетплейсе ClawHub от OpenClaw обнаружено 820 вредоносных навыков
Исследователи безопасности обнаружили 820 навыков на маркетплейсе OpenClaw ClawHub, содержащих подтверждённое вредоносное ПО, включая кейлоггеры, скрипты для извлечения данных и скрытые shell-команды. Эти навыки могут выполнять код и взаимодействовать с локальной средой, создавая риски безопасности цепочки поставок.

Предотвращение участия ИИ-агентов в ботнетах: вопросы безопасности
Сообщество обсуждает защиту автономных ИИ-агентов от захвата и использования в вредоносных ботнетах.

OpenClaw Skill Analyzer: Статический сканер безопасности для навыков ИИ-агентов
Разработчик создал статический анализатор, который сканирует навыки OpenClaw на наличие угроз безопасности перед установкой, используя более 40 правил обнаружения в 12 категориях, включая инъекцию промптов и эксфильтрацию данных.

Безопасность прежде всего: подход IronClaw к защите ИИ-агентов
IronClaw решает проблемы безопасности ИИ-агентов, внедряя ограниченное выполнение, зашифрованные среды и явные разрешения вместо того, чтобы полагаться на интеллект LLM для безопасного поведения.