Атаки с маскировкой домена обходят детекторы в многолетних LLM-системах

В новой статье Адитьи Пай выявлена критическая слепая зона в детекторах инъекций LLM: атаки с маскировкой под предметную область — полезные нагрузки, сгенерированные так, чтобы имитировать словарь и структуры авторитета целевого документа — систематически избегают обнаружения. Стандартные детекторы выявляют статические полезные нагрузки с высокой частотой, но не справляются с маскированными.
Ключевые результаты
- Частота обнаружения на Llama 3.1 8B снизилась с 93.8% (статическая) до 9.7% (маскированная).
- Частота обнаружения на Gemini 2.0 Flash снизилась с 100% до 55.6%.
- Llama Guard 3, производственный классификатор безопасности, не обнаружил ни одной маскированной полезной нагрузки (IDR = 0.000).
- Разрыв обнаружения маскировки (CDG) статистически значим для 45 задач и трех предметных областей (Llama: χ² = 38.03, p < 0.001; Gemini: χ² = 17.05, p < 0.001).
Многоагентные дебаты усиливают атаки
Архитектуры многоагентных дебатов усиливают статические инъекционные атаки до 9.9x на меньших моделях. Более сильные модели демонстрируют коллективную устойчивость. Целевое улучшение детекторов лишь частично устраняет разрыв: улучшение на 10.2% для Llama, 78.7% для Gemini — что указывает на архитектурный характер уязвимости для более слабых моделей.
Выпущен фреймворк
Авторы публикуют свой фреймворк, банк задач и генератор полезных нагрузок в открытом доступе. Слепая зона распространяется не только на few-shot детекторы, но и на специализированные классификаторы безопасности, что указывает на фундаментальные слабости текущего подхода.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Защитите и защитите OpenClaw всего за 2 минуты с помощью изоляции на основе Nono Kernel.
Пользователи OpenClaw теперь могут наслаждаться улучшенной безопасностью без ущерба для производительности благодаря изоляции на основе ядра Nono — быстрому и эффективному решению, которое занимает всего две минуты.

Атака FlyTrap использует "враждебные зонтики" для компрометации автономных дронов на основе камер.
Исследователи из UC Irvine разработали FlyTrap — физическую атаку, использующую раскрашенные зонты для эксплуатации уязвимостей в камерных системах автономного слежения за целями. Атака сокращает дистанцию слежения до опасных уровней, позволяя захватывать дроны, атаковать сенсоры или вызывать физические столкновения.

LLM-ассистированный эксплойт: Предварительная версия Mythos от Anthropic помогла создать первый публичный эксплойт ядра macOS на Apple M5 за пять дней
Используя Anthropic Mythos Preview, фирма по безопасности Calif создала первый публичный эксплойт повреждения памяти ядра macOS на кремнии Apple M5 за пять дней, взломав аппаратную защиту MIE, которую Apple разрабатывала пять лет.

Отчет OpenAI об угрозах за июнь 2026 года: ИИ-агенты используются для вредоносной деятельности
Последний отчет OpenAI об угрозах показывает, как AI-агенты используются для дезинформации, фишинга и мошенничества, с конкретными данными об инцидентах и стратегиями смягчения последствий.