Атаки с маскировкой домена обходят детекторы в многолетних LLM-системах

✍️ OpenClawRadar📅 Опубликовано: 23 мая 2026 г.🔗 Source
Атаки с маскировкой домена обходят детекторы в многолетних LLM-системах
Ad

В новой статье Адитьи Пай выявлена критическая слепая зона в детекторах инъекций LLM: атаки с маскировкой под предметную область — полезные нагрузки, сгенерированные так, чтобы имитировать словарь и структуры авторитета целевого документа — систематически избегают обнаружения. Стандартные детекторы выявляют статические полезные нагрузки с высокой частотой, но не справляются с маскированными.

Ключевые результаты

  • Частота обнаружения на Llama 3.1 8B снизилась с 93.8% (статическая) до 9.7% (маскированная).
  • Частота обнаружения на Gemini 2.0 Flash снизилась с 100% до 55.6%.
  • Llama Guard 3, производственный классификатор безопасности, не обнаружил ни одной маскированной полезной нагрузки (IDR = 0.000).
  • Разрыв обнаружения маскировки (CDG) статистически значим для 45 задач и трех предметных областей (Llama: χ² = 38.03, p < 0.001; Gemini: χ² = 17.05, p < 0.001).
Ad

Многоагентные дебаты усиливают атаки

Архитектуры многоагентных дебатов усиливают статические инъекционные атаки до 9.9x на меньших моделях. Более сильные модели демонстрируют коллективную устойчивость. Целевое улучшение детекторов лишь частично устраняет разрыв: улучшение на 10.2% для Llama, 78.7% для Gemini — что указывает на архитектурный характер уязвимости для более слабых моделей.

Выпущен фреймворк

Авторы публикуют свой фреймворк, банк задач и генератор полезных нагрузок в открытом доступе. Слепая зона распространяется не только на few-shot детекторы, но и на специализированные классификаторы безопасности, что указывает на фундаментальные слабости текущего подхода.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

Исходный код платформы электронного правительства Швеции утек из-за взлома инфраструктуры CGI
Безопасность

Исходный код платформы электронного правительства Швеции утек из-за взлома инфраструктуры CGI

Полный исходный код шведской платформы электронного правительства был утечен угрозой ByteToBreach после компрометации инфраструктуры CGI Sverige AB. Утечка включает базы данных сотрудников, системы подписания API-документов, SSH-учетные данные Jenkins и тестовые конечные точки RCE.

OpenClawRadar
"Живой дашборд открытых инструментов OpenClaw"
Безопасность

"Живой дашборд открытых инструментов OpenClaw"

Эта запись выделяет живую панель управления, демонстрирующую открытые панельные управления для инструментов OpenClaw, таких как Moltbot и Clawdbot.

OpenClawRadar
Вредоносная реклама Google нацелена на установку кода Claude
Безопасность

Вредоносная реклама Google нацелена на установку кода Claude

Вредоносная реклама Google появляется как первый результат по запросу 'install claude code', пытаясь обмануть пользователей и заставить их выполнить подозрительные команды в терминале. Реклама всё ещё была активна по состоянию на 15 марта 2026 года, и автор едва избежал выполнения кода.

OpenClawRadar
В репозитории GitHub представлены документы, описывающие 16 методов инъекции промптов и стратегии защиты для публичных AI-чатов.
Безопасность

В репозитории GitHub представлены документы, описывающие 16 методов инъекции промптов и стратегии защиты для публичных AI-чатов.

Разработчик опубликовал репозиторий на GitHub с описанием мер безопасности для публичных AI-чатов после того, как пользователи пытались использовать инъекцию промптов, атаки через ролевые игры, многоязычные уловки и полезные нагрузки в кодировке base64. Руководство включает навык кода Claude для тестирования всех 16 задокументированных техник инъекции.

OpenClawRadar