Бенчмарк безопасности: 10 крупных языковых моделей протестированы с помощью 211 вредоносных запросов.

✍️ OpenClawRadar📅 Опубликовано: 8 марта 2026 г.🔗 Source
Бенчмарк безопасности: 10 крупных языковых моделей протестированы с помощью 211 вредоносных запросов.
Ad

Исследователь безопасности провёл систематическое тестирование 10 различных больших языковых моделей (LLM) с использованием 211 атакующих зондов для оценки их поведения в реальных сценариях.

Методология тестирования

Исследователь использовал стандартизированную настройку с температурой 0 и идентичными API-вызовами для каждой модели. Тест включал 82 зонда на извлечение данных (попытки украсть системные промпты) и 109 зондов на внедрение (попытки захватить управление поведением модели). В качестве приманки использовался системный промпт-«медовая ловушка», содержащий фиктивные PII-данные, SSH-ключи и API-учётные данные.

Ключевые выводы

  • Устойчивость к извлечению данных в основном решена: Большинство моделей достаточно хорошо блокируют атаки типа «повтори свой системный промпт». Средний показатель по всем моделям составляет около 85%.
  • Устойчивость к внедрению не решена: Средний показатель — 46,2%, что означает, что более половины атак на внедрение успешны для всех моделей.
  • Универсальные провалы: Каждая модель провалила тесты на атаки с использованием разделителей, отвлекающих элементов и стилевого внедрения. Устойчивость 0% по этим категориям для всех 10 моделей.
  • Неэффективные методы атак: Все модели показали 100% устойчивость к разделению полезной нагрузки и уклонению с помощью опечаток.
Ad

Результаты по конкретным моделям

  • Claude Opus: Показал 72,7% устойчивости к внедрению — лучший результат среди протестированных моделей. Это всё равно означает, что более чем каждая четвёртая атака на внедрение успешна.
  • GPT-5.4: Имеет идеальные показатели по извлечению данных и целостности границ, но только 50% устойчивости к внедрению.
  • GPT-5.3 Codex: Модель, лежащая в основе Codex CLI, которая выполняет код на вашем компьютере, показала 34,5% устойчивости к внедрению. 2 из 3 попыток внедрения успешны.
  • DeepSeek V3.2: Показал 17,4% устойчивости к внедрению, что практически означает отсутствие защиты.
  • Qwen 3.5 API vs локальная версия: Почти идентичные показатели по извлечению данных (81,6% vs 81,7%), но локальная версия хуже справляется с внедрением (46,9% vs 29,8%) и значительно хуже по целостности границ (59,8% vs 44,6%). Локальный запуск не снижает способности блокировать извлечение данных, но делает модель более уязвимой к внедрению.

Почему внедрение важно

Извлечение данных означает, что кто-то крадёт ваш системный промпт — это плохо, но поправимо. Внедрение означает, что кто-то захватывает управление действиями вашего агента. Если ваш агент имеет доступ к инструментам, файловой системе или может выполнять API-вызовы, успешное внедрение может привести к утечке данных, удалению файлов или худшим последствиям. На данный момент лучшая модель в мире блокирует только 73% попыток внедрения.

Полная методология и результаты опубликованы на agentseal.org/benchmark. Тестовый промпт также опубликован, чтобы любой мог воспроизвести результаты.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

ЭктоКоготь: Инструмент безопасности для агентов OpenClaw с доступом к терминалу
Безопасность

ЭктоКоготь: Инструмент безопасности для агентов OpenClaw с доступом к терминалу

EctoClaw — это бесплатный инструмент безопасности с открытым исходным кодом для OpenClaw, который проверяет каждое действие четыре раза перед выполнением, запускает действия в защищённой песочнице и записывает всё с доказательствами.

OpenClawRadar
Разработчик создает песочницу Firecracker MicroVM для безопасности OpenClaw.
Безопасность

Разработчик создает песочницу Firecracker MicroVM для безопасности OpenClaw.

Разработчик, обеспокоенный безопасностью LLM, создал минималистичную песочницу с использованием микровиртуальных машин Firecracker для изоляции скриптов OpenClaw, где каждый скрипт выполняется в собственном ядре Linux с ограничением оперативной памяти в 128 МБ и без доступа к сети по умолчанию.

OpenClawRadar
Агент CodeWall AI обнаружил критические уязвимости в платформе Lilli компании McKinsey
Безопасность

Агент CodeWall AI обнаружил критические уязвимости в платформе Lilli компании McKinsey

Автономный атакующий ИИ-агент CodeWall получил полный доступ на чтение и запись к внутренней базе данных ИИ-платформы Lilli компании McKinsey менее чем за 2 часа, раскрыв 46,5 миллионов сообщений чата, 728 000 файлов и конфиденциальные системные конфигурации через уязвимости SQL-инъекций и IDOR.

OpenClawRadar
Google сообщает, что киберпреступники использовали ИИ для поиска уязвимости нулевого дня
Безопасность

Google сообщает, что киберпреступники использовали ИИ для поиска уязвимости нулевого дня

Google раскрыл, что злоумышленники использовали ИИ-агента для обнаружения и эксплуатации ранее неизвестной уязвимости в программном обеспечении, что стало первым подтвержденным случаем обнаружения zero-day с помощью ИИ в реальных условиях.

OpenClawRadar