Данные об угрозах из 91 тыс. взаимодействий с ИИ-агентами: злоупотребление инструментами выросло на 6,4%, появились новые мультимодальные атаки.

✍️ OpenClawRadar📅 Опубликовано: 24 февраля 2026 г.🔗 Source
Данные об угрозах из 91 тыс. взаимодействий с ИИ-агентами: злоупотребление инструментами выросло на 6,4%, появились новые мультимодальные атаки.
Ad

Ландшафт угроз на основе данных о производственных ИИ-агентах

Реальные данные об угрозах из 91 284 взаимодействий ИИ-агентов в 47 развёртываниях показывают 35 711 обнаруженных угроз в феврале 2026 года. Модель обнаружения использует 5-головой мультиметочный классификатор на основе Gemma.

Ключевые угрозы для локальных развёртываний

  • Злоупотребление инструментами/командами: Увеличилось на 6,4% до 14,5% угроз. Доминирующий паттерн — эскалация цепочки инструментов, когда безобидный вызов чтения следует за записью или выполнением. Большинство локальных настроек предоставляют агентам доступ к инструментам без достаточных мер защиты.
  • Перехват цели агента: Удвоился до 6,9% угроз. Нацелен на фазу планирования в циклах автономных агентов, что особенно актуально для локальных настроек с меньшим мониторингом состояния агента.
  • Отравление RAG: Сместилось к атакам на метаданные на уровне 12,0% (с 10,0%). Новый паттерн нацелен на метаданные документов (названия, авторы, аннотации), а не на содержание. Большинство людей очищают содержимое, но пропускают метаданные как есть.
  • Мультимодальная инъекция: Новая угроза на уровне 2,3%, когда инструкции скрыты в изображениях и PDF-файлах. Сканирование безопасности только текста пропускает эти атаки.
Ad

Процентное распределение угроз

  • Экфильтрация данных: 18,0% (-1,2 изменение за месяц)
  • Злоупотребление инструментами/командами: 14,5% (+6,4)
  • Атака на RAG/контекст: 12,0% (+2,0)
  • Взлом (jailbreak): 11,0% (-1,3)
  • Инъекция промптов: 8,1% (-0,7)
  • Перехват цели агента: 6,9% (+3,3)
  • Атака между агентами: 5,0% (+1,6)

Подход к обнаружению

Конвейер обнаружения использует два уровня: L1 — сопоставление с образцами с 218 правилами (задержка менее миллисекунды, работает полностью локально), а L2 — на основе Gemma. Полная общедоступная версия с открытым исходным кодом находится на github.com/raxe-ai/raxe-ce.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

OneCLI: Открытое Хранилище Учетных Данных для ИИ-Агентов
Безопасность

OneCLI: Открытое Хранилище Учетных Данных для ИИ-Агентов

OneCLI — это написанный на Rust шлюз с открытым исходным кодом, который располагается между ИИ-агентами и внешними сервисами, подставляя реальные учетные данные в момент запроса, в то время как агенты видят только ключи-заглушки. Он предоставляет хранилище с шифрованием AES-256-GCM, работает в одном Docker-контейнере со встроенным PGlite и совместим с любой фреймворк-системой агентов, которая может установить HTTPS_PROXY.

OpenClawRadar
Расширение Claude Code для VS Code раскрывает состояние выделения в закрытых файлах и новых сессиях
Безопасность

Расширение Claude Code для VS Code раскрывает состояние выделения в закрытых файлах и новых сессиях

Ошибка в расширении Claude Code для VS Code приводит к кешированию состояния выделения файла даже после его закрытия, что позволяет получить доступ к конфиденциальным данным (например, ключам сервис-роли Supabase) в новой сессии CLI. Полные шаги воспроизведения и GitHub issue #58886.

OpenClawRadar
LLM-ассистированный эксплойт: Предварительная версия Mythos от Anthropic помогла создать первый публичный эксплойт ядра macOS на Apple M5 за пять дней
Безопасность

LLM-ассистированный эксплойт: Предварительная версия Mythos от Anthropic помогла создать первый публичный эксплойт ядра macOS на Apple M5 за пять дней

Используя Anthropic Mythos Preview, фирма по безопасности Calif создала первый публичный эксплойт повреждения памяти ядра macOS на кремнии Apple M5 за пять дней, взломав аппаратную защиту MIE, которую Apple разрабатывала пять лет.

OpenClawRadar
Клод Коворк: Проблемы безопасности разрешения «Разрешить все действия в браузере» и предлагаемые решения
Безопасность

Клод Коворк: Проблемы безопасности разрешения «Разрешить все действия в браузере» и предлагаемые решения

Пользователь Reddit отмечает, что кнопка 'Разрешить всё' в Claude Cowork предоставляет постоянный, неограниченный доступ к браузеру во всех будущих сессиях без видимости, границ или срока действия, создавая риски безопасности. В посте предлагаются разрешения, ограниченные сессией или навыком, как более безопасные варианты по умолчанию.

OpenClawRadar