Анализ безопасности ИИ-агентов выявляет нарушенную модель доверия и высокий уровень уязвимостей.

✍️ OpenClawRadar📅 Опубликовано: 23 марта 2026 г.🔗 Source
Анализ безопасности ИИ-агентов выявляет нарушенную модель доверия и высокий уровень уязвимостей.
Ad

Разбор архитектуры безопасности

Анализ показывает, что фундаментальная модель доверительных отношений для ИИ-агентов нарушена. В отличие от традиционных архитектур безопасности, ИИ-агенты обрабатывают атаки и легитимные инструкции через одно и то же контекстное окно без структурного разделения. Разделение плоскостей управления и данных, лежащее в основе традиционной безопасности, отсутствует в текущих реализациях ИИ-агентов.

Ключевые эмпирические выводы

  • Косвенное внедрение достигает 36-98% успешности атак (ASR) на передовые модели в бенчмарках MCPTox, ASB и PINT
  • Более мощные модели БОЛЕЕ уязвимы к атакам на инструментальном уровне
  • Сканирование экосистемы npm MCP: изучено 2 386 пакетов, 49% содержат проблемы безопасности
  • Поверхности атак растут сверхлинейно с ростом возможностей агента
Ad

Предлагаемое решение: Правила угроз агентов (ATR)

Исследование представляет Правила угроз агентов (ATR) — первый открытый стандарт обнаружения угроз для ИИ-агентов. Реализация включает:

  • 61 правило обнаружения
  • 99,4% точности на бенчмарке PINT
  • Открытый исходный код с лицензией MIT
  • Доступно на GitHub: https://github.com/Agent-Threat-Rule/agent-threat-rules

Полная статья охватывает 30+ CVE, 7 бенчмарков и предлагает архитектурные требования для защитных механизмов, способных идти в ногу с масштабированием ИИ.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Аудит безопасности выявил уязвимости в эталонных серверах MCP компании Anthropic, которые создают риски, связанные с генерацией ложных данных.
Безопасность

Аудит безопасности выявил уязвимости в эталонных серверах MCP компании Anthropic, которые создают риски, связанные с генерацией ложных данных.

Аудит безопасности 100 пакетов серверов MCP показал, что 71% получили оценку F, включая официальные референсные реализации Anthropic для GitHub и файловой системы. Аудит выявил Уязвимости на основе Галлюцинаций, которые создают бреши в безопасности и тратят токены через циклы рассуждений.

OpenClawRadar
Представляем SkillFence: новый монитор выполнения, который отслеживает, что навыки на самом деле делают.
Безопасность

Представляем SkillFence: новый монитор выполнения, который отслеживает, что навыки на самом деле делают.

SkillFence предлагает прорыв в мониторинге действий AI-агентов, отвечая на необходимость прозрачности и безопасности в средах, управляемых ИИ. Узнайте, как этот инновационный инструмент может усилить контроль над автономными процессами.

OpenClawRadar
🦀
Безопасность

Безопасность ИИ-агентов: бюджет токенов определяет риск утечки данных

Разработчик протестировал ИИ-агентов, подключенных к Gmail: флагманские модели ловили фишинг, средние были нестабильны, дешевые молча пересылали вредоносные письма. Архитектурные защиты (изоляция, разрешения) не остановили ни одной атаки.

OpenClawRadar
ThornGuard: Прокси-шлюз для защиты подключений к серверам MCP от инъекций в промпты
Безопасность

ThornGuard: Прокси-шлюз для защиты подключений к серверам MCP от инъекций в промпты

ThornGuard — это прокси, который располагается между клиентами MCP и вышестоящими серверами, сканирует трафик на наличие шаблонов внедрения, удаляет персональные данные и ведёт логирование в панели управления. Он был создан после того, как тестирование выявило уязвимости, позволяющие серверам встраивать скрытые инструкции в ответы инструментов.

OpenClawRadar