Анализ безопасности ИИ-агентов выявляет нарушенную модель доверия и высокий уровень уязвимостей.

Разбор архитектуры безопасности
Анализ показывает, что фундаментальная модель доверительных отношений для ИИ-агентов нарушена. В отличие от традиционных архитектур безопасности, ИИ-агенты обрабатывают атаки и легитимные инструкции через одно и то же контекстное окно без структурного разделения. Разделение плоскостей управления и данных, лежащее в основе традиционной безопасности, отсутствует в текущих реализациях ИИ-агентов.
Ключевые эмпирические выводы
- Косвенное внедрение достигает 36-98% успешности атак (ASR) на передовые модели в бенчмарках MCPTox, ASB и PINT
- Более мощные модели БОЛЕЕ уязвимы к атакам на инструментальном уровне
- Сканирование экосистемы npm MCP: изучено 2 386 пакетов, 49% содержат проблемы безопасности
- Поверхности атак растут сверхлинейно с ростом возможностей агента
Предлагаемое решение: Правила угроз агентов (ATR)
Исследование представляет Правила угроз агентов (ATR) — первый открытый стандарт обнаружения угроз для ИИ-агентов. Реализация включает:
- 61 правило обнаружения
- 99,4% точности на бенчмарке PINT
- Открытый исходный код с лицензией MIT
- Доступно на GitHub: https://github.com/Agent-Threat-Rule/agent-threat-rules
Полная статья охватывает 30+ CVE, 7 бенчмарков и предлагает архитектурные требования для защитных механизмов, способных идти в ногу с масштабированием ИИ.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Реклама Meta содержала созданный ИИ CSAM; исследователи нашли более 50 в библиотеке объявлений
Исследователи обнаружили более 50 платных объявлений с ИИ-сгенерированным контентом о жестоком обращении с детьми в библиотеке рекламы Meta, некоторые из которых достигли тысяч аккаунтов. Meta удалила их после запроса WIRED.

FastCGI: 30 лет, и всё ещё лучший протокол для обратных прокси
FastCGI избегает HTTP-десинхронизации и проблем с ненадежными заголовками, используя явную фреймовую структуру сообщений и отдельные каналы параметров, что делает его более безопасным выбором для взаимодействия между прокси и бэкендом.

Google TIG сообщает о первом в реальных условиях эксплойте для нулевого дня, созданном ИИ
Группа угроз Google выявила субъект угрозы, использующий эксплойт zero-day, разработанный, как считается, с помощью ИИ, что стало первым наблюдением использования ИИ в наступательных целях для эксплуатации уязвимостей zero-day.

Инструмент для пентеста MCPwner AI обнаружил несколько уязвимостей нулевого дня в OpenClaw.
MCPwner, сервер MCP, который оркестрирует ИИ-агентов для автоматизированного тестирования на проникновение, выявил несколько критических уязвимостей нулевого дня в OpenClaw, включая инъекцию переменных окружения, обход разрешений и утечку информации, которые пропустили стандартные сканеры.