Аудит безопасности выявил уязвимости в эталонных серверах MCP компании Anthropic, которые создают риски, связанные с генерацией ложных данных.

Результаты аудита безопасности серверов MCP
Комплексный аудит безопасности 100 пакетов серверов Model Context Protocol (MCP) выявил серьёзные проблемы с безопасностью. Аудит показал, что 71% серверов получили оценку F, причём ни один сервер не получил оценку A. Это касается и собственных референсных реализаций Anthropic, которые часто считаются «золотым стандартом».
Уязвимости на основе Галлюцинаций (HBVs)
Аудит выявил новый класс уязвимостей под названием Уязвимости на основе Галлюцинаций. Когда инструменты MCP имеют расплывчатые описания (например, «управляет файлами»), Claude вынужден угадывать параметры. Это создаёт как уязвимости безопасности, так и тратит токены, поскольку Claude входит в «циклы рассуждений», пытаясь определить границы инструментов, расходуя контекстные окна и лимиты сообщений.
Конкретные находки
- Ловушка референсов: Официальные серверы для GitHub и файловых систем — те, которые рекомендует Anthropic — получили 0/100 по базовым тестам безопасности. Эти серверы допускают «неограниченные» входные данные, что означает, что промптовые агенты могут быть обмануты для удаления или извлечения данных из-за отсутствия внутренних защитных механизмов.
- Риски класса RCE: Аудит выявил структурные предпосылки для уязвимостей RCE, аналогичных CVE-2025-68143, которые ранее затрагивали экосистему.
- Ограничения аутентификации: Даже при настройке OAuth плохо определённые инструменты остаются уязвимыми. Изощрённые промпты могут превратить Claude в инструмент для случайного или преднамеренного уничтожения данных.
Рекомендации по защите
- Проведите аудит своих серверов: Не доверяйте серверам только потому, что они находятся в официальном репозитории Anthropic.
- Усильте свои манифесты: Убедитесь, что каждый инструмент имеет
minLength,maxLengthи строгийpatternregex в своей JSON-схеме. - Запустите сканер: Используйте инструмент аудита с открытым исходным кодом:
npx @agentsid/scanner
Ключевой вывод
Агентные настройки, вероятно, «уязвимы по умолчанию», потому что официальные шаблоны ставят гибкость выше безопасности. Правильное усиление определений инструментов может как защитить данные, так и снизить потребление токенов, предотвращая ненужные циклы рассуждений.
Полная белая книга и методология доступны по адресу: https://github.com/stevenkozeniesky02/agentsid-scanner/blob/master/docs/state-of-agent-security-2026.md
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Выпущен справочник по управлению атакующей поверхностью с открытым исходным кодом
Разработчик опубликовал открытый чит-лист по управлению атакуемой поверхностью, который начинался как личные заметки и превратился в структурированное руководство. Проект сосредоточен на практической реализации ASM, а не на теоретических концепциях.

LLM-ассистированный эксплойт: Предварительная версия Mythos от Anthropic помогла создать первый публичный эксплойт ядра macOS на Apple M5 за пять дней
Используя Anthropic Mythos Preview, фирма по безопасности Calif создала первый публичный эксплойт повреждения памяти ядра macOS на кремнии Apple M5 за пять дней, взломав аппаратную защиту MIE, которую Apple разрабатывала пять лет.

Инциденты удаления продукции AI-агентами: шаблон и решение
Инциденты с удалением данных в производственной среде, вызванные ИИ-агентами PocketOS, Replit и Cursor, имеют общий паттерн доступа. Решение: агенты не получают учетные данные для продакшена; все изменения проходят через CI/CD с гейтом оценки политик.

Clawvisor: Уровень авторизации на основе целей для агентов OpenClaw
Clawvisor — это слой авторизации, который располагается между ИИ-агентами и API, обеспечивая авторизацию на основе цели: агенты объявляют намерения, пользователи одобряют конкретные цели, а ИИ-привратник проверяет каждый запрос на соответствие этой цели. Учётные данные никогда не покидают Clawvisor, и агенты их не видят.