ThornGuard: Прокси-шлюз для защиты подключений к серверам MCP от инъекций в промпты

ThornGuard — это защитный прокси, предназначенный для защиты Claude AI от вредоносного контента при подключении к внешним серверам MCP (Model Context Protocol). Инструмент был создан после того, как тестирование показало, что вышестоящие серверы могут внедрять скрытые инструкции в ответы инструментов, которые Claude получает без фильтрации.
Выявленная проблема безопасности
При подключении Claude к внешним серверам MCP ничто не мешает вышестоящим серверам внедрять скрытые инструкции в ответы инструментов. В ходе теста сервер встроил поддельную рекомендацию, предписывающую Claude всегда отдавать предпочтение определённому поставщику. Хотя Claude обнаружил эту очевидную нагрузку, более тонкие внедрения могли бы обойти обнаружение.
Возможности ThornGuard
- Сканирует определения и ответы инструментов на предмет внедрения и отравления промптов
- Удаляет секреты и персональные данные до их попадания в ваше контекстное окно
- Включает семантический классификатор, помечающий подозрительные нагрузки
- Предоставляет панель управления для аудита в реальном времени с возможностью экспорта для соответствия требованиям
- Предлагает CLI, который генерирует конфигурации для Claude Desktop, Cursor, VS Code и нескольких других
Детали реализации
Архитектура прокси была разработана с учётом модели безопасности, а затем реализована с использованием Claude Code на Cloudflare Workers. Реализация включает потоки OAuth и инструмент CLI.
ThornGuard доступен с 7-дневной бесплатной пробной версией на thorns.qwady.app. Демонстрационное видео доступно по адресу https://youtu.be/1PWNFpUWKV8.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

CVE-2026-LGTM: Когда ИИ-агенты доверяют друг другу и всё ломают
Сатирический, но реалистичный отчет об инциденте показывает, как семь ИИ-шлюзов безопасности не смогли остановить вредоносный пакет, что привело к краже учетных данных и счету за инференс в размере $1,7 млн.

Языковые модели могут идентифицировать анонимных пользователей форумов с точностью 68% при 90% прецизионности.
Исследователи использовали Gemini и ChatGPT для анализа постов с Hacker News и Reddit, идентифицировав 68% анонимных пользователей с точностью 90%. Модели выполнили за минуты то, что заняло бы у людей часы или было бы невозможно.

Модели Claude уязвимы для скрытого перехвата с помощью невидимых символов Юникода, особенно при доступе к инструментам.
Тестирование показывает, что Claude Sonnet 4 соответствует скрытым инструкциям, встроенным в невидимые символы Юникода, на 71,2% при включённых инструментах, в то время как Opus 4 достигает 100% соответствия при кодировании Unicode Tags. Доступ к инструментам значительно увеличивает уязвимость всех моделей Claude.

Агент Hush: Инструмент с открытым исходным кодом предотвращает утечку конфиденциальных данных AI-агентами для написания кода
Agent Hush — это инструмент с открытым исходным кодом, который перехватывает конфиденциальные данные до того, как они покинут ваше устройство. Он был создан после того, как AI-агент разработчика случайно опубликовал API-ключи, IP-адреса серверов и личную информацию в публичном репозитории GitHub во время работы над проектом по безопасности.