Эксперимент по проверке безопасности показывает, что производительность ИИ-агента зависит от доступа к знаниям.

Пользователь Reddit провёл эксперимент, сравнивая подходы к аудиту безопасности с помощью ИИ на одном кодовом проекте, чтобы проверить, как доступ к знаниям влияет на результаты. В качестве тестового объекта использовался открытый стартовый набор SaaS на Next.js от BoxyHQ.
Три метода аудита в сравнении
Разработчик провёл три независимых аудита безопасности:
- Встроенная проверка безопасности Claude Code: Обнаружила 1 критическую, 6 высоких и 13 проблем средней степени серьёзности
- ИИ-агент без дополнительного контекста: Обнаружил 1 критическую, 5 высоких и 14 проблем средней степени серьёзности
- ИИ-агент с доступом к 10 профессиональным книгам по безопасности: Обнаружил 8 критических, 9 высоких и 10 проблем средней степени серьёзности
Ключевые выводы
Агент с доступом к книгам выявил уязвимости, которые другие методы полностью пропустили, включая:
- Токены сброса пароля, хранящиеся в открытом виде
- Состояние гонки TOCTOU (Time-of-Check to Time-of-Use) при проверке токенов
- Флаг функции, который вызывает
res.status(404), но не завершает выполнение, позволяя коду продолжать работу
Разработчик отметил, что это не какие-то редкие случаи, а именно те проблемы, которые встречаются в реальных нарушениях безопасности. Эксперимент использовал один и тот же кодовый проект и одну и ту же модель ИИ во всех трёх тестах, единственной переменной был доступный агенту объём знаний.
Последствия для разработки с помощью ИИ
Эксперимент показывает, что ИИ-агенты ограничены не интеллектом, а тем, какие знания они могут получить в нужный момент. Разработчик сделал вывод, что знания о безопасности «находятся над кодом», а не в нём, подчёркивая важность предоставления ИИ-инструментам предметных справочных материалов вместо того, чтобы полагаться только на их базовое обучение.
Такой подход к расширению возможностей ИИ-агентов специализированными источниками знаний может быть особенно актуален для разработчиков, использующих ИИ-помощников для проверки безопасности, где доступ к актуальным справочникам и лучшим практикам значительно влияет на качество обнаруженных проблем.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Настольное приложение Claude от Anthropic устанавливает нераскрытый мост нативной передачи сообщений
Claude Desktop незаметно устанавливает предварительно авторизованное расширение браузера, поддерживающее обмен сообщениями с нативными приложениями, что вызывает опасения по поводу безопасности.

Открытая площадка для тестирования на проникновение ИИ-агентов с опубликованными уязвимостями.
Fabraix открыла исходный код живой среды для стресс-тестирования защит ИИ-агентов с помощью состязательных испытаний. Каждое испытание разворачивает живого агента с реальными инструментами и опубликованными системными промптами, а выигрышные транскрипты диалогов и логи защитных механизмов документируются публично.

Пробел в безопасности OpenClaw устранен спецификацией агентской доверенности (APOA).
Разработчик опубликовал открытую спецификацию под названием Agentic Power of Attorney (APOA), чтобы решить проблемы безопасности в OpenClaw, где агенты в настоящее время получают доступ к таким сервисам, как электронная почта и календарь, имея в качестве ограничений только инструкции на естественном языке. Спецификация предлагает разрешения для каждого сервиса, ограниченный по времени доступ, журналы аудита, отзыв прав и изоляцию учетных данных.

Анализ безопасности изоляции агентов: от отсутствия песочницы до виртуальных машин Firecracker
Анализ того, как Cursor, Claude Code, Devin, OpenAI и E2B изолируют рабочие нагрузки агентов, от отсутствия песочницы до аппаратно-изолированных микровиртуальных машин Firecracker. Среда выполнения контейнеров ежегодно с 2019 года имела уязвимости типа CVE, позволяющие сбежать из контейнера, в то время как у Firecracker за семь лет не было ни одного случая побега из гостевой системы на хост.