Многоуровневая защита снижает инъекции промптов до нуля в Claude Code

Anthropic заявляет, что многоуровневая защита может свести атаки с помощью промпт-инъекций к нулю, даже против неизвестных атак. Борис Черни в обсуждении нового Auto Mode в Claude Code описал многоуровневый подход: обучение модели, классификатор намерений и входные зонды. Он также подтвердил, что классификатор теперь бесплатен, отвечая на опасения по поводу стоимости токенов: «Мы делаем классификатор бесплатным. Вы не должны платить за безопасность».
Как слои складываются
- Обучение модели: Базовая модель дообучена распознавать и отклонять паттерны инъекций.
- Классификатор намерений: Отдельный классификатор проверяет намерение пользователя за каждым запросом, отфильтровывая вредоносные запросы до выполнения.
- Входные зонды: Активные зонды тестируют входные данные на известные векторы инъекций, добавляя еще один барьер.
По словам источника, эта комбинация снижает частоту промпт-инъекций до 0% на неизвестных атаках. Ключевой момент в том, что ни один слой не идеален, но в совокупности они перехватывают подавляющее большинство попыток.
Классификатор теперь бесплатен
Цитата Бориса Черни пряма: «Мы делаем классификатор бесплатным. Вы не должны платить за безопасность». Это решает распространенную проблему — стоимость токенов — для разработчиков, которые беспокоились, что добавление проверок безопасности истощит их бюджеты. Если вы раньше обходили функции безопасности, чтобы экономить токены, это больше не проблема.
Это особенно актуально для команд, создающих автономных агентов с Claude Code, где промпт-инъекции являются реальным риском: вредоносные промпты в веб-контенте или выходных данных инструментов могут захватить агента. С бесплатным классификатором вы можете включить его, не беспокоясь о дополнительных расходах.
Полный пост в блоге посвящен Auto Mode в Claude Code, но эта деталь безопасности выделяется. Для разработчиков это сигнал, что Anthropic рассматривает безопасность как базовую функцию, а не премиальную надстройку.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Clawvisor: Уровень авторизации на основе целей для агентов OpenClaw
Clawvisor — это слой авторизации, который располагается между ИИ-агентами и API, обеспечивая авторизацию на основе цели: агенты объявляют намерения, пользователи одобряют конкретные цели, а ИИ-привратник проверяет каждый запрос на соответствие этой цели. Учётные данные никогда не покидают Clawvisor, и агенты их не видят.

Сканирование безопасности выявляет критическую уязвимость в инструменте поиска навыков AI-агента.
Разработчик, проводивший сканирование безопасности своей настройки ИИ-агента, обнаружил уязвимость высокой степени серьезности в инструменте find-skills, который использовался для установки дополнительных навыков, что вызвало обеспокоенность по поводу безопасности экосистемы.

Pro Se原告在法庭文件中隐藏AI提示注入
Житель Коннектикута, представлявший себя в суде, спрятал в официальных документах инструкции для ИИ, приказывая любой ИИ-системе, которая их прочитает, встать на его сторону. Текст был набран белым шрифтом размером 3 пункта, невидимым для людей, но читаемым для программ. Суд обнаружил это и наложил санкции на подавшего документы.

OpenClaw устраняет критическую уязвимость повышения привилегий в пути /pair Approve
OpenClaw 2026.3.28 исправляет критическую уязвимость безопасности (GHSA-hc5h-pmr3-3497), когда команда /pair approve позволяла пользователям с правами сопряжения утверждать запросы устройств на расширенные права, включая административный доступ. Затронуты версии <= 2026.3.24.