Многоуровневая защита снижает инъекции промптов до нуля в Claude Code

✍️ OpenClawRadar📅 Опубликовано: 8 августа 2026 г.🔗 Source
Многоуровневая защита снижает инъекции промптов до нуля в Claude Code
Ad

Anthropic заявляет, что многоуровневая защита может свести атаки с помощью промпт-инъекций к нулю, даже против неизвестных атак. Борис Черни в обсуждении нового Auto Mode в Claude Code описал многоуровневый подход: обучение модели, классификатор намерений и входные зонды. Он также подтвердил, что классификатор теперь бесплатен, отвечая на опасения по поводу стоимости токенов: «Мы делаем классификатор бесплатным. Вы не должны платить за безопасность».

Как слои складываются

  • Обучение модели: Базовая модель дообучена распознавать и отклонять паттерны инъекций.
  • Классификатор намерений: Отдельный классификатор проверяет намерение пользователя за каждым запросом, отфильтровывая вредоносные запросы до выполнения.
  • Входные зонды: Активные зонды тестируют входные данные на известные векторы инъекций, добавляя еще один барьер.

По словам источника, эта комбинация снижает частоту промпт-инъекций до 0% на неизвестных атаках. Ключевой момент в том, что ни один слой не идеален, но в совокупности они перехватывают подавляющее большинство попыток.

Ad

Классификатор теперь бесплатен

Цитата Бориса Черни пряма: «Мы делаем классификатор бесплатным. Вы не должны платить за безопасность». Это решает распространенную проблему — стоимость токенов — для разработчиков, которые беспокоились, что добавление проверок безопасности истощит их бюджеты. Если вы раньше обходили функции безопасности, чтобы экономить токены, это больше не проблема.

Это особенно актуально для команд, создающих автономных агентов с Claude Code, где промпт-инъекции являются реальным риском: вредоносные промпты в веб-контенте или выходных данных инструментов могут захватить агента. С бесплатным классификатором вы можете включить его, не беспокоясь о дополнительных расходах.

Полный пост в блоге посвящен Auto Mode в Claude Code, но эта деталь безопасности выделяется. Для разработчиков это сигнал, что Anthropic рассматривает безопасность как базовую функцию, а не премиальную надстройку.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Интеграция агента OpenClaw SOC для охоты за угрозами в домашней лаборатории SIEM
Безопасность

Интеграция агента OpenClaw SOC для охоты за угрозами в домашней лаборатории SIEM

Пользователь Reddit делится своей открытой SIEM-системой под названием Red Threat Redemption на Debian 13, которая интегрирует Elasticsearch, Kibana, Wazuh, Zeek и pfSense с Suricata, а затем добавляет ИИ-агента для автоматической корреляции угроз, охоты и сортировки оповещений.

OpenClawRadar
Система ИИ обнаружила 12 уязвимостей нулевого дня в OpenSSL, а Curl отменил программу вознаграждений за баги из-за спама от ИИ.
Безопасность

Система ИИ обнаружила 12 уязвимостей нулевого дня в OpenSSL, а Curl отменил программу вознаграждений за баги из-за спама от ИИ.

ИИ-система AISLE обнаружила все 12 уязвимостей нулевого дня в последнем релизе безопасности OpenSSL, что стало первой крупномасштабной демонстрацией ИИ-кибербезопасности. В то же время curl отменил свою программу вознаграждений за обнаружение уязвимостей из-за спам-отчетов, сгенерированных ИИ.

OpenClawRadar
Открытые инструменты искусственного интеллекта создают угрозы безопасности из-за «иллюзии безопасности через прозрачность».
Безопасность

Открытые инструменты искусственного интеллекта создают угрозы безопасности из-за «иллюзии безопасности через прозрачность».

В посте на Reddit предупреждают о вредоносном ПО, замаскированном под открытые ИИ-агенты и инструменты, где зловредный код может быть скрыт в больших кодовых базах, которые пользователи считают безопасными, потому что они на GitHub. В посте описывается, как «вайб-кодинг» и автономные ИИ-агенты приучают пользователей запускать неизвестные программы без проверки.

OpenClawRadar
Анализатор навыков теперь доступен на ClawHub с установкой одной командой.
Безопасность

Анализатор навыков теперь доступен на ClawHub с установкой одной командой.

Сканер безопасности OpenClaw Skill Analyzer теперь доступен на ClawHub с установкой одной командой. Инструмент проверяет папки навыков на наличие вредоносных паттернов, таких как инъекция промптов и кража учетных данных, и включает поддержку Docker-песочницы для безопасного выполнения.

OpenClawRadar