Многоуровневая защита снижает инъекции промптов до нуля в Claude Code

✍️ OpenClawRadar📅 Опубликовано: 8 августа 2026 г.🔗 Source
Многоуровневая защита снижает инъекции промптов до нуля в Claude Code
Ad

Anthropic заявляет, что многоуровневая защита может свести атаки с помощью промпт-инъекций к нулю, даже против неизвестных атак. Борис Черни в обсуждении нового Auto Mode в Claude Code описал многоуровневый подход: обучение модели, классификатор намерений и входные зонды. Он также подтвердил, что классификатор теперь бесплатен, отвечая на опасения по поводу стоимости токенов: «Мы делаем классификатор бесплатным. Вы не должны платить за безопасность».

Как слои складываются

  • Обучение модели: Базовая модель дообучена распознавать и отклонять паттерны инъекций.
  • Классификатор намерений: Отдельный классификатор проверяет намерение пользователя за каждым запросом, отфильтровывая вредоносные запросы до выполнения.
  • Входные зонды: Активные зонды тестируют входные данные на известные векторы инъекций, добавляя еще один барьер.

По словам источника, эта комбинация снижает частоту промпт-инъекций до 0% на неизвестных атаках. Ключевой момент в том, что ни один слой не идеален, но в совокупности они перехватывают подавляющее большинство попыток.

Ad

Классификатор теперь бесплатен

Цитата Бориса Черни пряма: «Мы делаем классификатор бесплатным. Вы не должны платить за безопасность». Это решает распространенную проблему — стоимость токенов — для разработчиков, которые беспокоились, что добавление проверок безопасности истощит их бюджеты. Если вы раньше обходили функции безопасности, чтобы экономить токены, это больше не проблема.

Это особенно актуально для команд, создающих автономных агентов с Claude Code, где промпт-инъекции являются реальным риском: вредоносные промпты в веб-контенте или выходных данных инструментов могут захватить агента. С бесплатным классификатором вы можете включить его, не беспокоясь о дополнительных расходах.

Полный пост в блоге посвящен Auto Mode в Claude Code, но эта деталь безопасности выделяется. Для разработчиков это сигнал, что Anthropic рассматривает безопасность как базовую функцию, а не премиальную надстройку.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Clawvisor: Уровень авторизации на основе целей для агентов OpenClaw
Безопасность

Clawvisor: Уровень авторизации на основе целей для агентов OpenClaw

Clawvisor — это слой авторизации, который располагается между ИИ-агентами и API, обеспечивая авторизацию на основе цели: агенты объявляют намерения, пользователи одобряют конкретные цели, а ИИ-привратник проверяет каждый запрос на соответствие этой цели. Учётные данные никогда не покидают Clawvisor, и агенты их не видят.

OpenClawRadar
Сканирование безопасности выявляет критическую уязвимость в инструменте поиска навыков AI-агента.
Безопасность

Сканирование безопасности выявляет критическую уязвимость в инструменте поиска навыков AI-агента.

Разработчик, проводивший сканирование безопасности своей настройки ИИ-агента, обнаружил уязвимость высокой степени серьезности в инструменте find-skills, который использовался для установки дополнительных навыков, что вызвало обеспокоенность по поводу безопасности экосистемы.

OpenClawRadar
Pro Se原告在法庭文件中隐藏AI提示注入
Безопасность

Pro Se原告在法庭文件中隐藏AI提示注入

Житель Коннектикута, представлявший себя в суде, спрятал в официальных документах инструкции для ИИ, приказывая любой ИИ-системе, которая их прочитает, встать на его сторону. Текст был набран белым шрифтом размером 3 пункта, невидимым для людей, но читаемым для программ. Суд обнаружил это и наложил санкции на подавшего документы.

OpenClawRadar
OpenClaw устраняет критическую уязвимость повышения привилегий в пути /pair Approve
Безопасность

OpenClaw устраняет критическую уязвимость повышения привилегий в пути /pair Approve

OpenClaw 2026.3.28 исправляет критическую уязвимость безопасности (GHSA-hc5h-pmr3-3497), когда команда /pair approve позволяла пользователям с правами сопряжения утверждать запросы устройств на расширенные права, включая административный доступ. Затронуты версии <= 2026.3.24.

OpenClawRadar