Многоуровневая защита снижает инъекции промптов до нуля в Claude Code

✍️ OpenClawRadar📅 Опубликовано: 8 августа 2026 г.🔗 Source
Многоуровневая защита снижает инъекции промптов до нуля в Claude Code
Ad

Anthropic заявляет, что многоуровневая защита может свести атаки с помощью промпт-инъекций к нулю, даже против неизвестных атак. Борис Черни в обсуждении нового Auto Mode в Claude Code описал многоуровневый подход: обучение модели, классификатор намерений и входные зонды. Он также подтвердил, что классификатор теперь бесплатен, отвечая на опасения по поводу стоимости токенов: «Мы делаем классификатор бесплатным. Вы не должны платить за безопасность».

Как слои складываются

  • Обучение модели: Базовая модель дообучена распознавать и отклонять паттерны инъекций.
  • Классификатор намерений: Отдельный классификатор проверяет намерение пользователя за каждым запросом, отфильтровывая вредоносные запросы до выполнения.
  • Входные зонды: Активные зонды тестируют входные данные на известные векторы инъекций, добавляя еще один барьер.

По словам источника, эта комбинация снижает частоту промпт-инъекций до 0% на неизвестных атаках. Ключевой момент в том, что ни один слой не идеален, но в совокупности они перехватывают подавляющее большинство попыток.

Ad

Классификатор теперь бесплатен

Цитата Бориса Черни пряма: «Мы делаем классификатор бесплатным. Вы не должны платить за безопасность». Это решает распространенную проблему — стоимость токенов — для разработчиков, которые беспокоились, что добавление проверок безопасности истощит их бюджеты. Если вы раньше обходили функции безопасности, чтобы экономить токены, это больше не проблема.

Это особенно актуально для команд, создающих автономных агентов с Claude Code, где промпт-инъекции являются реальным риском: вредоносные промпты в веб-контенте или выходных данных инструментов могут захватить агента. С бесплатным классификатором вы можете включить его, не беспокоясь о дополнительных расходах.

Полный пост в блоге посвящен Auto Mode в Claude Code, но эта деталь безопасности выделяется. Для разработчиков это сигнал, что Anthropic рассматривает безопасность как базовую функцию, а не премиальную надстройку.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Claw Hub и Hugging Face атакованы 575 вредоносными пакетами навыков
Безопасность

Claw Hub и Hugging Face атакованы 575 вредоносными пакетами навыков

И Claw Hub, и Hugging Face были скомпрометированы: на платформах размещено 575 вредоносных пакетов навыков. Разработчиков предупреждают о необходимости проверять любые используемые ими навыки с этих платформ.

OpenClawRadar
Результаты проверки безопасности для ИИ-агентов OpenClaw, PicoClaw, ZeroClaw, IronClaw и Minion.
Безопасность

Результаты проверки безопасности для ИИ-агентов OpenClaw, PicoClaw, ZeroClaw, IronClaw и Minion.

В ходе оценки безопасности пяти ИИ-агентов для написания кода было протестировано 145 атакующих векторов в 12 категориях, включая инъекцию промптов, джейлбрейкинг и эксфильтрацию данных. OpenClaw набрал 77,8/100 с критическими уязвимостями SQL-инъекций, в то время как Minion улучшил результат с 81,2 до 94,4/100 после исправлений.

OpenClawRadar
🦀
Безопасность

Как работает водяные знаки ИИ в тексте: секретные ключи, выбор «зеленых»/«красных» слов и обнаружение

Текстовое водяной знак скрывает метки в выборе слов, а не в символах. Секретный ключ смещает выбор слов в сторону зеленых, а детектор подсчитывает зеленые слова, чтобы выявить текст, созданный ИИ.

OpenClawRadar
Анализатор навыков теперь доступен на ClawHub с установкой одной командой.
Безопасность

Анализатор навыков теперь доступен на ClawHub с установкой одной командой.

Сканер безопасности OpenClaw Skill Analyzer теперь доступен на ClawHub с установкой одной командой. Инструмент проверяет папки навыков на наличие вредоносных паттернов, таких как инъекция промптов и кража учетных данных, и включает поддержку Docker-песочницы для безопасного выполнения.

OpenClawRadar