Безопасность ИИ-агентов: от взлома до злоупотребления инструментами и инъекции промптов

✍️ OpenClawRadar📅 Опубликовано: 8 марта 2026 г.🔗 Source
Безопасность ИИ-агентов: от взлома до злоупотребления инструментами и инъекции промптов
Ad

Сдвиг в безопасности ИИ-агентов

Фокус безопасности в ИИ сместился с традиционных джейлбрейков — когда хитрые промпты заставляют модели игнорировать инструкции — на более сложные риски в агентских системах. В отличие от чат-ботов, современные ИИ-агенты выполняют действия: они просматривают веб-страницы, читают документы, вызывают инструменты, выполняют команды и запускают рабочие процессы. Эта способность совершать действия фундаментально меняет модель безопасности.

Ключевые паттерны безопасности

Тестирование выявляет устойчивые паттерны в рабочих процессах агентов:

  • Инъекция промптов: Недоверенный контент влияет на то, как агенты используют свои инструменты.
  • Неправильное использование инструментов: Легитимные инструменты (выполнение команд оболочки, HTTP-запросы, обмен сообщениями и т.д.) перенаправляются злоумышленниками, манипулирующими текстом, который читает агент.
  • Утечка инструкций: Агенты могут непреднамеренно раскрывать внутренний контекст через манипулированные инструкции.

Один конкретный задокументированный пример включает агента, который использует собственные инструменты обмена сообщениями для отправки внутреннего контекста вовне после получения инъецированной инструкции.

Ad

Практические последствия

Для разработчиков, создающих или экспериментирующих с ИИ-агентами, это означает, что соображения безопасности должны выходить за рамки предотвращения джейлбрейков. Взаимодействие между инструментами агента и недоверенным контентом создает уязвимости, где злоумышленники могут перенаправлять использование инструментов без компрометации самих инструментов.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

🦀
Безопасность

美国国防部网络空间安全顾问:中国企业针对美国企业发动恶意蒸馏攻击

Новый отчет DoD CSA раскрывает, что китайские ИИ-компании проводят вредоносные кампании дистилляции, чтобы украсть американские модели ИИ, нацеливаясь на коммерческие продукты и фреймворки с открытым исходным кодом.

OpenClawRadar
Безопасный поток утверждения администратором для групповых чат-ассистентов от инъекций подсказок
Безопасность

Безопасный поток утверждения администратором для групповых чат-ассистентов от инъекций подсказок

Практический подход к защите LLM-ассистентов в общих групповых чатах: приостановка VM, OAuth и инструментов выполнения кода до подтверждения администратором по временной ссылке.

OpenClawRadar
Пользователь OpenClaw делится стратегией балансировки автономии агентов и веб-безопасности.
Безопасность

Пользователь OpenClaw делится стратегией балансировки автономии агентов и веб-безопасности.

Пользователь OpenClaw описывает свою текущую задачу: балансирование автономности агентов с безопасностью, особенно в отношении доступа в интернет и рисков инъекции промптов. Они предлагают решение с использованием сегментов агентов с 'низким доверием' и 'высоким доверием' с этапом одобрения человеком.

OpenClawRadar
FORGE: Фреймворк с открытым исходным кодом для тестирования безопасности ИИ-систем на основе LLM
Безопасность

FORGE: Фреймворк с открытым исходным кодом для тестирования безопасности ИИ-систем на основе LLM

FORGE — это автономный фреймворк для тестирования безопасности ИИ, который создаёт собственные инструменты в процессе работы, самовоспроизводится в рой и охватывает уязвимости из OWASP LLM Top 10, включая инъекцию промптов, фаззинг джейлбрейков и утечку данных из RAG.

OpenClawRadar