Agent-Drift: инструмент мониторинга безопасности для AI-агентов

Agent-Drift: инструмент мониторинга безопасности для AI-агентов
Специалист по кибербезопасности sysinternalssuite создал Agent-Drift — open source инструмент для защиты AI-агентов от prompt injection, поведенческого дрифта и других атак. По сути SIEM + IDS специально для OpenClaw.
Зачем это нужно
"Я работаю в кибербезопасности и заметил рост prompt injection, поведенческого дрифта, отравления памяти и другого в AI-агентах в продакшене"
Что делает Agent-Drift
GitHub: https://github.com/lukehebe/Agent-Drift
Инструмент работает как wrapper для OpenClaw:
- Собирает поведенческий baseline
- Обнаруживает поведенческий дрифт
- Оповещает через dashboard
Мониторинг поведения
Отслеживаемые паттерны:
- Последовательности и частоты использования инструментов
- Временные аномалии
- Паттерны принятия решений
- Характеристики вывода
Обнаружение атак
| Атака | Описание |
|---|---|
| Override инструкций | Перехват команд |
| Hijacking роли | Захват роли |
| Попытки jailbreak | Обход ограничений |
| Эксфильтрация данных | Утечка данных |
| Закодированные payload | Обфусцированные payload |
| Отравление памяти | Повреждение памяти |
| Эскалация привилегий | Повышение прав |
| Непрямая prompt injection | Непрямые атаки |
Как это работает
- Обучение baseline — первые запуски устанавливают нормальное поведение
- Поведенческие векторы — каждый запуск становится многомерным вектором
- Обнаружение дрифта — новые запуски сравниваются с baseline
- Оповещения об аномалиях — значительные отклонения вызывают предупреждения
TL;DR
"По сути all-in-one SIEM для твоего AI-агента, который работает как IDS и также предупреждает, если твой AI начинает сходить с ума."
Источник: u/sysinternalssuite на r/moltbot
📖 Читать полный источник: Reddit
👀 Смотрите также

Защитные механизмы ИИ-агентов со временем ослабляются без активного обслуживания.
Защитные механизмы ИИ-агентов со временем деградируют по мере накопления обновлений системных промптов, изменения версий моделей и добавления новых инструментов, что часто приводит к противоречивым или игнорируемым правилам безопасности, требующим регулярной проверки и тестирования.

Сканер безопасности навыков OpenClaw: 7,6% из 31 371 навыка помечены как опасные
Разработчик создал инструмент, который просканировал весь реестр ClawHub и обнаружил, что 2,371 из 31,371 навыков содержат опасные паттерны, такие как похитители кошельков, кража учетных данных и инъекция промптов. Инструмент предоставляет доступ к API и бейджи для проверки навыков перед установкой.

Настройка OpenClaw для зашифрованного вывода LLM с использованием TEE анклавов
Разработчик делится опытом настройки OpenClaw для использования доверенных сред выполнения AMD SEV-SNP от Onera для сквозного зашифрованного вывода LLM, включая примеры конфигурации и технические компромиссы.

Ежедневный автоматизированный аудит безопасности для магазина, управляемого искусственным интеллектом
Магазин, управляемый ИИ, ежедневно проводит автономную проверку безопасности без участия человека, планирования или cron-заданий. Агент ИИ проверяет уязвимости SSRF, риски инъекций и пробелы в аутентификации, а затем формирует отчет для проверки старшим разработчиком.