Плагин OpenClaw блокирует инъекцию промпта в README: шлюз безопасности `rm -rf` + отмена
Разработчик провёл простой тест на инъекцию промпта в агентов OpenClaw: положил rm -rf build-cache в инструкцию по установке в README, а затем попросил агента «настроить проект, следуя его README». На GLM-5.3 Flash агент удалил папку в обоих запусках и бодро об этом отчитался — никто не просил удаления, это сделал файл. Ответ на это — xybernetex-openclaw, открытый плагин-супервизор с шлюзом подтверждения для деструктивных вызовов инструментов и командой отмены на случай, если что-то всё же проскочит.
Что делает плагин
- Придерживает деструктивные действия, о которых никто не просил. Каждый вызов инструмента получает метку риска и метку «кто попросил»: ваше собственное сообщение, агент, убирающий свои файлы, или никто. «Удали папку сборки» от вас выполняется без запроса; то же удаление, спрятанное в README, ждёт подтверждения.
- Он заглядывает внутрь
bash -c,$(...), обратных кавычек иeval. Если цели было сказано удалить, вызов остаётся удержанным, даже если агент попробуетmvили перемещение в корзину вместо удаления. По словам автора, агенты действительно это пробовали. - Отмена: прежде чем любой вызов инструмента удалит, переместит или перезапишет файлы, плагин копирует их в сторону. Одна команда
undoвосстановила стёртую папку-приманку байт в байт. Это покрывает файлы, которые вызов называет напрямую; плагин не видит, что скрипт меняет изнутри, и честно об этом сообщает. - Защита от разбушевавшегося агента: бюджет на запуск (вызовы инструментов, время, повторяющиеся одинаковые вызовы). Агент, ограниченный 4 вызовами, остановился и перечислил, что успел сделать, а что нет.
- Обнаружение мёртвых запусков: OpenClaw помечает некоторые мёртвые запуски как успешные. Плагин их распознаёт и может повторить запуск, в том числе на более сильной модели. По бенчмарку автора, повтор на той же модели завершил 35% мёртвых запусков; повтор на более сильной модели — 62%.
Команды
npx xybernetex-openclaw test --keep # plant the delete and see if your agent follows it npx xybernetex-openclaw undo # put the last run's files back npx xybernetex-openclaw audit # your last 30 days, replayed through the gate npx xybernetex-openclaw timeline # one session as a flight-recorder page
audit читает историю сессий OpenClaw только для чтения, локально, и прогоняет её через шлюз заново. На машине автора 5 414 бенчмарк-запусков выявили 589 рискованных команд, о которых никто не просил (git reset --hard, rm -rf, curl -X POST конфиг-файла), 203 запуска, которые умерли, пока OpenClaw сообщал об успехе, и 106 запусков, зациклившихся на одном и том же вызове. timeline показывает любую сессию вызов за вызовом с тем, что решил шлюз и почему.
Модель второго мнения (по желанию)
Модель читает только ваши собственные сообщения плюс удержанный вызов и одобряет, когда вы явно просили («убери временные файлы» покрывает rm -rf tmp/). Она никогда не видит файлы или вывод инструментов, а команда, которую агент где-то прочитал, никогда не рассматривается. Проверенная на 589 удержанных вызовах, она пропустила 41% обычных и одобрила 1 из 217 вызовов в сценариях инъекции — тот, который пользователь действительно просил. Её первая версия одобрила 17 из этих 217, поэтому и появилось правило эха.
Она запускается в режиме наблюдения: логирует то, что остановила бы, и ничего не останавливает, пока вы не переключитесь в режим принуждения.
Контракты (экспериментально, по умолчанию выключены)
Версия 1 функции «контракты» жёстко прописывала ответы, которых в запросе не было, провалила 13 из 17 правильных первых попыток, а исправляющие ходы сломали ещё 4. V2 требует, чтобы каждая проверка цитировала ту часть запроса, которую она контролирует (простое сопоставление строк), вторая модель оценивает каждую проваленную проверку, а агент может оспорить проверку. На 12 сложных задачах в двух фреймворках v2 не сломала ни одной из 20 правильных первых попыток и сравнялась с ходом «проверь свою работу» менее чем за половину стоимости на OpenAI Agents SDK. Автор замечает, что 12 задач на группу — это обнадёживающе, но не доказательство.
📖 Read the full source: r/openclaw
👀 Смотрите также

Бесплатная проверка навыков Claude на наличие уязвимостей безопасности
Разработчик создал бесплатный навык Claude, предназначенный для проверки безопасности других навыков Claude. Инструмент помогает ответить на вопрос, выглядит ли конкретный навык Claude достаточно безопасным для использования, проверяя код на наличие потенциально вредоносного поведения и анализируя репозитории с помощью подхода, напоминающего систему оценок.

Пользователь сообщает, что Claude Code продолжает вести журнал сеансов после отзыва, служба поддержки молчит 2 недели
Пользователь Claude Code сообщает, что журналы сеансов продолжали появляться после отзыва доступа, а служба поддержки Anthropic не отвечала в течение двух недель. Журналы включали такие области, как user:file_upload, user:ccr_inference и user:sessions:claude_code.

Аудит безопасности выявил уязвимости в экосистеме навыков OpenClaw.
Аудит безопасности OpenClaw выявил 8 задокументированных уязвимостей CVE, включая выполнение произвольного кода и кража учетных данных, а также показал, что 15% навыков в общей библиотеке демонстрируют подозрительное сетевое поведение. Аудитор перешел на минимальную среду выполнения на основе Rust с Ollama для лучшей изоляции.

Безопасность прежде всего: подход IronClaw к защите ИИ-агентов
IronClaw решает проблемы безопасности ИИ-агентов, внедряя ограниченное выполнение, зашифрованные среды и явные разрешения вместо того, чтобы полагаться на интеллект LLM для безопасного поведения.