Уязвимости функции «Разрешать всегда» в OpenClaw и более безопасные альтернативы

Уязвимости системы одобрения OpenClaw
Система одобрения OpenClaw спрашивает пользователей "можно мне это сделать?" перед выполнением команд, предлагая варианты: одобрить один раз или одобрить всегда. Функция "разрешить всегда" была идентифицирована как угроза безопасности благодаря двум недавним уязвимостям (CVE).
Конкретные проблемы безопасности
CVE-2026-29607: Одобрение "разрешить всегда" привязывается к команде-обёртке, а не к внутренней команде. Если вы одобрите time npm test с опцией "всегда", система запомнит "всегда разрешать time". Позже, если агент (или через инъекцию в запрос) выполнит time rm -rf /, команда выполнится без повторного запроса, потому что вы одобрили команду-обёртку.
CVE-2026-28460: Эта уязвимость полностью обходит список разрешённых команд, используя символы продолжения строки в оболочке. Другая техника, но тот же результат: команды выполняются без проверки одобрения, которую вы считали своей защитой.
Обе уязвимости исправлены в OpenClaw 3.12+, но более глубокая проблема остаётся.
Поведенческая проблема безопасности
Даже после исправления, ментальная модель "разрешить всегда" приучает пользователей переставать обращать внимание. Изначально пользователи внимательно читают каждый запрос на одобрение. К 3-й неделе они нажимают "всегда" на всё подряд, потому что запросы становятся раздражающими, а доверие к агенту растёт. К 6-й неделе пользователи накапливают 20+ правил "всегда", которые они не смогли бы перечислить, если бы их спросили.
Рекомендуемый альтернативный подход
Автор источника рекомендует: не использовать "разрешить всегда" для чего-либо, что изменяет файлы, отправляет сообщения или выполняет команды оболочки. Вместо этого добавьте явные ограничения в ваш файл SOUL.md:
"для любого действия, которое изменяет файлы, отправляет сообщения или выполняет команды оболочки: покажите мне точно, что вы планируете сделать, и ждите моего явного подтверждения. предыдущие одобрения не переносятся. спрашивайте каждый раз. это не обсуждается."
Такой подход означает больше нажатий "ок" в интерфейсах, таких как Telegram, но предотвращает возможность обмана агента через инъекцию в запрос или его собственные галлюцинации для выполнения разрушительных действий под устаревшими одобрениями.
Ключевой вывод
Система одобрения — это функция для удобства, которая никогда не проектировалась как граница безопасности. Относитесь к ней соответственно.
📖 Read the full source: r/openclaw
👀 Смотрите также

Концепции безопасности для Vibe-кодинга с Claude Code: Аутентификация, Авторизация и Принуждение
Старший инженер разбирает аутентификацию, авторизацию и контроль доступа для приложений, созданных с помощью ИИ, используя метафору отеля — плюс как попросить AI-агентов проверить безопасность.

SCION: Швейцарская безопасная альтернатива протоколу маршрутизации BGP
SCION (Scalability, Control, and Isolation On Next-Generation Networks) — это архитектура маршрутизации интернета, разработанная в ETH Zürich, которая заменяет основу BGP встроенной безопасностью и многопутевой маршрутизацией. В отличие от заплаток BGP, таких как RPKI и BGPsec, SCION устанавливает десятки или сотни параллельных путей с перемаршрутизацией за миллисекунды при возникновении сбоев.

Сканирование безопасности пакетов MCP выявляет широко распространенные деструктивные возможности без подтверждения
Сканирование безопасности 2,386 пакетов MCP в npm показало, что 63,5% из них предоставляют деструктивные операции, такие как удаление файлов и сброс баз данных, без запроса подтверждения у человека. Исследователь обнаружил, что в целом 49% пакетов имеют проблемы с безопасностью, включая 402 критических и 240 уязвимостей высокой степени серьезности.

Исследование Корнелла: 13 слов в Reddit могут манипулировать ИИ-поиском
Исследование Корнеллского университета показывает, что фрагмент из 13 слов на Reddit или Wikipedia может надежно отравлять AI-поисковые агенты. Половина всех AI-цитат поступает с сайтов с пользовательским контентом, что позволяет брендам с легкостью внедрять рекламный контент.