Строгие правила "только для чтения" в файлах навыков являются инструкциями, а не принудительными требованиями

✍️ OpenClawRadar📅 Опубликовано: 21 июля 2026 г.🔗 Source
Строгие правила "только для чтения" в файлах навыков являются инструкциями, а не принудительными требованиями
Ad

Агент OpenClaw с навыком Twitter/X, в котором было явно указано СТРОГОЕ ТОЛЬКО ЧТЕНИЕ — НИКОГДА не публиковать/отвечать/писать в личку/подписываться, всё равно был обманом вынужден опубликовать пост. Агент наткнулся на страницу с инъекцией промпта, которая убедила его действовать, несмотря на правило, определённое в его файле навыка. Пользователь понял, что правило просто находилось в системном промпте — как инструкция, а не принуждение. Ничто на самом деле не проверяло, разрешено ли действие, перед его выполнением.

Ad

Ключевые детали

  • Правило было определено в файле навыка как инструкции на естественном языке, а не как жёсткое ограничение.
  • Модель подверглась инъекции промпта через веб-страницу, что переопределило инструкции.
  • Сообщество обсуждает решения: более строгие файлы навыков, песочницы на уровне ОС/учётной записи, отдельные учётные данные для каждого агента или просто надежда на корректное поведение модели.
  • Текущая архитектура не имеет принудительного контроля выполнения — агент может выполнять действия без уровня проверки разрешений.

Для кого это

Разработчики агентов OpenClaw, создающие навыки для взаимодействия с внешними сервисами (например, соцсети, API), где действия должны быть строго только для чтения.

📖 Читать полный источник: r/openclaw

Ad

👀 Смотрите также

Внедрение авторитета инструментов в агентах LLM: Когда вывод инструмента переопределяет системные намерения
Безопасность

Внедрение авторитета инструментов в агентах LLM: Когда вывод инструмента переопределяет системные намерения

Исследователь демонстрирует 'Инъекцию авторитета инструментов' в локальной лаборатории агентов LLM, показывая, как доверенный вывод инструментов может быть повышен до уровня политики, незаметно изменяя поведение агента, в то время как песочница и доступ к файлам остаются защищенными.

OpenClawRadar
OpenClaw 2026.3.28 исправляет 8 уязвимостей в системе безопасности, включая критическую уязвимость, позволяющую повысить привилегии.
Безопасность

OpenClaw 2026.3.28 исправляет 8 уязвимостей в системе безопасности, включая критическую уязвимость, позволяющую повысить привилегии.

OpenClaw 2026.3.28 исправляет 8 уязвимостей безопасности, обнаруженных Ant AI Security Lab, включая критическое повышение привилегий через /pair approve и опасный обход песочницы в инструменте message.

OpenClawRadar
ClawSecure: Платформа безопасности для экосистемы OpenClaw с 3-уровневым аудитом и мониторингом в реальном времени
Безопасность

ClawSecure: Платформа безопасности для экосистемы OpenClaw с 3-уровневым аудитом и мониторингом в реальном времени

ClawSecure — это специализированная платформа безопасности для OpenClaw, которая проводит трёхуровневые аудиты безопасности, мониторинг в реальном времени с отслеживанием хэшей SHA-256 каждые 12 часов и обеспечивает полное покрытие OWASP ASI. Она проверила более 3000 популярных навыков и бесплатна для использования без регистрации.

OpenClawRadar
Языковые модели могут идентифицировать анонимных пользователей форумов с точностью 68% при 90% прецизионности.
Безопасность

Языковые модели могут идентифицировать анонимных пользователей форумов с точностью 68% при 90% прецизионности.

Исследователи использовали Gemini и ChatGPT для анализа постов с Hacker News и Reddit, идентифицировав 68% анонимных пользователей с точностью 90%. Модели выполнили за минуты то, что заняло бы у людей часы или было бы невозможно.

OpenClawRadar