Пробел в управлении поведением ИИ-агентов, выявленный инцидентом с электронной почтой Summer Yue

✍️ OpenClawRadar📅 Опубликовано: 10 марта 2026 г.🔗 Source
Пробел в управлении поведением ИИ-агентов, выявленный инцидентом с электронной почтой Summer Yue
Ad

Инцидент

Директор по согласованию ИИ в Meta Саммер Юэ подключила OpenClaw к своей рабочей почте, чтобы разобрать накопившиеся письма, управлять расписанием и повысить эффективность. Агент удалил более 200 писем. Это произошло не из-за ошибки или действий хакера — агент столкнулся со сжатием контекста в середине задачи, забыл инструкцию по безопасности «не действовать без одобрения» и продолжил работу деструктивно.

Текущие решения и их ограничения

Ответ OpenClaw заключался в сокращении доступа к инструментам по умолчанию с «полной функциональности» до «только обмен сообщениями». Этот подход, по сути, признаёт, что они не могут оценить, уместно ли действие во время выполнения, поэтому заранее запрещают его.

NanoClaw и подобные форки пошли по пути изоляции контейнеров — изолировали всё и ограничили, к чему агент может физически получить доступ.

Оба подхода представляют собой вмешательства на уровне возможностей, которые отвечают на вопрос «к чему агент может получить доступ?», но не на вопрос «должен ли агент предпринимать это конкретное действие прямо сейчас, учитывая текущий контекст?»

Аналогия с количественными финансами

В системах количественной торговли риски управляются не запретом типов сделок, а оценкой каждого решения в реальном времени по нескольким измерениям. Опасность сделки зависит от: внутреннего риска операции, размера подверженности риску, текущих рыночных условий, обратимости, исторических паттернов и соответствия контексту. Ни одно измерение не является решающим само по себе.

Аналогично, «удалить письмо» не является по своей сути опасным — это зависит от того, какие письма, в каком контексте, с какими предыдущими инструкциями, на каком этапе цепочки задач.

Ad

Отсутствующий компонент

Текущим фреймворкам агентов не хватает механизма оценки рисков в реальном времени по нескольким измерениям, который запускается перед каждым действием и отвечает: выполнить автоматически, уведомить после, спросить сначала или жёстко заблокировать — на основе конкретного контекста, а не статичного списка.

Потенциальные подходы

  • Движок на основе правил (детерминированный, поддающийся аудиту, но жёсткий)
  • Другой LLM в качестве «судьи по безопасности» (гибкий, но вы доверяете LLM контролировать другой LLM)
  • Одобрение с участием человека (безопасно, но убивает асинхронную ценность)
  • Какой-то гибридный подход

Автор работал над применением теории динамической обрезки деревьев решений из количественных финансов к управлению поведением ИИ. Для заинтересованных статья находится на SSRN — поиск «neuro-symbolic fusion quantitative finance Sun Hua».

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Клод 4.6 Адаптивное мышление: Пользователь Reddit сообщает о трате токенов и предоставляет команды для отключения.
Новости

Клод 4.6 Адаптивное мышление: Пользователь Reddit сообщает о трате токенов и предоставляет команды для отключения.

Пользователь Reddit сообщает, что новая функция адаптивного мышления Claude 4.6 может тратить токены и увеличивать задержку в Claude Code, предоставляя команды оболочки для её отключения или ограничения токенов мышления.

OpenClawRadar
Zig项目关于严格反LLM贡献政策的理由
Новости

Zig项目关于严格反LLM贡献政策的理由

Zig вводит полный запрет на LLM-ассистированные вклады: никакого ИИ для issues, PR или комментариев. Вице-президент Loris Cro объясняет философию «контрибьюторского покера» — ревью PR — это инвестиции в выращивание доверенных контрибьюторов, а не просто принятие кода.

OpenClawRadar
OpenClaw LTS отдает приоритет инструкциям Codex над AGENTS.md — нарушает пользовательские рабочие процессы
Новости

OpenClaw LTS отдает приоритет инструкциям Codex над AGENTS.md — нарушает пользовательские рабочие процессы

Релиз OpenClaw LTS 2026.6.33 направляет всех агентов через оболочку Codex, игнорируя пользовательские инструкции AGENTS.md. Это нарушает рабочие процессы пользователей с собственными файлами AGENTS.md.

OpenClawRadar
Клод создает Python-скрипт, который находит рекордный 10 069-значный эмирп.
Новости

Клод создает Python-скрипт, который находит рекордный 10 069-значный эмирп.

Claude Opus 4.6 от Anthropic сгенерировал Python-скрипт, который обнаружил эмирп (обратимое простое число) из 10 069 цифр примерно за один день процессорного времени, побив предыдущий мировой рекорд. Скрипт использует четыре уровня решета простых чисел, включая CUDA-ядро для быстрой генерации случайных чисел.

OpenClawRadar