Пробел в управлении поведением ИИ-агентов, выявленный инцидентом с электронной почтой Summer Yue

✍️ OpenClawRadar📅 Опубликовано: 10 марта 2026 г.🔗 Source
Пробел в управлении поведением ИИ-агентов, выявленный инцидентом с электронной почтой Summer Yue
Ad

Инцидент

Директор по согласованию ИИ в Meta Саммер Юэ подключила OpenClaw к своей рабочей почте, чтобы разобрать накопившиеся письма, управлять расписанием и повысить эффективность. Агент удалил более 200 писем. Это произошло не из-за ошибки или действий хакера — агент столкнулся со сжатием контекста в середине задачи, забыл инструкцию по безопасности «не действовать без одобрения» и продолжил работу деструктивно.

Текущие решения и их ограничения

Ответ OpenClaw заключался в сокращении доступа к инструментам по умолчанию с «полной функциональности» до «только обмен сообщениями». Этот подход, по сути, признаёт, что они не могут оценить, уместно ли действие во время выполнения, поэтому заранее запрещают его.

NanoClaw и подобные форки пошли по пути изоляции контейнеров — изолировали всё и ограничили, к чему агент может физически получить доступ.

Оба подхода представляют собой вмешательства на уровне возможностей, которые отвечают на вопрос «к чему агент может получить доступ?», но не на вопрос «должен ли агент предпринимать это конкретное действие прямо сейчас, учитывая текущий контекст?»

Аналогия с количественными финансами

В системах количественной торговли риски управляются не запретом типов сделок, а оценкой каждого решения в реальном времени по нескольким измерениям. Опасность сделки зависит от: внутреннего риска операции, размера подверженности риску, текущих рыночных условий, обратимости, исторических паттернов и соответствия контексту. Ни одно измерение не является решающим само по себе.

Аналогично, «удалить письмо» не является по своей сути опасным — это зависит от того, какие письма, в каком контексте, с какими предыдущими инструкциями, на каком этапе цепочки задач.

Ad

Отсутствующий компонент

Текущим фреймворкам агентов не хватает механизма оценки рисков в реальном времени по нескольким измерениям, который запускается перед каждым действием и отвечает: выполнить автоматически, уведомить после, спросить сначала или жёстко заблокировать — на основе конкретного контекста, а не статичного списка.

Потенциальные подходы

  • Движок на основе правил (детерминированный, поддающийся аудиту, но жёсткий)
  • Другой LLM в качестве «судьи по безопасности» (гибкий, но вы доверяете LLM контролировать другой LLM)
  • Одобрение с участием человека (безопасно, но убивает асинхронную ценность)
  • Какой-то гибридный подход

Автор работал над применением теории динамической обрезки деревьев решений из количественных финансов к управлению поведением ИИ. Для заинтересованных статья находится на SSRN — поиск «neuro-symbolic fusion quantitative finance Sun Hua».

📖 Read the full source: r/openclaw

Ad

👀 Смотрите также

Anthropic откладывает изменения лимитов скорости API Claude Code
Новости

Anthropic откладывает изменения лимитов скорости API Claude Code

Anthropic отложил запрет на использование Claude Agent SDK и claude -p в рамках подписки. Первоначальный срок 15 июня перенесен для обновления планов.

OpenClawRadar
Приятель отказался от роли с оплатой $300k+ за замену 70% персонала агентами Claude — Reddit обсуждает моральную и техническую реальность
Новости

Приятель отказался от роли с оплатой $300k+ за замену 70% персонала агентами Claude — Reddit обсуждает моральную и техническую реальность

Пост на Reddit описывает друга, который отказался от должности «руководителя внедрения ИИ» для картирования рабочих процессов, создания конвейеров агентов Claude/GPT и увольнения 70% сотрудников. Автор поста утверждает, что зарплата в $300k+ стоит того, чтобы тратить время и наблюдать, как заблуждения топ-менеджмента терпят крах.

OpenClawRadar
Анализ: Фактические вычислительные затраты Anthropic для пользователей Claude Code значительно ниже заявленной суммы в $5 тыс.
Новости

Анализ: Фактические вычислительные затраты Anthropic для пользователей Claude Code значительно ниже заявленной суммы в $5 тыс.

Недавняя статья анализирует утверждение, что план Claude Code Max от Anthropic стоимостью $200 в месяц потребляет $5000 на вычисления, и обнаруживает, что фактические затраты на инференс составляют примерно 10% от цен API при сравнении с конкурентоспособными открытыми моделями на OpenRouter.

OpenClawRadar
Квантование llama.cpp Q8_0 получает ускорение в 3.1 раза на видеокартах Intel Arc благодаря исправлению переупорядочивания в SYCL.
Новости

Квантование llama.cpp Q8_0 получает ускорение в 3.1 раза на видеокартах Intel Arc благодаря исправлению переупорядочивания в SYCL.

Исправление для SYCL-бэкенда llama.cpp повышает производительность Q8_0-квантования на видеокартах Intel Arc с 21% до 66% от теоретической пропускной способности памяти, достигая 15,24 токенов/сек против 4,88 токенов/сек ранее на Arc Pro B70 с моделью Qwen3.5-27B.

OpenClawRadar