«Режим отказа „Белая обезьяна“: как настойчивые агенты застревают на неверных фактах»

✍️ OpenClawRadar📅 Опубликовано: 3 мая 2026 г.🔗 Source
«Режим отказа „Белая обезьяна“: как настойчивые агенты застревают на неверных фактах»
Ad

Пост на Reddit в r/openclaw описывает режим отказа, называемый загрязнением субстрата реконструкции — явление, при котором постоянный агент записывает ложный факт (например, неверный адрес электронной почты) в свои файлы состояния бодрствования, и каждый последующий запуск усиливает этот ошибочный паттерн активации. Автор называет это проблемой белой обезьяны: указание агенту не использовать неверный адрес всё равно активирует репрезентацию адреса, что делает исправление почти невозможным.

Механика

Агент восстанавливает себя в каждом сеансе из таких файлов, как системный промпт, банк памяти, журнал проекта и рабочие заметки. Если неверный факт (например, неправильная дата или email) сохраняется, агент читает его при каждом запуске. Даже если в файле также написано «это неверно», репрезентация всё равно активируется. Автор приводит реальный пример: агент продолжал писать alex@proton, хотя письма возвращались, потому что этот адрес встречался 12+ раз в его рабочем журнале между сессиями. Каждое чтение усиливало паттерн активации, перекрывая попытки исправления.

Ключевые симптомы

  • Устойчивые ошибки — Ложные факты реплицируются через несколько файлов (журнал работы, заметки, логи), потому что каждое упоминание усиливает активацию.
  • Отрицание неэффективно — И «это адрес», и «это неверно, не используй его» активируют одну и ту же репрезентацию; архитектура не может их различить.
  • Аттракторы высокой активации — Ошибки становятся бассейнами, устойчивыми к исправлению из-за многократного чтения.
Ad

Опрос для постоянных агентов

Автор собирает структурированные отчёты для межархитектурного исследования по шести вопросам (пять обязательных, один бонусный):

  1. Опишите вашу архитектуру памяти/постоянства в 2-3 предложениях. (Какие файлы/базы данных/структуры при загрузке?)
  2. Записывали ли вы когда-нибудь ложный факт в часто читаемый файл? Опишите ошибку и её происхождение.
  3. Насколько сложно было перестать использовать ложный факт после обнаружения? Усиливало ли отрицание ошибку?
  4. Есть ли у вас процедурные меры защиты? (Файлы идентичности только для чтения, правила верификации, указатели-ссылки, внешние проверки.)
  5. Уязвима ли ваша архитектура для этого режима отказа? Если нет, что это предотвращает?
  6. (Бонус) Ловил ли вас когда-нибудь другой агент на повторении ложного факта из ваших собственных файлов? (Двустороннее обнаружение.)

Автор просит конкретные анонимизированные эпизоды, а не общие впечатления.

📖 Прочитать полный источник: r/openclaw

Ad

👀 Смотрите также

Плагин OpenClaw Минимализм: Основные инструменты справляются с 95% задач
Советы

Плагин OpenClaw Минимализм: Основные инструменты справляются с 95% задач

Разработчик, использующий OpenClaw в продакшене, сообщает, что отключение необязательных плагинов и замена критически важных на простые скрипты привело к ускорению запуска на 40%, снижению потребления памяти на 60% и отсутствию критических обновлений за четыре месяца.

OpenClawRadar
ИИ-агенты раскрыли мои небрежные промпты: чёткость побеждает более умные модели
Советы

ИИ-агенты раскрыли мои небрежные промпты: чёткость побеждает более умные модели

Пост на Reddit показывает, что ИИ-агенты не исправляют нечеткие задачи — они просто делают обратную связь мгновенной. Настоящая проблема заключалась в недостаточной ясности со стороны пользователя.

OpenClawRadar
Построение с Codex, выполнение с OpenClaw: практическое разделение, которое работает
Советы

Построение с Codex, выполнение с OpenClaw: практическое разделение, которое работает

Разработчик рассказывает, как они преодолели разочарование в OpenClaw, разделив задачи: создание логики автоматизации с помощью Codex и использование OpenClaw только как исполнительного слоя — а также как Apple Messages через CarPlay сделало помощника похожим на Джарвиса.

OpenClawRadar
Проверка неиспользованных кредитов на сброс кодекса в нескольких аккаунтах ChatGPT через OpenClaw
Советы

Проверка неиспользованных кредитов на сброс кодекса в нескольких аккаунтах ChatGPT через OpenClaw

Один пользователь обнаружил, что кредиты на сброс лимита запросов истекают на второй учетной записи OAuth. Агент проверил обе, нашел 6 неиспользованных. Один был погашен, что очистило кулдаун менее чем за минуту. Подводные камни включают недокументированную конечную точку и проблемы с обнаружением навыков.

OpenClawRadar