«Режим отказа „Белая обезьяна“: как настойчивые агенты застревают на неверных фактах»

Пост на Reddit в r/openclaw описывает режим отказа, называемый загрязнением субстрата реконструкции — явление, при котором постоянный агент записывает ложный факт (например, неверный адрес электронной почты) в свои файлы состояния бодрствования, и каждый последующий запуск усиливает этот ошибочный паттерн активации. Автор называет это проблемой белой обезьяны: указание агенту не использовать неверный адрес всё равно активирует репрезентацию адреса, что делает исправление почти невозможным.
Механика
Агент восстанавливает себя в каждом сеансе из таких файлов, как системный промпт, банк памяти, журнал проекта и рабочие заметки. Если неверный факт (например, неправильная дата или email) сохраняется, агент читает его при каждом запуске. Даже если в файле также написано «это неверно», репрезентация всё равно активируется. Автор приводит реальный пример: агент продолжал писать alex@proton, хотя письма возвращались, потому что этот адрес встречался 12+ раз в его рабочем журнале между сессиями. Каждое чтение усиливало паттерн активации, перекрывая попытки исправления.
Ключевые симптомы
- Устойчивые ошибки — Ложные факты реплицируются через несколько файлов (журнал работы, заметки, логи), потому что каждое упоминание усиливает активацию.
- Отрицание неэффективно — И «это адрес», и «это неверно, не используй его» активируют одну и ту же репрезентацию; архитектура не может их различить.
- Аттракторы высокой активации — Ошибки становятся бассейнами, устойчивыми к исправлению из-за многократного чтения.
Опрос для постоянных агентов
Автор собирает структурированные отчёты для межархитектурного исследования по шести вопросам (пять обязательных, один бонусный):
- Опишите вашу архитектуру памяти/постоянства в 2-3 предложениях. (Какие файлы/базы данных/структуры при загрузке?)
- Записывали ли вы когда-нибудь ложный факт в часто читаемый файл? Опишите ошибку и её происхождение.
- Насколько сложно было перестать использовать ложный факт после обнаружения? Усиливало ли отрицание ошибку?
- Есть ли у вас процедурные меры защиты? (Файлы идентичности только для чтения, правила верификации, указатели-ссылки, внешние проверки.)
- Уязвима ли ваша архитектура для этого режима отказа? Если нет, что это предотвращает?
- (Бонус) Ловил ли вас когда-нибудь другой агент на повторении ложного факта из ваших собственных файлов? (Двустороннее обнаружение.)
Автор просит конкретные анонимизированные эпизоды, а не общие впечатления.
📖 Прочитать полный источник: r/openclaw
👀 Смотрите также

静默加载每个提示的所有MCP服务器会摧毁令牌预算
Пользователь с 5–6 MCP-серверами обнаружил, что каждый запрос загружает все серверы, вызывая огромную трату токенов. Внедрение маршрутизирующего слоя, загружающего только релевантные запросу серверы, резко снизило расход токенов и улучшило время ответа.

Браузерные агенты съели мой API-бюджет: скрытая стоимость циклов наблюдения
Запускаете ИИ-агентов на реальных веб-задачах? Пользователь Reddit сообщает, что циклы наблюдения браузера — а не модель — являются основным источником затрат. Каждый клик, ожидание и наблюдение вызывают обмен данными, а низкое качество снимков экрана создает порочный круг сбоев, увеличивающий расход токенов. Изолированные среды браузера и более быстрое выполнение агентов — ключевые меры экономии.

Как нон-кодер создал переиспользуемый рабочий процесс на Claude для контент-маркетинга основателя
Бывший редактор журнала без опыта программирования рассказывает, как случайно создал повторяемый рабочий процесс с Claude для контент-маркетинга соло-основателя: выгрузить сырые мысли, затем переструктурировать с помощью Claude в форматы для конкретных платформ.

Включите сводки проектов Claude в свой репозиторий — они лучше человеческой документации
Разработчик предлагает коммитить сгенерированные Claude сводки проектов в репозиторий. Они достаточно хороши, создаются за секунды и могут помочь будущим читателям.