OpenClaw Agent сломался на 65% контекста: 683k токенов, ноль чтений кэша на Ollama/GLM
Разработчик примерно 23 часа гонял агента OpenClaw по имени Francis в Discord на модели GLM 5.3 Flash через Ollama Cloud с номинальным окном контекста в 1 048 576 токенов. Около 6 человек в нескольких каналах Discord общались с ним, пока он выполнял вызовы инструментов, квитанции, задачи по коду, код-ревью и чтение файлов. Он держался примерно 800 событий транскрипта, а затем жёстко сломался примерно на 65% от настроенного окна контекста.
Хронология сбоя
- ~683k токенов: Francis ответил на сообщение о завершённой задаче по настройке инструкциями из совершенно другой задачи, обсуждавшейся примерно 19 часов ранее. Английский ещё связный, но момент не тот.
- Через 2 минуты: долгий внутренний монолог-планирование о устаревшей задаче, затем коллапс в сотни повторов слова
design. - После этого: галочки,
tool tool tool,toolResult, фальшивый транскрипт, повторяющиеся числа и фрагменты собственного оркестрационного конверта. - ~688k токенов: последние сломанные ходы.
Сессия так и не восстановилась. Обычные средства управления (/new, /reset, /stop) не смогли её прервать, и оператору пришлось убивать саму сессию OpenClaw.
Самое важное: он отчитался об успехе
Ни ошибки переполнения. Ни ошибки провайдера. Ни таймаута. С точки зрения harness, design design design было абсолютно валидным завершением модели. Автоматическая компакция ожидалась примерно в тот момент, когда остаётся около 25% окна — а сбой случился примерно за 100k токенов до того, как должна была сработать страховка.
Статистика кэша: cacheRead=0, cacheWrite=0
Каждый затронутый ход Ollama/GLM показывал ноль видимых чтений кэша и ноль записей в кэш. Телеметрия кэша была недоступна или нулевой, поэтому у OpenClaw не было доказательств, что повторяющийся префикс переиспользуется. Примерно десять ходов в последние 25 минут несли промпт примерно на 680k токенов — то есть около 6,1 млн входных токенов было прогнано за это короткое окно.
Другая сессия агента незадолго до основного коллапса зафиксировала 6 912 253 входных токена, 28 956 выходных токенов, ноль чтений кэша, ноль компакций, без таймаута, без ошибки провайдера. Через несколько минут этот агент заявил, что в истории его разговора есть выдуманные люди, инструменты и каналы, и признал, что больше не может отличить, какие части его контекста реальны.
Разговор о кэшировании
За несколько минут до коллапса оператор спросил Francis, стоит ли строить слой кэширования с учётом всего повторяющегося текста, проходящего через систему. Francis уверенно ответил, что полезного делать нечего, потому что повторяющийся контекст и так дёшев у провайдера благодаря кэшированию промпта/KV. Для OpenAI или Anthropic это хороший ответ — там стабильные префиксы кэшируются, и телеметрия это подтверждает. Но для используемого маршрута Ollama/GLM это было ложью — агент фактически говорил оператору «этот кусок дёшев», пока harness заново отправлял ~680k токенов на каждый ход.
Вывод не в том, что «маленькая модель — плохо»: агент почти целый день делал реальную работу. Проблема в том, что harness доверял кэшу, которого не было, не имел триггера компакции раньше ~75% и считал деградировавший вывод успешным завершением. Если вы запускаете агентов с длинным контекстом у провайдеров без проверяемой телеметрии кэша, следите за накоплением входных токенов, а не только за процентом контекста.
📖 Читать полный источник: r/openclaw
👀 Смотрите также

Запуск 20 терминальных окон Claude Code одновременно с признаками СДВГ
Разработчик с чертами СДВГ (дислексия, недиагностированный) одновременно запускает 20 терминальных окон Claude Code для разных проектов, используя ИИ-агентов для удержания контекста, который его мозг не может поддерживать. Статья рассматривает как преимущества для продуктивности, так и потенциальные недостатки такого рабочего процесса.

Ассистент OpenClaw создает докеризированного терминального помощника с пользовательской маршрутизацией
Пользователь OpenClaw сообщает, что его основной помощник помог запустить второго помощника внутри Docker с его собственной рабочей областью, памятью и поведением, ориентированным на терминал. Сообщения, начинающиеся с 'meow:', направляются контейнеризированному терминальному помощнику вместо основного интерфейса чата.

Как Нил Каккар использует Claude Code для автоматизации рабочего процесса разработки
Нил Каккар описывает автоматизацию создания pull request с помощью навыка /git-pr, переход на SWC для перезапуска сервера менее чем за секунду и использование функции предпросмотра Claude Code для автоматической проверки изменений в интерфейсе.

Агент ИИ застройщика совершает первый телефонный звонок с контекстом и стилем голоса
Разработчик, управляющий многоагентной системой для недвижимости, сообщает, что его ИИ-агент совершил первый успешный телефонный звонок, используя полный контекст о сделках и потенциальных клиентах, имитируя конкретный подход к продажам и стиль речи разработчика.