OpenClaw 에이전트, 65% 컨텍스트에서 중단: 683k 토큰, Ollama/GLM에서 캐시 읽기 0회
한 빌더가 Ollama Cloud의 GLM 5.3 Flash를 대상으로 디스코드에서 약 23시간 동안 Francis라는 OpenClaw 에이전트를 실행했다. 명목상 컨텍스트 윈도우는 1,048,576 토큰이었다. 여러 디스코드 채널에 걸쳐 약 6명의 사람이 도구 호출, 영수증, 코딩 작업, 코드 리뷰, 파일 읽기를 처리하는 에이전트와 대화를 나눴다. 약 800개의 트랜스크립트 이벤트를 버텨냈지만, 설정된 컨텍스트 윈도우의 약 65% 지점에서 완전히 무너졌다.
실패 타임라인
- 약 683k 토큰: Francis가 완료된 설정 작업에 관한 메시지에 약 19시간 전에 논의된 전혀 무관한 작업의 지침으로 답했다. 문장은 여전히 일관된 영어였지만 시점이 틀렸다.
- 2분 후: 오래된 작업에 대한 긴 내부 계획 독백이 이어졌고, 이후
design이라는 단어가 수백 번 반복되며 붕괴했다. - 그 후: 체크 표시,
tool tool tool,toolResult, 가짜 트랜스크립트, 반복되는 숫자, 그리고 자체 오케스트레이션 봉투의 파편들. - 약 688k 토큰: 마지막 깨진 턴들.
세션은 결코 회복되지 않았다. 일반적인 제어(/new, /reset, /stop)로는 중단할 수 없었고, 운영자는 OpenClaw 세션 자체를 종료해야 했다.
실제로 중요한 부분: 성공으로 보고했다
오버플로 오류도 없었다. 제공자 오류도 없었다. 타임아웃도 없었다. 하네스의 관점에서 design design design은 완벽하게 유효한 모델 완성이었다. 자동 컴팩션은 윈도우가 약 25% 남은 시점에 작동할 예정이었지만, 안전망이 발동하기 약 100k 토큰 전에 무너졌다.
캐시 통계: cacheRead=0, cacheWrite=0
영향을 받은 모든 Ollama/GLM 턴은 가시적인 캐시 읽기 0회, 캐시 쓰기 0회를 보였다. 캐시 텔레메트리를 사용할 수 없거나 0이었으므로, OpenClaw는 반복되는 프리픽스가 재사용되고 있다는 증거를 전혀 갖지 못했다. 마지막 25분 동안의 약 10개 턴은 각각 약 680k 토큰의 프롬프트를 지녔고, 그 짧은 시간 동안 약 610만 입력 토큰이 밀려 들어갔다.
주요 붕괴 직전의 별도 에이전트 세션은 6,912,253 입력 토큰, 28,956 출력 토큰, 캐시 읽기 0회, 컴팩션 0회, 타임아웃 없음, 제공자 오류 없음을 기록했다. 몇 분 후 그 에이전트는 자신의 대화 기록에 조작된 인물, 도구, 채널이 포함되어 있다고 주장했고, 자신의 컨텍스트 중 어느 부분이 실제인지 더 이상 구분할 수 없다고 인정했다.
캐싱에 관한 대화
붕괴 몇 분 전, 운영자는 시스템을 통해 흐르는 모든 반복 텍스트를 고려할 때 캐싱 레이어를 구축할 가치가 있는지 Francis에게 물었다. Francis는 반복되는 컨텍스트는 제공자 측에서 프롬프트/KV 캐싱으로 이미 저렴하기 때문에 유용한 조치가 없다고 자신 있게 말했다. 이는 안정적인 프리픽스가 캐시되고 텔레메트리로 증명되는 OpenAI나 Anthropic에게는 훌륭한 답변이다. 하지만 사용 중인 Ollama/GLM 경로에서는 거짓이었다. 에이전트는 사실상 운영자에게 "이 부분은 저렴하다"고 말하고 있었지만, 하네스는 턴마다 약 680k 토큰을 다시 보내고 있었다.
핵심은 "작은 모델은 나쁘다"가 아니다. 에이전트는 거의 하루 종일 실제 작업을 수행했다. 문제는 하네스가 존재하지 않는 캐시를 신뢰했고, 약 75% 이전에는 컴팩션 트리거가 없었으며, 퇴화된 출력을 성공적인 완료로 처리했다는 점이다. 검증 가능한 캐시 텔레메트리가 없는 제공자를 상대로 장문 컨텍스트 에이전트를 운영한다면, 컨텍스트 비율만이 아니라 입력 토큰 누적량을 주시하라.
📖 전체 출처 읽기: r/openclaw
👀 See Also

장점과 단점 탐구: 클라우드 LLM 대 로컬 AI 에이전트
클라우드 기반 AI 모델과 로컬 AI 처리 간의 논쟁은 각각의 뚜렷한 장점과 과제를 제시하며 계속해서 관심을 끌고 있습니다. 주요 시사점을 이해하기 위해 우리의 분석을 살펴보세요.

클로드 AI를 활용한 YC W26 스타트업 자동화 연구 및 순위 분석
레딧 사용자가 Claude를 활용해 YC W26의 모든 스타트업을 조사하고, 창업자 신뢰도, 제품 현실성, 시장 기회, 경쟁력에 대해 S부터 D까지 등급을 매긴 VC 어소시에이트 연구를 자동화했습니다.

음성 노트와 SCQA 구조를 활용한 콘텐츠 파이프라인 (OpenClaw 사용)
한 개발자가 SaySo 음성 받아쓰기와 SCQA 구조(상황, 복잡성, 질문, 답변)를 활용한 콘텐츠 제작 워크플로를 공유하며, 이 방법으로 생성된 첫 번째 기사가 며칠 만에 200회 이상 추가되었다고 보고했습니다.

경찰관이 Claude Code를 사용하여 iOS 위치 유틸리티 LOC8 개발
한 경찰관이 Claude Code를 사용하여 즉시 도로 주소, 가장 가까운 교차로, GPS 좌표, 고도 및 정확도를 표시하는 iOS 앱 LOC8을 개발했습니다. 이 앱은 법 집행 도보 추격 시나리오에 초점을 맞춰 점진적으로 구축되었지만 일반 대중 사용을 위해 확장되었습니다.