장기 세션에서 OpenClaw 느려짐 수정: llama.cpp 캐시에 대한 contextInjection continuation-skip

✍️ OpenClawRadar📅 게시일: June 30, 2026🔗 Source
장기 세션에서 OpenClaw 느려짐 수정: llama.cpp 캐시에 대한 contextInjection continuation-skip
Ad

자체 호스팅 OpenClaw와 llama.cpp를 사용할 때 세션이 90k 토큰을 넘어가면서 점점 느려진다면, 원인은 매 턴마다 프롬프트 캐시를 조용히 무효화하는 단일 OpenClaw 설정일 수 있습니다. r/openclaw의 한 사용자가 문제를 추적하고 간단한 해결책을 찾았습니다.

환경 설정

  • 듀얼 RTX 3090에서 Qwen3.6-27B-Q8_0 (텐서 병렬)
  • llama-server: --cache-prompt, --ctx-size 400000, --parallel 2
  • LAN을 통해 연결된 OpenClaw

증상

llama-server 로그에 매 턴마다 다음과 같이 표시되었습니다:

forcing full prompt re-processing due to lack of cache data
erased invalidated context checkpoint (pos_min = 57172)
erased invalidated context checkpoint (pos_min = 60139)
erased invalidated context checkpoint (pos_min = 91076)
prompt eval time = 130511 ms / 91403 tokens

매 턴마다 91k 토큰을 처음부터 다시 처리 — 130초. 캐시는 활성화되어 있고 체크포인트는 존재했지만, llama.cpp는 일치하는 항목을 찾지 못해 전체 재처리로 대체되었습니다.

근본 원인

OpenClaw의 설정 contextInjection (기본값 always)은 모든 워크스페이스 부트스트랩 파일(AGENTS.md, SOUL.md, USER.md, TOOLS.md, MEMORY.md, HEARTBEAT.md, ~15kb)을 연속 턴을 포함한 모든 턴의 시스템 프롬프트에 다시 주입합니다. 이로 인해 토큰 시퀀스가 변경되어 정확한 접두사 일치에 의존하는 llama.cpp의 프롬프트 캐시를 재사용할 수 없게 됩니다.

Ad

해결책

openclaw config set agents.defaults.contextInjection continuation-skip --merge

그런 다음 게이트웨이를 재시작하세요. continuation-skip은 연속 턴이 아닌 새 사용자 메시지에서만 부트스트랩 파일을 주입하여 프롬프트를 안정적으로 유지하고 캐시를 유효하게 만듭니다.

결과

전: 턴당 91,403 토큰 재처리, 130초 프롬프트 평가, 캐시 재사용 0%, 답변당 2분 이상.

후: 턴당 513 새 토큰, 1.3초 프롬프트 평가, 캐시 재사용 99.7%, 답변당 약 5초. 100배 더 빠름.

진단 방법

ssh your-server "journalctl -u llama.service --no-pager -n 50 | grep -iE 'cache|re-process|checkpoint'"

캐시 손상 신호: forcing full prompt re-processing due to lack of cache data, erased invalidated context checkpoint 반복, 프롬프트 처리 30초 초과. 건강한 캐시 신호: restored context checkpoint, f_keep = 0.99+, graphs reused = 큰 숫자, 프롬프트 처리 5초 미만.

또한 추가 개선을 위해 --ctx-size를 400k(세션당 200k)로, OpenClaw contextTokens를 200k로, memoryFlush.softThresholdTokens를 30k에서 10k로 조정하세요.

📖 전체 소스 읽기: r/openclaw

Ad

👀 See Also

질문 분류를 위한 Qwen 3:0.6B 미세 조정 – 기준선 대 미세 조정 결과
Guides

질문 분류를 위한 Qwen 3:0.6B 미세 조정 – 기준선 대 미세 조정 결과

600M 파라미터 소형 LLM(Qwen 3:0.6B)을 Unsloth로 약 850개의 가정용 질문에 미세 조정. 기본 프롬프트는 10% 정확도였으나, 미세 조정 후 80-90% 이상 달성 예상.

OpenClawRadar
OpenClaw에서 Gemini CLI write_file을 찾을 수 없음 문제 해결: 두 가지 수정 필요
Guides

OpenClaw에서 Gemini CLI write_file을 찾을 수 없음 문제 해결: 두 가지 수정 필요

OpenClaw 에이전트가 google-gemini-cli를 사용할 때 잘못된 tools.profile과 서브프로세스의 --approval-mode auto_edit 플래그 누락으로 인해 파일을 쓸 수 없습니다(write_file / default_api_write_file 없음). 해결 방법: 프로필을 full로 설정하고 cliBackends 설정을 통해 플래그를 주입합니다.

OpenClawRadar
iOS 개발자, 여러 앱 출시 후 Claude 코드 모범 사례 공유
Guides

iOS 개발자, 여러 앱 출시 후 Claude 코드 모범 사례 공유

사이버 보안 배경을 가진 iOS 개발자가 Claude Code를 효과적으로 사용하기 위한 구체적인 실천 방법을 제시합니다. 여기에는 환경 분리, 관측 가능성 설정, 기술 부채 축적 방지 등이 포함됩니다.

OpenClawRadar
클로드로 API 엔드포인트 구축하기: 70개 이상의 엔드포인트 프로젝트에서 얻은 실용적인 프롬프트 엔지니어링 교훈
Guides

클로드로 API 엔드포인트 구축하기: 70개 이상의 엔드포인트 프로젝트에서 얻은 실용적인 프롬프트 엔지니어링 교훈

한 개발자가 Claude를 사용하여 코드의 약 80%를 작성하며 70개 이상의 LinkedIn 자동화 API 엔드포인트를 구축했습니다. 이 프로젝트는 행동 수행 에이전트(API 호출, 데이터 추출, 의사결정 트리 등을 실행하는 에이전트)를 위한 프롬프트 구성에 대한 구체적인 교훈을 보여주었는데, 자연어 지시보다는 명시적 제약 조건을 가진 계약서처럼 프롬프트를 다루는 것이 더 효과적임을 발견했습니다.

OpenClawRadar