OpenClaw API 예산 소진: 즉시 변경해야 할 설정

OpenClaw의 기본 설정이 하트비트 기능을 통해 예상치 못한 API 예산 소진을 초래할 수 있습니다. 이 기능은 기본적으로 30분마다 작업을 확인하며, 각 확인 시 전체 컨텍스트 파일, 메모리, 채팅 기록을 로드하여 기본 상태 확인을 위해 수만 개의 토큰을 API로 전송합니다.
즉시 변경해야 할 설정
- 작업 시간 설정: 설정에서 하트비트를 실제 근무 시간으로 제한하여 야간 토큰 소진을 중지하세요.
- 기본 기본 모델 변경: 프리미엄 모델(Claude 3.5 Sonnet 또는 Opus 등) 대신 Gemini Flash나 DeepSeek과 같은 더 저렴한 모델을 기본 에이전트 작업에 사용하세요.
- 대형 모델은 필요할 때만 호출: 무거운 추론이나 복잡한 코딩이 필요할 때만 수동으로 프리미엄 모델로 전환하세요.
- /new 명령어 사용: 대규모 작업 후
/new를 입력하여 세션을 강제 초기화하면 다음 프롬프트에 불필요한 컨텍스트가 유입되는 것을 방지할 수 있습니다.
출처에서는 모든 작업에 프리미엄 모델을 사용하면 비용이 빠르게 증가할 수 있으며, OpenClaw가 기본적으로 전체 채팅 기록을 계속 끌고 가기 때문에 컨텍스트가 급속도로 쌓인다고 지적합니다.
📖 Read the full source: r/openclaw
👀 See Also

OpenClaw의 WhatsApp: 먼저 5.7로 업데이트하면 2시간 절약
OpenClaw에서 WhatsApp을 설정하려면 Baileys 라이브러리, 24/7 가동 시간, 그리고 버전 5.7+가 필요하여 고스트 채팅, TUI 저하, 이중 전송 버그를 피할 수 있습니다.

llama.cpp 대규모 프롬프트 재처리와 코딩 에이전트: KV 캐시 및 컨텍스트 스와핑 디버깅
사용자가 opencode + pi.dev 사용 시 유사한 프롬프트에서 llama.cpp가 40k+ 토큰을 재처리하는 문제를 보고했습니다. LCP 유사도가 높음에도 불구하고 발생합니다. 설정 세부 정보와 의심되는 원인이 공유되었습니다.

클로드 성능 저하 진단: 근본 원인과 해결 방법
Claude 코딩 결과가 시간이 지남에 따라 저하되는 이유와 맥락 관리 및 프롬프트 위생을 포함한 실질적인 해결책에 대한 실용적인 분석.

MTP 수용률: 50% 임계값이 투기적 디코딩 이점을 결정한다
추론적 디코딩(Speculative Decoding)을 통한 Gemma-4 26B 기반 MTP(다중 토큰 예측, Multi-Token Prediction)는 초안 토큰 수락률이 50%를 초과할 때만 성능 향상을 보여줌 — M4 Max Studio에서의 mlx-vlm 벤치마크 기준.