Ollama Cloud 모델 maxTokens 수정: 상한선은 16K, 구성 값 아님

프로덕션에서 에이전트가 unexpected EOF 오류를 발생시키는 경우 주의하세요. openclaw.json에 { "id": "deepseek-v4-pro:cloud", "maxTokens": 500000 } 같은 클라우드 모델 항목이 있다면, 그 maxTokens는 실제가 아닙니다. Ollama 클라우드는 설정과 관계없이 서버 측에서 출력을 16,384 토큰으로 제한합니다. 에이전트가 그 이상을 출력하려고 하면 상위 서버가 스트림 중간에 소켓을 끊어버리고, ollama.com:443에서 전송 오류가 발생합니다. OpenClaw는 이를 타임아웃 형태의 장애 조치로 간주하여 설정된 대체 모델을 시도하지만, 대체 모델도 :cloud 모델이면 같은 문제가 발생합니다.
도움이 된 조치
- 클라우드 항목의 maxTokens 수정 — OpenClaw가 서비스가 제공하지 못할 출력 예산을 요청하지 않도록 함:
{ "id": "deepseek-v4-pro:cloud", "maxTokens": 14000 }
{ "id": "kimi-k2.6:cloud", "maxTokens": 14000 }
16k가 아닌 14k — 모델이 절대 상한에서 이상해질 수 있으므로 약간의 여유를 둠. - 대규모 구조적 출력 재구성 (긴 JSON, 여러 섹션 콘텐츠) — 모든 것을 한 번에 처리하는 대신 턴당 하나의 섹션을 출력하도록 함. 상한을 넘지 않으며 재시도가 더 깔끔함.
- 대규모 에이전트를 직접 제공업체로 라우팅 —
:cloud를 거치지 않고agents.list[]에서 에이전트별 모델 오버라이드를 사용. 소규모 출력 에이전트는 Ollama 클라우드에 그대로 둠. 일회성 설정:
openclaw onboard --auth-choice deepseek-api-key
그런 다음 agents.list에서 필요한 에이전트를 오버라이드:
"list": [ { "id": "your-agent", "model": "deepseek/deepseek-v4-pro" } ]
트레이드오프: 정액제 대신 토큰당 과금이지만, 여유 공간이 필요한 에이전트에 한정됨.
결론
에이전트가 긴 출력 도중 실패하고 명백한 문제를 확인했는데도 원인을 모르겠다면, OpenClaw 버그를 의심하기 전에 제공업체의 실제 출력 제한을 확인하세요. 오류 메시지는 도움이 되지 않으며, 설정 필드는 서버 측에서 재정의되고 있다는 사실을 알려주지 않습니다.
📖 전체 출처 읽기: r/openclaw
👀 See Also

tmux와 at을 사용한 Claude 세션 재시작 자동화
사용량이 초기화되는 이른 시간에 Claude 세션을 자동으로 재시작하려면 tmux와 at 명령어를 사용하세요.

Anthropic의 문서화되지 않은 OAuth 속도 제한 풀은 Claude Code 시스템 프롬프트가 필요합니다
Anthropic OAuth 토큰을 사용할 때, API는 시스템 프롬프트가 Claude Code로 식별되는지 여부에 따라 요청을 Claude Code 속도 제한 풀로 라우팅합니다. 시스템 프롬프트에 "You are Claude Code, Anthropic's official CLI for Claude."를 추가하면 설명하기 어려운 429 오류가 해결됩니다.

Claude Code 및 Codex에서 에이전트 실행을 검토 패킷으로 취급하는 실용적 패턴
한 개발자가 에이전트 실행마다 구조화된 폴더(연구, 초안, 평가, 승인 패킷, 메트릭, 메모리)를 생성함으로써 실패를 가시화하고 반복 속도를 높인 방법을 공유합니다.

값비싼 모델이 무조건 좋다고 가정하지 마세요: 사례 연구, 테스트를 통해 13배 비용 절감 보여줘
한 Reddit 사용자가 분류 작업에서 GPT-5.4를 Gemini 3.1 Flash Lite로 교체하여 21개 모델에 대한 평가를 실행한 결과, 동일한 85% 정확도를 1/13 비용으로 달성한 사례 연구를 공유했습니다.