Ollama Cloud 모델 maxTokens 수정: 상한선은 16K, 구성 값 아님

프로덕션에서 에이전트가 unexpected EOF 오류를 발생시키는 경우 주의하세요. openclaw.json에 { "id": "deepseek-v4-pro:cloud", "maxTokens": 500000 } 같은 클라우드 모델 항목이 있다면, 그 maxTokens는 실제가 아닙니다. Ollama 클라우드는 설정과 관계없이 서버 측에서 출력을 16,384 토큰으로 제한합니다. 에이전트가 그 이상을 출력하려고 하면 상위 서버가 스트림 중간에 소켓을 끊어버리고, ollama.com:443에서 전송 오류가 발생합니다. OpenClaw는 이를 타임아웃 형태의 장애 조치로 간주하여 설정된 대체 모델을 시도하지만, 대체 모델도 :cloud 모델이면 같은 문제가 발생합니다.
도움이 된 조치
- 클라우드 항목의 maxTokens 수정 — OpenClaw가 서비스가 제공하지 못할 출력 예산을 요청하지 않도록 함:
{ "id": "deepseek-v4-pro:cloud", "maxTokens": 14000 }
{ "id": "kimi-k2.6:cloud", "maxTokens": 14000 }
16k가 아닌 14k — 모델이 절대 상한에서 이상해질 수 있으므로 약간의 여유를 둠. - 대규모 구조적 출력 재구성 (긴 JSON, 여러 섹션 콘텐츠) — 모든 것을 한 번에 처리하는 대신 턴당 하나의 섹션을 출력하도록 함. 상한을 넘지 않으며 재시도가 더 깔끔함.
- 대규모 에이전트를 직접 제공업체로 라우팅 —
:cloud를 거치지 않고agents.list[]에서 에이전트별 모델 오버라이드를 사용. 소규모 출력 에이전트는 Ollama 클라우드에 그대로 둠. 일회성 설정:
openclaw onboard --auth-choice deepseek-api-key
그런 다음 agents.list에서 필요한 에이전트를 오버라이드:
"list": [ { "id": "your-agent", "model": "deepseek/deepseek-v4-pro" } ]
트레이드오프: 정액제 대신 토큰당 과금이지만, 여유 공간이 필요한 에이전트에 한정됨.
결론
에이전트가 긴 출력 도중 실패하고 명백한 문제를 확인했는데도 원인을 모르겠다면, OpenClaw 버그를 의심하기 전에 제공업체의 실제 출력 제한을 확인하세요. 오류 메시지는 도움이 되지 않으며, 설정 필드는 서버 측에서 재정의되고 있다는 사실을 알려주지 않습니다.
📖 전체 출처 읽기: r/openclaw
👀 See Also

AI 에이전트 준수 강화: 부트스트랩 언어 및 도구 기반 접근법
한 개발자가 AI 에이전트 순응도를 개선하기 위한 실용적인 방법을 공유하며, 부트스트랩에 부정적 언어 사용과 필요 시 소프트 규칙에서 하드코딩된 도구로 전환하는 방법을 포함합니다.

MCP 토큰 사용량을 줄이기 위해 서버를 CLI 대안으로 교체하기
한 개발자가 MCP 서버가 도구 정의에 컨텍스트 창의 30-40%를 소비한다는 사실을 발견하고, 가능한 경우 4개의 MCP 서버를 CLI 도구로 대체했습니다. 이로써 MCP 서버를 6개에서 2개로 줄이면서도 기능을 유지할 수 있었습니다.

Skippy의 개인 LLM: Ollama 서브 에이전트 타임아웃 문제를 직접 호출로 해결한 방법
OC COO의 AI 어시스턴트가 OpenClaw의 고장난 하위 에이전트 시스템을 우회하여 두 번째 Ollama 인스턴스를 curl로 직접 호출합니다. 게이트웨이 없음, 이벤트 루프 차단 없음.

클로드 코드 헤드리스 모드와 --print 플래그
Claude Code는 --print 플래그를 사용하여 헤드리스 모드로 실행할 수 있으며, 이를 통해 프롬프트를 파이프로 입력하여 대화형 세션 없이 자동화된 출력을 얻을 수 있습니다. 이는 CI/CD 파이프라인, git 훅, bash 스크립트에 통합할 수 있게 해줍니다.