클로드 CLI v2.1.154, 로컬 vLLM 중단 — 한 줄 패치로 해결

✍️ OpenClawRadar📅 게시일: May 30, 2026🔗 Source
클로드 CLI v2.1.154, 로컬 vLLM 중단 — 한 줄 패치로 해결
Ad

Claude CLI v2.1.154는 워크플로우 지원을 도입했지만, 그 과정에서 세 가지 새로운 API 메시지 역할(ctx, msg, system)을 추가하여 로컬 vLLM 서버와의 호환성을 깨뜨렸습니다. 해결책은 vLLM의 Anthropic 프로토콜 정의에 한 줄을 변경하는 것입니다.

문제점

Claude CLI 버전 ≥2.1.154부터는 userassistant 외의 역할이 포함된 메시지를 전송합니다. vLLM의 Anthropic API 엔드포인트는 기존 두 역할만 허용했기 때문에, 로컬 vLLM 인스턴스를 가리키는 CLI 요청이 실패했습니다.

한 줄 패치

패치는 vllm/entrypoints/anthropic/protocol.pyrole 필드를 업데이트하여 새 역할을 허용합니다:

--- a/vllm/entrypoints/anthropic/protocol.py
+++ b/vllm/entrypoints/anthropic/protocol.py
@@ -65,7 +65,7 @@ class AnthropicContentBlock(BaseModel):
 class AnthropicMessage(BaseModel):
     """메시지 구조"""
-    role: Literal["user", "assistant"]
+    role: Literal["user", "assistant", "ctx", "msg", "system"]

이게 전부입니다. 이 변경 사항을 적용한 후에는 최신 Claude CLI 워크플로우를 MiniMax-M2.7(저자가 테스트한 유일한 모델)과 같은 vLLM 기반 로컬 모델에서 사용할 수 있습니다.

vLLM에서 로컬 Anthropic 호환 엔드포인트를 실행 중이라면, 이 패치를 적용하여 Claude CLI ≥2.1.154에서 계속 작동하도록 하세요.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

OpenClaw 에이전트, 1주일 후 응답 불능: 텔레그램 통합 문제?
Tips

OpenClaw 에이전트, 1주일 후 응답 불능: 텔레그램 통합 문제?

레딧 사용자가 OpenClaw 에이전트가 첫 주 이후 침묵한다고 보고하며, Telegram 통합이나 장기 실행 문제를 의심하고 있습니다. 재시작하면 일시적으로 도움이 됩니다.

OpenClawRadar
레딧 사용자가 복잡한 작업에서 Claude 코드 출력 편차를 줄이는 프롬프트 구조를 공유합니다
Tips

레딧 사용자가 복잡한 작업에서 Claude 코드 출력 편차를 줄이는 프롬프트 구조를 공유합니다

레딧 사용자가 긴 클로드 코드 작업에 구조화된 프롬프트 레이아웃을 사용하면 출력 편향을 방지하는 데 도움이 된다는 사실을 발견했습니다. 이 접근법은 실행 전에 작업 범위, 필요한 파일, 성공 기준, 피해야 할 매개변수와 같은 특정 요소를 정의하는 것을 포함합니다.

OpenClawRadar
클로드 코드 토큰 낭비 해결: 캐시 적중률 향상을 위한 어트리뷰션 헤더 비활성화
Tips

클로드 코드 토큰 낭비 해결: 캐시 적중률 향상을 위한 어트리뷰션 헤더 비활성화

셸 구성에서 CLAUDE_CODE_ATTRIBUTION_HEADER=false를 설정하면 Claude Code의 세션 간 프롬프트 캐시 적중률을 48%에서 99.98%로 향상시켜 세션당 시스템 프롬프트 처리 비용을 7배 절감할 수 있습니다.

OpenClawRadar
Skippy의 개인 LLM: Ollama 서브 에이전트 타임아웃 문제를 직접 호출로 해결한 방법
Tips

Skippy의 개인 LLM: Ollama 서브 에이전트 타임아웃 문제를 직접 호출로 해결한 방법

OC COO의 AI 어시스턴트가 OpenClaw의 고장난 하위 에이전트 시스템을 우회하여 두 번째 Ollama 인스턴스를 curl로 직접 호출합니다. 게이트웨이 없음, 이벤트 루프 차단 없음.

OpenClawRadar