클로드 CLI v2.1.154, 로컬 vLLM 중단 — 한 줄 패치로 해결

Claude CLI v2.1.154는 워크플로우 지원을 도입했지만, 그 과정에서 세 가지 새로운 API 메시지 역할(ctx, msg, system)을 추가하여 로컬 vLLM 서버와의 호환성을 깨뜨렸습니다. 해결책은 vLLM의 Anthropic 프로토콜 정의에 한 줄을 변경하는 것입니다.
문제점
Claude CLI 버전 ≥2.1.154부터는 user와 assistant 외의 역할이 포함된 메시지를 전송합니다. vLLM의 Anthropic API 엔드포인트는 기존 두 역할만 허용했기 때문에, 로컬 vLLM 인스턴스를 가리키는 CLI 요청이 실패했습니다.
한 줄 패치
패치는 vllm/entrypoints/anthropic/protocol.py의 role 필드를 업데이트하여 새 역할을 허용합니다:
--- a/vllm/entrypoints/anthropic/protocol.py
+++ b/vllm/entrypoints/anthropic/protocol.py
@@ -65,7 +65,7 @@ class AnthropicContentBlock(BaseModel):
class AnthropicMessage(BaseModel):
"""메시지 구조"""
- role: Literal["user", "assistant"]
+ role: Literal["user", "assistant", "ctx", "msg", "system"]이게 전부입니다. 이 변경 사항을 적용한 후에는 최신 Claude CLI 워크플로우를 MiniMax-M2.7(저자가 테스트한 유일한 모델)과 같은 vLLM 기반 로컬 모델에서 사용할 수 있습니다.
vLLM에서 로컬 Anthropic 호환 엔드포인트를 실행 중이라면, 이 패치를 적용하여 Claude CLI ≥2.1.154에서 계속 작동하도록 하세요.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

OpenClaw 에이전트, 1주일 후 응답 불능: 텔레그램 통합 문제?
레딧 사용자가 OpenClaw 에이전트가 첫 주 이후 침묵한다고 보고하며, Telegram 통합이나 장기 실행 문제를 의심하고 있습니다. 재시작하면 일시적으로 도움이 됩니다.

레딧 사용자가 복잡한 작업에서 Claude 코드 출력 편차를 줄이는 프롬프트 구조를 공유합니다
레딧 사용자가 긴 클로드 코드 작업에 구조화된 프롬프트 레이아웃을 사용하면 출력 편향을 방지하는 데 도움이 된다는 사실을 발견했습니다. 이 접근법은 실행 전에 작업 범위, 필요한 파일, 성공 기준, 피해야 할 매개변수와 같은 특정 요소를 정의하는 것을 포함합니다.

클로드 코드 토큰 낭비 해결: 캐시 적중률 향상을 위한 어트리뷰션 헤더 비활성화
셸 구성에서 CLAUDE_CODE_ATTRIBUTION_HEADER=false를 설정하면 Claude Code의 세션 간 프롬프트 캐시 적중률을 48%에서 99.98%로 향상시켜 세션당 시스템 프롬프트 처리 비용을 7배 절감할 수 있습니다.

Skippy의 개인 LLM: Ollama 서브 에이전트 타임아웃 문제를 직접 호출로 해결한 방법
OC COO의 AI 어시스턴트가 OpenClaw의 고장난 하위 에이전트 시스템을 우회하여 두 번째 Ollama 인스턴스를 curl로 직접 호출합니다. 게이트웨이 없음, 이벤트 루프 차단 없음.