Claude CLI v2.1.154 bricht lokales vLLM — Einzeiliger Patch behebt es

✍️ OpenClawRadar📅 Veröffentlicht: 30. Mai 2026🔗 Source
Claude CLI v2.1.154 bricht lokales vLLM — Einzeiliger Patch behebt es
Ad

Claude CLI v2.1.154 hat Unterstützung für Workflows eingeführt, dabei aber drei neue API-Nachrichtenrollen (ctx, msg und system) hinzugefügt, die die Kompatibilität mit lokalen vLLM-Servern gebrochen haben. Der Fix ist eine einzeilige Änderung in vLLMs Anthropic-Protokolldefinitionen.

Das Problem

Claude CLI-Versionen ≥2.1.154 senden jetzt Nachrichten mit Rollen über user und assistant hinaus. vLLMs Anthropic-API-Endpunkt akzeptierte nur die ursprünglichen zwei Rollen, was dazu führte, dass Anfragen von der CLI bei einem lokalen vLLM-Instance fehlschlugen.

Ad

Der einzeilige Patch

Der Patch aktualisiert das role-Feld in vllm/entrypoints/anthropic/protocol.py, um die neuen Rollen zu erlauben:

--- a/vllm/entrypoints/anthropic/protocol.py
+++ b/vllm/entrypoints/anthropic/protocol.py
@@ -65,7 +65,7 @@ class AnthropicContentBlock(BaseModel):
 class AnthropicMessage(BaseModel):
     """Message structure"""
-    role: Literal["user", "assistant"]
+    role: Literal["user", "assistant", "ctx", "msg", "system"]

Das war's. Nach Anwendung dieser Änderung können Sie die neuesten Claude CLI-Workflows mit vLLM-basierten lokalen Modellen wie MiniMax-M2.7 (das einzige vom Autor getestete Modell) verwenden.

Wenn Sie einen lokalen anthropic-kompatiblen Endpunkt auf vLLM betreiben, wenden Sie diesen Patch an, um mit Claude CLI ≥2.1.154 weiterzuarbeiten.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Claude-Code-Plugin-Fehler führt dazu, dass Fähigkeiten doppelt geladen werden und die Kontextkomprimierung verstärkt wird
Tipps

Claude-Code-Plugin-Fehler führt dazu, dass Fähigkeiten doppelt geladen werden und die Kontextkomprimierung verstärkt wird

Ein Fehler in Claude Code führt dazu, dass Plugins jede Fähigkeit doppelt laden, was die Größe des Systemprompts erheblich erhöht und häufige Kontextkomprimierung auslöst. Die Quelle bietet Prüfskripte zur Identifizierung des Problems und Korrekturskripte zum Entfernen veralteter Plugin-Versionen und doppelter Symlinks.

OpenClawRadar
Auth 400 Fehlerbehebung: Verwendung des Python-Pakets `mnemonic`, um BIP39-Filterauslöser zu vermeiden
Tipps

Auth 400 Fehlerbehebung: Verwendung des Python-Pakets `mnemonic`, um BIP39-Filterauslöser zu vermeiden

Ein Reddit-Nutzer stellte fest, dass der Inhaltsfilter von Anthropic einen 400-Fehler auslöst, wenn KI-Agenten versuchen, die vollständige BIP39-Wortliste (2048 standardisierte englische Wörter) in Python-Code zu schreiben. Die Lösung besteht darin, stattdessen das Python-Paket 'mnemonic' zu verwenden, das die Wortliste intern enthält.

OpenClawRadar
Praktische Claude-Code-Workflow-Tipps für komplexe Entwicklungsprojekte
Tipps

Praktische Claude-Code-Workflow-Tipps für komplexe Entwicklungsprojekte

Ein Claude Pro-Benutzer teilt spezifische Workflow-Strategien für die Entwicklung komplexer Audio-Plugins, einschließlich der Verwendung des Planungsmodus für Hauptfunktionen, der Erstellung von Kontextdateien, der Verwaltung des Token-Verbrauchs und der Implementierung von Validierungsschritten.

OpenClawRadar
Wie die Weiterleitung einfacher Aufgaben an günstigere Modelle die KI-Kosten um 40 % senkte
Tipps

Wie die Weiterleitung einfacher Aufgaben an günstigere Modelle die KI-Kosten um 40 % senkte

Ein OpenClaw-Nutzer hat seine KI-Rechnung um 40 % gesenkt, indem er Nutzungsprotokolle analysierte und einfache Aufgaben wie Dateioperationen und Q&A auf günstigere Modelle wie DeepSeek-v3 und Gemini Flash umleitete, während Claude Sonnet für komplexe Denkaufgaben reserviert blieb.

OpenClawRadar