Claude CLI v2.1.154 brise le vLLM local — un correctif d'une ligne le répare

Claude CLI v2.1.154 a introduit la prise en charge des workflows, mais ce faisant, il a ajouté trois nouveaux rôles de message API (ctx, msg et system) qui ont cassé la compatibilité avec les serveurs vLLM locaux. Le correctif est une modification d'une ligne dans les définitions du protocole Anthropic de vLLM.
Le problème
Les versions de Claude CLI ≥2.1.154 envoient désormais des messages avec des rôles au-delà de user et assistant. Le point de terminaison API Anthropic de vLLM n'acceptait que les deux rôles d'origine, ce qui entraînait l'échec des requêtes du CLI lorsqu'elles pointaient vers une instance vLLM locale.
Le correctif d'une ligne
Le correctif met à jour le champ role dans vllm/entrypoints/anthropic/protocol.py pour autoriser les nouveaux rôles :
--- a/vllm/entrypoints/anthropic/protocol.py
+++ b/vllm/entrypoints/anthropic/protocol.py
@@ -65,7 +65,7 @@ class AnthropicContentBlock(BaseModel):
class AnthropicMessage(BaseModel):
"""Structure du message"""
- role: Literal["user", "assistant"]
+ role: Literal["user", "assistant", "ctx", "msg", "system"]C'est tout. Après avoir appliqué cette modification, vous pouvez utiliser les derniers workflows de Claude CLI avec des modèles locaux basés sur vLLM comme MiniMax-M2.7 (le seul modèle testé par l'auteur).
Si vous exécutez un point de terminaison local compatible Anthropic sur vLLM, appliquez ce correctif pour continuer à travailler avec Claude CLI ≥2.1.154.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

La communauté discute des solutions pour la consommation des jetons OpenClaw
Les utilisateurs partagent des stratégies pour gérer une utilisation élevée de tokens lors de l'exécution d'agents IA 24h/24 et 7j/7.

Utiliser le HTML comme langage de chat principal pour les agents de codage IA afin de permettre les diagrammes SVG
Un développeur a changé les instructions système des agents de codage, passant du Markdown au HTML, permettant aux agents de générer des diagrammes SVG et des tableaux riches directement dans le chat. Utilisation de Qwen3.6-27B avec une interface HTML.

Comment les instructions du projet Claude sont injectées — et pourquoi les modifier en cours de conversation brise l'historique
Les instructions du projet et les préférences utilisateur sont chargées dans le prompt système au début de la conversation, et ne sont pas réinjectées à chaque tour. Les modifier en cours de conversation amène Claude à écraser sa mémoire des instructions passées, entraînant des réminiscences erronées.

Compétences d'agent : arrêtez d'écrire des SOP, commencez à construire des systèmes de frontières
Un post Reddit soutient qu'ajouter plus de compétences ou d'outils à un agent IA le rend plus fragile. La solution : un ensemble d'outils minimal, une clarté maximale des limites.