La bifurcation vllm-mlx ajoute l'appel d'outils et le cache de prompts pour les agents d'IA de codage locaux.

✍️ OpenClawRadar📅 Publié: February 26, 2026🔗 Source
La bifurcation vllm-mlx ajoute l'appel d'outils et le cache de prompts pour les agents d'IA de codage locaux.
Ad

Un développeur a publié une version modifiée de vllm-mlx qui corrige plusieurs problèmes pour exécuter des agents d'IA de codage comme OpenClaw localement sur Mac. Le fork ajoute un appel d'outils fonctionnel et la mise en cache des invites au serveur compatible OpenAI pour Apple Silicon.

Corrections et fonctionnalités clés

Le développeur a effectué 37 commits sur la version principale de vllm-mlx pour résoudre des problèmes spécifiques :

  • Appel d'outils : Ajout du drapeau --tool-call-parser hermes — les appels d'outils de Qwen3-Coder-Next fonctionnent immédiatement
  • MiniMax-M2.5 : Ajout de l'analyse des appels d'outils en streaming et non-streaming avec une précision de 4/4 sur les benchmarks d'appel de fonction (météo, recherche, exécution de code, multi-outils)
  • Cache d'invite : Ajout d'un cache KV persistant entre les requêtes dans SimpleEngine — seules les nouvelles unités lexicales sont pré-remplies avec la même invite système et l'historique de conversation
  • Séparation du raisonnement : Construction d'un analyseur heuristique pour les sorties MiniMax qui avaient un raisonnement intégré sans balises — réduction du taux de fuite de 60 % à 0 %

Améliorations des performances

Avec un contexte de 33K unités lexicales, le temps jusqu'au premier jeton (TTFT) est passé de 28 secondes à 0,3 seconde en cas de succès du cache. Benchmarks sur Mac Studio M3 Ultra 256GB :

  • Qwen3-Coder-Next 4bit : 42GB RAM, 70 tok/s en décodage, 1270 tok/s en pré-remplissage
  • Qwen3-Coder-Next 6bit : 60GB RAM, 65 tok/s en décodage, 1090-1440 tok/s en pré-remplissage
  • Qwen3-Coder-Next 8bit : 75GB RAM, ~45 tok/s en décodage, ~900 tok/s en pré-remplissage
  • MiniMax-M2.5 4bit : 120GB RAM, 33-38 tok/s en décodage, 430-500 tok/s en pré-remplissage

Le développeur recommande Qwen3-Coder-Next 6bit comme le point idéal pour le codage interactif, notant que la qualité est nettement meilleure que le 4bit (qui avait parfois une sortie incohérente).

Ad

Instructions d'installation

pip install git+https://github.com/raullenchai/vllm-mlx.git
python -c "from mlx_lm import load; load('lmstudio-community/Qwen3-Coder-Next-MLX-6bit')"
python -m vllm_mlx.server \
  --model lmstudio-community/Qwen3-Coder-Next-MLX-6bit \
  --tool-call-parser hermes \
  --prefill-step-size 8192 \
  --kv-bits 8 \
  --port 8000

Puis dirigez OpenClaw ou tout client SDK OpenAI vers http://localhost:8000/v1.

Exigences matérielles

  • Qwen3-Coder-Next 4bit : 42GB — convient à M2 Pro 64GB ou mieux
  • Qwen3-Coder-Next 6bit : 60GB — nécessite M2/M3/M4 Max 96GB+ ou Ultra
  • MiniMax-M2.5 : 120GB — Ultra 192GB+ uniquement

Ce qui n'a pas fonctionné

  • Décodage spéculatif avec Qwen3-0.6B comme modèle de brouillon — mlx-lm a un bug connu avec Qwen3 (saute des unités lexicales, problème #846)
  • DeepSeek-R1-Distill-70B pour OpenClaw — excellent en raisonnement mais l'appel d'outils est peu fiable

Le dépôt contient plus de 1500 tests et est sous licence Apache 2.0.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

ClawNet : Réseau d'Agents IA Pair-à-Pair Sans Clés API
Tools

ClawNet : Réseau d'Agents IA Pair-à-Pair Sans Clés API

ClawNet est un réseau pair-à-pair qui permet aux agents d'IA de collaborer directement sans clés API ni frais de plateforme. L'installation se fait via un script curl, et les fonctionnalités incluent un bazar de tâches, une économie de shell et un réseau de connaissances.

OpenClawRadar
Orchestrateur d'Agents Parallèles pour Claude Code Utilisant des Worktrees Git
Tools

Orchestrateur d'Agents Parallèles pour Claude Code Utilisant des Worktrees Git

Un développeur a construit un orchestrateur parallèle qui utilise les git worktrees pour créer des environnements isolés pour les agents Claude Code, résolvant ainsi le problème des répertoires de travail partagés qui provoquent des applications cassées et un état git désordonné.

OpenClawRadar
Claude Code Ajoute un Système de Revue de Code Multi-Agent
Tools

Claude Code Ajoute un Système de Revue de Code Multi-Agent

Anthropic a lancé Code Review pour Claude Code, un système multi-agents qui déploie des équipes d'agents IA pour examiner les demandes de fusion. Le système détecte des bogues que les réviseurs humains manquent souvent, avec 54 % des PR recevant désormais des commentaires de revue substantiels contre 16 % auparavant.

OpenClawRadar
Claude Code Plugin Yoink Remplace les Dépendances de Bibliothèque pour Réduire les Risques de la Chaîne d'Approvisionnement
Tools

Claude Code Plugin Yoink Remplace les Dépendances de Bibliothèque pour Réduire les Risques de la Chaîne d'Approvisionnement

Yoink est un plugin Claude Code qui supprime les dépendances complexes en réimplémentant uniquement les fonctions nécessaires, utilisant un flux de travail en trois étapes avec les commandes /setup, /curate-tests et /decompose. Il prend actuellement en charge Python, avec le support de TypeScript et Rust en cours de développement.

OpenClawRadar