Exécuter NemoClaw avec vLLM Local : Notes de Configuration et Observations sur l'Ingénierie d'Agents

Configuration locale de NemoClaw avec vLLM
Un développeur a partagé son expérience d'exécution de NemoClaw, une plateforme d'agents IA sandbox de NVIDIA, avec un modèle local Nemotron 9B v2 en utilisant vLLM sur WSL2. La configuration est basée sur le fork de NemoClaw de jieunl24.
Détails techniques clés
Routage de l'inférence : Le routage de l'inférence de NemoClaw suit un chemin propre : inference.local → passerelle → vLLM. Cependant, des bogues initiaux d'intégration ont nécessité un contournement réseau à 3 couches qui a depuis été corrigé via la PR #412.
Compatibilité des analyseurs : Les analyseurs vLLM intégrés (qwen3_coder, nemotron_v3) sont incompatibles avec les modèles Nemotron v2. Vous avez besoin des analyseurs officiels de NVIDIA provenant du dépôt NeMo à la place.
Écart en ingénierie des agents : OpenClaw en tant que plateforme d'agents fournit une infrastructure solide mais est livré avec un minimum d'ingénierie de prompts. L'écart entre "le modèle sert du texte" et "l'agent effectue un travail utile" concerne principalement l'échafaudage plutôt que les limitations de capacité du modèle.
Ressources
- Article de blog couvrant l'architecture, la configuration des analyseurs vLLM et les observations sur l'ingénierie des agents : https://github.com/soy-tuber/nemoclaw-local-inference-guide/blob/master/BLOG-openclaw-agent-engineering.md
- Guide de configuration (V2) avec routage inference.local et sans contournements réseau : https://github.com/soy-tuber/nemoclaw-local-inference-guide
- Problème original NemoClaw #315 : https://github.com/NVIDIA/NemoClaw/issues/315
Cette configuration démontre le déploiement local pratique des plateformes d'agents IA, mettant en lumière à la fois les détails de mise en œuvre technique et les défis persistants en ingénierie des agents.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Interface Web Open-Source pour Sessions de Code Parallèles Claude Utilisant Git Worktree
Un développeur a créé une interface web open-source appelée CCUI qui permet d'exécuter plusieurs sessions Claude Code en parallèle en utilisant git worktree. Elle fonctionne comme un serveur web local accessible via un navigateur et prend en charge le transfert de port SSH pour le développement à distance.

Savant Commander 48B : Un modèle personnalisé Qwen 3 à base de mélange d'experts, intégrant 12 modèles distillés
Savant Commander 48B est un modèle Qwen 3 Mixture-of-Experts personnalisé avec un routage codé manuellement qui combine 12 modèles distillés provenant de fournisseurs comme Claude, Gemini, OpenAI et Deepseek. Il dispose d'une longueur de contexte de 256K et permet l'activation contrôlée par prompt de modèles distillés spécifiques.

CAP : Plugin de barre d'état Claude Code qui s'installe avec /plugin install
CAP (Claude Allowance Pulse) est un plugin de ligne d'état pour Claude Code qui s'installe via /plugin install sans npm, curl ou jq. Il affiche l'utilisation du modèle, les limites de session et hebdomadaires, l'utilisation de la fenêtre de contexte et le coût de session dans le terminal.

Shipwright : Un outil de gestion de projet open-source construit sur Claude Code
Shipwright est un outil de gestion de projet open-source qui fonctionne sur Claude Code avec 44 compétences, 7 agents spécialisés et 16 flux de travail. Il comprend des portes de qualité binaires et des playbooks de récupération, et a été utilisé pour auditer des registres d'identifiants et évaluer des plateformes d'automatisation avant le début des travaux d'ingénierie.