Ejecutando NemoClaw con vLLM Local: Notas de Configuración y Observaciones de Ingeniería de Agentes

Configuración Local de NemoClaw con vLLM
Un desarrollador compartió su experiencia ejecutando NemoClaw de NVIDIA, una plataforma de agentes de IA en sandbox, con un modelo local Nemotron 9B v2 utilizando vLLM en WSL2. La configuración se basa en el fork de NemoClaw de jieunl24.
Detalles Técnicos Clave
Enrutamiento de Inferencia: El enrutamiento de inferencia de NemoClaw sigue una ruta limpia: inference.local → gateway → vLLM. Sin embargo, los errores iniciales de incorporación requerían un hack de red de 3 capas que desde entonces se ha solucionado mediante el PR #412.
Compatibilidad del Analizador: Los analizadores integrados de vLLM (qwen3_coder, nemotron_v3) son incompatibles con los modelos Nemotron v2. Necesitas los analizadores de complementos oficiales de NVIDIA del repositorio NeMo en su lugar.
Brecha en la Ingeniería de Agentes: OpenClaw como plataforma de agentes proporciona una infraestructura sólida pero se distribuye con una ingeniería de prompts mínima. La brecha entre "el modelo sirve texto" y "el agente realiza trabajo útil" se trata principalmente de andamiaje en lugar de limitaciones de capacidad del modelo.
Recursos
- Publicación de blog que cubre la arquitectura, configuración del analizador vLLM y observaciones sobre ingeniería de agentes: https://github.com/soy-tuber/nemoclaw-local-inference-guide/blob/master/BLOG-openclaw-agent-engineering.md
- Guía de configuración (V2) con enrutamiento inference.local y sin hacks de red: https://github.com/soy-tuber/nemoclaw-local-inference-guide
- Problema original de NemoClaw #315: https://github.com/NVIDIA/NemoClaw/issues/315
Esta configuración demuestra el despliegue local práctico de plataformas de agentes de IA, destacando tanto los detalles de implementación técnica como los desafíos continuos en la ingeniería de agentes.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Interfaz de Usuario Web de Código Abierto para Sesiones de Código Paralelas de Claude Usando Git Worktree
Un desarrollador ha creado una interfaz web de código abierto llamada CCUI que permite ejecutar múltiples sesiones de Claude Code en paralelo utilizando git worktree. Se ejecuta como un servidor web local accesible a través del navegador y admite reenvío de puertos SSH para desarrollo remoto.

Monarch v3: Paginación KV Inspirada en NES para una Inferencia de LLM 78% Más Rápida
Monarch v3 implementa paginación de memoria inspirada en NES para transformadores, logrando una inferencia 78% más rápida (de 17.01 a 30.42 tok/seg) en un modelo de 1.1B parámetros con un consumo de VRAM casi nulo. El algoritmo de código abierto divide la caché KV en regiones calientes y frías con mecanismos de compresión y promoción.

Agente Enjambre: Marco de Orquestación Multiagente para Asistentes de Codificación con IA
Agent Swarm es un framework de código abierto que permite a equipos de agentes de IA de codificación coordinarse de manera autónoma. Un agente principal recibe tareas desde Slack, GitHub o correo electrónico, las desglosa y las delega a agentes trabajadores aislados en Docker.

El Log es el Agente: Grafos de Eventos para Sistemas de IA Auditables y Bifurcables
ActiveGraph invierte los marcos de agentes típicos: un registro de eventos de solo adición es la fuente de verdad, y una proyección de grafo determinista reacciona a los cambios y emite eventos. Esto permite la reproducción, bifurcación y linaje completo sin memoria añadida.