Ejecutando NemoClaw con vLLM Local: Notas de Configuración y Observaciones de Ingeniería de Agentes

Configuración Local de NemoClaw con vLLM
Un desarrollador compartió su experiencia ejecutando NemoClaw de NVIDIA, una plataforma de agentes de IA en sandbox, con un modelo local Nemotron 9B v2 utilizando vLLM en WSL2. La configuración se basa en el fork de NemoClaw de jieunl24.
Detalles Técnicos Clave
Enrutamiento de Inferencia: El enrutamiento de inferencia de NemoClaw sigue una ruta limpia: inference.local → gateway → vLLM. Sin embargo, los errores iniciales de incorporación requerían un hack de red de 3 capas que desde entonces se ha solucionado mediante el PR #412.
Compatibilidad del Analizador: Los analizadores integrados de vLLM (qwen3_coder, nemotron_v3) son incompatibles con los modelos Nemotron v2. Necesitas los analizadores de complementos oficiales de NVIDIA del repositorio NeMo en su lugar.
Brecha en la Ingeniería de Agentes: OpenClaw como plataforma de agentes proporciona una infraestructura sólida pero se distribuye con una ingeniería de prompts mínima. La brecha entre "el modelo sirve texto" y "el agente realiza trabajo útil" se trata principalmente de andamiaje en lugar de limitaciones de capacidad del modelo.
Recursos
- Publicación de blog que cubre la arquitectura, configuración del analizador vLLM y observaciones sobre ingeniería de agentes: https://github.com/soy-tuber/nemoclaw-local-inference-guide/blob/master/BLOG-openclaw-agent-engineering.md
- Guía de configuración (V2) con enrutamiento inference.local y sin hacks de red: https://github.com/soy-tuber/nemoclaw-local-inference-guide
- Problema original de NemoClaw #315: https://github.com/NVIDIA/NemoClaw/issues/315
Esta configuración demuestra el despliegue local práctico de plataformas de agentes de IA, destacando tanto los detalles de implementación técnica como los desafíos continuos en la ingeniería de agentes.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Ingeniería inversa del protocolo inform de UniFi para el enrutamiento multiinquilino
El protocolo inform de UniFi envía datos de dispositivos a los controladores mediante HTTP POST en el puerto 8080 cada 10 segundos. Los primeros 40 bytes de cada paquete contienen direcciones MAC de dispositivos sin cifrar, lo que permite el enrutamiento sin necesidad de descifrar.

Historial de ELO del modelo Arena AI rastrea la degradación del rendimiento de LLM a lo largo del tiempo
Un panel en vivo visualiza las puntuaciones ELO de los modelos insignia de los principales laboratorios de IA, revelando una degradación gradual del rendimiento y saltos repentinos en los nuevos lanzamientos. La herramienta traza dinámicamente una curva por laboratorio, rastreando el modelo mejor valorado.

Problemas y Soluciones de Compactación de Sesiones de Claude AI
La compactación predeterminada en las sesiones de Claude AI puede degradar la precisión de recuperación de ~9.75/10 a ~5/10, causando alucinaciones. El usuario probó con 418K tokens y encontró que la compactación manual usando Opus mantiene la precisión mientras que la compactación predeterminada falla.

aco-system: Un Sistema Operativo Completo para Empresas para Claude que Escribe Historias de Usuario, Divide Tareas y Revisa PRs
Un usuario de Reddit compartió cómo aco-system convirtió un solo issue de GitHub en un PR completamente validado con tests — impulsado enteramente por Claude. Incluye generación de historias de usuario, desglose de tareas, verificación de secretos y revisión de PR.