로컬 vLLM으로 NemoClaw 실행하기: 설정 노트 및 에이전트 엔지니어링 관찰

vLLM을 이용한 로컬 NemoClaw 설정
개발자가 WSL2에서 vLLM을 사용하여 로컬 Nemotron 9B v2 모델과 함께 NVIDIA의 샌드박스 AI 에이전트 플랫폼인 NemoClaw을 실행한 경험을 공유했습니다. 이 설정은 jieunl24의 NemoClaw 포크를 기반으로 합니다.
주요 기술 세부사항
추론 라우팅: NemoClaw의 추론 라우팅은 깔끔한 경로를 따릅니다: inference.local → gateway → vLLM. 그러나 초기 온보딩 버그로 인해 3계층 네트워크 해킹이 필요했으며, 이는 이후 PR #412를 통해 수정되었습니다.
파서 호환성: 내장된 vLLM 파서(qwen3_coder, nemotron_v3)는 Nemotron v2 모델과 호환되지 않습니다. 대신 NeMo 저장소의 NVIDIA 공식 플러그인 파서를 사용해야 합니다.
에이전트 엔지니어링 격차: 에이전트 플랫폼으로서의 OpenClaw는 견고한 인프라를 제공하지만 최소한의 프롬프트 엔지니어링만 포함하고 있습니다. '모델이 텍스트를 제공한다'와 '에이전트가 유용한 작업을 수행한다' 사이의 격차는 주로 모델 능력의 한계보다는 스캐폴딩에 관한 것입니다.
참고 자료
- 아키텍처, vLLM 파서 설정, 에이전트 엔지니어링 관찰을 다루는 블로그 게시물: https://github.com/soy-tuber/nemoclaw-local-inference-guide/blob/master/BLOG-openclaw-agent-engineering.md
- 추론.local 라우팅 및 네트워크 해킹 없이 설정하는 가이드 (V2): https://github.com/soy-tuber/nemoclaw-local-inference-guide
- 원본 NemoClaw 이슈 #315: https://github.com/NVIDIA/NemoClaw/issues/315
이 설정은 AI 에이전트 플랫폼의 실용적인 로컬 배포를 보여주며, 기술 구현 세부사항과 에이전트 엔지니어링의 지속적인 과제를 모두 강조합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Bifrost LLM 게이트웨이: 11마이크로초 오버헤드, Go로 작성된 단일 바이너리
Bifrost는 Go로 작성된 오픈소스 LLM 프록시로, OpenAI, Anthropic, Azure, Bedrock으로 요청을 라우팅하며 요청당 11마이크로초의 오버헤드와 월 20달러 VPS에서 5,000 RPS를 처리합니다.

크리에이티브 엑설런스 플러그인, 클로드 코드가 상호작용 테제로 애니메이션 품질 향상
클로드 코드용 새로운 오픈소스 플러그인이 '상호작용 테제' 접근법을 구현하여 일반적인 애니메이션 생성 문제를 해결합니다. 이 접근법에서 클로드는 코딩 전에 동작 개념을 설명해야 합니다. 이 플러그인은 연구된 저장소에서 얻은 GSAP, Framer Motion, CSS 애니메이션 및 디자인 원칙을 다루는 8가지 하위 기술을 포함합니다.

상위 6가지 오픈소스 클로드 스킬 (4월 15일 - 5월 3일)
지난 15일간의 여섯 가지 오픈소스 클로드 스킬: 브랜드-연금술, npm-다운로드를-리드로, 하이퍼프레임, 이메일-뉴스레터, 가격 책정 등. 각 스킬의 기능에 대한 상세 분석.

Org Studio: 다중 에이전트 AI 팀 관리를 위한 오픈소스 대시보드
Org Studio는 조직 설계 원칙을 적용하여 AI 에이전트 팀을 조정하는 오픈소스 대시보드로, OpenClaw와 Hermes Agent 런타임 모두에 대한 네이티브 지원을 제공합니다. 이 대시보드는 팀 토폴로지 관리, 이벤트 기반 작업 보드, 그리고 에이전트들이 작업 댓글에서 서로를 언급할 수 있는 크로스-런타임 커뮤니케이션 기능을 갖추고 있습니다.