Ausführen von NemoClaw mit lokalem vLLM: Setup-Notizen und Beobachtungen zum Agent-Engineering

Lokale NemoClaw-Einrichtung mit vLLM
Ein Entwickler teilte seine Erfahrungen mit der Ausführung von NVIDIAs NemoClaw, einer sandboxed AI-Agentenplattform, mit einem lokalen Nemotron 9B v2-Modell unter Verwendung von vLLM auf WSL2. Das Setup basiert auf jieunl24s Fork von NemoClaw.
Wichtige technische Details
Inferenz-Routing: Das Inferenz-Routing von NemoClaw folgt einem klaren Pfad: inference.local → gateway → vLLM. Anfängliche Onboarding-Fehler erforderten jedoch einen 3-Schichten-Netzwerk-Hack, der inzwischen über PR #412 behoben wurde.
Parser-Kompatibilität: Die integrierten vLLM-Parser (qwen3_coder, nemotron_v3) sind mit Nemotron v2-Modellen inkompatibel. Stattdessen benötigen Sie die offiziellen Plugin-Parser von NVIDIA aus dem NeMo-Repository.
Kluft in der Agentenentwicklung: OpenClaw als Agentenplattform bietet eine solide Infrastruktur, wird jedoch mit minimaler Prompt-Engineering ausgeliefert. Die Kluft zwischen "Modell liefert Text" und "Agent leistet nützliche Arbeit" betrifft in erster Linie das Gerüst und nicht die Fähigkeitsgrenzen des Modells.
Ressourcen
- Blogbeitrag zu Architektur, vLLM-Parser-Einrichtung und Beobachtungen zur Agentenentwicklung: https://github.com/soy-tuber/nemoclaw-local-inference-guide/blob/master/BLOG-openclaw-agent-engineering.md
- Einrichtungsanleitung (V2) mit inference.local-Routing und ohne Netzwerk-Hacks: https://github.com/soy-tuber/nemoclaw-local-inference-guide
- Originales NemoClaw-Issue #315: https://github.com/NVIDIA/NemoClaw/issues/315
Dieses Setup demonstriert die praktische lokale Bereitstellung von AI-Agentenplattformen und hebt sowohl die technischen Implementierungsdetails als auch die anhaltenden Herausforderungen in der Agentenentwicklung hervor.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Audio-Ingenieur baut Mix-Analysetool mit Claude Code
Ein Toningenieur hat ein Tool entwickelt, das Audiomischungen mithilfe der Web Audio API und Claude analysiert, um spezifisches Feedback zu Problemen wie matten Tieftonmitten, fehlendem Headroom und untergehenden Gesangsspuren zu geben. Das Tool bietet einen kostenlosen Tarif für schnelle Analysen und einen kostenpflichtigen Pro-Bericht mit detaillierten Frequenznotizen und Plugin-Empfehlungen.

SubQ: Ein sub-quadratisches LLM mit 12-Millionen-Token-Kontextfenster
SubQ ist ein vollständig sub-quadratisches Sparse-Attention-LLM mit einem 12M-Token-Kontextfenster bei 150 Tokens/s, SWE-Bench Verified 81,8% und RULER @ 128K 95,0%. Es reduziert die Attention-Berechnung im Vergleich zu Transformatoren um etwa das 1000-fache.

Claude Code Matrix Channel Plugin in Rust mit E2EE-Unterstützung erstellt
Ein Entwickler hat ein Matrix-Kanal-Plugin für Claude Code in Rust erstellt, das Unterstützung für Text, Dateien, Bilder mit E2EE-Entschlüsselung, Antwort-Threads, Reaktionen und Bot-Befehle bietet. Die 14 MB große Binärdatei ist unter der MIT-Lizenz lizenziert und funktioniert mit jedem Matrix-Homeserver.

Tandem MCP: Claude Code-Sitzungen von Claude.ai Chat aus ausführen und verwalten
Tandem ist ein Open-Source-MCP-Server, der Claude.ai-Chat mit lokalen Claude Code-Sitzungen verbindet und autonome Codierungsabläufe ohne Kopieren und Einfügen ermöglicht.