Ausführen von NemoClaw mit lokalem vLLM: Setup-Notizen und Beobachtungen zum Agent-Engineering

Lokale NemoClaw-Einrichtung mit vLLM
Ein Entwickler teilte seine Erfahrungen mit der Ausführung von NVIDIAs NemoClaw, einer sandboxed AI-Agentenplattform, mit einem lokalen Nemotron 9B v2-Modell unter Verwendung von vLLM auf WSL2. Das Setup basiert auf jieunl24s Fork von NemoClaw.
Wichtige technische Details
Inferenz-Routing: Das Inferenz-Routing von NemoClaw folgt einem klaren Pfad: inference.local → gateway → vLLM. Anfängliche Onboarding-Fehler erforderten jedoch einen 3-Schichten-Netzwerk-Hack, der inzwischen über PR #412 behoben wurde.
Parser-Kompatibilität: Die integrierten vLLM-Parser (qwen3_coder, nemotron_v3) sind mit Nemotron v2-Modellen inkompatibel. Stattdessen benötigen Sie die offiziellen Plugin-Parser von NVIDIA aus dem NeMo-Repository.
Kluft in der Agentenentwicklung: OpenClaw als Agentenplattform bietet eine solide Infrastruktur, wird jedoch mit minimaler Prompt-Engineering ausgeliefert. Die Kluft zwischen "Modell liefert Text" und "Agent leistet nützliche Arbeit" betrifft in erster Linie das Gerüst und nicht die Fähigkeitsgrenzen des Modells.
Ressourcen
- Blogbeitrag zu Architektur, vLLM-Parser-Einrichtung und Beobachtungen zur Agentenentwicklung: https://github.com/soy-tuber/nemoclaw-local-inference-guide/blob/master/BLOG-openclaw-agent-engineering.md
- Einrichtungsanleitung (V2) mit inference.local-Routing und ohne Netzwerk-Hacks: https://github.com/soy-tuber/nemoclaw-local-inference-guide
- Originales NemoClaw-Issue #315: https://github.com/NVIDIA/NemoClaw/issues/315
Dieses Setup demonstriert die praktische lokale Bereitstellung von AI-Agentenplattformen und hebt sowohl die technischen Implementierungsdetails als auch die anhaltenden Herausforderungen in der Agentenentwicklung hervor.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Open-Source-Go-Port der Claude Code CLI als claw-code-go veröffentlicht
Entwickler dolm09 hat claw-code-go veröffentlicht, einen vollständigen Go-Port des Claude Code CLI mit einer eigenständigen Binärdatei unter 10.000 Codezeilen. Das Projekt umfasst eine TUI mit bubbletea, Multi-Provider-Unterstützung, MCP-Client und eine Tool-Ausführungs-Engine.

Cursors Ansatz für schnelle Regex-Suche für KI-Agenten
Cursor entwickelt eine indexierte Regex-Suche, um Leistungsprobleme in großen Monorepos zu beheben, bei denen ripgrep über 15 Sekunden benötigen kann. Dabei werden invertierte Indizes mit N-Grammen verwendet, basierend auf der Forschung von Zobel, Moffat und Sacks-Davis aus dem Jahr 1993.

Semble: Ein lokaler MCP-Server für Claude Code mit 98% Token-Reduktion
Semble ist ein Open-Source-MCP-Server für Claude Code, der grep+read-Workflows ersetzt und Embeddings, BM25 sowie Reranking nutzt, um den Tokenverbrauch um ~98% zu senken, während Repos in ~250ms indiziert werden.

Claude Compact Guard Plugin verwendet neuen PostCompact-Hook, um Kontext zu erhalten
Ein Entwickler hat claude-compact-guard veröffentlicht, ein Plugin, das automatisch kritischen Kontext speichert, bevor Claudes /compact-Befehl ihn zerstört, und anschließend alles wieder einfügt. Es nutzt den vor 4 Tagen veröffentlichten PostCompact-Hook von Anthropic.