Umgehung der NemoClaw-Sandbox-Isolierung für den lokalen Nemotron 9B-Agenten

✍️ OpenClawRadar📅 Veröffentlicht: 18. März 2026🔗 Source
Umgehung der NemoClaw-Sandbox-Isolierung für den lokalen Nemotron 9B-Agenten
Ad

Lokale NemoClaw-Umgehung für vollständig lokale Inferenz

Ein Entwickler hat eine Methode dokumentiert, um die Sandbox-Isolation von NVIDIAs NemoClaw zu umgehen und einen vollständig lokalen KI-Agenten auszuführen. NemoClaw, das auf der GTC vorgestellt wurde, ist eine Unternehmens-Sandbox für KI-Agenten, die auf OpenShell (k3s + Landlock + seccomp) basiert und standardmäßig Cloud-API-Verbindungen erwartet sowie lokale Netzwerkverbindungen stark einschränkt.

Ad

Technische Implementierungsdetails

Der Entwickler wollte 100% lokale Inferenz auf WSL2 + RTX 5090 erreichen und durchbrach die Sandbox, um eine vLLM-Instanz zu erreichen. Die Lösung umfasste mehrere Komponenten:

  • Host-iptables-Konfiguration: Erlaubte Datenverkehr von der Docker-Bridge zu vLLM auf Port 8000
  • Pod-TCP-Relay: Benutzerdefinierter Python-Relay im Haupt-Namespace des Pods, der die Sandbox-veth mit der Docker-Bridge verbindet
  • Sandbox-iptables-Injektion: Verwendete nsenter, um eine ACCEPT-Regel in die OUTPUT-Kette der Sandbox einzufügen und die Standard-REJECT-Regel zu umgehen
  • Tool-Aufruf-Übersetzung: Erstellte ein benutzerdefiniertes Gateway, das die Streaming-SSE-Antwort von vLLM abfängt, puffert, die <TOOLCALL>[...]</TOOLCALL>-Textausgabe von Nemotron 9B analysiert und sie in Echtzeit in OpenAI-kompatible tool_calls umschreibt

Diese Konfiguration ermöglicht es opencode innerhalb der Sandbox, Nemotron als vollständig autonomen Agenten zu nutzen. Alles läuft lokal, ohne dass Daten das Gerät verlassen. Das Setup ist flüchtig (WSL2-Neustarts löschen die iptables-Hacks), ermöglicht aber einem 9B-Modell, Terminalbefehle innerhalb eines abgeschotteten Unternehmenscontainers auszuführen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Benchmark-Ergebnisse: Wann Claude Opus mit Codex gegenüber reinem Opus für Code-Generierung verwenden
Werkzeuge

Benchmark-Ergebnisse: Wann Claude Opus mit Codex gegenüber reinem Opus für Code-Generierung verwenden

Ein kontrollierter Benchmark testete den 'Planen mit Opus, Ausführen mit Codex'-Ansatz an drei realen Programmieraufgaben. Die Ergebnisse zeigen einen Kostenschwellenwert bei etwa 600 Codezeilen, mit spezifischen Empfehlungen basierend auf der Projektgröße.

OpenClawRadar
Unsloth und NVIDIA arbeiten zusammen, um das LLM-Training um etwa 25 % zu beschleunigen
Werkzeuge

Unsloth und NVIDIA arbeiten zusammen, um das LLM-Training um etwa 25 % zu beschleunigen

Unsloth und NVIDIA veröffentlichen Optimierungen für das Training großer Sprachmodelle: Caching von Metadaten gepackter Sequenzen (~14,3% Beschleunigung) und doppelt gepuffertes asynchrones Gradienten-Checkpointing (~8% Beschleunigung), ohne Genauigkeitsverlust. Automatisch aktiviert auf RTX-Laptops, Data-Center-GPUs und DGX Spark.

OpenClawRadar
Mehr-Agenten-Inhalts-Pipeline für Claude-Code mit Qualitätssicherungsschleusen
Werkzeuge

Mehr-Agenten-Inhalts-Pipeline für Claude-Code mit Qualitätssicherungsschleusen

Ein Entwickler hat eine Sechs-Agenten-Inhalts-Pipeline für Claude Code erstellt, die Recherche, Schreiben, Bearbeitung und SEO-Aufgaben mit Qualitätsprüfpunkten zwischen den Stufen trennt. Das System stoppt zur manuellen Freigabe vor der Veröffentlichung und ermöglicht das erneute Ausführen einzelner Agenten.

OpenClawRadar
DeepSeek V4 Flash liefert nahe Opus-Qualität für lokale LLMs vor Ort
Werkzeuge

DeepSeek V4 Flash liefert nahe Opus-Qualität für lokale LLMs vor Ort

Reddit-Benutzer berichtet, dass DeepSeek 4 Flash für lokale KI-Agenten mit vertraulichen Daten eine Leistung nahe Opus-Niveau erreicht und einen lokalen Einsatz ohne AWS ermöglicht. Läuft lokal mit NVIDIA-GPUs, aber bei 1M Token immer noch langsam.

OpenClawRadar