Sicheres Ausführen von llama.cpp nativen Tools (exec_shell_command) mit mehrfacher Sandboxing unter Linux

Das llama.cpp-Projekt hat kürzlich native Tool-Unterstützung zu seinem llama-server hinzugefügt, die es dem Modell ermöglicht, Funktionen wie get_datetime und das mächtige, aber gefährliche exec_shell_command aufzurufen. Ein Reddit-Benutzer hat einen detaillierten Multi-Sandboxing-Workflow veröffentlicht, um exec_shell_command sicher für Aufgaben wie Web-RAG (Abruf von Live-URLs) zu nutzen, ohne das Hostsystem zu gefährden.
Wichtige Details aus der Quelle
- Verwendetes Modell:
Qwen3.6-35B-A3B_MTP-UD-Q8_K_XL.ggufmit MTP spekulativer Dekodierung - Server-Flags:
--jinja --tools get_datetime,exec_shell_command --temp 0.6 --top-p 0.95 --top-k 20 --presence-penalty 1.5 --min-p 0.00 --chat-template-kwargs '{"preserve_thinking":true}' --spec-type draft-mtp --spec-draft-n-max 1 - Multi-Sandboxing-Stack: Firejail + smolvm (Alpine Linux VM) + dedizierter Linux-Benutzer für die Tool-Ausführung
Schritt-für-Schritt-Einrichtung
- Tools in llama-server aktivieren: starten mit
--tools get_datetime,exec_shell_command(zuerst mitget_datetimetesten) - Firejail installieren (z.B.
sudo pacman -S firejailauf Arch) - Isolierten Benutzer erstellen:
sudo useradd -m vmagents; sudo passwd vmagents - Zu
vmagentswechseln und smolvm installieren:curl -sSL https://smolmachines.com/install.sh | bash - Minimale Alpine VM erstellen:
smolvm machine create minivm --image alpine --net
smolvm machine start --name minivm minivm-execerstellen in~vmagents/.local/bin/:
#!/bin/sh smolvm machine start --name minivm >/dev/null firejail smolvm machine exec --name minivm -- $* 2>/dev/null smolvm machine stop --name minivm >/dev/null
Ausführbar machen:chmod +x minivm-execvm-execerstellen im eigenen Benutzer-~/.local/bin/:
#!/bin/sh sudo su - vmagents -c "minivm-exec $*"
Ausführbar machen.- In der llama-Web-Oberfläche das Modell anweisen,
vm-execals Wrapper zu verwenden, z.B.:
Stelle jedem auszuführenden Befehl den Sandbox-Wrapper vm-exec voran. Verwende wget, um Webinhalte abzurufen, und füge die Option "-U Mozilla" als Browser-User-Agent-String hinzu.
Dann bitte es, eine Live-URL abzurufen und den Inhalt zu analysieren.
Wie das Sandboxing funktioniert
Befehle werden in einer temporären Alpine Linux VM (minivm) ausgeführt, die von smolvm erstellt und selbst in eine Firejail-Sandbox eingebettet wird. Dies isoliert Netzwerkzugriff, Dateisystem und Prozessraum. Das vm-exec-Skript auf dem Host ruft die gesamte Kette als Benutzer vmagents auf und verhindert so eine Eskalation in das Home-Verzeichnis des Host-Benutzers oder zu kritischen Systemdateien. Die VM wird nach jedem Befehl gestoppt, sodass kein dauerhafter Zustand von bösartigen Aktionen erhalten bleibt.
Für wen das gedacht ist
Entwickler, die lokale LLM-Server betreiben und sichere Codeausführung oder Web-Fetching über agentische Tools ermöglichen möchten, ohne das Host-Betriebssystem zu gefährden.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Vier aarch64-spezifische Fehlermodi beim Ausführen von vLLM auf Blackwell GB10 mit CUDA 13.0
Ein Entwickler stieß auf vier spezifische Fehlermodi beim Einrichten von vLLM v0.7.1 mit DeepSeek-R1-32B auf einem Blackwell-GB10-System mit aarch64-Architektur und CUDA 13.0, darunter ABI-Inkompatibilitäten und fehlende Abhängigkeiten.

Wie OpenCLAW-Speicher tatsächlich funktioniert: Behebung des Agenten-‚Vergessens‘
OpenCLAW-Agenten verfügen nicht über persistente Erinnerungen zwischen Konversationen – sie rekonstruieren den Kontext aus Dateien wie SOUL.md, USER.md und MEMORY.md in jeder Sitzung neu. Häufige 'Vergessens'-Probleme entstehen durch aufgeblähte Sitzungen, unstrukturierte Speicherdateien und die Verwechslung von Chatverlauf mit dauerhafter Speicherung.

Praktische OpenClaw-Ratschläge: Klein anfangen, häufige Fehler vermeiden
Ein Entwickler teilt Erfahrungen aus dem Aufbau eines persönlichen Gesundheits-Trackers mit OpenClaw und betont einen engen Fokus, deterministische Workflows und die Verwendung eines einzigen LLM. Der Beitrag enthält spezifische Modellbeobachtungen, die ChatGPT und Gemini vergleichen.

Erstellung eines vollständig lokalen Multi-Agenten-Assistenten mit OpenClaw und Ollama
Ein Entwickler teilt seinen Stack für einen vollständig lokalen persönlichen KI-Assistenten mit OpenClaw und Ollama, einschließlich der Modelle qwen3.5:35b-a3b, gemma3:4b, mistral:7b, MCP-Server für Home Assistant und Gmail sowie einer Telegram-Bot-Schnittstelle.