Bonsai 2 (Qwen 3.8 27B) als OpenClaw-Fallback: 8 GB, 85 tok/s auf einer 5070
PrismMLs Ternary-Bonsai-2-27B ist ein quantisierter Qwen3-3.8-27B-Build, den ein r/openclaw-Nutzer lokal als OpenClaw-Fallback-Modell betreibt, wenn seine ChatGPT- und Grok-Kontingente aufgebraucht sind. Seine Behauptung: ~8 GB Footprint, 98 % der Qualität des Basis-Qwen3 27B erhalten und Unterstützung für Text plus Vision.
Zahlen aus dem Setup
- Ausgabegeschwindigkeit: 85 tok/s
- Hardware: RTX 5070 mit 16 GB VRAM, 64 GB Systemspeicher
- Festplatten-Footprint: ~8 GB
- Qualitätserhalt: laut Bericht 98 % von Qwen3 3.8 27B
Die zwei GGUFs, die du brauchst
Die Dateien stammen aus dem Repo prism-ml/Ternary-Bonsai-2-27B-gguf auf Hugging Face:
Ternary-Bonsai-2-27B-PQ2_0.gguf (Text) Ternary-Bonsai-2-27B-mmproj-Q8_0.gguf (Vision)
Beide sind erforderlich, wenn du den multimodalen Pfad nutzen willst – die mmproj-Datei ist der Vision-Projektor, die PQ2_0-Datei sind die ternarisierten Textgewichte.
Setup-Hinweise
Bonsai 2 erfordert PrismMLs eigenen Fork von llama.cpp – im Standard-llama.cpp lädt es nicht. Der Autor ließ GPT den Fork auf einer separaten KI-Maschine vom OpenClaw-Host einrichten, wobei das Modell so konfiguriert wurde, dass es:
- dynamisch lädt, wenn OpenClaw es aufruft
- nach 10 Minuten Inaktivität entlädt
- als Fallback dient, wenn GPT 5.6 und Grok ihre Nutzungsgrenzen erreichen
Was es tatsächlich geleistet hat
Das Interessante sind nicht die tok/s – es ist das agentische Verhalten. Laut dem Beitrag bewältigte es Websuche über einen Browser, VM-Steuerung, das Installieren und Nutzen neuer Software und das Ausführen bestehender Workflows, bis zu dem Punkt, an dem der Autor sagt, er „kann nicht erkennen, dass es kein Frontier-Modell ist“.
Das ist der Bericht eines einzelnen Nutzers, kein Benchmark, also behandle die Qualitätsaussagen als anekdotisch. Das Load/Unload-on-Idle-Muster ist die praktische Erkenntnis: Es hält ein lokales 27B nur dann resident, wenn dein bezahlter Anbieter ratenbegrenzt ist, was ein sinnvoller Weg ist, um nicht dauerhaft VRAM auf einer Maschine zu verbrennen, die auch andere Arbeit erledigt.
Wenn du eine GPU mit 16 GB+ VRAM hast, ist das Paar aus PQ2_0 + mmproj klein genug, um es gegen deine eigenen agentischen Aufgaben zu testen, bevor du entscheidest, ob es für dich überzeugt.
📖 Read the full source: r/openclaw
👀 Siehe auch

Garry Tans gstack: Ein Open-Source-AI-Agent-Framework für Claude Code
Garry Tans gstack ist eine Open-Source-Softwarefabrik, die Claude Code in ein virtuelles Engineering-Team verwandelt, mit 13 spezialisierten Slash-Befehlen für Planung, Design, Entwicklung, Review, QA und Release-Management.

Lokale semantische Speichersuche für OpenClaw-Agenten mittels Harrier-Embeddings
Betreiben Sie einen lokalen Embedding-Server mit Microsofts Harrier-Modell, stellen Sie eine Ollama-kompatible API bereit und konfigurieren Sie OpenClaws memorySearch für lokale semantische Gedächtnisabfragen ohne externe Dienste.

Open-Source Artikel-12-Protokollierungsbibliothek für die Einhaltung des EU-KI-Gesetzes
Eine kostenlose, quelloffene TypeScript-Bibliothek für Node.js-Anwendungen mit Vercel AI SDK, die die Protokollierungsanforderungen von Artikel 12 mit ausschließlich anfügbaren JSONL-Protokollen, SHA-256-Hash-Ketten zur Manipulationserkennung und Durchsetzung einer 180-tägigen Aufbewahrungsfrist implementiert.

A2P: Ein MCP-Server, der Engineering-Disziplin für KI-Codierungsagenten durchsetzt
A2P (Architect-to-Product) ist ein KI-Engineering-Framework, das als MCP-Server verpackt ist und einen gated Workflow durchsetzt: Architektur → Plan → Build → Audit → Sicherheit → Deploy, wobei jeder Feature-Slice den Fortschritt RED → GREEN → REFACTOR → SAST → DONE durchlaufen muss.