OpenClaw Lokaler Agent mit TurboQuant-Caching für Mittelklasse-Hardware

Das OpenClaw-Team hat eine One-Click-Anwendung veröffentlicht, die es ermöglicht, lokale agentische Modelle auf Mittelklasse-Hardware wie dem MacBook Air mit 16 GB RAM und dem Mac Mini laufen zu lassen. Die Implementierung adressiert die Herausforderung, anspruchsvolle Agentenmodelle (wie QWEN oder GLM) auf durchschnittlicher Hardware laufen zu lassen, indem sie TurboQuant-Cache-Kompression und einen Kontextvorwärmungsprozess integriert.
Technische Implementierungsdetails
Die Lösung baut auf mehreren Schlüsselkomponenten auf:
- TurboQuant-Caching: Verwendet Tom Turneys llama.cpp TurboQuant-Implementierung, die gepatcht wurde, um korrekt mit agentischem Tool-Calling in QWEN-Modellen zu funktionieren.
- Kontext-Caching/Vorwärmung: Implementiert einen OpenClaw-spezifischen "Aufwärm"-Prozess, der einige Minuten nach dem Modellstart dauert, aber danach eine reibungslose Anfrageverarbeitung auf eingeschränkter Hardware ermöglicht.
- Modellunterstützung: Getestet mit Googles Gemma 4 Reasoning-Modell und QWEN 3.5, wobei beide ähnliche Leistung auf Standard-M4-Maschinen erzielen.
Leistungsbenchmarks
Aus Tests auf einem MacBook Air mit 16 GB Arbeitsspeicher:
- Verarbeitungsgeschwindigkeit: Sowohl Gemma 4 als auch QWEN 3.5 liefern etwa 10-15 Tokens pro Sekunde (tps)
- Geschwindigkeitsvergleich: QWEN zeigt eine leicht schnellere Leistung als Gemma 4
- Reasoning-Leistung: Vergleichbar zwischen den beiden Modellen, obwohl keines für komplexe Aufgaben oder Programmierung an Anthropic-Modelle heranreicht
- Cloud-Vergleich: Antworten sind 2-3 mal langsamer als leistungsstarke Cloud-Modelle
Praktische Anwendungen
Die Implementierung macht lokale Agenten praktikabel für:
- Alltägliche Aufgaben, bei denen Geschwindigkeit nicht kritisch ist
- Hintergrundprozesse auf erschwinglicher Hardware (z.B. 600 $ Mac Mini)
- 24/7 lokale Agentenbereitstellung, die sich innerhalb von Monaten amortisieren kann
Das Team merkt an, dass die Reasoning-Leistung für komplexe Aufgaben zwar noch nicht an erstklassige Cloud-Modelle heranreicht, dies jedoch einen bedeutenden Schritt in Richtung praktischer lokaler Agentenbereitstellung auf Consumer-Hardware darstellt.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Der MemAware-Benchmark zeigt, dass RAG-basierte Agentenspeicher bei der impliziten Kontextabfrage versagen.
Der MemAware-Benchmark testet, ob KI-Agenten relevante frühere Kontexte abrufen können, wenn Nutzer nicht explizit danach fragen. Die Ergebnisse zeigen, dass aktuelle Gedächtnissysteme bei schwierigen impliziten Abfragen nur eine Genauigkeit von 2,8 % erreichen, verglichen mit 0,8 % ohne Gedächtnis.

Open-Source SwiftUI-Testfunktion für Claude Code nutzt Computer Use zur visuellen App-Testung
Eine Open-Source-Fähigkeit für Claude Code namens /ios-test testet SwiftUI-Apps visuell mithilfe der Computer-Use-Fähigkeit. Der Agent findet .xcodeproj-Dateien, baut die App in einem Simulator und navigiert dann durch jeden Bildschirm, tippt auf Buttons und folgt Links wie ein echter Benutzer.

Kostenloses Pharmakovigilanz-Signalerkennungstool, erstellt mit Claude Code
Ein Entwickler hat mit Claude Code eine kostenlose Plattform für Pharmakovigilanz erstellt, die 2,9 Millionen FDA-Berichte über unerwünschte Ereignisse analysiert und statistische Signalerfassung durchführt, für die kommerzielle Plattformen 50.000 bis 500.000 US-Dollar pro Jahr verlangen. Das Tool wird kostenlos auf HuggingFace gehostet.

Multi-Agenten-Handelsratssystem mit GPT-5.1 und Claude 4.6
Ein Entwickler hat ein Multi-Agenten-Handelssystem mit ZagiHQ für die Orchestrierung erstellt, das drei parallele Datenerfassungs-Agenten und drei LLMs (GPT-5.1, Claude 4.6 Opus, Claude 4.6 Sonnet) verwendet, die sich bei Trades einigen müssen. Das System filtert Setups durch Uneinigkeit heraus und erfordert manuelle Genehmigung.