OpenClaw-Benchmark zeigt: Qwen3.5:27B übertrifft andere lokale LLMs bei Agenten-Aufgaben

Benchmark-Aufbau und Ergebnisse
Ein Nutzer testete 7 lokale Modelle bei 22 realen Agentenaufgaben mit OpenClaw auf einem Raspberry Pi 5 mit einer RTX 3090, die Ollama ausführt. Die Aufgaben umfassten das Lesen von E-Mails, das Planen von Meetings, das Erstellen von Aufgaben, das Erkennen von Phishing, das Behandeln von Fehlern und Browser-Automatisierung.
Der Gewinner mit großem Abstand war qwen3.5:27b-q4_K_M mit 59,4 %. Der Zweitplatzierte (qwen3.5:35b) erreichte nur 23,2 %. Alle anderen Modelle lagen unter 5 %.
Wichtige Erkenntnisse
- Das quantisierte 27B-Modell schlug die größere 35B-Version um das 2,5-fache
- Ein 30B-Modell landete mit 1,6 % auf dem letzten Platz
- Mittleres Denken funktionierte am besten – zu viel Denken schadete der Leistung tatsächlich
- Kein Modell konnte Browser-Automatisierungsaufgaben abschließen
- Der Hauptunterschied zwischen Gewinnern und Verlierern war, ob das Modell Befehlszeilenwerkzeuge finden und nutzen konnte
- Die meisten Modelle konnten nicht einmal grundlegende Werkzeuge wie die E-Mail-Funktion finden
Dieser Benchmark liefert konkrete Daten darüber, wie verschiedene lokale LLMs als KI-Agenten in praktischen Szenarien abschneiden. Die erhebliche Leistungslücke zwischen dem Top-Modell und den anderen deutet darauf hin, dass die Fähigkeit, Werkzeuge zu finden, ein kritischer Engpass für lokale LLM-Agenten ist.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch
Mesh LLM: Verteiltes KI-Computing auf Iroh – LLMs über eigene GPUs ausführen
Mesh LLM vereint vorhandene GPUs mehrerer Rechner und stellt sie als eine OpenAI-kompatible API dar. Modelle werden lokal, per Peer-Routing oder als Pipeline über mehrere Knoten mittels irohs QUIC-Transport verteilt.

Claude Code im großen Maßstab: Wie agentische Suche RAG-Fehlermodi in großen Codebasen vermeidet
Claude Code nutzt agentisches Dateisystem-Traversal anstelle von embeddingsbasiertem RAG und vermeidet so Probleme mit veralteten Indizes. Der Artikel beschreibt fünf Erweiterungspunkte (CLAUDE.md, Hooks, Skills, Plugins, MCP) und die Harness-as-Model-Philosophie für Repos mit mehreren Millionen Zeilen.

Einführung von OneTool MCP: Ein Open-Source-Multitool für Entwickler
OneTool MCP, entwickelt mit Claude AI, bietet Entwicklern über 100 Werkzeuge für Aufgaben wie Websuchen, Bibliotheksaktualisierungen und Dateiverwaltung ohne Werkzeugsteuer oder Kontextverfall.

Claude Auto-Continue: Chrome-Erweiterung automatisiert Unterbrechungen durch das Tool-Use-Limit
Ein Entwickler hat eine kostenlose Chrome-Erweiterung erstellt, die automatisch auf 'Weiter' klickt, wenn Claude nach etwa 20 Werkzeugaufrufen sein Nutzungslimit erreicht, und so manuelle Unterbrechungen in agentenbasierten Arbeitsabläufen eliminiert. Die Erweiterung enthält eine optionale Token-Minimierung und funktioniert über alle Tabs und Fenster hinweg.