OpenClaw-Benchmark zeigt: Qwen3.5:27B übertrifft andere lokale LLMs bei Agenten-Aufgaben

Benchmark-Aufbau und Ergebnisse
Ein Nutzer testete 7 lokale Modelle bei 22 realen Agentenaufgaben mit OpenClaw auf einem Raspberry Pi 5 mit einer RTX 3090, die Ollama ausführt. Die Aufgaben umfassten das Lesen von E-Mails, das Planen von Meetings, das Erstellen von Aufgaben, das Erkennen von Phishing, das Behandeln von Fehlern und Browser-Automatisierung.
Der Gewinner mit großem Abstand war qwen3.5:27b-q4_K_M mit 59,4 %. Der Zweitplatzierte (qwen3.5:35b) erreichte nur 23,2 %. Alle anderen Modelle lagen unter 5 %.
Wichtige Erkenntnisse
- Das quantisierte 27B-Modell schlug die größere 35B-Version um das 2,5-fache
- Ein 30B-Modell landete mit 1,6 % auf dem letzten Platz
- Mittleres Denken funktionierte am besten – zu viel Denken schadete der Leistung tatsächlich
- Kein Modell konnte Browser-Automatisierungsaufgaben abschließen
- Der Hauptunterschied zwischen Gewinnern und Verlierern war, ob das Modell Befehlszeilenwerkzeuge finden und nutzen konnte
- Die meisten Modelle konnten nicht einmal grundlegende Werkzeuge wie die E-Mail-Funktion finden
Dieser Benchmark liefert konkrete Daten darüber, wie verschiedene lokale LLMs als KI-Agenten in praktischen Szenarien abschneiden. Die erhebliche Leistungslücke zwischen dem Top-Modell und den anderen deutet darauf hin, dass die Fähigkeit, Werkzeuge zu finden, ein kritischer Engpass für lokale LLM-Agenten ist.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Das Claude-switch CLI-Tool automatisiert das Wechseln zwischen Claude Max-Konten, wenn Nutzungslimits erreicht werden.
Ein Entwickler hat claude-switch erstellt, ein 250-zeiliges Bash-CLI-Tool, das Claude Code-Anmeldedaten aus dem macOS Keychain speichert und wiederherstellt, um zwischen Konten zu wechseln, wenn eines Nutzungslimits erreicht. Das Tool eliminiert die erneute Browser-Authentifizierung und erhält die Arbeitsablaufkontinuität.

**Claude Code Routines: Planen und Ausführen von Agenten-Aufgaben wie mit Cron, inkl. logischer Entscheidungsfindung** Oder kürzer und prägnanter: **Claude Code Routines: Agenten-Aufgaben wie mit Cron planen – mit logischer Entscheidungsfindung**
Mit Claude Code Routines können Sie Agentenaufgaben planen, ohne eine Sitzung offen halten zu müssen. Ein Reddit-Nutzer teilt konkrete Beispiele: nächtliche Commit-Überprüfung, wöchentlicher Abhängigkeitscheck, tägliche Fehlerlog-Analyse – mit KI-Schlussfolgerungen statt roher Skriptausgabe.

Zwei MCP-Tools für Claude Code: Ideenvalidierung und Trading-Agent-Speicher
Ein Entwickler hat zwei MCP-Tools für Claude Code erstellt: idea-reality-mcp prüft GitHub und Hacker News vor dem Programmieren, um Duplikate zu vermeiden, während tradememory-protocol Speicher für KI-Handelsagenten bereitstellt, um Trades mit Kontext zu speichern und die Strategieleistung zu verfolgen. Beide sind Open Source und auf PyPI verfügbar.

OpenClaw als Infrastructure-as-Code-Schnittstelle für die Verwaltung von Home-Labs
OpenClaw hat sich von einem coolen KI-Gadget zur primären Schnittstelle für die Computerverwaltung entwickelt, insbesondere bei Home-Lab-Rebuilds und Upgrades. Das Tool arbeitet in seiner eigenen VM und bietet gleichzeitig direkten Zugriff auf die Infrastruktur Ihres Computers.