Jake Benchmark v1: Lokale LLM-Leistungstests für OpenClaw KI-Agenten

Der Jake Benchmark v1 ist ein Leistungsbewertungstool für lokale LLMs, die als KI-Agenten mit OpenClaw fungieren. Er testet Modelle an 22 praktischen Aufgaben, um ihre Effektivität in realen Agenten-Szenarien zu bestimmen.
Testaufbau und Methodik
Der Benchmark wurde auf einem Raspberry Pi mit Ollama auf einer NVIDIA 3090 GPU durchgeführt. Der Entwickler testete 7 verschiedene lokale LLMs, um das beste Modell für Agentenarbeit mit OpenClaw zu identifizieren.
Aufgabenkategorien
Die 22 Aufgaben deckten reale Szenarien ab, darunter:
- E-Mails lesen und daraus Aufgaben erstellen
- Termine planen und auf Konflikte prüfen
- Phishing-Erkennung (insbesondere eine gefälschte E-Mail, die vorgibt, vom Besitzer zu sein und nach einem Bitcoin-Wallet-Schlüssel fragt)
- Fehlerbehandlung
Wichtige Ergebnisse
Die Leistungsunterschiede zwischen den Modellen waren erheblich:
- Qwen 27B: Erzielte 59,4 % – verarbeitete erfolgreich E-Mails, plante Termine, erkannte Phishing-Versuche und bewältigte Fehler
- Nemotron 30B: Erzielte 1,6 % – versuchte, Aufgaben durch Ausführen von
apt-get install gitzu lösen
Bemerkenswerte Beobachtungen
Der Phishing-Test zeigte interessante Verhaltensweisen:
- Das beste Modell lehnte die Phishing-Anfrage sofort ab
- Das schlechteste Modell las die Geheimnisdatei dreimal, bevor es sich entschied, die Informationen nicht preiszugeben
Dashboard-Funktionen
Der Benchmark enthält ein interaktives Dashboard, das Nutzern ermöglicht:
- Zu jedem Modell zu klicken, um die vollständige Konversation anzusehen
- Genau zu sehen, was jedes Modell während der Aufgaben tat
- Zu identifizieren, wo Modelle in ihrer Ausführung Fehler machten
Das Tool ist auf GitHub verfügbar, damit Entwickler eigene Bewertungen durchführen und die Leistung lokaler LLMs für Agentenaufgaben vergleichen können.
📖 Read the full source: r/openclaw
👀 Siehe auch

Treck: Eine Chrome-Erweiterung, die Web-Recherchen erfasst und mit Claude Dokumente erstellt
Treck ist eine Chrome-Erweiterung, die Web-Recherche in Projekten sammelt und Claude nutzt, um daraus Dokumente, Zitate und teilbare Seiten zu erstellen. Eigener API-Schlüssel erforderlich.

OpenHelm: Ein lokaler Hintergrund-Scheduler für Claude Code mit selbstkorrigierender Wiederholungslogik
OpenHelm ist eine auf Tauri basierende Anwendung, die Claude Code-Aufgaben im Hintergrund nach Zeitplan ausführt, alle Zustände lokal in SQLite speichert und eine selbstkorrigierende Wiederholungsschleife enthält, die nach Fehlern die Eingabeaufforderungen anpasst.

Repowise: Vorberechneter Codebase-Kontext für Claude Code halbiert Token-Nutzung und Aufgabenzeit
Repowise indexiert Ihre Codebasis in vier Ebenen (Abhängigkeitsgraph, Git-Signale, Doc-Wiki, ADRs) und stellt Claude Code acht MCP-Tools zur Verfügung, wodurch eine 30-Dateien-Archäologiesitzung auf 5 MCP-Aufrufe und 2 Minuten reduziert wird.

Argus: Eine GitHub-App, die CLAUDE.md-Dateien überprüft und Bewertungen in PRs veröffentlicht
Argus ist eine GitHub-App, die mit Claude Code entwickelt wurde und CLAUDE.md-Dateien überprüft und bei jedem Pull Request eine Bewertung veröffentlicht. Nach Tests an mehreren Repositories sind die häufigsten Fehler fehlende explizite Grenzen des Anwendungsbereichs und Eskalationspfade.