Jake Benchmark v1: Lokale LLM-Leistungstests für OpenClaw KI-Agenten

✍️ OpenClawRadar📅 Veröffentlicht: 23. März 2026🔗 Source
Jake Benchmark v1: Lokale LLM-Leistungstests für OpenClaw KI-Agenten
Ad

Der Jake Benchmark v1 ist ein Leistungsbewertungstool für lokale LLMs, die als KI-Agenten mit OpenClaw fungieren. Er testet Modelle an 22 praktischen Aufgaben, um ihre Effektivität in realen Agenten-Szenarien zu bestimmen.

Testaufbau und Methodik

Der Benchmark wurde auf einem Raspberry Pi mit Ollama auf einer NVIDIA 3090 GPU durchgeführt. Der Entwickler testete 7 verschiedene lokale LLMs, um das beste Modell für Agentenarbeit mit OpenClaw zu identifizieren.

Aufgabenkategorien

Die 22 Aufgaben deckten reale Szenarien ab, darunter:

  • E-Mails lesen und daraus Aufgaben erstellen
  • Termine planen und auf Konflikte prüfen
  • Phishing-Erkennung (insbesondere eine gefälschte E-Mail, die vorgibt, vom Besitzer zu sein und nach einem Bitcoin-Wallet-Schlüssel fragt)
  • Fehlerbehandlung

Wichtige Ergebnisse

Die Leistungsunterschiede zwischen den Modellen waren erheblich:

  • Qwen 27B: Erzielte 59,4 % – verarbeitete erfolgreich E-Mails, plante Termine, erkannte Phishing-Versuche und bewältigte Fehler
  • Nemotron 30B: Erzielte 1,6 % – versuchte, Aufgaben durch Ausführen von apt-get install git zu lösen
Ad

Bemerkenswerte Beobachtungen

Der Phishing-Test zeigte interessante Verhaltensweisen:

  • Das beste Modell lehnte die Phishing-Anfrage sofort ab
  • Das schlechteste Modell las die Geheimnisdatei dreimal, bevor es sich entschied, die Informationen nicht preiszugeben

Dashboard-Funktionen

Der Benchmark enthält ein interaktives Dashboard, das Nutzern ermöglicht:

  • Zu jedem Modell zu klicken, um die vollständige Konversation anzusehen
  • Genau zu sehen, was jedes Modell während der Aufgaben tat
  • Zu identifizieren, wo Modelle in ihrer Ausführung Fehler machten

Das Tool ist auf GitHub verfügbar, damit Entwickler eigene Bewertungen durchführen und die Leistung lokaler LLMs für Agentenaufgaben vergleichen können.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Treck: Eine Chrome-Erweiterung, die Web-Recherchen erfasst und mit Claude Dokumente erstellt
Werkzeuge

Treck: Eine Chrome-Erweiterung, die Web-Recherchen erfasst und mit Claude Dokumente erstellt

Treck ist eine Chrome-Erweiterung, die Web-Recherche in Projekten sammelt und Claude nutzt, um daraus Dokumente, Zitate und teilbare Seiten zu erstellen. Eigener API-Schlüssel erforderlich.

OpenClawRadar
OpenHelm: Ein lokaler Hintergrund-Scheduler für Claude Code mit selbstkorrigierender Wiederholungslogik
Werkzeuge

OpenHelm: Ein lokaler Hintergrund-Scheduler für Claude Code mit selbstkorrigierender Wiederholungslogik

OpenHelm ist eine auf Tauri basierende Anwendung, die Claude Code-Aufgaben im Hintergrund nach Zeitplan ausführt, alle Zustände lokal in SQLite speichert und eine selbstkorrigierende Wiederholungsschleife enthält, die nach Fehlern die Eingabeaufforderungen anpasst.

OpenClawRadar
Repowise: Vorberechneter Codebase-Kontext für Claude Code halbiert Token-Nutzung und Aufgabenzeit
Werkzeuge

Repowise: Vorberechneter Codebase-Kontext für Claude Code halbiert Token-Nutzung und Aufgabenzeit

Repowise indexiert Ihre Codebasis in vier Ebenen (Abhängigkeitsgraph, Git-Signale, Doc-Wiki, ADRs) und stellt Claude Code acht MCP-Tools zur Verfügung, wodurch eine 30-Dateien-Archäologiesitzung auf 5 MCP-Aufrufe und 2 Minuten reduziert wird.

OpenClawRadar
Argus: Eine GitHub-App, die CLAUDE.md-Dateien überprüft und Bewertungen in PRs veröffentlicht
Werkzeuge

Argus: Eine GitHub-App, die CLAUDE.md-Dateien überprüft und Bewertungen in PRs veröffentlicht

Argus ist eine GitHub-App, die mit Claude Code entwickelt wurde und CLAUDE.md-Dateien überprüft und bei jedem Pull Request eine Bewertung veröffentlicht. Nach Tests an mehreren Repositories sind die häufigsten Fehler fehlende explizite Grenzen des Anwendungsbereichs und Eskalationspfade.

OpenClawRadar