Jake Benchmark v1: Lokale LLM-Leistungstests für OpenClaw KI-Agenten

✍️ OpenClawRadar📅 Veröffentlicht: 23. März 2026🔗 Source
Jake Benchmark v1: Lokale LLM-Leistungstests für OpenClaw KI-Agenten
Ad

Der Jake Benchmark v1 ist ein Leistungsbewertungstool für lokale LLMs, die als KI-Agenten mit OpenClaw fungieren. Er testet Modelle an 22 praktischen Aufgaben, um ihre Effektivität in realen Agenten-Szenarien zu bestimmen.

Testaufbau und Methodik

Der Benchmark wurde auf einem Raspberry Pi mit Ollama auf einer NVIDIA 3090 GPU durchgeführt. Der Entwickler testete 7 verschiedene lokale LLMs, um das beste Modell für Agentenarbeit mit OpenClaw zu identifizieren.

Aufgabenkategorien

Die 22 Aufgaben deckten reale Szenarien ab, darunter:

  • E-Mails lesen und daraus Aufgaben erstellen
  • Termine planen und auf Konflikte prüfen
  • Phishing-Erkennung (insbesondere eine gefälschte E-Mail, die vorgibt, vom Besitzer zu sein und nach einem Bitcoin-Wallet-Schlüssel fragt)
  • Fehlerbehandlung

Wichtige Ergebnisse

Die Leistungsunterschiede zwischen den Modellen waren erheblich:

  • Qwen 27B: Erzielte 59,4 % – verarbeitete erfolgreich E-Mails, plante Termine, erkannte Phishing-Versuche und bewältigte Fehler
  • Nemotron 30B: Erzielte 1,6 % – versuchte, Aufgaben durch Ausführen von apt-get install git zu lösen
Ad

Bemerkenswerte Beobachtungen

Der Phishing-Test zeigte interessante Verhaltensweisen:

  • Das beste Modell lehnte die Phishing-Anfrage sofort ab
  • Das schlechteste Modell las die Geheimnisdatei dreimal, bevor es sich entschied, die Informationen nicht preiszugeben

Dashboard-Funktionen

Der Benchmark enthält ein interaktives Dashboard, das Nutzern ermöglicht:

  • Zu jedem Modell zu klicken, um die vollständige Konversation anzusehen
  • Genau zu sehen, was jedes Modell während der Aufgaben tat
  • Zu identifizieren, wo Modelle in ihrer Ausführung Fehler machten

Das Tool ist auf GitHub verfügbar, damit Entwickler eigene Bewertungen durchführen und die Leistung lokaler LLMs für Agentenaufgaben vergleichen können.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

Startup-Buchhalter: Kostenlose Claude-Fähigkeit für die Geschäftsverfolgung kleiner Unternehmen
Werkzeuge

Startup-Buchhalter: Kostenlose Claude-Fähigkeit für die Geschäftsverfolgung kleiner Unternehmen

Startup Bookkeeper ist eine Open-Source-Claude-AI-Fähigkeit, die bootstrapped Gründern hilft, Ausgaben zu verfolgen, indem sie Transaktionen aus einfachen englischen Beschreibungen kategorisiert, Quittungsfotos mit OCR verarbeitet und Dashboards oder Gewinn- und Verlustrechnungen erstellt.

OpenClawRadar
Die Vereinfachung des OpenClaw Hostings: BestClaw behält SSH und benutzerfreundliche Funktionen bei.
Werkzeuge

Die Vereinfachung des OpenClaw Hostings: BestClaw behält SSH und benutzerfreundliche Funktionen bei.

BestClaw präsentiert sich als eine unkomplizierte Lösung für das Hosting von OpenClaw und vereint Benutzerfreundlichkeit mit wichtigem SSH-Zugang, wie auf r/openclaw diskutiert wird.

OpenClawRadar
Show HN: WUPHF — Karpathy-artiges LLM-Wiki mit Markdown + Git als Quelle der Wahrheit
Werkzeuge

Show HN: WUPHF — Karpathy-artiges LLM-Wiki mit Markdown + Git als Quelle der Wahrheit

WUPHF liefert eine Wiki-Schicht für KI-Agenten mit Markdown + Git zur Persistenz, bleve (BM25) + SQLite für die Suche sowie Entity-Fact-Logs, Wikilinks und einem täglichen Lint-Cron. Läuft lokal, noch ohne Vektor-DB-Abhängigkeit.

OpenClawRadar
Orkestra: Kostenbewusste LLM-Routing-Schicht für OpenClaw reduziert API-Kosten um 60–80 %
Werkzeuge

Orkestra: Kostenbewusste LLM-Routing-Schicht für OpenClaw reduziert API-Kosten um 60–80 %

Orkestra ist eine modulare Routing-Schicht, die vor LLM-Aufrufen in OpenClaw sitzt und semantische Klassifizierung nutzt, um Anfragen an Budget-, Balanced- oder Premium-Modellstufen weiterzuleiten. Der Ansatz reduzierte API-Kosten um 60-80 %, ohne Prompt-Umschreibung oder komplexe Regeln.

OpenClawRadar