Open-Source Benchmark Runner zum Testen von OpenClaw-Agenten in realen Workflows

✍️ OpenClawRadar📅 Veröffentlicht: 14. Mai 2026🔗 Source
Open-Source Benchmark Runner zum Testen von OpenClaw-Agenten in realen Workflows
Ad

Ein Reddit-Nutzer hat ein Open-Source-Tool namens personal_agent_eval (Repo: github.com/javiersgjavi/personal_agent_eval) veröffentlicht, um OpenClaw-Agenten an realistischen, unübersichtlichen Workflows zu benchmarken – nicht an öffentlichen Spielzeugdatensätzen.

Workflow

Definieren Sie Testfälle als YAML-Dateien mit:

  • Eingabenachrichten
  • Erwarteten Artefakten
  • Bewertungskriterien
  • Deterministischen Prüfungen
  • Ausführungs- und Bewerterprofilen

Der Ausführer führt Fälle gegen eine echte OpenClaw-Instanz aus, speichert Ausgaben, bewertet Ausführungen und erstellt Berichte und Diagramme.

Hauptfunktion: Import realer Workspaces

Sie können Ihren tatsächlichen OpenClaw-Workspace importieren – einschließlich Speicher, Fähigkeiten, Dateien, Prompts und Kontext – statt einer abgespeckten Nachbildung. Der Agent läuft in einer echten OpenClaw-Instanz und testet genau den Agenten, den Sie täglich verwenden.

Private Bewertungssets

Der Autor veröffentlicht seine privaten Bewertungssets explizit nicht, um zu vermeiden, dass öffentliche Benchmarks veralten. Das Repo enthält jedoch Beispiel-Fälle, Konfigurationen, Bewertungsprofile, deterministische Prüfungen und Diagrammerstellung, sodass Sie Ihre eigene private Suite aufbauen können.

Ad

SKILL.md zur Agentenunterstützung

Eine SKILL.md-Datei im Repo soll einem Agenten genügend Kontext geben, um Ihnen bei der Definition neuer Benchmark-Fälle, Ausführungsprofile, Bewertungskriterien und deterministischer Prüfungen zu helfen – und reduziert manuelle Bearbeitung.

Beispielergebnisse (Private Ausführung des Autors)

Der Autor teilte einen Einzellauf-Vergleich (Metrik unklar, wahrscheinlich gewichteter Durchschnitt 0-10):

Claude Opus 4.6 - 9.44
GLM 5.1 - 9.31
GPT-5.5 - 9.31
Claude Sonnet 4.6 - 9.25
DeepSeek V4 Flash - 8.61
Gemma 4 31B - 8.39
DeepSeek V4 Pro - 8.28
Kimi K2.6 - 7.97

Interessanter als die Bewertungen: Fehlermodi. Manche Modelle argumentieren gut, sind aber unbeholfen im Umgang mit Werkzeugen; günstigere Modelle verschlechtern sich bei langen oder zustandsbehafteten Aufgaben; einige Fehler sind modellbedingt, andere sind OpenClaw-/Tooling-Grenzfälle, die durch das Benchmark aufgedeckt werden.

Für wen es gedacht ist

OpenClaw-Nutzer, die Agenten für reale Arbeit einsetzen und Modelle an ihren eigenen privaten Aufgaben vergleichen möchten, statt aufgrund von Bauchgefühl oder generischen Ranglisten zu argumentieren.

📖 Lesen Sie die vollständige Quelle: r/openclaw

Ad

👀 Siehe auch

LiteParse: Schneller Open-Source-Dokumentenparser für KI-Agenten
Werkzeuge

LiteParse: Schneller Open-Source-Dokumentenparser für KI-Agenten

LiteParse ist ein Open-Source-Dokumentenparser, der räumliche Textanalyse mit Begrenzungsrahmen bietet, lokal ohne GPUs läuft und PDFs, Office-Dokumente und Bilder unterstützt. Er kann als Fähigkeit für über 40 KI-Agenten installiert werden, darunter Claude Code, Cursor und OpenClaw.

OpenClawRadar
Claude Code Container bietet Zero-Config Docker-Isolation für Claude Code
Werkzeuge

Claude Code Container bietet Zero-Config Docker-Isolation für Claude Code

Claude Code Container (ccc) ist ein kostenloses, quelloffenes Tool, das automatisch Docker-Container pro Projekt für Claude Code mit vollständiger Isolation und ohne Konfiguration erstellt. Es leitet Host-Umgebungsvariablen weiter, bindet SSH-Schlüssel ein, bietet transparenten localhost-Proxy und enthält Chromium mit vorkonfiguriertem chrome-devtools MCP.

OpenClawRadar
Aurelius: Ein React-Framework, entwickelt mit 48 Claude Code Agents und einer Figma-zu-React-Pipeline
Werkzeuge

Aurelius: Ein React-Framework, entwickelt mit 48 Claude Code Agents und einer Figma-zu-React-Pipeline

Aurelius ist ein Open-Source-React-Framework, das 48 hierarchisch organisierte Claude-Code-Agenten nutzt, um autonom React-Anwendungen aus Figma-Designs zu erstellen. Das Framework erzwingt TDD, visuelle QA mit Pixel-Differenz-Vergleich und Qualitätskontrollen vor dem Deployment.

OpenClawRadar
Portable Mind Format (PMF): Anbieterunabhängige Agentenspezifikation mit 15 Open-Source-Agenten
Werkzeuge

Portable Mind Format (PMF): Anbieterunabhängige Agentenspezifikation mit 15 Open-Source-Agenten

Das Portable Mind Format (PMF) ist eine JSON-basierte Spezifikation zur Definition von KI-Agenten-Identitäten, die über mehrere Modelle und Anbieter hinweg laufen können, einschließlich Claude, GPT-4, Gemini, DeepSeek und lokaler Modelle via Ollama. Es enthält 15 MIT-lizenzierte Produktionsagenten und Konverter für Claude Code, Cursor, GitHub Copilot und Gemini CLI.

OpenClawRadar