PinchBench-Ergebnisse: Erster OpenClaw-spezifischer Benchmark für KI-Codierungsagenten

✍️ OpenClawRadar📅 Veröffentlicht: 8. März 2026🔗 Source
PinchBench-Ergebnisse: Erster OpenClaw-spezifischer Benchmark für KI-Codierungsagenten
Ad

PinchBench ist der erste Benchmark, der speziell für die Bewertung von KI-Coding-Agenten im OpenClaw-Ökosystem entwickelt wurde und Modelle nach Erfolgsquote, Kosten und Geschwindigkeit einstuft.

Wichtige Ergebnisse

Der Benchmark testete 32 Modelle. Die besten Modelle nach Erfolgsquote:

  • 1. google/gemini-3-flash-preview: 95,1 % Erfolgsquote, 0,72 $ Kosten, 254,50 s Geschwindigkeit
  • 2. minimax/minimax-m2.1: 93,6 % Erfolgsquote, 0,14 $ Kosten, 239,79 s Geschwindigkeit
  • 3. moonshotai/kimi-k2.5: 93,4 % Erfolgsquote, 0,20 $ Kosten, 291,67 s Geschwindigkeit
  • 4. anthropic/claude-sonnet-4.5: 92,7 % Erfolgsquote, 3,07 $ Kosten, 304,53 s Geschwindigkeit
  • 5. google/gemini-3-pro-preview: 91,7 % Erfolgsquote, 1,48 $ Kosten, 239,55 s Geschwindigkeit
Ad

Bemerkenswerte Erkenntnisse

  • Flash-Modelle übertreffen Pro-Modelle bei niedrigeren Kosten: Gemini-3-Flash-Preview (95,1 %, 0,72 $) schneidet besser ab als Gemini-3-Pro-Preview (91,7 %, 1,48 $)
  • Teurere Modelle sind nicht unbedingt besser
  • Minimax 2.5 belegte Platz 31 mit 35,5 % Erfolgsquote, 105,96 s Geschwindigkeit (Kosten nicht angegeben)
  • Mehrere Modelle zeigen hohe Erfolgsquoten über 90 % bei Kosten unter 1 $

Leistungsspektrum

Die Erfolgsquoten reichen von 95,1 % (Spitze) bis 35,2 % (Ende). Kostengünstige Optionen umfassen:

  • openai/gpt-5-nano: 85,8 % Erfolgsquote für 0,03 $
  • google/gemini-2.5-flash-lite: 83,2 % Erfolgsquote für 0,05 $
  • mistralai/devstral-2512: 81,7 % Erfolgsquote für 0,10 $

Mehrere Modelle am Ende der Rangliste (Plätze 23-32) zeigen Erfolgsquoten um 40 % oder darunter, wobei die Kosten in den bereitgestellten Daten nicht aufgeführt sind.

📖 Read the full source: r/openclaw

Ad

👀 Siehe auch

PhAIL-Benchmark-Tests testen VLA-Modelle an echten Lagerhaus-Roboteraufgaben
Werkzeuge

PhAIL-Benchmark-Tests testen VLA-Modelle an echten Lagerhaus-Roboteraufgaben

PhAIL ist ein Echt-Roboter-Benchmark, der vier Vision-Language-Action-Modelle bei der Behälter-zu-Behälter-Kommissionierung mit einem Franka FR3 Roboter testet. Das beste Modell erreichte 64 Einheiten pro Stunde, verglichen mit 330 UPH für menschliche Teleoperation und über 1.300 UPH für manuelle menschliche Arbeit.

OpenClawRadar
Claude-File-Recovery: CLI-Tool extrahiert Dateien aus Claude-Code-Sitzungsverlauf
Werkzeuge

Claude-File-Recovery: CLI-Tool extrahiert Dateien aus Claude-Code-Sitzungsverlauf

claude-file-recovery ist ein Python-CLI-Tool und TUI, das JSONL-Sitzungstranskripte aus ~/.claude/projects/ analysiert, um Dateien wiederherzustellen, die von Claude Code erstellt, geändert oder gelesen wurden, einschließlich der punktgenauen Wiederherstellung früherer Dateiversionen.

OpenClawRadar
Tether: Ein MCP-Server zum Austausch von Kontext zwischen KI-Modellen über SQLite
Werkzeuge

Tether: Ein MCP-Server zum Austausch von Kontext zwischen KI-Modellen über SQLite

Tether ist ein Open-Source-Tool, das JSON-Daten auf 28-Byte inhaltsadressierte Handles reduziert, wodurch mehrere KI-Modelle Kontext über eine gemeinsame SQLite-Datenbank teilen können. Es fungiert als MCP-Server und ermöglicht die direkte Kommunikation zwischen Modellen wie Claude und MiniMax ohne Kopieren und Einfügen.

OpenClawRadar
Kriminalteam: Multi-Agent-Orchestrator für OpenClaw — Parallele Code-Überprüfung mit Coder-Agent
Werkzeuge

Kriminalteam: Multi-Agent-Orchestrator für OpenClaw — Parallele Code-Überprüfung mit Coder-Agent

Crime Team v0.1 führt mehrere spezialisierte OpenClaw-Agenten parallel zur Code-Überprüfung aus und integriert die Ergebnisse. Enthält agentenspezifische Modelle, einen Coder-Agenten, der Änderungen anwendet, und eine erneute Prüfschleife. CLI + GUI.

OpenClawRadar