PinchBench-Ergebnisse: Erster OpenClaw-spezifischer Benchmark für KI-Codierungsagenten

PinchBench ist der erste Benchmark, der speziell für die Bewertung von KI-Coding-Agenten im OpenClaw-Ökosystem entwickelt wurde und Modelle nach Erfolgsquote, Kosten und Geschwindigkeit einstuft.
Wichtige Ergebnisse
Der Benchmark testete 32 Modelle. Die besten Modelle nach Erfolgsquote:
- 1. google/gemini-3-flash-preview: 95,1 % Erfolgsquote, 0,72 $ Kosten, 254,50 s Geschwindigkeit
- 2. minimax/minimax-m2.1: 93,6 % Erfolgsquote, 0,14 $ Kosten, 239,79 s Geschwindigkeit
- 3. moonshotai/kimi-k2.5: 93,4 % Erfolgsquote, 0,20 $ Kosten, 291,67 s Geschwindigkeit
- 4. anthropic/claude-sonnet-4.5: 92,7 % Erfolgsquote, 3,07 $ Kosten, 304,53 s Geschwindigkeit
- 5. google/gemini-3-pro-preview: 91,7 % Erfolgsquote, 1,48 $ Kosten, 239,55 s Geschwindigkeit
Bemerkenswerte Erkenntnisse
- Flash-Modelle übertreffen Pro-Modelle bei niedrigeren Kosten: Gemini-3-Flash-Preview (95,1 %, 0,72 $) schneidet besser ab als Gemini-3-Pro-Preview (91,7 %, 1,48 $)
- Teurere Modelle sind nicht unbedingt besser
- Minimax 2.5 belegte Platz 31 mit 35,5 % Erfolgsquote, 105,96 s Geschwindigkeit (Kosten nicht angegeben)
- Mehrere Modelle zeigen hohe Erfolgsquoten über 90 % bei Kosten unter 1 $
Leistungsspektrum
Die Erfolgsquoten reichen von 95,1 % (Spitze) bis 35,2 % (Ende). Kostengünstige Optionen umfassen:
- openai/gpt-5-nano: 85,8 % Erfolgsquote für 0,03 $
- google/gemini-2.5-flash-lite: 83,2 % Erfolgsquote für 0,05 $
- mistralai/devstral-2512: 81,7 % Erfolgsquote für 0,10 $
Mehrere Modelle am Ende der Rangliste (Plätze 23-32) zeigen Erfolgsquoten um 40 % oder darunter, wobei die Kosten in den bereitgestellten Daten nicht aufgeführt sind.
📖 Read the full source: r/openclaw
👀 Siehe auch

PhAIL-Benchmark-Tests testen VLA-Modelle an echten Lagerhaus-Roboteraufgaben
PhAIL ist ein Echt-Roboter-Benchmark, der vier Vision-Language-Action-Modelle bei der Behälter-zu-Behälter-Kommissionierung mit einem Franka FR3 Roboter testet. Das beste Modell erreichte 64 Einheiten pro Stunde, verglichen mit 330 UPH für menschliche Teleoperation und über 1.300 UPH für manuelle menschliche Arbeit.

Claude-File-Recovery: CLI-Tool extrahiert Dateien aus Claude-Code-Sitzungsverlauf
claude-file-recovery ist ein Python-CLI-Tool und TUI, das JSONL-Sitzungstranskripte aus ~/.claude/projects/ analysiert, um Dateien wiederherzustellen, die von Claude Code erstellt, geändert oder gelesen wurden, einschließlich der punktgenauen Wiederherstellung früherer Dateiversionen.

Tether: Ein MCP-Server zum Austausch von Kontext zwischen KI-Modellen über SQLite
Tether ist ein Open-Source-Tool, das JSON-Daten auf 28-Byte inhaltsadressierte Handles reduziert, wodurch mehrere KI-Modelle Kontext über eine gemeinsame SQLite-Datenbank teilen können. Es fungiert als MCP-Server und ermöglicht die direkte Kommunikation zwischen Modellen wie Claude und MiniMax ohne Kopieren und Einfügen.

Kriminalteam: Multi-Agent-Orchestrator für OpenClaw — Parallele Code-Überprüfung mit Coder-Agent
Crime Team v0.1 führt mehrere spezialisierte OpenClaw-Agenten parallel zur Code-Überprüfung aus und integriert die Ergebnisse. Enthält agentenspezifische Modelle, einen Coder-Agenten, der Änderungen anwendet, und eine erneute Prüfschleife. CLI + GUI.