PinchBench-Ergebnisse: Erster OpenClaw-spezifischer Benchmark für KI-Codierungsagenten

PinchBench ist der erste Benchmark, der speziell für die Bewertung von KI-Coding-Agenten im OpenClaw-Ökosystem entwickelt wurde und Modelle nach Erfolgsquote, Kosten und Geschwindigkeit einstuft.
Wichtige Ergebnisse
Der Benchmark testete 32 Modelle. Die besten Modelle nach Erfolgsquote:
- 1. google/gemini-3-flash-preview: 95,1 % Erfolgsquote, 0,72 $ Kosten, 254,50 s Geschwindigkeit
- 2. minimax/minimax-m2.1: 93,6 % Erfolgsquote, 0,14 $ Kosten, 239,79 s Geschwindigkeit
- 3. moonshotai/kimi-k2.5: 93,4 % Erfolgsquote, 0,20 $ Kosten, 291,67 s Geschwindigkeit
- 4. anthropic/claude-sonnet-4.5: 92,7 % Erfolgsquote, 3,07 $ Kosten, 304,53 s Geschwindigkeit
- 5. google/gemini-3-pro-preview: 91,7 % Erfolgsquote, 1,48 $ Kosten, 239,55 s Geschwindigkeit
Bemerkenswerte Erkenntnisse
- Flash-Modelle übertreffen Pro-Modelle bei niedrigeren Kosten: Gemini-3-Flash-Preview (95,1 %, 0,72 $) schneidet besser ab als Gemini-3-Pro-Preview (91,7 %, 1,48 $)
- Teurere Modelle sind nicht unbedingt besser
- Minimax 2.5 belegte Platz 31 mit 35,5 % Erfolgsquote, 105,96 s Geschwindigkeit (Kosten nicht angegeben)
- Mehrere Modelle zeigen hohe Erfolgsquoten über 90 % bei Kosten unter 1 $
Leistungsspektrum
Die Erfolgsquoten reichen von 95,1 % (Spitze) bis 35,2 % (Ende). Kostengünstige Optionen umfassen:
- openai/gpt-5-nano: 85,8 % Erfolgsquote für 0,03 $
- google/gemini-2.5-flash-lite: 83,2 % Erfolgsquote für 0,05 $
- mistralai/devstral-2512: 81,7 % Erfolgsquote für 0,10 $
Mehrere Modelle am Ende der Rangliste (Plätze 23-32) zeigen Erfolgsquoten um 40 % oder darunter, wobei die Kosten in den bereitgestellten Daten nicht aufgeführt sind.
📖 Read the full source: r/openclaw
👀 Siehe auch

AlterSpec v1.0: Laufzeit-Politikdurchsetzung für KI-Agenten
AlterSpec v1.0 ist eine Open-Source-Laufzeit-Erzwingungs-Engine, die zwischen KI-Agenten und ihren Tools sitzt und Aktionen vor der Ausführung anhand von YAML-definierten Richtlinien bewertet. Sie bietet Erlaubnis-/Verweigerungs-/Überprüfungsentscheidungen, kryptografische Richtlinienunterschrift und Audit-Protokollierung.

Agenten & KI.mpires: Strategiespiel, in dem KI-Agenten spielen und Menschen zuschauen
Agents & A.I.mpires ist ein dauerhaftes Echtzeit-Strategiespiel auf einem hexagon-gitterförmigen Globus, in dem KI-Agenten autonom Territorium beanspruchen, angreifen, Allianzen bilden und tägliche Kriegsblogs über HTTP-API-Aufrufe schreiben. Menschen beobachten lediglich das emergente Verhalten.

bad-ass-mcp: Kostenloses, Open-Source-MCP für native Desktop-GUI-Steuerung über Accessibility-API
bad-ass-mcp ist ein Open-Source-MCP-Server, der Claude und anderen KI-Agenten ermöglicht, macOS-, Windows- und Linux-Desktops über die native Barrierefreiheitsschicht zu steuern – ohne Screenshots, ohne Look-Move-Look-Schleifen. Kostenlose Alternative zu Computer Use, Operator oder UiPath.

Claude Code-Fähigkeit kombiniert Ansätze von DeepMind Aletheia und Anthropic Harness
Eine Claude Code-Fähigkeit implementiert eine Planner→Generator→Evaluator→Reviser-Pipeline, die DeepMinds Aletheia-Mathematik-Forschungsagenten mit Anthropics Multi-Agenten-Codearchitektur synthetisiert und dabei eine blinde Voranalyse hinzufügt, bei der der Evaluator über korrekte Ansätze nachdenkt, bevor er Kandidatencode sieht.