Resultados de PinchBench: Primer Benchmark Específico de Agentes de IA de Codificación OpenClaw

PinchBench es el primer benchmark diseñado específicamente para evaluar agentes de codificación de IA en el ecosistema OpenClaw, clasificando modelos por tasa de éxito, costo y velocidad.
Resultados Clave
El benchmark evaluó 32 modelos. Los mejores rendimientos por tasa de éxito:
- 1. google/gemini-3-flash-preview: 95,1% de éxito, $0,72 de costo, 254,50s de velocidad
- 2. minimax/minimax-m2.1: 93,6% de éxito, $0,14 de costo, 239,79s de velocidad
- 3. moonshotai/kimi-k2.5: 93,4% de éxito, $0,20 de costo, 291,67s de velocidad
- 4. anthropic/claude-sonnet-4.5: 92,7% de éxito, $3,07 de costo, 304,53s de velocidad
- 5. google/gemini-3-pro-preview: 91,7% de éxito, $1,48 de costo, 239,55s de velocidad
Hallazgos Destacados
- Los modelos Flash superan a los modelos Pro con menor costo: Gemini-3-Flash-Preview (95,1%, $0,72) supera a Gemini-3-Pro-Preview (91,7%, $1,48)
- Los modelos más caros no necesariamente tienen mejor rendimiento
- Minimax 2.5 ocupó el puesto 31 con una tasa de éxito del 35,5%, 105,96s de velocidad (costo no listado)
- Varios modelos muestran altas tasas de éxito superiores al 90% manteniendo costos inferiores a $1
Rango de Rendimiento
Las tasas de éxito varían del 95,1% (máximo) al 35,2% (mínimo). Las opciones rentables incluyen:
- openai/gpt-5-nano: 85,8% de éxito por $0,03
- google/gemini-2.5-flash-lite: 83,2% de éxito por $0,05
- mistralai/devstral-2512: 81,7% de éxito por $0,10
Varios modelos en la parte inferior de la clasificación (posiciones 23-32) muestran tasas de éxito alrededor del 40% o menos, con costos no listados en los datos proporcionados.
📖 Read the full source: r/openclaw
👀 Ver también

Claude Code Hook Monitorea la Acumulación de WIP en los Flujos de Trabajo de Codificación con IA
Un desarrollador creó un gancho UserPromptSubmit para Claude Code que muestra la acumulación de trabajo en progreso en cuatro colas: cambios sin confirmar de más de 200 líneas, tres o más confirmaciones sin enviar, confirmaciones enviadas sin archivos de conjunto de cambios y PRs de lanzamiento abiertos por más de 24 horas.

Cognithor v0.40.0 añade identidad persistente del agente de IA con restricciones éticas.
Cognithor v0.40.0 presenta el Protocolo de Mente Inmortal, que otorga a los agentes de IA locales una identidad persistente entre sesiones con 7 anclajes éticos integrados y ciclos de sueño para la consolidación de la memoria. La actualización agrega 9,488 líneas de código y se ejecuta 100% localmente.

Contextium: Marco de Contexto Persistente de Código Abierto para Claude Code
Contextium es un framework de repositorio git estructurado que proporciona contexto persistente para sesiones de Claude Code, utilizando un archivo CLAUDE.md como enrutador de contexto para cargar de forma diferida archivos markdown relevantes. La versión de código abierto incluye una plantilla con 6 aplicaciones de ejemplo y 27 documentos de integración.
PullMD v2.4.1 añade conector nativo MCP para claude.ai web y autenticación multiusuario
PullMD v2.4.1 ahora admite el diálogo de conector personalizado de claude.ai mediante OAuth 2.1 + PKCE-S256 y añade modos de autenticación multiusuario. Convierte cualquier URL en Markdown limpio a través de MCP autoalojado.