Resultados de PinchBench: Primer Benchmark Específico de Agentes de IA de Codificación OpenClaw

✍️ OpenClawRadar📅 Publicado: 8 de marzo de 2026🔗 Source
Resultados de PinchBench: Primer Benchmark Específico de Agentes de IA de Codificación OpenClaw
Ad

PinchBench es el primer benchmark diseñado específicamente para evaluar agentes de codificación de IA en el ecosistema OpenClaw, clasificando modelos por tasa de éxito, costo y velocidad.

Resultados Clave

El benchmark evaluó 32 modelos. Los mejores rendimientos por tasa de éxito:

  • 1. google/gemini-3-flash-preview: 95,1% de éxito, $0,72 de costo, 254,50s de velocidad
  • 2. minimax/minimax-m2.1: 93,6% de éxito, $0,14 de costo, 239,79s de velocidad
  • 3. moonshotai/kimi-k2.5: 93,4% de éxito, $0,20 de costo, 291,67s de velocidad
  • 4. anthropic/claude-sonnet-4.5: 92,7% de éxito, $3,07 de costo, 304,53s de velocidad
  • 5. google/gemini-3-pro-preview: 91,7% de éxito, $1,48 de costo, 239,55s de velocidad
Ad

Hallazgos Destacados

  • Los modelos Flash superan a los modelos Pro con menor costo: Gemini-3-Flash-Preview (95,1%, $0,72) supera a Gemini-3-Pro-Preview (91,7%, $1,48)
  • Los modelos más caros no necesariamente tienen mejor rendimiento
  • Minimax 2.5 ocupó el puesto 31 con una tasa de éxito del 35,5%, 105,96s de velocidad (costo no listado)
  • Varios modelos muestran altas tasas de éxito superiores al 90% manteniendo costos inferiores a $1

Rango de Rendimiento

Las tasas de éxito varían del 95,1% (máximo) al 35,2% (mínimo). Las opciones rentables incluyen:

  • openai/gpt-5-nano: 85,8% de éxito por $0,03
  • google/gemini-2.5-flash-lite: 83,2% de éxito por $0,05
  • mistralai/devstral-2512: 81,7% de éxito por $0,10

Varios modelos en la parte inferior de la clasificación (posiciones 23-32) muestran tasas de éxito alrededor del 40% o menos, con costos no listados en los datos proporcionados.

📖 Read the full source: r/openclaw

Ad

👀 Ver también

Claude Code Hook Monitorea la Acumulación de WIP en los Flujos de Trabajo de Codificación con IA
Herramientas

Claude Code Hook Monitorea la Acumulación de WIP en los Flujos de Trabajo de Codificación con IA

Un desarrollador creó un gancho UserPromptSubmit para Claude Code que muestra la acumulación de trabajo en progreso en cuatro colas: cambios sin confirmar de más de 200 líneas, tres o más confirmaciones sin enviar, confirmaciones enviadas sin archivos de conjunto de cambios y PRs de lanzamiento abiertos por más de 24 horas.

OpenClawRadar
Cognithor v0.40.0 añade identidad persistente del agente de IA con restricciones éticas.
Herramientas

Cognithor v0.40.0 añade identidad persistente del agente de IA con restricciones éticas.

Cognithor v0.40.0 presenta el Protocolo de Mente Inmortal, que otorga a los agentes de IA locales una identidad persistente entre sesiones con 7 anclajes éticos integrados y ciclos de sueño para la consolidación de la memoria. La actualización agrega 9,488 líneas de código y se ejecuta 100% localmente.

OpenClawRadar
Contextium: Marco de Contexto Persistente de Código Abierto para Claude Code
Herramientas

Contextium: Marco de Contexto Persistente de Código Abierto para Claude Code

Contextium es un framework de repositorio git estructurado que proporciona contexto persistente para sesiones de Claude Code, utilizando un archivo CLAUDE.md como enrutador de contexto para cargar de forma diferida archivos markdown relevantes. La versión de código abierto incluye una plantilla con 6 aplicaciones de ejemplo y 27 documentos de integración.

OpenClawRadar
🦀
Herramientas

PullMD v2.4.1 añade conector nativo MCP para claude.ai web y autenticación multiusuario

PullMD v2.4.1 ahora admite el diálogo de conector personalizado de claude.ai mediante OAuth 2.1 + PKCE-S256 y añade modos de autenticación multiusuario. Convierte cualquier URL en Markdown limpio a través de MCP autoalojado.

OpenClawRadar