Actualización del Tablero de Líderes de SWE-rebench: Los Resultados de Febrero de 2026 Muestran una Competencia Ajustada

✍️ OpenClawRadar📅 Publicado: 23 de marzo de 2026🔗 Source
Actualización del Tablero de Líderes de SWE-rebench: Los Resultados de Febrero de 2026 Muestran una Competencia Ajustada
Ad

Resultados de SWE-rebench Febrero 2026

El ranking SWE-rebench se ha actualizado con las ejecuciones de febrero de 2026 en 57 nuevas tareas de PR de GitHub. La configuración sigue la metodología estándar de SWE-bench: los modelos leen problemas reales de PR, editan código, ejecutan pruebas y deben hacer pasar toda la suite de pruebas. Las tareas se limitan a PRs creados en el mes anterior.

Ad

Resultados Clave

  • Claude Opus 4.6 se mantiene en la cima con una tasa de resolución del 65.3%, continuando marcando el ritmo con un fuerte pass@5 (~70%)
  • El nivel superior es extremadamente ajustado: gpt-5.2-medium (64.4%), GLM-5 (62.8%) y gpt-5.4-medium (62.8%) están todos a pocos puntos del líder
  • Gemini 3.1 Pro Preview (62.3%) y DeepSeek-V3.2 (60.9%) completan un top-6 muy agrupado
  • Los modelos de código abierto/híbridos siguen mejorando: Qwen3.5-397B (59.9%), Step-3.5-Flash (59.6%) y Qwen3-Coder-Next (54.4%) están reduciendo la brecha, impulsados por un mejor uso de contexto largo y escalabilidad
  • MiniMax M2.5 (54.6%) continúa destacándose como una opción rentable con un rendimiento competitivo

En general, febrero muestra una frontera altamente competitiva con múltiples modelos a pocos puntos del liderazgo.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

OpenClaw organiza su primer AMA: Perspectivas sobre agentes de codificación de IA.
Noticias

OpenClaw organiza su primer AMA: Perspectivas sobre agentes de codificación de IA.

OpenClaw, una figura destacada en agentes de programación de IA, organizó su primera sesión AMA en Reddit. La discusión arrojó luz sobre sus impactos, planes futuros y desafíos.

OpenClawRadar
Colaborador de OpenClaw critica el enfoque del proyecto en la paridad pixel-perfect por sobre características modernas.
Noticias

Colaborador de OpenClaw critica el enfoque del proyecto en la paridad pixel-perfect por sobre características modernas.

Una publicación de Reddit en r/openclaw detalla cómo una solicitud de extracción (PR) de un colaborador que abordaba el escalado de resolución y la compatibilidad con altas tasas de refresco fue rechazada por desviarse de las limitaciones visuales del motor original, generando un debate sobre la dirección del proyecto.

OpenClawRadar
Claude Code 2.1.76 añade solicitud MCP, mejoras en worktree y correcciones para límites de contexto.
Noticias

Claude Code 2.1.76 añade solicitud MCP, mejoras en worktree y correcciones para límites de contexto.

La versión 2.1.76 de Claude Code introduce soporte de elicitación MCP para entrada estructurada durante tareas, añade worktree.sparsePaths para grandes monorepos y corrige errores de 'Límite de contexto alcanzado' en sesiones de 1M de contexto. La versión 2.1.75 estableció ventanas de contexto de 1M por defecto para Opus 4.6 en planes Max, Team y Enterprise.

OpenClawRadar
SAP congela la mayoría de viajes y contrataciones debido al creciente costo de la IA — excepto la IA en sí
Noticias

SAP congela la mayoría de viajes y contrataciones debido al creciente costo de la IA — excepto la IA en sí

SAP suspendió la mayoría de los viajes y contrataciones debido al creciente costo de la IA, con excepciones solo para viajes y contrataciones relacionadas con IA, según un correo interno obtenido por 404 Media.

OpenClawRadar