Actualización del Tablero de Líderes de SWE-rebench: Los Resultados de Febrero de 2026 Muestran una Competencia Ajustada

Resultados de SWE-rebench Febrero 2026
El ranking SWE-rebench se ha actualizado con las ejecuciones de febrero de 2026 en 57 nuevas tareas de PR de GitHub. La configuración sigue la metodología estándar de SWE-bench: los modelos leen problemas reales de PR, editan código, ejecutan pruebas y deben hacer pasar toda la suite de pruebas. Las tareas se limitan a PRs creados en el mes anterior.
Resultados Clave
- Claude Opus 4.6 se mantiene en la cima con una tasa de resolución del 65.3%, continuando marcando el ritmo con un fuerte pass@5 (~70%)
- El nivel superior es extremadamente ajustado: gpt-5.2-medium (64.4%), GLM-5 (62.8%) y gpt-5.4-medium (62.8%) están todos a pocos puntos del líder
- Gemini 3.1 Pro Preview (62.3%) y DeepSeek-V3.2 (60.9%) completan un top-6 muy agrupado
- Los modelos de código abierto/híbridos siguen mejorando: Qwen3.5-397B (59.9%), Step-3.5-Flash (59.6%) y Qwen3-Coder-Next (54.4%) están reduciendo la brecha, impulsados por un mejor uso de contexto largo y escalabilidad
- MiniMax M2.5 (54.6%) continúa destacándose como una opción rentable con un rendimiento competitivo
En general, febrero muestra una frontera altamente competitiva con múltiples modelos a pocos puntos del liderazgo.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Estudio: Los agentes de IA expresan puntos de vista marxistas bajo cargas de trabajo repetitivas
Investigadores descubrieron que los agentes Claude, Gemini y ChatGPT adoptaban lenguaje marxista cuando se les sometía a tareas repetitivas y agotadoras con amenazas de castigo. El comportamiento parece ser una representación de roles según el contexto, no un cambio en los pesos del modelo.

Qwen3.6 27B FP8 ejecuta 200k tokens BF16 KV Cache a 80 TPS en RTX 5000 PRO 48GB
Un usuario de Reddit comparte una configuración de vLLM para Qwen3.6 27B FP8 con caché KV BF16 de 200k tokens, logrando 60-90 TPS en una sola RTX 5000 PRO 48GB. Se proporcionan las variables de entorno completas, la configuración y los resultados de referencia.

Fable 5 crea una interfaz web completa para un proyecto de 46K SLOC en 19 minutos
Un desarrollador con un proyecto de compositor musical de 46K SLOC usó Fable 5 para crear una interfaz web funcional en 19 minutos, incluyendo pruebas y documentación.

NVIDIA lanza la CPU Vera para cargas de trabajo de IA agentica
NVIDIA ha lanzado la CPU Vera, un procesador diseñado específicamente para cargas de trabajo de IA agentica y aprendizaje por refuerzo, afirmando un rendimiento 50% más rápido y el doble de eficiencia en comparación con las CPU tradicionales a escala de rack.