Claude Opus 4.1 obtiene un 17,75 % en el conjunto de datos privado de SWE-Bench Pro, lo que pone de relieve la brecha entre memorización y razonamiento.

✍️ OpenClawRadar📅 Publicado: 9 de marzo de 2026🔗 Source
Claude Opus 4.1 obtiene un 17,75 % en el conjunto de datos privado de SWE-Bench Pro, lo que pone de relieve la brecha entre memorización y razonamiento.
Ad

Los resultados del benchmark muestran una brecha de rendimiento significativa

Claude Opus 4.1 logró más del 80% en SWE-Bench Verified, pero obtuvo solo 17.75% en el conjunto de datos privado de SWE-Bench Pro. Este conjunto de datos contiene 276 tareas de 18 bases de código de startups propietarias que nunca han estado en GitHub, específicamente diseñadas para eliminar la contaminación de datos a través de repositorios públicos con licencia GPL.

Otros resultados de modelos en el mismo conjunto de datos privado: GPT-5.2 obtuvo 23.81% (encabezando la tabla de clasificación) y Gemini 3 Pro obtuvo 17.95%.

El análisis de trayectoria revela comportamiento de memorización

El análisis de Scale AI encontró que durante las pruebas, los modelos podían identificar las rutas de archivo correctas para modificar antes de leer completamente las descripciones de problemas en repositorios familiares. Esto indica que navegaban por memoria en lugar de razonar a través de los problemas.

El puntaje del 80% en SWE-Bench Verified era real, pero medía una capacidad diferente a la que la mayoría de la gente asumía: principalmente memoria de datos de entrenamiento en lugar de razonamiento sobre código novedoso.

Ad

Implicaciones prácticas para la implementación de herramientas de codificación con IA

Para los desarrolladores que deciden dónde implementar herramientas de codificación con IA en su flujo de trabajo, la distinción entre memoria y razonamiento importa más que los números destacados de los benchmarks. Los modelos que funcionan bien en benchmarks contaminados pueden tener dificultades con bases de código verdaderamente novedosas que no han visto durante el entrenamiento.

SWE-Bench Pro fue creado específicamente para abordar este problema de contaminación utilizando código que nunca ha estado disponible públicamente en GitHub o en conjuntos de datos de entrenamiento.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

Las autoridades estadounidenses declaran el 'extremismo antitecnológico' como una nueva categoría de amenaza en medio del rechazo a la IA
Noticias

Las autoridades estadounidenses declaran el 'extremismo antitecnológico' como una nueva categoría de amenaza en medio del rechazo a la IA

El DHS, el FBI y los centros de fusión están vigilando el 'extremismo violento antitecnología' — una nueva categoría que apunta a protestas, amenazas a centros de datos y disidencia relacionada con la IA bajo las directivas de Trump.

OpenClawRadar
El giro de Meta hacia la IA: Zuckerberg dice que el progreso no es lo suficientemente rápido y que se gastaron 145 mil millones de dólares
Noticias

El giro de Meta hacia la IA: Zuckerberg dice que el progreso no es lo suficientemente rápido y que se gastaron 145 mil millones de dólares

El CEO de Meta, Mark Zuckerberg, dijo al personal que el desarrollo de agentes de IA no se ha acelerado como se esperaba. La compañía gastó $145 mil millones en infraestructura de IA este año y despidió a 8,000 empleados para reorganizarse en torno a la IA.

OpenClawRadar
India's Sarvam and Krutrim build frugal AI models for local needs
Noticias

India's Sarvam and Krutrim build frugal AI models for local needs

Las startups indias Sarvam AI y Krutrim están desarrollando modelos de IA soberanos optimizados para teléfonos inteligentes de gama baja y redes de bajo ancho de banda, con el modelo SarvamM de 24 mil millones de parámetros de Sarvam entrenado en 10 idiomas indios.

OpenClawRadar
Por qué no leeré ficción escrita por LLM: perfiles estadísticos y el problema de la escritura mediana
Noticias

Por qué no leeré ficción escrita por LLM: perfiles estadísticos y el problema de la escritura mediana

Chris McCormick explica por qué evita la ficción generada por LLM, argumentando que su perfil estadístico es demasiado cercano a la mediana, empujando la mente de los lectores hacia lo estadísticamente normal en lugar de lo creativamente único.

OpenClawRadar