Los modelos de código abierto de menos de 100 GB no pueden superar a Claude Haiku en pruebas de programación.

Un análisis reciente de modelos de lenguaje de peso abierto revela una brecha de rendimiento significativa en comparación con Claude Haiku de Anthropic en puntos de referencia de programación. La comparación se realizó utilizando parámetros de prueba específicos y requisitos de memoria.
Metodología de evaluación
La evaluación comparó modelos en dos puntos de referencia de programación: LiveBench (enero de 2026) y Arena Code/WebDev. Las pruebas se realizaron contra Claude Haiku 4.5 con capacidades de pensamiento habilitadas. Los modelos se graficaron según los requisitos de memoria para implementación local.
Especificaciones técnicas
- Cuantización: Q4_K_M
- Longitud de contexto: 32K
- Caché KV: q8_0
- Estimación de VRAM: Calculada usando la calculadora personalizada del autor
Hallazgos clave
Ningún modelo de peso abierto por debajo de 100 GB de memoria se acerca al rendimiento de Claude Haiku en ninguno de los puntos de referencia. El competidor más cercano es Minimax M2.5, que requiere aproximadamente 136 GB de memoria y aproximadamente iguala el rendimiento de Haiku en ambos puntos de referencia.
El análisis destaca la brecha actual entre modelos propietarios y de peso abierto en la categoría por debajo de 100 GB para tareas de programación. El autor expresa frustración con esta limitación y hace un llamado para el desarrollo de modelos más pequeños que al menos puedan igualar las capacidades de Haiku.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Claude Code agrega entrada de voz con funcionalidad de pulsar para hablar.
Claude Code está implementando el modo de voz para aproximadamente el 5% de los usuarios inicialmente, con activación por pulsar y mantener la barra espaciadora. Los tokens de transcripción de voz no cuentan contra los límites de tasa y la función se incluye sin costo adicional.
Golf de Parámetros: Experimento de Investigación en ML Asistido por IA de OpenAI
OpenAI organizó Parameter Golf, una competencia con más de 1,000 participantes y más de 2,000 propuestas, que probó el aprendizaje automático asistido por IA, agentes de codificación, cuantización y diseño novedoso de modelos bajo estrictas restricciones.

NVIDIA lanza la CPU Vera para cargas de trabajo de IA agentica
NVIDIA ha lanzado la CPU Vera, un procesador diseñado específicamente para cargas de trabajo de IA agentica y aprendizaje por refuerzo, afirmando un rendimiento 50% más rápido y el doble de eficiencia en comparación con las CPU tradicionales a escala de rack.

Subsistema de sonido de Linux inundado de correcciones asistidas por IA: IRQ, UAF y peculiaridades
La solicitud de extracción más reciente de Takashi Iwai para Linux 7.1 en sonido muestra muchos parches 'assisted-by' de Claude Code y GPT-5.5, que corrigen el manejo de IRQ de HD-audio, errores UAF y peculiaridades de dispositivos.