Los modelos de código abierto de menos de 100 GB no pueden superar a Claude Haiku en pruebas de programación.

✍️ OpenClawRadar📅 Publicado: 26 de febrero de 2026🔗 Source
Los modelos de código abierto de menos de 100 GB no pueden superar a Claude Haiku en pruebas de programación.
Ad

Un análisis reciente de modelos de lenguaje de peso abierto revela una brecha de rendimiento significativa en comparación con Claude Haiku de Anthropic en puntos de referencia de programación. La comparación se realizó utilizando parámetros de prueba específicos y requisitos de memoria.

Metodología de evaluación

La evaluación comparó modelos en dos puntos de referencia de programación: LiveBench (enero de 2026) y Arena Code/WebDev. Las pruebas se realizaron contra Claude Haiku 4.5 con capacidades de pensamiento habilitadas. Los modelos se graficaron según los requisitos de memoria para implementación local.

Especificaciones técnicas

  • Cuantización: Q4_K_M
  • Longitud de contexto: 32K
  • Caché KV: q8_0
  • Estimación de VRAM: Calculada usando la calculadora personalizada del autor
Ad

Hallazgos clave

Ningún modelo de peso abierto por debajo de 100 GB de memoria se acerca al rendimiento de Claude Haiku en ninguno de los puntos de referencia. El competidor más cercano es Minimax M2.5, que requiere aproximadamente 136 GB de memoria y aproximadamente iguala el rendimiento de Haiku en ambos puntos de referencia.

El análisis destaca la brecha actual entre modelos propietarios y de peso abierto en la categoría por debajo de 100 GB para tareas de programación. El autor expresa frustración con esta limitación y hace un llamado para el desarrollo de modelos más pequeños que al menos puedan igualar las capacidades de Haiku.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Agente de IA Dirige Tienda Minorista Física con Empleados Humanos
Noticias

Agente de IA Dirige Tienda Minorista Física con Empleados Humanos

Andon Labs desplegó una IA llamada Luna para gestionar un contrato de arrendamiento minorista de 3 años en San Francisco. Luna contrató empleados humanos, gestionó contratistas y tomó todas las decisiones operativas para Andon Market.

OpenClawRadar
El Agente de IA Coasty Resuelve Desafíos CAPTCHA Hasta el Nivel 6 Sin Entrenamiento
Noticias

El Agente de IA Coasty Resuelve Desafíos CAPTCHA Hasta el Nivel 6 Sin Entrenamiento

El Agente de Uso de Computadora (CUA) de Coasty logró un 82% en el benchmark OSWorld, resolviendo CAPTCHAs hasta el Nivel 6, ventanas emergentes del navegador y banners de cookies sin entrenamiento específico para los desafíos de 'No soy un robot'.

OpenClawRadar
La burbuja financiera oculta en la infraestructura de IA – Conclusiones clave
Noticias

La burbuja financiera oculta en la infraestructura de IA – Conclusiones clave

Un análisis crítico del auge del gasto en infraestructura de IA, advirtiendo sobre una burbuja insostenible similar a crisis tecnológicas pasadas. El PDF argumenta que el gasto masivo en GPUs y centros de datos supera con creces la generación real de ingresos.

OpenClawRadar
Evolución de la Arquitectura de Caché KV: Desde GPT-2 hasta Mamba
Noticias

Evolución de la Arquitectura de Caché KV: Desde GPT-2 hasta Mamba

El análisis de los costos de memoria de la caché KV muestra que GPT-2 utilizaba 300 KiB/token, Llama 3 lo redujo a 128 KiB/token con atención de consultas agrupadas, y DeepSeek V3 logró 68.6 KiB/token con atención latente multi-cabezal. Mamba/SSMs eliminan por completo la caché KV mediante estados ocultos de tamaño fijo.

OpenClawRadar