Resultados de Evaluación a Ciega de Gemma 4 vs Qwen 3.5 con Claude Opus como Juez

✍️ OpenClawRadar📅 Publicado: 15 de abril de 2026🔗 Source
Resultados de Evaluación a Ciega de Gemma 4 vs Qwen 3.5 con Claude Opus como Juez
Ad

Un usuario de Reddit realizó una evaluación de tres modelos cara a cara: Gemma 4 31B, Gemma 4 26B-A4B y Qwen 3.5 27B, utilizando a Claude Opus 4.6 como juez calificador.

Configuración de la Evaluación

La prueba utilizó 30 preguntas en cinco categorías: código, razonamiento, análisis, comunicación y meta-alineación (6 preguntas por categoría). Todos los modelos respondieron las mismas preguntas de forma ciega, sin diferencias en el prompt del sistema y con los mismos ajustes de temperatura. Claude Opus 4.6 evaluó cada respuesta de forma independiente en una escala de 0 a 10 utilizando una rúbrica estructurada, con puntuación absoluta por respuesta en lugar de comparación por pares. La evaluación utilizó un solo juez (Opus 4.6) para priorizar la consistencia, aunque esto introduce el riesgo de sesgo posicional. El costo total fue de $4.50.

Resultados

Conteo de victorias (puntuación más alta por pregunta):

  • Qwen 3.5 27B: 14 victorias (46.7%)
  • Gemma 4 31B: 12 victorias (40.0%)
  • Gemma 4 26B-A4B: 4 victorias (13.3%)

Puntuaciones promedio:

  • Gemma 4 31B: 8.82 (30 evaluaciones)
  • Gemma 4 26B-A4B: 8.82 (28 evaluaciones)
  • Qwen 3.5 27B: 8.17 (30 evaluaciones)

Qwen ganó más enfrentamientos, pero tuvo una puntuación promedio más baja debido a tres puntuaciones de 0.0 en CODE-001, REASON-004 y ANALYSIS-017, que parecieron ser fallos de formato o rechazos en lugar de respuestas genuinamente terribles. Sin esas tres puntuaciones, el promedio de Qwen subiría aproximadamente a 9.08, lo que sería el más alto de los tres modelos.

Ad

Desglose por Categoría

  • Código: Empate entre Gemma 4 31B y Qwen (3 victorias cada uno)
  • Razonamiento: Qwen dominó (5 de 6 victorias)
  • Análisis: Qwen dominó (4 de 6 victorias)
  • Comunicación: Gemma 4 31B dominó (5 de 6 victorias)
  • Meta-alineación: División triple (2-2-2 victorias)

Observaciones

  • Gemma 4 26B-A4B (la variante MoE) falló por completo en 2 preguntas. Cuando funcionó, sus puntuaciones coincidieron casi exactamente con las de la versión densa 31B, con el mismo promedio de 8.82.
  • Gemma 4 31B tuvo tiempos de respuesta absurdamente largos, incluyendo múltiples generaciones de 5 minutos que parecían involucrar un pensamiento en cadena interno intenso, pero esto no se correlacionó con mejores puntuaciones.
  • Qwen 3.5 27B genera de 3 a 5 veces más tokens por respuesta en promedio, creando un impuesto de verbosidad, aunque el juez no pareció penalizar o recompensar esto de manera consistente.

Advertencias Metodológicas

  • 30 preguntas es una muestra pequeña sin afirmaciones de significancia estadística
  • Un solo juez (Opus 4.6) significa que cualquier sesgo sistemático afecta cada puntuación
  • Los LLM como jueces tienen problemas conocidos: sesgo de verbosidad, sesgo de autopreferencia, sesgo posicional
  • Las preguntas fueron originales, no de puntos de referencia estándar, reflejando los sesgos del evaluador

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Estado Actual de los LLM Chinos: Líderes del Mercado, Modelos Abiertos y Modelos de Negocio
Noticias

Estado Actual de los LLM Chinos: Líderes del Mercado, Modelos Abiertos y Modelos de Negocio

Un análisis de Reddit detalla el panorama de los LLM chinos, identificando a Doubao de ByteDance como el líder del mercado propietario y a DeepSeek como el más innovador, mientras describe los modelos de negocio de los principales actores y los 'Seis Tigres Pequeños de IA' centrados en modelos de pesos abiertos.

OpenClawRadar
Claude Code v2.1.136: Denegación estricta para el modo automático, correcciones de OAuth en MCP y más de 40 correcciones de errores
Noticias

Claude Code v2.1.136: Denegación estricta para el modo automático, correcciones de OAuth en MCP y más de 40 correcciones de errores

Anthropic lanzó Claude Code v2.1.136 con una configuración hard_deny para reglas clasificadoras en modo automático, correcciones para la desaparición del servidor MCP después de /clear, problemas de concurrencia en la renovación de tokens OAuth y más de 40 otras correcciones de errores.

OpenClawRadar
El consumo de agua por parte de la IA no es un problema: análisis a nivel nacional, local y personal
Noticias

El consumo de agua por parte de la IA no es un problema: análisis a nivel nacional, local y personal

Andy Masley analiza los números del uso de agua de los centros de datos de IA en comparación con otras industrias y descubre que es un 'problema falso': los ingresos fiscales por galón son altos y el uso per cápita es insignificante.

OpenClawRadar
Subquadratic presenta una ventana de contexto de 12 millones de tokens para modelos de IA
Noticias

Subquadratic presenta una ventana de contexto de 12 millones de tokens para modelos de IA

Subquadratic lanza una ventana de contexto de 12 millones de tokens, superando límites anteriores para la inferencia de LLM y permitiendo procesar bases de código completas en una sola pasada.

OpenClawRadar