TranslateGemma-12b: La revisión humana detecta el 71% de errores que pasan desapercibidos para las métricas automatizadas

✍️ OpenClawRadar📅 Publicado: 12 de mayo de 2026🔗 Source
TranslateGemma-12b: La revisión humana detecta el 71% de errores que pasan desapercibidos para las métricas automatizadas
Ad

Una auditoría de seguimiento de las traducciones de subtítulos de TranslateGemma-12b revela que las métricas automatizadas subestiman significativamente los errores del mundo real. La evaluación comparativa original mostró que el modelo superaba a los modelos generales de vanguardia (Claude Sonnet, GPT-5.4, DeepSeek, Gemini Flash Lite) en 6 idiomas. Para verificarlo, el equipo agregó revisión humana.

Configuración

  • 21 segmentos de subtítulos en inglés de un video tutorial
  • TranslateGemma-12b tradujo a 4 idiomas: ES, JA, TH, ZH-CN (se eliminaron coreano y chino tradicional)
  • 84 traducciones en total, preseleccionadas por obtener buenos resultados en métricas automatizadas
  • Cada traducción se envió a revisión humana MQM
Ad

Resultados

Según el propio umbral de alerta del panel (MX ≥ 5 O CK < 0,70):

  • Marcado automático: 1/84 (1,2%)
  • Marcado humano (cualquiera): 60/84 (71%)
  • Marcado humano (grave): 13/84 (15%)

Por idioma:

  • ES: 0/21 automático, 11/21 marcado humano, 2/21 grave — en su mayoría inconsistencias de tono (cambios formal/informal), el más fácil de los cuatro
  • JA: 0/21 automático, 17/21 marcado humano, 3/21 grave — patrón de “fluido pero significado incorrecto”; 10 de los 15 errores de traducción en el conjunto de datos. El alto COMETKiwi (media 0,86) ocultó los errores. El mismo modo de fallo observado en Claude Sonnet 4.6 para JA.
  • TH: 0/21 automático, 17/21 marcado humano, 5/21 grave — sobreproducción: 5 errores de Precisión/Adición (insertar contenido que no está en el original), más errores de puntuación por puntos al estilo inglés.
  • ZH-CN: 1/21 automático (error de estilo), 15/21 marcado humano, 3/21 grave — incluyendo omisión de “tienda” que cambia el significado, y traducción inconsistente de “billete” entre segmentos.

De los 25 errores de clase Precisión (mala traducción, omisión, adición, no traducido), todos estaban en el cuadrante ciego a las métricas. Las métricas no detectaron ningún error de precisión.

Conclusión

Auditoría pequeña, un modelo, un conjunto de contenido: las cifras son orientativas. Pero el patrón es claro: las métricas automatizadas por sí solas pasan por alto la mayoría de los problemas reales de traducción, especialmente los errores de precisión. Para trabajar con subtítulos en producción, la revisión humana sigue siendo esencial.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Amazon evade la votación comunitaria de Gilroy para un centro de datos de IA usando reglas de hace 45 años
Noticias

Amazon evade la votación comunitaria de Gilroy para un centro de datos de IA usando reglas de hace 45 años

Amazon comenzó silenciosamente la construcción de un centro de datos de IA de 56 acres en Gilroy, CA, evitando el escrutinio público al adherirse a las reglas de zonificación establecidas hace 45 años. Los residentes quedaron excluidos del período de comentarios.

OpenClawRadar
Ajuste Fino Autosupervisado en Errores Propios Eleva Modelos Pequeños al 80% en HumanEval
Noticias

Ajuste Fino Autosupervisado en Errores Propios Eleva Modelos Pequeños al 80% en HumanEval

Un desarrollador entrenó a Qwen 2.5 7B con sus propios pares de código autogenerados, alcanzando 112/164 en HumanEval (+87 problemas) sin datos de entrenamiento escritos por humanos. El enfoque se transfiere a Llama 3.2 3B y Qwen 3 4B.

OpenClawRadar
GitHub Copilot actualiza la política de uso de datos para el entrenamiento de modelos
Noticias

GitHub Copilot actualiza la política de uso de datos para el entrenamiento de modelos

GitHub utilizará los datos de interacción de los usuarios de Copilot Free, Pro y Pro+ para entrenar modelos de IA a partir del 24 de abril de 2026, a menos que los usuarios opten por no participar. Los usuarios de Copilot Business y Enterprise están exentos de este cambio.

OpenClawRadar
Comparación de referencia de Qwen3.6 Plus con modelos SOTA occidentales
Noticias

Comparación de referencia de Qwen3.6 Plus con modelos SOTA occidentales

Qwen3.6 Plus obtiene 78.8 en SWE-bench Verified, 90.4 en GPQA/GPQA Diamond, 28.8 en HLE (sin herramientas) y 78.8 en MMMU-Pro, posicionándose de manera competitiva frente a modelos como GPT-5.4, Claude Opus 4.6 y Gemini 3.1 Pro Preview.

OpenClawRadar