TranslateGemma-12b: La revisión humana detecta el 71% de errores que pasan desapercibidos para las métricas automatizadas

Una auditoría de seguimiento de las traducciones de subtítulos de TranslateGemma-12b revela que las métricas automatizadas subestiman significativamente los errores del mundo real. La evaluación comparativa original mostró que el modelo superaba a los modelos generales de vanguardia (Claude Sonnet, GPT-5.4, DeepSeek, Gemini Flash Lite) en 6 idiomas. Para verificarlo, el equipo agregó revisión humana.
Configuración
- 21 segmentos de subtítulos en inglés de un video tutorial
- TranslateGemma-12b tradujo a 4 idiomas: ES, JA, TH, ZH-CN (se eliminaron coreano y chino tradicional)
- 84 traducciones en total, preseleccionadas por obtener buenos resultados en métricas automatizadas
- Cada traducción se envió a revisión humana MQM
Resultados
Según el propio umbral de alerta del panel (MX ≥ 5 O CK < 0,70):
- Marcado automático: 1/84 (1,2%)
- Marcado humano (cualquiera): 60/84 (71%)
- Marcado humano (grave): 13/84 (15%)
Por idioma:
- ES: 0/21 automático, 11/21 marcado humano, 2/21 grave — en su mayoría inconsistencias de tono (cambios formal/informal), el más fácil de los cuatro
- JA: 0/21 automático, 17/21 marcado humano, 3/21 grave — patrón de “fluido pero significado incorrecto”; 10 de los 15 errores de traducción en el conjunto de datos. El alto COMETKiwi (media 0,86) ocultó los errores. El mismo modo de fallo observado en Claude Sonnet 4.6 para JA.
- TH: 0/21 automático, 17/21 marcado humano, 5/21 grave — sobreproducción: 5 errores de Precisión/Adición (insertar contenido que no está en el original), más errores de puntuación por puntos al estilo inglés.
- ZH-CN: 1/21 automático (error de estilo), 15/21 marcado humano, 3/21 grave — incluyendo omisión de “tienda” que cambia el significado, y traducción inconsistente de “billete” entre segmentos.
De los 25 errores de clase Precisión (mala traducción, omisión, adición, no traducido), todos estaban en el cuadrante ciego a las métricas. Las métricas no detectaron ningún error de precisión.
Conclusión
Auditoría pequeña, un modelo, un conjunto de contenido: las cifras son orientativas. Pero el patrón es claro: las métricas automatizadas por sí solas pasan por alto la mayoría de los problemas reales de traducción, especialmente los errores de precisión. Para trabajar con subtítulos en producción, la revisión humana sigue siendo esencial.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

El desarrollador cambia a Minimax 2.7 tras la prohibición de Claude y los problemas de crédito de MiMo.
Un desarrollador probó múltiples modelos de IA para OpenClaw después de que Claude fuera prohibido, encontrando que GLM 5.1 y 5 Turbo eran ineficaces para tareas de agente, el sistema de créditos de MiMo V2 Pro ineficiente, y finalmente optó por Minimax 2.7 por su generosa cuota y capacidad para manejar tareas de automatización.

Resumen Semanal de IA Multimodal: Holotron-12B, Nemotron Omni, GlyphPrinter y Más
Los aspectos más destacados de la IA multimodal de esta semana incluyen Holotron-12B para tareas de uso informático, los modelos Nemotron Omni de NVIDIA que integran lenguaje+visión+voz, GlyphPrinter para una representación precisa de texto en la generación de imágenes, y varios proyectos de código abierto para mejora de video, segmentación 3D y sistemas multiagente.

Meta pausa programa interno de entrenamiento de IA tras fuga de datos de pulsaciones de teclas de empleados
Meta pausa el programa MCI que rastrea las pulsaciones de teclado de los empleados tras una filtración SEV 2 que expuso conversaciones privadas, datos de rendimiento y transcripciones en toda la empresa.

VibeThinker-3B: Un modelo de 3B parámetros que iguala a DeepSeek 671B en los benchmarks de matemáticas AIME
Investigadores de Sina Weibo lanzaron VibeThinker-3B, un modelo de 3B de parámetros que obtiene 94.3 en AIME 2026, igualando a DeepSeek V3.2 (671B). El artículo introduce la Hipótesis de Compresión-Cobertura Paramétrica, argumentando que el razonamiento verificable puede comprimirse en modelos pequeños.