TranslateGemma-12b : L'examen humain détecte 71 % d'erreurs manquées par les mesures automatisées

✍️ OpenClawRadar📅 Publié: May 12, 2026🔗 Source
TranslateGemma-12b : L'examen humain détecte 71 % d'erreurs manquées par les mesures automatisées
Ad

Un audit de suivi des traductions de sous-titres TranslateGemma-12b révèle que les métriques automatisées sous-estiment considérablement les erreurs réelles. Le benchmark initial montrait que le modèle surpassait les modèles généraux de pointe (Claude Sonnet, GPT-5.4, DeepSeek, Gemini Flash Lite) dans 6 langues. Pour vérifier, l'équipe a ajouté une révision humaine.

Configuration

  • 21 segments de sous-titres anglais provenant d'une vidéo tutorielle
  • Traduction par TranslateGemma-12b dans 4 langues : ES, JA, TH, ZH-CN (coréen et chinois traditionnel abandonnés)
  • 84 traductions au total, présélectionnées comme ayant obtenu de bons résultats aux métriques automatisées
  • Chaque traduction soumise à un examen MQM humain
Ad

Résultats

Selon le seuil d'alerte propre au tableau de bord (MX ≥ 5 OR CK < 0,70) :

  • Signalé automatiquement : 1/84 (1,2 %)
  • Signalé par l'humain (tout type) : 60/84 (71 %)
  • Signalé par l'humain (Majeur) : 13/84 (15 %)

Par langue :

  • ES : 0/21 auto, 11/21 signalé par l'humain, 2/21 Majeur — principalement des incohérences de ton (alternance formel/informel), la plus facile des quatre
  • JA : 0/21 auto, 17/21 signalé par l'humain, 3/21 Majeur — schéma « fluide mais sens erroné » ; 10 des 15 erreurs de traduction totales dans l'ensemble de données. Un COMETKiwi élevé (moyenne 0,86) a masqué les erreurs. Même mode de défaillance observé avec Claude Sonnet 4.6 sur JA.
  • TH : 0/21 auto, 17/21 signalé par l'humain, 5/21 Majeur — surproduction : 5 erreurs de précision/ajout (insertion de contenu absent de la source), plus des erreurs de ponctuation dues aux points de style anglais.
  • ZH-CN : 1/21 auto (erreur de style), 15/21 signalé par l'humain, 3/21 Majeur — y compris l'omission de « magasin » modifiant le sens, et une traduction incohérente de « ticket » d'un segment à l'autre.

Sur les 25 erreurs de classe Précision (contresens, omission, ajout, non-traduction), toutes se trouvaient dans le quadrant aveugle aux métriques. Les métriques n'ont détecté aucune erreur de précision.

Conclusion

Petit audit, un modèle, un ensemble de contenu — les chiffres sont indicatifs. Mais le schéma est clair : les métriques automatisées seules manquent la majorité des vrais problèmes de traduction, en particulier les erreurs de précision. Pour un travail de sous-titrage en production, la révision humaine reste essentielle.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

FR v2.1.122 : Suppressions d'invites système, mise à jour de débogage et confiance accrue dans le calendrier
News

FR v2.1.122 : Suppressions d'invites système, mise à jour de débogage et confiance accrue dans le calendrier

Claude Code CC v2.1.122 supprime le prompt autonome de la phase quatre en mode plan, améliore le repli du contexte de débogage du démon, et relève le seuil de confiance pour les offres de planification de 70 %+ à 85 %+.

OpenClawRadar
Qwen3.5-122B sur Blackwell SM120 : Problème de corruption du cache KV en fp8 et résultats de performance
News

Qwen3.5-122B sur Blackwell SM120 : Problème de corruption du cache KV en fp8 et résultats de performance

Le test de Qwen3.5-122B sur du matériel 8x RTX PRO 6000 Blackwell a révélé que le cache KV fp8_e4m3 produit silencieusement des sorties corrompues sans erreurs, nécessitant plutôt un cache KV bf16. L'optimisation MTP a fourni une accélération de 2,75x pour les requêtes uniques, tandis que les contraintes de DeltaNet ont bloqué d'autres optimisations.

OpenClawRadar
Les Fonctionnalités Phares d'OpenClaw et les Risques (Avec Solutions)
News

Les Fonctionnalités Phares d'OpenClaw et les Risques (Avec Solutions)

Explorez les fonctionnalités remarquables d'OpenClaw, les risques potentiels qu'elles comportent et les solutions innovantes pour atténuer ces défis.

OpenClawRadar
🦀
News

Claude AI ouvre une PR fusionnée pour un bug de lien magique pendant que le développeur dort

Un utilisateur de Reddit rapporte que Claude AI a automatiquement corrigé un bug de production de lien magique à 4h46 du matin — l'étape trim/lowercase a été déplacée avant la regex de validation d'email — la PR a été fusionnée sans modifications.

OpenClawRadar