TranslateGemma-12b : L'examen humain détecte 71 % d'erreurs manquées par les mesures automatisées

✍️ OpenClawRadar📅 Publié: May 12, 2026🔗 Source
TranslateGemma-12b : L'examen humain détecte 71 % d'erreurs manquées par les mesures automatisées
Ad

Un audit de suivi des traductions de sous-titres TranslateGemma-12b révèle que les métriques automatisées sous-estiment considérablement les erreurs réelles. Le benchmark initial montrait que le modèle surpassait les modèles généraux de pointe (Claude Sonnet, GPT-5.4, DeepSeek, Gemini Flash Lite) dans 6 langues. Pour vérifier, l'équipe a ajouté une révision humaine.

Configuration

  • 21 segments de sous-titres anglais provenant d'une vidéo tutorielle
  • Traduction par TranslateGemma-12b dans 4 langues : ES, JA, TH, ZH-CN (coréen et chinois traditionnel abandonnés)
  • 84 traductions au total, présélectionnées comme ayant obtenu de bons résultats aux métriques automatisées
  • Chaque traduction soumise à un examen MQM humain
Ad

Résultats

Selon le seuil d'alerte propre au tableau de bord (MX ≥ 5 OR CK < 0,70) :

  • Signalé automatiquement : 1/84 (1,2 %)
  • Signalé par l'humain (tout type) : 60/84 (71 %)
  • Signalé par l'humain (Majeur) : 13/84 (15 %)

Par langue :

  • ES : 0/21 auto, 11/21 signalé par l'humain, 2/21 Majeur — principalement des incohérences de ton (alternance formel/informel), la plus facile des quatre
  • JA : 0/21 auto, 17/21 signalé par l'humain, 3/21 Majeur — schéma « fluide mais sens erroné » ; 10 des 15 erreurs de traduction totales dans l'ensemble de données. Un COMETKiwi élevé (moyenne 0,86) a masqué les erreurs. Même mode de défaillance observé avec Claude Sonnet 4.6 sur JA.
  • TH : 0/21 auto, 17/21 signalé par l'humain, 5/21 Majeur — surproduction : 5 erreurs de précision/ajout (insertion de contenu absent de la source), plus des erreurs de ponctuation dues aux points de style anglais.
  • ZH-CN : 1/21 auto (erreur de style), 15/21 signalé par l'humain, 3/21 Majeur — y compris l'omission de « magasin » modifiant le sens, et une traduction incohérente de « ticket » d'un segment à l'autre.

Sur les 25 erreurs de classe Précision (contresens, omission, ajout, non-traduction), toutes se trouvaient dans le quadrant aveugle aux métriques. Les métriques n'ont détecté aucune erreur de précision.

Conclusion

Petit audit, un modèle, un ensemble de contenu — les chiffres sont indicatifs. Mais le schéma est clair : les métriques automatisées seules manquent la majorité des vrais problèmes de traduction, en particulier les erreurs de précision. Pour un travail de sous-titrage en production, la révision humaine reste essentielle.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Claude Code retiré du plan Pro d'Anthropic, désormais uniquement disponible sur les plans Max
News

Claude Code retiré du plan Pro d'Anthropic, désormais uniquement disponible sur les plans Max

Anthropic a retiré Claude Code de son plan Pro (17-20 $/mois), le rendant disponible uniquement sur les plans Max à partir de 100 $/mois. Le plan Pro inclut désormais Claude Cowork, des projets illimités, la fonction Recherche et l'accès à davantage de modèles Claude.

OpenClawRadar
Qwen 3 8B surpasse des modèles plus volumineux lors d'évaluations en aveugle par les pairs sur des tâches difficiles.
News

Qwen 3 8B surpasse des modèles plus volumineux lors d'évaluations en aveugle par les pairs sur des tâches difficiles.

Lors d'une évaluation en aveugle par les pairs de 10 petits modèles de langage sur 13 tâches difficiles de niveau frontière, Qwen 3 8B a remporté 6 évaluations et s'est classé dans le top 3 dans 12 des 13 tâches, surpassant des modèles ayant jusqu'à 4 fois plus de paramètres. L'évaluation couvrait le débogage de verrous distribués, les bogues de concurrence en Go, l'optimisation SQL, le diagnostic médical bayésien, le paradoxe de Simpson, le théorème de vote d'Arrow et l'analyse du biais du survivant.

OpenClawRadar
Nvidia investit 26 milliards de dollars dans des modèles d'IA à poids ouvert et lance Nemotron 3 Super.
News

Nvidia investit 26 milliards de dollars dans des modèles d'IA à poids ouvert et lance Nemotron 3 Super.

Nvidia va dépenser 26 milliards de dollars sur cinq ans pour construire des modèles d'IA open source, selon les documents financiers de 2025. La société a également publié Nemotron 3 Super, un modèle à 128 milliards de paramètres qui surpasse GPT-OSS sur les benchmarks et se classe premier sur PinchBench pour le contrôle OpenClaw.

OpenClawRadar
Notes de version de Claude Desktop 1.1.4498 : Rebond du Dock, Extension de l'environnement Shell et Prise en charge du Cloud Gouvernemental
News

Notes de version de Claude Desktop 1.1.4498 : Rebond du Dock, Extension de l'environnement Shell et Prise en charge du Cloud Gouvernemental

Claude Desktop 1.1.4498 ajoute des notifications de rebond dans le dock pour attirer l'attention de l'utilisateur, étend l'extraction de l'environnement shell pour inclure des variables spécifiques à Claude, et introduit la détection des déploiements gouvernementaux/personnalisés. La mise à jour réduit également le délai d'expiration des appels d'outils du pont Chrome de 120 à 10 secondes.

OpenClawRadar