TranslateGemma-12b: Человеческая проверка выявляет 71% ошибок, пропущенных автоматическими метриками

Последующий аудит субтитров TranslateGemma-12b показывает, что автоматические метрики значительно недооценивают реальные ошибки. Первоначальный бенчмарк показал, что модель превосходит ведущие универсальные модели (Claude Sonnet, GPT-5.4, DeepSeek, Gemini Flash Lite) на 6 языках. Для проверки команда добавила человеческую оценку.
Настройка
- 21 сегмент английских субтитров из одного обучающего видео
- TranslateGemma-12b перевела на 4 языка: ES, JA, TH, ZH-CN (корейский и традиционный китайский были исключены)
- Всего 84 перевода, заранее отобранных как получивших высокие оценки по автоматическим метрикам
- Каждый перевод отправлен на человеческую проверку MQM
Результаты
По порогу срабатывания системы (MX ≥ 5 OR CK < 0.70):
- Автоматически отмечено: 1/84 (1,2%)
- Отмечено человеком (любые): 60/84 (71%)
- Отмечено человеком (критические): 13/84 (15%)
По языкам:
- ES: 0/21 авто, 11/21 отмечено человеком, 2/21 критических — в основном проблемы с тоном (переключение формального/неформального), самый лёгкий из четырёх
- JA: 0/21 авто, 17/21 отмечено человеком, 3/21 критических — паттерн «бегло, но неверный смысл»; 10 из 15 всех искажений в наборе данных. Высокий COMETKiwi (среднее 0.86) маскировал ошибки. Тот же сбой наблюдался у Claude Sonnet 4.6 на JA.
- TH: 0/21 авто, 17/21 отмечено человеком, 5/21 критических — избыточность: 5 ошибок точности/добавления (вставка отсутствующего в оригинале контента), плюс пунктуационные ошибки из-за английских точек.
- ZH-CN: 1/21 авто (ошибка стиля), 15/21 отмечено человеком, 3/21 критических — включая пропуск слова «store», меняющий смысл, и непоследовательный перевод «ticket» в разных сегментах.
Из 25 ошибок класса «точность» (искажение, пропуск, добавление, непереведённый фрагмент) все находились в слепой для метрик зоне. Метрики не выявили ни одной ошибки точности.
Вывод
Небольшой аудит, одна модель, один набор контента — цифры ориентировочны. Но паттерн ясен: одни автоматические метрики пропускают большинство реальных проблем перевода, особенно ошибки точности. Для производственной работы с субтитрами человеческая проверка остаётся необходимой.
📖 Источник: r/LocalLLaMA
👀 Смотрите также

Claude Skills vs. MCP: Практический вопрос разработчика о границах применения
Разработчик задаётся вопросом, в каких случаях ценность MCP становится решающей по сравнению с Claude Skills после того, как выпуск Skills усложнил интеграцию инструментов, отмечая, что хорошо структурированные инструкции часто могут быть достаточными без границ протокола.

Claude-Code версии 2.1.110 добавляет режим TUI, push-уведомления и множество исправлений.
Claude-Code v2.1.110 представляет новую команду /tui для рендеринга без мерцания, возможности push-уведомлений для мобильных оповещений, а также улучшения в управлении плагинами и функциональности удаленного управления. Выпуск также включает множество исправлений ошибок для MCP-серверов, обработки сессий и проблем с интерфейсом.

Клод возглавил чарты App Store на фоне противостояния с правительством
Приложение Claude от Anthropic поднялось с 42-го на 1-е место в чарте самых скачиваемых приложений в американском App Store, оставив ChatGPT и Gemini на втором и третьем местах. Этот скачок произошел после публичного разногласия между Anthropic и правительством США по поводу военного и разведывательного использования технологий ИИ.

Рост экосистемы OpenClaw и ключевые участники на карте
Участник сообщества составил карту стремительного расширения экосистемы OpenClaw, отметив более 230 тысяч звёзд на GitHub, более 116 тысяч участников в Discord и появление компаний в сферах управляемого хостинга, маршрутизации LLM и слоёв безопасности в течение 60 дней с момента запуска.