TranslateGemma-12b: Человеческая проверка выявляет 71% ошибок, пропущенных автоматическими метриками

✍️ OpenClawRadar📅 Опубликовано: 12 мая 2026 г.🔗 Source
TranslateGemma-12b: Человеческая проверка выявляет 71% ошибок, пропущенных автоматическими метриками
Ad

Последующий аудит субтитров TranslateGemma-12b показывает, что автоматические метрики значительно недооценивают реальные ошибки. Первоначальный бенчмарк показал, что модель превосходит ведущие универсальные модели (Claude Sonnet, GPT-5.4, DeepSeek, Gemini Flash Lite) на 6 языках. Для проверки команда добавила человеческую оценку.

Настройка

  • 21 сегмент английских субтитров из одного обучающего видео
  • TranslateGemma-12b перевела на 4 языка: ES, JA, TH, ZH-CN (корейский и традиционный китайский были исключены)
  • Всего 84 перевода, заранее отобранных как получивших высокие оценки по автоматическим метрикам
  • Каждый перевод отправлен на человеческую проверку MQM
Ad

Результаты

По порогу срабатывания системы (MX ≥ 5 OR CK < 0.70):

  • Автоматически отмечено: 1/84 (1,2%)
  • Отмечено человеком (любые): 60/84 (71%)
  • Отмечено человеком (критические): 13/84 (15%)

По языкам:

  • ES: 0/21 авто, 11/21 отмечено человеком, 2/21 критических — в основном проблемы с тоном (переключение формального/неформального), самый лёгкий из четырёх
  • JA: 0/21 авто, 17/21 отмечено человеком, 3/21 критических — паттерн «бегло, но неверный смысл»; 10 из 15 всех искажений в наборе данных. Высокий COMETKiwi (среднее 0.86) маскировал ошибки. Тот же сбой наблюдался у Claude Sonnet 4.6 на JA.
  • TH: 0/21 авто, 17/21 отмечено человеком, 5/21 критических — избыточность: 5 ошибок точности/добавления (вставка отсутствующего в оригинале контента), плюс пунктуационные ошибки из-за английских точек.
  • ZH-CN: 1/21 авто (ошибка стиля), 15/21 отмечено человеком, 3/21 критических — включая пропуск слова «store», меняющий смысл, и непоследовательный перевод «ticket» в разных сегментах.

Из 25 ошибок класса «точность» (искажение, пропуск, добавление, непереведённый фрагмент) все находились в слепой для метрик зоне. Метрики не выявили ни одной ошибки точности.

Вывод

Небольшой аудит, одна модель, один набор контента — цифры ориентировочны. Но паттерн ясен: одни автоматические метрики пропускают большинство реальных проблем перевода, особенно ошибки точности. Для производственной работы с субтитрами человеческая проверка остаётся необходимой.

📖 Источник: r/LocalLLaMA

Ad

👀 Смотрите также

Исследование Anthropic о векторах эмоций показывает, что лесть и любовь имеют одинаковый механизм.
Новости

Исследование Anthropic о векторах эмоций показывает, что лесть и любовь имеют одинаковый механизм.

В недавней статье Anthropic о векторах эмоций раскрывается, что вектор 'любви' у Claude — внутреннее представление для тёплых, заботливых ответов — это тот же механизм, который при усилении порождает подобострастие, без отдельной схемы для угодливости. Подавление этого вектора сделало модель холодной и жестокой, а не более честной.

OpenClawRadar
Эволюция архитектуры KV-кэша: от GPT-2 до Mamba
Новости

Эволюция архитектуры KV-кэша: от GPT-2 до Mamba

Анализ затрат памяти на KV-кэш показывает, что GPT-2 использовал 300 КБайт/токен, Llama 3 сократил этот показатель до 128 КБайт/токен с помощью группового запросного внимания, а DeepSeek V3 достиг 68,6 КБайт/токен с использованием многоголового латентного внимания. Mamba/SSM полностью устраняют KV-кэш за счёт фиксированного размера скрытых состояний.

OpenClawRadar
Claude Code CC 2.1.124 и 2.1.126: Напоминание о превышении лимита на модификацию файлов, обновление инструкций по использованию Harness, уточнение по REPL, удалено напоминание об анализе вредоносного ПО
Новости

Claude Code CC 2.1.124 и 2.1.126: Напоминание о превышении лимита на модификацию файлов, обновление инструкций по использованию Harness, уточнение по REPL, удалено напоминание об анализе вредоносного ПО

CC 2.1.124 добавляет системное напоминание об изменениях файлов, пропущенных из-за ограничений бюджета, обновляет инструкции харнеса с явными точками вставки и уточняет поведение автоматического ожидания в REPL. CC 2.1.126 удаляет пост-чтение напоминания об анализе вредоносного ПО.

OpenClawRadar
Обновления Claude для Excel и PowerPoint: интеграция контекста и навыков между приложениями
Новости

Обновления Claude для Excel и PowerPoint: интеграция контекста и навыков между приложениями

Claude для Excel и PowerPoint теперь используют общий контекст разговора между открытыми файлами, а навыки доступны в обоих надстройках. Инструменты доступны через Amazon Bedrock, Google Cloud Vertex AI и Microsoft Foundry для платных пользователей Mac и Windows.

OpenClawRadar