Локализация больших кодовых баз с помощью LLM: Рабочий процесс разработчика для 4500 UI-ключей

Разработчик задокументировал свой процесс локализации крупного игрового проекта с примерно 4500 ключами интерфейса, хранящимися в файле en-US.json размером 500 КБ. Он использовал многоэтапный рабочий процесс с LLM для обработки извлечения, перевода и улучшения качества.
Первоначальные попытки извлечения и перевода
Сначала он использовал Claude для сканирования кодовой базы, извлечения жёстко заданных строк интерфейса и их миграции в стандарты i18n, создав файл локали. Для перевода на итальянский он изначально попробовал Claude и Gemini Pro (через Gemini CLI и Antigravity). Обе облачные модели выдавали переводы неприемлемого качества. Gemini Pro также столкнулась с ошибками из-за большого файла, потребовав его разделения на 10 меньших частей.
Переход на локальные модели и ключевое прозрение
Затем он попробовал TranslateGemma локально через LM Studio, переводя ключ за ключом. Хотя качество было немного лучше, оно всё ещё оставалось неприемлемым. Ключевым прозрением стало то, что слова в интерфейсе часто неоднозначны, и для перевода требуется устранение неоднозначности и контекст использования.
Чтобы решить эту проблему, он вернулся к Claude для создания второго файла. Для каждого из 4500 ключей Claude анализировал использование в коде, чтобы предоставить контекст: где появляется строка, её функция (метка кнопки, описание, подсказка для ввода) и её влияние на игровой процесс.
Финальный конвейер перевода
Он построил автоматизированный конвейер перевода со следующими шагами:
- Группировка ключей вместе с их сгенерированным контекстом.
- Использование промпта, сфокусированного на функциональном (а не буквальном) переводе.
- Обеспечение сохранения заполнителей и тегов.
- Отправка запросов локальной модели через LM Studio.
TranslateGemma не справилась с форматом промпта, насыщенного контекстом, поэтому он сменил модели. Тестирование проводилось на Mac Mini M1 с 16 ГБ унифицированной памяти.
Производительность моделей и результаты
Qwen 3 4B показала хорошие результаты, но Qwen 3 8B оказалась оптимальной, допуская меньше грамматических ошибок и предлагая лучшие формулировки, оставаясь при этом управляемой для локального запуска. Финальный конвейер может перевести более 4500 ключей на несколько языков, занимая примерно 8 часов на одну локаль на его машине. Он использует квантованную модель, чтобы можно было продолжать работу, пока она выполняется в фоновом режиме.
Разработчик отмечает, что этот подход дал качество, достаточное для выпуска, и показался ему лучше, чем многие автоматически переведённые проекты, которые он видел.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Конвейер промптов демонстрирует свойства метапрограммирования.
Разработчик создал четырехэтапный конвейер промптов для приложения Electron, который структурно напоминает язык программирования, включая типизированные контракты, управление потоком выполнения и автоматическую документацию. Система исправила 17 ошибок и рефакторила 1218 строк кода за один день.

Автоматизация ежедневного подкаста об искусственном интеллекте с помощью Claude Code и трёх AI-агентов
Разработчик создал полностью автоматизированный конвейер для подкастов с использованием Claude Code для координации трех специализированных ИИ-агентов, которые отбирают новости об ИИ, пишут сценарии для озвучки, проверяют факты и генерируют аудио с клонированием голоса. Система публикует ежедневные выпуски с минимальным ручным вмешательством.

Разработчик создает инструмент сравнения авиарейсов с помощью Claude Code, используя подход BDMA.
Непрограммист создал easyscape.eu, используя Claude Code с подходом BDMA (создание/отладка/измерение/корректировка). Инструмент сравнивает несколько аэропортов вылета, учитывает реальные расходы, такие как дорожные сборы и парковка, и показывает наиболее экономичный вариант отправления, а не просто самый дешёвый билет.

Непрограммист создает игру в цепочку слов за один день с помощью ИИ Claude.
Пользователь без опыта программирования создал полноценную браузерную игру за один сеанс с помощью Claude AI. Игра в слова включает словарь на 74 тысячи слов, звуковые эффекты, элементы дизайна и талисман.