Локальный конвейер перевода книг использует модели Qwen 32B и Mistral 24B с контекстуальной системой RAG

Разработчик создал полностью локальный автоматизированный конвейер перевода книг, который преобразует файлы PDF в формат ePub с использованием восьми скриптов на Python. Система решает распространённые проблемы перевода, такие как потеря контекста и проблемы с форматированием, через многоэтапный рабочий процесс.
Детали рабочего процесса
Конвейер состоит из восьми скриптов, которые обрабатывают весь процесс:
- Извлечение PDF: Использует Marker для извлечения содержимого из PDF с сохранением элементов форматирования, таких как жирный текст, главы и изображения
- Сегментация текста: Разделяет извлечённый текст на управляемые фрагменты
- Создание контекста: Перед переводом отправляет отрывки из всей книги в Qwen 32B для создания «Супер-Библии» — глобального глоссария, содержащего персонажей, тон и атмосферу
- Перевод: Qwen 32B переводит каждый текстовый сегмент, обращаясь к Супер-Библии для поддержания согласованности
- Стилевая правка: Mistral 24B выступает в роли редактора, проверяя переводы Qwen и переписывая их для идеального литературного стиля
- Сборка: Финальный скрипт собирает все переведённые сегменты, вставляет обратно изображения и использует Pandoc для вывода отполированного файла ePub
Функции автоматизации
Система включает скрипт мониторинга, который отслеживает назначенную папку. Пользователи просто помещают PDF в эту папку, и конвейер автоматически обрабатывает его. Через несколько часов система выводит как переведённый ePub, так и квитанцию с временем обработки.
Разработчик отмечает, что результаты удивительно эффективны, хотя и не на 100% идеальны, и упоминает несколько идей для улучшения. Вся система работает локально на персональном компьютере без необходимости внешних сервисов.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Клод Код против OpenCode: Ключевые технические различия, обнаруженные разработчиком
Разработчик сравнивает Claude Code и OpenCode по контексту, памяти, использованию инструментов, подагентам, разрешениям, безопасности и гибкости моделей, заключая, что Claude Code по-прежнему выигрывает для работы с продуктивными репозиториями.

Использование вложений Harrier для локального семантического поиска в памяти агентов OpenClaw
Запустите локальный сервер эмбеддингов с моделью Harrier от Microsoft, откройте API, совместимое с Ollama, и настройте memorySearch в OpenClaw для локального поиска семантической памяти без внешних сервисов.

MCP контекстное раздувание: реальные затраты и практическое решение для пользователей Claude Code
Запуск 9 серверов MCP в Claude Code приводит к холодному старту на 38k токенов, ~$700 в месяц накладных расходов на определение инструментов и снижению производительности модели. Паттерн шлюза с ранжированием BM25 сокращает контекст до 4k.

Проект "Реестр": Система памяти с участием человека для AI-агентов в программировании
Проект GitHub представляет систему учета на основе YAML, где люди курируют то, что ИИ-агенты запоминают о кодовых базах. Он включает навык /ledger, хук UserPromptSubmit для автоматического внедрения контекста и проверку аудитором Haiku.