Локальный конвейер перевода книг использует модели Qwen 32B и Mistral 24B с контекстуальной системой RAG

✍️ OpenClawRadar📅 Опубликовано: 1 апреля 2026 г.🔗 Source
Локальный конвейер перевода книг использует модели Qwen 32B и Mistral 24B с контекстуальной системой RAG
Ad

Разработчик создал полностью локальный автоматизированный конвейер перевода книг, который преобразует файлы PDF в формат ePub с использованием восьми скриптов на Python. Система решает распространённые проблемы перевода, такие как потеря контекста и проблемы с форматированием, через многоэтапный рабочий процесс.

Детали рабочего процесса

Конвейер состоит из восьми скриптов, которые обрабатывают весь процесс:

  • Извлечение PDF: Использует Marker для извлечения содержимого из PDF с сохранением элементов форматирования, таких как жирный текст, главы и изображения
  • Сегментация текста: Разделяет извлечённый текст на управляемые фрагменты
  • Создание контекста: Перед переводом отправляет отрывки из всей книги в Qwen 32B для создания «Супер-Библии» — глобального глоссария, содержащего персонажей, тон и атмосферу
  • Перевод: Qwen 32B переводит каждый текстовый сегмент, обращаясь к Супер-Библии для поддержания согласованности
  • Стилевая правка: Mistral 24B выступает в роли редактора, проверяя переводы Qwen и переписывая их для идеального литературного стиля
  • Сборка: Финальный скрипт собирает все переведённые сегменты, вставляет обратно изображения и использует Pandoc для вывода отполированного файла ePub
Ad

Функции автоматизации

Система включает скрипт мониторинга, который отслеживает назначенную папку. Пользователи просто помещают PDF в эту папку, и конвейер автоматически обрабатывает его. Через несколько часов система выводит как переведённый ePub, так и квитанцию с временем обработки.

Разработчик отмечает, что результаты удивительно эффективны, хотя и не на 100% идеальны, и упоминает несколько идей для улучшения. Вся система работает локально на персональном компьютере без необходимости внешних сервисов.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Клод Код против OpenCode: Ключевые технические различия, обнаруженные разработчиком
Инструменты

Клод Код против OpenCode: Ключевые технические различия, обнаруженные разработчиком

Разработчик сравнивает Claude Code и OpenCode по контексту, памяти, использованию инструментов, подагентам, разрешениям, безопасности и гибкости моделей, заключая, что Claude Code по-прежнему выигрывает для работы с продуктивными репозиториями.

OpenClawRadar
Использование вложений Harrier для локального семантического поиска в памяти агентов OpenClaw
Инструменты

Использование вложений Harrier для локального семантического поиска в памяти агентов OpenClaw

Запустите локальный сервер эмбеддингов с моделью Harrier от Microsoft, откройте API, совместимое с Ollama, и настройте memorySearch в OpenClaw для локального поиска семантической памяти без внешних сервисов.

OpenClawRadar
MCP контекстное раздувание: реальные затраты и практическое решение для пользователей Claude Code
Инструменты

MCP контекстное раздувание: реальные затраты и практическое решение для пользователей Claude Code

Запуск 9 серверов MCP в Claude Code приводит к холодному старту на 38k токенов, ~$700 в месяц накладных расходов на определение инструментов и снижению производительности модели. Паттерн шлюза с ранжированием BM25 сокращает контекст до 4k.

OpenClawRadar
Проект "Реестр": Система памяти с участием человека для AI-агентов в программировании
Инструменты

Проект "Реестр": Система памяти с участием человека для AI-агентов в программировании

Проект GitHub представляет систему учета на основе YAML, где люди курируют то, что ИИ-агенты запоминают о кодовых базах. Он включает навык /ledger, хук UserPromptSubmit для автоматического внедрения контекста и проверку аудитором Haiku.

OpenClawRadar