TranscriptionSuite v1.1.2 добавляет модели WhisperX, NeMo и VibeVoice.

Выпуск TranscriptionSuite v1.1.2
TranscriptionSuite, полностью локальное и открытое приложение для транскрипции аудио, выпустило версию 1.1.2 с важными дополнениями функций на основе отзывов сообщества.
Ключевые обновления
Разработчик заменил предыдущую реализацию faster-whisper на WhisperX и добавил поддержку нескольких новых семейств моделей:
- WhisperX - включает диаризацию через PyAnnote
- Модели NeMo - поддержка моделей Parakeet и Canary с диаризацией через PyAnnote
- Модели VibeVoice - поддержка как основной модели, так и 4-битных квантованных версий со встроенной диаризацией
Новые функции
- Менеджер моделей - централизованное управление различными моделями транскрипции
- Режим параллельной обработки - одновременная транскрипция и диаризация
- Управление горячими клавишами - сочетания клавиш для улучшения рабочего процесса
- Вставка в позицию курсора - функция прямой вставки текста
- Конвейер записи 24 кГц - специально добавлен для полного использования возможностей моделей VibeVoice (модели Whisper и NeMo требуют 16 кГц)
Приложение теперь предоставляет три различных конвейера транскрипции, каждый с разными подходами к диаризации в зависимости от выбранного семейства моделей.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

2-промптовая система для переноса контекста между чатами Claude без потери токенов
Разработчик делится двумя подсказками для сжатия всего разговора с Клодом в структурированный блок контекста и загрузки его в новый чат, сохраняя решения, проделанную работу и следующие шаги.

Логира: Аудит среды выполнения eBPF для запусков AI-агентов
Logira — это инструмент командной строки для Linux, работающий только в режиме наблюдения. Он записывает события выполнения, файловые и сетевые события через eBPF во время запусков ИИ-агентов, с локальным хранилищем на каждый запуск в форматах JSONL и SQLite, а также со встроенными правилами обнаружения для доступа к учетным данным, изменений постоянства и подозрительных шаблонов.

Навык OpenClaw сокращает количество токенов в дереве доступности с 600 тысяч до 1,3 тысячи.
Разработчик создал навык OpenClaw, который использует ранжирование элементов на основе машинного обучения для обрезки деревьев доступности, сокращая slickdeals.com с ~598 тыс. токенов до ~1,3 тыс. токенов, сохраняя только ~50 наиболее значимых интерактивных элементов.

Точность обоснованных ответов модели Qwen3.5-2B, дообученной с архитектурой RAG-Engram, повысилась с 50% до 93% при контексте в 8 тысяч токенов.
Разработчик дообучил модель Qwen3.5-2B с пользовательской архитектурой RAG-Engram для решения проблемы "потери в середине", улучшив процент правильных ответов при 8K токенах с 50% до 93% на реальных запросах. Система использует двухуровневый подход со статическими эмбеддингами сущностей и динамической навигацией по чанкам.