Исследование Mistral Voxtral Realtime 4B на чистом C для преобразования речи в текст

Модель Mistral Voxtral Realtime 4B представляет собой модель распознавания речи, реализованную на чистом C, предлагая альтернативу без зависимостей для тех, кто полагается исключительно на стандартную библиотеку C. Репозиторий voxtral.c от antirez упрощает процесс вывода без необходимости в среде выполнения Python, наборе инструментов CUDA или любой другой внешней библиотеке во время вывода.
Ключевые особенности
- Чистая C-реализация: Не нужны внешние зависимости, кроме стандартной библиотеки C, что делает ее подходящей для сред, где критически важна минимальная зависимость.
- Платформо-зависимые бэкенды: Предоставляет две цели сборки:
make mpsдля Apple Silicon, обеспечивающую более быструю обработку, иmake blasдля Intel Mac или Linux-систем с OpenBLAS, хотя с меньшей производительностью из-за необходимости конвертации с bf16 на fp32. - Обработка аудио: Использует кодировщик с разбиением на блоки и перекрывающимися окнами для ограничения использования памяти, независимо от длины входного потока. Также позволяет ввод аудио через stdin или микрофон на macOS, что улучшает ее универсальность для задач транскрипции в реальном времени или на основе файлов.
- Потоковый C API: API
vox_stream_tпозволяет инкрементальный ввод аудио и выводит строковые токены по мере их генерации.
Использование
- Скачайте модель (~8.9GB) с помощью
./download_model.sh. - Для транскрипции аудио из файла:
./voxtral -d voxtral-model -i audio.wav. - Живая транскрипция с микрофона на macOS:
./voxtral -d voxtral-model --from-mic. - Транскодирование и транскрипция с помощью
ffmpeg:ffmpeg -i audio.mp3 -f s16le -ar 16000 -ac 1 - 2> /dev/null | ./voxtral -d voxtral-model --stdin.
Проект открыт для дальнейшего тестирования, так как в настоящее время он зависит от ограниченного числа образцов. Полная готовность к производству может потребовать дополнительной работы, особенно в обработке длинных транскрипций для тестирования кольцевого буфера кэша KV.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

Hippo v0.21.0: Биологически вдохновленная память для ИИ-агентов с поддержкой нескольких инструментов
Hippo v0.21.0 представляет однокомандную настройку для нескольких инструментов ИИ-кодирования, включая Claude Code, OpenCode, OpenClaw, Codex, Cursor и Pi. Система памяти включает механизмы затухания, усиления извлечения и консолидации без зависимостей во время выполнения.

Локальная система памяти MCP с консолидацией для AI-диалогов
Разработчик создал MCP-сервер, предоставляющий постоянную локальную память для AI-клиентов, используя Qwen 2.5-7B для консолидации диалогов в структурированные документы знаний каждые 6 часов. Система полностью работает на вашем оборудовании с семантическим дедуплицированием, адаптивной оценкой и векторным поиском FAISS.

Менграм добавляет постоянную память агентам OpenClaw.
Mengram — это система памяти с открытым исходным кодом, которая предоставляет агентам OpenClaw долговременную память между сессиями, решая проблему, когда агенты забывают всё при перезапуске. Она обеспечивает эпизодическую, объектную и процедурную память с интеллектуальным архивированием устаревших фактов.

Claude Code LSP: Включение протокола языкового сервера для более быстрой и точной навигации по коду
Claude Code поставляется без включенного LSP по умолчанию, но его активация преобразует навигацию по коду из 30-60-секундных поисков через grep в 50-миллисекундные запросы со 100% точностью. Настройка требует флага, обнаруженного через issue на GitHub, а не через официальную документацию.