Исследование Mistral Voxtral Realtime 4B на чистом C для преобразования речи в текст

✍️ OpenClawRadar📅 Опубликовано: 13 февраля 2026 г.🔗 Source
Исследование Mistral Voxtral Realtime 4B на чистом C для преобразования речи в текст
Ad

Модель Mistral Voxtral Realtime 4B представляет собой модель распознавания речи, реализованную на чистом C, предлагая альтернативу без зависимостей для тех, кто полагается исключительно на стандартную библиотеку C. Репозиторий voxtral.c от antirez упрощает процесс вывода без необходимости в среде выполнения Python, наборе инструментов CUDA или любой другой внешней библиотеке во время вывода.

Ключевые особенности

  • Чистая C-реализация: Не нужны внешние зависимости, кроме стандартной библиотеки C, что делает ее подходящей для сред, где критически важна минимальная зависимость.
  • Платформо-зависимые бэкенды: Предоставляет две цели сборки: make mps для Apple Silicon, обеспечивающую более быструю обработку, и make blas для Intel Mac или Linux-систем с OpenBLAS, хотя с меньшей производительностью из-за необходимости конвертации с bf16 на fp32.
  • Обработка аудио: Использует кодировщик с разбиением на блоки и перекрывающимися окнами для ограничения использования памяти, независимо от длины входного потока. Также позволяет ввод аудио через stdin или микрофон на macOS, что улучшает ее универсальность для задач транскрипции в реальном времени или на основе файлов.
  • Потоковый C API: API vox_stream_t позволяет инкрементальный ввод аудио и выводит строковые токены по мере их генерации.
Ad

Использование

  • Скачайте модель (~8.9GB) с помощью ./download_model.sh.
  • Для транскрипции аудио из файла: ./voxtral -d voxtral-model -i audio.wav.
  • Живая транскрипция с микрофона на macOS: ./voxtral -d voxtral-model --from-mic.
  • Транскодирование и транскрипция с помощью ffmpeg: ffmpeg -i audio.mp3 -f s16le -ar 16000 -ac 1 - 2> /dev/null | ./voxtral -d voxtral-model --stdin.

Проект открыт для дальнейшего тестирования, так как в настоящее время он зависит от ограниченного числа образцов. Полная готовность к производству может потребовать дополнительной работы, особенно в обработке длинных транскрипций для тестирования кольцевого буфера кэша KV.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

Откат: Реализация на основе хуков утечек верификационных циклов Claude
Инструменты

Откат: Реализация на основе хуков утечек верификационных циклов Claude

Clawback — это проект на GitHub, который переосмысливает циклы проверки из утечки исходной карты Claude, реализуя их как механические хуки вместо промптов. Он включает стоп-хуки, PreToolUse, PostToolUse и PostCompact хуки, которые модель не может пропустить под давлением контекста.

OpenClawRadar
Плагин OKed: OpenClaw запрашивает разрешение телефона перед деструктивными действиями
Инструменты

Плагин OKed: OpenClaw запрашивает разрешение телефона перед деструктивными действиями

Новый плагин OKed подключается к хуку before_tool_call OpenClaw, чтобы перехватывать деструктивные команды (электронные письма, удаления, платежи) и отправлять запросы на подтверждение на ваш телефон или в Telegram.

OpenClawRadar
DeepSeek Reasonix: Нативный кодинг-агент с высоким кэшированием и низкой стоимостью
Инструменты

DeepSeek Reasonix: Нативный кодинг-агент с высоким кэшированием и низкой стоимостью

Reasonix — это AI-агент для написания кода в терминале, ориентированный на DeepSeek, с высокой эффективностью кэширования и низкой стоимостью инференса.

OpenClawRadar
Attesor: Обратная разработка на основе ИИ Rosetta 2 для виртуальной машины Linux
Инструменты

Attesor: Обратная разработка на основе ИИ Rosetta 2 для виртуальной машины Linux

Attesor — это проект на GitHub, который использует искусственный интеллект для реверс-инжиниринга технологии бинарной трансляции Apple Rosetta 2. Цель проекта — задокументировать её архитектуру и, возможно, обеспечить трансляцию x86_64 в ARM64 на виртуальных машинах Linux.

OpenClawRadar