Explorando Mistral Voxtral Realtime 4B em C Puro para Conversão de Fala em Texto

✍️ OpenClawRadar📅 Publicado: February 13, 2026🔗 Source
Explorando Mistral Voxtral Realtime 4B em C Puro para Conversão de Fala em Texto
Ad

O Mistral Voxtral Realtime 4B é um modelo de conversão de fala em texto implementado em C puro, oferecendo uma alternativa livre de dependências para aqueles que dependem exclusivamente da biblioteca padrão C. O repositório, voxtral.c de antirez, facilita o pipeline de inferência sem exigir runtime Python, toolkit CUDA ou qualquer outra biblioteca externa no momento da inferência.

Principais Características

  • Implementação em C Puro: Nenhuma dependência externa além da biblioteca padrão C é necessária, tornando-o adequado para ambientes onde dependência mínima é crítica.
  • Backends Específicos de Plataforma: Oferece dois alvos de compilação: make mps para Apple Silicon, que fornece processamento mais rápido, e make blas para sistemas Intel Mac ou Linux equipados com OpenBLAS, embora com desempenho mais lento devido à necessidade de conversão de bf16 para fp32.
  • Processamento de Áudio: Utiliza um codificador segmentado com janelas sobrepostas para limitar o uso de memória, independentemente do comprimento da entrada. Também permite entrada de áudio via stdin ou microfone no macOS, aumentando sua versatilidade para tarefas de transcrição ao vivo ou baseadas em arquivos.
  • API de Streaming em C: A API, vox_stream_t, permite alimentação incremental de áudio e gera strings de tokens conforme são produzidos.
Ad

Uso

  • Baixe o modelo (~8,9GB) usando ./download_model.sh.
  • Para transcrição de áudio de um arquivo: ./voxtral -d voxtral-model -i audio.wav.
  • Transcrição ao vivo de um microfone no macOS: ./voxtral -d voxtral-model --from-mic.
  • Transcodificação e transcrição com ffmpeg: ffmpeg -i audio.mp3 -f s16le -ar 16000 -ac 1 - 2> /dev/null | ./voxtral -d voxtral-model --stdin.

O projeto está aberto a mais testes, pois atualmente depende de amostras limitadas. A prontidão total para produção pode exigir mais trabalho, especialmente no tratamento de transcrições longas para testar o buffer circular do cache KV.

📖 Leia o código-fonte completo: HN AI Agents

Ad

👀 See Also

Eqho: Aplicativo Local de Voz para Texto para Sessões de Código do Claude
Tools

Eqho: Aplicativo Local de Voz para Texto para Sessões de Código do Claude

Eqho é um aplicativo gratuito e de código aberto de voz para texto que usa o modelo Whisper da OpenAI localmente para digitar entrada falada em qualquer aplicativo em foco. Atualmente, apenas para Windows, com configuração por linha de comando necessária.

OpenClawRadar
Nelson: Um Plugin Claude Code para Coordenar Agentes de IA Como uma Frota Naval
Tools

Nelson: Um Plugin Claude Code para Coordenar Agentes de IA Como uma Frota Naval

Nelson é um plugin do Claude Code que estrutura a coordenação de agentes de IA usando princípios de frota naval, apresentando três modos de execução, um sistema de classificação de risco, monitoramento de integridade do casco e portões de ordens permanentes para prevenir antipadrões comuns.

OpenClawRadar
Ferramenta de sincronização de documentos/contexto de IA para desenvolvedores ganha tração após post no Reddit
Tools

Ferramenta de sincronização de documentos/contexto de IA para desenvolvedores ganha tração após post no Reddit

Um desenvolvedor compartilhou sua ferramenta de sincronização de documentação e contexto de IA no Reddit, resultando em 1,1 mil downloads, 60 estrelas no GitHub e 192 clones únicos em duas semanas após a postagem em 22 de março.

OpenClawRadar
Logira: Auditoria de Runtime eBPF para Execuções de Agentes de IA
Tools

Logira: Auditoria de Runtime eBPF para Execuções de Agentes de IA

Logira é uma ferramenta CLI apenas para observação no Linux que registra eventos de execução, arquivo e rede via eBPF durante execuções de agentes de IA, com armazenamento local por execução em JSONL e SQLite e regras de detecção integradas para acesso a credenciais, alterações de persistência e padrões suspeitos.

OpenClawRadar