音声認識のためのPure CでのMistral Voxtral Realtime 4Bの探求

Mistral Voxtral Realtime 4Bは、純粋なC言語で実装された音声認識モデルで、C標準ライブラリのみに依存する依存関係のない代替手段を提供します。antirezによるリポジトリvoxtral.cは、推論時にPythonランタイム、CUDAツールキット、またはその他の外部ライブラリを必要とせずに推論パイプラインを容易にします。
主な特徴
- 純粋なC言語実装: C標準ライブラリ以外の外部依存関係が必要ないため、最小限の依存関係が重要な環境に適しています。
- プラットフォーム固有のバックエンド: 2つのmakeターゲットを提供します:Apple Silicon向けの高速処理を提供する
make mpsと、OpenBLASを搭載したIntel MacまたはLinuxシステム向けのmake blas(bf16からfp32への変換が必要なため、パフォーマンスは遅くなります)。 - オーディオ処理: 入力長に関係なくメモリ使用量を制限するために、オーバーラップするウィンドウを持つチャンクエンコーダーを利用します。また、macOSでは標準入力またはマイクからのオーディオ入力を可能にし、ライブまたはファイルベースの文字起こしタスクでの汎用性を高めています。
- ストリーミングC API: API
vox_stream_tは、インクリメンタルなオーディオ供給を許可し、生成されたトークン文字列を出力します。
使用方法
./download_model.shを使用してモデル(約8.9GB)をダウンロードします。- ファイルからのオーディオ文字起こしの場合:
./voxtral -d voxtral-model -i audio.wav - macOSでのマイクからのライブ文字起こしの場合:
./voxtral -d voxtral-model --from-mic ffmpegを使用したトランスコードと文字起こしの場合:ffmpeg -i audio.mp3 -f s16le -ar 16000 -ac 1 - 2> /dev/null | ./voxtral -d voxtral-model --stdin
このプロジェクトは、現在限られたサンプルに依存しているため、さらなるテストに開放されています。完全な本番環境での使用には、特にKVキャッシュの循環バッファをテストするための長い文字起こしの処理において、さらなる作業が必要になる可能性があります。
📖 完全なソースを読む: HN AI Agents
👀 See Also

8つのAIコーディングモデルを実世界のTypeScript機能実装で比較
ある開発者が、オープンソースのTypeScript Telegramボットプロジェクトで/renameコマンドを実装するという課題で8つのAIコーディングモデルをテストし、コスト、実行時間、正確性、技術的品質の観点から評価しました。GPT-5.4は実装の正確性で最高得点を獲得し、GLM 5は最高のコストパフォーマンスを提供しました。

エージェントアーキテクト:AIエージェント向け完全なワークスペースファイルを生成する無料ツール
Agent Architectは、ユーザーがAIエージェントに関する40以上の質問に回答する無料のインタラクティブツールです。すべての回答をまとめてフォーマットされたプロンプトを作成し、7つの本番レベルのワークスペースファイルを生成します:SOUL.md、IDENTITY.md、AGENTS.md、OPERATIONS.md、TOOLS.md、MEMORY.md、HEARTBEAT.mdです。

反重力2.0在OpenSCAD建筑3D基准测试中拔得头筹——ModelRift在万神殿上测试6种大语言模型
ModelRiftが6つのLLMをOpenSCADでパンテオンを構築するベンチマークで評価。Antigravityは建築品質で4.5/5を獲得し、ベースラインのCodex 5.5を上回った。Cursor 3.5は最速だが最も弱い結果に。

BrowserKing: Claudeおよび他のモデルによるブラウザ制御のためのオープンソースChrome拡張機能
BrowserKingは、無料のオープンソースChrome拡張機能で、Claudeや15以上の他のモデルがサイドパネルからブラウザを閲覧・操作できるようにします。画面のスクリーンショットを撮影してモデルに送信し、ボタンのクリック、フォームの入力、スクロール、タブの移動などの決定に基づいて動作します。