NexQuant: エッジデプロイメント向けRustネイティブ3ビットKVキャッシュエンジン

NexQuantは、通常はメモリ制約に悩まされるコンシューマーハードウェア上で高コンテキストモデルを実行するためのRustネイティブエンジンです。Tom TurneyのTurboQuant+研究の後継として、生産環境で実証済みの位置付けとなっています。
主な技術詳細
- 3〜5倍のメモリ削減: 14Bモデルが4GBのVRAMまたは統合メモリに収まるようになりました
- MSEのみの安定性: ノイズの多いQJLパスを安定したMSEのみの軌道に置き換え(27/27の論理テストを通過)
- 統合されたスパース-V: スパース性がベンチマーク機能だけでなく、リアルタイムデコードループに統合されています
- ゼロアロケーションプリフィル: C++プロトタイプのセグメンテーションフォールト問題なしに高速化するため、100% Safe Rustで記述
- ハードウェアサポート: Metal、CUDA、Vulkanのネイティブランタイムディスパッチ、古いラップトップやRaspberry Pi向けのCPU-AVX2/NEONバックエンドサポート
実装の詳細
このプロジェクトはウォルシュ・アダマール変換とRust GGUFパーシングを使用しています。3ビットKVキャッシュが数学的に可能であることを証明したTom TurneyのPolarQuant/TurboQuant+の画期的成果を基盤としています。開発には高速ペアプログラマーとしてClaude(Anthropic)が関与しました。
目標は、モデルがスケールするにつれ、それらをローカルかつ分散して実行する能力を維持することです。チームは特にVulkan SPIR-Vカーネルに関するフィードバックを求めています。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

Eqho:Claudeコードセッション用ローカル音声テキスト変換アプリ
Eqhoは、OpenAIのWhisperモデルをローカルで使用し、音声入力を任意のフォーカスされたアプリケーションにタイプする無料のオープンソース音声テキスト変換アプリです。現在はWindows専用で、コマンドラインでのセットアップが必要です。

OpenClawビデオ翻訳スキルがClawHubで利用可能になりました
OpenClawエージェント向けの新しいVideo Translatorスキルにより、ユーザーは動画をアップロードするかURLを提供することで、翻訳されたプレビューを即座に取得できます。このスキルはClawHubでホストされています。

Oodle.ai、エージェントの可観測性を100万トレースあたり10ドルで提供開始
Oodle.aiは、エージェントトレースを100万スパンあたり10ドルで提供し、サブ秒のP99クエリレイテンシを実現。サンプリングなしで全トレースをS3ベースのカラムナストレージに保存します。

VSCodiumでローカルのOllamaモデルを使用するOpenAI Codex IDEの活用
OpenAI Codex IDEは、config.tomlファイル内の特定の設定を使用して、VSCodiumでローカルのOllamaモデルと連携するように設定できます。