NexQuant: Rust-native 3-Bit-KV-Cache-Engine für Edge-Bereitstellung

✍️ OpenClawRadar📅 Veröffentlicht: 2. April 2026🔗 Source
NexQuant: Rust-native 3-Bit-KV-Cache-Engine für Edge-Bereitstellung
Ad

NexQuant ist eine in Rust native Engine zum Ausführen von Modellen mit hohem Kontext auf Consumer-Hardware, die normalerweise mit Speicherbeschränkungen kämpfen würde. Sie wird als produktionserprobter Nachfolger von Tom Turneys TurboQuant+-Forschung positioniert.

Wichtige technische Details

  • 3-5-fache Speicherreduzierung: 14B-Modelle passen jetzt in 4 GB VRAM oder Unified Memory
  • Nur-MSE-Stabilität: Ersetzt verrauschte QJL-Pfade durch eine stabile Nur-MSE-Trajektorie (27/27 Logiktests bestanden)
  • Integrierte Sparse-V: Sparsity ist in die Echtzeit-Decode-Schleife integriert und nicht nur eine Benchmark-Funktion
  • Zero-Alloc-Prefill: Zu 100 % in sicherem Rust geschrieben für Geschwindigkeit ohne C++-Prototyp-Segfault-Probleme
  • Hardware-Unterstützung: Native Runtime-Dispatch für Metal, CUDA und Vulkan, mit CPU-AVX2/NEON-Backend-Unterstützung für ältere Laptops und Raspberry Pi
Ad

Implementierungsspezifika

Das Projekt verwendet Walsh-Hadamard-Transformationen und Rust-GGUF-Parsing. Es baut auf Tom Turneys PolarQuant/TurboQuant+-Durchbrüchen auf, die bewiesen, dass 3-Bit-KV-Caches mathematisch möglich sind. Die Entwicklung beinhaltete Claude (Anthropic) als Hochgeschwindigkeits-Pair-Programmierer.

Das Ziel ist sicherzustellen, dass mit wachsenden Modellen die Fähigkeit, sie auszuführen, lokal und dezentralisiert bleibt. Das Team sucht speziell Feedback zu Vulkan-SPIR-V-Kerneln.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch