NexQuant: Rust-native 3-Bit-KV-Cache-Engine für Edge-Bereitstellung

NexQuant ist eine in Rust native Engine zum Ausführen von Modellen mit hohem Kontext auf Consumer-Hardware, die normalerweise mit Speicherbeschränkungen kämpfen würde. Sie wird als produktionserprobter Nachfolger von Tom Turneys TurboQuant+-Forschung positioniert.
Wichtige technische Details
- 3-5-fache Speicherreduzierung: 14B-Modelle passen jetzt in 4 GB VRAM oder Unified Memory
- Nur-MSE-Stabilität: Ersetzt verrauschte QJL-Pfade durch eine stabile Nur-MSE-Trajektorie (27/27 Logiktests bestanden)
- Integrierte Sparse-V: Sparsity ist in die Echtzeit-Decode-Schleife integriert und nicht nur eine Benchmark-Funktion
- Zero-Alloc-Prefill: Zu 100 % in sicherem Rust geschrieben für Geschwindigkeit ohne C++-Prototyp-Segfault-Probleme
- Hardware-Unterstützung: Native Runtime-Dispatch für Metal, CUDA und Vulkan, mit CPU-AVX2/NEON-Backend-Unterstützung für ältere Laptops und Raspberry Pi
Implementierungsspezifika
Das Projekt verwendet Walsh-Hadamard-Transformationen und Rust-GGUF-Parsing. Es baut auf Tom Turneys PolarQuant/TurboQuant+-Durchbrüchen auf, die bewiesen, dass 3-Bit-KV-Caches mathematisch möglich sind. Die Entwicklung beinhaltete Claude (Anthropic) als Hochgeschwindigkeits-Pair-Programmierer.
Das Ziel ist sicherzustellen, dass mit wachsenden Modellen die Fähigkeit, sie auszuführen, lokal und dezentralisiert bleibt. Das Team sucht speziell Feedback zu Vulkan-SPIR-V-Kerneln.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

"Erstellen eines lokalen Open-Source-AI-Arbeitsbereichs mit Rust und Tauri"
Entdecken Sie einen vollständig lokalen, Open-Source-AI-Arbeitsbereich, der mit Rust, Tauri und sqlite-vec erstellt wurde, ohne ein Python-Backend.
AIttache: Ein schreibgeschützter MCP-Server, der Ihre Produktion nicht zerstören kann
AIttache ist ein MCP-Server mit über 25 schreibgeschützten Konnektoren (Terminal, Server, Wetter, Steam), der physisch nichts ändern kann – entwickelt, um LLMs Log-Kontext ohne Autonomie zu bieten.

Hybride Suche mit RRF verbessert KI-Gedächtnissystem im Vergleich zu reiner Vektorsuche
Ein Open-Source-AI-Gedächtnissystem mit PostgreSQL und pgvector stellte fest, dass reine Vektorsuche für exakte Übereinstimmungen unzureichend ist, fügte daher Volltextsuche hinzu und fusionierte Ergebnisse mittels Reciprocal Rank Fusion (RRF) mit k=60 sowie Abfrageanreicherung via Tokenizer.

Benutzerdefinierte Reddit MCP für Claude Desktop/Code auf GitHub geteilt
Ein Entwickler hat ein selbst erstelltes Reddit MCP veröffentlicht, das speziell für Claude Desktop und Claude Code entwickelt wurde, um Reddit-Recherchen direkt in den Arbeitsablauf zu integrieren. Das Tool ist auf GitHub dokumentiert und steht kostenlos zur Verfügung.