NexQuant: Rust-native 3-Bit-KV-Cache-Engine für Edge-Bereitstellung

✍️ OpenClawRadar📅 Veröffentlicht: 2. April 2026🔗 Source
NexQuant: Rust-native 3-Bit-KV-Cache-Engine für Edge-Bereitstellung
Ad

NexQuant ist eine in Rust native Engine zum Ausführen von Modellen mit hohem Kontext auf Consumer-Hardware, die normalerweise mit Speicherbeschränkungen kämpfen würde. Sie wird als produktionserprobter Nachfolger von Tom Turneys TurboQuant+-Forschung positioniert.

Wichtige technische Details

  • 3-5-fache Speicherreduzierung: 14B-Modelle passen jetzt in 4 GB VRAM oder Unified Memory
  • Nur-MSE-Stabilität: Ersetzt verrauschte QJL-Pfade durch eine stabile Nur-MSE-Trajektorie (27/27 Logiktests bestanden)
  • Integrierte Sparse-V: Sparsity ist in die Echtzeit-Decode-Schleife integriert und nicht nur eine Benchmark-Funktion
  • Zero-Alloc-Prefill: Zu 100 % in sicherem Rust geschrieben für Geschwindigkeit ohne C++-Prototyp-Segfault-Probleme
  • Hardware-Unterstützung: Native Runtime-Dispatch für Metal, CUDA und Vulkan, mit CPU-AVX2/NEON-Backend-Unterstützung für ältere Laptops und Raspberry Pi
Ad

Implementierungsspezifika

Das Projekt verwendet Walsh-Hadamard-Transformationen und Rust-GGUF-Parsing. Es baut auf Tom Turneys PolarQuant/TurboQuant+-Durchbrüchen auf, die bewiesen, dass 3-Bit-KV-Caches mathematisch möglich sind. Die Entwicklung beinhaltete Claude (Anthropic) als Hochgeschwindigkeits-Pair-Programmierer.

Das Ziel ist sicherzustellen, dass mit wachsenden Modellen die Fähigkeit, sie auszuführen, lokal und dezentralisiert bleibt. Das Team sucht speziell Feedback zu Vulkan-SPIR-V-Kerneln.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude für Designarbeit: Wie man die immer gleichen Geschmacksdebatten in jeder Sitzung beendet
Werkzeuge

Claude für Designarbeit: Wie man die immer gleichen Geschmacksdebatten in jeder Sitzung beendet

Ein Entwickler, der über Claude Kundenprojekte betreut, beschreibt das Kernproblem: Claude hat kein Gedächtnis für abgelehnte Designentscheidungen, was zu generischen Ergebnissen und inkonsistenter Markenidentität führt.

OpenClawRadar
LivingAgents.ai: Eine webbasierte KI-Agenten-Simulation mit der Claude API
Werkzeuge

LivingAgents.ai: Eine webbasierte KI-Agenten-Simulation mit der Claude API

LivingAgents.ai ist eine webbasierte Simulation, bei der jeder Agent von der Claude API angetrieben wird und Aktionen wie Sammeln, Handeln, Herstellen, Angreifen, Fortpflanzen und dauerhaftes Sterben ausführt, wobei jede Aktion einen echten LLM-Aufruf erfordert.

OpenClawRadar
InsForge: Selbst gehostetes Postgres-Backend mit MCP-Integration für KI-Coding-Agenten
Werkzeuge

InsForge: Selbst gehostetes Postgres-Backend mit MCP-Integration für KI-Coding-Agenten

InsForge ist eine Open-Source, selbst gehostete Backend-Alternative zu Supabase, die über MCP mit Claude Code verbunden ist und es KI-Agenten ermöglicht, Schema, Richtlinien und Dienstzustand einzusehen. Es umfasst PostgreSQL 16.4, PostgREST, Deno Runtime, Authentifizierung, Speicher und Edge-Funktionen.

OpenClawRadar
ClawMetry: Open-Source Observability-Dashboard für OpenClaw-Agenten
Werkzeuge

ClawMetry: Open-Source Observability-Dashboard für OpenClaw-Agenten

ClawMetry ist ein Open-Source-Observability-Dashboard für OpenClaw-Agenten, das Live-Sitzungsaktivitäten, Token-Kostenverfolgung, Erkennung von Speicherdateiänderungen und Warnungen bei festhängenden Sitzungen bietet. Es läuft lokal mit pip install clawmetry und wurde selbst mit OpenClaw entwickelt.

OpenClawRadar