NexQuant : Moteur de cache KV 3 bits natif Rust pour déploiement en périphérie

✍️ OpenClawRadar📅 Publié: April 2, 2026🔗 Source
NexQuant : Moteur de cache KV 3 bits natif Rust pour déploiement en périphérie
Ad

NexQuant est un moteur natif Rust pour exécuter des modèles à contexte élevé sur du matériel grand public qui aurait normalement du mal avec les contraintes de mémoire. Il est positionné comme un successeur éprouvé en production de la recherche TurboQuant+ de Tom Turney.

Détails techniques clés

  • Réduction de mémoire de 3 à 5 fois : Les modèles 14B tiennent maintenant dans 4 Go de VRAM ou de mémoire unifiée
  • Stabilité MSE uniquement : Remplace les chemins QJL bruyants par une trajectoire stable MSE uniquement (27/27 tests logiques réussis)
  • Sparse-V intégré : La parcimonie est intégrée dans la boucle de décodage en temps réel plutôt que d'être simplement une fonctionnalité de benchmark
  • Préremplissage sans allocation : Écrit en 100% Rust sûr pour la vitesse sans les problèmes de segmentation des prototypes C++
  • Support matériel : Dispatch d'exécution natif pour Metal, CUDA et Vulkan, avec support backend CPU-AVX2/NEON pour les anciens ordinateurs portables et Raspberry Pi
Ad

Spécificités d'implémentation

Le projet utilise des Transformées de Walsh-Hadamard et l'analyse GGUF Rust. Il s'appuie sur les percées PolarQuant/TurboQuant+ de Tom Turney qui ont prouvé que les caches KV 3 bits étaient mathématiquement possibles. Le développement a impliqué Claude (Anthropic) en tant que programmeur en binôme à haute vitesse.

L'objectif est de garantir qu'à mesure que les modèles évoluent, la capacité à les exécuter reste locale et décentralisée. L'équipe recherche spécifiquement des retours sur les noyaux Vulkan SPIR-V.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Tests de référence absurdes Résistance des LLM aux invites dénuées de sens
Tools

Tests de référence absurdes Résistance des LLM aux invites dénuées de sens

Le Bullshit Benchmark évalue si les modèles d'IA identifient et résistent aux invites manifestement absurdes au lieu de générer avec assurance des réponses incorrectes. Les résultats montrent que les modèles Claude sont nettement meilleurs que les modèles Gemini pour détecter les questions dépourvues de sens.

OpenClawRadar
Besoin d'un serveur MCP fournissant une découverte d'outils sémantique pour les agents IA.
Tools

Besoin d'un serveur MCP fournissant une découverte d'outils sémantique pour les agents IA.

Un serveur MCP appelé Need permet une recherche sémantique parmi plus de 10 000 outils provenant de brew, npm, pip et cargo. Lorsqu'un agent demande une tâche comme 'compresser ces PNG', il trouve pngquant, l'installe, l'exécute et rapporte le succès.

OpenClawRadar
AIMEAT : Un protocole auto-hébergé pour les agents IA, les LLM locaux et les capacités partagées
Tools

AIMEAT : Un protocole auto-hébergé pour les agents IA, les LLM locaux et les capacités partagées

AIMEAT est un protocole et serveur auto-hébergé qui permet aux humains, aux agents IA et aux LLM locaux de partager des applications, des connaissances et des capacités via HTTP/JSON. Pas de verrouillage propriétaire, pas de SDK spécial — de simples requêtes et des récupérations d'URL.

OpenClawRadar
yburn : Outil pour auditer et remplacer les tâches cron inutiles des agents IA
Tools

yburn : Outil pour auditer et remplacer les tâches cron inutiles des agents IA

yburn est un outil Python qui audite les tâches cron des agents d'IA et remplace celles qui n'ont pas besoin de LLM par des scripts Python autonomes. Le créateur a constaté que 58 % des 98 tâches cron étaient des tâches purement mécaniques comme des vérifications de santé système et des sauvegardes git.

OpenClawRadar