NexQuant: Motor de caché KV de 3 bits nativo en Rust para implementación en el edge

✍️ OpenClawRadar📅 Publicado: 2 de abril de 2026🔗 Source
NexQuant: Motor de caché KV de 3 bits nativo en Rust para implementación en el edge
Ad

NexQuant es un motor nativo en Rust para ejecutar modelos de alto contexto en hardware de consumo que normalmente tendría dificultades con las limitaciones de memoria. Se posiciona como un sucesor optimizado para producción de la investigación TurboQuant+ de Tom Turney.

Detalles técnicos clave

  • Reducción de Memoria 3-5x: Los modelos de 14B ahora caben en 4GB de VRAM o memoria unificada
  • Estabilidad Solo-MSE: Reemplaza rutas QJL ruidosas con trayectoria estable solo-MSE (27/27 pruebas lógicas aprobadas)
  • Sparse-V Integrado: La dispersión se integra en el bucle de decodificación en tiempo real en lugar de ser solo una característica de referencia
  • Prefill Sin Asignación: Escrito en 100% Rust Seguro para velocidad sin problemas de fallos de segmentación de prototipos C++
  • Soporte de Hardware: Despacho de tiempo de ejecución nativo para Metal, CUDA y Vulkan, con soporte de backend CPU-AVX2/NEON para portátiles antiguos y Raspberry Pi
Ad

Especificaciones de implementación

El proyecto utiliza Transformadas de Walsh-Hadamard y análisis GGUF en Rust. Se basa en los avances PolarQuant/TurboQuant+ de Tom Turney que demostraron que las cachés KV de 3 bits eran matemáticamente posibles. El desarrollo involucró a Claude (Anthropic) como programador pareado de alta velocidad.

El objetivo es garantizar que, a medida que los modelos escalan, la capacidad de ejecutarlos permanezca local y descentralizada. El equipo busca específicamente comentarios sobre los kernels Vulkan SPIR-V.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Conocimiento Cuervo: Una Plataforma de Base de Conocimiento Independiente del Modelo, Construida con Claude Code
Herramientas

Conocimiento Cuervo: Una Plataforma de Base de Conocimiento Independiente del Modelo, Construida con Claude Code

Knowledge Raven es una plataforma de base de conocimiento que permite a cualquier LLM compatible con MCP (Claude, GPT, etc.) buscar documentos de la empresa y recuperar secciones específicas con citas de origen. La plataforma funciona como una memoria estructurada y con gestión de permisos para asistentes de IA.

OpenClawRadar
Habilidades de Investigación Académica para Claude Code: Un Flujo de Trabajo Humano en el Ciclo para la Redacción de Artículos
Herramientas

Habilidades de Investigación Académica para Claude Code: Un Flujo de Trabajo Humano en el Ciclo para la Redacción de Artículos

Academic Research Skills (ARS) v3.7.0+ es un plugin para Claude Code que automatiza la búsqueda de referencias, el formateo de citas, la verificación de datos y la revisión de consistencia lógica, manteniendo al investigador humano al mando. Instálalo a través de /plugin marketplace add Imbad0202/academic-research-skills.

OpenClawRadar
Creación de una aplicación local de voz a texto para macOS con Claude Code: Caso de estudio de Vext
Herramientas

Creación de una aplicación local de voz a texto para macOS con Claude Code: Caso de estudio de Vext

Un desarrollador pasó 3 meses construyendo Vext, una aplicación de voz a texto para macOS que usa Whisper en Apple Neural Engine. Claude Code ayudó con FFI entre Rust y Swift, optimización de Core ML y la arquitectura de atajos de teclado. La aplicación funciona 100% sin conexión, transcribe 60 segundos de audio en ~400ms.

OpenClawRadar
Gestión de Múltiples Tareas de Agentes de IA con Tableros Kanban
Herramientas

Gestión de Múltiples Tareas de Agentes de IA con Tableros Kanban

Un desarrollador comparte su experiencia ejecutando múltiples agentes de IA Claude en pestañas de terminal e identifica tres desafíos clave en el flujo de trabajo: falta de visibilidad del progreso, pérdida de contexto al cambiar entre tareas e interrupciones por límites de tasa. Su solución implica tratar las tareas de IA como elementos de trabajo en un tablero Kanban.

OpenClawRadar