NexQuant: Motor de cache KV de 3 bits nativo em Rust para implantação em borda

✍️ OpenClawRadar📅 Publicado: April 2, 2026🔗 Source
NexQuant: Motor de cache KV de 3 bits nativo em Rust para implantação em borda
Ad

NexQuant é um mecanismo nativo em Rust para executar modelos de alto contexto em hardware de consumo que normalmente teria dificuldades com restrições de memória. Ele é posicionado como um sucessor robusto para produção da pesquisa TurboQuant+ de Tom Turney.

Detalhes técnicos principais

  • Redução de Memória 3-5x: Modelos de 14B agora cabem em 4GB de VRAM ou memória unificada
  • Estabilidade Apenas MSE: Substitui caminhos QJL ruidosos por trajetória estável apenas MSE (27/27 testes lógicos passados)
  • Sparse-V Integrado: A esparsidade é integrada no loop de decodificação em tempo real, não apenas sendo um recurso de benchmark
  • Prefill Sem Alocação: Escrito em 100% Rust Seguro para velocidade sem problemas de segfault do protótipo C++
  • Suporte de Hardware: Despacho de runtime nativo para Metal, CUDA e Vulkan, com suporte de backend CPU-AVX2/NEON para laptops antigos e Raspberry Pi
Ad

Especificidades de implementação

O projeto usa Transformadas de Walsh-Hadamard e análise GGUF em Rust. Ele se baseia nos avanços PolarQuant/TurboQuant+ de Tom Turney que provaram que caches KV de 3 bits eram matematicamente possíveis. O desenvolvimento envolveu Claude (Anthropic) como um programador em par de alta velocidade.

O objetivo é garantir que, à medida que os modelos escalam, a capacidade de executá-los permaneça local e descentralizada. A equipe está especificamente buscando feedback sobre kernels Vulkan SPIR-V.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Redutor de Tokens: Um Plugin de Código Claude para Compressão Inteligente de Contexto
Tools

Redutor de Tokens: Um Plugin de Código Claude para Compressão Inteligente de Contexto

Token Reducer é um plugin do Claude Code que processa o contexto do repositório localmente para reduzir o uso de tokens em 90-98% usando segmentação baseada em AST, recuperação híbrida e compressão TextRank. É licenciado sob MIT e disponível através do marketplace de plugins.

OpenClawRadar
Servidor MCP: Comparando LLMs Locais e na Nuvem com Recurso de Debate
Tools

Servidor MCP: Comparando LLMs Locais e na Nuvem com Recurso de Debate

O servidor MCP permite que os desenvolvedores consultem modelos locais via Ollama juntamente com vários LLMs na nuvem, oferecendo recursos como comparação lado a lado e uma função de debate estruturado.

OpenClawRadar
🦀
Tools

Netlify testa 11 modelos de IA para codificação: Qual é o melhor?

A Netlify executou prompts de codificação idênticos em 11 modelos de IA, revelando grandes diferenças nos resultados e custos de créditos. Veja o que descobriram antes de escolher seu próximo agente de codificação.

OpenClawRadar
skillcheck: Um linter para arquivos SKILL.md que detecta problemas de compatibilidade entre agentes
Tools

skillcheck: Um linter para arquivos SKILL.md que detecta problemas de compatibilidade entre agentes

skillcheck é uma ferramenta Python que valida arquivos SKILL.md de acordo com a especificação agentskills.io, com recursos exclusivos incluindo pontuação de qualidade da descrição, avisos sobre campos exclusivos do Claude e validação de referências de arquivo que não estão disponíveis em validadores existentes.

OpenClawRadar