FairyFuse alcança aceleração de kernel de 29,6x em CPUs através de inferência livre de multiplicação de pesos ternários

✍️ OpenClawRadar📅 Publicado: May 13, 2026🔗 Source
Ad

FairyFuse é um sistema de inferência para LLMs ternários (valores em {-1,0,+1}) em CPUs comuns. Ao fundir os oito sub-GEMVs de valor real de cada camada amplamente linear em um único loop AVX-512 usando adições e subtrações mascaradas, ele elimina todas as multiplicações de ponto flutuante. A análise Roofline mostra que a compressão de peso de 16x desloca o GEMV limitado pela memória para o regime computacional em CPUs com largura de banda limitada, resultando em um ganho de velocidade de kernel de 29,6x em relação aos kernels convencionais de desquantização e multiplicação. Notavelmente, a abordagem oferece pouco benefício em GPUs.

Ad

Principais Resultados

  • Taxa de transferência ponta a ponta: 32,4 tokens por segundo em um único Intel Xeon 8558P.
  • Comparação com llama.cpp Q4_K_M: 1,24x mais rápido com qualidade quase sem perdas (perplexidade WikiText-2 de 5,52 vs. 5,47 para FP16; precisão downstream de 66,0% vs. 66,0% FP16).
  • Compressão de peso: 16x (2 bits por peso) devido à representação ternária — sem necessidade de desquantização para FP.
  • Técnica: Funde oito sub-GEMVs em um único loop AVX-512 usando adições/subtrações mascaradas — sem multiplicações de ponto flutuante.

Contexto

Trabalhos anteriores (Fairy2i) mostraram que LLMs ternários podem igualar a qualidade FP16, mas o tempo de execução não explorava a estrutura. FairyFuse preenche essa lacuna ao rearquitetar a inferência para ser livre de multiplicações em CPUs x86 com AVX-512.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also