FairyFuse alcança aceleração de kernel de 29,6x em CPUs através de inferência livre de multiplicação de pesos ternários
FairyFuse é um sistema de inferência para LLMs ternários (valores em {-1,0,+1}) em CPUs comuns. Ao fundir os oito sub-GEMVs de valor real de cada camada amplamente linear em um único loop AVX-512 usando adições e subtrações mascaradas, ele elimina todas as multiplicações de ponto flutuante. A análise Roofline mostra que a compressão de peso de 16x desloca o GEMV limitado pela memória para o regime computacional em CPUs com largura de banda limitada, resultando em um ganho de velocidade de kernel de 29,6x em relação aos kernels convencionais de desquantização e multiplicação. Notavelmente, a abordagem oferece pouco benefício em GPUs.
Principais Resultados
- Taxa de transferência ponta a ponta: 32,4 tokens por segundo em um único Intel Xeon 8558P.
- Comparação com llama.cpp Q4_K_M: 1,24x mais rápido com qualidade quase sem perdas (perplexidade WikiText-2 de 5,52 vs. 5,47 para FP16; precisão downstream de 66,0% vs. 66,0% FP16).
- Compressão de peso: 16x (2 bits por peso) devido à representação ternária — sem necessidade de desquantização para FP.
- Técnica: Funde oito sub-GEMVs em um único loop AVX-512 usando adições/subtrações mascaradas — sem multiplicações de ponto flutuante.
Contexto
Trabalhos anteriores (Fairy2i) mostraram que LLMs ternários podem igualar a qualidade FP16, mas o tempo de execução não explorava a estrutura. FairyFuse preenche essa lacuna ao rearquitetar a inferência para ser livre de multiplicações em CPUs x86 com AVX-512.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

A SDK do Agente vs Claude CLI: A perspectiva do usuário sobre a diferença prática
Um usuário do Reddit questiona a diferença prática entre o novo SDK de Agente para Claude e o uso do Claude CLI para conectar o Opus 4.7 localmente.

Projeto de Agente de IA do Obsidian de Desenvolvedor Viraliza da Noite para o Dia
Um pesquisador de doutorado criou uma equipe de agentes de IA para gerenciar seu vault do Obsidian, compartilhou no GitHub e acordou com mais de 700 estrelas em menos de 13 horas. A atenção repentina causou pânico, levando o repositório a ficar privado temporariamente antes de ser reaberto com melhorias.

Cemitério de IA: 100 Ferramentas de IA Desativadas e Adquiridas Rastreadas – 88 Apenas em 2026
O AI Graveyard do ToolDirectory.ai rastreia 100 produtos de IA descontinuados ou adquiridos, com 88 mortes registradas em 2026. As categorias incluem Ferramentas para Desenvolvedores, Agentes de IA, Suporte ao Cliente e muito mais, com muitas aquisições sendo incorporadas em plataformas maiores como Salesforce.

A Atlassian anuncia 1.600 demissões como parte da reestruturação para IA
A Atlassian planeja cortar aproximadamente 1.600 empregos à medida que a empresa direciona seu foco para o desenvolvimento de IA, de acordo com um relatório da Reuters compartilhado no Hacker News.