FairyFuse alcança aceleração de kernel de 29,6x em CPUs através de inferência livre de multiplicação de pesos ternários
FairyFuse é um sistema de inferência para LLMs ternários (valores em {-1,0,+1}) em CPUs comuns. Ao fundir os oito sub-GEMVs de valor real de cada camada amplamente linear em um único loop AVX-512 usando adições e subtrações mascaradas, ele elimina todas as multiplicações de ponto flutuante. A análise Roofline mostra que a compressão de peso de 16x desloca o GEMV limitado pela memória para o regime computacional em CPUs com largura de banda limitada, resultando em um ganho de velocidade de kernel de 29,6x em relação aos kernels convencionais de desquantização e multiplicação. Notavelmente, a abordagem oferece pouco benefício em GPUs.
Principais Resultados
- Taxa de transferência ponta a ponta: 32,4 tokens por segundo em um único Intel Xeon 8558P.
- Comparação com llama.cpp Q4_K_M: 1,24x mais rápido com qualidade quase sem perdas (perplexidade WikiText-2 de 5,52 vs. 5,47 para FP16; precisão downstream de 66,0% vs. 66,0% FP16).
- Compressão de peso: 16x (2 bits por peso) devido à representação ternária — sem necessidade de desquantização para FP.
- Técnica: Funde oito sub-GEMVs em um único loop AVX-512 usando adições/subtrações mascaradas — sem multiplicações de ponto flutuante.
Contexto
Trabalhos anteriores (Fairy2i) mostraram que LLMs ternários podem igualar a qualidade FP16, mas o tempo de execução não explorava a estrutura. FairyFuse preenche essa lacuna ao rearquitetar a inferência para ser livre de multiplicações em CPUs x86 com AVX-512.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

IA escreveu um motor PHP em Rust, passa 17% dos testes do PHP-src, renderiza WordPress
Phargo, um interpretador PHP escrito do zero em Rust inteiramente por IA, passa em 3.844 dos 22.037 testes upstream do PHP (17,4%) e renderiza páginas do WordPress a partir do SQLite.

Por que todo cliente quer um chatbot agora (e por que é o novo carrossel)
Uma desenvolvedora relata a tendência de clientes exigirem chatbots de IA em sites, apesar de admitirem que os fecham imediatamente — paralelos com a era dos carrosséis.

Bug no Template de Chat do Gemma 4: Parâmetros de Ferramenta com anyOf/null Renderizados como Tipo Vazio
Um bug no template de chat do Gemma 4 remove $ref, anyOf e $defs dos esquemas de parâmetros de ferramentas, tornando referências anuláveis como campos de tipo vazios. Uma correção no Jinja restaura a análise correta do esquema para todos os mecanismos de inferência.

Benchmarks de desempenho do Qwen3.5-27B-FP8 com agentes OpenClaw
Testes mostram que o Qwen3.5-27B-FP8 pode executar seis agentes OpenClaw simultaneamente com a taxa de transferência escalando para 120 tokens/segundo. O framework SGLang com cache de prefixo reduz o pré-preenchimento de contexto de 100K de 10 segundos para 200ms.