FairyFuse logra una aceleración del kernel de 29.6x en CPUs mediante inferencia sin multiplicación de pesos ternarios
FairyFuse es un sistema de inferencia para LLM ternarios (valores en {-1,0,+1}) en CPUs comerciales. Al fusionar los ocho sub-GEMVs de valor real de cada capa ampliamente lineal en un único bucle AVX-512 mediante sumas y restas enmascaradas, elimina todas las multiplicaciones de punto flotante. El análisis roofline muestra que la compresión de pesos 16x desplaza el GEMV limitado por memoria hacia el régimen computacional en CPUs con ancho de banda limitado, logrando una aceleración del kernel de 29.6x sobre los kernels convencionales de des-cuantificar y multiplicar. Cabe destacar que el enfoque ofrece poco beneficio en GPUs.
Resultados Clave
- Rendimiento de extremo a extremo: 32.4 tokens por segundo en un solo Intel Xeon 8558P.
- Comparación con llama.cpp Q4_K_M: 1.24x más rápido con calidad casi sin pérdidas (perplejidad WikiText-2 5.52 vs. 5.47 para FP16; precisión downstream 66.0% vs. 66.0% FP16).
- Compresión de pesos: 16x (2 bits por peso) debido a la representación ternaria — sin necesidad de des-cuantificar a FP.
- Técnica: Fusiona ocho sub-GEMVs en un único bucle AVX-512 usando sumas/restas enmascaradas — sin multiplicaciones de punto flotante en absoluto.
Contexto
Trabajo previo (Fairy2i) mostró que los LLM ternarios pueden igualar la calidad FP16, pero el tiempo de ejecución no explotaba la estructura. FairyFuse cierra esa brecha rediseñando la inferencia para que esté libre de multiplicaciones en CPUs x86 con AVX-512.
📖 Lea la fuente completa: HN LLM Tools
👀 Ver también

Kimi K2.6 supera a Claude, GPT-5.5 y Gemini en desafío de codificación con estrategia de deslizamiento agresivo
En el Day 12 Word Gem Puzzle del AI Coding Contest, el Kimi K2.6 de pesos abiertos de Moonshot AI obtuvo 22 puntos de partido (7-1-0), superando a GPT-5.5 (16), Claude Opus 4.7 (12) y Gemini Pro 3.1 (9). MiMo V2-Pro quedó segundo. Kimi ganó deslizando agresivamente.

Claude Code v2.1.158: Modo Auto ahora en Bedrock, Vertex, Foundry para Opus 4.7/4.8
Claude Code v2.1.158 habilita el modo automático en Bedrock, Vertex y Foundry para Opus 4.7 y 4.8. Actívalo con CLAUDE_CODE_ENABLE_AUTO_MODE=1.

Se filtra el sistema operativo ligero basado en Edge con IA de Windows 11 no lanzado de Microsoft
Una filtración de una versión ligera de Windows 11 con IA de Microsoft integra Edge como componente central, dirigida a hardware de bajos recursos y flujos de trabajo impulsados por IA.

4 meses alcanzando $950 MRR construyendo un servidor MCP para Claude Code Intel
Un desarrollador solitario creó un servidor MCP para inteligencia de código fuente, alcanzó $950 MRR en 4 meses con 54 usuarios, trabajando 8-10 horas después de su trabajo diario. Sin anuncios, sin growth hacking — solo Reddit y Medium.