FairyFuse logra una aceleración del kernel de 29.6x en CPUs mediante inferencia sin multiplicación de pesos ternarios
FairyFuse es un sistema de inferencia para LLM ternarios (valores en {-1,0,+1}) en CPUs comerciales. Al fusionar los ocho sub-GEMVs de valor real de cada capa ampliamente lineal en un único bucle AVX-512 mediante sumas y restas enmascaradas, elimina todas las multiplicaciones de punto flotante. El análisis roofline muestra que la compresión de pesos 16x desplaza el GEMV limitado por memoria hacia el régimen computacional en CPUs con ancho de banda limitado, logrando una aceleración del kernel de 29.6x sobre los kernels convencionales de des-cuantificar y multiplicar. Cabe destacar que el enfoque ofrece poco beneficio en GPUs.
Resultados Clave
- Rendimiento de extremo a extremo: 32.4 tokens por segundo en un solo Intel Xeon 8558P.
- Comparación con llama.cpp Q4_K_M: 1.24x más rápido con calidad casi sin pérdidas (perplejidad WikiText-2 5.52 vs. 5.47 para FP16; precisión downstream 66.0% vs. 66.0% FP16).
- Compresión de pesos: 16x (2 bits por peso) debido a la representación ternaria — sin necesidad de des-cuantificar a FP.
- Técnica: Fusiona ocho sub-GEMVs en un único bucle AVX-512 usando sumas/restas enmascaradas — sin multiplicaciones de punto flotante en absoluto.
Contexto
Trabajo previo (Fairy2i) mostró que los LLM ternarios pueden igualar la calidad FP16, pero el tiempo de ejecución no explotaba la estructura. FairyFuse cierra esa brecha rediseñando la inferencia para que esté libre de multiplicaciones en CPUs x86 con AVX-512.
📖 Lea la fuente completa: HN LLM Tools
👀 Ver también
Ejecutivo de Microsoft llamó al scraping de IA "el mayor robo de trabajo en la historia de la humanidad", muestran documentos sin censura del caso NYT contra OpenAI
Documentos recién desclasificados en la demanda por derechos de autor de The New York Times contra OpenAI y Microsoft citan a un director de Microsoft calificando el scraping como "el mayor robo de mano de obra en la historia de la humanidad". Datos internos también muestran que Copilot redujo los clics en NYT hasta un 93%.

Anthropic lanza Claude Code Remote Control para desarrollo móvil.
Anthropic ha lanzado Remote Control, una función que permite a los usuarios de Claude Code controlar sus sesiones de desarrollo local desde dispositivos móviles. Disponible inicialmente para suscriptores de Claude Max, requiere la versión 2.1.52 y utiliza un código QR para sincronizar sesiones.

TranslateGemma-12b: La revisión humana detecta el 71% de errores que pasan desapercibidos para las métricas automatizadas
Una auditoría humana MQM marcó el 71% de los segmentos de traducción que las métricas automatizadas calificaron como limpios, y todos los 25 errores de precisión estaban en el cuadrante ciego a las métricas.

Claude Code v2.1.214 publicado: Trazado OTel, correcciones de permisos, herramienta EndConversation y protección Docker
Anthropic lanzó Claude Code v2.1.214 con correcciones críticas de permisos para Bash y PowerShell, nuevos atributos OpenTelemetry, indicaciones de Docker y la herramienta EndConversation para usuarios abusivos.