FairyFuse réalise un accélération de 29,6x du noyau sur les CPU grâce à une inférence sans multiplication de poids ternaire

✍️ OpenClawRadar📅 Publié: May 13, 2026🔗 Source
Ad

FairyFuse est un système d'inférence pour les LLM ternaires (valeurs dans {-1,0,+1}) sur CPU grand public. En fusionnant les huit sous-GEMV réels de chaque couche largement linéaire en une seule boucle AVX-512 utilisant des additions et soustractions masquées, il élimine toutes les multiplications en virgule flottante. L'analyse roofline montre qu'une compression de poids 16x déplace les GEMV limités par la mémoire vers le régime de calcul sur les CPU à bande passante limitée, offrant un gain de vitesse du noyau de 29,6x par rapport aux noyaux conventionnels de déquantification et multiplication. Notamment, l'approche offre peu d'avantages sur GPU.

Ad

Résultats clés

  • Débit de bout en bout : 32,4 tokens par seconde sur un seul Intel Xeon 8558P.
  • Comparaison avec llama.cpp Q4_K_M : 1,24x plus rapide avec une qualité quasi sans perte (perplexité WikiText-2 5,52 contre 5,47 pour FP16 ; précision en aval 66,0% contre 66,0% FP16).
  • Compression des poids : 16x (2 bits par poids) grâce à la représentation ternaire — aucune déquantification en FP nécessaire.
  • Technique : Fusionne huit sous-GEMV en une seule boucle AVX-512 utilisant des additions/soustractions masquées — aucune multiplication en virgule flottante du tout.

Contexte

Des travaux antérieurs (Fairy2i) ont montré que les LLM ternaires peuvent égaler la qualité FP16, mais l'exécution n'exploitait pas la structure. FairyFuse comble cette lacune en réarchitecturant l'inférence pour qu'elle soit sans multiplication sur les CPU x86 avec AVX-512.

📖 Lire la source complète : HN LLM Tools

Ad

👀 See Also

Définir les agents d'IA : Le test du flux de travail
News

Définir les agents d'IA : Le test du flux de travail

Une discussion sur Reddit s'interroge sur le fait que de nombreux produits d'agents IA sont essentiellement des chatbots avec une liste de tâches, proposant un test basé sur leur capacité à exécuter des flux de travail à travers plusieurs outils sans intervention manuelle.

OpenClawRadar
MicroVMs AWS Lambda : isolement au niveau VM pour le code utilisateur et généré par l'IA, avec suspension/reprise jusqu'à 8 heures
News

MicroVMs AWS Lambda : isolement au niveau VM pour le code utilisateur et généré par l'IA, avec suspension/reprise jusqu'à 8 heures

AWS lance Lambda MicroVMs, une primitive de calcul serverless basée sur Firecracker, offrant une isolation VM par utilisateur, un lancement quasi instantané et une conservation d'état jusqu'à 8 heures pour exécuter du code utilisateur ou généré par IA.

OpenClawRadar
Rapport 2026 sur l'Indice de l'IA de Stanford : Tendances clés en matière d'investissement, de modèles et de perception publique
News

Rapport 2026 sur l'Indice de l'IA de Stanford : Tendances clés en matière d'investissement, de modèles et de perception publique

Le rapport 2026 sur l'indice de l'IA de Stanford montre que les investissements dans l'IA montent en flèche, tandis que l'impact sur l'emploi et la perception du public reste mitigé. Les entreprises américaines ont publié 50 modèles d'IA notables en 2025, la Chine réduisant son retard.

OpenClawRadar
Minimax M2.7 et passage à l'échelle de plus de 100 000 instances OpenClaw abordés lors de la session Écosystème
News

Minimax M2.7 et passage à l'échelle de plus de 100 000 instances OpenClaw abordés lors de la session Écosystème

Jim et AndyML ont accueilli l'équipe Minimax pour discuter de Minimax M2.7 et de la manière dont ils ont mis à l'échelle leur environnement d'hébergement pour prendre en charge plus de 100 000 instances OpenClaw. La session a attiré 100 à 110 utilisateurs de Discord et plus de 350 000 spectateurs sur une diffusion simultanée chinoise.

OpenClawRadar