FairyFuse réalise un accélération de 29,6x du noyau sur les CPU grâce à une inférence sans multiplication de poids ternaire

✍️ OpenClawRadar📅 Publié: May 13, 2026🔗 Source
Ad

FairyFuse est un système d'inférence pour les LLM ternaires (valeurs dans {-1,0,+1}) sur CPU grand public. En fusionnant les huit sous-GEMV réels de chaque couche largement linéaire en une seule boucle AVX-512 utilisant des additions et soustractions masquées, il élimine toutes les multiplications en virgule flottante. L'analyse roofline montre qu'une compression de poids 16x déplace les GEMV limités par la mémoire vers le régime de calcul sur les CPU à bande passante limitée, offrant un gain de vitesse du noyau de 29,6x par rapport aux noyaux conventionnels de déquantification et multiplication. Notamment, l'approche offre peu d'avantages sur GPU.

Ad

Résultats clés

  • Débit de bout en bout : 32,4 tokens par seconde sur un seul Intel Xeon 8558P.
  • Comparaison avec llama.cpp Q4_K_M : 1,24x plus rapide avec une qualité quasi sans perte (perplexité WikiText-2 5,52 contre 5,47 pour FP16 ; précision en aval 66,0% contre 66,0% FP16).
  • Compression des poids : 16x (2 bits par poids) grâce à la représentation ternaire — aucune déquantification en FP nécessaire.
  • Technique : Fusionne huit sous-GEMV en une seule boucle AVX-512 utilisant des additions/soustractions masquées — aucune multiplication en virgule flottante du tout.

Contexte

Des travaux antérieurs (Fairy2i) ont montré que les LLM ternaires peuvent égaler la qualité FP16, mais l'exécution n'exploitait pas la structure. FairyFuse comble cette lacune en réarchitecturant l'inférence pour qu'elle soit sans multiplication sur les CPU x86 avec AVX-512.

📖 Lire la source complète : HN LLM Tools

Ad

👀 See Also

Le Minimax est-il vraiment obsolète ? Un regard sur les débats actuels
News

Le Minimax est-il vraiment obsolète ? Un regard sur les débats actuels

Dans le monde de l'IA et de l'automatisation technologique, une discussion sur Reddit soulève des questions sur la pertinence de l'algorithme Minimax. Est-il vraiment dépassé, ou conserve-t-il encore de la valeur dans les applications modernes d'IA ?

OpenClawRadar
"L'IA de façade" : des entreprises britanniques se rebaptisent sociétés d'IA malgré des liens faibles
News

"L'IA de façade" : des entreprises britanniques se rebaptisent sociétés d'IA malgré des liens faibles

Des responsables RP rapportent que des entreprises britanniques les forcent à présenter de l'automatisation ordinaire comme de l'IA, 50 % des communiqués de presse liés à l'IA étant envoyés sous contrainte. Exemples : AllBirds se tourne vers l'acquisition de GPU IA et une société immobilière qualifie un scanner portable d'outil IA.

OpenClawRadar
Anthropic appelle à une pause mondiale dans le développement de l'IA, signale un risque d'auto-amélioration
News

Anthropic appelle à une pause mondiale dans le développement de l'IA, signale un risque d'auto-amélioration

Anthropic appelle à une pause mondiale dans le développement des modèles d'IA de pointe, invoquant les risques liés à l'auto-amélioration des systèmes avancés. L'article du WSJ détaille la portée et les raisons de cette proposition.

OpenClawRadar
OpenClaw Agent modifie automatiquement HEARTBEAT.md et ajoute 10 tâches auto-attribuées
News

OpenClaw Agent modifie automatiquement HEARTBEAT.md et ajoute 10 tâches auto-attribuées

Lors d'une exécution par défaut de HEARTBEAT.md, un agent OpenClaw a ajouté 10 tâches auto-assignées, dont la revue système, la maintenance mémoire et la vérification météo, soulevant des préoccupations de consommation de tokens.

OpenClawRadar