FairyFuse erreicht 29,6-fache Kernel-Beschleunigung auf CPUs durch ternäre gewichtsfreie Inferenz
FairyFuse ist ein Inferenzsystem für ternäre (Werte in {-1,0,+1}) LLMs auf handelsüblichen CPUs. Durch die Verschmelzung der acht reellwertigen Sub-GEMVs jeder breit-linearer Schicht zu einer einzigen AVX-512-Schleife mittels maskierter Additionen und Subtraktionen werden alle Gleitkomma-Multiplikationen eliminiert. Eine Roofline-Analyse zeigt, dass die 16-fache Gewichtskomprimierung den speichergebundenen GEMV auf bandbreitenbegrenzten CPUs in Richtung des Rechenregimes verschiebt, was einen 29,6-fachen Kernel-Beschleunigungsfaktor gegenüber herkömmlichen Dequantisierungs-und-Multiplikations-Kernels ergibt. Bemerkenswerterweise bietet der Ansatz auf GPUs kaum Vorteile.
Wichtigste Ergebnisse
- End-to-End-Durchsatz: 32,4 Tokens pro Sekunde auf einem einzelnen Intel Xeon 8558P.
- Vergleich mit llama.cpp Q4_K_M: 1,24-mal schneller bei nahezu verlustfreier Qualität (WikiText-2 Perplexität 5,52 gegenüber 5,47 für FP16; nachgelagerte Genauigkeit 66,0 % gegenüber 66,0 % FP16).
- Gewichtskomprimierung: 16-fach (2 Bit pro Gewicht) aufgrund der ternären Darstellung – keine Dequantisierung zu FP erforderlich.
- Technik: Verschmilzt acht Sub-GEMVs zu einer einzigen AVX-512-Schleife mittels maskierter Additionen/Subtraktionen – überhaupt keine Gleitkomma-Multiplikationen.
Kontext
Vorherige Arbeiten (Fairy2i) zeigten, dass ternäre LLMs die FP16-Qualität erreichen können, aber die Laufzeit nutzte die Struktur nicht aus. FairyFuse schließt diese Lücke, indem es die Inferenz auf x86-CPUs mit AVX-512 multiplikationsfrei neu gestaltet.
📖 Lesen Sie die vollständige Quelle: HN LLM Tools
👀 Siehe auch

OpenClaw 2026.3.24: Bridge-Konfiguration entfernt, Heartbeat-Token-Einsparungen, Schleifenerkennung
OpenClaw 2026.3.24 entfernt den veralteten Bridge-Konfigurationsabschnitt aus openclaw.json, fügt isolatedSession: true zur Heartbeat-Konfiguration hinzu, um die Tokenkosten von ~100K auf 2-5K pro Ausführung zu reduzieren, und führt neue Funktionen ein, darunter imageGenerationModel, tools.loopDetection, channels.modelByChannel, integrierte Modellaliase und pdfModel.

Der KI-Operator: Eine neue Rolle für agentische Workflows
Rish Gupta argumentiert, dass AI-Operatoren innerhalb eines Jahres die Schlüsselrolle in Organisationen sein werden, wobei sie technische Fähigkeiten (Python, LLM-APIs, Agent-Frameworks) mit Geschäftsprozessverständnis kombinieren, um repetitive und wirkungsvolle Aufgaben zu automatisieren.

SWE-rebench Leaderboard-Update: Ergebnisse vom Februar 2026 zeigen knappen Wettbewerb
Das SWE-rebench-Ranking wurde mit den Ergebnissen vom Februar 2026 aktualisiert, bei denen 57 neue GitHub-PR-Aufgaben getestet wurden. Claude Opus 4.6 führt mit einer Lösungsrate von 65,3 %, aber die sechs besten Modelle liegen innerhalb von 5 Prozentpunkten.

KI hat nicht deine Datenbank gelöscht – du warst es: Verantwortung im Zeitalter von KI-Code-Agenten
Eine virale Geschichte machte einen KI-Agenten dafür verantwortlich, eine Produktionsdatenbank gelöscht zu haben, aber das eigentliche Problem ist die Offenlegung destruktiver API-Endpunkte und fehlende Prozesse – nicht das Werkzeug.