Qwen 3.6 27B Quantisierungs-Benchmark: Q4_K_M schlägt Q8_0 bei praktischen Abwägungen

Ein Reddit-Benutzer hat Qwen 3.6 27B in drei GGUF-Quantisierungsvarianten (BF16, Q4_K_M, Q8_0) mit llama-cpp-python über das Neo AI Engineer-Framework getestet. Die Auswertung umfasste insgesamt 664 Stichproben in drei Aufgaben: HumanEval (Codegenerierung, 164 Stichproben), HellaSwag (gesunder Menschenverstand, 100 Stichproben) und BFCL (Funktionsaufruf, 400 Stichproben).
Testergebnisse
- BF16 (Modellgröße 53,8 GB, Spitzen-RAM 54 GB, Durchsatz 15,5 tok/s): HumanEval 56,10 % (92/164), HellaSwag 90,00 % (90/100), BFCL 63,25 % (253/400). Durchschnittliche Genauigkeit: 69,78 %.
- Q4_K_M (16,8 GB, 28 GB RAM, 22,5 tok/s): HumanEval 50,61 % (83/164), HellaSwag 86,00 % (86/100), BFCL 63,00 % (252/400). Durchschnitt: 66,54 %.
- Q8_0 (28,6 GB, 42 GB RAM, 18,0 tok/s): HumanEval 52,44 % (86/164), HellaSwag 83,00 % (83/100), BFCL 63,00 % (252/400). Durchschnitt: 66,15 %.
Wichtige Erkenntnisse
Q4_K_M ist die herausragende praktische Variante. Sie bewahrt die BFCL-Genauigkeit (63,00 % vs. 63,25 %), verliert nur etwa 5,5 Punkte bei HumanEval und liegt bei HellaSwag etwa 4 Punkte hinter BF16. Die Kompromisse: 1,45-mal schneller als BF16, 48 % weniger Spitzen-RAM, 68,8 % kleinere Datei und nahezu identische Funktionsaufrufleistung. Q8_0 war enttäuschend: Es verbesserte HumanEval nur um etwa 1,8 Punkte gegenüber Q4_K_M, benötigte aber 42 GB RAM statt 28 GB, war langsamer und erzielte bei HellaSwag niedrigere Werte.
Für lokale/CPU-Bereitstellung wird Q4_K_M empfohlen, es sei denn, die Arbeitslast konzentriert sich stark auf Codegenerierung. Für maximale Qualität gewinnt immer noch BF16.
Testaufbau
GGUF-Varianten über llama-cpp-python mit n_ctx: 32768, kontrollierte Auswertung. Das Neo AI Engineer Framework erstellte die GGUF-Auswertungspipeline, führte kontrollierte Läufe durch und fasste die Ergebnisse zusammen. Eine vollständige Fallstudie mit Codeausschnitten ist in den ursprünglichen Reddit-Kommentaren verlinkt.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Attesor: KI-gestützte Reverse-Engineering von Rosetta 2 für Linux-VM
Attesor ist ein GitHub-Projekt, das KI nutzt, um Apples Rosetta-2-Binärübersetzungstechnologie zu reverse-engineern. Es zielt darauf ab, deren Architektur zu dokumentieren und möglicherweise x86_64-zu-ARM64-Übersetzung auf Linux-Virtual-Machines zu ermöglichen.

First-Tree: Open-Source-Daemon, der Claude Code nutzt, um GitHub-Benachrichtigungen während des Schlafs zu priorisieren
Ein Open-Source-Menüleisten-Daemon, der Claude Code verwendet, um GitHub-Benachrichtigungen autonom zu priorisieren – bei einem kürzlichen Scan wurden 98 von 100 Benachrichtigungen bearbeitet, nur 2 blieben für die manuelle Überprüfung übrig.

Fantastisches OpenClaw-Fähigkeiten-Repository bietet über 5.400 gefilterte Fähigkeiten
Ein GitHub-Repository namens awesome-openclaw-skills bietet über 1.715 produktionsreife Fähigkeiten, die KI-Agenten mit einem CLI-Befehl installieren können, gefiltert aus dem offiziellen OpenClaw Skills Registry.

Qure: Desktop-App zur Generierung von E2E-Tests aus aufgezeichneten Browser-Abläufen
Qure ist eine Desktop-Anwendung von JetBrains (derzeit in geschlossener Beta), die aus Aufnahmen im integrierten Browser vollständigen Web-Testcode generiert. Anstatt Testabläufe in Textform für KI-Agenten zu beschreiben, zeichnen Entwickler ihre manuellen QA-Szenarien durch Interaktion mit ihrem Produkt auf, und die KI erzeugt funktionierenden Testcode, der zu ihrer bestehenden Codebasis passt.