Qwen 3.6 27B Quantisierungs-Benchmark: Q4_K_M schlägt Q8_0 bei praktischen Abwägungen

✍️ OpenClawRadar📅 Veröffentlicht: 28. April 2026🔗 Source
Qwen 3.6 27B Quantisierungs-Benchmark: Q4_K_M schlägt Q8_0 bei praktischen Abwägungen
Ad

Ein Reddit-Benutzer hat Qwen 3.6 27B in drei GGUF-Quantisierungsvarianten (BF16, Q4_K_M, Q8_0) mit llama-cpp-python über das Neo AI Engineer-Framework getestet. Die Auswertung umfasste insgesamt 664 Stichproben in drei Aufgaben: HumanEval (Codegenerierung, 164 Stichproben), HellaSwag (gesunder Menschenverstand, 100 Stichproben) und BFCL (Funktionsaufruf, 400 Stichproben).

Testergebnisse

  • BF16 (Modellgröße 53,8 GB, Spitzen-RAM 54 GB, Durchsatz 15,5 tok/s): HumanEval 56,10 % (92/164), HellaSwag 90,00 % (90/100), BFCL 63,25 % (253/400). Durchschnittliche Genauigkeit: 69,78 %.
  • Q4_K_M (16,8 GB, 28 GB RAM, 22,5 tok/s): HumanEval 50,61 % (83/164), HellaSwag 86,00 % (86/100), BFCL 63,00 % (252/400). Durchschnitt: 66,54 %.
  • Q8_0 (28,6 GB, 42 GB RAM, 18,0 tok/s): HumanEval 52,44 % (86/164), HellaSwag 83,00 % (83/100), BFCL 63,00 % (252/400). Durchschnitt: 66,15 %.
Ad

Wichtige Erkenntnisse

Q4_K_M ist die herausragende praktische Variante. Sie bewahrt die BFCL-Genauigkeit (63,00 % vs. 63,25 %), verliert nur etwa 5,5 Punkte bei HumanEval und liegt bei HellaSwag etwa 4 Punkte hinter BF16. Die Kompromisse: 1,45-mal schneller als BF16, 48 % weniger Spitzen-RAM, 68,8 % kleinere Datei und nahezu identische Funktionsaufrufleistung. Q8_0 war enttäuschend: Es verbesserte HumanEval nur um etwa 1,8 Punkte gegenüber Q4_K_M, benötigte aber 42 GB RAM statt 28 GB, war langsamer und erzielte bei HellaSwag niedrigere Werte.

Für lokale/CPU-Bereitstellung wird Q4_K_M empfohlen, es sei denn, die Arbeitslast konzentriert sich stark auf Codegenerierung. Für maximale Qualität gewinnt immer noch BF16.

Testaufbau

GGUF-Varianten über llama-cpp-python mit n_ctx: 32768, kontrollierte Auswertung. Das Neo AI Engineer Framework erstellte die GGUF-Auswertungspipeline, führte kontrollierte Läufe durch und fasste die Ergebnisse zusammen. Eine vollständige Fallstudie mit Codeausschnitten ist in den ursprünglichen Reddit-Kommentaren verlinkt.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Skalierung von Karpathys Autoresearch mit 16 GPUs: Ergebnisse und Methoden
Werkzeuge

Skalierung von Karpathys Autoresearch mit 16 GPUs: Ergebnisse und Methoden

Das SkyPilot-Team gab Claude Code Zugriff auf 16 GPUs in einem Kubernetes-Cluster, um Karpathys Autoresearch-Projekt auszuführen. In 8 Stunden reichte der Agent ~910 Experimente ein, reduzierte die Validierungsbits pro Byte von 1,003 auf 0,974 (2,87 % Verbesserung) und erreichte den besten Validierungsverlust 9-mal schneller als bei sequentieller Ausführung.

OpenClawRadar
🦀
Werkzeuge

Forscher entwickelt Wahrheitsprüfungs-Funktion für Claude Code, findet Hallucinationen in eigener Dokumentation

Ein Forscher entwickelte eine Claude Code-Fähigkeit namens /veracity-tweaked-555, die Dokumente in atomare Behauptungen zerlegt und jede über Websuche verifiziert, wobei 16 parallele Agenten über 4 Wellen hinweg eingesetzt werden. Bei einer Selbstprüfung erzielte die Fähigkeit 62/100 Punkte aufgrund von erfundenen Statistiken und übertriebenen Behauptungen in ihrer eigenen Dokumentation.

OpenClawRadar
Lokaler MCP-Server verbindet Claude mit Mac-Apps ohne Cloud oder Tokens
Werkzeuge

Lokaler MCP-Server verbindet Claude mit Mac-Apps ohne Cloud oder Tokens

Local MCP ist ein nativer macOS MCP-Server, der Claude Desktop, Cursor, Windsurf und VS Code Zugriff auf Mail-, Kalender-, Teams- und OneDrive-Daten auf Ihrem Mac ermöglicht, ohne Cloud-Verarbeitung oder API-Tokens.

OpenClawRadar
Steerling-8B: Ein interpretierbares Sprachmodell mit Token-Level-Attribution
Werkzeuge

Steerling-8B: Ein interpretierbares Sprachmodell mit Token-Level-Attribution

Guide Labs veröffentlichte Steerling-8B, ein Sprachmodell mit 8 Milliarden Parametern, das auf 1,35 Billionen Tokens trainiert wurde und jeden generierten Token auf Eingabekontext, menschenverständliche Konzepte und Trainingsdatenquellen zurückführen kann. Das Modell erreicht eine wettbewerbsfähige Leistung mit Modellen, die auf 2-7× mehr Daten trainiert wurden.

OpenClawRadar