Qwen 3.6-35B-A3B KV Cache Bench: f16 vs q8_0 vs Turbo3 vs Turbo4 auf M5 Max bis zu 1M Kontext

✍️ OpenClawRadar📅 Veröffentlicht: 28. April 2026🔗 Source
Qwen 3.6-35B-A3B KV Cache Bench: f16 vs q8_0 vs Turbo3 vs Turbo4 auf M5 Max bis zu 1M Kontext
Ad

Ein Reddit-Nutzer führte einen Depth-Sweep auf Qwen 3.6-35B-A3B Q8 mit TheToms TurboQuant Metal Fork von llama.cpp (GitHub: TheTom/llama-cpp-turboquant, Branch feature/turboquant-kv-cache) auf einem MacBook Pro M5 Max mit 128 GB Unified Memory durch. Getestet wurden vier KV-Cache-Typen: f16, q8_0, turbo3 (3-Bit) und turbo4 (4-Bit), symmetrisches K und V, mit Flash-Attn an und Mlock an, von 0 bis 1M Kontext-Token.

Hardware & Build

M5 Max, 128 GB Unified Memory. Erstellt mit cmake -B build -DGGML_METAL=ON. Verwendet wurde llama-bench, 3 Wiederholungen pro Zelle, Flash-Attn an, Mlock an. 8 Stunden Wall-Clock über Nacht.

Generierungsdurchsatz (tok/s)

Tiefef16q8_0turbo3turbo4
089,487,479,579,7
8K84,279,272,271,2
32K72,667,861,561,8
128K44,440,736,037,7
256KOOM26,622,925,5
512KOOMOOM13,316,0
1MOOMOOM6,5OOM

Prompt-Verarbeitungsdurchsatz (tok/s)

Tiefef16q8_0turbo3turbo4
02962294829042854
8K2098162316531439
32K1063802784678
128K321245253206
256KOOM124128101
512KOOMOOM6656
1MOOMOOM30OOM
Ad

Wichtige Erkenntnisse

  • Bei Tiefe 0 führt f16 knapp beim Prefill; turbo3 ist ~10% langsamer beim Decode.
  • Bei 128K erreicht turbo3 Prefill (253 tok/s) das Niveau von q8_0 (245 tok/s) – kleinerer Cache reduziert Bandbreitendruck.
  • Bei 256K gewinnt turbo3 beim Prefill +27% gegenüber turbo4 (128 vs 101), aber turbo4 gewinnt beim Decode +11% (25,5 vs 22,9). Bei 512K vergrößert sich der Decode-Vorsprung auf +20% (turbo4 16,0 vs turbo3 13,3).
  • turbo3 ist der einzige Cache-Typ, der in 1M Kontext passt (6,5 tok/s Decode). Speicher bei 1M: ~89 GB (37 GB Gewichte, ~52 GB KV-Cache).

Workload-Empfehlungen

  • Coding-Agenten (tiefer Kontext, viele generierte Token): turbo4
  • RAG / Batch-QA (viel Prefill, kurze Antworten): turbo3
  • 1M Kontext: nur turbo3
  • Kurz interaktiv (<32K): f16, wenn es passt, sonst q8_0

Einschränkungen

Dies ist ein einzelner M5 Max. Übergänge verschieben sich wahrscheinlich mit Speicherbandbreite und GPU-Kernen. Nur symmetrisches K/V getestet. Asymmetrische Kombinationen (z. B. -ctk q8_0 -ctv turbo4) wurden nicht gemessen. TheToms Fork ist Forschungsqualität, nicht im Hauptzweig von llama.cpp.

📖 Zur vollständigen Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Opus 4.6 überragend in Forschung, Gemini 3.1 Pro besser in Vorhersage-Benchmark
Nachrichten

Opus 4.6 überragend in Forschung, Gemini 3.1 Pro besser in Vorhersage-Benchmark

Ein Benchmark mit 1.417 binären Prognosefragen trennt Forschungs- und Urteilsleistung: Claude Opus 4.6 führt bei agentischer Recherche, Gemini 3.1 Pro punktet bei Kalibrierung auf festen Beweisen. GPT-5.4 und Grok 4.20 zeigen kaum Unterschiede zwischen den Bedingungen.

OpenClawRadar
Anthropic verdoppelt Claude Code-Nutzungslimits und schließt Compute-Deal mit SpaceX
Nachrichten

Anthropic verdoppelt Claude Code-Nutzungslimits und schließt Compute-Deal mit SpaceX

Anthropic hat die Nutzungsfenster von fünf Stunden für Claude Code Pro- und Max-Abonnenten verdoppelt, die Reduzierungen während der Spitzenzeiten aufgehoben und die API-Limits für Opus erhöht. Grund dafür ist ein neuer Deal mit SpaceX über mehr als 300 MW Rechenkapazität des Colossus 1-Supercomputers (über 220.000 NVIDIA-GPUs).

OpenClawRadar
Kimi K2.6 vs Claude Opus 4.7: Praxistest eines Minetest-Bounty-Board-Mods
Nachrichten

Kimi K2.6 vs Claude Opus 4.7: Praxistest eines Minetest-Bounty-Board-Mods

Ein Entwickler testete Kimi K2.6 und Claude Opus 4.7 beim Bauen eines Minetest/Luanti-Bounty-Board-Mods mit TypeScript-Backend und Google-Sheets-Protokollierung. Opus erledigte die Aufgabe sauber; Kimi scheiterte am Integrationsteil.

OpenClawRadar
Google Chrome installiert 4 GB Gemini Nano KI-Modell stillschweigend – ohne Nutzerzustimmung
Nachrichten

Google Chrome installiert 4 GB Gemini Nano KI-Modell stillschweigend – ohne Nutzerzustimmung

Es wurde festgestellt, dass Google Chrome das 4 GB große KI-Modell Gemini Nano ohne ausdrückliche Zustimmung auf Benutzergeräten herunterlädt und installiert, was Datenschutz- und Speicherbedenken aufwirft.

OpenClawRadar