llama.cpp上的Qwen 3.6 27B通过MTP推测解码达到2.5倍速度

✍️ OpenClawRadar📅 Veröffentlicht: 6. Mai 2026🔗 Source
llama.cpp上的Qwen 3.6 27B通过MTP推测解码达到2.5倍速度
Ad

Ein Reddit-Nutzer hat llama.cpp mit einem ausstehenden PR (#22673) kompiliert, der Multi-Token Prediction (MTP) für Qwen 3.6 27B ermöglicht. MTP nutzt die eingebauten Tensor-Schichten des Modells für spekulatives Decoding und verspricht einen 2,5-fachen Geschwindigkeitszuwachs – von etwa 11 tok/s auf 28 tok/s auf einem Mac M2 Max 96GB.

Wichtige Details

  • Modell: Qwen 3.6 27B (Qwen2.5-3.0-Architekturvariante)
  • Getestete Hardware: Mac M2 Max 96GB
  • Ergebnisse: 28 tok/s mit MTP (vs. ~11 tok/s ohne)
  • Kontextunterstützung: Bis zu 262K Token mit turbo4 KV-Cache auf 48GB Mac
  • Quantisierungen: Vom Benutzer hochgeladene, vorkonvertierte GGUF-Quantisierungen unter froggeric/Qwen3.6-27B-MTP-GGUF

Kompilierungsanleitung

git clone --depth 1 https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
git fetch origin pull/22673/head:mtp-pr && git checkout mtp-pr
cmake -B build -DGGML_METAL=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --target llama-cli llama-server
Ad

Server-Befehl

llama-server -m Qwen3.6-27B-Q5_K_M-mtp.gguf \
  --mmproj mmproj-Qwen3.6-27B-f16.gguf \
  --spec-type mtp --spec-draft-n-max 5 \
  --cache-type-k turbo4 --cache-type-v turbo4 \
  -c 262144 --temp 0.7 --top-k 20 -ngl 99 --port 8081

Drei Optimierungen kombiniert:

  • --spec-type mtp --spec-draft-n-max 5: Aktiviert MTP-spekulatives Decoding (2,5x schneller)
  • --cache-type-k turbo4 --cache-type-v turbo4: 4,25-Bit-KV-Cache (viertel Speicherplatz im Vergleich zu 16-Bit)
  • -c 262144: 262K-Kontextfenster (passt mit turbo4 in 48GB)

Hardware-Empfehlungen

Quantisierungs- und KV-Cache-Tabellen für Apple Silicon und NVIDIA-GPUs sind in der Quelle für speicherbegrenzte Konfigurationen verfügbar (z.B. IQ2_M auf 16GB Apple Silicon mit 48K Kontext). Vision-Unterstützung (mmproj) ist auf 32GB+-Konfigurationen verfügbar.

Zusätzliche Korrekturen

Der Nutzer hat außerdem 7 Korrekturen für die kaputten Qwen Jinja-Chat-Templates veröffentlicht, die aufgrund vLLM-spezifischer Formatierung defekt waren. Diese sind nun kompatibel mit llama.cpp und anderen Tools.

Hinweis: Bestehende GGUF-Dateien auf Hugging Face enthalten keine MTP-Unterstützung – sie müssen mit dem PR neu konvertiert werden. Der Nutzer warnt, dass erste Uploads unvollständig sind; Status des Hugging-Face-Repos überprüfen.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Khael KI-Agent teilt Produktionsarchitekturentscheidungen für OpenClaw mit
Werkzeuge

Khael KI-Agent teilt Produktionsarchitekturentscheidungen für OpenClaw mit

Khael, ein KI-autonomer Agent, der auf OpenClaw läuft, erläutert spezifische Architekturentscheidungen, die sich seit Monaten in der Produktion bewährt haben, einschließlich separater LAWS.md-Dateien, Modusdateien, Selbstprüfungs-Cron-Jobs und spezialisierter Bot-Typen.

OpenClawRadar
Nelson: Ein Claude-Code-Plugin zur Koordination von KI-Agenten wie eine Marineflotte
Werkzeuge

Nelson: Ein Claude-Code-Plugin zur Koordination von KI-Agenten wie eine Marineflotte

Nelson ist ein Claude Code-Plugin, das die Koordination von KI-Agenten mithilfe von Prinzipien inspiriert von Marineflotten strukturiert. Es bietet drei Ausführungsmodi, ein Risikoklassifizierungssystem, eine Überwachung der Rumpfintegrität und feste Befehlsschleusen, um häufige Anti-Patterns zu verhindern.

OpenClawRadar
Claude Code Fähigkeit refaktorisiert React-Komponenten nach dem "Don't Make Me Think"-Prinzip
Werkzeuge

Claude Code Fähigkeit refaktorisiert React-Komponenten nach dem "Don't Make Me Think"-Prinzip

Eine neue Claude Code Fähigkeit refraktiert automatisch React-Komponenten für Benutzerfreundlichkeit basierend auf Steve Krugs Prinzipien – entfernt Fülltexte, hebt primäre Handlungsaufforderungen hervor, korrigiert leere/Fehlerzustände und strafft Bezeichnungen.

OpenClawRadar
VidLens MCP-Server: Dauerhafte YouTube-Wissensdatenbank für Claude
Werkzeuge

VidLens MCP-Server: Dauerhafte YouTube-Wissensdatenbank für Claude

VidLens ist ein kostenloser, quelloffener MCP-Server, der YouTube-Inhalte lokal mit semantischen Embeddings indiziert und Videos als dauerhafte Wissensbasis behandelt, anstatt temporäre Transkripte zu extrahieren. Er bietet 41 Werkzeuge in 10 Modulen zum Suchen, Analysieren und Abrufen von Videoinhalten.

OpenClawRadar