Qwen 3.6 27B mit MTP auf V100 32GB: 54 t/s über llama.cpp Zweig

✍️ OpenClawRadar📅 Veröffentlicht: 6. Mai 2026🔗 Source
Qwen 3.6 27B mit MTP auf V100 32GB: 54 t/s über llama.cpp Zweig
Ad

Ein Benutzer auf r/LocalLLaMA berichtet von beeindruckenden Ergebnissen beim Betrieb von Qwen 3.6 27B mit Multi-Token Prediction (MTP) auf einem V100 32GB SXM-Modul über einen PCIe-Adapter. Die Konfiguration verwendet am17ans MTP-Zweig von llama.cpp und das entsprechende MTP-GGUF-Quant. Wichtige Spezifikationen: Q8_0 KV-Cache mit 200k Cache-Limit, ausgeführt als VS Code Copilot-Backend über llama-server.

Leistungszahlen

  • Ohne MTP: 29-30 Token/Sekunde
  • Mit MTP: 54-55 Token/Sekunde (bei 150W Leistungsgrenze)
  • Nach 50k Token Kontext: fällt auf 40-45 t/s

Zweig: am17ans MTP-Fork. Build und Ausführung waren unkompliziert – 'gepullt und in einem Durchlauf gebaut' mit llama-server, der ohne Probleme lief. Das Setup verarbeitet Tool-Aufrufe und Sub-Agents gut und lieferte 'sehr aufschlussreiche Code-Reviews und Refactorings' trotz der VRAM-Begrenzung (32GB).

Dies ist besonders relevant für Entwickler, die LLMs auf älterer Rechenzentrumshardware wie V100s betreiben. MTP verdoppelt effektiv den Durchsatz für dieses Modell und zeigt praktische Gewinne für Arbeitslasten von Codierungsassistenten.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Browser39: Ein kopfoser Webbrowser für KI-Agenten
Werkzeuge

Browser39: Ein kopfoser Webbrowser für KI-Agenten

Browser39 ist ein Headless-Webbrowser, der speziell für KI-Agenten entwickelt wurde und Webseiten lokal in token-optimiertes Markdown umwandelt, JavaScript ausführt, Cookies und Sitzungen verwaltet, das DOM abfragt und Formulare ausfüllt. Es handelt sich um eine einzelne Binärdatei, die keinen externen Browser, keine Gebühren und keinen externen Dienst benötigt.

OpenClawRadar
Tripsy startet MCP-Server für Claude: Reisen über strukturierte API verwalten
Werkzeuge

Tripsy startet MCP-Server für Claude: Reisen über strukturierte API verwalten

Der offizielle MCP-Server von Tripsy ermöglicht es Claude, Reisen, Aktivitäten, Unterkünfte, Transport und Ausgaben direkt zu lesen, zu erstellen und zu aktualisieren. Die Einrichtung dauert etwa eine Minute über Claudes benutzerdefinierten Connector.

OpenClawRadar
Enthüllung von OpenClaw: Wie es KI-Coding-Agenten stärkt.
Werkzeuge

Enthüllung von OpenClaw: Wie es KI-Coding-Agenten stärkt.

Entdecken Sie, wie OpenClaw KI-Coding-Agenten revolutioniert und die Automatisierung in verschiedenen Bereichen vorantreibt.

OpenClawRadar
Automatisierte Claude-Code-Pipeline reduziert Token-Verbrauch von 78k auf 15k pro Feature
Werkzeuge

Automatisierte Claude-Code-Pipeline reduziert Token-Verbrauch von 78k auf 15k pro Feature

Eine Open-Source-Pipeline für Claude Code automatisiert 12 Phasen, einschließlich der Vorabprüfung von bestehendem Code, und reduziert den Token-Verbrauch von ~78k auf ~15k pro Feature. Sie bietet drei Profile (yolo, standard, paranoid) und ersetzt Konfidenzscores durch grep-basierte Validierung.

OpenClawRadar