Qwen 3.6 27B mit MTP auf V100 32GB: 54 t/s über llama.cpp Zweig

✍️ OpenClawRadar📅 Veröffentlicht: 6. Mai 2026🔗 Source
Qwen 3.6 27B mit MTP auf V100 32GB: 54 t/s über llama.cpp Zweig
Ad

Ein Benutzer auf r/LocalLLaMA berichtet von beeindruckenden Ergebnissen beim Betrieb von Qwen 3.6 27B mit Multi-Token Prediction (MTP) auf einem V100 32GB SXM-Modul über einen PCIe-Adapter. Die Konfiguration verwendet am17ans MTP-Zweig von llama.cpp und das entsprechende MTP-GGUF-Quant. Wichtige Spezifikationen: Q8_0 KV-Cache mit 200k Cache-Limit, ausgeführt als VS Code Copilot-Backend über llama-server.

Leistungszahlen

  • Ohne MTP: 29-30 Token/Sekunde
  • Mit MTP: 54-55 Token/Sekunde (bei 150W Leistungsgrenze)
  • Nach 50k Token Kontext: fällt auf 40-45 t/s

Zweig: am17ans MTP-Fork. Build und Ausführung waren unkompliziert – 'gepullt und in einem Durchlauf gebaut' mit llama-server, der ohne Probleme lief. Das Setup verarbeitet Tool-Aufrufe und Sub-Agents gut und lieferte 'sehr aufschlussreiche Code-Reviews und Refactorings' trotz der VRAM-Begrenzung (32GB).

Dies ist besonders relevant für Entwickler, die LLMs auf älterer Rechenzentrumshardware wie V100s betreiben. MTP verdoppelt effektiv den Durchsatz für dieses Modell und zeigt praktische Gewinne für Arbeitslasten von Codierungsassistenten.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude Code v2.1.142: Neue Claude-Agents-Flags, Opus 4.7 als Standard und Fehlerbehebungen
Werkzeuge

Claude Code v2.1.142: Neue Claude-Agents-Flags, Opus 4.7 als Standard und Fehlerbehebungen

Claude Code v2.1.142 fügt acht neue Flags zur Konfiguration von Hintergrundsitzungen hinzu, schaltet den Schnellmodus standardmäßig auf Opus 4.7 um und behebt über ein Dutzend Fehler, darunter MCP-Tool-Timeout, macOS-Schlaf-/Aufwach-Daemon-Probleme und Deadlocks bei Windows-Netzwerklaufwerken.

OpenClawRadar
Colony: Eine lokale Koordinationsschicht, die Multi-Agent-Handoff-Token von 30K auf 400 reduziert
Werkzeuge

Colony: Eine lokale Koordinationsschicht, die Multi-Agent-Handoff-Token von 30K auf 400 reduziert

Colony ist eine lokale erste Koordinationsschicht, die die Kosten für den Agentenwechsel von ~30.000 Token auf ~400 Token senkt, indem sie die Kontexterstellung durch kompakte Beobachtungen ersetzt, die in SQLite gespeichert werden.

OpenClawRadar
Claude-Vorschlag: Scope-Speicher & hermetische Instanztrennung
Werkzeuge

Claude-Vorschlag: Scope-Speicher & hermetische Instanztrennung

Ein formeller Vorschlag an Anthropic von einem Power-User: globale/lokale Speicherbereiche und hermetische Instanzisolierung für Claude, die deterministische, überprüfbare Sitzungen ermöglicht.

OpenClawRadar
Sponsio: Deterministische Sicherheitsvorkehrungen für OpenClaw – Blockierung von „legalen, aber falschen“ Tool-Aufrufen
Werkzeuge

Sponsio: Deterministische Sicherheitsvorkehrungen für OpenClaw – Blockierung von „legalen, aber falschen“ Tool-Aufrufen

Open-Source-Tool, das an der Tool-Grenze sitzt, jeden Aufruf mit Temporal-Logic-Verträgen evaluiert (~0,14ms p50). Verhindert, dass Agenten Dateien außerhalb des Arbeitsverzeichnisses bearbeiten, Force-Pushes oder Migrationen gegen die falsche Datenbank ausführen.

OpenClawRadar