MTPLX: 2,24x schnellere Token auf Apple Silicon mit nativen MTP-Köpfen

✍️ OpenClawRadar📅 Veröffentlicht: 5. Mai 2026🔗 Source
MTPLX: 2,24x schnellere Token auf Apple Silicon mit nativen MTP-Köpfen
Ad

MTPLX ist eine Inferenz-Engine für Apple Silicon, die die integrierten Multi-Token-Prediction (MTP)-Köpfe eines Modells als spekulative Drafter nutzt. Das wichtigste Ergebnis: Qwen 3.6 27B 4-Bit MLX steigert sich von 28 tok/s auf 63 tok/s (2,24× schneller) auf einem MacBook Pro M5 Max bei einer Temperatur von 0,6, top_p 0,95, top_k 20 – genau die Einstellungen, die Qwen fürs Programmieren empfiehlt.

Wie es funktioniert

Im Gegensatz zu DFlash oder DDTree (die einen externen Drafter benötigen und nur greedy sind), verwendet MTPLX die eigenen MTP-Köpfe des Modells. Jeder MTP-Kopf sequenziert nacheinander und erzeugt Wahrscheinlichkeitsverteilungen pro Token. Dies ermöglicht exaktes Zurückweisungs-Sampling mit Temperatur- und Residual-Korrektur. Kein externer Drafter bedeutet keine zusätzliche Speichernutzung.

Für Qwen 3.6 27B (das MTP-Köpfe bis zur Tiefe 5 mitbringt) wurde die optimale Tiefe nach Durchlauf von D2–D5 als D3 ermittelt. Tiefere Stufen (D4/D5) hatten eine gute frühe Akzeptanz, aber tiefere Positionen kosteten mehr Verifizierungszeit als eingesparte Tokens.

Status vs. DFlash / DDTree

DFlash MLX erreicht eine höhere Rohgeschwindigkeit, ist aber auf greedy (Temperatur 0) Sampling beschränkt, was die praktische Nutzung stark einschränkt. DDTree erbt dieselben Einschränkungen. Beide benötigen einen externen Drafter. MTPLX funktioniert mit jedem Modell, das seine MTP-Köpfe behält und vollständiges temperaturgesteuertes Sampling unterstützt.

Ad

Installation und Nutzung

MTPLX wird als vollständiges CLI mit folgenden Befehlen ausgeliefert:

  • mtplx start wizard – geführte Einrichtung
  • Modell-Download und -Inspektion mit vierstufiger MTP-Kompatibilitätserkennung
  • Konfigurierbare Tiefe 2–7+
  • OpenAI/Anthropic-kompatibler API-Server, Browser-Chat-UI, Terminal-Chat
  • Benchmarking-Suite, Health-Diagnose, absturzsichere Lüftersteuerung mit idle-bewusster Auto-Wiederherstellung
  • Eine 562-Tests umfassende Testsuite ist enthalten

Die Engine basiert auf einem gepatchten MLX-Fork mit benutzerdefinierten Metal-Kernels, kompilierten Verify-Graphen, Innovation-Tape-GDN-Rollback und einem nur zum Drafting requantisierten LM-Head.

Für wen es gedacht ist

Entwickler, die lokale LLMs auf Apple Silicon betreiben und einen hohen Durchsatz sowie temperaturgesteuertes Sampling fürs Programmieren oder kreatives Schreiben benötigen, ohne Einbußen bei der Ausgabequalität hinzunehmen.

📖 Vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Genehmigungsgrenzen-Tool für das Claude-Code-Repository
Werkzeuge

Genehmigungsgrenzen-Tool für das Claude-Code-Repository

Ein Entwickler hat ein Genehmigungsgrenzen-Tool erstellt, das einen Überprüfungsschritt hinzufügt, bevor die lokale Ausführung erfolgt, wenn Claude Code für Repository-Arbeiten verwendet wird. Das Tool folgt einem Kreislauf: Zuerst den Plan sehen, einmal genehmigen, die Ausführung lokal geschehen lassen und anschließend den Nachweis aufbewahren.

OpenClawRadar
StarSteady: KI-gestützte Google-Bewertungsantworten und SMS-Anfragen für lokale Unternehmen
Werkzeuge

StarSteady: KI-gestützte Google-Bewertungsantworten und SMS-Anfragen für lokale Unternehmen

StarSteady ist ein von einer Einzelperson entwickeltes SaaS, das KI-generierte Antworten auf Google-/Yelp-Bewertungen erstellt und SMS-Bewertungsanfragen an Kunden sendet. Der Preis beginnt bei 39 $/Monat, mit einem kostenlosen Testangebot für 5 Antworten/5 SMS.

OpenClawRadar
Jean-Claude: Ein satirisches LLM-Frontend, das die EU-KI-Regulierung verspottet, mit 412 Cookie-Partnern und Mehrwertsteuer-Rechnungen alle 5 Nachrichten
Werkzeuge

Jean-Claude: Ein satirisches LLM-Frontend, das die EU-KI-Regulierung verspottet, mit 412 Cookie-Partnern und Mehrwertsteuer-Rechnungen alle 5 Nachrichten

Jean-Claude ist ein satirisches LLM-Frontend, das EU-Bürokratie bis zum Äußersten treibt: 412 Cookie-Partner, Vier-Augen-Prinzip mit Mitzeichnungspflicht, CO₂-Tracking pro Token mit verbindlicher €-Kompensation, Umsatzsteuerrechnung alle 5 Nachrichten und ein Compliance-Center mit fiktiven DSGVO/AI-Act-Kennzahlen.

OpenClawRadar
Banker erstellt Kredit-Due-Diligence-Tool mit nur 31 KI-Prompts unter Verwendung von Claude
Werkzeuge

Banker erstellt Kredit-Due-Diligence-Tool mit nur 31 KI-Prompts unter Verwendung von Claude

Ein Banker mit 17 Jahren Erfahrung in der MSME-Kreditprüfung in Indien hat 31 KI-Prompts quelloffen gemacht, die eine Visitenkarte in einen vollständigen Kreditprüfbericht verwandeln und einen 3-4-wöchigen Prozess auf 30 Minuten verkürzen. Das Tool wurde ausschließlich durch Gespräche mit Claude erstellt, ohne eine einzige Codezeile zu schreiben.

OpenClawRadar