M5 Max vs. M3 Max Inferenz-Benchmarks für Qwen-Modelle auf oMLX

Der Reddit-Nutzer /u/onil_gova führte Inferenz-Benchmarks durch, die 16-Zoll MacBook Pros mit M5 Max- und M3 Max-Prozessoren verglichen, beide mit 40 GPU-Kernen und 128 GB Unified Memory ausgestattet. Die Tests verwendeten oMLX v0.2.23 und drei Qwen 3.5-Modelle: das 122B-A10B MoE, 35B-A3B MoE und 27B dense.
Benchmark-Ergebnisse
Bei pp1024/tg128 (Prompt-Verarbeitungslänge 1024, Token-Generierungslänge 128) zeigte der M5 Max signifikante Geschwindigkeitsverbesserungen:
- 35B-A3B MoE: 134,5 vs. 80,3 tg tok/s (1,7-mal schneller)
- 122B-A10B MoE: 65,3 vs. 46,1 tg tok/s (1,4-mal schneller)
- 27B dense: 32,8 vs. 23,0 tg tok/s (1,4-mal schneller)
Die Leistungslücke vergrößert sich mit längeren Kontexten. Bei einer Kontextlänge von 65K sank das 27B dense-Modell auf 6,8 tg tok/s beim M3 Max gegenüber 19,6 tg tok/s beim M5 Max (2,9-facher Unterschied).
Prefill- und Batching-Leistung
Die Prefill-Vorteile waren noch größer und erreichten beim M5 Max bei langen Kontextlängen bis zu 4-mal schnellere Werte, was auf die GPU Neural Accelerators des M5 Max zurückgeführt wird.
Die Batching-Leistung zeigte wichtige Unterschiede für agentische Workloads:
- M5 Max skalierte auf den 2,54-fachen Durchsatz bei 4-facher Batch-Größe beim 35B-A3B-Modell
- M3 Max Batching bei dense-Modellen verschlechterte die Leistung (0,80-fach bei 2-facher Batch-Größe beim 122B-Modell)
Der Bandbreitenunterschied (614 GB/s beim M5 Max vs. 400 GB/s beim M3 Max) ist signifikant für mehrstufige Agenten-Schleifen oder parallele Tool-Aufrufe.
MoE-Effizienz-Erkenntnisse
Die Benchmarks zeigten, dass das 122B-Modell (mit 10B aktiven Parametern) auf beiden Maschinen schneller generiert als das 27B dense-Modell. Dies zeigt, dass die Anzahl der aktiven Parameter die Inferenzgeschwindigkeit bestimmt, nicht die Gesamtmodellgröße.
Die vollständige interaktive Aufschlüsselung mit allen Diagrammen und Daten ist verfügbar unter: https://claude.ai/public/artifacts/c9fba245-e734-4b3b-be44-a6cabdec6f8f
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

KI-Agenten töten Code-Reviews – Das Prinzipal-Agent-Problem erklärt
Das Einfügen von KI-Agenten in den traditionellen Code-Review-Prozess verdoppelt die Review-Last, zerstört Vertrauenssignale und schafft ein unhaltbares Ungleichgewicht – das ist das Principal-Agent-Problem, angewandt auf die Softwareentwicklung.

Anthropic-Bericht beschreibt Massen-Distillation von Claude durch chinesische KI-Firmen
Anthropic veröffentlichte Beweise, dass DeepSeek, Moonshot AI und MiniMax 24.000 gefälschte Konten und über 16 Millionen Austausche nutzten, um Claudes Fähigkeiten zu destillieren, wodurch Sicherheitsmechanismen in den kopierten Modellen beeinträchtigt wurden.

Gründungsagent: Sprach-KI für Websites mit schnellem Abruf
Moss baute einen Voice-AI-Agenten für seine Website, der Besucherfragen mithilfe schneller Abrufe sofort beantwortet. Jetzt ist es ein Produkt namens Founding Agent.

Anthropics Claude-Mythos: Angstmacherei oder reale Gefahr?
Anthropic behauptet, dass sein Claude Mythos-Modell bei der Suche nach Cybersicherheitsfehlern hervorragend sei, aber Kritiker argumentieren, dass die Warnungen des Unternehmens vor einer Katastrophe ein Marketing-Trick seien, um von aktuellen Schäden abzulenken und Regulierungsbehörden zu beeinflussen.