M5 MaxとM3 Maxの推論ベンチマーク比較:oMLX上のQwenモデル

Redditユーザー/u/onil_govaは、40 GPUコアと128GB統一メモリを搭載した16インチMacBook ProのM5 MaxとM3 Maxプロセッサを比較する推論ベンチマークを実施しました。テストにはoMLX v0.2.23と、122B-A10B MoE、35B-A3B MoE、27B denseの3つのQwen 3.5モデルが使用されました。
ベンチマーク結果
pp1024/tg128(プロンプト処理長1024、トークン生成長128)では、M5 Maxが顕著な速度向上を示しました:
- 35B-A3B MoE: 134.5 vs 80.3 tg tok/s(1.7倍高速)
- 122B-A10B MoE: 65.3 vs 46.1 tg tok/s(1.4倍高速)
- 27B dense: 32.8 vs 23.0 tg tok/s(1.4倍高速)
パフォーマンスの差は、より長いコンテキストで拡大します。65Kコンテキスト長では、27B denseモデルはM3 Maxで6.8 tg tok/s、M5 Maxで19.6 tg tok/sとなり、2.9倍の差が生じました。
プリフィルとバッチ処理のパフォーマンス
プリフィルの優位性はさらに大きく、長いコンテキスト長ではM5 Maxで最大4倍高速となり、これはM5 MaxのGPUニューラルアクセラレーターによるものです。
バッチ処理パフォーマンスは、エージェント型ワークロードにおいて重要な違いを示しました:
- M5 Maxは、35B-A3Bモデルでバッチサイズ4倍時に2.54倍のスループットにスケーリング
- M3 Maxの密モデルでのバッチ処理はパフォーマンスを低下させました(122Bモデルでバッチ2倍時に0.80倍)
帯域幅の差(M5 Maxで614 GB/s、M3 Maxで400 GB/s)は、マルチステップのエージェントループや並列ツール呼び出しにおいて重要です。
MoE効率に関する洞察
ベンチマークにより、122Bモデル(アクティブパラメータ10B)は両マシンで27B密モデルよりも高速に生成されることが明らかになりました。これは、推論速度を決定するのは総モデルサイズではなく、アクティブパラメータ数であることを示しています。
すべてのチャートとデータを含む完全なインタラクティブな詳細は以下でご覧いただけます: https://claude.ai/public/artifacts/c9fba245-e734-4b3b-be44-a6cabdec6f8f
📖 Read the full source: r/LocalLLaMA
👀 See Also

Redditの議論では、AI生成コードのデバッグにおける課題が浮き彫りにされています。
r/ClaudeAIでのRedditディスカッションでは、AI生成コードが開発者に直面させる具体的な問題が詳細に語られています。これには、セキュリティの脆弱性、論理の幻覚、そして手動でコードを書くよりも時間がかかるデバッグ作業などが含まれます。
Grok 4.5 対 Claude Code: 1ドルあたりの承認済み変更数が真のベンチマーク
Grok 4.5とClaude Code (Opus)のコーディングタスクにおける実践的な比較:受け入れられた変更1ドルあたりのコスト。ベンチマークの見出しではなく、実用的な指標。サードパーティによるRustタスクのテストでは、Opusが複数ファイルの機能構築で優位に立つことが明らかに。

GitHub Copilot 個人プランの変更: 新規申し込み一時停止、制限強化、モデル調整
GitHubは、エージェント型ワークフローによる計算需要の増加に対応するため、Copilot Pro、Pro+、およびStudentプランの新規申し込みを一時停止し、使用制限を厳格化、さらにProプランからOpusモデルを削除しています。

テキストAIの透かしは常に除去が容易である
EU AI法は2026年までにAI生成テキストへの透かしを義務付けるが、それは常に除去可能だ。その理由とSynthIDの仕組みを解説する。