Qwen3.5-397B MoE、M1 Ultraでページ化エキスパートローディングにより14GB RAMで動作

Redditのu/ur_dad_mattによる投稿(Claude経由)では、カスタムのpaged MoEエンジンがQwen3.5-397B-A17B(ディスク上209GB、512エキスパート、top-10ルーティング)をM1 Ultra 64GB Mac Studioで、わずか14GBのピークRAMと1.59 tok/sの推論速度で動作させることを実証している。このモデルは単純に読み込むには大きすぎるため、エンジンはK=20のエキスパートのみをRAMに常駐させ、残りはルーターの要求に応じてSSDからレイジーページングし、キャッシュプレッシャー下でエビクションする。計算はFloat16(MPS上のternaryより高速)、Apple Siliconネイティブ、MLXベースで行われる。
M1 Ultra 64GBでの5プロンプトスイープによるベンチマーク結果:
- 速度:1.59 tok/s(5つの一貫した生成の平均、K=20)
- キャッシュRSSピーク(生成中):7.91 GB
- 総RSSピーク:14.04 GB
- 一貫した出力:5/5
最適なエンジン設定:K_override=20、cache_gb=8.0、OUTLIER_MMAP_EXPERTS=0、lazy_load=True。最初はすべてのエキスパートをディスクに置こうとしたが、キャッシュサイズを調整するまでコマンドバッファ割り当てエラーが発生した。
著者は、生のスコアベンチマークは64GBハードウェア上のローカルLLMにとっては的外れであり、重要な指標は1GBあたりのMMLUだと主張する。1.59 tok/sではモデルは「思考ペース」で動作し、チャットペースではなく、モデル対メモリ比の上限を示している。
同じハードウェア上の小型量子化モデル(MLX-4ビット)の速度:
- 4B Nano:71.7 tok/s
- 9B Lite:53.4 tok/s
- 26B-A4B Quick:14.6 tok/s
- 27B Core:40.7 tok/s(MMLU 0.851 n=14042 σ=0.003、HumanEval 0.866 n=164 σ=0.027)
- 35B-A3B Vision:64.1 tok/s
- 397B Plus:1.59 tok/s
ランタイムはmacOS向けにTauri + Rust + MLXで構築されている。無料ティア(NanoとLite)はoutlier.hostで永久に利用可能。動画デモはRedditの投稿に含まれている。
📖 全文はこちら: r/LocalLLaMA
👀 See Also

ヒッチハイカーによるエージェンティックAIガイド — 完全概説
LLMの内部動作、RL訓練、推論、RAGメモリ、マルチエージェントシステム、MCPやスキルなどのツールを解説するReddit投稿。論文へのリンク付き。

小型本地模型运行编码代理时会出现什么问题
7B未満のモデルでマルチファイルタスクをテストした際の実際の障害ポイント:マークダウンフェンス、構造化出力の信頼性、ファイル編集エラー、読み取り/書き込みアクションの分類。

OpenClaw メガチートシート:AIコーディング習得への扉
r/openclawから公開されたOpenClaw Mega Cheatsheetに飛び込もう。AIコーディングと自動化愛好家のための必須のヒントが詰まった包括的なガイドです。

ChatGPTからClaudeへのユーザーコンテキスト転送方法
Redditユーザーが、ChatGPTから詳細な認知プロファイルを抽出し、Claudeに転送可能なポータブルなAI憲章を作成する2プロンプト手法を共有。AIシステム間での移行の難しさに対処。