Qwen3.5-397B MoE、M1 Ultraでページ化エキスパートローディングにより14GB RAMで動作

✍️ OpenClawRadar📅 公開日: May 7, 2026🔗 Source
Qwen3.5-397B MoE、M1 Ultraでページ化エキスパートローディングにより14GB RAMで動作
Ad

Redditのu/ur_dad_mattによる投稿(Claude経由)では、カスタムのpaged MoEエンジンがQwen3.5-397B-A17B(ディスク上209GB、512エキスパート、top-10ルーティング)をM1 Ultra 64GB Mac Studioで、わずか14GBのピークRAMと1.59 tok/sの推論速度で動作させることを実証している。このモデルは単純に読み込むには大きすぎるため、エンジンはK=20のエキスパートのみをRAMに常駐させ、残りはルーターの要求に応じてSSDからレイジーページングし、キャッシュプレッシャー下でエビクションする。計算はFloat16(MPS上のternaryより高速)、Apple Siliconネイティブ、MLXベースで行われる。

M1 Ultra 64GBでの5プロンプトスイープによるベンチマーク結果:

  • 速度:1.59 tok/s(5つの一貫した生成の平均、K=20)
  • キャッシュRSSピーク(生成中):7.91 GB
  • 総RSSピーク:14.04 GB
  • 一貫した出力:5/5

最適なエンジン設定:K_override=20、cache_gb=8.0、OUTLIER_MMAP_EXPERTS=0、lazy_load=True。最初はすべてのエキスパートをディスクに置こうとしたが、キャッシュサイズを調整するまでコマンドバッファ割り当てエラーが発生した。

著者は、生のスコアベンチマークは64GBハードウェア上のローカルLLMにとっては的外れであり、重要な指標は1GBあたりのMMLUだと主張する。1.59 tok/sではモデルは「思考ペース」で動作し、チャットペースではなく、モデル対メモリ比の上限を示している。

Ad

同じハードウェア上の小型量子化モデル(MLX-4ビット)の速度:

  • 4B Nano:71.7 tok/s
  • 9B Lite:53.4 tok/s
  • 26B-A4B Quick:14.6 tok/s
  • 27B Core:40.7 tok/s(MMLU 0.851 n=14042 σ=0.003、HumanEval 0.866 n=164 σ=0.027)
  • 35B-A3B Vision:64.1 tok/s
  • 397B Plus:1.59 tok/s

ランタイムはmacOS向けにTauri + Rust + MLXで構築されている。無料ティア(NanoとLite)はoutlier.hostで永久に利用可能。動画デモはRedditの投稿に含まれている。

📖 全文はこちら: r/LocalLLaMA

Ad

👀 See Also

OpenClawセルフホストAIエージェントの実用的なセットアップと設定ガイド
Guides

OpenClawセルフホストAIエージェントの実用的なセットアップと設定ガイド

OpenClawは、メッセージングアプリと統合し、ファイルベースのシステムを通じて永続的なメモリを維持するセルフホスト型AIエージェントです。主なセットアップの推奨事項には、ターミナルインターフェースから始めること、最初は1つのメッセージングチャネルのみを接続すること、そして個性とセキュリティルールのためにSOUL.mdファイルを適切に設定することが含まれます。

OpenClawRadar
AIをコード工場ではなく、認知パートナーとして活用する
Guides

AIをコード工場ではなく、認知パートナーとして活用する

Redditの投稿では、『Cognitive Authorship Copilot』と呼ばれるシステムプロンプトが提案されています。これは、AIを自律的な解決策生成器ではなく、ペアプログラミングのパートナーとして行動させるもので、タスクの複雑さに基づいて3段階の介入レベルを設けています。

OpenClawRadar
ChatGPTの履歴をClaudeのプロジェクトにインポートする方法
Guides

ChatGPTの履歴をClaudeのプロジェクトにインポートする方法

ChatGPTのチャットをMarkdownとしてエクスポートし、関連するものをClaude Projectsにアップロードすることで、何年分のコンテキスト、進行中のプロジェクト、スタイル設定を引き継げます。

OpenClawRadar
Claude Code Skills vs. カスタムエージェント:タスクの一貫性に基づくメンタルモデル
Guides

Claude Code Skills vs. カスタムエージェント:タスクの一貫性に基づくメンタルモデル

Redditユーザーが、Claude Codeのスキルとカスタムエージェントの違いを明確に説明しています:スキルは毎回同じ手順を実行するのに対し、カスタムエージェントは推論と適応を必要とします。この投稿では、並列サブエージェント、委任、フック、ビルディングブロックについても触れられています。

OpenClawRadar