Mac Studio ローカルLLM構成:GLM 5.1、Kimi K2.6、そしてClaude Codeでのコーディングに効果的なもの

r/LocalLLaMAで、ユーザーezyzが、M3 Ultra搭載512GBユニファイドメモリのMac Studioで2026年5月時点のローカルLLM構成を投稿しました。この投稿は厳密なベンチマークではなく、日々の感触をチェックしたものですが、Claude Codeを使ってローカルで大規模モデルを実行している人にとって、実用的な観察結果が満載です。
現在アクティブなモデルとパフォーマンス
GLM 5.1 が最大の勝者です。量子化すると、最大コンテキストで約380GBに収まり、他のタスクの余裕を残します。デコード速度は約17 t/s、プリフィルは約190 t/sです。著者は、Claude Codeでのコーディングにおいて、タスクの複雑さが6/10(10が「ブラウンフィールドのレガシーコードベース+曖昧な仕様」)まで信頼しています。自己完結型で半ばスコープが定まった問題を一貫して処理し、計画やクリーンアップのために時折API版のClaudeを利用しています。
Kimi K2.6 も同じレベルの性能ですが、明らかに優れているわけでも劣っているわけでもなく、より大きいモデルです。積極的に量子化しても約460GBを使用し、他の実験の余地がほとんどありません。速度は速く、プリフィル約220 t/s、デコード約21 t/sです。メモリを大量に使う実験のためにアンロードする必要があるのが難点です。
Minimax 2.7 はサイズと速度の割に印象的ですが、著者は開発作業において3-4/10と評価しています。中途半端なサイズで、GLMとKimiは実用的なコード生成で優れ、一方小規模モデルは「このウェブ検索を要約して」といったアシスタントタスクで優れています。また、単純なリクエストに対してすぐに推論を放棄します。
Gemma 4 31B は期待外れでした。リリースから1か月経ってもMLXサポートがまだ不安定です。31BのDenseモデルは大規模MoEよりそれほど速くなく、公式チャットテンプレートには複数の未修正のバグがあり、パッチもまだ徐々にしか提供されていません。著者は、MTP/ドラフトサポートが安定したら再訪する予定です。
Qwen 3.6 35B は、スクリーンショットの翻訳などのマルチモーダルタスクのためにQwen 3.5 9Bに置き換えられました。十分に優れており高速で、Claude CodeのHaikuバックグラウンドタスクを処理しても違いを感じさせず、約14GBのメモリを節約できます。
保留中のサポートと今後の注目点
Deepseek 4 FlashとMimo 2.5は、まだ正式にllama.cppやmlx-lmに搭載されていません。著者は時間ができたらPRを試す予定です。両方のProバージョンはM3 Ultraには大きすぎて遅いと推測しています。GLMの40Bアクティブパラメータがおおよその忍耐の限界です。
注目のプロジェクト:
- ExoとtinygradによるMac + NVIDIAクラスタリングと分離型プリフィル
- Stable Dflash / DDtree / MTPサポート
- 新しい量子化フォーマット(paroquant, JANGTQ)— llama.cpp PR #21038 参照
- ローカル音楽生成 — Ace Step 1.5は「ほぼ良い」がボイスはまだ。
📖 原文を読む: r/LocalLLaMA
👀 See Also

オープンクローエージェントのための垂直データレイヤーの構築
OpenClawの真の可能性は、単にそれを使うことだけではありません。それは、乱雑なデータソースを接続し、それらを利用可能なスキーマに正規化し、構造化されたJSONを返すクリーンなツールエンドポイントとして公開する、業界固有のデータレイヤーを構築することにあります。

OpenClawエージェントを使用してWixからWordPressに移行 — 現在は3Dプリントショップの日常業務を管理
小規模な3Dプリントショップが、VPSにデプロイされたOpenClawエージェントを使ってWixからWordPressに移行しました。このエージェントは現在、新製品の追加やペットバッジ注文のカスタム注文フォームの作成を行っています。

Claude Codeを使用したGPTとGeminiによるマルチAIオーケストレーション設定
ある開発者が、Claude CodeがGPT-5.4とGemini 3.1 Proを同じIDE内で調整するセットアップを共有しています。マークダウンファイルを永続的なコンテキストとして使用し、CLIコマンドでモデル間通信を行っています。

Claude Codeを用いたプロダクションコードベースでの自動研究:60の実験、3つの変更を保持
開発者は、本番環境のハイブリッド検索システム(Django、pgvector、Cohere埋め込み)でClaude Codeを用いて60回のオートリサーチを実行し、93%の失敗率でわずか3つの変更のみを採用しました。このプロセスにより、効果のない最適化が特定され、Redisキャッシュのバグが発見されました。