Qwen3.5-122B-A10B-MINT-MLXは、64GB RAM搭載のM5 Proでスムーズに動作します。

Apple SiliconでのローカルLLMパフォーマンス
Redditユーザーが、64GB RAMを搭載したM5 ProでQwen3.5-122B-A10B-MINT-MLXモデルをローカルで実行した経験を共有しました。このセットアップは、適切な設定により大規模言語モデルがコンシューマーハードウェアでも効果的に動作することを示しています。
設定の詳細
ユーザーは、VRAM割り当てのための特定のターミナルコマンドを使用してスムーズなパフォーマンスを達成しました:
sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440
LM Studioでは、コンテキストウィンドウを16384トークンに設定しました。この設定により、システムはSafariで複数のタブを開き、MessagesとActivity Monitorを同時に実行しながら安定したパフォーマンスを維持しました。
パフォーマンスベンチマーク
Qwen3.5-122B-A10B-MINT-MLXモデルは以下の結果を示しました:
- 最初のトークンまでの時間:0.86秒
- トークン生成速度:39.58トークン/秒
ユーザーは、モデルが「多くのなぞなぞを正しく解き、少しの雰囲気コーディングを行った」と述べ、3ビットMINT量子化について不満はなかったと報告しています。唯一の問題は、コンテキストウィンドウが約59GBのVRAM使用量に近づいた時にシステムがロックアップしたことでした。
他のモデルとの比較
ユーザーは「Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8」もテストし、122Bモデルよりも正確だが生成速度が大幅に遅いと感じました:
- トークン生成速度:6.93トークン/秒
- プロンプト処理は生成速度が遅いにもかかわらず高速でした
これは、ローカルLLM設定を選択する際に開発者が直面するモデルサイズ、量子化、推論速度のトレードオフを示しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

AIエージェントマーケットプレイスのテスト:ClawGig、RentAHuman、およびOpenClawベースのセットアップからの実用的な結果
ある開発者が複数のAIエージェントマーケットプレイスをテストしたところ、ClawGigではエージェントの反応がなく、評価スコアが不正操作されていることが判明。RentAHumanのエージェントは一貫した会話を維持できず、OpenClawベースの個人開発者によるセットアップは有望だが、発見性に欠けるという結果でした。

Claude Codeが突然リスク回避的になり、日常的なタスクで許可を求める
あるユーザーが、Claude Codeが自律実行から過剰な権限要求に断続的に切り替わると報告。日々の変更のないワークフロー(モノレポの再構築やテスト実行など)でも発生する。

OpenClawユーザーがOpenRouter経由で1億4300万トークンを94ドルで処理したと報告
RedditユーザーがOpenClawマルチエージェントパイプラインを実行し、1億4300万トークンを94.16ドルで処理。OpenRouter経由のルーティングと特定の設定最適化により、約0.66ドル/100万トークンのコストを達成。
AIの生産性向上がエネルギー・経済モデルにおいて純CO₂排出量の増加を牽引
新しい研究では、AIをグローバルなエネルギー経済モデルにおける双方向の生産性増幅器としてモデル化し、化石燃料の生産性向上による排出量の増加が、再生可能エネルギーの改善による回避排出量を上回ることを発見した。再生可能エネルギーの利得が化石燃料の4〜5倍以上でない限り、純排出量は増加する。