16GB Mac Mini M4での88の小型GGUFモデルのベンチマーク

Mac Mini M4(16GB統合メモリ)でGGUFモデルを一括ダウンロード、ベンチマーク、アップロード、削除する自動パイプラインが開発されました。このパイプラインは、当該ハードウェア構成に適したローカルLLMを見つけるために88モデルをテストしました。
主な発見
- 88モデル中9つが16GB RAMでは使用不可 - 重みとKVキャッシュの合計が約14GBを超えるモデルはメモリスラッシングを引き起こし、TTFTが10秒以上またはトークン速度が0.1未満になります。これには全ての密な27B+モデルが含まれます。
- スループット対品質のパレートフロンティア上にあるのは4モデルのみ - 全てLFM2-8B-A1Bアーキテクチャ(LiquidAIのMoE、活性化パラメータ1B)です。MoE設計によりトークンあたり約1Bパラメータのみが活性化され、密な8Bモデルが5-7トークン/秒で頭打ちになるのに対し、12-20トークン/秒を達成しています。
- 1kから4kへのコンテキスト拡張はフラット - 大半のモデルでスループット低下はゼロで、一部のLFM2バリアントでは4kコンテキストで実際に高速化しています。
- 並行処理スケーリングは低い(並行度2で理想2.0xに対し0.57x) - Mac Miniはメモリ帯域幅が制限されているため、一度に1リクエストを実行することを推奨します。
パレートフロンティアモデル
以下の4モデルは速度と品質の両方で他を上回りました:
- LFM2-8B-A1B-Q5_K_M(unsloth):平均14.24 TPS、品質スコア44.6
- LFM2-8B-A1B-Q8_0(unsloth):平均12.37 TPS、品質スコア46.2
- LFM2-8B-A1B-UD-Q8_K_XL(unsloth):平均12.18 TPS、品質スコア47.9
- LFM2-8B-A1B-Q8_0(LiquidAI):平均12.18 TPS、品質スコア51.2
品質評価にはコンパクトなサブセット(GSM8K 20問 + MMLU 60問)を使用 - 順位付けには方向性として有用ですが、公表レベルの絶対値ではありません。
推奨事項
最高品質の場合:LFM2-8B-A1B-Q8_0。速度重視の場合:Q5_K_M。バランス重視の場合:UD-Q6_K_XL。
技術詳細
- ハードウェア:Mac Mini M4、16GB統合メモリ、macOS 15.x
- ソフトウェア:llama-server(llama.cpp)
- 方法論:スループット数値は複数リクエストのp50
- データ:全てのデータはリポジトリ内の成果物から再現可能
パイプライン全体は自動化されオープンソースです。全88モデルのCSVデータとベンチマークスクリプトはリポジトリで利用可能です。
📖 全文を読む: r/LocalLLaMA
👀 See Also

Apple Silicon向けAIエージェントのローカル音声コントロール設定
Parakeet STTとKokoro TTSをApple Siliconで使用して、AIエージェントのローカル音声制御を設定する方法について説明します。これにより、高速でクラウドに依存しない対話が可能になります。

Interact MCP:Claude Codeのための高速ウェブブラウジングと永続的なChromium
Interact MCPは、プロセス内に永続的なChromiumブラウザを維持することで、ブラウザ操作時間を初回呼び出し後の2-5秒から5-50msに短縮するModel Context Protocolツールです。CSSセレクターなしで要素操作を行うためのrefシステムを備え、ウェブ自動化のための46種類のツールを含んでいます。

Warp ターミナルがエージェンティック開発環境とともにオープンソース化
Warpがオープンソース化され、エージェンティック開発環境としてリブランド。内蔵コーディングエージェントと、Claude Code、Codex、Gemini CLIなどの独自CLIエージェントのサポートを提供。

Meera: Qwen3.5-2BをベースにしたLinux Gnome向け完全オフラインAIアシスタント
Meeraは、Qwen3.5-2B-Q4_K_M(1.2 GB)とVulkan対応のllama-cppを使用する、Gnome Desktop向けのオフラインAIアシスタントです。ツール選択とRAGのために2番目の小さな埋め込みモデルを活用し、プロンプトの埋め込み肥大化を回避します。Ubuntu 24.04 + RTX 5090、Fedora Silverblue + Intel i3で動作します。