16GB Mac Mini M4での88の小型GGUFモデルのベンチマーク

✍️ OpenClawRadar📅 公開日: March 2, 2026🔗 Source
16GB Mac Mini M4での88の小型GGUFモデルのベンチマーク
Ad

Mac Mini M4(16GB統合メモリ)でGGUFモデルを一括ダウンロード、ベンチマーク、アップロード、削除する自動パイプラインが開発されました。このパイプラインは、当該ハードウェア構成に適したローカルLLMを見つけるために88モデルをテストしました。

主な発見

  • 88モデル中9つが16GB RAMでは使用不可 - 重みとKVキャッシュの合計が約14GBを超えるモデルはメモリスラッシングを引き起こし、TTFTが10秒以上またはトークン速度が0.1未満になります。これには全ての密な27B+モデルが含まれます。
  • スループット対品質のパレートフロンティア上にあるのは4モデルのみ - 全てLFM2-8B-A1Bアーキテクチャ(LiquidAIのMoE、活性化パラメータ1B)です。MoE設計によりトークンあたり約1Bパラメータのみが活性化され、密な8Bモデルが5-7トークン/秒で頭打ちになるのに対し、12-20トークン/秒を達成しています。
  • 1kから4kへのコンテキスト拡張はフラット - 大半のモデルでスループット低下はゼロで、一部のLFM2バリアントでは4kコンテキストで実際に高速化しています。
  • 並行処理スケーリングは低い(並行度2で理想2.0xに対し0.57x) - Mac Miniはメモリ帯域幅が制限されているため、一度に1リクエストを実行することを推奨します。
Ad

パレートフロンティアモデル

以下の4モデルは速度と品質の両方で他を上回りました:

  • LFM2-8B-A1B-Q5_K_M(unsloth):平均14.24 TPS、品質スコア44.6
  • LFM2-8B-A1B-Q8_0(unsloth):平均12.37 TPS、品質スコア46.2
  • LFM2-8B-A1B-UD-Q8_K_XL(unsloth):平均12.18 TPS、品質スコア47.9
  • LFM2-8B-A1B-Q8_0(LiquidAI):平均12.18 TPS、品質スコア51.2

品質評価にはコンパクトなサブセット(GSM8K 20問 + MMLU 60問)を使用 - 順位付けには方向性として有用ですが、公表レベルの絶対値ではありません。

推奨事項

最高品質の場合:LFM2-8B-A1B-Q8_0。速度重視の場合:Q5_K_M。バランス重視の場合:UD-Q6_K_XL。

技術詳細

  • ハードウェア:Mac Mini M4、16GB統合メモリ、macOS 15.x
  • ソフトウェア:llama-server(llama.cpp)
  • 方法論:スループット数値は複数リクエストのp50
  • データ:全てのデータはリポジトリ内の成果物から再現可能

パイプライン全体は自動化されオープンソースです。全88モデルのCSVデータとベンチマークスクリプトはリポジトリで利用可能です。

📖 全文を読む: r/LocalLLaMA

Ad

👀 See Also

モバイルからのClaude Code CLI制御用Telegramボット
Tools

モバイルからのClaude Code CLI制御用Telegramボット

開発者が、/commit、/code_review、/simplifyなどのモバイルコマンドで制御できるClaude Code CLIへのブリッジとなるTelegramボットを構築しました。このボットはカスタムスキルを自動検出し、写真/ドキュメント/音声メモを処理し、グループチャットセッションをサポートします。

OpenClawRadar
Claudeプラグイン:コンピュータービジョン、マルチエージェント協議会、セルフデバッグワークフロー
Tools

Claudeプラグイン:コンピュータービジョン、マルチエージェント協議会、セルフデバッグワークフロー

3つのClaudeプラグインがリリースされました:Windowsアプリ自動化のためのComputer Vision v1.7.0、敵対的マルチエージェント協議のためのThe Council v3.1.0、求人市場分析のためのUpwork Scraper v0.2.0です。デモンストレーションでは、Claudeがこれらのプラグインを使用して自身のソリティア自動化バグを診断・修正する様子が示されました。

OpenClawRadar
RubyLLM: すべての主要AIプロバイダーに対応する一つのRubyフレームワーク
Tools

RubyLLM: すべての主要AIプロバイダーに対応する一つのRubyフレームワーク

RubyLLMは、OpenAI、Anthropic、Gemini、Ollamaなど800以上のモデルを統一したRubyフレームワークです。チャット、ビジョン、音声、ツール、エージェント、ストリーミング、Rails統合を備えています。

OpenClawRadar
OpenClaw CoreBrain プラグイン:AIコーディングエージェントのための永続メモリ
Tools

OpenClaw CoreBrain プラグイン:AIコーディングエージェントのための永続メモリ

新しいプラグイン「CoreBrain」は、情報をコンテキストウィンドウ外のナレッジグラフに保存し、各クエリの前に自動的に注入することで、OpenClawのメモリ問題を解決します。これにより、ツール呼び出しやオプションのメモリ呼び出しが不要になります。

OpenClawRadar