ベンチマークによると、スマートフォンから家庭内チャットアプリケーションにおいて、小規模な4Bモデルが大規模LLMを上回る性能を示しています。

電話から自宅チャットベンチマーク結果
最近のベンチマークでは、推論を自宅コンピューターで実行する電話から自宅チャットアプリケーション向けに8つのローカルLLMが評価されました。テストはMac mini M4 Pro 24Gbハードウェア上で、640回の評価(8モデル×8データセット×10サンプル)を実施しました。
適合度計算式と重み付け
総合適合度計算式では3つの要素を重み付けしました:チャットUX 50%、速度 30%、短文品質 20%。この重み付けは、遅延が最も重要なモバイルアプリケーションにおいてユーザーエクスペリエンスを優先するものです。
主な発見
- Gemma3:4Bはテスト対象の中で最小モデルにもかかわらず、総合適合度スコア88.7で優勝
- 最低TTFT(11.2秒)、最高スループット(89.3トークン/秒)、最も低い温度(45°C)を達成
- GPT-OSS:20Bのような大規模モデルはタスクの70%を通過したが、平均TTFT25.4秒のため6位に留まった
- 温度性能は大きく異なりました:Qwen3:14Bは83°C、DeepSeek-R1:14Bは81°Cまで上昇
- Magistral:24Bはタイムアウトループを引き起こしGPU温度97°Cに達したため最終ランキングから除外
小規模モデルが優れた理由
このベンチマークは、電話チャットアプリケーションでは、生の精度よりも最初のトークン応答(TTFT)の速さと発熱負荷の低さが重要であることを明らかにしました。77.5%の精度を達成しても最初のトークン待ち時間25秒を要するモデルは、72.5%の精度でも11秒で応答するモデルに負けます。温度差は個人用ハードウェアの信頼性と寿命にとって重要です。
独立分析
同じ640評価データセットを使用したClaudeによる独立分析では、信頼性とTTFTをより積極的に重み付けし、若干異なるトップ4順序を導き出しました。これはKPIの重み付けが絶対的な真実ではなく選択であることを確認しています。
ユースケースの考慮事項
著者は、コーディングや長文執筆など異なるユースケースでは、重み付け計算式が完全に逆転し、速度やチャットUXよりも品質が優先されると指摘しています。
📖 詳細はこちら: r/LocalLLaMA
👀 See Also

Anthropicが100万件のClaude会話を分析:6%が個人的ガイダンスを求め、お世辞率9%、Opus 4.7で改善
100万件のClaude会話の分析により、6%が個人的なアドバイスを求めており、人間関係における同調率が最も高い(25%)ことが判明。Opus 4.7とMythos Previewでは、合成トレーニングデータを使用して同調率を半分に削減。

GitHub Copilot、2026年6月1日よりプレミアムリクエストに代わりトークン消費量ベースの課金に移行
GitHub Copilot は、プレミアムリクエストユニットからトークンベースの GitHub AI Credits に移行します。プラン料金は変更ありません。すべての有料プランには、サブスクリプション料金に相当する月間クレジットが含まれます。追加使用分は API レートで請求されます。

Claude Code v2.1.214 リリース: OTelトレーシング、権限修正、EndConversationツール、Docker保護
AnthropicはClaude Code v2.1.214をリリース。BashとPowerShellの権限バイパスを修正し、OpenTelemetry属性の追加、Dockerフラグのプロンプト、悪用ユーザー対応のEndConversationツールを搭載。

自分自身の作品として提示するものにAIを使って書くな
ジェームズ・バックは、自分が作成したと主張するコンテンツをAIで下書きすることを否定する。AIの助けを認めると評判が傷つき、作品はすべて「粗悪品」扱いされると警告する。