ベンチマークによると、スマートフォンから家庭内チャットアプリケーションにおいて、小規模な4Bモデルが大規模LLMを上回る性能を示しています。

電話から自宅チャットベンチマーク結果
最近のベンチマークでは、推論を自宅コンピューターで実行する電話から自宅チャットアプリケーション向けに8つのローカルLLMが評価されました。テストはMac mini M4 Pro 24Gbハードウェア上で、640回の評価(8モデル×8データセット×10サンプル)を実施しました。
適合度計算式と重み付け
総合適合度計算式では3つの要素を重み付けしました:チャットUX 50%、速度 30%、短文品質 20%。この重み付けは、遅延が最も重要なモバイルアプリケーションにおいてユーザーエクスペリエンスを優先するものです。
主な発見
- Gemma3:4Bはテスト対象の中で最小モデルにもかかわらず、総合適合度スコア88.7で優勝
- 最低TTFT(11.2秒)、最高スループット(89.3トークン/秒)、最も低い温度(45°C)を達成
- GPT-OSS:20Bのような大規模モデルはタスクの70%を通過したが、平均TTFT25.4秒のため6位に留まった
- 温度性能は大きく異なりました:Qwen3:14Bは83°C、DeepSeek-R1:14Bは81°Cまで上昇
- Magistral:24Bはタイムアウトループを引き起こしGPU温度97°Cに達したため最終ランキングから除外
小規模モデルが優れた理由
このベンチマークは、電話チャットアプリケーションでは、生の精度よりも最初のトークン応答(TTFT)の速さと発熱負荷の低さが重要であることを明らかにしました。77.5%の精度を達成しても最初のトークン待ち時間25秒を要するモデルは、72.5%の精度でも11秒で応答するモデルに負けます。温度差は個人用ハードウェアの信頼性と寿命にとって重要です。
独立分析
同じ640評価データセットを使用したClaudeによる独立分析では、信頼性とTTFTをより積極的に重み付けし、若干異なるトップ4順序を導き出しました。これはKPIの重み付けが絶対的な真実ではなく選択であることを確認しています。
ユースケースの考慮事項
著者は、コーディングや長文執筆など異なるユースケースでは、重み付け計算式が完全に逆転し、速度やチャットUXよりも品質が優先されると指摘しています。
📖 詳細はこちら: r/LocalLLaMA
👀 See Also

Claude Code v2.1.85 リリース: MCPの改善、フックフィルター、バグ修正
Claude Code v2.1.85は、MCPヘッダーヘルパーの環境変数追加、フックのプロセス生成を削減する条件付きifフィールド、/compactの失敗、プラグインの有効化/無効化の問題、Ghostty、Kitty、WezTermのターミナルキーボード問題の修正を追加しました。

プロジェクトヘルスチェック:Claw/Assistantリポジトリにおけるバスファクターとコミット活動
Redditユーザーが主要な爪/アシスタントプロジェクトのコミットデータをスクレイピングしたところ、バスファクターが1のプロジェクトが多いことが判明しました。つまり、1人の作者がコミットの50%以上を占めています。また、一部のプロジェクトでは4月のアクティビティが急減しています。

Claude Cowork UXの問題:永続的な入力ボックスが誤った継続性の期待を生む
ユーザーがClaude CoworkでUXの問題を特定しました。永続的なテキスト入力ボックスはタスク切り替え時に下書きテキストを保持しますが、コンテキストをリセットし添付ファイルを失うため、連続性について矛盾した信号を生み出しています。

プロバイダーを超えたAPI監視をonWatchで革新する
強力な新ツール「onWatch」が、複数のプロバイダーにわたるAI APIクォータ使用量の追跡を効率化し、制限内での運用とリソース配分の最適化を実現する方法をご紹介します。