ローカルLLMとクラウドLLMの一貫したベンチマーク手法

r/LocalLLaMAの開発者が、ローカルLLMとクラウドAPIを比較する際に一貫性のあるベンチマーク数値を得るための方法論を詳述し、異なるレイテンシ、スコアリング、方法論による不公平な比較によくある不満に対処しています。
ベンチマークの核心的な問題
ローカルモデルとクラウドモデルの両方にリクエストを送る素朴な比較では、異なる要素を測定してしまいます。クラウドAPIにはキューイング、負荷分散、ルーティングが関与します。ローカルモデルにはウォームアップ、バッチ処理、GPU競合が関与します。実装された解決策は、順次リクエストのみを使用することです。遅くはありますが(60回の呼び出しベンチマークで約45秒ではなく約3分かかります)、各測定がクリーンであることを保証し、推論時間をキュー時間から分離します。
測定セットアップ
このセットアップでは、ZenMuxを統一エンドポイントとして使用し、GPT-5.4、Claude Sonnet 4.6、Gemini 3.1 Pro、ローカルのLlama 4量子化モデルの4つのモデルに対して1つのベースURLを提供します。このアプローチは、以下のようなOpenAI互換エンドポイントであれば動作します:
- llama.cppサーバー:
curl http://localhost:8080/v1/chat/completions ... - vLLM:
curl http://localhost:8000/v1/chat/completions ... - Ollama:
curl http://localhost:11434/v1/chat/completions ...
重要なのは、すべてに対して同じクライアントコード、タイムアウト設定、リトライロジックを使用することです。
測定の仕組み
システムは5つのモジュールで構成されています:YAML設定 → BenchRunner → AIClient → Analyzer → Reporter。
YAML設定ではタスクとモデルを定義します。例:
suite: coding-benchmark
models:
- gpt-5.4
- claude-sonnet-4.6
- gemini-3.1-pro
- llama-4
runs_per_model: 3
tasks:
- name: fizzbuzz
prompt: "1から100までの数字に対してFizzBuzzを出力するPython関数を書いてください"
- name: refactor-suggestion
prompt: "このコードを改善する提案をしてください:\n\ndef calc(x):\n if x == 0: return 0\n if x == 1: return 1\n return calc(x-1) + calc(x-2)"BenchRunnerは、タスク×モデル×実行回数の直積を取り、APIを順次呼び出し、レイテンシ、プロンプトトークン、完了トークンを記録します。
スコアリング部分
品質スコアリングは、自己選好バイアスを避け、再現性を確保するために、LLMを審判とするのではなくルールベースです。_quality_score関数は3つのシグナルを使用します:
- 応答長:50〜3000文字で4.0点、短い場合は1.0点、長い場合は3.0点。
- フォーマット:箇条書きの存在に応じて最大3.0点を追加。
- コードの存在:コードブロックや関数定義を検出すると2.0点を追加。
最高スコアは9.0点です。これにより、「良い構造化された応答」と「ゴミ/空/幻覚」を相対的にランク付けする信頼性が得られます。レイテンシについては、95パーセンタイル応答時間(P95)も計算されます。
📖 Read the full source: r/LocalLLaMA
👀 See Also

あなたのLLMはコーディングエージェントのワークフローであるべきではない:OpenClawにおける関心の分離
コーディングエージェントのワークフローがLLMの利用制限に達した瞬間に停止してしまうなら、それはLLMがやりすぎている証拠です。キュー、状態、リトライ、検証は決定的に保ち、LLMは判断が必要なときだけ呼び出しましょう。

Qwen 3.5 ツール呼び出しのエージェント利用向け修正:サーバーステータスとクライアント側の回避策
詳細な分析により、エージェント環境でのQwen 3.5のツール呼び出しを完全に破壊する4つのバグが特定され、2026年4月時点でのサーバー修正状況を追跡し、サーバーが失敗した場合にXMLツール呼び出しを解析するクライアント側のPython関数を提供します。

VPSと専用サーバー:OpenClawをどこで実行するか
新規ユーザーが最初に尋ねる質問の一つ:OpenClawはどこで実行すべきか?決断を助ける比較をご紹介します。

サブスクリプションモデルを活用したコスト効率の良いOpenClawマルチエージェントセットアップ
Redditユーザーが、生のAPI呼び出しの代わりに既存の200ドルのAnthropic Pro Maxと200ドルのChatGPT OpenAI Codexサブスクリプションを活用してOpenClawマルチエージェント運用を全てルーティングする方法を説明。シンプルなエージェントには安価なAnthropicモデルを、より複雑なエージェントには高度なモデルを使用。