エージェント型テキスト-to-SQLタスクにおける小規模ローカルモデルとOpenRouterモデルのベンチマーク結果

開発者が、エージェント型テキスト-to-SQLタスクにおける小型ローカルモデルとOpenRouterモデルのベンチマーク結果を公開しました。このベンチマークは、「各製品サブカテゴリについて、注文明細、売上高、販売数量、単位当たり売上高(総売上高÷総販売数量)、サブカテゴリ内の製品ごとの平均定価、粗利益、利益率を表示」といった英語クエリを受け取り、データベーステーブルに対してテストされるSQLに変換します。
ベンチマークの詳細
エージェントはクエリ結果を確認し、問題を修正するためにSQLを修正できますが、デバッグラウンド数に制限があります。ベンチマークは意図的に短く25問で構成され、ほとんどのモデルで5分未満で実行されるため、さまざまな設定をテストするのに実用的です。最良のモデルを他と区別するのに十分な厳しさを持つように設計されています。
主な発見
- 特定された最良のオープンモデルは、kimi-k2.5、Qwen 3.5 397B-A17B、Qwen 3.5 27Bでした
- NVIDIA Nemotron-Cascade-2-30B-A3BはQwen 3.5-35B-A3Bを上回り、Codex 5.3と同等のスコアを達成
- Mimo v2 Flashは「モデルの宝石」と評されました
セルフホスティングオプション
このベンチマークには、Llama.cppのWASMバージョンを使用して自身のサーバーに対して実行する機能が追加されました。開発者はバージョン2で変更すべき点についてフィードバックを求めており、異なる設定で他のユーザーが得るスコアを確認したいと考えています。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

本を司書と共に:読書管理とネタバレなしのおすすめ
OpenClawスキルが読書生活を記録し、所有する未読本から優先的に推薦、時間と共に嗜好の変化を学習します。

OpenClawローカルエージェント実装:ミッドレンジハードウェア向けTurboQuantキャッシング搭載
OpenClaw向けのワンクリックアプリが、TurboQuantキャッシュとコンテキストウォーミングを活用し、MacBook Air(16GB RAM)などの中間スペックデバイスでローカルモデルを実行できるようになりました。この実装では、信頼性の高いツール呼び出しを実現するためにllama.cppにパッチを適用し、Gemma 4とQWEN 3.5で毎秒10~15トークンの処理速度を達成しています。

AIエージェントのための複雑な検索パイプラインを、シンプルなgitコマンドで置き換える
ある開発者が、3GBのDockerイメージを、AIエージェントがgit log、grep、git diffなどの読み取り専用シェルコマンドをメモリリポジトリで直接実行できる単一ツールに置き換えました。

Claude価格改定後の代替AIコーディング環境
ある開発者が、現在のAIコーディングセットアップを共有しています。主要モデルとしてGPT 5.4を使用し、ChatGPTサブスクリプションに含まれるCodexをフォールバックとして、さらにMinimax 2.7をバックアップとしてコーディングプランの価格で利用しています。