EvalShift: モデル移行中のLLM回帰検出のためのオープンソースCLI

✍️ OpenClawRadar📅 公開日: May 15, 2026🔗 Source
EvalShift: モデル移行中のLLM回帰検出のためのオープンソースCLI
Ad

EvalShiftは、LLMやモデルバージョン間の切り替え時に回帰を検出するためのオープンソースPython CLIです。ゴールデン入力スイートをソースモデルとターゲットモデルの両方に対して実行し、出力を評価して、ローカルHTMLレポートを生成します。バックエンドやアカウント、テレメトリは不要です。

主な機能

  • LiteLLMによるソースモデルとターゲットモデルの比較
  • タグ/スライス付きJSONLゴールデンスイート
  • 構造的評価: JSONスキーマ、正規表現、長さ
  • 意味的評価: 埋め込み類似度
  • LLM-as-judgeによるペアワイズ評価
  • ツール呼び出し評価: ツール選択、引数マッチング、トレース構造
  • ペア統計検定: t検定 / Wilcoxon
  • 効果量: Cohen's d
  • 多重比較補正: Benjamini-Hochberg
  • スライスレベルの内訳
  • ローカルキャッシュによるコスト制御
  • 再開可能な実行
  • 単一ファイルHTMLレポート + JSON出力

このプロジェクトの狭い目標は移行の安全性です。「プロンプトやエージェントの動作を壊さずにモデルを切り替えられるか?」著者は、静かなエージェント回帰(例えば、新しいモデルが一見妥当な最終回答を生成するが、必要なツール呼び出しをスキップしたり、間違ったツールを呼び出したり、引数を変更したりする)を捕捉することを重視しています。

ユースケース

  • Claude 4.5 → Claude 5
  • GPT-5 → GPT-6
  • Gemini 2 → 3
  • ローカルモデル → ホストモデル

著者は、ローカルモデルとホストモデルのどちらに役立つか、ローカルLLMワークフローで最も重要な評価タイプ、ツール呼び出し/構造化出力の回帰が実際に問題となるかについてフィードバックを求めています。リポジトリはMITライセンスです。

📖 ソース全文を読む: r/LocalLLaMA

Ad

👀 See Also

OpenClawのatoshipスキルは、AIアシスタントを配送マネージャーに変えます。
Tools

OpenClawのatoshipスキルは、AIアシスタントを配送マネージャーに変えます。

OpenClawのatoshipスキルにより、ユーザーは配送ニーズを平易な英語で説明でき、その後、運送会社の選択、料金比較、ラベル購入、追跡を処理します。例として、「この1ポンドの箱をニューヨークへ、最も安いオプションで送ってください」といったコマンドがあります。

OpenClawRadar
マゼラン:クロードコード上に構築された15エージェント自律科学発見システム
Tools

マゼラン:クロードコード上に構築された15エージェント自律科学発見システム

MAGELLANは、Claude Code上に完全に構築された15エージェントの自律的科学発見システムです。Opusを深い推論に、Sonnetを構造化タスクに使用し、人間の指示なしに学際的な仮説を生成します。19回のセッションで260の仮説が提案され、敵対的検証によって60%が棄却されました。

OpenClawRadar
Swarmcoreの紹介:Pythonで実装されたスケーラブルなマルチエージェントフレームワーク
Tools

Swarmcoreの紹介:Pythonで実装されたスケーラブルなマルチエージェントフレームワーク

Swarmcoreは、Pythonでスケーラブルなマルチエージェントワークフローを実行するためのオープンソースライブラリで、逐次実行または並列実行、拡張可能なコンテキスト管理を特徴としています。

OpenClawRadar
PageAgent:Ollamaサポートを備えたWebページ内で動作するブラウザAIエージェント
Tools

PageAgent:Ollamaサポートを備えたWebページ内で動作するブラウザAIエージェント

PageAgentは、スクリーンショットの代わりにライブDOMをテキストとして読み取ることで、Webページ内で直接AIエージェントを実行するJavaScriptライブラリです。Ollamaを含むあらゆるOpenAI互換エンドポイントで動作し、ブラウザから直接ローカルLLM呼び出しを可能にします。

OpenClawRadar