EvalShift: モデル移行中のLLM回帰検出のためのオープンソースCLI

EvalShiftは、LLMやモデルバージョン間の切り替え時に回帰を検出するためのオープンソースPython CLIです。ゴールデン入力スイートをソースモデルとターゲットモデルの両方に対して実行し、出力を評価して、ローカルHTMLレポートを生成します。バックエンドやアカウント、テレメトリは不要です。
主な機能
- LiteLLMによるソースモデルとターゲットモデルの比較
- タグ/スライス付きJSONLゴールデンスイート
- 構造的評価: JSONスキーマ、正規表現、長さ
- 意味的評価: 埋め込み類似度
- LLM-as-judgeによるペアワイズ評価
- ツール呼び出し評価: ツール選択、引数マッチング、トレース構造
- ペア統計検定: t検定 / Wilcoxon
- 効果量: Cohen's d
- 多重比較補正: Benjamini-Hochberg
- スライスレベルの内訳
- ローカルキャッシュによるコスト制御
- 再開可能な実行
- 単一ファイルHTMLレポート + JSON出力
このプロジェクトの狭い目標は移行の安全性です。「プロンプトやエージェントの動作を壊さずにモデルを切り替えられるか?」著者は、静かなエージェント回帰(例えば、新しいモデルが一見妥当な最終回答を生成するが、必要なツール呼び出しをスキップしたり、間違ったツールを呼び出したり、引数を変更したりする)を捕捉することを重視しています。
ユースケース
- Claude 4.5 → Claude 5
- GPT-5 → GPT-6
- Gemini 2 → 3
- ローカルモデル → ホストモデル
著者は、ローカルモデルとホストモデルのどちらに役立つか、ローカルLLMワークフローで最も重要な評価タイプ、ツール呼び出し/構造化出力の回帰が実際に問題となるかについてフィードバックを求めています。リポジトリはMITライセンスです。
📖 ソース全文を読む: r/LocalLLaMA
👀 See Also

Claudeがpywikibotをインポートせずに3,000行のコードを書いた理由——AIエージェントが既存ライブラリを無視するケーススタディ
ある開発者がClaude Code(Opus 4.7)にFandomウィキのタイポ修正を依頼した。モデルは既存ライブラリをインポートせず、pywikibot、mwparserfromhell、RETFルールを再実装した約3,000行のPythonコードを書いた。この記事では、なぜそうなるのか、そして2分の検索でコードベースが1,259行に減った経緯を探る。

InsForge:Claudeコードエージェントのためのバックエンドセマンティックレイヤー
InsForgeは、Claude CodeエージェントがAPI統合を推測する代わりに、MCPを通じて検査・設定できる構造化コンポーネントとして、認証、PostgreSQLデータベース、S3互換ストレージ、エッジ/サーバーレス関数、モデルゲートウェイ、サイトデプロイの6つのバックエンドプリミティブを公開しています。

なぜ大規模なPythonモノリスにおいてCodexが依然としてClaude Codeに勝るのか
シニア開発者が、アーキテクチャが混在する本番環境のPythonモノリスでCodexとClaude Codeを比較。Codexは、計画性、コード再利用、ハーネスエンジニアリングの遵守において優れ、バックエンド作業で勝利した。

Microsoft DebugMCP VS Code拡張機能がAIエージェントにデバッグ機能を提供
Microsoft DebugMCPは、Model Context Protocol(MCP)を介してAIコーディングエージェントに完全なVS Codeデバッガーを公開するVS Code拡張機能であり、ブレークポイントの設定、コードのステップ実行、変数の検査、式の評価を可能にします。