Arena AIモデルELO履歴が経時的なLLM性能低下を追跡

Erwin MayerのArena AI Model ELO History(ライブトラッカー)は、LMSYS Arenaリーダーボードの過去のELOレーティングをプロットし、フラッグシップAIモデルのパフォーマンス傾向を明らかにします。核となる洞察:発売時には素晴らしく感じられるモデルも、サイレントアップデート、量子化、またはセーフティラッパーの変更により、数週間後に劣化することがよくあります。
主な機能
- 研究所ごとに1本の曲線:すべてのバリアントを描くスパゲッティチャートではなく、主要なAI研究所ごとに、各時点で最高評価のフラッグシップモデルを表す1本の連続線を表示します。
- フラッグシップ追跡ロジック:曲線は最上位モデルに固定されます(例:Opusは、新しい高スコアモデルが登場するまでアクティブのまま)。Opusがリードしている間、Sonnetなどの中級リリースではジャンプは発生しません。
- 推論モードの統合:
-thinking、-reasoning、-highなどのサフィックスはベースモデルに統合され、切り替わりを防ぎます。 - 新リリースマーカー:リリースはラベル付きポイントとして表示され、通常はスコアのジャンプを伴います。
- 劣化の可視化:リリース間のモデルライフサイクル内での下降トレンドが明確にプロットされます。
- モバイルフレンドリー+ダークモードを搭載。
データソース
データはHugging Faceの公式LMSYS Arenaデータセットから毎日自動的に取得されます。ArenaはAPIエンドポイントを介した数千のブラインドクラウドソーシングによる人間評価を使用しています。コンシューマー向けWeb UIではありません。
重大な盲点:Web UI vs. API
著者は重要な制限を認めています。LMSYSは生のAPIモデルをテストします。コンシューマー向けインターフェース(chatgpt.com、gemini.com)は重いシステムプロンプト、セーフティラッパーを追加し、負荷がかかると量子化モデルにサイレントに切り替える可能性があります。このプロジェクトは、ユーザーが経験する「ナーフィング」を捉えるために、実際のWeb UIからの過去のELOまたは評価データセットを求めています。そのようなデータセットのPRは歓迎します(リポジトリリンクはフッターにあります)。
対象ユーザー
特に一貫したモデル動作に依存するAIエージェントを展開する、LLMモデルの品質を長期追跡する開発者や研究者。
📖 出典全文を読む: HN LLM Tools
👀 See Also

Kanban CLI:终端用本地优先、智能体优先的任务管理器
Kanban CLIは、Rust製のターミナルツールで、完全なgit統合により構造化されたタスク追跡を提供し、AIエージェント駆動のワークフロー向けに設計されています。

エージェントフォージ:Claude Code向けマルチエージェントパイプラインを構築するオープンソースツール
Agent Forgeは、ユースケースの説明から完全なマルチエージェントパイプラインを生成するClaude Codeスキルです。既存のマルチエージェントシステムで観察されたパターンに基づき、プロンプトファイル、オーケストレータースクリプト、データフローディレクトリ、GitHub Actions設定を生成します。

Atoo Studio:マルチプロジェクトのClaudeコードワークフローを管理するためのオープンソースワークスペース
Atoo Studioは、複数のプロジェクトでClaude Codeを使用する際のターミナルやタブの混乱に対処するために構築されたオープンソースワークスペースです。Gitブランチのようなセッションフォークを導入し、Claude Code、Codex CLI、Gemini CLI間での継続を可能にします。

MCP-Loci:ClaudeおよびMCP互換AI向けローカル永続メモリサーバー
MCP-Lociは、Claudeのセッションベースのメモリ制限を解決する永続メモリサーバーで、remember、recall、forget、synthesize、healthの5つのツールを備えています。APIキーを必要とせず、ハイブリッドBM25キーワードマッチングとセマンティック埋め込みを使用して正確な検索を実現します。