RelayPlaneオープンソースプロキシ、Claudeモデルルーティングで73%のコスト削減を実現

Claude APIルーティングのためのオープンソースプロキシ
RelayPlaneは、Anthropic APIの前に配置されるオープンソースのnpmネイティブプロキシです。このツールはClaude Codeを使用して構築され、開発を加速させました。セルフホストは無料で、プロンプトの複雑度に基づいて異なるClaudeモデル間のルーティングを処理するように設計されています。
ベンチマーク結果と設定
ベンチマークでは、60%の単純タスクと40%の複雑タスクを含む混合ワークロードを使用しました。2つのシナリオを比較しました:
- 直接(すべてSonnet): p50レイテンシ 1.55秒、10リクエストあたりのコスト 0.0323ドル
- RelayPlane経由のルーティング: p50レイテンシ 0.78秒、10リクエストあたりのコスト 0.0086ドル
これは73.4%のコスト削減を表しています。1日あたり10,000リクエストの場合、これは月間約712ドルの節約に相当します。
ルーティング設定
ルーティング設定はシンプルです:
{
"routing": {
"complexity": {
"enabled": true,
"simple": "claude-haiku-4-5",
"moderate": "claude-sonnet-4-6",
"complex": "claude-opus-4-6"
}
}
}ルーティングロジックは、トークン数、コード指標、分析キーワードを調べる複雑度分類器を使用します。レスポンスヘッダーには、どのモデルが実際にリクエストを処理したかを確認するためのx-relayplane-routed-modelが含まれます。
モデル価格とルーティングロジック
ルーティングシステムは、複雑度に基づいてプロンプトを適切なモデルに振り分けます:
- 単純なプロンプト → Haiku(100万トークンあたり0.80ドル)
- 中程度のプロンプト → Sonnet(100万トークンあたり3ドル)
- 複雑なプロンプト → Opus(100万トークンあたり15ドル)
著者は、分類器は完璧ではないが「節約の大部分を捉えるには十分である」と述べています。完全なベンチマーク手法は、ソース資料にリンクされているGistで利用可能です。
📖 Read the full source: r/ClaudeAI
👀 See Also

Meera: Qwen3.5-2BをベースにしたLinux Gnome向け完全オフラインAIアシスタント
Meeraは、Qwen3.5-2B-Q4_K_M(1.2 GB)とVulkan対応のllama-cppを使用する、Gnome Desktop向けのオフラインAIアシスタントです。ツール選択とRAGのために2番目の小さな埋め込みモデルを活用し、プロンプトの埋め込み肥大化を回避します。Ubuntu 24.04 + RTX 5090、Fedora Silverblue + Intel i3で動作します。

ローカル深層研究ツールの現状:GPT Researcherとローカル深層研究がリード、STORMとLangChainプロジェクトは停滞
2026年5月時点のローカルディープリサーチプロジェクトに関するReddit調査では、GPT ResearcherとLearningCircuitのLocal Deep Researchが最も活発で、STORMとLangChainのOpen Deep Researchは放棄または半放棄状態であることが判明しました。

GitAgent: Gitリポジトリ内のポータブルAIエージェントのためのオープンスタンダード
GitAgentは、Gitリポジトリ内の3つのコアファイル(設定用のagent.yaml、性格・指示用のSOUL.md、機能定義用のSKILL.md)を通じてAIエージェントを定義するオープン仕様です。CLIを使用すると、npx @open-gitagent/gitagent run -r https://github.com/user/agent -a claude のようなコマンドで、任意のエージェントリポジトリを直接実行できます。

WCYフォーマットは、LLMのトークンオーバーヘッドを50〜71%削減し、構造化された「わかりません」マーカーを追加します。
WCY(Watch-Compute-Yield)は、JSONのトークンオーバーヘッドを50-71%削減し、推論中の不確実性を示す構造的な「?」マーカーを導入する行指向フォーマットです。このフォーマットはファインチューニングを必要とせず、わずか3つのfew-shot例だけで使用できます。