Bifrost LLM Gateway: 11マイクロ秒のオーバーヘッド、Go製のシングルバイナリ

Bifrostとは
Bifrostは、セルフホスト環境向けにGoで書かれたドロップインLLMプロキシです。OpenAI、Anthropic、Azure、Bedrockなどのプロバイダーにリクエストをルーティングしながら、フェイルオーバー、キャッシング、予算管理を処理します。
パフォーマンスベンチマーク
開発者は5,000リクエスト/秒を持続的にベンチマークしました:
- Bifrost (Go): リクエストごとに約11マイクロ秒のオーバーヘッド
- LiteLLM (Python): リクエストごとに約8ミリ秒のオーバーヘッド
これはオーバーヘッドで約700倍の差です。
メモリ使用量の比較
同じスループットで:
- Bifrost: 約50MB RAMベースライン、負荷下でも平坦に保たれる
- LiteLLM: 約300-400MBベースライン、高トラフィック時には800MB以上に急増
開発者は、LiteLLMで2k+ RPSを実行するには水平スケーリングと大規模なインスタンスが必要である一方、Bifrostは月額20ドルのVPSで5k RPSを処理できると指摘しています。
負荷下での安定性
Bifrostのパフォーマンスは負荷下でも一定で、100 RPSでも5,000 RPSでも同じレイテンシを維持します。対照的に、LiteLLMはトラフィックが急増すると予測不可能になります - レイテンシの変動が増加し、メモリが急増し、GCポーズが最悪のタイミングで発生します。
独自機能
Bifrostには、10以上のMCPツールサーバーを接続し、ディスカバリー、名前空間、ヘルスチェック、リクエストごとのツールフィルタリングを処理するMCPゲートウェイが含まれています。LiteLLMはMCPをサポートしていません。
デプロイメントと移行
デプロイメントは単一のバイナリで、Python仮想環境、依存関係の問題、Dockerは必要ありません。サーバーにコピーして実行するだけです。
移行については、APIはOpenAI互換です。ベースURLを変更し、既存のコードを維持でき、ほとんどの移行は1時間以内で完了します。
オープンソースの入手可能性
このプロジェクトはオープンソースで、github.com/maximhq/bifrostで入手可能です。
📖 完全なソースを読む: r/clawdbot
👀 See Also

Snip: オープンソースツールがYAMLフィルターでClaude Codeのトークン使用量を削減
SnipはGoで書かれたオープンソースツールで、Claude Codeのトークン使用量を60〜90%削減します。これは、シェルコマンドの出力がコンテキストウィンドウに到達する前にフィルタリングすることで実現します。rtk(Rust Token Killer)に触発されていますが、異なるアプローチを取っています:フィルターはコンパイルされたコードではなく、データ(YAMLファイル)です。

QuellプロキシによるWindowsでのClaudeコードスクロールジャンプの修正
Quellは、端末とClaude Codeの間に位置するRust製プロキシで、長い応答中にスクロール位置のリセットを引き起こす画面クリアシーケンスを除去します。また、Shift+Enterでの改行、セキュリティフィルタリング、完全なUnicodeサポートも追加します。

Claude-Code v2.1.76では、MCPの誘導機能、ワークツリーの最適化、および多数の修正が追加されました。
Claude-Code v2.1.76は、構造化入力のMCPエリシテーションサポートを追加し、monorepo効率化のためのworktree.sparsePathsを導入し、遅延ツールスキーマの消失、スラッシュコマンドの問題、Remote Controlセッションの安定性など20以上の問題を修正しました。

スニップツールは、AIコーディングエージェントとの視覚的コミュニケーションを可能にします。
Snipは、開発者がAIエージェントに視覚的に意図を伝えるためのスクリーンショット、注釈、描画を可能にする無料ツールです。エージェントはCLIやMCPを通じてダイアグラムを生成したり画像を直接読み込んだりできます。現在はApple Silicon Macで動作し、Mermaidダイアグラムをサポート、HTMLサポートは開発中です。