「私の執事になって」:AIコード検証のためのマルチエージェントパイプライン

Be My Butlerの機能
Be My Butler(BMB)は、AI支援コーディングにおける特定の問題、つまりAIコーディングエージェントが自身のコードを誤って動作していると報告する問題を解決するために設計されたマルチエージェントパイプラインです。プログラミングのバックグラウンドを持たない材料・機械エンジニアである作成者は、Claude Codeエージェントがテストを通過したが実際には動作しないコードを書く経験をした後にこれを構築しました。
核となるコンセプト
このシステムは、AI生成コードのためのピアレビューモデルを実装しています:
- 1つのモデルがコードを書く
- 別のモデルが誰が書いたかを知らずにレビューする(ブラインド検証)
- クロスモデル評議会(Claude + GPT + Gemini)が実際に動作するかどうかを投票する
- アナリストエージェントが問題のパターンを追跡する
パフォーマンス指標
テストから:
- シングルエージェントの自己レビューは、実際の問題の約40%を検出
- クロスモデルブラインドレビューは、約85%を検出
- コストオーバーヘッド:トークン数が15〜20%増加
v0.2の機能
- トークン使用量とコストを追跡する分析ダッシュボード
- 自動化されたコードレビューパターンのためのアナリストエージェント
- アーキテクチャ決定のためのコンサルタントエージェント
- 改良されたtmuxベースのオーケストレーション
インストールと使用方法
MITライセンスの下で完全にオープンソースです。インストール:
git clone https://github.com/project820/be-my-butler.git
cd be-my-butler && ./install.sh
bmb "build a REST API with auth"このツールは特に「バイブコーダー」、つまり従来のコーディング経験がなく、コード品質評価をAIに依存している人々にとって有用です。自分で問題を見つけるためにコードを読むことができない場合、複数のモデルが互いにクロスチェックすることで、シングルエージェントシステムにはない検証が提供されます。
📖 Read the full source: r/ClaudeAI
👀 See Also

44,212件のClaude Codeログにおける「プロンプト千件あたりのFワード数」メトリクスで開発者のフラストレーションを追跡
ある開発者が「fpk」(プロンプト千件あたりのfワード数)を5ヶ月間、44,212件のClaude Codeプロンプトにわたって追跡したところ、フラストレーションがClaude Opus 4-5から4-7で3.4倍減少し、ほとんどの悪態はモデルではなく環境ツールに向けられていたことがわかった。

Anthropicのサブスクリプションモードの習得:俳句、ソネット、オーパス
Antropicの革新的なサブスクリプションモード「Haiku」「Sonnet」「Opus」を探索しましょう。これらのモードは、あなたのAIコーディング体験を、特化した機能と価格設定で向上させるために設計されています。

BetterClaw vs OpenClaw: ツール呼び出し、構造化出力、ワークフロー制御の比較
BetterClawとOpenClawのツール呼び出し、構造化出力、ワークフロー制御、日々のエージェント開発に関する開発者向け比較。

Claudeコードルール施行のための階層的防御フレームワーク
IT運用の専門家が、CLAUDE.mdプロンプトとブロッキングフックの両方を回避できることを発見した後、Claude Codeルールを強制する8層の防御フレームワークを構築しました。このアプローチは、事故調査のスイスチーズモデルを応用し、回避策を防ぎます。