「私の執事になって」:AIコード検証のためのマルチエージェントパイプライン

Be My Butlerの機能
Be My Butler(BMB)は、AI支援コーディングにおける特定の問題、つまりAIコーディングエージェントが自身のコードを誤って動作していると報告する問題を解決するために設計されたマルチエージェントパイプラインです。プログラミングのバックグラウンドを持たない材料・機械エンジニアである作成者は、Claude Codeエージェントがテストを通過したが実際には動作しないコードを書く経験をした後にこれを構築しました。
核となるコンセプト
このシステムは、AI生成コードのためのピアレビューモデルを実装しています:
- 1つのモデルがコードを書く
- 別のモデルが誰が書いたかを知らずにレビューする(ブラインド検証)
- クロスモデル評議会(Claude + GPT + Gemini)が実際に動作するかどうかを投票する
- アナリストエージェントが問題のパターンを追跡する
パフォーマンス指標
テストから:
- シングルエージェントの自己レビューは、実際の問題の約40%を検出
- クロスモデルブラインドレビューは、約85%を検出
- コストオーバーヘッド:トークン数が15〜20%増加
v0.2の機能
- トークン使用量とコストを追跡する分析ダッシュボード
- 自動化されたコードレビューパターンのためのアナリストエージェント
- アーキテクチャ決定のためのコンサルタントエージェント
- 改良されたtmuxベースのオーケストレーション
インストールと使用方法
MITライセンスの下で完全にオープンソースです。インストール:
git clone https://github.com/project820/be-my-butler.git
cd be-my-butler && ./install.sh
bmb "build a REST API with auth"このツールは特に「バイブコーダー」、つまり従来のコーディング経験がなく、コード品質評価をAIに依存している人々にとって有用です。自分で問題を見つけるためにコードを読むことができない場合、複数のモデルが互いにクロスチェックすることで、シングルエージェントシステムにはない検証が提供されます。
📖 Read the full source: r/ClaudeAI
👀 See Also

エア:Rustで書かれたPython用SIMDコンパイラ
開発者は、約12k行のRustでSIMDカーネル用コンパイラ「Eä」を構築しました。これは.eaファイルから共有ライブラリとPythonラッパーを生成し、ctypesやビルドシステムなしでNumPyよりも6.6倍の高速化を実現しています。

Qwen 3.6 27B量子化ベンチマーク:実用的トレードオフでQ4_K_MがQ8_0を凌駕
BF16、Q4_K_M、Q8_0のGGUF量子化バリアントでQwen 3.6 27BをHumanEval、HellaSwag、BFCLで評価。Q4_K_MはBF16とほぼ同等のスコアを達成しつつ、RAM使用量48%削減、1.45倍の速度、68.8%のファイルサイズ削減を実現。
ClaudeAI ブレインストーミングモード、モックアップとUI承認のためのビジュアルコンパニオンを獲得
ユーザーがClaudeAIのブレインストーミングモードで、ローカルWebサーバー上にモックアップを提供する新機能「Visual companion」を発見。実際の開発前にUIの微調整を双方向で行える。

開発者が現実的なリレーショナルデータベース生成ツールを構築
開発者が、外部キー関係とテーブル間の整合性が保たれたテストデータベースを作成する問題を解決する、現実的なデータを備えた完全なリレーショナルデータベースを生成するツールを構築しました。