クロードコードがマルチエージェントコードレビューシステムを追加

Code Review for Claude Code
Anthropicは、自社の内部プロセスをモデルにしたマルチエージェントレビューシステム「Code Review for Claude Code」を導入しました。TeamおよびEnterpriseプラン向けにリサーチプレビューとして利用可能で、Anthropicエンジニアのコード出力が昨年比200%増加する中、コードレビューのボトルネックに対処するために設計されています。
仕組み
PRが作成されると、Code Reviewは複数のエージェントチームを派遣し、並行してバグを探し、誤検出を除外するためにバグを検証し、深刻度でバグをランク付けします。結果は、単一の高品質な概要コメントと、特定のバグに対するインラインコメントとして表示されます。レビューはPRのサイズに合わせて拡張され、大規模または複雑な変更にはより多くのエージェントと詳細な読み取りが行われ、些細な変更には軽量なパスが適用されます。
Anthropicのテストによると、平均的なレビューには約20分かかります。このシステムはPRを承認しません(それは人間の判断に委ねられます)が、レビュアーがリリース内容をより適切にカバーできるようにギャップを埋めることを目指しています。
パフォーマンス指標
- 導入前:16%のPRが実質的なレビューコメントを受けた
- 導入後:54%のPRが実質的なレビューコメントを受ける
- 大規模PR(1,000行以上の変更):84%が指摘を受け、平均7.5件の問題
- 小規模PR(50行以下の変更):31%が指摘を受け、平均0.5件の問題
- エンジニアの同意率:指摘の1%未満が誤りとマークされた
実例
あるケースでは、Code Reviewは本番サービスへの1行の変更を重大とフラグ付けしました。これはサービスの認証を破壊していたでしょう。エンジニアは、自分だけでは気づかなかったと共有しました。
早期アクセス顧客も同様のパターンを経験しています。TrueNASのオープンソースミドルウェアにおけるZFS暗号化のリファクタリングでは、Code Reviewは隣接コードに存在していた既存のバグを明らかにしました。これは、同期のたびに暗号化キーキャッシュを静かに消去していた型の不一致でした。
コストと制御
Code Reviewは、既存のClaude Code GitHub Action(オープンソースのまま)よりも高価です。レビューはトークン使用量に基づいて課金され、一般的に平均15〜25ドルで、PRのサイズと複雑さに応じてスケーリングします。管理者にはいくつかの制御オプションがあります:
- 月間組織全体の支出上限
- 選択したリポジトリのみでレビューを有効にするリポジトリレベルの制御
- レビューされたPR、受入率、総レビューコストを追跡する分析ダッシュボード
始め方
管理者向け:Claude Code設定でCode Reviewを有効にし、GitHubアプリをインストールし、リポジトリを選択します。開発者向け:有効にすると、レビューは新しいPRで自動的に実行され、設定は不要です。
📖 全文を読む: HN AI Agents
👀 See Also

オリー・ルーメン:Claude Code用オープンソースローカルセマンティック検索プラグイン
Ory Lumenは、Claude Codeのパフォーマンス問題を解決するためのプラグインです。Ollamaのコード埋め込みモデルとSQLite-vecのセマンティック検索を使用してコードベースをインデックス化し、大規模なコードベースでのClaude Codeの性能問題に対処します。このツールは無料でローカルのみ動作し、再現可能な結果を得るためのSWEスタイルのベンチマークテストハーネスを含んでいます。

Claudeタグ: マルチプレイヤーAIコラボレーションのためのSlack上の@Claude
AnthropicがSlackでClaude Tagを発表 — チャンネルで@Claudeをメンションし、ツールを付与して非同期タスクを委任。プロダクトチームのコードの65%がClaudeによって生成。

AIコーディングエージェントのためのセキュリティスキャン機能は、デプロイメントを自動的にチェックします。
開発者が、AIコーディングエージェントがデプロイ後に自動的にセキュリティ問題をスキャンできるスキルファイルを作成しました。このスキャンは、公開された秘密情報、開かれたポート、欠落したセキュリティヘッダー、漏洩したソースコードなどを検出し、各デプロイ後に約30秒で実行されます。

A/Bテスト結果:oh-my-claudecodeフックはClaude Codeのパフォーマンスに最小限の影響しか示さず
ある開発者が、週間Max20トークンの7%をClaude Sonnet 4.6でoh-my-claudecodeフックのテストに費やし、単一セッションのコーディングタスクにおいてコード品質やコストに有意な改善が見られなかったことを発見しました。