アンソロピックのマルチエージェントハーネス設計によるクロードのコード品質向上

Anthropicは、長時間実行されるコーディングタスクにおけるClaudeのパフォーマンスを向上させるためのハーネス設計アプローチを概説するブログ記事を公開しました。この手法は、2つの特定の問題に対処しています:コンテキスト不安(長時間にわたる一貫性の喪失)と自己評価バイアス(品質が低い場合でもClaudeが自身の作業を称賛すること)です。
マルチエージェントソリューション
このソリューションは、GAN(敵対的生成ネットワーク)に着想を得て、複数のエージェントが協力して動作します。コア構造は以下を含みます:
- ジェネレーター: コードと設計を作成
- エバリュエーター: 批判的評価とフィードバックを提供
フロントエンド実装
フロントエンド開発では、ハーネスは4つの評価基準を使用し、一般的な設計を避けるために美学と創造性を重視します。このプロセスには5〜15回の改訂が含まれ、より美しくユニークな出力が得られます。
フルスタック実装
フルスタック開発では、ハーネスは3つのエージェントを採用します:
- プランナー
- ジェネレーター
- エバリュエーター
パフォーマンス比較
記事では、同じゲーム開発要件に対する結果を比較しています:
- 単独実行: 実行は速いが、ゲームには重大なバグがある
- ハーネス使用: 時間とコストはかかるが、美しいインターフェース、プレイ可能なゲーム、追加のAIサポートを含む、大幅に高品質な結果を生成
記事は、モデルがより強力になるにつれて(特にOpus 4.6に言及)、不要なハーネス要素は削除されるべきだと示唆しています。
📖 Read the full source: r/ClaudeAI
👀 See Also

Gitワークツリーを使用した並列ClaudeコードセッションのためのオープンソースWeb UI
開発者がCCUIというオープンソースのWeb UIを構築し、git worktreeを使用して複数のClaude Codeセッションを並列実行できるようにしました。これはローカルWebサーバーとして動作し、ブラウザからアクセス可能で、リモート開発のためのSSHポートフォワーディングをサポートしています。

Qwen 3.6 27B量子化ベンチマーク:実用的トレードオフでQ4_K_MがQ8_0を凌駕
BF16、Q4_K_M、Q8_0のGGUF量子化バリアントでQwen 3.6 27BをHumanEval、HellaSwag、BFCLで評価。Q4_K_MはBF16とほぼ同等のスコアを達成しつつ、RAM使用量48%削減、1.45倍の速度、68.8%のファイルサイズ削減を実現。

自動最適化:自律的なパフォーマンス最適化のためのClaudeコードプラグイン
開発者がauto-optimizeというClaude Codeプラグインを作成しました。このプラグインは、プロファイリング→計画→ベンチマークのループを自律的に実行してコードのパフォーマンスを最適化します。あるテストでは、約3時間で全てのベンチマークシナリオにおいて27%高速なハッシュテーブルを実現しました。

ブラインドスポットMCP:AIコーディングエージェントのための外部ブレイン
Blindspot MCPは、tree-sitterとSQLiteを使用して完全なコードベースをインデックス化し、AIコーディングエージェントがシンボル、依存関係、ファイル間の関係を理解できるようにするツールです。これにより、直接的なコンテキスト外のコードを壊す変更を防ぎます。