Claude Codeを用いたプロダクションコードベースでの自動研究:60の実験、3つの変更を保持

本番コードベースでのオートリサーチ実験
開発者は、Karpathyのオートリサーチ手法を、Django、pgvector、Cohere埋め込みで構築された本番環境のハイブリッド検索システムに対して、Claude Codeを用いて実際にテストしました。コンピュータから離れている間に2ラウンドで合計60回のイテレーションを実行しました。
主な結果と発見
60回のイテレーションのうち、57回は元に戻され、採用された変更はわずか3つでした。全体のスコア改善はわずか(+0.03)でしたが、得られた知見は重要でした:
- 検索シグナルとしてのタイトルマッチングは、わずか2回のイテレーションで純粋に悪影響であることが実証されました
- より大きな候補プールは効果がありませんでした。問題は再現率ではなく、ランキングにありました
- 手作りで適応的な重み付けは実際に機能しており、それを削除すると性能が低下しました
- キーワード減衰式の微調整は、スコアをほとんど動かしませんでした
- ラウンド2でHaikuメタデータプロンプトをターゲットにしましたが、改善はゼロでした。これは、ラウンド1のランキング重みが元のプロンプトの出力に合わせて共最適化されていたためです
- Redisキャッシュのバグを発見しました:キーがプロンプトハッシュではなくクエリハッシュに基づいており、これが本番環境に気づかれずにリリースされるところでした
実用的な教訓
最大の洞察は、オートリサーチが改善点を見つけるだけでなく、どこが限界なのかをマッピングするのに役立つということでした。「これ以上の調整はやめていい」という60のデータポイントがあることで、直感に頼るのではなく具体的な証拠が得られます。開発者は、このアプローチが、効果のない最適化に費やす手動実験の時間を節約したと述べています。
詳細なレポートはブログリンクで入手可能で、オープンソースのClaude CodeオートリサーチスキルはGitHubにあります。開発者は、他の人が非MLコードベースでこれを試し、どのような指標を使用しているかに関心を持っています。
📖 Read the full source: r/ClaudeAI
👀 See Also

ソロの3DアニメーターがClaude Coworkプラグインで持続的なAIビジネス開発アシスタントを構築した方法
個人で3Dアニメーションスタジオを運営するクリエイターが、Claude Coworkプラグインを使って永続的なAIビジネス開発アシスタント(Reid)を構築。見込み客調査、フォローアップ管理、ピッチ準備、戦略立案を担当する。重要なデザイン上のポイントは、戦略的で率直なペルソナがすべてのアウトプットを形作ること。

AIエージェントをチームメンバーとして迎え入れる:実践ビジネス事例
ある企業が、デザイン、コード、マーケティング、運用を担当する実際のチームメンバーとして初のAIエージェントをオンボーディングした経験を共有。技術的なセットアップが難しい部分ではなかったと指摘しています。

ローカルLLMを使用してMinecraftボットのAFKセッションを監視する
ある開発者がローカルLLMを使用して、採掘作業を実行するBaritoneを搭載したMinecraftボットを監視し、ボットが死亡したときやサーバーから切断されたときにアラートを受け取るための画面監視を設定しました。

OpenClawエージェント構造:5つのコアファイルと3つの実用ケース
OpenClawのユーザーが、すべてのエージェントが5つのコアファイル(User、Soul、Agent、Tools、Identity)から構築されていることを発見しました。彼らは、日次AIブリーフィング集約ツール、子供向け数学コーチ、YouTubeショート動画生成ツールを含む3つの実用的なエージェントを共有しました。