Culpa: AIエージェントデバッグのためのオープンソース決定性リプレイエンジン

Culpaは、AIエージェントセッションのデバッグに特化して設計されたオープンソースの決定論的再生エンジンです。このツールが解決する中核的な問題は、LLMエージェントの非決定論的な性質です。エージェントが失敗した場合、セッションを単に再実行するだけでは正確な失敗を再現できません。
仕組み
このツールは、エージェントセッション中にすべてのLLM呼び出しと完全な実行コンテキストを記録します。失敗をデバッグする必要がある場合、新しいAPI呼び出しを行う代わりに、記録された応答をスタブとして使用してセッションを再生します。これにより、再生は完全に決定論的になり、実際のAPIを呼び出さないためコストがかかりません。
主な機能
- プロキシモード: Claude CodeやCursorなどのツールと連携し、コード変更を必要としません
- Python SDK: 独自のエージェントを構築する開発者向けに利用可能
- APIサポート: AnthropicおよびOpenAI APIと互換性があります
- フォーク機能: 記録された任意の決定ポイントでフォークし、異なる応答を注入して、何が起こったかを確認できます
実用的な利点
再生では実際のAPI呼び出しの代わりに記録された応答を使用するため、デバッグセッションではAPIコストがゼロになります。再生の決定論的な性質により、LLM応答に内在するランダム性のために再現が不可能だった失敗を確実に再現して分析することが可能になります。
このプロジェクトは、特にエージェントワークフローを構築している開発者からのフィードバックを積極的に求めています。作成者はCS(コンピュータサイエンス)の新入生であり、ツールの改善を目指していると述べています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

インディー開発者がClaude CodeでSteam APIデータ層を含むゲームスタジオサイト全体を展開
インディーゲーム開発者がClaude Codeを使用して、端末に触れることなくゲームスタジオのウェブサイトを構築・デプロイしました。Steam APIからライブ情報を取得するデータレイヤーも含まれています。

Claude Code v2.1.144:バックグラウンドセッション、/modelスコーピング、15秒起動タイムアウト
Claude Code v2.1.144にて、バックグラウンドセッション用の/resume機能が追加され、/modelは現在のセッションのみに適用されるようになりました。また、api.anthropic.comに接続できない場合の起動時の75秒のハングアップを修正し、タイムアウトを15秒に短縮しました。

PRECCツール、事前ツール呼び出し圧縮でClaudeコードAPIコストを削減
開発者がPRECCというオープンソースツールを構築しました。このツールはClaude Codeのツール呼び出しを傍受し、RTK(冗長性を考慮したトークン圧縮)を使用してペイロードを圧縮します。これにより、入力トークンが40〜66%削減され、知覚できる遅延の影響はありません。

オープンソースのSwiftUIテストスキル「Claude Code」は、Computer Useを活用してアプリを視覚的にテストします。
Claude Code用のオープンソーススキル「/ios-test」は、Computer Use機能を活用してSwiftUIアプリを視覚的にテストします。エージェントは.xcodeprojファイルを探し、シミュレーターでアプリをビルドし、実際のユーザーのように画面を移動しながらボタンをタップしたりリンクをたどったりします。