Culpa: AIエージェントデバッグのためのオープンソース決定性リプレイエンジン

Culpaは、AIエージェントセッションのデバッグに特化して設計されたオープンソースの決定論的再生エンジンです。このツールが解決する中核的な問題は、LLMエージェントの非決定論的な性質です。エージェントが失敗した場合、セッションを単に再実行するだけでは正確な失敗を再現できません。
仕組み
このツールは、エージェントセッション中にすべてのLLM呼び出しと完全な実行コンテキストを記録します。失敗をデバッグする必要がある場合、新しいAPI呼び出しを行う代わりに、記録された応答をスタブとして使用してセッションを再生します。これにより、再生は完全に決定論的になり、実際のAPIを呼び出さないためコストがかかりません。
主な機能
- プロキシモード: Claude CodeやCursorなどのツールと連携し、コード変更を必要としません
- Python SDK: 独自のエージェントを構築する開発者向けに利用可能
- APIサポート: AnthropicおよびOpenAI APIと互換性があります
- フォーク機能: 記録された任意の決定ポイントでフォークし、異なる応答を注入して、何が起こったかを確認できます
実用的な利点
再生では実際のAPI呼び出しの代わりに記録された応答を使用するため、デバッグセッションではAPIコストがゼロになります。再生の決定論的な性質により、LLM応答に内在するランダム性のために再現が不可能だった失敗を確実に再現して分析することが可能になります。
このプロジェクトは、特にエージェントワークフローを構築している開発者からのフィードバックを積極的に求めています。作成者はCS(コンピュータサイエンス)の新入生であり、ツールの改善を目指していると述べています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

非公式ウルトラヒューマンリングMCPサーバー:AIエージェント統合向け
コミュニティで開発されたMCPサーバーがUltrahuman Partner APIをラップし、AIコーディングエージェントが睡眠、HRV、血糖値、回復スコアなどのリングおよびCGMメトリクスを構造化データ呼び出しで直接アクセスできるようにします。

新しい構造化データAPIがLLMエージェント向けにサブスクリプション価格を提供
開発者が、ストリーミングプラットフォーム、ライドシェアサービス、デートアプリ、その他のサブスクリプションベースのプラットフォームにわたるサブスクリプション価格を正規化する構造化データAPIをリリースしました。このAPIは、一貫したJSONスキーマ、利用可能な場合は地域対応の価格設定、およびスクレイピングなしでLLMエージェントが利用できるMCP互換エンドポイントを提供します。

レッドクイーン:Claude Codeをワーカープールとして動作させる決定論的オーケストレーター
Red Queenはステートマシンを使ってClaude Codeのサブプロセスを orchestrate し、LLMのルーティングエラーとメガプロンプトによるトークン浪費を排除します。

SecureCode監査: Claude Codeで構築されたLinuxサーバーセキュリティ監査ツール
ある個人開発者が、Claude Codeを使って構築したSecureCode Audit。SSHコマンドを1つ実行するだけで、22項目のセキュリティチェックと優先順位付きの修正内容をレポートします。最初の30名の登録者は、フル監査を無料で受けられます。