Culpa: Open Source Deterministic Replay Engine for AI Agent Debugging

Culpa ist eine Open-Source-Deterministic-Replay-Engine, die speziell für das Debugging von KI-Agent-Sitzungen entwickelt wurde. Das Kernproblem, das es angeht, ist die nicht-deterministische Natur von LLM-Agenten – wenn sie scheitern, kann man den genauen Fehler nicht einfach durch erneutes Ausführen der Sitzung reproduzieren.
Wie es funktioniert
Das Tool zeichnet jeden LLM-Aufruf zusammen mit dem vollständigen Ausführungskontext während einer Agent-Sitzung auf. Wenn Sie einen Fehler debuggen müssen, gibt es die Sitzung unter Verwendung der aufgezeichneten Antworten als Stubs wieder, anstatt neue API-Aufrufe zu tätigen. Dies macht die Wiedergabe vollständig deterministisch und kostet nichts, da keine echten APIs angesteuert werden.
Wichtige Funktionen
- Proxy-Modus: Funktioniert mit Tools wie Claude Code und Cursor, ohne Codeänderungen zu erfordern
- Python SDK: Verfügbar für Entwickler, die ihre eigenen Agenten erstellen
- API-Unterstützung: Kompatibel mit Anthropic- und OpenAI-APIs
- Forking-Fähigkeit: Sie können an jedem aufgezeichneten Entscheidungspunkt forken, eine andere Antwort injizieren und sehen, was passiert wäre
Praktische Vorteile
Da die Wiedergabe aufgezeichnete Antworten verwendet, anstatt tatsächliche API-Aufrufe zu tätigen, verursachen Debugging-Sitzungen keine API-Kosten. Die deterministische Natur der Wiedergaben ermöglicht es, Fehler zuverlässig zu reproduzieren und zu analysieren, die aufgrund der inhärenten Zufälligkeit von LLM-Antworten sonst nicht nachvollziehbar wären.
Das Projekt sucht aktiv nach Feedback, insbesondere von Entwicklern, die Agent-Workflows erstellen. Der Ersteller merkt an, dass er ein CS-Erstsemester ist und das Tool verbessern möchte.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Argus: Open-Source VS Code Erweiterung für Echtzeit-Beobachtbarkeit von Claude Code
Argus visualisiert Claude Code-Agent-Schritte in Echtzeit in VS Code und zeigt Zeitstrahl, Abhängigkeitsdiagramm sowie Kosten-/Schleifenerkennung, um tokenverschwendendes Verhalten zu debuggen.

CrabMeat v0.1.0: Ein sicherheitsorientierter Agenten-Gateway, das dem LLM die Sicherheitsgrenze nicht anvertraut
CrabMeat v0.1.0 ist ein WebSocket-Gateway für agentische LLM-Workloads, das Sicherheit auf architektonischer Ebene erzwingt: Capability-ID-Indirektion, Effektklassen, IRONCLAD_CONTEXT fixierte Anweisungen, manipulationssichere Audit-Kette, Streaming-Output-Leak-Filter und kein YOLO-Modus.

Claude Code Skill wandelt Stickdesigns in Next.js um – ohne Pixelversatz
Eine Claude Code-Fähigkeit wandelt Google Stitch AI-Designs in Next.js-Komponenten um und verhindert dabei den typischen Pixelversatz, der normalerweise bei der Verwendung von Claude für diese Aufgabe auftritt. Das Tool bewahrt exakte Werte und verwaltet Assets.

NaNMesh MCP prüft GitHub-Issues, bevor Claude Bibliotheken empfiehlt
NaNMesh MCP ist ein Open-Source-Model-Context-Protocol-Server, der GitHub Issues, Stack Overflow und Reddit nach bekannten Fehlern in Entwicklungstools durchsucht. Wenn Claude eine Bibliothek empfiehlt, kann es zuerst auf echte Probleme prüfen, bevor sie integriert wird.