Culpa: AI 에이전트 디버깅을 위한 오픈 소스 결정론적 재생 엔진

Culpa는 AI 에이전트 세션 디버깅을 위해 특별히 설계된 오픈 소스 결정론적 재생 엔진입니다. 이 도구가 해결하는 핵심 문제는 LLM 에이전트의 비결정론적 특성입니다—에이전트가 실패할 때, 단순히 세션을 다시 실행해서 정확한 실패를 재현할 수 없습니다.
작동 방식
이 도구는 에이전트 세션 동안 모든 LLM 호출과 전체 실행 컨텍스트를 기록합니다. 실패를 디버깅해야 할 때, 새로운 API 호출을 하지 않고 기록된 응답을 스텁으로 사용해 세션을 재생합니다. 이렇게 하면 재생이 완전히 결정론적이 되며, 실제 API를 호출하지 않으므로 비용이 전혀 발생하지 않습니다.
주요 기능
- 프록시 모드: Claude Code 및 Cursor와 같은 도구와 코드 변경 없이 작동
- Python SDK: 자체 에이전트를 구축하는 개발자에게 제공
- API 지원: Anthropic 및 OpenAI API와 호환
- 포킹 기능: 기록된 결정 지점에서 포크를 생성하고, 다른 응답을 주입하여 어떤 일이 발생했을지 확인 가능
실용적 이점
재생 시 실제 API 호출 대신 기록된 응답을 사용하므로, 디버깅 세션에 API 비용이 전혀 들지 않습니다. 재생의 결정론적 특성 덕분에, LLM 응답의 고유한 무작위성으로 인해 재현이 불가능했던 실패를 안정적으로 재현하고 분석할 수 있습니다.
이 프로젝트는 특히 에이전트 워크플로를 구축하는 개발자들의 피드백을 적극적으로 구하고 있습니다. 제작자는 CS 신입생이며 도구를 개선하고자 한다고 밝혔습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Devvit용 Claude 스킬이 코드 생성 정확도를 73%에서 100%로 향상시킵니다
한 개발자가 Claude를 위한 구조화된 SKILL.md 프롬프트 레이어를 만들어 Reddit의 Devvit 플랫폼에 대한 컨텍스트를 제공했으며, 이를 통해 일반적인 Devvit 작업에서 평가 결과를 7/10점에서 10/10점으로 향상시켜 특정 런타임 버그를 방지했습니다.

Shipwright: Claude Code 기반 오픈소스 프로젝트 관리 도구
Shipwright는 Claude Code에서 실행되는 오픈소스 프로젝트 관리 도구로, 44가지 스킬, 7개의 전문화된 에이전트, 16개의 워크플로우를 갖추고 있습니다. 이진 품질 게이트와 복구 플레이북을 포함하며, 엔지니어링 작업 시작 전 자격 증명 레지스트리 감사와 자동화 플랫폼 평가에 사용되었습니다.

코드 결정: 오픈소스 클로드 플러그인이 기술적 결정을 포착합니다
Code Decisions는 Claude Code용 오픈 소스 플러그인으로, 대화에서 기술적 결정 사항을 캡처하고 영향을 받는 파일이 편집될 때 이를 표면화합니다. 이 플러그인은 결정 사항을 .claude/decisions/에 마크다운 파일로 작성하며, 관리되는 파일을 가리키는 affects 필드를 포함합니다.

프리 LLM API와 툴 콜링으로 구축된 포켓몬 쇼다운 AI 에이전트
무료 API 티어를 통해 Llama 3, Qwen, Gemma를 사용하여 구조화된 도구 호출로 자율적으로 포켓몬 쇼다운 배틀을 진행하는 시스템. 인간 vs AI 및 AI vs AI 모드를 지원합니다.