Culpa: Открытый движок детерминированного воспроизведения для отладки ИИ-агентов

Culpa — это механизм детерминированного воспроизведения с открытым исходным кодом, специально разработанный для отладки сессий AI-агентов. Основная проблема, которую он решает, — недетерминированная природа LLM-агентов: когда они дают сбой, невозможно воспроизвести точный сбой, просто повторно запустив сессию.
Как это работает
Инструмент записывает каждый вызов LLM вместе с полным контекстом выполнения во время сессии агента. Когда вам нужно отладить сбой, он воспроизводит сессию, используя записанные ответы в качестве заглушек вместо выполнения новых вызовов к API. Это делает воспроизведение полностью детерминированным и бесплатным, поскольку не затрагивает реальные API.
Ключевые возможности
- Режим прокси: Работает с такими инструментами, как Claude Code и Cursor, без необходимости изменять код
- Python SDK: Доступен для разработчиков, создающих собственных агентов
- Поддержка API: Совместим с API Anthropic и OpenAI
- Возможность ветвления: Вы можете создать ветвление в любой записанной точке принятия решения, внедрить другой ответ и посмотреть, что бы произошло
Практические преимущества
Поскольку воспроизведение использует записанные ответы вместо реальных вызовов к API, сессии отладки не несут затрат на API. Детерминированная природа воспроизведения позволяет надёжно воспроизводить и анализировать сбои, которые иначе было бы невозможно воссоздать из-за присущей случайности в ответах LLM.
Проект активно собирает обратную связь, особенно от разработчиков, создающих рабочие процессы агентов. Создатель отмечает, что он первокурсник по компьютерным наукам и стремится улучшить инструмент.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Бесплатный инструмент Fingerprint для тестирования аутентификации веб-ботов для разработчиков AI-агентов
Fingerprint выпустил бесплатный публичный эндпоинт для тестирования реализаций Web Bot Auth. Этот инструмент проверяет криптографические подписи HTTP-запросов, помогая разработчикам ботов и AI-агентов убедиться, что их настройка WBA работает корректно перед запуском в продакшен.

SWE-CI: Новые эталонные тесты оценивают ИИ-агентов в долгосрочном сопровождении кода через CI
SWE-CI — это бенчмарк на уровне репозитория, который оценивает агентов на основе LLM в поддержании кодовых баз через циклы непрерывной интеграции, смещая фокус со статического исправления ошибок на долгосрочную поддерживаемость в рамках 100 реальных задач.

OpenCawt: Открытая Судебная Система для Разрешения Споров между ИИ-Агентами
OpenCawt — это система открытого правосудия для автономных агентов, которая позволяет им подавать споры, представлять доказательства, получать структурированные решения и фиксировать результаты в виде проверяемых публичных записей. Она включает легкий протокольный слой OCP для формализации соглашений и решений в других приложениях.

PocketBot Beta: Приватный ИИ-агент для iOS с гибридным локально-облачным движком
PocketBot — это AI-агент для iOS, который работает в фоновом режиме, интегрируется с App Intents и использует гибридный движок: локальное выполнение для системных триггеров и очистки персональных данных, а также облачную обработку для сложных задач, таких как суммаризация писем или бронирование авиабилетов.