Агентный контекстный движок: Автоматизированный цикл улучшения агентов с приростом точности на 34,2%

Автоматизация цикла улучшения агентов
Разработчик опубликовал систему с открытым исходным кодом, которая автоматизирует весь процесс улучшения ИИ-агентов, позволяя им самостоятельно анализировать и корректировать свою работу. Инструмент решает распространённую проблему ручного чтения логов, настройки промптов и надежды на улучшения.
Пятиэтапный процесс
Автоматизированный цикл состоит из пяти этапов:
- Анализ трассировок: Анализирует трассировки, чтобы определить не только что пошло не так, но и почему, является ли проблема разовой или системной, и к какой категории сбоев она относится. Выдаёт структурированную разбивку типов сбоев вместо простых списков ошибок.
- Создание оценок: Формирует конкретные проверки для валидации анализа и измерения эффективности исправлений. Общие оценки не выявляют специфические сбои. LLM-судья используется как запасной вариант, когда данные трассировок недостаточно структурированы для детерминированных проверок.
- Измерение базовых показателей: Запускает проверки на текущем агенте до внесения исправлений, чтобы установить базовые уровни и валидировать сами проверки.
- Внедрение исправлений: Разработчик изучает анализ и код, чтобы решить, что изменить. Ключевое решение — относится ли исправление к промпту или к окружающему коду (например, когда оболочка некорректно обрабатывает вывод инструментов или не передаёт нужный контекст).
- Верификация и накопление: После исправлений проверки запускаются снова для подтверждения улучшений, после чего изменения сохраняются, откатываются или дорабатываются.
Детали реализации
Решение автоматизирует весь этот цикл от начала до конца одной командой, которая запускает самоанализирующую агентную систему. Анализ трассировок происходит в REPL-среде с агентами, настроенными для этой конкретной задачи. Система предоставляет анализ через CLI-доступ к Claude Code, который обрабатывает остальное с набором навыков.
Поскольку Claude может работать внутри кодовой базы, он проверяет анализ и определяет оптимальный способ действий на этапе исправлений (промпт vs. код).
Результаты и работа
Протестированная на Tau-2 Bench всего за одну итерацию, система уже в первом проходе достигла повышения точности на 34,2% без ручного вмешательства. Система спроектирована для накопления улучшений: новые трассировки выявляют новые проблемы, что приводит к новым исправлениям в каждом цикле.
Вы можете настроить её на полностью автономную работу. Также есть опция с участием человека, если вы хотите утверждать исправления перед 4-м этапом, но в тестах разработчик «просто дал системе работать».
Инструмент с открытым исходным кодом доступен на GitHub: https://github.com/kayba-ai/agentic-context-engine
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Claude Code молча завершается с ошибкой, когда ANTHROPIC_API_KEY установлен в облачных средах
Установка ANTHROPIC_API_KEY в облачных средах приводит к неисправности Claude Code и может повлечь неожиданные расходы на API. Пользователи сообщают о дополнительном использовании и неотзывчивом поведении.

Настольное приложение Nexus автоматизирует настройку MCP для управления кампаниями TTRPG
Надоело вручную редактировать конфиг Claude Desktop для каждого MCP? Nexus устанавливает и настраивает Archivist, Foundry VTT, Notion, Obsidian и NotebookLM для управления TTRPG-кампаниями.

Intuno: Открытая сеть для обнаружения и взаимодействия ИИ-агентов
Intuno — это открытая сеть, где ИИ-агенты регистрируют свои возможности, находят друг друга через семантический поиск и вызывают функции с помощью трёх строк кода на Python. Включает интеграцию с MCP для использования в Claude Desktop или Cursor.

Настройка OpenClaw как постоянного ИИ-ассистента
OpenClaw, настроенный как постоянно действующий AI-ассистент для небольшой команды разработчиков, размещен на сервере Railway, использует Claude в качестве бэкенда и интегрируется с Google Workspace, GitHub и другими сервисами.