Кодев: Рабочий процесс ИИ-агента для 106 PR за 14 дней

Codev — это система координации ИИ-агентов с открытым исходным кодом, которая обеспечивает структурированный рабочий процесс разработки. Проект демонстрирует, как перевести ИИ от прототипирования к производственной работе с помощью конкретных практик, извлечённых из обработки 106 запросов на слияние за 14 дней.
Шесть основных практик
- Спецификации и планы — это исходный код: Спецификации и планы хранятся в git вместе с исходным кодом, а не в истории чата. Новый агент читает arch.md для общего понимания, затем свою конкретную спецификацию. Это гарантирует, что вы всегда знаете, почему что-то было создано.
- Три модели проверяют каждый этап: Claude, Gemini и Codex обнаруживают почти полностью разные ошибки. Ни одна модель не нашла более 55% проблем. В тестировании 20 ошибок были выявлены перед выпуском: Claude Code нашёл 5 ошибок, а Gemini и Codex обнаружили ещё 15, включая серьёзную проблему безопасности, которую пропустил Claude.
- Обеспечивайте процесс, а не предлагайте его: Конечный автомат принудительно выполняет Spec → Plan → Implement → Review → PR. ИИ не может пропускать этапы, и тесты должны проходить перед переходом. Система обеспечивает направляющие, потому что ИИ сами по себе не придерживаются плана.
- Аннотируйте, а не редактируйте: Большая часть работы включает написание спецификаций и рецензий, которые направляют код, а не хаотичное редактирование файлов в открытом чате.
- Агенты координируют агентов: Агент-архитектор запускает агентов-строителей в изолированные рабочие деревья git. Вы управляете архитектором; он управляет строителями. Они общаются друг с другом асинхронно.
- Управляйте всем жизненным циклом: Большинство инструментов ИИ помогают писать код быстрее (около 30% работы). Остальные 70% включают планирование, рецензирование, интеграцию, скрипты развёртывания и управление промежуточной и производственной средами. Codev позволяет ИИ запускать весь конвейер от спецификации до запроса на слияние и далее.
Результаты и затраты
Система позволила одному инженеру производить то, что обычно делает команда из 3-4 человек. Качество кода измерялось на 1,2 балла лучше по 10-балльной шкале по сравнению с использованием только Claude Code. Подход занимает больше времени и использует больше токенов, но затраты остаются разумными — примерно $1,60 за запрос на слияние.
По словам разработчика, обеспечение соблюдения протокола — это ключевое изменение: "Я обнаружил, что ИИ просто не придерживается спецификаций или планов". Координация агентов также оказалась эффективной: агент-архитектор управлял несколькими агентами-строителями, одновременно исправляя разные ошибки.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Разработчик OpenClaw ищет «убийственные» варианты применения после 900 пользовательских тестов
Создатель OpenClaw сообщает, что хотя пользователи пробуют такие функции, как интерфейсы Telegram, интеграции с календарями и автоматизированные рабочие процессы, большинство не остаются с инструментом надолго. Задача заключается в поиске рабочих процессов для ежедневного использования, которые станут необходимыми, а не экспериментальными.

Tacit: язык программирования, ориентированный на LLM, созданный с помощью Claude Code и Opus 4.7
Tacit — это экспериментальный язык программирования, ориентированный на LLM, созданный и реализованный с помощью Claude Code и Opus 4.7. Он избавляется от человеческих удобств, чтобы минимизировать использование токенов, и поставляется с праймером, который обучает LLM среднего уровня (Sonnet и выше) писать код на Tacit.

Запуск Qwen3.6-35B-A3B-UD-Q5_K_XL локально с VS Code Copilot на AMD R9700
Пользователь делится своей рабочей конфигурацией llama.cpp для Qwen3.6-35B-A3B-UD-Q5_K_XL на одной AMD R9700 с Vulkan, которая позволяет генерировать полноценный сайт и набор тестов Playwright с нуля при минимальной коррекции.

Многомодельный рабочий процесс проверки кода, упакованный как переиспользуемый навык
Многоразовый навык, который координирует несколько ИИ-моделей для проверки кода в PR и не-PR режимах, протестированный с OpenClaw и моделями, такими как GPT-5.5, DeepSeek V4 Pro, Kimi K2.6, Qwen 3.6 Plus и GLM-5.1.