Холодная архитектура валидации: система проверки кода с двумя агентами стала открытой

Архитектура «Холодной проверки» — это система с открытым исходным кодом, реализующая двухагентную проверку кода, сгенерированного ИИ. Один агент пишет код, а отдельный агент проверяет его независимо, без доступа к рассуждениям или контексту создателя.
Как это работает
Система решает проблему предвзятости при самопроверке одним агентом, применяя разделение обязанностей, аналогичное независимым аудитам. Проверяющий работает в полной изоляции от мыслительного процесса создателя.
Фазы рабочего процесса
- Написание плана →
/review-plan(Шлюз A) - Реализация →
/review-impl(Шлюз C) - Отправка →
/acceptance-report(Шлюз D)
Ключевые детали реализации
- Проверяющий работает в изолированном временном каталоге
- Проверяющий видит только: документ плана, изменения в коде и вывод тестов
- Результаты проверки сохраняются с отпечатками для отслеживания
- Создатель может не согласиться с обоснованием проверяющего
- Максимум 2 раунда на фазу
- Построена на bash-скриптах и JSON-схемах
- В настоящее время работает с Claude Code + Codex CLI
- Паттерн агент-независимый (может работать с разными ИИ-агентами)
Технические характеристики
Система реализована как bash-скрипты, координирующие работу двух отдельных ИИ-агентов. JSON-схемы определяют структуру для документов плана, проверок кода и отчётов о принятии. Изолированная среда выполнения гарантирует, что проверяющий не имеет доступа к внутренним рассуждениям или промежуточным шагам создателя.
Такой подход полезен для разработчиков, которые хотят внедрить более строгую проверку кода, сгенерированного ИИ, особенно при работе со сложными системами, где самопроверка одним агентом может привести к предвзятости подтверждения.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Создание автономного исследовательского агента с помощью C# и локальных LLM.
A C# research agent automates URL processing with local LLMs using Ollama and llama3.1:8b, generating structured markdown reports from web searches.

audio-analyzer-rs: Сервер MCP для анализа аудио с Claude
Разработчик создал audio-analyzer-rs — сервер MCP на Rust, который предоставляет Claude прямой доступ к анализу аудиофайлов, включая спектральный, гармонический, ритмический анализ, измерения громкости LUFS (стандарт EBU R128) и динамического диапазона. Инструмент эффективен по токенам: Claude начинает с низкого разрешения и при необходимости увеличивает детализацию небольших фрагментов.

Холабосс AI Runtime переходит на TypeScript, реализует постоянные порты MCP.
Среда выполнения локального агента Holaboss AI была переработана для использования исключительно TypeScript, что устранило зависимости от Python и уменьшило размер пакета. Теперь она сохраняет порты серверов MCP в SQLite с ограничениями UNIQUE(port), чтобы предотвратить конфликты при перезапусках.

ТайниФиш Веб Агент превосходит конкурентов в бенчмаркинге веб-задач.
Веб-агент TinyFish достиг 81,9% успешности в сложных веб-задачах, значительно опередив таких конкурентов, как OpenAI Operator с 43,2%.