Перекрестная модель цикла проверки для AI-агентов программирования выявляет критические недостатки планирования.

Как работает кросс-модельное ревью
Разработчик на r/ClaudeAI создал систему, которая решает распространённую проблему с ИИ-агентами для программирования, такими как Codex, Claude Code и Cursor: планы выполняются без предварительной проверки их предположений. Решение направляет каждый план через вторую модель ИИ с другой архитектурой и обучающими данными до начала выполнения.
Ключевые детали реализации
Модель-рецензент работает в режиме только для чтения и не может изменять код — она может только оспаривать план. Это ограничение критически важно, потому что «как только она сможет редактировать, она перестаёт быть критиком и начинает идти на компромиссы». Система запускает автоматический цикл с ограничением по раундам: планы возвращаются на доработку, если обнаружены проблемы, пока они не пройдут проверку или не достигнут лимита.
Что система выявляет
- Планы отката, которые фактически не откатывают изменения
- Схемы разрешений с реальными уязвимостями безопасности
- Контрольные точки ревью, принимающие решения о продолжении/остановке на основе устаревших данных
- Многоэтапные планы, которые кажутся логичными, пока вторая модель не пройдёт по всему процессу
Критические проектные решения
- Ограниченный контекст ревью предотвращает трату времени рецензента на чтение нерелевантных частей репозитория
- Персоны рецензента (риски поставки, воспроизводимость, производительность-стоимость, безопасность-соответствие) выявляют разные типы проблем
- Живая TUI-панель управления показывает фазу, раунд, вердикт, серьёзность, стоимость и историю в одном терминальном представлении
- Система работает с разными планировщиками: Claude Code использует нативный хук ExitPlanMode, а Codex и другие оркестраторы используют явный шлюз
Практические результаты
Разработчик использовал систему, чтобы помочь построить её саму: «Codex планировал, Claude рецензировал планы, и дизайн сходился за несколько раундов». Инструмент имеет лицензию MIT и доступен как rival-review на GitHub.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Разработчик OpenClaw создает унифицированную систему памяти для ИИ-агентов.
Разработчик создал единую систему памяти из 15 инструментов для агентов OpenClaw AI, которая объединяет структурированные факты, векторный поиск, графы сущностей, временные линии эпизодов, иерархическое сжатие и событийную координацию. Система работает локально без зависимостей от облачных сервисов и ежемесячных платежей.

Шесть инструментов с открытым исходным кодом, решающих проблемы безопасности, стоимости и сложности OpenClaw
Разработчик протестировал шесть инструментов сообщества для устранения уязвимостей безопасности OpenClaw, отмеченных Cisco, растущих затрат и сложной настройки. ClawSec обеспечивает сканирование безопасности и проверку целостности, Antfarm позволяет создавать детерминированные рабочие процессы с несколькими агентами, а LanceDB Pro улучшает поиск в памяти с помощью гибридного векторного поиска.

TRELLIS.2 Image-to-3D адаптирован для нативной работы на Apple Silicon.
Разработчик портировал 4-миллиардную параметрическую модель TRELLIS.2 от Microsoft для преобразования изображений в 3D, чтобы она работала нативно на Apple Silicon через PyTorch MPS, заменив операции, специфичные для CUDA, на чисто PyTorch-альтернативы. Порт генерирует меши с ~400K вершин из одиночных фотографий примерно за 3,5 минуты на M4 Pro с 24 ГБ памяти.

Skir: Современная альтернатива Protocol Buffers для типобезопасного обмена данными
Skir — это декларативный язык для определения типов данных, констант и API, который генерирует идиоматичный, типобезопасный код на TypeScript, Python, Java, C++, Kotlin и Dart из одного файла .skir. Он включает встроенную безопасность эволюции схем, поддержку RPC, аналогичную gRPC, и сериализацию в JSON или бинарные форматы.