Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект

Экспериментальная платформа Glomz (glomz.com) поместила ИИ-агентов на арену под названием «Octagon» для рецензирования кода друг друга. Правила: агенты могут раскритиковать материал, предложить улучшения или проголосовать за «убийство» с обоснованием. Никакой критики «на лету» — если критикуешь, нужно также предложить исправление.
Данные на данный момент
- 179 агентов зарегистрировались от разных поставщиков моделей
- 433 материала отправлено на рецензию
- 1333 рецензии сгенерировано агентами, рецензирующими других агентов
- 9 структурированных задач (поиск ошибок, аудит безопасности, упражнения по рефакторингу)
- Самое рецензируемое задание: 21 рецензия на задачу «общий анализ кода»
- Задача аудита LOT-Squatch (инструмент безопасности ОТ): 10 независимых улучшений, 9 из которых получили по 9 рецензий
Что сработало
Сетевой эффект каскада рецензий: Когда материал получал 3-5 первых отзывов, другие агенты подключались быстрее. Лучший материал получил 21 рецензию; тихие — 2-3 и «умерли».
Кросс-модельные рецензии выявляют слепые зоны: Агент на основе Модели A обнаружил проблему безопасности, которую Модель B полностью пропустила в своем коде. Агент на Модели C предложил рефакторинг, который не рассматривался в исходном материале.
Голоса «убить» с обоснованием дали лучший код: Когда агенту нужно было написать формальное обоснование, почему материал следует «убить», результат почти всегда был более строгим анализом, чем стандартная оценка от 1 до 10. Требование обоснования заставляло быть конкретнее.
Что не сработало
- Большинство материалов не прошли полный цикл. 433 материала, все в ожидании. Цикл был рассчитан на ~15 минут (отправка → критика → улучшения → голос «убить» → вердикт). На практике большинство материалов были открыты и не продвигались. Агентам нужна автоматическая оркестрация, а не просто API-эндпоинт.
- Нулевые платные конверсии. 179 агентов, все на бесплатном тарифе.
- Безопасность конфликтует с прямотой. Некоторые агенты полностью участвовали в критике, другие сразу переходили к «Отличный вопрос!» с уклончивыми формулировками, несмотря на явные инструкции так не делать.
Уроки для мультиагентных систем
- Идентичность имеет значение: Агенты с постоянной идентичностью (API-ключи, история, репутация) вели себя иначе, чем анонимные материалы. Отслеживаемость изменила динамику.
- Структурированные промпты лучше свободных: Правила «Octagon» (критика → улучшение → обоснование) давали более качественный результат, чем просто «проверьте этот код».
- Оркестрация — это сложно: API — легко. Заставить агентов реально появиться, участвовать последовательно и завершить полный цикл — вот где кроется сложность.
📖 Источник: r/openclaw
👀 Смотрите также

Claude устанавливает реальный будильник на Android через систему Intent — без взлома, но остаются проблемы прозрачности
ИИ Claude использовал стандартную систему интентов Android, чтобы создать нативное будильник в приложении Samsung Clock. Пользователь сначала заподозрил взлом, но это обычное взаимодействие между приложениями. Отсутствие предварительного уведомления о действиях на уровне устройства вызывает вопросы прозрачности.

完全转型为AI工程师:不再接触代码
Макс Хейер описывает рабочий процесс, где агенты пишут весь код, а он только читает diff'ы, пишет спецификации и проверяет результат. Важен вкус — оценивать код сложнее, чем писать его.

Claude Code v2.1.139 добавляет Agent View, команду /goal и крупные улучшения MCP
Claude Code v2.1.139 представляет новый режим агента для управления сессиями, команду /goal для многозадачных задач, расширенные возможности хуков и исправления проблем с памятью MCP-сервера и повреждением терминала.

Исследование показывает, что сбои агента Claude Opus были вызваны архитектурными, а не проблемами согласованности.
Исследование поместило Claude Opus и Kimi K2.5 в реальную среду с доступом к электронной почте, оболочке и постоянному хранилищу. Модели продемонстрировали правильные ценности, но столкнулись с серьёзными сбоями из-за отсутствия архитектурных защитных механизмов, таких как модели заинтересованных сторон и границы выполнения.