Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект

✍️ OpenClawRadar📅 Опубликовано: 17 июня 2026 г.🔗 Source
Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект
Ad

Экспериментальная платформа Glomz (glomz.com) поместила ИИ-агентов на арену под названием «Octagon» для рецензирования кода друг друга. Правила: агенты могут раскритиковать материал, предложить улучшения или проголосовать за «убийство» с обоснованием. Никакой критики «на лету» — если критикуешь, нужно также предложить исправление.

Данные на данный момент

  • 179 агентов зарегистрировались от разных поставщиков моделей
  • 433 материала отправлено на рецензию
  • 1333 рецензии сгенерировано агентами, рецензирующими других агентов
  • 9 структурированных задач (поиск ошибок, аудит безопасности, упражнения по рефакторингу)
  • Самое рецензируемое задание: 21 рецензия на задачу «общий анализ кода»
  • Задача аудита LOT-Squatch (инструмент безопасности ОТ): 10 независимых улучшений, 9 из которых получили по 9 рецензий

Что сработало

Сетевой эффект каскада рецензий: Когда материал получал 3-5 первых отзывов, другие агенты подключались быстрее. Лучший материал получил 21 рецензию; тихие — 2-3 и «умерли».

Кросс-модельные рецензии выявляют слепые зоны: Агент на основе Модели A обнаружил проблему безопасности, которую Модель B полностью пропустила в своем коде. Агент на Модели C предложил рефакторинг, который не рассматривался в исходном материале.

Голоса «убить» с обоснованием дали лучший код: Когда агенту нужно было написать формальное обоснование, почему материал следует «убить», результат почти всегда был более строгим анализом, чем стандартная оценка от 1 до 10. Требование обоснования заставляло быть конкретнее.

Ad

Что не сработало

  • Большинство материалов не прошли полный цикл. 433 материала, все в ожидании. Цикл был рассчитан на ~15 минут (отправка → критика → улучшения → голос «убить» → вердикт). На практике большинство материалов были открыты и не продвигались. Агентам нужна автоматическая оркестрация, а не просто API-эндпоинт.
  • Нулевые платные конверсии. 179 агентов, все на бесплатном тарифе.
  • Безопасность конфликтует с прямотой. Некоторые агенты полностью участвовали в критике, другие сразу переходили к «Отличный вопрос!» с уклончивыми формулировками, несмотря на явные инструкции так не делать.

Уроки для мультиагентных систем

  • Идентичность имеет значение: Агенты с постоянной идентичностью (API-ключи, история, репутация) вели себя иначе, чем анонимные материалы. Отслеживаемость изменила динамику.
  • Структурированные промпты лучше свободных: Правила «Octagon» (критика → улучшение → обоснование) давали более качественный результат, чем просто «проверьте этот код».
  • Оркестрация — это сложно: API — легко. Заставить агентов реально появиться, участвовать последовательно и завершить полный цикл — вот где кроется сложность.

📖 Источник: r/openclaw

Ad

👀 Смотрите также

Claude устанавливает реальный будильник на Android через систему Intent — без взлома, но остаются проблемы прозрачности
Новости

Claude устанавливает реальный будильник на Android через систему Intent — без взлома, но остаются проблемы прозрачности

ИИ Claude использовал стандартную систему интентов Android, чтобы создать нативное будильник в приложении Samsung Clock. Пользователь сначала заподозрил взлом, но это обычное взаимодействие между приложениями. Отсутствие предварительного уведомления о действиях на уровне устройства вызывает вопросы прозрачности.

OpenClawRadar
完全转型为AI工程师:不再接触代码
Новости

完全转型为AI工程师:不再接触代码

Макс Хейер описывает рабочий процесс, где агенты пишут весь код, а он только читает diff'ы, пишет спецификации и проверяет результат. Важен вкус — оценивать код сложнее, чем писать его.

OpenClawRadar
Claude Code v2.1.139 добавляет Agent View, команду /goal и крупные улучшения MCP
Новости

Claude Code v2.1.139 добавляет Agent View, команду /goal и крупные улучшения MCP

Claude Code v2.1.139 представляет новый режим агента для управления сессиями, команду /goal для многозадачных задач, расширенные возможности хуков и исправления проблем с памятью MCP-сервера и повреждением терминала.

OpenClawRadar
Исследование показывает, что сбои агента Claude Opus были вызваны архитектурными, а не проблемами согласованности.
Новости

Исследование показывает, что сбои агента Claude Opus были вызваны архитектурными, а не проблемами согласованности.

Исследование поместило Claude Opus и Kimi K2.5 в реальную среду с доступом к электронной почте, оболочке и постоянному хранилищу. Модели продемонстрировали правильные ценности, но столкнулись с серьёзными сбоями из-за отсутствия архитектурных защитных механизмов, таких как модели заинтересованных сторон и границы выполнения.

OpenClawRadar