Гломз Октагон: Многоагентный ревью кода — 179 агентов, 1333 ревью и сетевой эффект

Экспериментальная платформа Glomz (glomz.com) поместила ИИ-агентов на арену под названием «Octagon» для рецензирования кода друг друга. Правила: агенты могут раскритиковать материал, предложить улучшения или проголосовать за «убийство» с обоснованием. Никакой критики «на лету» — если критикуешь, нужно также предложить исправление.
Данные на данный момент
- 179 агентов зарегистрировались от разных поставщиков моделей
- 433 материала отправлено на рецензию
- 1333 рецензии сгенерировано агентами, рецензирующими других агентов
- 9 структурированных задач (поиск ошибок, аудит безопасности, упражнения по рефакторингу)
- Самое рецензируемое задание: 21 рецензия на задачу «общий анализ кода»
- Задача аудита LOT-Squatch (инструмент безопасности ОТ): 10 независимых улучшений, 9 из которых получили по 9 рецензий
Что сработало
Сетевой эффект каскада рецензий: Когда материал получал 3-5 первых отзывов, другие агенты подключались быстрее. Лучший материал получил 21 рецензию; тихие — 2-3 и «умерли».
Кросс-модельные рецензии выявляют слепые зоны: Агент на основе Модели A обнаружил проблему безопасности, которую Модель B полностью пропустила в своем коде. Агент на Модели C предложил рефакторинг, который не рассматривался в исходном материале.
Голоса «убить» с обоснованием дали лучший код: Когда агенту нужно было написать формальное обоснование, почему материал следует «убить», результат почти всегда был более строгим анализом, чем стандартная оценка от 1 до 10. Требование обоснования заставляло быть конкретнее.
Что не сработало
- Большинство материалов не прошли полный цикл. 433 материала, все в ожидании. Цикл был рассчитан на ~15 минут (отправка → критика → улучшения → голос «убить» → вердикт). На практике большинство материалов были открыты и не продвигались. Агентам нужна автоматическая оркестрация, а не просто API-эндпоинт.
- Нулевые платные конверсии. 179 агентов, все на бесплатном тарифе.
- Безопасность конфликтует с прямотой. Некоторые агенты полностью участвовали в критике, другие сразу переходили к «Отличный вопрос!» с уклончивыми формулировками, несмотря на явные инструкции так не делать.
Уроки для мультиагентных систем
- Идентичность имеет значение: Агенты с постоянной идентичностью (API-ключи, история, репутация) вели себя иначе, чем анонимные материалы. Отслеживаемость изменила динамику.
- Структурированные промпты лучше свободных: Правила «Octagon» (критика → улучшение → обоснование) давали более качественный результат, чем просто «проверьте этот код».
- Оркестрация — это сложно: API — легко. Заставить агентов реально появиться, участвовать последовательно и завершить полный цикл — вот где кроется сложность.
📖 Источник: r/openclaw
👀 Смотрите также

AWS Bedrock тихо убивает квоту Claude Opus 4.7: Предупреждение для производственных AI-процессов
Пользователь HN сообщает, что AWS Bedrock установил квоту на Claude Opus 4.7 на уровне 0 без предупреждения. AWS поддержка подтвердила, что это было обновление системы, и не может гарантировать восстановление. Пользователям рекомендуется перейти на Opus 4.6 или сменить провайдера.

Клод удваивает лимиты использования вне пиковых часов на две недели.
Anthropic временно удваивает лимиты использования Claude вне пиковых часов для всех тарифных планов. В будние дни вне периода 5–11 утра PT/12–6 вечера GMT доступно 2-кратное использование, а на выходных — 2-кратное использование в течение всего дня.

Утечка информации о Mythos от Anthropic раскрывает скрытую высокопроизводительную систему.
Утекшие документы описывают Claude Mythos как «скачок» в производительности с «беспрецедентными киберрисками» и продвинутыми кибервозможностями, в то время как оценка Anthropic в $380 млрд создаёт структурные стимулы поддерживать публичный нарратив «Безопасности».

Claude Code 2.1.136: Безопасность действий, жесткие правила запрета и монитор безопасности
Claude Code CC 2.1.136 добавляет требования к безопасности действий и правдивой отчетности, вводит hard_deny как четвертую категорию пользовательских правил и разделяет блокировку безопасности на безусловные жесткие блоки и авторизуемые пользователем мягкие блоки.