Сравнение мультиагентных систем ИИ: Harness от Anthropic и модель инженерной организации Agyn

Anthropic опубликовала дизайн фреймворка для разработки долгоиграющих приложений, в то время как мультиагентная система Agyn для командной автономной разработки ПО была открыта в прошлом месяце на arXiv. Оба подхода отвергают модель «монолитного агента» и вместо этого структурируют ИИ-агентов для работы как реальные инженерные команды с разделением ролей, структурированными передачами и циклами проверки.
Ключевые различия в архитектуре
Система Anthropic использует архитектуру, вдохновлённую GAN, с тремя ролями: планировщик → генератор → оценщик. Оценщик использует Playwright для взаимодействия с запущенным приложением, как реальный пользователь, а затем предоставляет структурированную критику генератору.
Agyn моделирует процесс как инженерную организацию с четырьмя ролями: координация → исследование → реализация → проверка. Агенты работают в изолированных песочницах и общаются через определённые контракты.
Общие решения для типичных проблем
- Потеря связности моделей в длительных задачах: Anthropic использует сброс контекста со структурированными артефактами передачи, в то время как Agyn использует сжатие со структурированными передачами между ролями
- Слишком мягкая самооценка: Обе системы отделяют оценку от генерации. Anthropic использует отдельного агента-оценщика, откалиброванного на нескольких примерах, в то время как у Agyn есть выделенная роль проверки, отделённая от реализации
- Неоднозначные критерии завершения: Anthropic использует спринт-контракты, согласованные до начала работы, в то время как Agyn имеет фазу спецификации задач с явными критериями приёмки и необходимыми тестами
- Сложная декомпозиция задач: Планировщик Anthropic расширяет односложные промпты в полные спецификации, в то время как агент-исследователь Agyn декомпозирует задачи и создаёт спецификации до начала реализации
- Тревога контекста: Anthropic использует сбросы для чистого листа, в то время как Agyn использует сжатие со слоем памяти
Отличительные особенности Agyn
Agyn включает две функции, отсутствующие во фреймворке Anthropic:
- Изолированные песочницы для каждого агента: Каждый агент работает в своём собственном изолированном файловом и сетевом пространстве имён, предотвращая конфликты из-за общего состояния во время параллельной или последовательной работы
- GitHub как общее состояние: Система использует примитивы GitHub (коммиты, комментарии, PR, ревью), которые уже понимают человеческие команды, предоставляя полный журнал аудита без необходимости в пользовательских протоколах связи
Различия в реализации
Фреймворк Anthropic тесно построен вокруг Claude с использованием Claude Agent SDK и Playwright MCP для цикла оценки. Оценщик навигает по живым запущенным приложениям перед выставлением оценки.
Agyn по замыслу является модель-агностиком, поддерживая Claude, Codex и модели с открытыми весами. Система позволяет смешивать разные модели для каждой роли, что на практике оказалось эффективнее, чем использование одной модели для всего.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Orion: Обход CoreML для запуска и обучения LLM напрямую на Apple Neural Engine
Orion — это система с открытым исходным кодом на Objective-C, которая обходит Apple CoreML для запуска и обучения LLM непосредственно на Apple Neural Engine (ANE), достигая скорости более 170 токенов/с для декодирования GPT-2 124M и стабильного многошагового обучения трансформера с 110 млн параметров.

Homebutler: MCP-сервер для управления мультисерверной домашней лабораторией через Claude
Homebutler — это бинарный файл Go со встроенным сервером MCP, который позволяет Claude управлять несколькими серверами по SSH без установки агентов на удалённых машинах. Он предоставляет 9 инструментов, включая мониторинг состояния системы, управление контейнерами Docker, сканирование портов и правила оповещений.

Тестирование показывает, что инструменты автоматизации браузера на основе ИИ различаются в 2,6 раза по стоимости токенов при одинаковой точности.
Бенчмарк 4 инструментов автоматизации браузера через CLI с использованием Claude Sonnet 4.6 на 6 реальных задачах показал, что все достигли 100% точности, но openbrowser-ai использовал 36 010 токенов, в то время как другие использовали 77 123–94 130 токенов. Количество вызовов инструментов оказалось самым сильным предиктором стоимости токенов.

Android CLI и навыки для рабочих процессов разработки AI-агентов
Google выпустила Android CLI с командами типа android create и android sdk install, а также репозиторий Android Skills на GitHub с модульными наборами инструкций. Внутренние тесты показывают снижение использования токенов LLM на 70% и ускорение выполнения задач в 3 раза.