Nelson v2.2.3 релиз: мульти-агентная координация для Claude Code и тест дискретно-событийного моделирования

Вышел Nelson v2.2.3 — навык многокомпонентной координации для Claude Code, использующий метафору Королевского флота (адмирал, капитаны, корабли, команда), чтобы параллельные агенты не мешали работе друг друга. Лицензия MIT, около 300 звезд на GitHub.
Установка
Выполните эти команды внутри Claude Code:
/plugin marketplace add aspegio/nelson
/plugin install nelson@nelson
Используй Nelson, чтобы создать мне игру в морской бой.Затем наблюдайте за координацией адмирала, капитанов и кораблей.
Результаты бенчмарка
Настоящая новость — это бенчмарк, созданный тем же автором. Он тестирует 13 комбинаций модели, CLI и навыка на задаче дискретно-событийного моделирования (синтетическая производительность шахты). Оценки качества (из 100):
- ouroboros-max-thinking (opus-4-7): 97
- plan-mode (opus-4-7): 96
- agent-teams-nelson-max-thinking (opus-4-7): 95
- superpowers-max-thinking (opus-4-7): 94
- max-thinking (opus-4-7): 92
- vanilla-max (sonnet-4-6): 85
- xhigh (gpt-5-5, codex): 85
- customtools (gemini-3.1-pro): 81
Ключевой вывод: nelson уступил ouroboros и plan-mode на 1–2 балла, но обошел superpowers на 1, vanilla max-thinking на 3 и sonnet без размышления на 10. Plan-mode (без навыков) занял второе место — тщательно подобранные навыки не дали большого отрыва. Модель и включенное размышление оказались гораздо важнее выбора навыка.
Оговорки: n=1 задача, качество оценено по рубрике, написанной автором Nelson, пока нет комбинированной метрики стоимость/точность.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

ClankerRank: Бенчмарк для оценки навыков программирования с помощью ИИ на основе Claude Haiku
Разработчик создал ClankerRank для оценки навыков программирования с помощью ИИ, используя модель Claude Haiku 4.5. Платформа предлагает пользователям одинаковые баги, оценивает результаты с помощью скрытых тестов и выявила явные различия в навыках среди сотен участников.

Qwen3.5-35B-A3B-UD-Q6_K_XL Протестировано в производственных рабочих процессах разработки
Разработчик протестировал модель Qwen3.5-35B-A3B-UD-Q6_K_XL на нескольких реальных клиентских проектах, достигнув стабильной производительности с показателями 1504pp2048 и 47.71 tg256, а также скоростью генерации токенов 80tps на одной видеокарте.

Пользователь OpenClaw критикует архитектуру инструмента и пробелы в безопасности.
Пользователь Reddit описывает OpenClaw как единственный инструмент, делающий автоматизацию агентов настолько доступной, но критикует его архитектуру за отсутствие контрольного слоя для файловых операций, защищённого ядра, надлежащего управления контекстом, а также встроенного контроля версий или тестов.

Tangent: Chrome-расширение для ветвления диалогов с Claude
Бесплатное open-source расширение для открытия боковых веток в диалогах Claude без потери места.