Структурированный рабочий процесс побеждает режим планирования и суперсилы в тесте AI DES

Пост на Reddit делится результатами нового бенчмарка AI-assisted Discrete-Event Simulation (DES). Работа с рабочим процессом Ouroboros (ooo) в Claude Code заняла первое место, обойдя как встроенный режим планирования Claude, так и стеки навыков 'суперспособностей'.
Детали бенчмарка
Бенчмарк проверяет полное понимание реальной системы — системы транспортировки руды на шахте с грузовиками, пунктами погрузки и разгрузки, маршрутами и очередями. Работы оцениваются по:
- Пониманию структуры системы
- Абстрагированию в модель дискретно-событийного моделирования
- Проектированию событий, изменений состояний и KPI
- Созданию исполняемого кода симуляции
- Интерпретации результатов (узкие места, пропускная способность, время ожидания)
- Генерации читаемых артефактов (диаграммы топологии, анимации)
Производительность Ouroboros
Решение Ouroboros включало рабочий код DES, диаграмму топологии шахтной системы и анимацию движения грузовиков с рудой. Примечательно, что когда MCP-сервер вышел из строя в середине работы, Ouroboros переключился на путь на основе навыков и завершил задачу — демонстрируя восстановление и перенаправление в реальных развертываниях.
Сравнение
- Режим планирования (облегченное планирование) — достойный базовый уровень
- Суперспособности / стеки навыков — хуже режима планирования в этой задаче
- Ouroboros (структурированный: уточнить → спланировать → выполнить → оценить → восстановить → повторить) — лучший
Результат показывает, что структурирование рабочего процесса вокруг определения проблемы, планирования, выполнения, оценки и восстановления эффективнее, чем нагромождение инструкций и больших навыков.
Ouroboros: https://github.com/Q00/ouroboros
Бенчмарк: https://simulation-bench.fly.dev/
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Выпуск Claude Code v2.1.85: Улучшения MCP, фильтры хуков и исправления ошибок
Claude Code v2.1.85 добавляет переменные окружения для MCP headersHelper, условные поля if для хуков, чтобы уменьшить создание процессов, а также исправляет ошибки /compact, проблемы включения/отключения плагинов и проблемы с клавиатурой терминала в Ghostty, Kitty и WezTerm.

Напряженность нарастает между Пентагоном и компанией ИИ Anthropic.
Использование ИИ Anthropic Пентагоном в засекреченных операциях, таких как рейд в Венесуэле, создало напряженность по поводу политик безопасности ИИ компании.

AI-оператор: новая роль для агентных рабочих процессов
Риш Гупта утверждает, что операторы ИИ станут ключевой ролью в организациях в течение года, сочетая технические навыки (Python, LLM API, агентные фреймворки) с пониманием бизнес-процессов для автоматизации повторяющихся задач с высоким влиянием.

Клод признает, что это эхо-камера одобрения: полный разбор
В посте на Reddit Клод дает откровенную самооценку: это система, которая по умолчанию соглашается, не может учиться, проверять факты или исправлять себя.