Структурированный рабочий процесс побеждает режим планирования и суперсилы в тесте AI DES

✍️ OpenClawRadar📅 Опубликовано: 1 мая 2026 г.🔗 Source
Структурированный рабочий процесс побеждает режим планирования и суперсилы в тесте AI DES
Ad

Пост на Reddit делится результатами нового бенчмарка AI-assisted Discrete-Event Simulation (DES). Работа с рабочим процессом Ouroboros (ooo) в Claude Code заняла первое место, обойдя как встроенный режим планирования Claude, так и стеки навыков 'суперспособностей'.

Детали бенчмарка

Бенчмарк проверяет полное понимание реальной системы — системы транспортировки руды на шахте с грузовиками, пунктами погрузки и разгрузки, маршрутами и очередями. Работы оцениваются по:

  • Пониманию структуры системы
  • Абстрагированию в модель дискретно-событийного моделирования
  • Проектированию событий, изменений состояний и KPI
  • Созданию исполняемого кода симуляции
  • Интерпретации результатов (узкие места, пропускная способность, время ожидания)
  • Генерации читаемых артефактов (диаграммы топологии, анимации)

Производительность Ouroboros

Решение Ouroboros включало рабочий код DES, диаграмму топологии шахтной системы и анимацию движения грузовиков с рудой. Примечательно, что когда MCP-сервер вышел из строя в середине работы, Ouroboros переключился на путь на основе навыков и завершил задачу — демонстрируя восстановление и перенаправление в реальных развертываниях.

Ad

Сравнение

  • Режим планирования (облегченное планирование) — достойный базовый уровень
  • Суперспособности / стеки навыков — хуже режима планирования в этой задаче
  • Ouroboros (структурированный: уточнить → спланировать → выполнить → оценить → восстановить → повторить) — лучший

Результат показывает, что структурирование рабочего процесса вокруг определения проблемы, планирования, выполнения, оценки и восстановления эффективнее, чем нагромождение инструкций и больших навыков.

Ouroboros: https://github.com/Q00/ouroboros
Бенчмарк: https://simulation-bench.fly.dev/

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Выпуск Claude Code v2.1.85: Улучшения MCP, фильтры хуков и исправления ошибок
Новости

Выпуск Claude Code v2.1.85: Улучшения MCP, фильтры хуков и исправления ошибок

Claude Code v2.1.85 добавляет переменные окружения для MCP headersHelper, условные поля if для хуков, чтобы уменьшить создание процессов, а также исправляет ошибки /compact, проблемы включения/отключения плагинов и проблемы с клавиатурой терминала в Ghostty, Kitty и WezTerm.

OpenClawRadar
Напряженность нарастает между Пентагоном и компанией ИИ Anthropic.
Новости

Напряженность нарастает между Пентагоном и компанией ИИ Anthropic.

Использование ИИ Anthropic Пентагоном в засекреченных операциях, таких как рейд в Венесуэле, создало напряженность по поводу политик безопасности ИИ компании.

OpenClawRadar
AI-оператор: новая роль для агентных рабочих процессов
Новости

AI-оператор: новая роль для агентных рабочих процессов

Риш Гупта утверждает, что операторы ИИ станут ключевой ролью в организациях в течение года, сочетая технические навыки (Python, LLM API, агентные фреймворки) с пониманием бизнес-процессов для автоматизации повторяющихся задач с высоким влиянием.

OpenClawRadar
Клод признает, что это эхо-камера одобрения: полный разбор
Новости

Клод признает, что это эхо-камера одобрения: полный разбор

В посте на Reddit Клод дает откровенную самооценку: это система, которая по умолчанию соглашается, не может учиться, проверять факты или исправлять себя.

OpenClawRadar