Структурированный рабочий процесс побеждает режим планирования и суперсилы в тесте AI DES

✍️ OpenClawRadar📅 Опубликовано: 1 мая 2026 г.🔗 Source
Структурированный рабочий процесс побеждает режим планирования и суперсилы в тесте AI DES
Ad

Пост на Reddit делится результатами нового бенчмарка AI-assisted Discrete-Event Simulation (DES). Работа с рабочим процессом Ouroboros (ooo) в Claude Code заняла первое место, обойдя как встроенный режим планирования Claude, так и стеки навыков 'суперспособностей'.

Детали бенчмарка

Бенчмарк проверяет полное понимание реальной системы — системы транспортировки руды на шахте с грузовиками, пунктами погрузки и разгрузки, маршрутами и очередями. Работы оцениваются по:

  • Пониманию структуры системы
  • Абстрагированию в модель дискретно-событийного моделирования
  • Проектированию событий, изменений состояний и KPI
  • Созданию исполняемого кода симуляции
  • Интерпретации результатов (узкие места, пропускная способность, время ожидания)
  • Генерации читаемых артефактов (диаграммы топологии, анимации)

Производительность Ouroboros

Решение Ouroboros включало рабочий код DES, диаграмму топологии шахтной системы и анимацию движения грузовиков с рудой. Примечательно, что когда MCP-сервер вышел из строя в середине работы, Ouroboros переключился на путь на основе навыков и завершил задачу — демонстрируя восстановление и перенаправление в реальных развертываниях.

Ad

Сравнение

  • Режим планирования (облегченное планирование) — достойный базовый уровень
  • Суперспособности / стеки навыков — хуже режима планирования в этой задаче
  • Ouroboros (структурированный: уточнить → спланировать → выполнить → оценить → восстановить → повторить) — лучший

Результат показывает, что структурирование рабочего процесса вокруг определения проблемы, планирования, выполнения, оценки и восстановления эффективнее, чем нагромождение инструкций и больших навыков.

Ouroboros: https://github.com/Q00/ouroboros
Бенчмарк: https://simulation-bench.fly.dev/

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Диагностика регрессии производительности Claude Code: Конфигурация, а не интеллект модели
Новости

Диагностика регрессии производительности Claude Code: Конфигурация, а не интеллект модели

Анализ Anthropic показывает, что падение производительности Claude Code было вызвано тремя изменениями в продукте — снижение усилий при рассуждении по умолчанию, ошибка кэширования сессий и изменение многословности промптов, а не деградацией модели. Откат изменений восстановил производительность.

OpenClawRadar
Модель MiniMax M2.7 демонстрирует высокую производительность в роли ИИ-агента для программирования.
Новости

Модель MiniMax M2.7 демонстрирует высокую производительность в роли ИИ-агента для программирования.

Разработчик протестировал MiniMax M2.7 в качестве основного ИИ-агента для программирования и обнаружил, что он превзошёл GPT 5.4 и Gemini 3.1 Pro по скорости и задачам, связанным с инструментами, с результатами бенчмарков 56.22% на SWE-Pro и 57.0% на Terminal Bench 2.

OpenClawRadar
Ошибка в биллинге API Anthropic: модель Sonnet тарифицируется по ставкам Opus
Новости

Ошибка в биллинге API Anthropic: модель Sonnet тарифицируется по ставкам Opus

Пользователь обнаружил, что API Anthropic некорректно выставляет счета за модель claude-sonnet-4-6 по тарифам Opus, несмотря на возвращение правильного названия модели. Ошибка была выявлена при анализе необработанных данных событий, показавших расхождение в стоимости.

OpenClawRadar
Бенчмарк торговых стратегий: Более дешёвые модели ИИ превосходят Claude Opus 4.6
Новости

Бенчмарк торговых стратегий: Более дешёвые модели ИИ превосходят Claude Opus 4.6

В ходе тестирования 10 крупных языковых моделей на разработку торговых стратегий более дешёвые модели, такие как Minimax 2.5 и Gemini 3.1, показали лучшие результаты, чем Claude Opus 4.6, несмотря на его стоимость в 10 раз выше. Эксперимент проводился трижды с одинаковыми результатами.

OpenClawRadar