Структурированный рабочий процесс побеждает режим планирования и суперсилы в тесте AI DES

Пост на Reddit делится результатами нового бенчмарка AI-assisted Discrete-Event Simulation (DES). Работа с рабочим процессом Ouroboros (ooo) в Claude Code заняла первое место, обойдя как встроенный режим планирования Claude, так и стеки навыков 'суперспособностей'.
Детали бенчмарка
Бенчмарк проверяет полное понимание реальной системы — системы транспортировки руды на шахте с грузовиками, пунктами погрузки и разгрузки, маршрутами и очередями. Работы оцениваются по:
- Пониманию структуры системы
- Абстрагированию в модель дискретно-событийного моделирования
- Проектированию событий, изменений состояний и KPI
- Созданию исполняемого кода симуляции
- Интерпретации результатов (узкие места, пропускная способность, время ожидания)
- Генерации читаемых артефактов (диаграммы топологии, анимации)
Производительность Ouroboros
Решение Ouroboros включало рабочий код DES, диаграмму топологии шахтной системы и анимацию движения грузовиков с рудой. Примечательно, что когда MCP-сервер вышел из строя в середине работы, Ouroboros переключился на путь на основе навыков и завершил задачу — демонстрируя восстановление и перенаправление в реальных развертываниях.
Сравнение
- Режим планирования (облегченное планирование) — достойный базовый уровень
- Суперспособности / стеки навыков — хуже режима планирования в этой задаче
- Ouroboros (структурированный: уточнить → спланировать → выполнить → оценить → восстановить → повторить) — лучший
Результат показывает, что структурирование рабочего процесса вокруг определения проблемы, планирования, выполнения, оценки и восстановления эффективнее, чем нагромождение инструкций и больших навыков.
Ouroboros: https://github.com/Q00/ouroboros
Бенчмарк: https://simulation-bench.fly.dev/
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Диагностика регрессии производительности Claude Code: Конфигурация, а не интеллект модели
Анализ Anthropic показывает, что падение производительности Claude Code было вызвано тремя изменениями в продукте — снижение усилий при рассуждении по умолчанию, ошибка кэширования сессий и изменение многословности промптов, а не деградацией модели. Откат изменений восстановил производительность.

Модель MiniMax M2.7 демонстрирует высокую производительность в роли ИИ-агента для программирования.
Разработчик протестировал MiniMax M2.7 в качестве основного ИИ-агента для программирования и обнаружил, что он превзошёл GPT 5.4 и Gemini 3.1 Pro по скорости и задачам, связанным с инструментами, с результатами бенчмарков 56.22% на SWE-Pro и 57.0% на Terminal Bench 2.

Ошибка в биллинге API Anthropic: модель Sonnet тарифицируется по ставкам Opus
Пользователь обнаружил, что API Anthropic некорректно выставляет счета за модель claude-sonnet-4-6 по тарифам Opus, несмотря на возвращение правильного названия модели. Ошибка была выявлена при анализе необработанных данных событий, показавших расхождение в стоимости.

Бенчмарк торговых стратегий: Более дешёвые модели ИИ превосходят Claude Opus 4.6
В ходе тестирования 10 крупных языковых моделей на разработку торговых стратегий более дешёвые модели, такие как Minimax 2.5 и Gemini 3.1, показали лучшие результаты, чем Claude Opus 4.6, несмотря на его стоимость в 10 раз выше. Эксперимент проводился трижды с одинаковыми результатами.