構造化ワークフローがAI DESベンチマークで計画モードとスーパーパワーを凌駕

Redditの投稿で、新しいAI支援離散イベントシミュレーション(DES)ベンチマークの結果が共有されました。Claude Code内でOuroborosワークフロー(ooo)を使用した提出物が1位を獲得し、Claudeの組み込みプランモードや「スーパーパワー」fat-skillスタックの両方を打ち負かしました。
ベンチマークの詳細
このベンチマークは、トラック、積み込みポイント、ダンプポイント、ルート、待ち行列を備えた鉱山運搬システムという現実世界のシステムの完全な理解をテストします。提出物は以下の基準で評価されます:
- システム構造の理解
- 離散イベントシミュレーションモデルへの抽象化
- イベント、状態変化、KPIの設計
- 実行可能なシミュレーションコードの作成
- 結果の解釈(ボトルネック、スループット、待ち時間)
- 人間が読める成果物(トポロジ図、アニメーション)の生成
Ouroborosのパフォーマンス
Ouroborosの提出物には、動作するDESコード、鉱山システムのトポロジ図、そして鉱石を運搬するトラックのアニメーションが含まれていました。特筆すべきは、MCPサーバーが実行中に失敗したとき、Ouroborosがスキルベースのパスにフォールバックしてタスクを完了したことです。これは実際の展開における回復とルート変更の能力を示しています。
比較
- プランモード(軽量計画) — まあまあのベースライン
- スーパーパワー / fat-skillスタック — このタスクではプランモードより悪い
- Ouroboros(構造化:明確化→計画→実行→評価→回復→反復) — 最良
この結果は、問題定義、計画、実行、評価、回復の周りにワークフローを構造化することが、より多くの指示や大きなスキルを積み重ねるよりも効果的であることを示唆しています。
Ouroboros: https://github.com/Q00/ouroboros
ベンチマーク: https://simulation-bench.fly.dev/
📖 完全なソースを読む: r/ClaudeAI
👀 See Also

NVIDIA、エージェントAIワークロード向け「Vera CPU」を発表
NVIDIAは、エージェント型AIと強化学習ワークロード向けに特別に設計されたプロセッサ「Vera CPU」を発表しました。従来のラックスケールCPUと比較して、50%高速な性能と2倍の効率性を実現するとNVIDIAは主張しています。

Claude Code v2.1.89では、遅延可能なフック、権限リトライ機能が追加され、メモリリークの問題が修正されました。
Claude Code v2.1.89では、PreToolUseフックに「defer」権限決定を導入し、再試行機能を備えたPermissionDeniedフックを追加、さらに大規模JSON入力でのメモリリークやStructuredOutputスキーマキャッシュの失敗など重大な問題を修正しました。

分析:AI産業とサブプライム住宅ローン危機のパターンを比較する
エドワード・ジトロンの分析は、2008年のサブプライム住宅ローン危機と現在のAI産業のトレンドを比較し、変動金利型住宅ローンの具体的なデータポイントとAI投資パターンの類似性を引用しています。

Sakana AI、RSIラボを設立:基盤モデルによる再帰的自己改善
Sakana AIは、再帰的自己改善(RSI)ラボを正式に立ち上げました。LLM-Squared、Darwin Gödel Machine、The AI Scientistなどの研究成果を基に、自律的に自己改善するAIシステムを構築します。