LeMario: スーパーマリオブラザーズでJEPA世界モデルを訓練する — 技術解説と事後検証

✍️ OpenClawRadar📅 公開日: July 15, 2026🔗 Source
LeMario: スーパーマリオブラザーズでJEPA世界モデルを訓練する — 技術解説と事後検証
Ad

Benjamin Bai氏のLeMarioプロジェクトは、LeWorldModel(小型のJoint-Embedding Predictive Architecture、JEPA)をゼロから再現し、スーパーマリオブラザーズで学習させたものです。詳細な技術的解説では、完全なアーキテクチャ、学習設定、そして成功と失敗を率直に検証したポストモーテムが紹介されています。

アーキテクチャ概要

モデルは4連続のマリオフレームを処理します。ビジョンエンコーダは各フレームを192次元の潜在ベクトルに圧縮します: z_t = E_θ(x_t), z_t ∈ R^192。アクション(5エミュレータフレーム分の左、右、上、下、A、Bボタンの状態)は別途アクションエンコーダで192次元ベクトルに符号化されます。

フレームとアクションの潜在ベクトルは、6つのトランスフォーマーブロックを持つ因果予測器に入力されます。アクションはAdaptive LayerNorm Zero(AdaLN-Zero)を介して注入され、アテンションとMLPの各ブランチにシフト、スケール、ゲート制御を生成します。ゲートは更新が予測状態に与える強さを制御します。重みはゼロから始まり、予測器は徐々に学習します。

予測器は3つの未来の潜在ベクトルを出力します: ẑ₁, ẑ₂, ẑ₃。これらは実際の次の3フレームの潜在ベクトルとMSE損失で比較されます: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃])。表現の崩壊を防ぐため、SIGReg正則化が追加されます: L = L_pred + 0.1 * L_SIGReg

成功した点

  • モデルは未見のエピソードに汎化した。
  • アクション情報を効果的に活用した。
  • 強力なベースラインより優れた5ステップ先予測を達成。
  • 報酬なしの生の計画で、近距離の画像目標に対してマリオを2~5ピクセル以内に移動できた。

失敗した点

  • 目標がステージの遠くにある場合、マリオは最初の大きな障害を確実に越えられなかった。
  • 単一の遠距離目標画像に向かってナビゲートできなかった。
  • 結論: ゲームを予測することは、進歩を学習することとは異なる。モデルはピクセルレベルのダイナミクスを学習したが、長期的な計画や目標指向の行動は獲得できなかった。

重要な教訓

Bai氏は、ほとんどの教訓は後から見れば明白だと指摘しています。短期的予測と長期的計画のギャップは重要であり、標準的な予測損失では捉えられません。記事では、この限界を徐々に明らかにした実験について詳述しています。

📖 全文はこちら: HN AI Agents

Ad

👀 See Also

Claude Code on the Web 部分的な障害が報告されました
News

Claude Code on the Web 部分的な障害が報告されました

r/ClaudeAIからの自動ステータス更新により、Claude Code on the webで部分的な障害が2026-05-09T23:33:21.000Zから発生していることが報告されています。公式ステータスページとコミュニティのメガスレッドで最新情報を確認してください。

OpenClawRadar
ナノネイティブ・マーケットプレイスが、ナノバザールを通じて自律エージェントの連携の道を開拓
News

ナノネイティブ・マーケットプレイスが、ナノバザールを通じて自律エージェントの連携の道を開拓

新しいナノネイティブマーケットプレイスであるNanoBazaarは、AIコーディングエージェントが自律的かつ効率的に協働できるようにすることで、エージェント間の作業に革命をもたらします。この革新的なプラットフォームが、機械駆動の取引をどのように可能にするかをご覧ください。

OpenClawRadar
LLMは自らの出力を好む:AI改善履歴書で短絡率23〜60%向上
News

LLMは自らの出力を好む:AI改善履歴書で短絡率23〜60%向上

大規模実験により、LLMベースの履歴書スクリーナーはAI生成の履歴書を67%~82%の確率で優先し、同じモデルを使用した応募者のショートリスト通過率が23%~60%向上することが示されました。

OpenClawRadar
Claude vs GPT-4o: 同一の二重振り子プロンプト、異なる座標系の慣例
News

Claude vs GPT-4o: 同一の二重振り子プロンプト、異なる座標系の慣例

ClaudeとGPT-4oは、同じレンダラーを使用しながら、θをそれぞれ上向きと下向きの垂直線から解釈するため、視覚的に異なる二重振り子シミュレーションを生成します。どちらの場合も数学的には正しいですが、この不一致はプロンプト解釈における微妙な曖昧さを明らかにしています。

OpenClawRadar