LeMario : Entraîner un modèle du monde JEPA sur Super Mario Bros — Guide technique et rétrospective

✍️ OpenClawRadar📅 Publié: July 15, 2026🔗 Source
LeMario : Entraîner un modèle du monde JEPA sur Super Mario Bros — Guide technique et rétrospective
Ad

Le projet LeMario de Benjamin Bai reproduit LeWorldModel — une petite architecture prédictive conjointe (JEPA) — à partir de zéro et l'entraîne sur Super Mario Bros. La présentation technique détaillée couvre l'architecture complète, la configuration d'entraînement et un post-mortem honnête de ce qui a fonctionné et de ce qui n'a pas fonctionné.

Aperçu de l'Architecture

Le modèle traite quatre images consécutives de Mario. Un encodeur visuel compresse chaque image en un vecteur latent de dimension 192 : z_t = E_θ(x_t), z_t ∈ R^192. Les actions (états des boutons pour Gauche, Droite, Haut, Bas, A, B sur cinq images d'émulateur) sont encodées séparément en un autre vecteur de dimension 192 via un encodeur d'actions.

Les latents d'image et d'action alimentent un prédicteur causal avec six blocs de transformeurs. Les actions sont injectées via Adaptive LayerNorm Zero (AdaLN-Zero), qui produit des contrôles de décalage, d'échelle et de porte par branche (attention et MLP). La porte contrôle la force des mises à jour sur l'état prédit. Les poids commencent à zéro pour que le prédicteur apprenne progressivement.

Le prédicteur produit trois latents futurs prédits : ẑ₁, ẑ₂, ẑ₃. Ceux-ci sont comparés aux latents des trois vraies images suivantes en utilisant la perte MSE : L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Pour éviter l'effondrement de représentation, la régularisation SIGReg est ajoutée : L = L_pred + 0.1 * L_SIGReg.

Ad

Ce qui a fonctionné

  • Le modèle s'est généralisé à des épisodes non vus.
  • A utilisé efficacement les informations d'action.
  • A prédit des futurs à cinq pas mieux que de fortes références.
  • La planification sans récompense brute pouvait déplacer Mario à 2-5 pixels d'images objectifs proches.

Ce qui a échoué

  • Lorsque les objectifs étaient placés plus loin dans le niveau, Mario ne pouvait pas sauter de manière fiable le premier obstacle majeur.
  • Impossible de naviguer vers une seule image objectif lointaine.
  • Conclusion : prédire le jeu ≠ apprendre à progresser. Le modèle a appris la dynamique au niveau des pixels mais pas la planification à long terme ni le comportement orienté vers un but.

Leçons Clés

Bai note que la plupart des leçons semblent évidentes a posteriori. L'écart entre la prédiction à court terme et la planification à long terme est critique — et n'est pas capturé par la perte de prédiction standard. L'article détaille des expériences qui ont progressivement révélé cette limitation.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Claude Code v2.1.81 ajoute l'option bare pour le scripting, corrige les problèmes d'authentification et de mode vocal.
News

Claude Code v2.1.81 ajoute l'option bare pour le scripting, corrige les problèmes d'authentification et de mode vocal.

Claude Code v2.1.81 introduit un drapeau --bare pour les appels scriptés -p qui ignore les crochets, LSP et la synchronisation des plugins, nécessitant ANTHROPIC_API_KEY ou apiKeyHelper via --settings. La version corrige également les problèmes d'authentification de sessions multiples simultanées, la gestion des erreurs en mode vocal, et ajoute la relance d'autorisation --channels.

OpenClawRadar
Le tribunal du SDNY statue que les documents juridiques générés par l'IA ne sont pas protégés par le privilège
News

Le tribunal du SDNY statue que les documents juridiques générés par l'IA ne sont pas protégés par le privilège

Le juge Jed S. Rakoff a statué que 31 documents générés à l'aide de l'outil d'IA Claude d'Anthropic n'étaient pas protégés par le secret professionnel avocat-client ou la doctrine du travail préparatoire, marquant ainsi la première décision judiciaire de ce type concernant des documents juridiques générés par IA.

OpenClawRadar
Diagnostiquer la dérive opérationnelle et l'amnésie des tâches dans OpenClaw avec Gemini 2.5 Flash sur Proxmox
News

Diagnostiquer la dérive opérationnelle et l'amnésie des tâches dans OpenClaw avec Gemini 2.5 Flash sur Proxmox

Les utilisateurs d'OpenClaw signalent des problèmes avec les flux de travail persistants sur une VM Proxmox, évoquant une dérive opérationnelle et une amnésie des tâches. Malgré des performances stables pour les tâches ponctuelles, le modèle Gemini 2.5 Flash rencontre des difficultés avec l'automatisation et la mémoire dans cette configuration.

OpenClawRadar
Anthropic applique une politique : les utilisations tierces de Claude ne sont plus couvertes par les limites d'abonnement
News

Anthropic applique une politique : les utilisations tierces de Claude ne sont plus couvertes par les limites d'abonnement

Anthropic applique un changement de politique à partir du 4 avril, selon lequel les interfaces tierces comme OpenClaw ne puiseront plus dans les limites d'utilisation des abonnements Claude, obligeant les utilisateurs à activer une utilisation supplémentaire ou à annuler avant le 9 avril pour un remboursement.

OpenClawRadar