LeMario : Entraîner un modèle du monde JEPA sur Super Mario Bros — Guide technique et rétrospective

Le projet LeMario de Benjamin Bai reproduit LeWorldModel — une petite architecture prédictive conjointe (JEPA) — à partir de zéro et l'entraîne sur Super Mario Bros. La présentation technique détaillée couvre l'architecture complète, la configuration d'entraînement et un post-mortem honnête de ce qui a fonctionné et de ce qui n'a pas fonctionné.
Aperçu de l'Architecture
Le modèle traite quatre images consécutives de Mario. Un encodeur visuel compresse chaque image en un vecteur latent de dimension 192 : z_t = E_θ(x_t), z_t ∈ R^192. Les actions (états des boutons pour Gauche, Droite, Haut, Bas, A, B sur cinq images d'émulateur) sont encodées séparément en un autre vecteur de dimension 192 via un encodeur d'actions.
Les latents d'image et d'action alimentent un prédicteur causal avec six blocs de transformeurs. Les actions sont injectées via Adaptive LayerNorm Zero (AdaLN-Zero), qui produit des contrôles de décalage, d'échelle et de porte par branche (attention et MLP). La porte contrôle la force des mises à jour sur l'état prédit. Les poids commencent à zéro pour que le prédicteur apprenne progressivement.
Le prédicteur produit trois latents futurs prédits : ẑ₁, ẑ₂, ẑ₃. Ceux-ci sont comparés aux latents des trois vraies images suivantes en utilisant la perte MSE : L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Pour éviter l'effondrement de représentation, la régularisation SIGReg est ajoutée : L = L_pred + 0.1 * L_SIGReg.
Ce qui a fonctionné
- Le modèle s'est généralisé à des épisodes non vus.
- A utilisé efficacement les informations d'action.
- A prédit des futurs à cinq pas mieux que de fortes références.
- La planification sans récompense brute pouvait déplacer Mario à 2-5 pixels d'images objectifs proches.
Ce qui a échoué
- Lorsque les objectifs étaient placés plus loin dans le niveau, Mario ne pouvait pas sauter de manière fiable le premier obstacle majeur.
- Impossible de naviguer vers une seule image objectif lointaine.
- Conclusion : prédire le jeu ≠ apprendre à progresser. Le modèle a appris la dynamique au niveau des pixels mais pas la planification à long terme ni le comportement orienté vers un but.
Leçons Clés
Bai note que la plupart des leçons semblent évidentes a posteriori. L'écart entre la prédiction à court terme et la planification à long terme est critique — et n'est pas capturé par la perte de prédiction standard. L'article détaille des expériences qui ont progressivement révélé cette limitation.
📖 Lire la source complète : HN AI Agents
👀 See Also

Claude Code v2.1.81 ajoute l'option bare pour le scripting, corrige les problèmes d'authentification et de mode vocal.
Claude Code v2.1.81 introduit un drapeau --bare pour les appels scriptés -p qui ignore les crochets, LSP et la synchronisation des plugins, nécessitant ANTHROPIC_API_KEY ou apiKeyHelper via --settings. La version corrige également les problèmes d'authentification de sessions multiples simultanées, la gestion des erreurs en mode vocal, et ajoute la relance d'autorisation --channels.

Le tribunal du SDNY statue que les documents juridiques générés par l'IA ne sont pas protégés par le privilège
Le juge Jed S. Rakoff a statué que 31 documents générés à l'aide de l'outil d'IA Claude d'Anthropic n'étaient pas protégés par le secret professionnel avocat-client ou la doctrine du travail préparatoire, marquant ainsi la première décision judiciaire de ce type concernant des documents juridiques générés par IA.

Diagnostiquer la dérive opérationnelle et l'amnésie des tâches dans OpenClaw avec Gemini 2.5 Flash sur Proxmox
Les utilisateurs d'OpenClaw signalent des problèmes avec les flux de travail persistants sur une VM Proxmox, évoquant une dérive opérationnelle et une amnésie des tâches. Malgré des performances stables pour les tâches ponctuelles, le modèle Gemini 2.5 Flash rencontre des difficultés avec l'automatisation et la mémoire dans cette configuration.

Anthropic applique une politique : les utilisations tierces de Claude ne sont plus couvertes par les limites d'abonnement
Anthropic applique un changement de politique à partir du 4 avril, selon lequel les interfaces tierces comme OpenClaw ne puiseront plus dans les limites d'utilisation des abonnements Claude, obligeant les utilisateurs à activer une utilisation supplémentaire ou à annuler avant le 9 avril pour un remboursement.