LeMario: Entrenando un modelo mundial JEPA en Super Mario Bros — Guía técnica y análisis posterior

El proyecto LeMario de Benjamin Bai reproduce LeWorldModel — una pequeña Arquitectura Predictiva de Incrustación Conjunta (JEPA) — desde cero y lo entrena en Super Mario Bros. El recorrido técnico detallado cubre la arquitectura completa, la configuración de entrenamiento y una autopsia franca de lo que funcionó y lo que no.
Resumen de la Arquitectura
El modelo procesa cuatro fotogramas consecutivos de Mario. Un codificador visual comprime cada fotograma en un vector latente de 192 dimensiones: z_t = E_θ(x_t), z_t ∈ R^192. Las acciones (estados de botones para Izquierda, Derecha, Arriba, Abajo, A, B a lo largo de cinco fotogramas del emulador) se codifican por separado en otro vector de 192 dimensiones mediante un codificador de acciones.
Los latentes de fotogramas y acciones alimentan un predictor causal con seis bloques transformer. Las acciones se inyectan mediante Adaptive LayerNorm Zero (AdaLN-Zero), que produce controles de desplazamiento, escala y compuerta por rama (atención y MLP). La compuerta controla cuán fuertemente las actualizaciones afectan el estado predicho. Los pesos comienzan en cero para que el predictor aprenda gradualmente.
El predictor genera tres latentes futuros predichos: ẑ₁, ẑ₂, ẑ₃. Estos se comparan con los latentes de los tres fotogramas reales siguientes utilizando pérdida MSE: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Para evitar el colapso de representación, se añade regularización SIGReg: L = L_pred + 0.1 * L_SIGReg.
Lo que Funcionó
- El modelo generalizó a episodios no vistos.
- Utilizó la información de acción de manera efectiva.
- Predijo futuros de cinco pasos mejor que líneas base sólidas.
- La planificación cruda sin recompensa podía mover a Mario dentro de 2-5 píxeles de objetivos de imagen cercanos.
Lo que Falló
- Cuando los objetivos se colocaban más lejos en el nivel, Mario no podía saltar de manera confiable el primer obstáculo importante.
- No podía navegar hacia una sola imagen de objetivo distante.
- Conclusión: predecir el juego ≠ aprender a progresar. El modelo aprendió dinámicas a nivel de píxel, pero no planificación a largo plazo ni comportamiento orientado a objetivos.
Lecciones Clave
Bai señala que la mayoría de las lecciones parecen obvias en retrospectiva. La brecha entre la predicción a corto plazo y la planificación a largo plazo es crítica — y no se captura con la pérdida de predicción estándar. El artículo detalla experimentos que gradualmente expusieron esta limitación.
📖 Lea la fuente completa: HN AI Agents
👀 Ver también

La Funcionalidad de Huevo de Pascua /buddy de Claude Code y las Solicitudes de Funciones de los Usuarios
Claude Code incluye un comando oculto /buddy que crea un compañero al estilo Tamagotchi con especie, estadísticas y comentarios decorativos. Un suscriptor Max con más de 840 sesiones ha detallado las limitaciones actuales y propuesto mejoras funcionales.

Anthropic restringe las suscripciones a Claude desde plataformas de terceros como OpenClaw.
Anthropic dejará de cubrir las suscripciones de Claude para herramientas de terceros como OpenClaw a partir del 4 de abril. Los usuarios deberán habilitar el uso adicional de pago por uso facturado por separado, con un crédito único equivalente al precio de la suscripción mensual disponible hasta el 17 de abril.

Colaborador de OpenClaw critica el enfoque del proyecto en la paridad pixel-perfect por sobre características modernas.
Una publicación de Reddit en r/openclaw detalla cómo una solicitud de extracción (PR) de un colaborador que abordaba el escalado de resolución y la compatibilidad con altas tasas de refresco fue rechazada por desviarse de las limitaciones visuales del motor original, generando un debate sobre la dirección del proyecto.

Caos de la prohibición de exportación de la mitología/fábula de Anthropic: La economía rota de la IA
El modelo Mythos de Anthropic, considerado 'demasiado peligroso para publicarse', fue vulnerado en cuestión de días, lo que llevó a controles de exportación de EE.UU. que prohíben el acceso a ciudadanos no estadounidenses. Las barreras de seguridad de Fable fallaron cuando investigadores de Amazon las rompieron, desencadenando una reversión por seguridad nacional.