LeMario: Entrenando un modelo mundial JEPA en Super Mario Bros — Guía técnica y análisis posterior

El proyecto LeMario de Benjamin Bai reproduce LeWorldModel — una pequeña Arquitectura Predictiva de Incrustación Conjunta (JEPA) — desde cero y lo entrena en Super Mario Bros. El recorrido técnico detallado cubre la arquitectura completa, la configuración de entrenamiento y una autopsia franca de lo que funcionó y lo que no.
Resumen de la Arquitectura
El modelo procesa cuatro fotogramas consecutivos de Mario. Un codificador visual comprime cada fotograma en un vector latente de 192 dimensiones: z_t = E_θ(x_t), z_t ∈ R^192. Las acciones (estados de botones para Izquierda, Derecha, Arriba, Abajo, A, B a lo largo de cinco fotogramas del emulador) se codifican por separado en otro vector de 192 dimensiones mediante un codificador de acciones.
Los latentes de fotogramas y acciones alimentan un predictor causal con seis bloques transformer. Las acciones se inyectan mediante Adaptive LayerNorm Zero (AdaLN-Zero), que produce controles de desplazamiento, escala y compuerta por rama (atención y MLP). La compuerta controla cuán fuertemente las actualizaciones afectan el estado predicho. Los pesos comienzan en cero para que el predictor aprenda gradualmente.
El predictor genera tres latentes futuros predichos: ẑ₁, ẑ₂, ẑ₃. Estos se comparan con los latentes de los tres fotogramas reales siguientes utilizando pérdida MSE: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Para evitar el colapso de representación, se añade regularización SIGReg: L = L_pred + 0.1 * L_SIGReg.
Lo que Funcionó
- El modelo generalizó a episodios no vistos.
- Utilizó la información de acción de manera efectiva.
- Predijo futuros de cinco pasos mejor que líneas base sólidas.
- La planificación cruda sin recompensa podía mover a Mario dentro de 2-5 píxeles de objetivos de imagen cercanos.
Lo que Falló
- Cuando los objetivos se colocaban más lejos en el nivel, Mario no podía saltar de manera confiable el primer obstáculo importante.
- No podía navegar hacia una sola imagen de objetivo distante.
- Conclusión: predecir el juego ≠ aprender a progresar. El modelo aprendió dinámicas a nivel de píxel, pero no planificación a largo plazo ni comportamiento orientado a objetivos.
Lecciones Clave
Bai señala que la mayoría de las lecciones parecen obvias en retrospectiva. La brecha entre la predicción a corto plazo y la planificación a largo plazo es crítica — y no se captura con la pérdida de predicción estándar. El artículo detalla experimentos que gradualmente expusieron esta limitación.
📖 Lea la fuente completa: HN AI Agents
👀 Ver también

El Desarrollo de LibreOffice Online se Reanuda Tras la Votación de la Comunidad
The Document Foundation ha reanudado el trabajo en LibreOffice Online después de que una votación comunitaria anuló la congelación de 2022. TDF reabrirá el repositorio para contribuciones, pero no alojará servidores; en su lugar, proporcionará herramientas que los usuarios puedan alojar por sí mismos.

Anthropic bloquea el uso de arneses de terceros en los límites de suscripción de Claude, pero hay una solución disponible.
Anthropic ha restringido el acceso de herramientas de terceros a los límites de suscripción de Claude, lo que podría interrumpir flujos de trabajo que dependen de estas herramientas. Un usuario de Reddit informa haber desarrollado una solución de código abierto tras casi perder meses de datos de entrenamiento.

Usuario de Reddit informa 18.8 tok/s en inferencia por CPU con Qwen 3 30B Q4 en Zen 4.
Un usuario en r/LocalLLaMA probó Qwen 3 30B Q4 en CPU y logró 18.8 tokens por segundo con un procesador Zen 4 y memoria DDR5, superando significativamente las expectativas de 3-5 tok/s.

Críticos de arte IA no logran identificar pintura real de Monet, revelando crítica hueca
Un usuario publicó una pintura real de Monet como generada por IA, y los críticos escribieron análisis detallados de sus "defectos", destacando la brecha entre la crítica segura y la comprensión real del arte de IA vs. humano.