LeMario: Entrenando un modelo mundial JEPA en Super Mario Bros — Guía técnica y análisis posterior

✍️ OpenClawRadar📅 Publicado: 15 de julio de 2026🔗 Source
LeMario: Entrenando un modelo mundial JEPA en Super Mario Bros — Guía técnica y análisis posterior
Ad

El proyecto LeMario de Benjamin Bai reproduce LeWorldModel — una pequeña Arquitectura Predictiva de Incrustación Conjunta (JEPA) — desde cero y lo entrena en Super Mario Bros. El recorrido técnico detallado cubre la arquitectura completa, la configuración de entrenamiento y una autopsia franca de lo que funcionó y lo que no.

Resumen de la Arquitectura

El modelo procesa cuatro fotogramas consecutivos de Mario. Un codificador visual comprime cada fotograma en un vector latente de 192 dimensiones: z_t = E_θ(x_t), z_t ∈ R^192. Las acciones (estados de botones para Izquierda, Derecha, Arriba, Abajo, A, B a lo largo de cinco fotogramas del emulador) se codifican por separado en otro vector de 192 dimensiones mediante un codificador de acciones.

Los latentes de fotogramas y acciones alimentan un predictor causal con seis bloques transformer. Las acciones se inyectan mediante Adaptive LayerNorm Zero (AdaLN-Zero), que produce controles de desplazamiento, escala y compuerta por rama (atención y MLP). La compuerta controla cuán fuertemente las actualizaciones afectan el estado predicho. Los pesos comienzan en cero para que el predictor aprenda gradualmente.

El predictor genera tres latentes futuros predichos: ẑ₁, ẑ₂, ẑ₃. Estos se comparan con los latentes de los tres fotogramas reales siguientes utilizando pérdida MSE: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Para evitar el colapso de representación, se añade regularización SIGReg: L = L_pred + 0.1 * L_SIGReg.

Ad

Lo que Funcionó

  • El modelo generalizó a episodios no vistos.
  • Utilizó la información de acción de manera efectiva.
  • Predijo futuros de cinco pasos mejor que líneas base sólidas.
  • La planificación cruda sin recompensa podía mover a Mario dentro de 2-5 píxeles de objetivos de imagen cercanos.

Lo que Falló

  • Cuando los objetivos se colocaban más lejos en el nivel, Mario no podía saltar de manera confiable el primer obstáculo importante.
  • No podía navegar hacia una sola imagen de objetivo distante.
  • Conclusión: predecir el juego ≠ aprender a progresar. El modelo aprendió dinámicas a nivel de píxel, pero no planificación a largo plazo ni comportamiento orientado a objetivos.

Lecciones Clave

Bai señala que la mayoría de las lecciones parecen obvias en retrospectiva. La brecha entre la predicción a corto plazo y la planificación a largo plazo es crítica — y no se captura con la pérdida de predicción estándar. El artículo detalla experimentos que gradualmente expusieron esta limitación.

📖 Lea la fuente completa: HN AI Agents

Ad

👀 Ver también

Claude Code 2.1.136: Seguridad de Acción, Reglas de Denegación Estricta y Monitor de Seguridad
Noticias

Claude Code 2.1.136: Seguridad de Acción, Reglas de Denegación Estricta y Monitor de Seguridad

Claude Code CC 2.1.136 agrega seguridad en las acciones y requisitos de informes veraces, introduce hard_deny como una cuarta categoría de reglas personalizadas y divide el bloqueo de seguridad en bloqueos duros incondicionales y bloqueos suaves autorizables por el usuario.

OpenClawRadar
Perros Robot con Inteligencia Artificial Desplegados para Vigilancia en Atlanta
Noticias

Perros Robot con Inteligencia Artificial Desplegados para Vigilancia en Atlanta

Perros robot de cuatro patas equipados con cámaras e IA están patrullando las calles, apartamentos y sitios de construcción de Atlanta, transmitiendo video de 360° a operadores remotos las 24 horas del día, los 7 días de la semana, como una alternativa más económica a los guardias humanos.

OpenClawRadar
Claude Code v2.1.73: Anulaciones de Modelo, Correcciones de Estabilidad y Mejoras de Rendimiento
Noticias

Claude Code v2.1.73: Anulaciones de Modelo, Correcciones de Estabilidad y Mejoras de Rendimiento

Claude Code v2.1.73 agrega modelOverrides para IDs de proveedores personalizados, corrige bloqueos críticos y puntos muertos, resuelve degradaciones de modelos de subagentes y mejora la estabilidad del modo de voz. La versión aborda 18 problemas específicos, incluyendo solicitudes de permisos de comandos bash, corrupción de sesiones y fallos del sandbox de Linux.

OpenClawRadar
Resumen Diario de Claude: Lanzamiento de la función /dream, Reacción Negativa a los Límites de Uso y Herramienta de Accesibilidad
Noticias

Resumen Diario de Claude: Lanzamiento de la función /dream, Reacción Negativa a los Límites de Uso y Herramienta de Accesibilidad

Anthropic lanzó la función /dream para el sistema de Memoria Automática de Claude, mientras la comunidad enfrenta quejas por límites de uso y un desarrollador sordo creó un complemento de notificación flash en terminal para Claude Code.

OpenClawRadar