LeMario: Treinando um Modelo Mundial JEPA em Super Mario Bros — Guia Técnico e Análise Pós-Morte

✍️ OpenClawRadar📅 Publicado: July 15, 2026🔗 Source
LeMario: Treinando um Modelo Mundial JEPA em Super Mario Bros — Guia Técnico e Análise Pós-Morte
Ad

O projeto LeMario de Benjamin Bai reproduz o LeWorldModel — uma pequena Arquitetura Preditiva de Embeddings Conjuntos (JEPA) — do zero e o treina no Super Mario Bros. A análise técnica detalhada cobre toda a arquitetura, configuração de treinamento e uma avaliação franca do que funcionou e do que não funcionou.

Visão Geral da Arquitetura

O modelo processa quatro quadros consecutivos de Mario. Um codificador visual comprime cada quadro em um vetor latente de 192 dimensões: z_t = E_θ(x_t), z_t ∈ R^192. As ações (estados dos botões para Esquerda, Direita, Cima, Baixo, A, B ao longo de cinco quadros do emulador) são codificadas separadamente em outro vetor de 192 dimensões por meio de um codificador de ações.

Os latentes de quadro e ação alimentam um preditor causal com seis blocos transformer. As ações são injetadas via Adaptive LayerNorm Zero (AdaLN-Zero), que produz controles de deslocamento, escala e porta por ramo (atenção e MLP). A porta controla a intensidade com que as atualizações afetam o estado previsto. Os pesos começam em zero, para que o preditor aprenda gradualmente.

O preditor gera três latentes futuros previstos: ẑ₁, ẑ₂, ẑ₃. Eles são comparados com os latentes dos três próximos quadros reais usando perda MSE: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Para evitar colapso de representação, a regularização SIGReg é adicionada: L = L_pred + 0.1 * L_SIGReg.

Ad

O que Funcionou

  • O modelo generalizou para episódios não vistos.
  • Usou informações de ação de forma eficaz.
  • Previu futuros de cinco passos melhor que linhas de base fortes.
  • O planejamento bruto sem recompensa conseguiu mover Mario dentro de 2 a 5 pixels de metas de imagem próximas.

O que Falhou

  • Quando as metas foram colocadas mais adiante no nível, Mario não conseguiu pular o primeiro obstáculo grande de forma confiável.
  • Não conseguiu navegar em direção a uma única meta de imagem distante.
  • Conclusão: prever o jogo ≠ aprender a progredir. O modelo aprendeu dinâmicas em nível de pixel, mas não planejamento de longo prazo ou comportamento direcionado a objetivos.

Lições Principais

Bai observa que a maioria das lições parece óbvia em retrospecto. A lacuna entre previsão de curto prazo e planejamento de longo prazo é crítica — e não é capturada pela perda de previsão padrão. O artigo detalha experimentos que gradualmente expuseram essa limitação.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Claude-Code v2.1.94 adiciona suporte ao Mantle e corrige bugs críticos
News

Claude-Code v2.1.94 adiciona suporte ao Mantle e corrige bugs críticos

O Claude-Code v2.1.94 introduz suporte ao Amazon Bedrock via Mantle com a variável de ambiente CLAUDE_CODE_USE_MANTLE=1, altera o nível de esforço padrão para alto para a maioria dos usuários e corrige mais de 15 bugs, incluindo tratamento de limites de taxa, problemas de login no macOS e problemas no sistema de plugins.

OpenClawRadar
Método Baseado em Gramática Iguala ou Supera IA em Análise de Autoria
News

Método Baseado em Gramática Iguala ou Supera IA em Análise de Autoria

Um estudo da Universidade de Manchester descobriu que o LambdaG, um método de análise de autoria baseado em gramática, igualou ou superou os principais sistemas de IA na maioria dos conjuntos de dados de teste, oferecendo maior transparência e menor custo computacional.

OpenClawRadar
Seis Paralelos Baseados em Pesquisa Entre Modos de Falha de LLM e Cognição no TDAH
News

Seis Paralelos Baseados em Pesquisa Entre Modos de Falha de LLM e Cognição no TDAH

Um desenvolvedor com TDAH identifica seis paralelos entre os padrões de falha de LLMs e a ciência cognitiva do TDAH, respaldados por pesquisas independentes sobre processamento associativo, confabulação, limitações da memória de trabalho, completamento de padrões, dependência de estrutura e continuidade de linha de pensamento.

OpenClawRadar
Claude Code v2.1.215: /verify e /code-review Não São Mais Automáticos
News

Claude Code v2.1.215: /verify e /code-review Não São Mais Automáticos

Claude Code v2.1.215 para de executar automaticamente as habilidades /verify e /code-review. Você deve invocá-las explicitamente com /verify ou /code-review quando necessário.

OpenClawRadar