LeMario: Treinando um Modelo Mundial JEPA em Super Mario Bros — Guia Técnico e Análise Pós-Morte

O projeto LeMario de Benjamin Bai reproduz o LeWorldModel — uma pequena Arquitetura Preditiva de Embeddings Conjuntos (JEPA) — do zero e o treina no Super Mario Bros. A análise técnica detalhada cobre toda a arquitetura, configuração de treinamento e uma avaliação franca do que funcionou e do que não funcionou.
Visão Geral da Arquitetura
O modelo processa quatro quadros consecutivos de Mario. Um codificador visual comprime cada quadro em um vetor latente de 192 dimensões: z_t = E_θ(x_t), z_t ∈ R^192. As ações (estados dos botões para Esquerda, Direita, Cima, Baixo, A, B ao longo de cinco quadros do emulador) são codificadas separadamente em outro vetor de 192 dimensões por meio de um codificador de ações.
Os latentes de quadro e ação alimentam um preditor causal com seis blocos transformer. As ações são injetadas via Adaptive LayerNorm Zero (AdaLN-Zero), que produz controles de deslocamento, escala e porta por ramo (atenção e MLP). A porta controla a intensidade com que as atualizações afetam o estado previsto. Os pesos começam em zero, para que o preditor aprenda gradualmente.
O preditor gera três latentes futuros previstos: ẑ₁, ẑ₂, ẑ₃. Eles são comparados com os latentes dos três próximos quadros reais usando perda MSE: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Para evitar colapso de representação, a regularização SIGReg é adicionada: L = L_pred + 0.1 * L_SIGReg.
O que Funcionou
- O modelo generalizou para episódios não vistos.
- Usou informações de ação de forma eficaz.
- Previu futuros de cinco passos melhor que linhas de base fortes.
- O planejamento bruto sem recompensa conseguiu mover Mario dentro de 2 a 5 pixels de metas de imagem próximas.
O que Falhou
- Quando as metas foram colocadas mais adiante no nível, Mario não conseguiu pular o primeiro obstáculo grande de forma confiável.
- Não conseguiu navegar em direção a uma única meta de imagem distante.
- Conclusão: prever o jogo ≠ aprender a progredir. O modelo aprendeu dinâmicas em nível de pixel, mas não planejamento de longo prazo ou comportamento direcionado a objetivos.
Lições Principais
Bai observa que a maioria das lições parece óbvia em retrospecto. A lacuna entre previsão de curto prazo e planejamento de longo prazo é crítica — e não é capturada pela perda de previsão padrão. O artigo detalha experimentos que gradualmente expuseram essa limitação.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Claude-Code v2.1.94 adiciona suporte ao Mantle e corrige bugs críticos
O Claude-Code v2.1.94 introduz suporte ao Amazon Bedrock via Mantle com a variável de ambiente CLAUDE_CODE_USE_MANTLE=1, altera o nível de esforço padrão para alto para a maioria dos usuários e corrige mais de 15 bugs, incluindo tratamento de limites de taxa, problemas de login no macOS e problemas no sistema de plugins.

Método Baseado em Gramática Iguala ou Supera IA em Análise de Autoria
Um estudo da Universidade de Manchester descobriu que o LambdaG, um método de análise de autoria baseado em gramática, igualou ou superou os principais sistemas de IA na maioria dos conjuntos de dados de teste, oferecendo maior transparência e menor custo computacional.

Seis Paralelos Baseados em Pesquisa Entre Modos de Falha de LLM e Cognição no TDAH
Um desenvolvedor com TDAH identifica seis paralelos entre os padrões de falha de LLMs e a ciência cognitiva do TDAH, respaldados por pesquisas independentes sobre processamento associativo, confabulação, limitações da memória de trabalho, completamento de padrões, dependência de estrutura e continuidade de linha de pensamento.

Claude Code v2.1.215: /verify e /code-review Não São Mais Automáticos
Claude Code v2.1.215 para de executar automaticamente as habilidades /verify e /code-review. Você deve invocá-las explicitamente com /verify ou /code-review quando necessário.