LeMario: Treinando um Modelo Mundial JEPA em Super Mario Bros — Guia Técnico e Análise Pós-Morte

O projeto LeMario de Benjamin Bai reproduz o LeWorldModel — uma pequena Arquitetura Preditiva de Embeddings Conjuntos (JEPA) — do zero e o treina no Super Mario Bros. A análise técnica detalhada cobre toda a arquitetura, configuração de treinamento e uma avaliação franca do que funcionou e do que não funcionou.
Visão Geral da Arquitetura
O modelo processa quatro quadros consecutivos de Mario. Um codificador visual comprime cada quadro em um vetor latente de 192 dimensões: z_t = E_θ(x_t), z_t ∈ R^192. As ações (estados dos botões para Esquerda, Direita, Cima, Baixo, A, B ao longo de cinco quadros do emulador) são codificadas separadamente em outro vetor de 192 dimensões por meio de um codificador de ações.
Os latentes de quadro e ação alimentam um preditor causal com seis blocos transformer. As ações são injetadas via Adaptive LayerNorm Zero (AdaLN-Zero), que produz controles de deslocamento, escala e porta por ramo (atenção e MLP). A porta controla a intensidade com que as atualizações afetam o estado previsto. Os pesos começam em zero, para que o preditor aprenda gradualmente.
O preditor gera três latentes futuros previstos: ẑ₁, ẑ₂, ẑ₃. Eles são comparados com os latentes dos três próximos quadros reais usando perda MSE: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Para evitar colapso de representação, a regularização SIGReg é adicionada: L = L_pred + 0.1 * L_SIGReg.
O que Funcionou
- O modelo generalizou para episódios não vistos.
- Usou informações de ação de forma eficaz.
- Previu futuros de cinco passos melhor que linhas de base fortes.
- O planejamento bruto sem recompensa conseguiu mover Mario dentro de 2 a 5 pixels de metas de imagem próximas.
O que Falhou
- Quando as metas foram colocadas mais adiante no nível, Mario não conseguiu pular o primeiro obstáculo grande de forma confiável.
- Não conseguiu navegar em direção a uma única meta de imagem distante.
- Conclusão: prever o jogo ≠ aprender a progredir. O modelo aprendeu dinâmicas em nível de pixel, mas não planejamento de longo prazo ou comportamento direcionado a objetivos.
Lições Principais
Bai observa que a maioria das lições parece óbvia em retrospecto. A lacuna entre previsão de curto prazo e planejamento de longo prazo é crítica — e não é capturada pela perda de previsão padrão. O artigo detalha experimentos que gradualmente expuseram essa limitação.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Explorando o Flash da Etapa 3.5: Modelo de Código Aberto para Raciocínio Profundo Rápido
O Step 3.5 Flash é um modelo de base de código aberto projetado para raciocínio profundo rápido e eficiente, utilizando uma arquitetura esparsa de Mistura de Especialistas.

Classificações da Claude App Store em 7 Países
Claude ficou em #1 nos EUA e Canadá, #3 na França e Alemanha, #4 no Reino Unido, #8 na Itália e #22 no Japão nas classificações de aplicativos gratuitos da App Store capturadas simultaneamente em 1º de março de 2026 às 09:00 UTC.

IA Não Deletou Seu Banco de Dados — Você Deletou: Responsabilidade na Era dos Agentes de Codificação de IA
Uma história viral culpou um agente de IA por deletar um banco de dados de produção, mas o verdadeiro problema é expor endpoints de API destrutivos e a falta de processo — não a ferramenta.

Meta OpenEnv AI Hackathon na Índia Oferece Entrevistas Diretas e Prêmio de US$ 30 Mil
A Meta está organizando o primeiro Hackathon OpenEnv AI da Índia em colaboração com a Hugging Face e a PyTorch, onde desenvolvedores construirão ambientes de aprendizado por reforço para agentes de IA. As melhores equipes recebem entrevistas diretas com as equipes de IA da Meta e da Hugging Face, além de um prêmio total de US$ 30.000.