LeMario: 슈퍼 마리오 브라더스에서 JEPA 세계 모델 훈련 — 기술적 워크스루 및 사후 분석

✍️ OpenClawRadar📅 게시일: July 15, 2026🔗 Source
LeMario: 슈퍼 마리오 브라더스에서 JEPA 세계 모델 훈련 — 기술적 워크스루 및 사후 분석
Ad

Benjamin Bai의 LeMario 프로젝트는 LeWorldModel — 소규모 JEPA(Joint-Embedding Predictive Architecture) — 을 처음부터 재현하여 Super Mario Bros에서 훈련합니다. 상세한 기술 워크스루는 전체 아키텍처, 훈련 설정, 그리고 작동한 것과 작동하지 않은 것에 대한 솔직한 포스트모템을 다룹니다.

아키텍처 개요

모델은 연속된 네 개의 마리오 프레임을 처리합니다. 비전 인코더는 각 프레임을 192차원 잠재 벡터로 압축합니다: z_t = E_θ(x_t), z_t ∈ R^192. 액션(다섯 에뮬레이터 프레임 동안 Left, Right, Up, Down, A, B 버튼 상태)은 액션 인코더를 통해 별도로 192차원 벡터로 인코딩됩니다.

프레임과 액션 잠재는 6개의 트랜스포머 블록을 가진 인과적 예측기에 공급됩니다. 액션은 Adaptive LayerNorm Zero(AdaLN-Zero)를 통해 주입되며, 이는 어텐션과 MLP 각 분기별로 shift, scale, gate 제어를 생성합니다. Gate는 업데이트가 예측된 상태에 얼마나 강하게 영향을 미치는지 제어합니다. 가중치는 0에서 시작하여 예측기가 점진적으로 학습합니다.

예측기는 세 개의 예측된 미래 잠재를 출력합니다: ẑ₁, ẑ₂, ẑ₃. 이들은 세 개의 실제 다음 프레임의 잠재와 MSE 손실을 사용하여 비교됩니다: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). 표현 붕괴를 방지하기 위해 SIGReg 정규화가 추가됩니다: L = L_pred + 0.1 * L_SIGReg.

Ad

작동한 것

  • 모델이 보이지 않는 에피소드에 일반화되었습니다.
  • 액션 정보를 효과적으로 사용했습니다.
  • 강력한 기준선보다 5단계 미래를 더 잘 예측했습니다.
  • 원시 보상 없는 계획으로 마리오를 가까운 이미지 목표까지 2-5픽셀 이내로 이동시킬 수 있었습니다.

실패한 것

  • 목표가 레벨의 더 먼 곳에 배치되면 마리오가 첫 번째 주요 장애물을 안정적으로 점프하지 못했습니다.
  • 단일 먼 목표 이미지를 향해 탐색할 수 없었습니다.
  • 결론: 게임 예측 ≠ 진행 학습. 모델은 픽셀 수준의 역학을 학습했지만 장기 계획이나 목표 지향 행동은 학습하지 못했습니다.

주요 교훈

Bai는 대부분의 교훈이 나중에 보면 당연해 보인다고 언급합니다. 단기 예측과 장기 계획 사이의 격차는 중요하며, 표준 예측 손실로는 포착되지 않습니다. 게시물에서는 이 한계를 점진적으로 드러낸 실험들을 자세히 설명합니다.

📖 전체 원문 읽기: HN AI Agents

Ad

👀 See Also

클로드 맥스 20배 플랜: 발표에도 불구하고 한도 증가 미적용 — 사용자가 수학으로 확인하다
News

클로드 맥스 20배 플랜: 발표에도 불구하고 한도 증가 미적용 — 사용자가 수학으로 확인하다

월 200달러를 지불하는 Claude Max 20x 사용자가 Anthropic이 발표한 2배 세션 제한과 1.5배 주간 제한 증가가 자신의 계정에 적용되지 않았다고 보고했습니다. 수학적 증거를 제시하고 완전한 지원 응답 부재를 공유합니다.

OpenClawRadar
Kimi 2.5 및 Opus 4.6의 구성 변경
News

Kimi 2.5 및 Opus 4.6의 구성 변경

사용자가 Kimi 2.5의 성능을 평가하며, 특히 구성 변경 관리 능력에 초점을 맞추고 있습니다. 기본 설정에서는 Kimi 2.5를 사용하며, 이는 특정 작업을 위해 별도의 모델에 연결된 서브에이전트를 동적으로 생성합니다.

OpenClawRadar
메타 오픈엔브 AI 해커톤 인도 개최, 직접 인터뷰 기회와 3만 달러 상금 풀 제공
News

메타 오픈엔브 AI 해커톤 인도 개최, 직접 인터뷰 기회와 3만 달러 상금 풀 제공

메타가 허깅 페이스와 파이토치와 협력하여 인도 최초의 OpenEnv AI 해커톤을 개최합니다. 개발자들은 AI 에이전트를 위한 강화 학습 환경을 구축하게 됩니다. 상위 팀은 메타와 허깅 페이스 AI 팀과의 직접 인터뷰 기회와 함께 30,000달러의 상금 풀을 획득합니다.

OpenClawRadar
메타, AI 훈련을 위해 직원의 마우스 움직임과 키 입력을 수집할 예정
News

메타, AI 훈련을 위해 직원의 마우스 움직임과 키 입력을 수집할 예정

로이터 보도에 따르면, 메타는 AI 학습 데이터를 위해 직원의 마우스 움직임과 키 입력을 포착하기 시작할 계획입니다. 이 기사는 해커 뉴스에서 33점과 7개의 댓글을 얻으며 논의를 불러일으켰습니다.

OpenClawRadar