LeMario: Training eines JEPA-Weltmodells mit Super Mario Bros — Technischer Leitfaden und Nachbetrachtung

Benjamin Bais LeMario-Projekt reproduziert LeWorldModel – eine kleine Joint-Embedding Predictive Architecture (JEPA) – von Grund auf und trainiert sie auf Super Mario Bros. Die detaillierte technische Beschreibung umfasst die vollständige Architektur, das Training und eine ehrliche Nachlese zu dem, was funktioniert hat und was nicht.
Architekturübersicht
Das Modell verarbeitet vier aufeinanderfolgende Mario-Bilder. Ein Vision-Encoder komprimiert jedes Bild in einen 192-dimensionalen latenten Vektor: z_t = E_θ(x_t), z_t ∈ R^192. Aktionen (Tastenzustände für Links, Rechts, Hoch, Runter, A, B über fünf Emulator-Frames) werden separat über einen Aktions-Encoder in einen weiteren 192-dimensionalen Vektor kodiert.
Die Bild- und Aktions-Latenten werden in einen kausalen Prädiktor mit sechs Transformer-Blöcken eingespeist. Aktionen werden über Adaptive LayerNorm Zero (AdaLN-Zero) injiziert, das pro Zweig (Attention und MLP) Verschiebungs-, Skalierungs- und Gate-Steuerungen erzeugt. Das Gate steuert, wie stark Aktualisierungen den vorhergesagten Zustand beeinflussen. Die Gewichte beginnen bei Null, sodass der Prädiktor allmählich lernt.
Der Prädiktor gibt drei vorhergesagte zukünftige Latenten aus: ẑ₁, ẑ₂, ẑ₃. Diese werden mit den Latenten der drei tatsächlichen nächsten Bilder mittels MSE-Verlust verglichen: L_pred = MSE([ẑ₁,ẑ₂,ẑ₃], [z₁,z₂,z₃]). Um einen Repräsentationskollaps zu verhindern, wird SIGReg-Regularisierung hinzugefügt: L = L_pred + 0,1 * L_SIGReg.
Was funktioniert hat
- Das Modell generalisierte auf nicht gesehene Episoden.
- Es nutzte Aktionsinformationen effektiv.
- Es sagte zukünftige fünf Schritte besser voraus als starke Baselines.
- Rohe belohnungsfreie Planung konnte Mario innerhalb von 2–5 Pixeln an nahegelegene Bildziele bewegen.
Was scheiterte
- Wenn Ziele weiter im Level platziert wurden, konnte Mario nicht zuverlässig über das erste große Hindernis springen.
- Er konnte nicht zu einem einzelnen entfernten Zielbild navigieren.
- Fazit: Das Spiel vorherzusagen bedeutet nicht, Fortschritt zu lernen. Das Modell lernte Pixel-Dynamiken, aber keine langfristige Planung oder zielgerichtetes Verhalten.
Wichtige Erkenntnisse
Bai merkt an, dass die meisten Lehren im Nachhinein offensichtlich erscheinen. Die Lücke zwischen kurzfristiger Vorhersage und langfristiger Planung ist entscheidend – und wird durch den standardmäßigen Vorhersageverlust nicht erfasst. Der Beitrag beschreibt Experimente, die diese Einschränkung schrittweise aufdeckten.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Claude fügt Gesprächen interaktive Diagramme und Grafiken direkt im Text hinzu.
Claude erstellt jetzt benutzerdefinierte Diagramme, Grafiken und Visualisierungen direkt in Chat-Konversationen, sodass Nutzer Visualisierungen anpassen und verändern können, während sich Diskussionen entwickeln. Die Funktion ist in der Beta-Version für alle Tariftypen verfügbar und erscheint inline anstatt in Seitenleisten.

Samsung-Mitarbeiter fordern Anteil an KI-Chip-Gewinnen — Was Entwickler wissen müssen
Samsungs Arbeitsabkommen setzt einen Präzedenzfall: 10,5 % des operativen Gewinns der Halbleitersparte fließen in Boni. Eine breitere Bewegung von Arbeitnehmern entlang der KI-Lieferkette fordert einen Anteil an den Rekordgewinnen.

Analyse: Die tatsächlichen Rechenkosten von Anthropic für Claude Code-Nutzer liegen weit unter dem genannten Betrag von 5.000 US-Dollar.
Ein kürzlicher Artikel analysiert die Behauptung, dass Anthropics 200-Dollar-pro-Monat-Plan 'Claude Code Max' 5.000 Dollar an Rechenleistung verbraucht, und stellt fest, dass die tatsächlichen Inferenzkosten bei einem Vergleich mit wettbewerbsfähigen Open-Weight-Modellen auf OpenRouter etwa 10 % der API-Preise ausmachen.

OpenAI entwickelt laut Reuters-Bericht eine GitHub-Alternative
Reuters berichtet, dass OpenAI eine Alternative zu Microsofts GitHub entwickelt, wobei die Geschichte auf Hacker News 35 Punkte und 12 Kommentare erhielt.