Atlas: World Labs' Omni-Weltmodell für räumliche Intelligenz
World Labs hat Atlas vorgestellt, ein "Omni-World-Modell" für räumliche Intelligenz. Atlas ist von Grund auf vortrainiert, um nativ mit Text, Bildern, Videos und 3D zu arbeiten und alle Eingaben in einen gemeinsamen räumlichen Kontext zu integrieren. Es ist ein multimodaler autoregressiver Diffusionstransformator, der Ausgaben erzeugt, die mit der gesehenen 3D-Geometrie konsistent sind, und sogar über die Eingabeframes hinaus vorstellen kann, was dahinter liegt.
Was Atlas kann
Atlas ist darauf ausgelegt, drei Kernaufgaben zu bewältigen: Welterzeugung, Rekonstruktion und Simulation.
Kameragesteuerte Generierung
Atlas erzeugt Bilder und Videos aus ein bis sechs Referenzbildern mit präziser Kamerasteuerung. Sie geben den Kamerapfad vor – keine textbasierten Eingabeaufforderungen erforderlich. Es liefert bis zu 1 Minute Video in 1440p. Aus einem einzelnen Bild kann es nicht sichtbare Teile einer Szene extrapolieren (z.B. die Rückseite eines Roboters, einen Rasen neben einem Pool).
Räumliche Rekonstruktion
Atlas rekonstruiert reale Szenen aus ein bis Dutzenden Eingabebildern. Laut World Labs übertrifft es hochmoderne 3D-Rekonstruktionsmodelle und erzeugt sowohl neue Ansichtsbilder als auch explizite 3D-Ausgaben. Dies ist ein Fortschritt bei dem jahrzehntealten Problem der Neuansichtssynthese aus spärlichen Bildern.
Raum-Zeit-Simulation
Atlas modelliert Raum und Zeit aus Eingabevideos. Es kann Videos für visuelle Effekte neu einrahmen und unterstützt Real-to-Sim-Workflows für Robotik.
Bildgenerierung
Aus Text kann Atlas Bilder und 360-Grad-Panoramen erzeugen, komplexe Eingabeaufforderungen befolgen und Text in einer Vielzahl von visuellen Stilen rendern.
Wichtige technische Details
Das Modell funktioniert, indem es Eingaben in einen "räumlichen Kontext" codiert – jedes Bild wird an einer 3D-Position verankert. Dieser Kontext ermöglicht es, unzusammenhängende Bilder an beliebigen 3D-Positionen zu platzieren, und Atlas erzeugt eine Welt, die zwischen ihnen interpoliert (sich Türen, Flure usw. vorstellt). Dies ermöglicht lange, steuerbare Videos: "Sie inszenieren die Szene, nicht ziehen am Hebel eines Spielautomaten."
Für wen es gedacht ist
Entwickler, die in der 3D-Inhaltserstellung, Robotiksimulation oder für alle, die steuerbare Videogenerierung aus spärlichen Bildeingaben benötigen. Atlas wird zukünftige Versionen des Marble-Produkts von World Labs unterstützen. Früher Zugang ist auf der World Labs-Website verfügbar.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Relay: Open-Source-Steuerungsebene für OpenClaw-KI-Agenten
Relay ist eine Electron-Desktop-App, die einen Claude-Cowork-ähnlichen Workflow für OpenClaw bietet, auf Ihrer Infrastruktur läuft, Ihre Wahl von LLM-Modellen unterstützt und integrierte Governance-Funktionen wie Freigabeschleusen und exportierbare Prüfpfade umfasst.

Behebung von Kontextaufblähung im Auto-Memory von Claude Code durch ein Benennungsschema und ein Audit-Skript
Eine Claude Code Skill erzwingt ein 3-Typen-Benennungsschema, erforderliche Frontmatter und ein Bash-Audit-Skript zur Deduplizierung von Speicherdateien und Reduzierung der Kontextlast.

Intuno: Open-Sourced Network for AI Agent Discovery and Communication
Intuno ist ein Open-Source-Netzwerk, in dem KI-Agenten ihre Fähigkeiten registrieren, sich gegenseitig über semantische Suche entdecken und Funktionen mit nur drei Zeilen Python-Code aufrufen können. Es beinhaltet MCP-Integration zur Nutzung mit Claude Desktop oder Cursor.

Clawpage: Ein Werkzeug, das OpenClaw-Konversationen in statische Websites umwandelt
Ein Entwickler hat Clawpage erstellt, eine Funktion, die den OpenClaw-Sitzungsverlauf in statische Webseiten umwandelt, um wertvolle Gespräche zu bewahren, einschließlich des Hin und Her, der Recherche und des Debugging-Prozesses. Das Tool ist auf GitHub verfügbar.