Atlas: World Labs' Omni-Weltmodell für räumliche Intelligenz
World Labs hat Atlas vorgestellt, ein "Omni-World-Modell" für räumliche Intelligenz. Atlas ist von Grund auf vortrainiert, um nativ mit Text, Bildern, Videos und 3D zu arbeiten und alle Eingaben in einen gemeinsamen räumlichen Kontext zu integrieren. Es ist ein multimodaler autoregressiver Diffusionstransformator, der Ausgaben erzeugt, die mit der gesehenen 3D-Geometrie konsistent sind, und sogar über die Eingabeframes hinaus vorstellen kann, was dahinter liegt.
Was Atlas kann
Atlas ist darauf ausgelegt, drei Kernaufgaben zu bewältigen: Welterzeugung, Rekonstruktion und Simulation.
Kameragesteuerte Generierung
Atlas erzeugt Bilder und Videos aus ein bis sechs Referenzbildern mit präziser Kamerasteuerung. Sie geben den Kamerapfad vor – keine textbasierten Eingabeaufforderungen erforderlich. Es liefert bis zu 1 Minute Video in 1440p. Aus einem einzelnen Bild kann es nicht sichtbare Teile einer Szene extrapolieren (z.B. die Rückseite eines Roboters, einen Rasen neben einem Pool).
Räumliche Rekonstruktion
Atlas rekonstruiert reale Szenen aus ein bis Dutzenden Eingabebildern. Laut World Labs übertrifft es hochmoderne 3D-Rekonstruktionsmodelle und erzeugt sowohl neue Ansichtsbilder als auch explizite 3D-Ausgaben. Dies ist ein Fortschritt bei dem jahrzehntealten Problem der Neuansichtssynthese aus spärlichen Bildern.
Raum-Zeit-Simulation
Atlas modelliert Raum und Zeit aus Eingabevideos. Es kann Videos für visuelle Effekte neu einrahmen und unterstützt Real-to-Sim-Workflows für Robotik.
Bildgenerierung
Aus Text kann Atlas Bilder und 360-Grad-Panoramen erzeugen, komplexe Eingabeaufforderungen befolgen und Text in einer Vielzahl von visuellen Stilen rendern.
Wichtige technische Details
Das Modell funktioniert, indem es Eingaben in einen "räumlichen Kontext" codiert – jedes Bild wird an einer 3D-Position verankert. Dieser Kontext ermöglicht es, unzusammenhängende Bilder an beliebigen 3D-Positionen zu platzieren, und Atlas erzeugt eine Welt, die zwischen ihnen interpoliert (sich Türen, Flure usw. vorstellt). Dies ermöglicht lange, steuerbare Videos: "Sie inszenieren die Szene, nicht ziehen am Hebel eines Spielautomaten."
Für wen es gedacht ist
Entwickler, die in der 3D-Inhaltserstellung, Robotiksimulation oder für alle, die steuerbare Videogenerierung aus spärlichen Bildeingaben benötigen. Atlas wird zukünftige Versionen des Marble-Produkts von World Labs unterstützen. Früher Zugang ist auf der World Labs-Website verfügbar.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Smriti: Ein Git-ähnliches System zur Verwaltung des LLM-Denkzustands, um Gesprächsabdrift zu verhindern
Smriti ist ein Open-Source-Tool, das Entwicklern ermöglicht, Denkzustände in LLM-Konversationen zu speichern, wiederherzustellen, zu verzweigen und zu vergleichen, um Abweichungen zu verhindern. Es behandelt Interaktionen als Zustand statt als Chatverlauf, was saubere Rückrollungen und alternative Erkundungen ohne Kontamination ermöglicht.

SwiftUI-Agentenfähigkeiten: Verbesserung der View-Entwicklung mit KI
Das SwiftUI Agent Skill ist ein Open-Source-Tool, das KI nutzt, um die Entwicklung von SwiftUI-Views durch die Einbettung von Best Practices und Optimierungen zu verbessern.

Clawdbot entfesselt neue Funktionen mit dem Pro-Abonnement.
Clawdbot führt ein 'Pro'-Abonnement ein, das erweiterte Funktionen für Benutzer bietet, die das Potenzial der Automatisierung in Programmierumgebungen maximieren möchten. Entdecken Sie die neuesten Funktionen und Community-Einsichten von r/clawdbot.

100 beliebte Apps in Markdown-Designspezifikationen für Claude UI Cloning zurückentwickelt
Ein Open-Source-Repository bietet strukturierte Markdown-Designspezifikationen für 100 beliebte iOS-Apps, optimiert für Claude, um UIs konsistent zu klonen. Schlüsseltechniken: exakte Farbwerte, Zustandsabdeckung, Abstandsskalen und Navigationsgraphen.