Atlas : le modèle mondial omni de World Labs pour l'intelligence spatiale

✍️ OpenClawRadar📅 Publié: September 2, 2026🔗 Source
Ad

World Labs a introduit Atlas, un « modèle mondial omni » pour l'intelligence spatiale. Atlas est pré-entraîné de zéro pour fonctionner nativement sur le texte, les images, la vidéo et la 3D, combinant toutes les entrées dans un contexte spatial partagé. C'est un transformateur autorégressif de diffusion multimodal qui génère des sorties cohérentes avec la géométrie 3D qu'il a vue, et peut même imaginer ce qui se trouve au-delà des images d'entrée.

Ce que peut faire Atlas

Atlas est conçu pour gérer trois tâches principales : la génération de mondes, la reconstruction et la simulation.

Génération contrôlée par caméra

Atlas génère des images et des vidéos à partir d'une à six images de référence avec un contrôle précis de la caméra. Vous spécifiez le chemin de la caméra, sans avoir besoin de prompts textuels. Il produit jusqu'à 1 minute de vidéo en 1440p. À partir d'une seule image, il peut extrapoler des parties invisibles d'une scène (par exemple, le dos d'un robot, une pelouse à côté d'une piscine).

Reconstruction spatiale

Atlas reconstruit des scènes du monde réel à partir d'une à plusieurs dizaines d'images d'entrée. Selon World Labs, il surpasse les modèles de reconstruction 3D de pointe et produit à la fois des images de nouvelles vues et des sorties 3D explicites. C'est une avancée sur le problème ancien de la synthèse de nouvelles vues à partir d'images clairsemées.

Simulation espace-temps

Atlas modélise l'espace et le temps à partir de vidéos d'entrée. Il peut recadrer des vidéos pour des effets visuels et prend en charge les flux de travail Real-to-Sim pour la robotique.

Génération d'images

À partir de texte, Atlas peut générer des images et des panoramas à 360°, suivant des prompts complexes et rendant du texte avec une variété de styles visuels.

Ad

Détails techniques clés

Le modèle fonctionne en encodant les entrées dans un « contexte spatial » : chaque image est ancrée à une position 3D. Ce contexte vous permet de placer des images non liées à des positions 3D arbitraires et Atlas générera un monde qui interpole entre elles (imaginant des portes, des couloirs, etc.). Cela permet des vidéos longues et contrôlables : « vous mettez en scène la scène, vous ne tirez pas le levier d'une machine à sous. »

À qui cela s'adresse

Les développeurs travaillant dans la création de contenu 3D, la simulation robotique, ou toute personne ayant besoin de génération vidéo contrôlable à partir d'images d'entrée clairsemées. Atlas alimentera les futures versions du produit Marble de World Labs. L'accès anticipé est disponible sur le site de World Labs.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Claude Code v2.1.206 : /doctor réduit CLAUDE.md, /commit-push-pr autorisation automatique de Git Push, mise à niveau de l'agent en arrière-plan
Tools

Claude Code v2.1.206 : /doctor réduit CLAUDE.md, /commit-push-pr autorisation automatique de Git Push, mise à niveau de l'agent en arrière-plan

Claude Code v2.1.206 ajoute des suggestions de chemin /cd, une vérification /doctor pour réduire CLAUDE.md des informations dérivables, /commit-push-pr autorise automatiquement git push vers les dépôts configurés, et corrige les timeouts MCP, les mises à jour d'agents en arrière-plan et les blocages Bedrock.

OpenClawRadar
Spectr : Un MCP qui rédige des spécifications d'applications à partir d'enregistrements d'écran pour des clones Claude pixel parfaits
Tools

Spectr : Un MCP qui rédige des spécifications d'applications à partir d'enregistrements d'écran pour des clones Claude pixel parfaits

Spectr est un serveur MCP, un CLI et une compétence Claude Code qui prend un enregistrement d'écran .mp4/.mov d'une application iOS et génère un spec.md en 7 sections avec codes hexadécimaux, poids de police, espacements, transitions et graphe de navigation — éliminant les 30 minutes de rédaction manuelle de spécifications par écran.

OpenClawRadar
Mise en œuvre d'un Assistant Vocal Local avec Qwen3 sur RTX 5060 Ti
Tools

Mise en œuvre d'un Assistant Vocal Local avec Qwen3 sur RTX 5060 Ti

Un assistant vocal d'automatisation domestique entièrement local utilisant Qwen3 pour la reconnaissance vocale, le traitement du langage et la synthèse vocale sur une RTX 5060 Ti, avec un clonage de voix de Morgan Freeman et divers outils d'intégration.

OpenClawRadar
Kanban CLI : Un gestionnaire de tâches local et axé sur les agents pour le terminal
Tools

Kanban CLI : Un gestionnaire de tâches local et axé sur les agents pour le terminal

Kanban CLI est un outil terminal en Rust offrant un suivi structuré des tâches avec intégration complète de git, conçu pour les flux de travail pilotés par des agents IA.

OpenClawRadar