Atlas : le modèle mondial omni de World Labs pour l'intelligence spatiale
World Labs a introduit Atlas, un « modèle mondial omni » pour l'intelligence spatiale. Atlas est pré-entraîné de zéro pour fonctionner nativement sur le texte, les images, la vidéo et la 3D, combinant toutes les entrées dans un contexte spatial partagé. C'est un transformateur autorégressif de diffusion multimodal qui génère des sorties cohérentes avec la géométrie 3D qu'il a vue, et peut même imaginer ce qui se trouve au-delà des images d'entrée.
Ce que peut faire Atlas
Atlas est conçu pour gérer trois tâches principales : la génération de mondes, la reconstruction et la simulation.
Génération contrôlée par caméra
Atlas génère des images et des vidéos à partir d'une à six images de référence avec un contrôle précis de la caméra. Vous spécifiez le chemin de la caméra, sans avoir besoin de prompts textuels. Il produit jusqu'à 1 minute de vidéo en 1440p. À partir d'une seule image, il peut extrapoler des parties invisibles d'une scène (par exemple, le dos d'un robot, une pelouse à côté d'une piscine).
Reconstruction spatiale
Atlas reconstruit des scènes du monde réel à partir d'une à plusieurs dizaines d'images d'entrée. Selon World Labs, il surpasse les modèles de reconstruction 3D de pointe et produit à la fois des images de nouvelles vues et des sorties 3D explicites. C'est une avancée sur le problème ancien de la synthèse de nouvelles vues à partir d'images clairsemées.
Simulation espace-temps
Atlas modélise l'espace et le temps à partir de vidéos d'entrée. Il peut recadrer des vidéos pour des effets visuels et prend en charge les flux de travail Real-to-Sim pour la robotique.
Génération d'images
À partir de texte, Atlas peut générer des images et des panoramas à 360°, suivant des prompts complexes et rendant du texte avec une variété de styles visuels.
Détails techniques clés
Le modèle fonctionne en encodant les entrées dans un « contexte spatial » : chaque image est ancrée à une position 3D. Ce contexte vous permet de placer des images non liées à des positions 3D arbitraires et Atlas générera un monde qui interpole entre elles (imaginant des portes, des couloirs, etc.). Cela permet des vidéos longues et contrôlables : « vous mettez en scène la scène, vous ne tirez pas le levier d'une machine à sous. »
À qui cela s'adresse
Les développeurs travaillant dans la création de contenu 3D, la simulation robotique, ou toute personne ayant besoin de génération vidéo contrôlable à partir d'images d'entrée clairsemées. Atlas alimentera les futures versions du produit Marble de World Labs. L'accès anticipé est disponible sur le site de World Labs.
📖 Lire la source complète : HN AI Agents
👀 See Also

Système de développement de produits open-source à 31 agents pour Claude, avec plus de 12 000 lignes de contenu
Une compétence Claude open source fournit 31 agents IA spécialisés et 20 cadres stratégiques couvrant tous les départements de l'entreprise, du produit à la conformité. Le système sous licence MIT comprend 62 fichiers avec plus de 12 000 lignes de contenu actionnable, une conformité spécifique par pays pour plusieurs régions, et un système de chargement intelligent qui achemine les demandes efficacement.

Auto Router vs Sonnet : Économies de coût vs Qualité de réponse
La fonctionnalité Auto Router d'Open Router sélectionne dynamiquement des LLM en fonction de la complexité du contexte, offrant des économies de coût significatives (0,8 centime contre 0,00071 centime par requête), mais les utilisateurs signalent une dégradation de la qualité des réponses par rapport à Sonnet 4.6.

Claude Code v2.1.229 : Contrôle à distance, places de marché de plugins et correctifs critiques
Claude Code v2.1.229 ajoute le contrôle à distance --continue, les sources de commandes de la place de marché de plugins, les keepalives SSE, et corrige des plantages, OAuth MCP et les fuites de surveillance de fichiers.

Examen de l'application de productivité Dart AI avec intégration OpenClaw
Un utilisateur rapporte être passé de Things à Dart AI pour la productivité, le trouvant meilleur pour mettre en œuvre la méthode Getting Things Done avec un accès complet à OpenClaw, malgré des problèmes d'interface et une complexité de configuration initiale.