Atlas: 空間知能のためのワールドラボのオムニワールドモデル
World Labsは、空間インテリジェンスのための「オムニワールドモデル」であるAtlasを発表しました。Atlasは、テキスト、画像、動画、3Dをネイティブに扱うためにゼロから事前学習されており、すべての入力を共有の空間コンテキストに統合します。これは、マルチモーダルな自己回帰拡散トランスフォーマーであり、見た3Dジオメトリと整合する出力を生成し、入力フレームの先にあるものを想像することもできます。
Atlasでできること
Atlasは、ワールド生成、再構築、シミュレーションという3つの中核タスクを処理するように設計されています。
カメラ制御による生成
Atlasは、1〜6枚の参照画像から、正確なカメラ制御で画像と動画を生成します。カメラパスを指定するだけで、テキストベースのプロンプトは不要です。最大1440pで1分間の動画を出力します。単一の画像から、シーンの見えない部分(ロボットの背面、プールの隣の芝生など)を外挿できます。
空間再構築
Atlasは、1〜数十枚の入力画像から実世界のシーンを再構築します。World Labsによると、最先端の3D再構築モデルを上回り、新しい視点のフレームと明示的な3D出力の両方を生成します。これは、スパースな画像からの新規視点合成という数十年にわたる問題における前進です。
時空間シミュレーション
Atlasは、入力動画から空間と時間をモデル化します。視覚効果のために動画をリフレーミングでき、ロボット工学のためのReal-to-Simワークフローをサポートします。
画像生成
テキストから、Atlasは画像や360度パノラマを生成でき、複雑なプロンプトに従い、さまざまなビジュアルスタイルでテキストをレンダリングします。
主な技術的詳細
このモデルは、入力を「空間コンテキスト」にエンコードすることで機能します。各画像は3D位置に基づいています。このコンテキストにより、無関係な画像を任意の3D位置に配置でき、Atlasはそれらの間を補間するワールド(ドアや廊下などを想像)を生成します。これにより、長く制御可能な動画が可能になります。「シーンをステージングしているのであって、スロットマシンのレバーを引いているのではない」と説明されています。
対象ユーザー
3Dコンテンツ作成、ロボットシミュレーション、スパースな画像入力からの制御可能な動画生成を必要とする開発者向けです。Atlasは、World LabsのMarble製品の将来バージョンを強化します。早期アクセスはWorld Labsのサイトで利用可能です。
📖 全文を読む: HN AI Agents
👀 See Also

リーンコラブの紹介:長時間実行LLMタスクのためのマルチエージェントオーケストレーター
Lean Collabは、調整された並列サブエージェントを使用して長時間実行されるLLMタスクを管理するために設計されたオープンソースのオーケストレーターです。

XLI: Claude Code風ターミナルUIのためのオープンソースPythonライブラリ
コーディングエージェントを構築中ですか?ターミナルUXが作業の半分を占めます。XLIはオープンソースのPythonレンダリングエンジンで、Claude Codeのストリーミングマークダウン、ツールカード、インライン承認、スラッシュコマンドをターミナルのスクロールバックを奪うことなく再現します。

OpenClaw開発者、AIエージェント向け統合メモリシステムを構築
開発者が、構造化された事実、ベクトル検索、エンティティグラフ、エピソードタイムライン、階層的圧縮、イベント駆動型調整を組み合わせた、OpenClaw AIエージェント向けの15ツール統合メモリシステムを構築しました。このシステムはクラウド依存や月額料金なしでローカルで動作します。

オープンブレイン:オープンソースMCPサーバーが、自動グラフ化とセマンティック検索による永続的メモリをClaudeに追加
Open Brainは、自動的なエンティティ抽出、意味的な重複排除、思考間の関連性の自動グラフ化を備え、Claudeにセッションを超えた永続的なメモリを提供するオープンソースのMCPサーバーです。Supabase(pgvector)とDeno Edge Functionsを使用し、セルフホスティング可能で、グラフ探索、エンティティ閲覧、週次レビュー合成のための16のMCPツールを含んでいます。