World Labs、空間知能の世界モデル「Atlas」を発表
Atlas: A World Model for Spatial Intelligence

World Labsが次世代の世界モデル「Atlas」を発表。Atlasはテキスト、画像、動画、3Dをネイティブに扱うオムニモデルで、マルチモーダル自己回帰拡散トランスフォーマーを採用。カメラ制御による高精細な動画生成(最大1440p・1分)、スパースな入力からの3D再構成、ロボット向けのReal-to-Simシミュレーション、テキストからの画像・360度パノラマ生成など、幅広いタスクを単一のアーキテクチャで実現。スケーリングに伴い性能が向上する設計で、将来のMarbleや他製品に搭載される予定。
Atlasは、カメラの動きと空間コンテキストの管理を組み合わせることで、長い動画を正確に制御しながら生成できます。
HNでの議論
32- teraflop
ブログ記事には、私がこのようなモデルの最も興味深い応用だと思うこと、つまり潜在空間から意味情報を抽出することについては触れられていないようです。ロボット工学への応用についても言及されていますが、それはシミュレーション用の現実的な世界モデルを生成するという文脈に限られています。
環境に配備されたロボットがある場合、自分がいる環境の合成ビューを生成しても明らかな価値はありません。明らかな価値があるのは、モデルがその合成ビューを生成するために使用できたであろう潜在知識です。
例えば、Atlasが入力画像の「床」のように見える領域を識別し、それらを滑らかに補間して、より多くの床でギャップを埋めることができるという事実は、トレーニングデータの例から学習した「床のような歩行可能性」の概念を持っていることを示唆しています。そして、その意味ラベルに対応する3D空間の領域を識別できることは、ロボットの経路計画に明らかに役立つでしょう。
ニューラルネットワークを使用して点群から歩行可能領域を推定することについては、多くの文献があります。そして、それらの方法の1つをAtlasの前に取り付け、合成された点群を(従来の写真測量やLIDARの代わりに)入力として使用することを想像できます。しかし、それは不必要に非効率であることに加えて、潜在的に有用な意味情報の多くを捨てているように思えます。
- Vakaiser
これは素晴らしい。私がすでに考えている潜在的な応用の1つは、ビデオゲームのマップブロッキングの迅速な反復です。「初期状態」の構成を投入して、それから手続き的にいくつかの代替構成を生成できるようにすれば、特に潜在的な最終結果がどのようになるかを見たい場合、ラピッドプロトタイピングが大幅に高速化される可能性があります。
さらに、Atlasからワールドジオメトリや3Dオブジェクトを抽出して処理できるようになれば、開発者の時間がより逼迫しているインディー開発の初期段階での摩擦を減らすことができます。
これが未来を垣間見せてくれるものなら、今後のAIツールに非常に興奮しています。
- xyzsparetimexyz
フレームを生成する速度はどのくらいですか?リアルタイムに十分速ければ、出力をガウシアンスプラットのような別の新規ビュー合成法にパイプする必要はないでしょう。
- ACCount37
これは有望なアプローチであり、デモは「2Dからの3D」再構成が現在どれほど高度で堅牢であるかを示しています。
専用の深度センサーは、かつて高度なロボットプラットフォームでは必須でした。信頼できる3D点群に近いものを得る唯一の方法は、LiDARを回転させることでした。しかし今では、スマートフォンのようなカメラブロックを搭載したロボットがますます増えることになるでしょう。視野角や焦点深度は異なりますが、明示的な深度センシングはほとんど、またはまったくないかもしれません。
また、このモデル自体を真のロボットVLAに改造できるのではないかと思います。すでにテキストと画像のガイダンスを受け取り、新しいビューの自己回帰拡散を実行し、時間的ダイナミクスを処理しているのなら、なぜアクションの拡散もできないのでしょうか?
- thinkingkong
ワールドモデルとは正確には何を意味するのでしょうか?最先端の何かを説明するために、さまざまな方法で何度も使われているのを見てきましたが、その意味を失っています。