Atlas: World Labs stellt ein Weltmodell vor, das aus einem einzigen Bild eine vollständige 3D-Szene erzeugt

Atlas: A World Model for Spatial Intelligence

Atlas: World Labs stellt ein Weltmodell vor, das aus einem einzigen Bild eine vollständige 3D-Szene erzeugt

World Labs präsentiert Atlas, ein multimodales autoregressives Diffusions-Transformer-Modell, das Text, Bilder, Videos und 3D-Daten verarbeitet. Atlas erzeugt aus einem oder mehreren Bildern kameragesteuerte Videos in bis zu 1440p, rekonstruiert reale Szenen in 3D und simuliert Raum und Zeit für Robotik-Anwendungen. Es übertrifft spezialisierte Modelle bei der 3D-Rekonstruktion und ermöglicht Real-to-Sim-Workflows. Atlas wird die Grundlage für zukünftige Produkte wie Marble bilden.

Atlas ist ein Omni-Modell, das von Grund auf neu vortrainiert wurde, um nativ mit Text, Bildern, Videos und 3D zu arbeiten.
  1. teraflop

    Der Blogbeitrag scheint nicht das zu erwähnen, was meiner Meinung nach die interessanteste Anwendung eines solchen Modells ist, nämlich das Extrahieren semantischer Informationen aus seinem latenten Raum. Es erwähnt Robotik-Anwendungen, aber nur im Zusammenhang mit der Erzeugung realistischer Weltmodelle für Simulationen.

    Wenn man einen Roboter in einer Umgebung einsetzt, hat das Erzeugen synthetischer Ansichten der Umgebung, in der man sich befindet, keinen offensichtlichen Nutzen. Was offensichtlichen Nutzen hat, ist das latente Wissen, das das Modell zur Erzeugung dieser synthetischen Ansichten hätte verwenden können.

    Zum Beispiel deutet die Tatsache, dass Atlas in der Lage ist, Regionen der Eingabebilder zu identifizieren, die wie "Böden" aussehen, und sie glatt zu interpolieren und Lücken mit mehr Boden zu füllen, darauf hin, dass es ein Konzept von "bodenähnlicher Begehbarkeit" hat, das es aus den Beispielen in seinen Trainingsdaten gelernt hat. Und die Fähigkeit, die Regionen des 3D-Raums zu identifizieren, die diesem semantischen Label entsprechen, wäre offensichtlich nützlich für die Pfadplanung von Robotern.

    Es gibt reichlich Literatur darüber, z.B. neuronale Netze zur Schätzung begehbarer Bereiche aus einer Punktwolke zu verwenden. Und man könnte sich vorstellen, einfach eine dieser Methoden vor Atlas zu schalten und die synthetisierte Punktwolke (anstelle von traditioneller Photogrammetrie oder LIDAR) als Eingabe zu verwenden. Aber das scheint eine Menge potenziell nützlicher semantischer Informationen wegzuwerfen, ganz zu schweigen von unnötiger Ineffizienz.

  2. Vakaiser

    Das ist unglaublich. Eine mögliche Anwendung, an die ich bereits denke, ist die schnelle Iteration von Videospiel-Level-Blockaden. Die Möglichkeit, eine "Anfangszustands"-Konfiguration einzusetzen und dann eine Handvoll alternativer Konfigurationen prozedural generieren zu lassen, könnte Rapid Prototyping erheblich beschleunigen, besonders wenn man sehen möchte, wie ein potenzielles Endergebnis aussehen könnte.

    Darüber hinaus könnte die Fähigkeit, Weltgeometrie und 3D-Objekte aus Atlas zu extrahieren und zu verarbeiten, die Reibung in den frühen Phasen der Indie-Entwicklung verringern, wo die Zeit der Entwickler knapper ist.

    Ich bin sehr aufgeregt über KI-Tools, wenn dies ein Blick in die Zukunft ist.

  3. xyzsparetimexyz

    Wie schnell kann es einen Frame generieren? Wenn es schnell genug für Echtzeit ist, müsste man die Ausgaben nicht an eine andere Neuansichts-Synthesemethode wie Gaussian Splats weiterleiten.

  4. ACCount37

    Es ist ein vielversprechender Ansatz – und die Demo zeigt, wie fortgeschritten und robust "3D aus 2D"-Rekonstruktion mittlerweile ist.

    Spezielle Tiefensensoren waren früher ein Muss auf fortgeschrittenen Robotik-Plattformen – der einzige Weg, um einigermaßen zuverlässige 3D-Punktwolken zu erhalten, war das Drehen eines LiDAR. Aber inzwischen würde es mich nicht wundern, wenn immer mehr Roboter mit Smartphone-ähnlichen Kamerablöcken ausgestattet werden – unterschiedliche Sichtfelder und Brennweiten, aber nicht viel explizite Tiefenerfassung, wenn überhaupt.

    Außerdem frage ich mich, ob genau dieses Modell in ein echtes Robotik-VLA nachgerüstet werden kann? Wenn es bereits Text- und Bildanweisungen annimmt, autoregressive Diffusion neuer Ansichten durchführt und zeitliche Dynamik behandelt – warum nicht auch Diffusion von Aktionen?

  5. thinkingkong

    Was genau bedeutet Weltmodell? Ich habe gesehen, wie es so oft auf so viele Arten verwendet wurde, um einfach alles mit SOTA-Status zu beschreiben, dass es seine Bedeutung verloren hat.

Mehr von diesem Tag

2026-09-01