Atlas, el nuevo modelo de World Labs, genera mundos 3D a partir de una sola imagen

Atlas: A World Model for Spatial Intelligence

Atlas, el nuevo modelo de World Labs, genera mundos 3D a partir de una sola imagen

World Labs presenta Atlas, un modelo de mundo omni que entiende texto, imágenes, video y 3D. Con una sola imagen, genera escenas completas desde cualquier ángulo, reconstruye espacios reales con precisión y simula trayectorias robóticas. Su arquitectura de transformer de difusión autorregresivo procesa contexto espacial, permitiendo control de cámara exacto y videos de hasta un minuto en 1440p. Atlas supera a modelos especializados en reconstrucción 3D y abre nuevas posibilidades en robótica, VFX y creación de contenido.

Esto te pone en la silla del director: estás escenificando la escena, no tirando de la palanca de una máquina tragamonedas.
  1. teraflop

    El artículo del blog no menciona lo que me parece la aplicación más interesante de un modelo como este, a saber, extraer información semántica de su espacio latente. Menciona aplicaciones de robótica, pero solo en el contexto de generar modelos de mundo realistas para simulación. Si tienes un robot desplegado en un entorno, generar vistas sintéticas del entorno en el que te encuentras no tiene ningún valor obvio. Lo que sí tiene valor obvio es el conocimiento latente que el modelo podría haber utilizado para generar esas vistas sintéticas. Por ejemplo, el hecho de que Atlas sea capaz de identificar regiones de las imágenes de entrada que parecen "suelos", e interpolarlas suavemente y rellenar los huecos con más suelo, sugiere que tiene un concepto de "caminabilidad tipo suelo" que ha aprendido de los ejemplos de sus datos de entrenamiento. Y poder identificar las regiones del espacio 3D que corresponden a esa etiqueta semántica sería obviamente útil para la planificación de rutas del robot. Hay mucha literatura sobre, por ejemplo, el uso de redes neuronales para estimar áreas caminables a partir de una nube de puntos. Y podrías imaginar simplemente acoplar uno de esos métodos al frente de Atlas, utilizando la nube de puntos sintetizada (en lugar de la fotogrametría tradicional o el LIDAR) como entrada. Pero eso parece que está desechando mucha información semántica potencialmente útil, además de ser innecesariamente ineficiente.

  2. Vakaiser

    Esto es increíble. Una aplicación potencial que ya estoy pensando es la iteración rápida del bloqueo de mapas en videojuegos. Poder introducir una configuración de 'estado inicial' y luego generar proceduralmente un puñado de configuraciones alternativas podría hacer que la creación rápida de prototipos sea una experiencia significativamente más rápida, especialmente si quisieras ver cómo podría verse un resultado final potencial. Además, poder extraer y procesar la geometría del mundo y los objetos 3D de Atlas podría reducir la fricción en las primeras etapas del desarrollo independiente, donde el tiempo del desarrollador está más limitado. Estoy muy emocionado con las herramientas de IA de cara al futuro si esto es un vistazo al futuro.

  3. xyzsparetimexyz

    ¿Qué tan rápido puede generar un fotograma? Si es lo suficientemente rápido para tiempo real, entonces no necesitarías enviar las salidas a un método diferente de síntesis de vistas novedosas como los splats gaussianos.

  4. ACCount37

    Es un enfoque prometedor, y la demo demuestra lo avanzada y robusta que es ahora la reconstrucción de '3D a partir de 2D'. Los sensores de profundidad dedicados solían ser imprescindibles en plataformas robóticas avanzadas; la única forma de obtener nubes de puntos 3D fiables era girar un LiDAR. Pero a estas alturas, no me sorprendería que cada vez más robots salgan con bloques de cámara similares a los de los teléfonos inteligentes, con distintos campos de visión y distancias focales, pero sin mucha detección de profundidad explícita, si es que tienen alguna. También me pregunto si este mismo modelo puede adaptarse para convertirse en un verdadero VLA robótico. Si ya toma guía de texto e imágenes, realiza difusión autorregresiva de vistas novedosas y maneja dinámicas temporales, ¿por qué no difusión de acciones también?

  5. thinkingkong

    ¿Qué significa exactamente 'modelo de mundo'? Lo he visto usado tantas veces y de tantas maneras para describir cualquier cosa de última generación que ha perdido su significado.

Más de este día

2026-09-01