World Labs, 공간 지능을 위한 세계 모델 'Atlas' 공개
Atlas: A World Model for Spatial Intelligence

World Labs가 공간 지능을 목표로 하는 차세대 세계 모델 'Atlas'를 공개했다. Atlas는 텍스트, 이미지, 비디오, 3D를 모두 처리하는 옴니 모델로, 멀티모달 자기회귀 확산 트랜스포머 기반이다. 카메라 제어 생성, 공간 재구성, 시공간 시뮬레이션, 이미지 생성 등 다양한 작업을 수행하며, 특히 단일 이미지로 1440p 해상도의 1분 분량 비디오를 생성하거나, 몇 장의 이미지로 실제 공간을 3D로 재구성할 수 있다. Atlas는 로봇공학, 게임, VFX 등 다양한 분야에 적용될 예정이며, World Labs의 제품인 Marble의 차기 버전에 통합될 계획이다.
Atlas는 공간적 맥락을 관리함으로써 완전히 새로운 종류의 창의적 제어를 가능하게 합니다.
HN 토론
32- teraflop
블로그 글에는 이런 모델의 가장 흥미로운 응용이라고 생각되는 부분, 즉 잠재 공간에서 의미론적 정보를 추출하는 것이 언급되지 않은 것 같다. 로봇공학 응용을 언급하지만, 시뮬레이션을 위한 현실적인 세계 모델을 생성하는 맥락에서만 그렇다.
로봇이 어떤 환경에 배치되어 있다면, 현재 있는 환경의 합성 뷰를 생성하는 것은 명백한 가치가 없다. 명백한 가치가 있는 것은 모델이 그 합성 뷰를 생성하는 데 사용했을 잠재 지식이다.
예를 들어, Atlas가 입력 이미지에서 '바닥'처럼 보이는 영역을 식별하고, 이를 부드럽게 보간하며 더 많은 바닥으로 빈틈을 채우는 능력은 훈련 데이터의 예시에서 학습한 '바닥처럼 걸을 수 있는 영역'이라는 개념을 가지고 있음을 시사한다. 그리고 3D 공간에서 그 의미론적 레이블에 해당하는 영역을 식별할 수 있다면 로봇 경로 계획에 분명히 유용할 것이다.
포인트 클라우드에서 걸을 수 있는 영역을 추정하기 위해 신경망을 사용하는 것에 관한 문헌은 많다. 그리고 합성된 포인트 클라우드(기존의 사진 측량이나 LIDAR 대신)를 입력으로 사용하여 그러한 방법 중 하나를 Atlas 앞에 붙이는 것을 상상할 수 있다. 하지만 그것은 불필요하게 비효율적일 뿐만 아니라 잠재적으로 유용한 의미론적 정보를 많이 버리는 것처럼 보인다.
- Vakaiser
이것은 놀랍다. 이미 생각나는 잠재적 응용 중 하나는 비디오 게임 맵 차단(blocking)의 빠른 반복이다. '초기 상태' 구성을 넣고 몇 가지 대체 구성을 절차적으로 생성할 수 있다면, 특히 잠재적 최종 결과가 어떤 모습일지 보고 싶다면 빠른 프로토타이핑이 훨씬 더 빨라질 수 있다.
게다가 Atlas에서 세계 지오메트리와 3D 객체를 추출하고 처리할 수 있다면, 개발자 시간이 더 촉박한 인디 개발 초기 단계에서 마찰을 줄일 수 있다.
이것이 미래를 엿볼 수 있는 것이라면 AI 도구가 앞으로 나아가는 것에 대해 매우 기대된다.
- xyzsparetimexyz
프레임을 얼마나 빨리 생성할 수 있나요? 실시간으로 충분히 빠르다면 출력을 가우시안 스플랫과 같은 다른 새로운 뷰 합성 방법으로 파이프할 필요가 없을 것입니다.
- ACCount37
유망한 접근 방식이다. 그리고 데모는 '2D에서 3D로' 재구성이 이제 얼마나 발전되고 견고한지 보여준다.
전용 깊이 센서는 고급 로봇 플랫폼에서 필수였던 적이 있다. 신뢰할 수 있는 3D 포인트 클라우드에 가까운 것을 얻는 유일한 방법은 LiDAR를 회전시키는 것이었다. 하지만 이제는 점점 더 많은 로봇이 스마트폰과 같은 카메라 블록(다양한 FoV와 초점 거리, 그러나 명시적인 깊이 감지는 거의 또는 전혀 없음)을 장착하고 출시되어도 놀라지 않을 것이다.
또한, 이 모델 자체를 진정한 로봇 VLA로 개조할 수 있을지 궁금하다. 이미 텍스트와 이미지 안내를 받고, 새로운 뷰의 자기회귀 확산을 수행하며, 시간적 역학을 처리한다면, 행동의 확산도 왜 안 될까?
- thinkingkong
세계 모델이 정확히 무엇을 의미하나요? 너무 여러 번, 너무 다양한 방식으로 사용되어 SOTA 무엇이든 설명하는 데 쓰여서 그 의미를 잃어버렸다.