LingBot-Map: 스트리밍 데이터로 3D 장면을 재구성하는 피드포워드 기반 모델
Lingbot-map: A 3D foundation model for reconstructing scenes from streaming data

LingBot-Map은 스트리밍 데이터로부터 3D 장면을 실시간 재구성하는 피드포워드(feed-forward) 3D 파운데이션 모델입니다. Geometric Context Transformer를 통해 앵커 컨텍스트, 포즈 참조 윈도우, 궤적 메모리를 단일 스트리밍 프레임워크로 통합하고, paged KV cache attention을 적용해 518×378 해상도에서 약 20 FPS로 10,000 프레임 이상의 장면을 안정적으로 처리합니다. KITTI, Oxford Spires 등 다양한 벤치마크에서 기존 스트리밍 및 반복 최적화 방식보다 우수한 성능을 보이며, 코드와 모델이 공개되어 있습니다.
LingBot-Map은 좌표 기반, 밀집 기하학적 단서, 장기 드리프트 보정을 앵커 컨텍스트, 포즈 참조 윈도우, 궤적 메모리를 통해 단일 스트리밍 프레임워크로 통합합니다.