LingBot-Map reconstruye escenas 3D en tiempo real desde video en streaming

Lingbot-map: A 3D foundation model for reconstructing scenes from streaming data

LingBot-Map reconstruye escenas 3D en tiempo real desde video en streaming

LingBot-Map es un modelo fundacional 3D feed-forward para reconstrucción en streaming. Su Geometric Context Transformer unifica anclaje de coordenadas, pistas geométricas densas y corrección de deriva a largo plazo mediante contexto de ancla, ventana de referencia de pose y memoria de trayectoria. Con atención de caché KV paginada, logra inferencia estable a ~20 FPS en resolución 518×378 sobre secuencias que superan los 10,000 fotogramas. El proyecto incluye código, pesos y demos interactivas, y supera a métodos basados en optimización iterativa en diversos benchmarks.

Hemos construido un modelo fundacional 3D feed-forward para reconstrucción en streaming.

Más de este día

2026-07-17