LingBot-Map: 3D-Rekonstruktion aus Videostreams in Echtzeit
Lingbot-map: A 3D foundation model for reconstructing scenes from streaming data

LingBot-Map ist ein neues 3D-Foundation-Modell, das Szenen direkt aus kontinuierlichen Videodaten rekonstruiert – ohne iterative Optimierung. Der Geometric Context Transformer vereint Koordinatenverankerung, dichte geometrische Hinweise und Driftkorrektur in einem einzigen Streaming-Framework. Mit paged KV-Cache-Attention erreicht das Modell stabile Inferenz mit etwa 20 FPS bei 518×378 Pixeln und verarbeitet Sequenzen von über 10.000 Frames. Auf diversen Benchmarks übertrifft es sowohl bestehende Streaming- als auch iterative Optimierungsansätze und setzt neue Maßstäbe in der 3D-Rekonstruktion.
Wir haben ein Feed-Forward-3D-Foundation-Modell für Streaming-3D-Rekonstruktion gebaut!