LingBot-Map: 3D-Rekonstruktion aus Videostreams in Echtzeit

Lingbot-map: A 3D foundation model for reconstructing scenes from streaming data

LingBot-Map: 3D-Rekonstruktion aus Videostreams in Echtzeit

LingBot-Map ist ein neues 3D-Foundation-Modell, das Szenen direkt aus kontinuierlichen Videodaten rekonstruiert – ohne iterative Optimierung. Der Geometric Context Transformer vereint Koordinatenverankerung, dichte geometrische Hinweise und Driftkorrektur in einem einzigen Streaming-Framework. Mit paged KV-Cache-Attention erreicht das Modell stabile Inferenz mit etwa 20 FPS bei 518×378 Pixeln und verarbeitet Sequenzen von über 10.000 Frames. Auf diversen Benchmarks übertrifft es sowohl bestehende Streaming- als auch iterative Optimierungsansätze und setzt neue Maßstäbe in der 3D-Rekonstruktion.

Wir haben ein Feed-Forward-3D-Foundation-Modell für Streaming-3D-Rekonstruktion gebaut!

Mehr von diesem Tag

2026-07-17