LingBot-Map:ストリーミングデータから3Dシーンを再構築するフィードフォワード基盤モデル
Lingbot-map: A 3D foundation model for reconstructing scenes from streaming data

LingBot-Mapは、カメラから流れ込む連続データをリアルタイムで処理し、3Dシーンを再構築する新しいフィードフォワード型の基盤モデルです。Geometric Context Transformerを採用し、アンカーコンテキスト、ポーズ参照ウィンドウ、軌跡メモリを統合することで、座標の接地、密な幾何学的手がかり、長距離ドリフト補正を単一のストリーミングフレームワークで実現します。ページングKVキャッシュアテンションにより、518×378解像度で約20FPSの安定した推論を達成し、10,000フレームを超える長いシーケンスを処理可能です。KITTIやOxford Spiresなどのベンチマークで最先端の性能を示し、反復最適化ベースの手法を凌駕します。
LingBot-Mapは、フィードフォワードアーキテクチャとページングKVキャッシュアテンションにより、518×378解像度で約20FPSの安定した推論を実現し、10,000フレームを超える長いシーケンスを処理できます。