OpenWAM vereint Videovorhersage und Robotersteuerung in einem Framework
OpenWAM: An Open Framework for Composable World-Action Models
OpenWAM von Stanford gibt Welt-Aktions-Modellen eine gemeinsame Basis: Ein 5B-Video-Experte und ein 2B-Aktions-Experte teilen sich Aufmerksamkeit über gepackte Tokens. Das Framework erlaubt verschiedene Interaktionsprogramme – Video-zuerst, Aktion-zuerst, gemeinsam oder entkoppelt – und verbindet unabhängig trainierte IDM- und FDM-Komponenten. Auf LIBERO erreicht VTA 98,6 % Erfolg, und Roboter-Videopretraining bringt bis zu 34,4 Punkte gegenüber der ursprünglichen Wan2.2-Initialisierung.
Starke Kontrolle auf diesem Benchmark erfordert keine Aufmerksamkeit zwischen zukünftigen Video- und Aktions-Tokens.