OpenWAM: un marco abierto para modelos composables de mundo-acción
OpenWAM: An Open Framework for Composable World-Action Models
OpenWAM es un marco que unifica la predicción visual y el control robótico bajo una arquitectura compartida. Con un experto de video de 5B y un experto de acción de 2B en un Mixture-of-Transformers, permite programas de interacción como video-luego-acción o acción-luego-video. Tras preentrenar con 3.34 millones de trayectorias, alcanza un 98.6% de éxito en LIBERO, facilitando estudiar cómo la predicción y el control se combinan.
¿Debería un robot predecir lo que verá antes de decidir cómo actuar, o generar ambos a la vez? Los modelos de mundo-acción hacen posibles ambas opciones.