OpenWAM, 로봇이 행동 전에 미래를 예측하게 하는 오픈 프레임워크
OpenWAM: An Open Framework for Composable World-Action Models
스탠포드 연구진이 로봇의 행동과 미래 예측을 유연하게 조합할 수 있는 오픈 프레임워크 OpenWAM을 공개했다. 5B 비디오 전문가와 2B 액션 전문가를 Mixture-of-Transformers 구조로 결합해, 비디오를 먼저 예측할지 행동을 먼저 생성할지 자유롭게 바꿀 수 있다. LIBERO 벤치마크에서 평균 98.6% 성공률을 기록했으며, 역동역학 및 순방향 동역학 모델을 독립적으로 연결해 재사용할 수 있다.
강한 제어 성능을 위해 미래 비디오와 행동 토큰 간의 어텐션이 반드시 필요한 것은 아니다.