OpenWAM:机器人预测与行动的通用框架

OpenWAM: An Open Framework for Composable World-Action Models

斯坦福推出的 OpenWAM 为机器人世界 - 行动模型提供了统一的开源框架。它基于 Wan2.2-5B 视频模型,结合 32 块 NVIDIA B200 GPU 进行预训练,构建了可灵活配置的 Mixture-of-Transformers 架构。该框架支持视频先于行动、行动先于视频或两者联合生成等多种交互模式,并引入了本地上下文的逆动力学(IDM)和前向动力学(FDM)模块。通过在 LIBERO-Long-CF 等包含反事实数据的集上训练,OpenWAM 在 LIBERO 基准测试中取得了 98.6% 的平均成功率,在双机械臂操作任务中也展现了卓越性能,证明了模块化组件在复杂控制任务中的强大潜力。

机器人应该在决定如何行动之前预测它将看到什么,还是应该同时生成两者?

同日更多故事

2026-10-07