论文
Masked Visual Actions:统一世界模型的掩码视觉动作接口
斯坦福大学李飞飞团队提出 Masked Visual Actions,将机器人动作表示为视频中实体轨迹的像素空间掩码。仅用15小时真实与仿真数据微调,单个视频模型即可同时作为前向动力学模型和逆向模型,用于策略评估与基于模型的规划。
资讯动态数据由 AI HOT 聚合提供
斯坦福大学李飞飞团队提出 Masked Visual Actions,将机器人动作表示为视频中实体轨迹的像素空间掩码。仅用15小时真实与仿真数据微调,单个视频模型即可同时作为前向动力学模型和逆向模型,用于策略评估与基于模型的规划。
资讯动态数据由 AI HOT 聚合提供