智能工具库

李飞飞吴佳俊新作:用视觉轨迹打通机器人控制

李飞飞、吴佳俊团队提出TrAct框架,用视觉轨迹作为统一接口,解决世界模型与机器人动作控制之间的语言不通问题,实现跨本体、跨数据源的通用机器人学习。

2026-09-01 0来源:雷锋网

在具身智能领域,一个核心愿景是让机器人不仅能执行指令,更能像人类一样在脑海中预演未来,从而选择最优行动。然而,这个愿景的实现长期受困于一个尴尬的现实:负责“思考”的世界模型与负责“行动”的机器人控制器,使用的是两种截然不同的“语言”。

近日,斯坦福大学李飞飞与吴佳俊团队在arXiv上发布了一篇题为《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的论文,尝试为这道鸿沟架起一座桥梁。论文的核心思想是引入“视觉轨迹”(Visual Track)作为中间翻译,让机器人的动作指令与世界模型的像素预测实现真正的“同频对话”。

动作与像素的“巴别塔”:为何世界模型难以指导机器人

当前,以π0.5、GR00T为代表的视觉-语言-动作模型(VLA)在标准测试中表现优异,但在真实世界的泛化中却频频出错。业界普遍认为,引入世界模型进行“预演”是关键一步——让机器人先生成多个候选动作,在想象中推演结果,再择优执行。

然而,问题在于“预演”的输入与输出存在巨大的语义鸿沟。

  • 动作是低维的“方言”:机器人控制器输出的是一串数字,可能是末端位姿、关节角度或夹爪开合度,通常只有十几个到二十几个维度。
  • 预测是高维的“画面”:世界模型需要生成的是未来帧的像素图,例如一张224×224的RGB图像就有约15万个像素点,16帧视频则意味着数百万像素。

从“末端位姿变化0.02米”推导出“夹爪在画面中向右移动50像素”,这中间隔着关节转动、物体滑动、相机成像等一长串物理因果链。论文将这种直接以动作条件预测画面的传统方案称为AWM(动作条件世界模型),其效果如同让导演仅凭20个关键词脑补出一部两小时的电影,翻车在所难免。

更棘手的是,不同机器人的“方言”各不相同。Franka机械臂说一套,UR5说另一套,双臂机器人又是第三套。这导致模型在一个本体上学到的“动作-画面”映射,换一个机器人就几乎作废,跨本体泛化成为行业死结。

TrAct的解法:视觉轨迹充当“同声传译”

TrAct的巧妙之处在于,它没有试图去翻译每一种“方言”,而是创造了一种所有机器人都能理解的“普通话”——视觉轨迹。它指的是任务相关关键点在图像坐标系中随时间移动的路径。

TrAct追踪两类点:

  1. 夹爪点:机械臂夹爪上的7个固定网格顶点,负责描述“手怎么动”。
  2. 场景点:图像平面上5×5网格采样的25个点,负责描述“环境怎么动”,如物体滑动或镜头晃动。

这套语言是具身无关的。无论Franka、UR5还是人类的手,执行“把面条放进碗里”这个动作,翻译成轨迹都是同一句话:“夹爪关键点沿此路径移动,物体从当前位置进入碗的区域”。

围绕这个接口,TrAct构建了一个“剧组”式的三阶段架构:

1. 导演组(VLAT):生成动作-轨迹对

VLAT在预训练VLA模型π0.5的基础上改造动作头,使其同时输出动作块和对应的轨迹块。动作块是“方言”,轨迹块是“普通话”,两者必须严格成对,来自同一次策略采样。这确保了预演的条件与执行的控制是同一套方案,避免了“想得到却做不到”的脱节。

2. 拍摄组(TWM):按轨迹脚本渲染画面

TWM以Stable Video Diffusion为骨干,通过一个Temporal ControlNet分支将轨迹坐标渲染成空间控制图。世界模型的工作方式由此从“因果推理”变为“条件渲染”——看到关键点从A到B,只需生成对应画面,难度大幅降低。

3. 审片人(VLAC):按任务完成度打分

VLAC是一个基于视觉语言的奖励模型,它不看画质,只看剧情——任务是否完成?面条进碗了吗?夹爪够到目标了吗?它从拍摄组生成的预演视频中选出最符合任务指令的一条。

推理时,三组协作:VLAT生成K个候选方案,TWM逐一预演,VLAC打分选优,最终执行高分方案对应的动作。

数据红利:人类视频的“二次利用”

这套接口的另一大价值体现在数据侧。机器人数据昂贵稀缺,而互联网上的海量人类第一视角操作视频却近乎无限。传统方法因缺少机器人动作标签而无法利用这些数据,但TrAct改变了这一点——人类视频虽不能提供“机器人方言”,却能提供通用的“分镜脚本”(视觉轨迹)。

TrAct的预训练混合了76K条DROID机器人数据和约150K条EgoDex人类视频,将不同来源的轨迹统一映射到同一套槽位布局。这意味着人类视频可以无需翻译成动作,直接参与机器人模型的预训练,极大扩充了运动先验的数据规模。

总结:通往通用机器人学习的新路径

TrAct的意义在于,它用视觉轨迹这一简单而统一的接口,初步打通了世界模型与机器人控制之间的壁垒。它让世界模型能理解机器人,也让机器人能从海量人类视频中学习。虽然这距离真正的通用具身智能还很远,但无疑为这个领域指明了一个极具潜力的方向。对于研究者和工程师而言,关注并验证这一框架在更多机器人平台和复杂任务上的表现,将是下一步值得投入的工作。

本文基于 雷锋网 的公开内容,由 AI 辅助整理改写后发布。

原标题:李飞飞、吴佳俊再联手,打破世界模型和机器人动作的「巴别塔」

阅读原文