对话交大杨理欣:三维时间轴如何为机器人装上“空间时间双导航”?

   发布时间:2026-09-09 10:48 作者:任飞扬

在机器人技术领域,如何让机器人在执行任务时不仅“动手”,还能“动脑”,理解任务意图、把握操作进度并感知环境变化,一直是科研人员努力攻克的关键问题。上海交通大学人工智能学院助理研究员杨理欣带领团队,围绕三维点流展开了一系列创新研究,为解决这些问题提供了新思路。

当前,视觉—语言—动作模型(Vision-Language-Action,VLA)虽能将图像和语言转化为动作,但训练重点多在于模仿专家动作,对任务意图在三维空间的落实、操作进度以及动作对环境的影响等方面关注不足。杨理欣形象地指出,机器人若无法判断自身操作进度,下一步就可能出错。为此,他担任通信作者的LaMP、ChronoFlow-Policy和Track4Action三项研究相继公开,前两项已被ECCV 2026录用,它们均尝试将三维点随时间的运动引入机器人策略,只是切入点各有不同。

LaMP的研究起点是VLA中存在的断层。预训练视觉语言模型擅长识别物体和理解指令,动作头负责输出机械臂命令,但中间缺少明确的几何表征,即机器人、物体等在三维空间应如何运动以完成任务。LaMP在视觉语言主干与动作头之间加入Motion Expert,当前观测和任务指令先经视觉语言主干处理,运动专家再生成部分去噪后的三维场景流表示,取中间隐藏状态通过门控交叉注意力送给Action Expert生成动作块。实验表明,在LIBERO-Plus的七类零样本扰动中,加入运动专家后,LaMP平均成功率从71.6%升至79.3%。不过,LaMP主要验证了当任务语义约束为三维运动表示时,动作策略在空间变化和长程任务上更稳定,并未专门评测自然语言理解和通用因果推理能力。

ChronoFlow则聚焦于解决任务中的时间歧义问题。在交换物体或检查抽屉等任务中,中间画面可能对应多种操作,正确动作不仅取决于当前观测,还与过去交互有关。ChronoFlow以物体与夹爪的稀疏三维关键点为载体,将过去轨迹、当前状态和预测的未来轨迹纳入同一坐标系。策略接收当前RGB-D点云和历史ChronoFlow,扩散模型恢复未来交互轨迹并解码动作。真机实验显示,在Swap-Easy任务中,完整模型和去掉历史的版本在第一阶段成功率相同,但第三阶段完整模型仍为93%,无历史版本只剩20%;Swap-Hard任务中,最终阶段完整模型为61%,无历史版本为11%,历史点流的作用显著。

Track4Action探索的是让VLA在训练阶段吸收三维经验,部署端仅保留必要表征。一段机器人演示包含动作序列和与之对齐的视频,常规VLA主要使用前者,Track4Action试图利用后者。团队选择让VLA学习追踪器形成轨迹前的内部表征,而非显式轨迹。训练时,冻结的Track4World提取场景、运动等特征形成教师表示,VLA学生通过当前信息和可学习的track queries逼近教师表示,并通过门控进入动作头。真机双臂任务中,Track4Action平均整项成功率为67.5%,比无追踪对齐消融版本高25个百分点,仿真结果也呈现类似趋势,说明追踪蒸馏路径能将动作结果信息转化为控制收益。

穹彻智能在这条研究链路中发挥着重要作用,将学术想法放大到工程尺度。上海交通大学人工智能学院与上海创智学院负责学生培养和研究,穹彻智能开放数据、机器人平台等资源。穹彻的数据平台累计数据时长约9.74万小时,覆盖47个城市,为三维轨迹提取等提供了可扩展的入口。同时,穹彻“以力为中心”的研究路线与点流研究形成衔接,团队也在探索将力加入世界模型。

这三项研究正在转化为量产项目,有望提升穹彻策略在不同场景的成功率。这条研究路线改变了演示数据的含义,使旧数据可重新加工成更密集的监督,还为未来VLA形态提供了分层架构思路,即视觉语言模型负责长程任务拆解,世界—动作模型负责连续操作,力觉、触觉等进入快速反应层。接下来,研究将聚焦于第一视角人类数据、灵巧手、高接触任务和自主纠错等方面,进一步检验点流作为中间接口的价值。

 
 
更多>同类内容
全站最新
热门内容
本栏最新