让机器人学会“手感”:TacForcing让精细操作告别“闭眼”困境

   时间:2026-09-09 04:53 来源:快讯

想象蒙住双眼操作滴管:手指能感受到液体流动带来的压力变化,但眼睛看到的画面几乎毫无不同。上海交通大学邓志杰实验室通过实验揭示了这一现象背后的数据差异——在40步操作中,视觉信号的余弦距离仅变化0.005,而触觉信号的波动幅度高达0.55。这种触觉与视觉的"时间错位",正是当前机器人精细操作面临的核心挑战。

主流的视觉-语言-动作(VLA)模型采用"预生成动作块"模式,即根据初始画面生成连续动作序列后闭眼执行。这种模式在均匀材质场景中尚可运行,但面对触觉信号剧烈变化的场景时,模型因缺乏实时反馈而逐渐偏离真实接触状态。研究团队将此比喻为装修师傅仅凭进门时的墙面观察制定全程施工计划,若遇到材质不均的墙面,后续操作必然失误。

针对这一痛点,研究团队提出TacForcing框架,其核心创新在于将传统动作专家改造为"流式动作专家"。该模块将50步动作拆分为10个5步小块,采用类似面包烘焙的分批处理机制:靠前的动作块优先生成并执行,后续块保持半成品状态,根据最新触觉反馈持续优化。这种设计通过流匹配技术实现,每个动作块拥有独立的时间进度参数,避免传统方法中所有步骤同步推进的僵化模式。

为解决触觉信息时效性问题,研究团队开发了执行感知触觉注意力(EATA)机制。该机制通过注意力掩码确保最新触觉数据仅影响即将执行的动作块,防止过时信息干扰后续步骤。实验数据显示,移除EATA后系统性能显著下降:仿真环境成功率从60%跌至51%,真实场景中更是从69%骤降至48%,印证了触觉反馈时效性对操作精度的决定性作用。

训练阶段采用动态进度采样策略,随机模拟不同执行阶段的中间状态,确保模型适应"半成品动作+实时触觉"的推理场景。损失函数仅计算未完成动作的误差,已执行部分不再参与参数更新。这种训练-推理对齐策略使模型在仿真环境六个接触密集型任务中取得65%的平均成功率,在真实场景的液体转移任务中成功率达50%,较基线方法提升超30个百分点。

实验特别设置了"固定触觉"对照组,该组在动作全程仅使用初始触觉数据。结果显示其仿真成功率降至42%,真实场景成功率仅31%,甚至低于完全不用触觉的模型。这一反直觉结果揭示:过时的触觉信息非但无益,反而会因误导模型决策而降低性能,凸显了动态更新机制的重要性。

该研究对动作块大小(block size)的参数选择保持开放态度。当前采用固定的5步拆分策略,但更细粒度的拆分虽能提升触觉响应灵敏度,却会增加计算开销;反之则可能重蹈传统方法的覆辙。这种灵敏度与效率的权衡关系,为后续研究提供了新的探索方向。

在真实场景验证中,TacForcing展现出显著优势:擦白板任务成功率达82%,瓶子直立任务成功率76%,均领先基线方法15个百分点以上。特别是在需要精确力度控制的液体转移任务中,其50%的成功率较次优方案提升31个百分点,直观证明了实时触觉反馈在动态操作场景中的关键价值。

 
 
更多>同类天脉资讯
全站最新
热门内容
媒体信息
新传播周刊
新传播,传播新经济之声!
网站首页  |  关于我们  |  联系方式  |  版权隐私  |  RSS订阅  |  违规举报 鲁公网安备37010202700497号