在可变形物体操作中,视觉触觉感知与检索、微调及人工审查相比表现如何?

在可变形物体操作中,视觉-触觉传感优于纯视觉方法,但检索、微调及人工审核在部署中仍发挥着关键作用。

直接答案

视觉-触觉反馈——将视觉与触觉相结合——在精细可变形物体操作中显著优于纯视觉方法,尤其是在插入和打包等任务中。例如,2025年的一项研究在100种不同抓取姿态的终端装配任务中实现了100%的成功率,而模仿学习和在线强化学习(RL)分别仅获得9%和0%的成功率[1]。然而,这些优势也伴随着权衡:它们需要精心设计的训练设置,通常包括人类示范或干预,且最佳结果来自同时使用检索(关键点匹配)或微调以适应新物体的系统[4][5]

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

变化何在:触觉-视觉融合已证实优于纯视觉,成为精细操作的首选方案

多年来,机器人操作几乎完全依赖摄像头。但近期研究表明,在视觉基础上加入触觉感知——即所谓的“视觉-触觉反馈”——能显著提升需要毫米级精度的任务表现,例如插入插头或整理物品。2025年一项关于端子装配(连接电气端子)的研究发现,视觉-触觉策略在100种不同起始位置下实现了100%的成功插入率,而仅依赖视觉的模仿学习策略成功率仅为9%,在线强化学习(RL)策略则完全失败(0%)[1]。这一结果堪称颠覆性逆转:触觉不再是锦上添花,而是处理易碎或可变形物体时不可或缺的关键要素。

同样地,2023年一项关于USB插入——这一经典工业任务——的研究表明,一种视觉-触觉策略在不同抓取姿态下45次尝试中成功45次,而基于50次人类演示训练的行为克隆智能体在45次中仅成功1次,在线强化学习策略(TD3)则在45次中成功0次[5]。这一信息是一致的:当机器人必须依靠触觉摸索才能完成紧密配合时,仅靠视觉是不够的。

检索、微调与人工审核如何融入新格局

检索——利用视觉-触觉图像中的关键点对应关系来引导动作——为完整的策略学习提供了一种更轻量级的替代方案。一项2024年的研究表明,通过从视觉-触觉传感器图像中提取关键点对应关系,机器人能够以毫米级精度完成诸如模块对齐和齿轮插入等精细任务,而无需大量训练或抓取后的调整[4]。这在物体位置未预先定义时尤为有用,因为机器人可以通过将触觉特征与视觉特征进行匹配来“检索”出正确的动作。其权衡之处在于,这种方法在高度多变的任务上可能不如学习型策略那样具备良好的泛化能力,但在部署效率方面表现出色。

微调与人工审查并非与视觉-触觉学习相分离——它们往往内嵌于训练过程之中。例如,2025年的终端装配研究在训练期间使用了人工演示和干预来确保安全性,而2023年的USB插接研究则利用力-力矩传感构建了一条安全的自监督数据采集流程,从而减少了对人工输入的依赖[1][5]。这表明,尽管视觉-触觉策略可以从零开始学习,但在探索过程中仍需人类参与,以避免损坏部件。相比之下,2023年的包装研究采用了一种深度强化学习(DRL)流程,该流程能够从视觉-触觉反馈中学习选择最优动作,其准确性和效率均优于现有方法[2]。因此,答案并非“非此即彼”——最佳系统会将视觉-触觉感知与检索、微调及人工监督相结合,以在精度、安全性和适应性之间取得平衡。

视觉-触觉反馈的最佳适用场景及其仍面临的挑战

视触觉反馈在涉及严格公差、易碎物体或长时程操作的任务中表现尤为突出。2024年的3D-ViTac系统证明,即使是低成本机器人也能执行精细操作,并显著优于仅依赖视觉的策略,尤其是在与易碎物品的安全交互以及涉及手内操作的长时程任务中[3]。关键在于,触觉传感器能提供视觉无法捕捉的密集接触信息,尤其是在物体被遮挡或可变形的情况下。

然而,证据也表明,视觉-触觉策略并非万能灵药。它们需要精心的传感器集成,并且往往需要人工演示或干预,以避免训练过程中出现灾难性失败[1][5]。此外,当策略未使用视觉-触觉数据进行训练时,成功率会大幅下降——正如9%和0%的基线结果所示[1]。因此,尽管这项技术功能强大,但它对硬件和训练基础设施的投入要求相当高。对于物体刚性强且位置固定的任务,基于视觉的简单方法或许仍然够用;但面对可变形或易碎物体,视觉-触觉方法则明显胜出。

关于这些资料来源

本回答基于5项同行评审研究——发表于2023年至2025年间,其中3项为2024年或之后发表,2项发表于Q1–Q2期刊——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的33篇文献。

本文引用的文献

1

基于强化学习的视觉-触觉反馈策略在终端装配中的应用

在2025年一项关于端子装配的研究中,一种视觉-触觉策略在100种不同抓取姿态下实现了100%的成功率,而模仿学习和在线强化学习在利用人类演示和干预进行安全训练的情况下,成功率分别仅为9%和0%。

2

基于视觉-触觉反馈的机器人操作用于物体打包

2023年的一项关于物体打包的研究,采用了一种基于视觉-触觉反馈的操控规划框架,并结合深度强化学习,通过利用视觉、触觉以及力/力矩传感来预测可抓取和可推动区域,在准确性和效率上均优于现有方法。

3

3D-ViTac:利用视觉-触觉传感学习精细操作

2024年的3D-ViTac系统将触觉与视觉数据融合为统一的3D表征,用于模仿学习,使低成本机器人能够执行精细操作,并在易碎物品和长时程手内操作任务中显著优于仅依赖视觉的策略。

4

面向物体操作的视觉-触觉关键点对应

2024年的一项研究利用视觉-触觉关键点对应关系来引导机器人执行精确抓取和放置操作,在无需大量训练的情况下,实现了积木对齐和齿轮插入的毫米级精度,其误差范围低于传统的基于视觉的方法。

5

面向工业插装任务的视触觉反馈策略的安全自监督学习

一项2023年关于USB插入的研究采用了一种安全的自监督视觉-触觉策略,在不同抓取姿态下成功完成了45/45次,而基于人类示范的行为克隆仅成功1/45次,在线强化学习(TD3)则为0/45次。