2026-09-08
导语:近年来具身感知技术不断融合机器人感知语义理解与认知推理等领域成果逐渐形成具有明研究目标和方法体系的研究方向
具身智能(Embodied AI)旨在将人工智能的交互边界从虚拟信息空间拓展至真实物理世界,使机器人具备环境感知、意图理解、行动规划与复杂任务执行能力。在具身智能体系中,感知系统是连接智能模型与具身体的桥梁。它通过对场景的几何结构、物体属性、交互状态以及操作反馈进行实时建模,进而构建支撑策略生成与底层闭环控制的世界模型。因此,感知系统的性能直接决定了智能体在非结构化动态场景下的自主性与泛化能力。
具身感知技术历经了从几何驱动的被动感知到深度学习驱动的语义与交互感知的演进。近年来,大语言模型(Large language model, LLM)与视觉-语言-动作模型(Vision-language-action, VLA)在语义推理和跨模态任务规划方面取得了显著进展,具身感知技术正迈入以具身大模型与世界模型驱动的生成式预测感知新阶段。
鉴于具身感知技术的快速迭代与工程化落地的迫切需求,本文系统梳理了具身感知技术的研究现状与发展趋势。全文结构安排如下:首先,沿着具身感知的发展脉络归纳具身感知技术体系;其次,对比分析遥操作采集、仿真合成与互联网弱标注数据三种数据获取方法的特点、瓶颈与融合趋势;随后,重点讨论多模态融合、跨域语义对齐与物理推断等关键技术的前沿进展;在此基础上,分类梳理典型数据集的构建思路与适用场景。最后,针对当前技术在数据成本、虚实动力学鸿沟、复杂交互鲁棒性及模型实时性等方面面临的关键挑战进行系统分析,并围绕虚实融合数据范式、通用具身基础模型以及端侧感知决策协同等方向,对未来演进路径进行展望。
1 具身感知技术体系
1.1 具身感知的内涵与功能定位
在具身智能体系中,感知信息是智能体理解环境状态、建模物理过程并实现可解释行为生成的先验基础。与传统计算机视觉主要面向离线识别和静态场景理解不同,具身感知强调面向任务需求的动态建模。它通过实时获取场景结构、物体属性及操作反馈,形成支撑策略生成、任务规划与闭环控制的动态世界模型。依托主动感知与多模态数据融合,智能体能够在真实环境中持续校正认知误差并优化控制策略。高质量的具身感知数据不仅能为模型学习提供精准的奖励信号与约束边界,还能有效缩小虚实迁移差异,显著提升智能体在非结构化动态场景下的抗干扰能力与跨任务迁移能力。
1.2 具身感知的层级化结构
现有研究普遍将具身感知划分为几何感知、语义感知、交互感知与预测感知四个层级,如图 1 所示。各层级通过多模态特征融合、状态反馈与动作驱动的主动感知机制紧密耦合,共同构成了支撑机器人在真实物理世界中自主操作与决策的感知体系。

图1 具身感知的层级化结构
几何感知作为基础层,侧重提取环境及物体的形状、深度、位姿与运动状态等几何要素。它通常依赖视觉与测距传感器构建三维场景表征,为机器人的定位、避障与粗粒度操作提供必要信息。该层级的核心目标在于建立稳定的空间几何描述,但难以表征物体的功能属性与交互机理。
在几何信息基础上,语义感知进一步挖掘物体的类别、功能属性与空间关系,为任务规划与高层决策提供更具任务关联性的世界模型。然而,仅靠静态观测难以完整揭示物体的材料特性与交互规律。
为弥补静态观测的不足,交互感知通过融合视觉、触觉与力觉等多模态信息,使机器人在物理交互过程中能够实时解算接触位置、受力状态及局部物理参数。这有效提升了系统在应对视线遮挡、未知物体处理及复杂接触工况下的适应能力。
在此基础上,预测感知基于时序建模与动力学推理,赋予智能体面向未来状态的推断能力。通过对环境演变趋势与动作执行后果的预判,预测感知提升了智能体在非结构化动态环境中的鲁棒性与安全性,为实现长期规划与前瞻性决策提供了关键保障。
1.3 具身感知技术的发展脉络
具身感知技术的发展呈现出由几何建模到语义理解,再到生成式预测的连续演进趋势,其发展脉络如图2所示。整体来看,具身感知技术的迭代与机器人能力的扩展密切相关,可大致划分为以下四个阶段:

图 2 具身感知技术的发展脉络
阶段 1:几何与经典规划为主的被动感知阶段(1970–2010)。
早期机器人感知主要依赖红外、超声波和编码器等低维传感器,侧重于获取环境的几何结构与位姿信息。1970 年代初,斯坦福大学的 Shakey 机器人项目首次在工程上将视觉感知、逻辑推理与行动相结合。随后,以扩展卡尔曼滤波(EKF)、FastSLAM为代表的概率推断方法,以及基于激光雷达和特征视觉的 SLAM 技术相继发展。机器人具备了对三维环境的被动式观测能力,但对物体属性、任务关联语义和交互状态的理解仍受限于算法框架的感知边界。
阶段 2:RGB-D 与多传感融合推动的三维场景理解阶段(2010–2015)。
随着 Kinect等低成本 RGB-D 传感设备的普及,感知能力迈入稠密建图时代。KinectFusion等技术使得机器人能够实时、高保真地重建三维表面几何,增强了对操作对象的识别与抓取规划能力。此阶段的突破在于实现了几何信息与深度信息的有效融合,但感知对象仍局限于静态几何体,与复杂任务语义及精细交互的耦合度较低。
阶段 3:深度学习驱动的语义与交互感知阶段(2015–2022)。
深度学习技术的兴起将机器人感知从纯几何重建推向语义理解与交互感知的融合阶段。此阶段工作广泛引入卷积神经网络以及更复杂的三维特征学习方法,使得物体检测、语义分割、实例级场景理解成为可能。诸如 MaskFusion和 Co-Fusion等方法将语义标签与运动信息嵌入 SLAM 架构,构建出具备对象级语义特征的感知地图。此外,多模态融合研究开始探索视觉与触觉、力觉的近端感知协同,以提升交互任务中的鲁棒性。深度强化学习和模仿学习的引入进一步加强了感知与策略学习之间的耦合,使感知特征可直接驱动决策与动作生成。
阶段 4:具身大模型与世界模型驱动的生成式预测感知阶段(2022–至今)。
近年来,视觉-语言模型(Vision-language model, VLM)和 VLA 模型推动机器人感知进入统一表征与预测推理阶段。这类模型能够将视觉、语言与动作解构并映射至统一语义空间,赋予智能体跨任务、跨场景的泛化能力。 Google 提出的 Robotics Transformer 1(RT-1)在大规模真实机器人数据上进行端到端学习,实现了视觉指令与动作预测的对齐。随后 Open X-Embodiment 数据集及其对应的RT-X 模型进一步证明了跨机器人本体数据训练对提升模型通用性的作用。该阶段感知系统不仅能执行被动观测,更能通过世界模型模拟物理状态演变,为长程规划与复杂交互提供前瞻性的决策机理。
1.4 具身感知技术体系框架
具身感知技术体系框架如图 3 所示。该体系以数据获取为基石,通过虚实结合等方法解决具身数据匮乏问题;以关键技术为核心,通过时空对齐与交互式世界建模赋予智能体深度的物理理解能力;以数据集为导向,建立面向不同任务场景的评价基准。三者互为支撑,形成“数据驱动技术、技术生成数据、任务检验感知”的闭环结构。

图3 具身感知技术体系框架
2 具身感知数据获取方法
数据是具身智能体习得通用操作技能的基石。目前,主流的数据获取方法可归纳为三类:基于真实物理交互的演示采集、基于物理引擎的仿真合成以及基于互联网的跨域知识迁移。如图 4 所示。

图 4 具身智能数据获取方法金字塔
2.1 基于真实物理交互的演示数据采集
遥操作是目前获取真实世界机器人演示数据最直接且广泛应用的方法,其核心优势在于能够消除人机跨域映射的偏差,直接在机器人的本体动作空间内捕获高保真的多模态交互时序数据。根据交互接口与系统架构的不同,现有方法主要分为以下四类,如图5所示。

图 5 遥操作真实数据采集方法
2.1.1 主从式遥操作采集
主从控制通过构建运动映射算法,使从端机械臂精确复现主端操作者的动作,并同步采集运动学与多模态感知数据。斯坦福大学开发的 ALOHA与 Mobile ALOHA系统是该领域的代表方案,如图 6 所示,其通过低成本的“傀儡臂(Puppet Arm)”实现对从端机械臂的直观控制,并且能够同步记录关节位置、基座速度及多视角视觉数据。Google DeepMind基于此优化的 ALOHA2 系统进一步提升了系统的刚度与人体工学性能,使其更能适应复杂的双手精细操作任务。然而,面对装配、打磨等接触丰富的任务,单一的位置映射难以表征隐含的力学交互规律。为此,Bi-ACT将 ACT 算法与双边(Bilateral)力/位置控制结合,利用双边力觉数据提升了智能体在处理不同硬度、质量物体时的表现。为了降低数据采集门槛,GELLO提供了一种低成本、同构化的遥操作框架,允许研究者利用简单关节组件快速构建示教硬件。如图 7 所示。SUJIT等在 GELLO 框架中引入六维力,实现了主端的力反馈交互,显著增强了接触任务的数据质量。在系统集成方面,国内松灵机器人的 Cobot Magic 提供了完整的移动遥操作解决方案,其搭载差速线控底盘(AGV)、高性能机械臂及深度相机,支撑了复杂环境下多模态数据的协同采集。此外,基于VR/AR设备的虚拟遥操作方案,利用空间追踪与增强现实技术,显著降低了人类在复杂三维示教中的空间认知偏差,进一步提升了高自由度轨迹数据的保真度与信噪比。

图 6 Mobile ALOHA

图 7 GELLO

图 8 DexCap动捕系统

图 9 Tesla Optimus
2.1.2 运动捕捉辅助采集
运动捕捉技术利用光学或惯性测量单元提取人体的运动序列,通过重定向(Retargeting)技术将其映射至机器人动作空间。近年来,动捕灵巧手受到了广泛研究。斯坦福大学开发的便携式手部动作捕捉系统 DexCap能采集手指关节位置数据、RGB-D图像数据、6-DoF姿态数据并通过其配套的DEXIL模仿学习算法直接从人手动作捕捉数据训练灵巧机器人技能,如图 8 所示。清华大学开发的Handy Sense则侧重于视觉、力觉与触觉的深度融合,显著提升了双手操作的跟踪精度。由于运动捕捉技术能够直接建立人类动作特征与机器人运动空间之间的映射关系,其与遥操作技术的结合在人形机器人训练中表现出显著优势。Tesla Optimus 利用VR 头显与动捕服构建全身多模态示教系统,通过端到端 Transformer 模型解析人类动作并生成关节指令,实现了人类技能向机器人动作的迁移,如图9所示。国内厂商诺亦腾的惯性动捕设备被广泛应用于人形机器人动作重定向。此外,基于 Isaac Sim等物理仿真平台的动捕数据重定向技术,已成为智元机器人、千寻智能等企业实现跨形态技能迁移的主流途径。
2.1.3 穿戴式设备采集
穿戴式外骨骼与手套型传感器能够紧密贴合人体,高保真地捕获关节运动学、交互力矩及触觉阵列信号,特别适用于高动态响应与力觉感知需求较强的场景。上海交通大学研发的 AirExo 系统是一款低成本、便携式双臂外骨骼平台,能够同步采集关节运动学与 RGB-D 环境数据,如图10所示。其后续版本 AirExo-2进一步简化了机械结构并增强了环境适应性,支持在大规模、野外条件下进行人机交互数据采集。加州大学开发的跨平台视觉外骨骼系统 ACE则展现了极强的兼容性,可推广至人形手、四足夹持器等多种异构系统。在特种医疗领域,TOEDTHEIDE 等研发的遥操作外骨骼通过实时捕获护理人员在复杂交互任务中的全身运动学特征,为医疗辅助机器人的精细操作策略提供了具备生物力学约束的高质量数据支撑。针对工业场景,戴盟机器人研发的便携式外骨骼 DM-Exton,配合视触觉传感器 DM-TacW,如图11所示。其实现了视觉、关节位姿与高分辨率触觉的多模态数据协同感知,这种多模态融合方案有效弥补了微小接触力感知在传统视觉方案中的表征缺失。

图10 AirExo外骨骼系统

图 11 戴盟外骨骼 DM-Exton
2.1.4 野外采集(In-The-Wild)
尽管上述方案能够获取高质量数据,但主从式系统多依赖机器人本体,动捕系统成本高昂,且外骨骼系统需针对特定关节进行复杂适配,这为工业场景下大规模收集演示数据带来了挑战。为此,低成本、易获取的野外采集方案(In-The-Wild)成为近年来的研究热点。斯坦福大学与哥伦比亚大学联合开发的 UMI,如图 12 所示,其通过低成本手持记录装置,实现了交互操作视频与执行动作的离线解耦采集。基于此范式,上海人工智能实验室与上海交通大学等开发了 FastUMI,在快速部署、软硬件集成方面展现出更强大的性能。UMI on Legs与 ForceMimic则分别将该技术推广至腿式机器人移动操作与复杂力控任务。在工业场景下,松灵机器人继 CobotMagic 方案后推出的 Pika 手持式方案集成了鱼眼相机、深度相机及高精度定位单元,实现了多传感器的一体化感知。在工业示教领域,德国 Wandelbots 公司的 TracePen 示教笔与丹麦NordboRobotics 的示教方案,利用定位追踪技术实现了毫米级别的轨迹跟踪精度,如图13所示。国内哈尔滨工业大学和浙江钱江机器人及青岛理工大学也分别针对焊接、涂胶等工艺需求,研发了基于双目视觉靶球或 IMU 的免编程示教笔。此类野外采集方案通过将人类示教轨迹重定向至机器人动作空间,凭借其低成本与高便携性,显著拓展了具身智能数据的覆盖范围。

图 12 UMI夹爪

图 13 TracePen 示教笔
2.2 基于物理引擎的仿真合成数据
基于物理引擎的仿真合成范式凭借其高可扩展性、参数全可控性以及跨平台通用性,已成为弥补具身数据匮乏的主要途径。其技术路线如图 14 所示。该方法通过构建包含高保真渲染与动力学反馈的虚拟仿真环境,利用大规模并行采样机制,实现了对真实物理世界中长尾接触工况的有效覆盖,从而显著降低了具身智能体从感知模型到决策策略的训练门槛。

图14 基于物理引擎的仿真数据生成技术路线
2.2.1 基于并行仿真架构的大规模数据生成
传统串行仿真受限于单机算力,难以在有限时间内积累覆盖长尾分布的交互数据。相比之下,并行仿真范式通过将物理引擎内核与渲染流水线部署于 GPU 计算集群,实现了物理状态更新、多视角感知成像与策略执行的异步解耦与高并发调度。NVIDIA 推出的 Isaac Gym 及其后续版本 Isaac Lab通过解耦仿真计算与渲染 I/O,支持在单机GPU 上实现数千个环境实例的同步采样。这种高通量仿真数据流极大地缩短了强化学习算法的收敛周期,且通过大批量(Batch Size)的策略梯度优化,有效提升了智能体在复杂交互任务中的鲁棒性与泛化性能。基于此类架构的 GR00T通过小样本人类演示实现了合成轨迹的指数级增长,实验结果表明,引入合成数据能够显著优化模型在复杂场景下的决策表现,其性能提升幅度达 40%。在物理交互保真度方面,基于 SAPIEN 引擎的 ManiSkill2基准体系重点突破了流体及柔性体等复杂物理特性模拟,有效解决了非结构化对象在多样化拓扑结构下的操作泛化难题,为工业机器人处理非结构化任务构建了标准化的合成数据基准。典型物理仿真平台如图 15 所示。

图 15 典型物理仿真平台
2.2.2 生成式仿真与数据扩增
为提升合成数据的语义多样性与环境生成效率,生成式仿真(Generative Simulation)逐渐成为具身数据来源的研究热点。GenSim 框架利用 LLM的逻辑推理能力自动编写仿真环境代码并生成多样化的任务指令,显著扩展了训练数据的语义多样性与任务覆盖面。面对工业领域示教数据稀缺的问题,MimicGen提出了一种基于轨迹重定向的数据增强方法,该方案通过在仿真环境中对有限的人类演示轨迹进行物体位姿变换与动作序列重生成,将少样本示教扩展为海量合成演示数据,为复杂长程任务的技能习得提供了高效的增广手段。此外,RoboTwin结合生成式数字孪生技术与3D 生成模型,有效解决了复杂操作任务中数据稀缺和评估标准缺失的问题。
2.3 基于互联网的跨域弱标注数据
互联网中蕴含海量人类操作视频、图文教程及百科知识。通过跨域特征提取与语义映射,将此类弱标注数据转化为具身技能,是赋予机器人“开放世界”认知与理解能力的核心方式。互联网数据采集方法如图 16 所示。

图16 互联网数据采集方法
2.3.1 以人为中心的视频表征学习
人类中心视角的操作视频是机器人学习通用操作技能的天然知识库。Ego4D数据集汇集了全球范围内的大规模第一人称视频,为理解人类操作意图提供了强视觉先验。在此基础上,R3M通过时空对比学习与视觉-语言对齐技术,提取出具备强迁移能力的通用视觉表征。进一步地,VideoDex等研究探索了“由观向动”的技能迁移路径,该方法通过从互联网视频中提取人类手部运动轨迹,并将其重定向至机器人运动空间,实现了无需遥操作即可让灵巧手习得复杂的动态操作技能。
2.3.2 跨形态异构机器人数据的整合与利用
为了打破单一机器人平台的孤岛效应,学术界开始尝试整合跨形态、跨机构的真实机器人数据。Google DeepMind 联合全球多家研究机构发布的Open X-Embodiment数据集,汇集了来自 22 种不同机器人本体、超过500项任务的100余万条真实交互轨迹。基于该大规模异构数据训练的 RT-X 模型表现出优秀的正向迁移能力,有力证明了异构数据混合训练对拓宽感知模型在长尾工况下适应边界的关键价值。
2.3.3 图文知识的常识推理数据转化
大语言模型的逻辑推理能力为具身智能提供了跨域的语义先验与物理常识,实现了从抽象指令向具体感知约束的转化。VoxPoser提出了一种将 LLM 逻辑推理与空间几何表征深度耦合的路径规划方法。该方法利用 LLM 将互联网文本中蕴含的逻辑先验解构并映射为具备物理意义的 3D 概率图 (Value Maps),从而将高层语义目标直接转化为底层的运动学约束。这种方法验证了利用大规模互联网知识库补全具身模型认知先验的可行性,显著增强了智能体在非结构化场景中处理长程复杂任务的逻辑一致性。
2.4 具身智能数据采集方法评价
针对工业复杂工况与多样化任务需求,单一数据获取范式难以兼顾数据规模、交互精度与泛化性能的多重约束。遥操作采集、仿真合成与互联网弱标注数据共同构成了具身基础模型的多源异构数据体系。其中,遥操作采集具备极高的交互保真度与物理规律刻画精度,但受限于采集成本高昂及样本分布狭窄;仿真合成数据凭借极高的样本通量与参数全可控性实现了对长尾工况的有效覆盖,但仍面临显著的虚实动力学偏置(Reality Gap);互联网数据则通过海量的语义先验与物理常识拓展了认知边界,但存在原始信号信噪比低及跨域语义对齐难度大等挑战。三种典型数据获取方法的综合评价对比如图 17 所示。

图 17 具身智能数据采集方法的评价
3 具身感知的关键技术
具身感知技术的发展涉及多模态信息获取、语义理解以及物理交互建模等多个方面。随着相关研究的不断深入,围绕数据获取与同步、跨模态语义对齐、环境与交互过程建模以及系统协同优化等问题,逐渐形成了一系列具有代表性的技术路径。
3.1 多模态数据采集与同步技术
3.1.1 任务驱动的异构传感器配置策略
传统机器人系统多采用基于静态预设的传感器阵列,在面临非结构化任务泛化或边缘算力受限时,极易出现感知冗余或盲区。为此,近年来的研究致力于探索基于任务语义的自适应配置方法。LIU 等提出了 TaskSense 框架,利用 LLM 的逻辑推理能力,根据任务指令自动规划视觉、触觉及深度传感器的调用策略。实验表明,在智能家居的多任务场景中,该方法在保持复杂场景操作成功率的同时,大幅降低了系统边缘侧的通信带宽与特征处理能耗。在高速动态环境下,传统帧相机由于固定的曝光机制,极易产生运动模糊并丢失关键瞬态信息,QI 等指出了一种集成激光雷达、事件相机与柔性触觉的异构感知阵列方案。该方案的核心在于利用异步感知数据的互补特性,并结合自适应加权融合算法,显著增强了系统在极端光照及物理遮挡条件下的感知稳健性。
3.1.2 虚实迁移与合成数据生成方法
真实物理世界中高价值感知数据的采集成本高、可扩展性差。合成数据与虚实迁移正成为具身模型训练的主流数据来源。TIAN 等构建的InternData-A1数据集验证了大规模高保真仿真数据在预训练 VLA 模型中的有效性。为进一步缓解虚实迁移过程中的状态分布偏移,WANG 等研发的EmbodiedDreamer 框架,利用生成式模型合成逼真的机器人操作视频作为训练数据,实验显示,该方法使机器人在真实世界操作任务中的平均成功率提升了 29.17%。在三维场景重建与策略迁移方面,CHHABLANI 等开发 EmbodiedSplat 系统,通过高斯泼溅(Gaussian Splatting)技术重建真实环境并在仿真中训练导航策略,实现了 0.87~0.97 的极高虚实相关性,使真实场景下的图像导航成功率提升了 20%~40%。
3.1.3 复杂环境下的多模态数据同步与质量增强
多模态数据的时间对齐、噪声抑制与外参标定是具身感知系统可靠性的基础。ZHAO 等发布的M2CS 数据集针对复杂交通与作业场景,提供了微秒级同步的多模态时空基准,为异构标定提供了标准化支撑。针对传感器噪声与数据丢包问题,CAI等提出了一种基于深度学习的跨模态感知增强模型。该模型利用语言模态的结构化信息引导视觉特征的去噪与补全,有效强化了机器人在弱纹理、强干扰环境下的空间理解深度。
3.2 开放世界的多模态表征与语义对齐技术
3.2.1 基于基础模型的通用感知表征学习
基础模型正逐渐演变为开放世界感知的核心表示层,其语义泛化能力显著优于传统卷积特征。RADFORD等开发的 CLIP 模型通过 4 亿级图文对实现通用视觉表示,赋予了机器人对长尾目标及未见类别的识 别能力。 DRIESS 等提出的PaLM-E 进一步将大型语言模型与视觉感知深度融合,构建了多模态具身语言模型,在 9 项真实机器人任务中展现出卓越的指令理解与迁移能力。与此同时,以 Flamingo为代表的视觉语言模型利用上下文学习机制,显著降低了特定任务对数据标注的依赖。
3.2.2 VLA 模型跨模态语义对齐
为了实现感知与决策的端到端贯通,真实世界机器人系统需要将视觉感知、语言指令与动作空间进行统一表征与对齐。BROHAN 等提出的 RT-1和 ZITKOVICH 等提出的RT-2 体系开创了 VLA模型的先河。其通过动作词元化 (Action Tokenization),实现了视觉、语言与离散动作空间的端到端映射。为了进一步提升特征编码效率,SHRIDHAR 等提出的 Perceiver-Actor利用Transformer 架构统一编码视觉、语言与本体状态。针对灵巧操作的精度需求,KIM等发布的OpenVLA 模型通过大规模指令微调,在29个真实机器人任务上的平均成功率超越RT-2-X模型。而LI 等提出的 CogACT 模型则引入了认知协同机制,利用感知与动作的深度耦合进一步提升了操作性能,在仿真评估中超越 OpenVLA 约 35%,在真实世界任务中提升了约55%。然而,简单地将连续动作离散化为文本 Token,会损失高频控制信号的精度。Physical Intelligence 团队发布的模型摒弃了传统的离散动作 Token,创新性地将 VLA 的大语言模型骨干与流匹配技术相结合,实现了语言语义特征与连续动作轨迹分布的直接对齐,有效解决了高频物理闭环中的轨迹抖动难题。综上所述,VLA模型通过构建统一的语义-动作对齐空间,实现了感知与执行的深度贯通,其跨模态映射的典型原理与信息流向如图18所示。

图 18 VLA 模型跨模态映射原理图
3.2.3 具身先验知识的表示约束与融合机制
尽管基础模型具备强大的语义理解能力,但缺乏对物理世界的交互经验。因此,先验知识成为提升感知精度的重要手段。YE 等提出了基础强化学习框架,将通用的操作策略、价值函数与物理约束作为先验知识融入感知模型,显著提升了样本效率与探索安全性。GHASEMIPOUR 等则探索了利用预训练模型的常识知识进行自我改进的机制,使机器人在与环境交互中不断修正感知偏差。
3.3 面向世界模型的物理建模与预测感知
3.3.1 语义化三维环境重构方法
从高维视觉观测到结构化三维空间的语义映射,是具身智能实现精准操作任务的核心前提。MILDENHALL 等提出的神经辐射场(NeRF)通过隐式连续函数实现了复杂场景的高质量几何与外观建模,克服了传统离散点云的稀疏性缺陷,但其推理速度难以满足机器人实时需求。KERBL 等提出的 3D Gaussian Splatting 技术,以其显式的场景表达与毫秒级渲染能力,引发了具身感知领域的“实时 3D 革命”。LI等进一步提出的 SGS-SLAM 系统,通过结合语义分割与 3DGS,在 Replica 等标准基准上实现了 28.5 dB 的峰值信噪比,并支持实时空间语义查询。
3.3.2 场景物理属性的多模态感知与估计
为了实现精细的柔性操作与力控,机器人感知系统需要从视觉观测中推断物体的质量、摩擦系数、柔顺性等物理属性。XU 等提出的 DensePhysNet能够通过分析单目视频中的形变信息估计物体的弹性参数。SURESH 等提出的 NeuralFeels 系统,创新性地结合视觉与触觉传感器,利用神经场实时联合优化物体的几何形状与物理属性。在手内旋转任务中,该系统能够将物体姿态估计误差降低至 5 度以内,并准确推断出物体的接触刚度,验证了多模态融合在物理属性感知中的优势。这些方法推动了具身感知从单纯的外观识别转向深层的物理理解。其交互感知与物理属性估计流程如图 19 所示。

图 19 交互感知与物理属性估计流程图
3.3.3 动态环境预测与时空演化
在动态非结构化环境中,准确预测环境的时空演化趋势是机器人规避风险、进行前瞻规划的前提。LIN 等较早探索了基于 Predictive-CNN 的像素级视频预测方法,但近年来,随着生成式人工智能的发展,该领域已从确定性的像素推演转向了基于生成式世界模型的交互模拟。针对长时程的动态演化,YANG 等提出的 UniSim 利用神经特征场构建了闭环传感器模拟器,使机器人能够通过反事实推理在仿真中预演稀有的长尾风险场景。在通用交互预测方面,BRUCE 等提出的 Genie 通过时空Transformer 在海量未标记视频中学习潜在动作空间,实现了对并未真实发生的未来轨迹的高保真生成与控制。
3.4 感知系统协同与鲁棒性增强技术
3.4.1 基于信息增益的主动感知策略
为了消除环境感知的不确定性,机器人需主动调整视角或通过试探性交互获取信息。WANG 等提出的好奇心驱动(Curiosity-driven)具身学习框架,通过将 VLM 的预测误差转化为内在奖励信号,有效引导机器人主动调整观测视角以获取关键环境信息。SHARAFELDIN 等提出的基于预测编码(Predictive coding)的主动感知架构,通过最小化感知不确定性来驱动探索,在非结构化场景的物体搜索任务中显著降低了规划路径的复杂冗余度,提升了智能体在信息匮乏环境下的感知效率。
3.4.2 感知-决策协同与端到端优化
感知与决策的深度协同是提升系统响应速度与一致性的关键,传统的感知与规划分层架构正逐渐向端到端协同优化演进。Google DeepMind 发布的RT-X 框架进一步验证了分布式、跨机器人的端到端协同学习范式,证明了大规模数据驱动下感知与决策联合优化的巨大潜力。ZHANG 等提出的Uni-Navid 模型架构,如图 20 所示。其打破了传统感知-规划-控制的分层架构,将导航任务统一在一个端到端的多模态 Transformer 架构中,实现了感知特征提取与决策指令生成的联合优化,大幅降低了模块间的累积误差。

图 20 Uni-Navid 模型架构图
3.4.3 复杂场景下的鲁棒性与长尾问题处理
面对工业级应用中频繁出现的极端光照、动态遮挡及长尾异物干扰,感知系统的鲁棒性设计是保障作业安全的前提。针对数据集分布极不平衡导致的模型过拟合问题,通过解耦特征表征与分类器重训练的方法,能够显著增强模型对稀有类别工况的捕获能力。针对物理环境持续演变的特性,持续学习(Continual learning)机制与稀疏激活的混合专家模型(MoE)自适应架构的引入,赋予了感知系统在线修正认知偏差与知识积累的能力,从而全面提升了智能体在非结构化动态工况下的感知能力。
4 具身感知数据集
具身智能策略的学习与泛化高度依赖于数据集的规模、模态多样性以及物理交互的丰富度。随着通用机器人基础模型(RFM)范式的兴起,数据集构建的重心已从单一任务导向转向跨平台、多模态与大规模融合。本节依据数据来源与应用目标,将主流数据集划分为通用具身模型基础数据集、精细操作与接触交互感知数据集、仿真合成与算法评测基准数据集三大类,并系统梳理其演进特征。具身感知数据集演进时间轴如图21所示。

图 21 具身感知数据集演进时间轴
4.1 通用具身模型基础数据集
通用具身模型基础数据集旨在突破机器人本体差异带来的数据割裂问题,通过对多形态机器人操作数据的聚合与标准化表示,支撑具备跨具身泛化能力的 VLA 模型训练。该类数据集通常覆盖多种机器人平台和任务类型,强调数据规模、模态完整性以及跨平台一致性。代表性通用具身模型基础数据集如表 1 所示。
表 1 跨平台通用基础模型数据集

RT-1通过约 13万条家庭与厨房场景操作片段,验证了 Transformer 架构在真实机器人控制任务中的可行性,是通用操作模型早期的重要数据基础。
Open X-Embodiment是该方向的代表性工作之一,由全球21家顶尖机构联合发布。该项目聚合了 60 余个数据集,涵盖 Franka、UR5、Kuka 等多种本体。其提供了包含 RGB 视觉、7 维动作指令及语言描述的100万条真实轨迹,为 RT-X 等模型在零样本迁移能力上的突破奠定了数据基础。
在工业与人形机器人领域 AgiBot World Colosseo展示了通用策略在真实复杂场景中的大规模采集潜力。该数据集依托 100 余台 AgiBot G1人形机器人并行采集,获得超过100万条轨迹,涵盖视觉、全身控制、灵巧手状态及触觉反馈等多种模态,任务聚焦于精细操作与多机器人协同,体现了工业界在通用人形机器人策略上的探索方向。
Galaxea Open-World Dataset则面向开放世界移动操作场景,通过 Galaxea R1 Lite 机器人在住宅、零售和办公等 11 类真实物理环境中采集约 10万条轨迹,覆盖 150 种任务和 1600 余种物体,其核心价值在于记录了高度动态、非结构化环境下的感知与决策过程,为解决长序列任务决策问题提供了数据支撑。RoboMIND由北京大学等高校联合发布,提出了面向多具身数据采集的规范化流程。该数据集采用统一遥操作平台,在 4 种不同形态的机器人上采集约 10.7万条轨迹,其显著特点在于显式引入失败演示,为提升大模型在复杂任务中的纠错恢复能力与决策鲁棒性提供了重要支持。
DROID通过在全球 18 个实验室使用标准化硬件进行分布式采集,获得7.6万条轨迹,强调环境多样性与外观变化,对提升模型在复杂真实环境中的鲁棒性具有重要意义。
BridgeData及其后续版本 BridgeDataV2通过 VR 遥操作与低成本硬件采集机制,在多环境中获取厨房操作数据,成为评估模型在杂乱环境下泛化能力的重要基准。
4.2 精细操作与接触交互感知数据集
相较于通用操作数据集,精细操作与接触交互感知数据集更加关注复杂物理交互过程的刻画,强调力觉、触觉等多模态信息在精密操作中的作用。该类数据集通常规模相对有限,但在物理真实性和交互细节方面具有不可替代的优势。代表性精细操作与接触交互感知数据集如表 2 所示。
表 2 精细操作、触觉与全身控制数据集

RH20T是典型的接触丰富操作数据集之一,包含约 11万条操作序列,覆盖 140 余项对力控精度要求较高的技能。其高频同步采集 RGB-D、六维力、指尖触觉及音频信息,为多模态融合感知与精细操作算法研究提供了重要实验基础。
RS-ManiRW 数据集依托睿尔曼智能的数据采集平台,包含超过 100万条真实机械臂操作数据,重点关注视觉与末端力控信息在工业和医疗等场景中的应用潜力,体现了低成本机械臂在柔顺控制与智能化方面的发展方向。
LET 数据集由乐聚机器人与国地中心联合发布。在1∶1 复刻的16 个真实场景中采集了全尺寸人形机器人的行走与操作数据。该数据集重点在于缩小人形机器人从实验室到真实应用场景的现实差距(Reality gap),解决现实场景适应与全身运动规划问题。DexCanvas是灵巧智能发布的垂直领域数据集,专注于解决灵巧手操作数据稀缺的问题。通过灵巧手采集了大量精细物体的抓取与重定向(In-Hand manipulation)数据,核心模态涵盖高维手指关节状态和指尖触觉阵列,为训练高自由度灵巧手控制策略提供了关键数据支撑。
RoboSet 由卡内基梅隆大学发布,通过动觉示教与遥操作相结合的方式,在厨房场景中采集约 2.85万条轨迹,并提供丰富的物体物理属性信息。
4.3 仿真合成与算法评测基准数据集
此类数据集基于物理仿真生成,兼具海量数据规模、多模态精准标注与物理参数完全可控等特性,是填补真实数据缺口、构建算法评测基准的重要基石。代表性仿真合成与算法评测基准数据集如表 3所示。
表 3 仿真合成与算法评测基准数据集

Habitat仿真平台结合Matterport3D与HM3D等大规模场景数据集,构建了室内具身导航与交互的测试基准。该系列数据集基于数千个真实室内空间的高保真 3D 扫描重建,全面支持视觉导航与复杂物体重排(Rearrangement)等任务。其通过提供的RGB-D 多模态渲染,为提升具身模型在非结构化环境下的语义理解与长时域规划能力奠定了基础。BEHAVIOR-1K数据集由斯坦福大学发布,依托 OmniGibson 环境,实现了从纯视觉仿真向物理交互的跨越。该平台全面支持流体、热力学变化及柔体形变等复杂物理过程模拟,通过提供真实的多维物理反馈,为评估和训练具备复杂物理常识的家庭服务机器人确立了新标准。
ManiSkill2基于 SAPIEN 物理引擎构建,包含2 000 余项操作任务。该数据集提供完整可观测的物理状态真值,如物体拓扑结构与摩擦参数等,主要用于评估模型在非结构化对象操作中的泛化能力。
RLBench基于 CoppeliaSim 引擎开发,提供一套包含 100 个完全独特的手工设计任务基准。该数据集对演示数据需求极低,通过强调任务多样性与视觉一致性,成为评估强化学习与模仿学习算法在少样本情况下泛化能力的标准。
Meta-World斯坦福大学等机构发布,专注于多任务强化学习与元学习。该数据集包含 50 个互相关联的机械臂操作任务,例如开门、推球和按开关。虽然其视觉渲染较为简化,但任务参数化设计完善,是研究智能体如何从单一任务快速迁移学习至新任务的首选基准。
RoboNet由加州大学伯克利分校发布,是早期的具身泛化代表性数据集。该数据集汇集了来自7 种不同机器人平台的 1500万帧视频数据,主要用于基于视觉预测的策略学习研究,为跨平台泛化研究奠定了基础。
RoboTurk由斯坦福大学发布,采用众包模式采集数据。远程工作者利用手机控制模拟机器人,在 MuJoCo 仿真环境中完成操纵任务。其核心模态包括 6 自由度机器人轨迹数据、实时场景视频流、手机振动触觉反馈及任务元数据。系统在 22 h 的使用时间内采集了137.5 h操纵数据与2200次以上的成功任务演示,有效支撑了大规模机器人模仿学习的研究。
5 挑战与难点
针对当前具身感知技术在走向工业级泛化过程中面临的共性问题,本文认为其核心瓶颈在于高维语义空间与低维高频物理交互空间之间的维度错位。这种错位贯穿于数据基建、物理推断与系统协同的各个层级,导致感知模型在实验室环境中表现优异,但在真实物理接触中极易失效。具身感知技术瓶颈如图 22 所示。

图 22 具身感知技术瓶颈分析
5.1 数据基础设施匮乏与虚实动力学壁垒
具身感知模型在向工业级复杂场景泛化过程中受制于底层数据基础设施的割裂。当前,行业内尚未形成统一的数据采集与标定标准化体系。不同平台的空间追踪器坐标系定义、深度相机的内外参标定法则存在非直观的偏差,导致海量多源数据呈现严重的表征不对齐,难以支撑十亿级参数基础模型的大规模预训练。同时,现有数据集普遍偏向于成功的理想操作轨迹,普遍缺失操作失效、碰撞恢复、系统奇点边界等异常工况的特征样本。异常训练样本的缺失限制了感知模型对物理安全边界的泛化学习能力。此外,基于物理引擎的合成数据方法虽能缓解样本稀缺,但在模拟柔体形变、微观接触与非线性摩擦时,受限于传统物理引擎数值离散化求解的算力与精度上限,无法彻底消除虚拟表征与物理世界间的动力学偏差。这种固有的虚实迁移鸿沟会导致感知与控制模型在向物理样机部署过程中性能下降。
5.2 开放世界下的感知泛化与隐含物理属性推断
具身感知模型在开放世界中的泛化瓶颈在于表象特征与底层隐含物理属性的映射断层。尽管大规模视觉预训练模型在静态图像的语义理解上表现优异,但在真实的灵巧物理交互中,诸如面对高反光金属零件、透明介质或低纹理目标时,单一时刻的视觉观测往往存在严重的物理遮挡与深度信息缺失难题。同时,高自由度柔性体在受力接触时的复杂拓扑大变形,也使得单纯的视觉追踪算法难以维持稳健的空间状态估计。此外,直接决定操作稳定性的隐含物理属性通常无法通过视觉信息直接获取。例如,在执行具有强物理接触的精细柔顺装配任务时,系统必须实时推断物体的质量分布、接触刚度与局部摩擦系数,这高度依赖多模态反馈信号在时间序列上的深度联合表征。然而,当前主流具身感知模型往往过度依赖视觉与语言模态的统计学共现概率,缺乏基于第一性原理的动力学推理框架。这种物理常识缺失与跨模态时序解耦能力不足,极易发生抓取滑移、应力过载或破坏性碰撞。
5.3 面向高频物理闭环的感知决策协同与系统鲁棒性
在涉及频繁物理接触的真实交互场景中,大模型推理的迟滞性与底层伺服的高频响应需求构成了具身感知的核心工程矛盾。传统的感知、规划与控制分层架构存在固有的时序延迟,大规模视觉语言动作预训练模型的推理计算负担极重。目前主流感知模块输出的环境状态更新频率在 10~30Hz 区间,难以直接融入工业级机械臂底层 500~1000Hz 的高频伺服控制回路。这种慢感知与快执行的严重时序错位,不仅引入了纯滞后控制环节,更破坏了底层伺服的稳定性边界,导致智能体在面对动态遮挡或突发干扰时,易因反馈不及时而丧失局部操作稳定性。此外,异构传感器间在时间戳同步上存在天然差异,高频域下的力触觉信号与低频视觉信号的特征级对齐误差,在高速物理交互中会被底层闭环机制急剧放大,进而引发机械臂高频抖动甚至不可控的操作安全隐患。
6 未来发展趋势
为突破上述技术瓶颈,未来具身感知将从离散的算法模块,迈向数据范式、模型结构与硬件基础设施的深度协同演化。结合当前产业诉求,具身感知技术的未来演进路线如图 23 所示,其核心破局路径将围绕以下三个维度展开。

图 23 具身感知技术的未来演进路线
6.1 虚实融合的数据范式与标准化基建
面向工业级智能体对海量、高质量交互数据的需求,具身感知的数据获取方式将由分散的实验室采集逐步转向工业化的数据工厂模式。未来,国家级标准化数据基建的落成将为通用感知模型的预训练确立统一的物理底座。目前,北京人形机器人数据训练中心对标准化场景动作库的构建,以及上海国家地方共建人形机器人创新中心对异构机器人训练场的布局,标志着我国正在构建跨本体、跨平台的标准化采集体系。这种基建化的思路,辅以智元机器人(Agibot)等企业级真机阵列的并行采样,将在未来彻底打破传感器标定与动作表征在底层协议上的割裂。在此基础上,虚实融合的演进路径将转向可微分物理仿真与真实反馈的深层耦合。未来,仿真环境将不再仅仅是真实世界的模拟器,而是具备自校准能力的数字引擎。通过将真实物理交互中的微观接触应力、非线性摩擦及柔性体大变形数据实时反向注入可微分物理仿真器,从根本上消除虚实动力学鸿沟。这种闭环数据获取方法,将允许智能体在极低成本下覆盖长尾分布的极端工况,在算法层面构建起应对非结构化复杂场景的认知鲁棒性。
6.2 通用具身基础模型与物理世界建模
构建具备跨形态泛化能力与深层物理理解的通用具身基础模型,是实现智能体感知跨越式提升的必然趋势。未来的感知架构需在统一的高维特征空间内,深度融合多视角视觉图像、自然语言指令、高频力触觉与机器人本体运动学等多模态异构数据,从底层逻辑上消解模态间的语义壁垒。同时,具身感知将从被动响应式观测向基于机理的生成式预测方向跨越,利用动力学推理构建交互式世界模型。该类模型赋予了机器人对目标运动趋势、接触应力分布及隐式物理属性的时空动力学推演能力。借此,智能体能够在进行真实物理交互之前,依托虚拟预测完成反事实推理与长时域任务规划。此外,引入持续学习与在线自适应机制,使模型在长期运行中不断修正感知偏差,成为保障智能体在开放未知场景下实现自主认知与物理稳健适应的重要 路径。
6.3 端到端感知决策协同与端侧高效部署
针对真实动态物理场景下的高频鲁棒控制需求,感知与决策的端到端联合优化能够从系统架构层面有效提升操作的整体稳定性。为彻底消除大模型推理延迟与底层伺服控制回路之间的频率级差,未来研究将着重探索采用连续流匹配等生成机制替代传统的离散动作词元映射,生成更符合机器人动力学特性的平滑连续控制指令。与此同时,高性能VLA 模型在边缘侧的实时落地,将依赖于软硬件一体的协同优化。一方面,利用混合专家模型(MoE)的稀疏计算特性,结合低秩自适应微调(LoRA)与跨模态知识蒸馏等前沿技术,大幅压缩模型的推理算力需求。另一方面,通过构建感知特征与动作执行高度紧耦合的专用加速算子,赋予感知系统对复杂柔性交互、动态遮挡等突发外部扰动进行毫秒级在线调节的能力。
7 结论
具身感知是机器人理解物理世界的基础,其建模质量直接决定了智能体从虚拟策略向真实交互跨越的成效。从技术演进脉络看,具身感知已由早期的几何驱动被动观测,历经语义理解与多模态融合的阶段迭代,正加速迈向由具身基础模型与世界模型驱动的生成式预测感知新范式。在数据层面,通过对比分析遥操作采集、仿真合成及互联网弱标注数据三类主流获取方式的优势与局限,归纳得出多源数据协同融合是支撑通用感知基础模型训练的必经路径。在技术层面,围绕多模态数据同步、VLA跨模态语义对齐、隐含物理属性推断以及世界模型驱动的动态预测等关键问题,系统总结了当前研究进展与技术趋势,构建了具身感知由“感知外观”向“理解物理”再向“预测演化”递进的整体技术框架。
尽管相关研究已取得显著进展,但具身感知在迈向工业级通用智能体的进程中仍面临多重挑战,具体体现在多模态异构数据获取成本高昂、虚实动力学迁移壁垒难以消除、隐含物理属性的推断与解释能力不足,以及端到端大模型在高频控制闭环中面临的实时性与鲁棒性瓶颈。这些问题表明,具身感知的进一步突破已无法单纯依赖模型参数尺度的扩增或单一算法的局部优化,而是必然取决于数据获取范式、认知基础模型与底层系统架构的全面协同演进。
展望未来,具身感知技术的演进将由静态的表象特征提取全面转向深层物理因果建模与端到端高频控制协同。通过在虚实融合数据阵列的规模化量产、生成式世界模型的反事实前瞻推演,以及基于混合专家架构的端侧实时推理等核心技术节点取得实质性突破,具身感知将彻底打破智能体从受控实验环境向非结构化真实物理世界迁移的泛化壁垒,最终为新一代工业智能制造与复杂动态交互场景提供绝对安全与高度鲁棒的核心技术支撑。
原文刊载于《机械工程学报》2026年8月 作者:韦锦宇 闫虹坤 李栋 华天宇 常皓楠 李峰 王振华 孙立宁 张驰 陈国栋
暂无评论,等你抢沙发