具身智能从业学习(一)新人的系统性知识框架与学习路径
2026/9/3 6:46:25 网站建设 项目流程

一、行业通用技术架构:一体两翼三层

具身智能之所以成为当前人工智能和机器人领域最受关注的方向之一,并不是因为它单独代表了某一种新算法,而是因为它试图解决一个更完整的问题:如何让智能系统真正进入物理世界,感知环境、理解任务、执行动作,并在持续交互中不断优化自身能力。也正因如此,具身智能从来不是一个单点突破的行业,而是机器人本体、感知系统、认知决策、运动控制、软件架构、数据闭环与工程部署共同作用的结果。

从行业视角看,理解具身智能最合适的方式,仍然是将其放在一个完整系统中讨论。业内常用的“一体两翼三层”框架,至今仍有较高共识,因为它比较准确地概括了这个行业的技术组织方式。

  • 一体:指机器人本体,是整个系统的物理载体。

  • 两翼:指智能大脑运动小脑,分别对应高层认知决策与低层实时执行。

  • 三层:指感知层决策层执行层,描述了信息如何从环境进入系统、再转化为动作输出。

这个框架的意义不在于概念本身,而在于它能帮助我们清楚地区分:哪些技术负责“理解世界”,哪些技术负责“在物理世界中把事情做成”。

二、机器人本体:具身智能成立的前提

任何具身智能系统,首先都必须有一个可被控制、可被感知、可与环境发生物理交互的实体。因此,机器人本体不是附属条件,而是整个系统成立的前提。机械臂、移动机器人、四足机器人、人形机器人、轮足平台、仓储机器人、服务机器人等不同形态,本质上对应的是不同任务边界和不同能力约束。机器人能否进入狭窄空间、能否稳定行走、能否完成精细抓取、能否承受长时间运行,这些问题都首先由本体能力决定。

从技术上看,机器人本体至少涉及以下几个方面:

  • 机械结构与自由度配置:例如串联结构、并联结构、多指灵巧手、移动底盘、人形关节链设计(如HRP系列、ASIMOAtlas)等。

  • 执行机构与驱动系统:例如伺服电机、无刷直流电机、减速器(谐波/RV)、驱动器、液压系统(Atlas采用液压)、气动系统、形状记忆合金等。

  • 电源、散热与可靠性设计:直接决定系统的续航、稳定性和长期运行能力,涉及电池管理系统、热管理方案等。

  • 传感器体系与整机标定:包括相机、深度相机(如Intel RealSense)、激光雷达(机械式/固态/OPA)、IMU(如BMI088MPU6050)、编码器、力/力矩传感器(如ATIKistler)、触觉传感器(如GelSightDigit、电阻式/电容式)等的选型、布置、同步与联合标定。

这部分内容看似偏硬件,但实际上与后续算法效果高度相关。很多系统在实验室中表现良好,一旦进入真实环境就快速退化,原因往往不在模型本身,而在于本体刚度不足、执行器响应不稳定、传感器噪声偏大、时间同步不准,或者标定误差累积过多。因此,即便是偏算法方向的从业者,也必须具备基本的机器人学素养,至少要理解运动学、动力学、坐标变换、刚体位姿表示、雅可比矩阵、逆运动学、多体系统动力学等基础内容。具身智能所有的高层能力,最终都要映射到一个有惯性、有摩擦、有时延、有控制频率限制的真实物理系统上。

三、智能大脑:感知、理解、规划与高层决策

智能大脑的职责,不是直接控制电机,而是负责理解环境、理解任务、形成目标,并将高层目标拆解为机器人可以执行的结构化任务链。它决定的是“做什么、为什么做、先做哪一步”,因此它更接近具身智能中的认知系统。

从行业实践来看,智能大脑通常由几个彼此衔接的能力模块构成:

  • 多模态感知与场景理解

  • 定位、建图与空间认知

  • 任务理解与语义决策

  • 大模型、多模态模型与 VLA

  • 世界模型、记忆与长期推理能力

3.1 多模态感知与场景理解

机器人进入真实环境后,首先要回答的是“我面前是什么”。这不仅包括识别目标物体,还包括理解其位置、姿态、可交互性、周围障碍物、可通行区域以及当前场景与任务之间的关系。因此,计算机视觉和三维感知始终是具身智能的核心基础能力。

核心技术模型与算法:

  • 目标检测YOLO系列(v3/v5/v8/v9/v10)、RT-DETRFaster R-CNNDETR

  • 图像分割SAMSEEMOneFormerU-Net

  • 位姿估计PoseCNNPVNetDOPEFoundationPose

  • 三维感知:点云滤波/聚类/配准/分割,PointNet++VoxelNetPFN

  • 视觉基础模型DINOv2CLIPSigLIP

  • 底层工具链:相机模型、OpenCV、图像处理基础

真正重要的,并不是简单知道某个模型是否流行,而是理解如何把图像、深度、点云、惯性信息和接触信息统一组织成一个可供规划和决策使用的环境表达。对从业者而言,这部分通常意味着需要系统接触:深度学习基础(CNN、Transformer)、2D/3D感知任务的训练与数据标注、点云处理的基本方法等。

3.2 定位、建图与空间认知(SLAM)

如果说场景理解解决的是“我看到了什么”,那么定位与建图解决的就是“我在哪里,以及周围环境是什么结构”。没有稳定的空间认知能力,机器人就无法形成可靠的自主行动能力。也正因为如此,SLAM 一直是具身智能行业中的基础能力

在众多 SLAM 路线中,激光雷达 SLAM在大量真实场景里仍然具有非常高的工程价值。它在仓储、配送、巡检、园区服务、室内移动机器人等场景中,能够提供相对稳定的空间几何感知能力,不依赖纹理特征,对光照变化相对不敏感,比纯视觉路线更稳健。

理解激光雷达 SLAM 需要把握完整技术链路:

  • 激光雷达原理与数据结构:量程、线数、刷新率、噪声模型(机械式/固态/OPA)

  • 点云预处理:滤波、下采样、去畸变、特征提取

  • 前端里程计估计:利用相邻帧或局部地图匹配估计位姿,典型方法有ICPNDTGICP

  • 回环检测与后端优化:消除累计误差,常用图优化库g2oGTSAMCeres

  • 多传感器融合:激光雷达 + IMU + 轮速计 + GPS,提升鲁棒性

行业常见方案CartographerLOAMLeGO-LOAMFAST-LIOLIO-SAMRTAB-MapORB-SLAM系列。会“调用某个开源仓库”并不等于真正理解 SLAM,真正的能力在于理解它为何能工作、在什么场景下会失效、又该如何调参与改进。

3.3 任务理解、语义决策与大模型能力

具身智能与传统机器人最重要的区别之一,在于它不再只执行预先写死的程序,而是越来越强调在开放环境中理解自然语言目标、形成任务链并进行动态调整。例如“去厨房拿一瓶水”“把桌面整理干净”“把地上的箱子搬到门口”这类指令,表面上是语言输入,实际上对应的是目标识别、环境搜索、路径规划、操作策略、异常处理和反馈闭环的组合。

因此,智能大脑还必须具备较强的语义理解和任务分解能力。自然语言理解、语义grounding、任务规划、行为树、有限状态机、任务图、规则系统和学习型策略生成,都会在这一层出现。

近年来,大语言模型(LLM)、视觉语言模型(VLM)以及 VLA 模型的快速发展,进一步提升了机器人在高层理解和决策层面的潜力:

  • LLM擅长语言理解、知识调用和高层推理,代表模型:GPT系列、PaLM-EGemini;经典工作框架:SayCan

  • VLM更适合视觉语义解释,代表模型:CLIPSigLIPDINOv2

  • VLA将视觉、语言与动作统一到同一建模框架中,直接输出可执行行为:

    • 自回归预测型RT-1RT-2RT-2-XOpenVLA

    • 扩散生成型π0/π0.5RDT-1BOcto

    • 双系统架构型G0GigaBrain-0GR00T N1Helix

    • 专用型3D-VLADexVLAWholeBodyVLATraceVLAFAST

    • 国内代表Qwen-VLAXR-1WALL-A/WALL-B

    • GoogleGemini Robotics 1.5(VLA 执行)、Gemini Robotics-ER 1.5(VLM 推理)

但从产业实践看,这一方向真正需要掌握的,不只是“会调用模型接口”,而是以下几个关键问题:

  • 如何把自然语言目标转换为结构化任务表示?

  • 如何设计机器人动作表示,使模型输出能够接入现有规划控制链路?

  • 如何构建高质量多模态数据,并进行训练、微调和评估?

  • 如何控制推理时延、提升稳定性,并处理真实环境中的失效情况?

  • 如何让高层语义推理与底层执行系统保持一致,而不是各自独立?

3.4 世界模型与持续认知

更进一步的具身智能系统,不能只具备瞬时识别能力,而需要具备持续认知能力。机器人不仅要知道“现在看到什么”,还要知道“刚才发生了什么”“哪些物体发生了状态变化”“如果我执行这个动作,接下来会出现什么结果”。这背后所对应的,就是世界模型、场景状态跟踪、短期和长期记忆、关系建模、常识推理乃至因果推断等方向。

如果说大语言模型让机器“读懂语言”,视频生成模型让机器“看世界”,那么世界模型就是让机器人“理解物理世界”。它使智能体从“感知-行动”的反应式回路升级为拥有“想象”未来的能力。以抓生鸡蛋为例,人类会本能地考虑用多大力才不会捏碎,人形机器人通过世界模型来预测类似的物理规律。

世界模型的核心价值

  • 让机器人具备“想象未来”的能力,高效规划与决策

  • 可通过世界模型生成数据训练 VLA,提升真机操作成功率(零真机数据即可将成功率从 38.7% 提升至 83.4%)

  • 为 Sim2Real 提供高质量仿真数据

代表性工作DreamerV3DayDreamer(真实机器人)、WoW(北京人形机器人创新中心开源,融合视觉/动作/物理感知与推理)、GigaWorld(极佳视界,数据多样性提升约 10 倍)、Genesis(通用物理引擎)。

这一层能力还在快速发展,但它很可能决定未来具身智能系统在开放环境中的上限。因为真正复杂的任务,往往依赖持续记忆、上下文理解与结果预判,而不是单次感知结果。

四、运动小脑:状态估计、运动规划与实时控制

如果说智能大脑负责“理解世界并形成决策”,那么运动小脑负责的就是“把决策稳定地变成动作”。在很多真实系统中,大脑决定的是能力上限,小脑决定的却是系统是否真正可用。因为一旦进入物理世界,机器人就必须面对噪声、摩擦、碰撞、接触不确定性、动态干扰和实时性约束

从系统划分看,运动小脑通常围绕以下几类能力展开:

  • 状态估计

  • 运动规划

  • 实时控制

  • 柔顺控制与接触控制

  • 实时系统与安全执行

4.1 状态估计

状态估计是小脑系统的起点。机器人必须实时知道自己的姿态、速度、加速度、关节状态和接触状态,否则后续控制器就失去了输入基础。对于四足和人形机器人,还往往需要进一步估计质心位置、支撑相、落脚点、平衡状态等更复杂的运动信息。

这一部分看起来不如大模型“显眼”,但却是稳定执行能力的前提。常见技术会涉及卡尔曼滤波、扩展卡尔曼滤波(EKF)、互补滤波、观测器设计以及多传感器融合框架。真正需要学习的关键,是如何把IMU、编码器、力传感器、视觉信息、激光雷达信息等不同频率、不同噪声特性的数据融合成统一、可信、实时的状态输入。

4.2 运动规划

状态被估计出来之后,小脑系统还需要把高层目标转换为物理上可执行的轨迹。这就是运动规划的任务。

  • 对于移动机器人:全局路径规划、局部避障、代价地图构建、路径跟踪、动态障碍物处理

  • 对于机械臂:逆运动学求解、碰撞检测、关节约束处理、抓取轨迹生成、操作路径优化

  • 对于四足和人形平台:步态规划、落脚点规划、全身动作协调、全身控制(WBC)

常用方法A*D*PRMRRTRRT*、轨迹优化、模型预测控制(MPC)等。真正需要理解的是,规划并不是简单“找到一条路”,而是在动态环境、硬件约束和执行时延共同存在的前提下,生成一条既能执行、又足够安全、同时还能被下游控制器稳定跟踪的轨迹。

4.3 实时控制

控制是运动小脑的核心。控制系统真正关心的,不是机器人“是否动起来”,而是机器人能否以稳定、平滑、精确、柔顺和安全的方式完成动作。位置控制、速度控制、力矩控制、PID控制、阻抗控制导纳控制、逆动力学控制、最优控制和模型预测控制(MPC),都是行业内高频出现的方法。

不同机器人对控制的关注点并不完全相同:

  • 机械臂:轨迹跟踪精度、抓取稳定性、接触力控制

  • 移动机器人:路径跟踪、速度平滑、避障安全

  • 四足与人形机器人:平衡控制、步态稳定、全身协调、抗扰能力

对从业者而言,这一层真正需要掌握的,不是算法名词本身,而是控制理论基础、闭环控制思想、系统模型与控制器之间的关系、采样周期对控制效果的影响、执行器动态特性,以及传感器噪声如何影响系统稳定性

4.4 柔顺控制、接触控制与安全执行

具身智能最终要在真实环境中完成抓、推、拉、扶、拧、插、装配等操作,这些任务一旦涉及接触,难度就会显著上升。接触意味着力的变化、摩擦的不确定性、物体约束的引入,以及动作需要具备柔顺性,而不只是轨迹跟踪精度。因此,柔顺控制、接触检测、力反馈控制、抓取稳定性分析、摩擦模型和接触模型,对于服务机器人、工业装配、人形机器人和灵巧手系统都非常关键。

与此同时,小脑系统天然带有强实时性和强安全属性。很多控制环路需要在毫秒级运行,背后会涉及实时线程调度、驱动器通信、EtherCATCAN等工业总线、急停机制、关节限位、碰撞保护、故障诊断和降级控制等工程问题。一个真正能落地的机器人,不能只是“能动起来”,而必须能够长时间稳定运行,并在出现异常时及时检测、及时保护、及时恢复

五、学习型方法:让系统从数据中获得更强适应能力

除了传统机器人方法,具身智能行业也越来越重视数据驱动路线。监督学习、模仿学习、强化学习、离线强化学习、自监督学习和 Sim2Real 迁移,已经成为很多系统中的关键组成部分。它们的重要性在于,真实环境过于复杂,仅靠人工规则和精确建模很难覆盖全部场景,而学习型方法可以帮助机器人从大量交互数据中提取策略、提升泛化能力,并逐步适应复杂环境。

5.1 强化学习(Reinforcement Learning, RL)

通过与环境交互试错,自主习得步态、抓取、避障等运动技能。

  • 经典算法DQNPPOSACTD3DDPGA3CPPO是最广泛使用的 on-policy 算法,SAC/TD3是 off-policy 样本效率更高)

  • 训练框架RLlibOpenAI GymnasiumDM ControlMuJoCo RL

  • 前沿工作

    • FastSAC/FastTD3(Amazon FAR, 2025.12):单张 RTX 4090,15 分钟完成人形机器人 locomotion 策略训练

    • OmniRetarget(Amazon FAR):长时程“移-操一体”(loco-manipulation)技能,Sim2Real 零样本迁移

    • DemoHLM(北大 & BeingBeyond):仅需 1 次仿真演示即可自动生成海量训练数据

    • EAGLE:模仿+RL 混合,先用人类动捕/视频数据提供运动先验

5.2 模仿学习(Imitation Learning, IL)

从人类操作演示数据中学习动作范式,快速复刻复杂作业技能。

  • 数据生态

    • Open X-Embodiment (OXE):100 万+轨迹,22 种本体,527 技能,被誉为机器人学“ImageNet 时刻”

    • DROID:7.6 万轨迹

    • LeRobot(HuggingFace):Parquet+MP4格式,存储降低 5-10 倍

  • 遥操作采集方式

    • ALOHA:双臂遥操作系统,精细装配

    • UMI(Universal Manipulation Interface):手持式,低成本快速采集

    • Apple Vision Pro + IK:VR 遥操作

  • 前沿工作AdaMimic(层次化模仿学习)、REPLAY(从原始单目视频学习意图感知行为)、ImMimic(真人视频+少量遥操作演示的跨域协同训练框架)

5.3 Diffusion Policy(扩散策略)

作为动作模块,负责学习具体的动作和执行。通过扩散模型生成整个动作轨迹,更好地捕捉任务执行中的时序结构与多样性。研究方向包括状态扩散、动作空间扩散和三维空间扩散。

5.4 学习型方法的共同难点

在具身智能中,学习型方法的真正难点并不只是“训练一个模型”,而在于以下几个问题是否被解决:

  • 数据是否高质量,是否覆盖关键任务和长尾场景?

  • 奖励设计是否合理,策略是否真正学到了目标行为?

  • 训练过程是否稳定,是否容易出现策略崩溃或过拟合?

  • 仿真策略能否可靠迁移到真实机器人(Sim2Real)?

  • 学习系统能否在安全约束下运行,而不是以高风险方式探索?

因此,在具身智能领域,学习型方法更多是与传统规划控制方法融合使用,而不是简单替代后者。

5.5 Sim2Real(仿真到现实迁移)

在仿真环境中训练策略再迁移到真实机器人,可以有效解决真机数据采集成本高、风险大的问题。

  • 核心仿真引擎

    • Gazebo:ROS 深度集成,功能全面

    • MuJoCo:高精度物理引擎,RL 首选

    • NVIDIA Isaac Sim:基于 Omniverse,图形渲染强,适合 VLA 前沿研究

    • PyBullet:轻量级,快速原型

    • Genesis:通用物理引擎

    • ManiSkill:操作基准

    • Habitat:导航仿真

  • 关键技术方向

    • 域随机化(Domain Randomization):随机化视觉/物理参数提升鲁棒性

    • Real2Sim2Real 闭环

    • 可微物理:支持梯度优化

    • 数字孪生

  • 代表性工作FetchBot(零样本 Sim2Real)、EmbodieDreamer(通过世界模型推进 Real2Sim2Real)

六、软件系统、仿真平台与工程化能力

具身智能最终必须以工程系统的方式存在,因此软件基础设施和工程工具链同样构成行业核心能力。

  • 编程语言

    • Python:算法原型、训练脚本、实验验证(生态:NumPySciPyMatplotlibPyTorchTensorFlowJAX

    • C++:高性能感知、规划控制、系统模块开发(工具链:STLEigenOpenCVCUDACMake

    • Linux:基本研发环境

    • 推理部署:CUDAONNXTensorRT

  • 机器人操作系统(ROS / ROS2)

    • 核心价值:定义机器人系统模块化协作的基本方式

    • 需掌握:节点/话题/服务/动作通信机制、TF坐标变换体系、参数管理/launch/日志/rosbag、RViz可视化、与仿真联动

    • ROS2相比ROS1在实时性、分布式通信和安全方面显著提升,核心组件:DDSEternalLaunchColconNav2Control2

    • 新兴中间件:Zenoh(有望在某些场景替代 DDS)

  • 仿真平台(见 5.5,此处强调工程价值):

    • 承担训练、调试、验证、回归测试和降低硬件试错成本的作用

    • 高效使用仿真需理解:动力学参数、接触模型、传感器仿真、域随机化、Sim2Real 关系

  • 数据集与基准

    • Open X-Embodiment:跨本体操作数据统一接口

    • Behavior-1K:日常任务

    • CALVIN:语言条件操作

    • MineDojo:开放世界

    • RoboNet:大规模机器人视频

  • 数据闭环能力(行业分水岭):

    • 运行数据(传感器、轨迹、异常日志、失败案例)是优化资产

    • 涉及:采集、清洗、标注、版本管理、训练评估、部署优化、日志回放

七、技术路线对比

当前具身智能行业在大脑与小脑的协作方式上,存在五种主流架构路线,在系统复杂度、实时性、泛化能力和部署难度上各有取舍:

路线大脑小脑代表模型特点
端到端 VLAVLA 直接输出动作不单独区分RT-2OpenVLAWALL-A/B信息无损,整体优化,但可解释性差,算力要求极高
分层端到端VLM 做长程规划VLA 做反应式控制Gemini Robotics(ER+VLA)兼顾高层推理与底层执行解耦,但层间接口设计关键
LLM+VFM 分层LLM 任务分解VFM/传统控制执行SayCan模块清晰,但语义到动作的 gap 较大
大小脑独立分层独立大脑模型独立小脑模型G0GR00T N1工程最成熟,易迭代,但信息传递存在损耗
类脑三层GPU 大脑滤波器小脑 + 神经形态芯片脊髓Spike-Drive(北大/智源)受神经科学启发,理论高效,但工程尚处早期

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询