ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

人形机器人控制三次范式转向:从ZMP到强化学习再到世界模型

2026/9/17 16:49:02 拓冰建站 浏览量
人形机器人控制三次范式转向:从ZMP到强化学习再到世界模型 人形机器人控制最近几年变化快得有点让人跟不上。年初还在刷Atlas空翻、Digit搬箱子年中大家就开始聊神经网络策略端到端控制到年底风向又变了1X的NEO用“世界模型”做家务英伟达GRUUT把生成式世界模型塞进机器人训练闭环。表面上看是“算法换新”但把这个时间线拉长了看其实是人形机器人控制正在经历第三次真正意义上的范式转向——从ZMP代表的模型驱动到强化学习代表的数据驱动再到世界模型代表的预测生成驱动。这篇文章我想从这三个阶段的核心逻辑、技术边界、实操取舍三个角度拆开聊也会把我自己这些年从仿真到真机调试过程中踩过的坑一并整理出来。适合正在做人形机器人、腿足机器人控制研发的工程师也适合想搞清楚“为什么RL火了几年又要被世界模型抢风头”的研究生和技术管理者。1. 三次转向到底转向了什么从三条控制路线说起1.1 为什么说“第三次转向”是个真命题要理解第三次转向先把时间轴拉直。人形机器人控制的前三十年基本是ZMPZero Moment Point的天下。从早期HRP系列到ASIMO再到后来一批实验室双足平台走路这件事基本都被建模成“规划一条质心轨迹保证ZMP落在支撑多边形内”。这套路线本质上是模型驱动——先把机器人的动力学简化成线性倒立摆再用数学方法求最优轨迹。第二阶段的标志是强化学习大规模进入腿足控制。OpenAI在2017年用RL训练模拟人形机器人行走后来Raibert团队在Digit上实现动态行走再到ANYmal在四足上把RL做到能翻越复杂废墟。核心变化是不再手工建立精确模型而是让策略网络通过大量试错找到“什么样的动作序列能获得高奖励”。这个转向在腿足控制里是颠覆性的因为机器人突然能做ZMP时代做不到的事跨越、奔跑、受扰动后的动态恢复。现在第三阶段来了标志是世界模型。这里要注意世界模型不是“用大模型生成对话”而是让机器人学习一个关于物理世界的内部预测模型——给它当前状态和一个动作它能在脑内推演后续状态。有了这个“脑内沙盘”机器人可以在想象中试错、规划、甚至生成合成训练数据。人形机器人走到这一步是因为单纯RL已经暴露了两个硬伤一是太费数据真机试错成本高得离谱二是缺乏长时程规划和因果推理能力遇到没见过的场景很容易崩。世界模型恰好在这两个方向上有补位空间。1.2 三个时代的关键词约束、数据、预测三个阶段的底层逻辑差异可以用三个关键词概括ZMP时代靠“约束”RL时代靠“数据”世界模型时代靠“预测”。ZMP时代的典型工作流是建立简化模型加上稳定性约束在约束空间里求最优解。优点是可解释、可证明、安全性高局限是建模误差会直接转化为控制误差而且模型复杂度一上来求解器根本吃不消。那时候做双足控制的人一半时间在调模型一半时间在调求解器。RL时代的工作流变成定义奖励函数搭建仿真环境让策略自己“试”出最优动作。优点是对建模精度要求大幅下降复杂全身动力学、接触变化、非结构地形都能靠数据硬学出来。代价是奖励设计像个黑盒子训练稳定性和可复现性都是大问题。真机部署前还得过Sim-to-Real这道坎不然仿真里飞真机上趴。世界模型时代的工作流又在变先让机器人从交互数据中学会“预测下一秒会怎样”再基于这个预测进行规划或评估动作。概念非常接近人类做事的思路——动手前先在脑子里过一遍大概会发生什么再决定怎么做。这个转向的意义在于它把“控制”和“规划”的边界重新画了一遍也让“机器人理解物理世界”这件事多了一条工程化路径。1.3 三条路线不是清仓换代你得先有全局观我看过太多人一听到新方法就要“革旧命的命”但实际上这三条路线在人形机器人系统里往往是共存的。ZMP思想至今还在做底层安全约束RL是当前主流的高级控制策略生成器世界模型则逐渐承担起任务规划、场景理解和数据生成层的职责。以我目前调试双足平台的经验来说最实用的系统架构是“分层混搭”底层用传统控制保证稳定性和安全性中层用RL策略实现动态行走和地形适应上层尝试用世界模型做任务理解和动作序列生成。这样既不会因为模型太复杂导致实时性崩盘又能逐步向新范式迁移。后面第5部分我会展开讲这个架构怎么落地。2. ZMP时代被“模型”支配的三十年2.1 ZMP的真实含义和数学直觉ZMP这个概念最早是Vukobratović在1968年前后提出的全称是Zero Moment Point。它定义的是地面上一个点——地面反作用力合力在该点的等效集中作用点——在那个点上地面反作用力产生的翻倒力矩为零。通俗理解你双脚站在地上如果合力作用点落在两脚围成的多边形内部脚底不会产生翻转人就是稳定的一旦这个点跑到支撑多边形外面脚就要翻人就要倒。这个判据的妙处在于它把复杂的人体动力学和地面接触问题简化成一句话让ZMP待在安全区域里。基于这个思想Kajita等人在2003年前后提出了经典的线性倒立摆模型加预览控制方法把人形机器人的质心轨迹规划问题转化为一个可以实时求解的优化问题。早期ASIMO、HRP系列走得稳靠的就是这套体系。2.2 为什么ZMP能工作又为什么走不到“通用”ZMP能统治人形控制三十年核心原因是它可预测、可设计、实时性好。地面的受力情况可以通过力传感器验证轨迹可以用数学方法论证控制器的稳定性可以严格证明。这在早期硬件可靠性差、算力有限的年代几乎是唯一能走通的路。但它有两个先天短板决定了它走不到通用。第一建模过程做了大量简化。二维线性倒立摆假设质心高度不变这在地面平坦、步态缓慢时还成立一旦遇到跑跳、踩踏、大幅肢体摆动模型误差就会放大到控制不住的程度。第二静态稳定判据本质上是保守的。ZMP要求每时每刻都要“稳定落在支撑多边形内”但人类奔跑时常常处在动态不稳定状态——靠前冲惯性和落脚点选择来维持平衡。ZMP体系天然排斥这种动态策略所以做不出快速、灵巧、大力度的动作。行业里对ZMP的反思本质上是模型复杂度和控制表现力之间的矛盾。后来尝试用MILP混合整数线性规划做步兵规划、用全身动力学控制WBC提升力控表现都是在原有框架内打补丁但补丁很难解决根本问题手工建模的上限决定了表达能力的上限。2.3 ZMP不是废弃了它变成了“安全垫”这里必须说清楚ZMP现在并没有退出工程现场。我自己的经验是ZMP或它衍生的质心状态约束在两类场景里仍然不可或缺一是高安全性要求的重载工业人形比如在工厂搬箱子你不希望机器人一个踉跄把货架带倒二是作为RL策略训练时的“软约束”或者真机部署时叠加的安全保护层。热词里出现“MILP与强化学习”这个搭配其实就是这个趋势的缩影——用MILP做接触序列和安全性约束的硬规划再用RL优化具体的动作轨迹。两者不是二选一而是各管一段。后面我会专门讲这个混合方案怎么落地。3. 强化学习时代从“建模”转向“做实验”3.1 RL到底干了什么策略网络替代了“设计规则”强化学习把人形控制从“建模-求解”带进了“定义奖励-训练策略”的范式。最常见的做法是在仿真环境里搭建一个带全身关节的人形机器人模型定义状态空间关节角度、角速度、角加速度、接触力、IMU读数等和动作空间各关节的目标角度/力矩然后让策略网络在环境中反复交互用累计奖励带动策略更新。与传统控制最大的区别是不再需要显式设计“什么情况下该迈哪只脚”“如何分配关节力矩”。策略网络自己从海量尝试中学会这些规则。归一化优势函数、PPO这类算法之所以成为腿足RL的主流是因为它们在高维连续动作空间里表现稳定且对超参数不那么敏感。以OpenAI早期在MuJoCo里做的Humanoid为例策略在数百万步训练后能从随机初始化学会站立、行走、奔跑。现在在NVIDIA Isaac Lab里跑一个人形RL任务基础流程已经相当成熟加载模型、初始化环境、开始训练、监控reward曲线、评估收敛效果。3.2 算法选型不是PPO打天下得看场景很多人一上来就问“RL该用哪个算法”实际上算法选型高度依赖任务类型和训练条件。PPO是目前腿足控制里最稳妥的默认选择。它在高维连续控制中训练稳定开源实现多收敛曲线相对平滑。如果你第一次训练人形机器人建议先跑通PPO baseline。SACSoft Actor-Critic适合对样本效率要求高的场景因为它是off-policy算法能更充分利用历史数据。代价是超参数更敏感训练波动也更大。如果手里只有离线数据——比如遥操作采集的示教数据、历史日志——那就要用离线RLIQLImplicit Q-Learning这类方法可以从固定数据集里学到策略不需要在线试错。这对做真实机器人尤其有价值因为真机在线试错的成本和风险太高了。另外一个正在被广泛讨论的趋势是把RL和传统优化器结合比如“MILP RL”。我在第2.3节提过具体做法是外层用MILP生成满足接触序列约束的参考轨迹内层用RL做扰动补偿和全身协调。这种混合方案能在安全性和表现力之间取得一个不错的平衡点。3.3 奖励设计是第一工程问题如果说算法是骨架奖励函数就是灵魂。同样的PPO换个奖励权重训练出来的步态可能一个正常走、一个蹲着挪、一个原地抽搐。奖励设计中最常见的坑就是“奖励黑客”——策略发现只要维持某个状态就能高奖励但那个状态在物理上根本不合理。我常用的奖励结构分三层。第一层是任务导向主奖励前进速度、目标达成度、任务完成率。第二层是姿态与运动约束质心高度、身体俯仰角、关节角度极限。第三层是细粒度正则项关节能耗、加速度平滑度、地面接触冲击力。权重设置上我建议先把主奖励单独调通再逐步加约束项避免一开始就让所有项耦合在一起出了问题根本不知道是哪个项引起的。还要注意奖励尺度。数值超过100的主奖励很容易让梯度爆炸低于0.01的约束项则可能完全不起作用。我曾经调试一个双足机器人前进速度奖励权重从0.1改到0.3步态周期直接从0.8秒变成了1.5秒动作曲线完全变形。3.4 Sim-to-Real仿真里认真真机才能开出来RL在人形机器人上最大的工程障碍不是训练而是迁移。仿真环境和真实世界永远有差距摩擦系数、关节延迟、电气噪声、结构弹性每个环节都有误差。如果策略只见过理想仿真环境到真机上基本是“见光死”。主流解决方案是域随机化在训练时随机化仿真环境里的物理属性比如地面摩擦系数在0.3到1.5之间采样电机力矩系数在90%到110%间波动让策略被迫学会适应不同环境而不是死记硬背一套参数。这一点和端到端自动驾驶里用仿真随机化增强泛化能力是同一个逻辑。但域随机化不是银弹。随机化范围过大训练难度直线上升策略可能学成一个“四平八稳但碌碌无为”的保守策略范围过小迁移依然会失败。我现在的做法是先用系统辨识把仿真模型校准到接近真机再在这个基础上做小范围随机化迁移成功率会明显提高。真机部署后还会用人体动力学观测器做状态估计把仿真中不存在的漂移问题消掉一部分。3.5 RL的瓶颈数据饥渴和长时程规划缺失RL在人形控制里走得意气风发但瓶颈也越来越明显。第一是数据效率太低即使有仿真加速训练一个能稳定行走的全身策略也需要数千万到数亿个状态转移样本。真机上根本无法承担这样规模的试错所以绝大多数团队只能依赖仿真。第二是泛化边界模糊。RL策略本质上是“记住”了训练分布内的状态-动作映射一旦遇到分布外的情况——比如一个完全没见过的物体摆放方式、一条没见过的地形——策略没有推理能力去自我调整只能硬着头皮输出动作结果往往很惨。第三是缺乏长时程记忆和规划。当前大多数RL策略是马尔可夫式的只根据当前观测决定动作不携带“我从哪来、下一步要做什么”的结构性信息。做单一技能比如稳定行走这够了但做“把杯子从厨房拿到客厅”这种多阶段任务就力不从心了。这些瓶颈正在把业界推向世界模型。4. 世界模型时代给机器人一颗“脑内沙盘”4.1 世界模型是什么它和“大模型”差在哪世界模型这个概念最早可以追溯到Schmidhuber的早期构想2018年David Ha和Schmidhuber合著的那篇经典论文《World Models》用RNN在赛车游戏里展示了“让智能体在梦境里学习”的可行性。它的核心是学习一个关于环境动态的生成式模型能够从当前状态和动作预测未来的状态、奖励、观测。很多人把世界模型和大语言模型混为一谈实际上差别很大。语言大模型建模的是“文字序列的条件概率分布”它学会的是“下一个词该说什么”世界模型建模的是“物理世界动态演化的条件概率分布”它学会的是“做这个动作后世界会变成什么样”。语言模型生成的文本可以语法通顺但物理上空想世界模型生成的预测必须与物理规律、动作语义一致否则后续规划全错。不过两者正在走向融合。近期很多工作用大语言模型做任务理解把自然语言指令转换成目标描述再交给世界模型做物理推演和动作规划。我理解的“第三代人形控制”画像是大模型负责“听懂人话”世界模型负责“脑内推演”底层策略负责“真的执行”。4.2 世界模型在人形机器人上的典型用法目前世界模型在人形机器人上主要有三条落地路径。第一条是把世界模型当作“脑内模拟器”用于规划。经典框架是model-based RL在latent space里学习一个状态转移模型然后基于这个模型做模型预测控制或交叉熵方法CEM搜索动作序列。好处是规划动作不需要真机试错搜索几百次成本只在GPU上。1X的NEO公开演示中他们强调的就是这种“先想再做”的能力让机器人收拾房间、摆放物体之前先在内部模型里模拟多种动作序列挑出可用的再执行。第二条路径是用世界模型生成合成训练数据。人形机器人最缺的就是高质量、多场景的交互数据。世界模型可以充当数据引擎给定一段初始状态生成多种可能的后续轨迹再把这些轨迹交给RL策略去做模拟训练。这种“虚拟世界生成数据→策略在虚拟数据中学习”的闭环能极大缓解真实数据不足的问题。英伟达在GRUUT相关工作中展示的就是这个方向。第三条路径是用世界模型做场景理解和状态推理。传统控制器只能处理传感器信号而世界模型可以从视觉观测中提取出“桌子在这里、杯子在桌上、杯子和桌沿的相对关系”等结构化信息再基于这些信息做任务拆解。这对人形机器人进入家庭、仓储、服务等非结构化场景是至关重要的一步。4.3 为什么控制层的第三次转向偏向了“认知层”从ZMP到RL再到世界模型表面上都是算法换代但背后其实藏着一个递进逻辑控制层越做越成熟瓶颈就慢慢从“怎么动”转移到“怎么想”。ZMP时代机器人连“走稳”都是难题所以大家把所有精力都放在动力学建模和稳定性控制上。RL时代“走稳”基本解决机器人开始需要在复杂地形里选择路线、适应扰动、完成单技能任务。真正卡住RL的是它分不清“接下来该干什么”、记不住“刚才做过了什么”、想不出“换一种情况怎么应对”。世界模型的出现本质上是为了补上“认知”这块短板。让机器人拥有一个关于自身如何影响环境的内部模型后它才能做长远规划、做因果推理、做想象冲浪。这已经不是单纯的“控制问题”而是进入了“认知与决策”的范畴。从这个角度看第三次转向比前两次更深刻因为它改变的不只是算法模块而是整套系统的信息流转方式。4.4 当前进展和已知短板目前世界模型在人形机器人上真实落地形态还比较早期远没有到“放之四海而皆准”的程度。大家最常用的训练框架是Dreamer这类基于latent dynamics的强化学习架构编码器从观测中得到状态表征转移网络预测下一状态价值网络评估状态好坏然后在想象的轨迹里更新策略。这套东西在仿真游戏里效果已经很惊艳但换到现实人形机器人上挑战比预期大得多。第一是计算资源问题。世界模型要在GPU上做大量前向推演真机部署时实时性很难保证。1X的那些演示视频里背后大概率有大量云端算力在跑规划而不是全部在机载硬件上完成。第二是预测误差累积。世界模型再准也只是近似长时程推演中误差会指数级放大。预测几十步还行预测几千步基本就天马行空了。目前用“预测几步—执行一步—重新预测”这种receding horizon方式缓解可以控制误差累积但决策深度也因此受限。第三是数据需求变得更高。世界模型是要“学物理规律”的它对数据多样性、场景覆盖度、动作语义一致性的要求比普通RL策略高出不止一个量级。现在行业里还没有公开的大规模人形机器人世界模型数据集各家都在自建数据壁垒。但我的判断是这些短板会随着算力升级和数据集共建逐步缓解方向本身不会逆转。5. 如果你也在做人形控制学习路线和踩坑实录5.1 按硬件条件选技术栈别盲目追热点我给不同基础的读者几条建议。如果你是一名学生还在实验室里搭刚起步的双足平台先别急着上世界模型。先把ZMP和预览控制搞明白至少能从数学上理解机器人为什么站得住然后去Isaac Lab或MuJoCo里跑通PPO训练一个人形机器人走路亲手体会什么叫reward climbing、什么叫infinite fall。再去读IQL、Dreamer这些进阶工作理解离线RL和世界模型数据结构上的差异。基础打得越扎实后面做新范式越不容易被各种演示视频带偏。如果你已经有一台硬件条件不错的双足/人形平台建议走“ZMP安全约束 RL策略 世界模型规划”的混搭路线。具体来说底层用传统算法做零轴状态估计和安全看门狗中层部署RL策略做动态行走和地形感知上层开始尝试用一个latent world model在仿真环境里做任务规划等可靠了再接真机。如果你在创业公司或在做产品决策我建议盯住三个能力来判断团队有没有吃下第三次转向的潜力奖励设计能力和仿真资产积累这是RL时代的硬通货系统辨识和Sim-to-Real迁移动手能力拥有它才能保证仿真结果不外强中干对世界模型从数据处理到latent dynamics训练再到真机部署的完整理解这是下一代差异化所在。5.2 我踩过的坑奖励陷阱、迁移失败的现场记录踩过的坑里最典型的是奖励函数被策略“钻空子”。有次训练双足机器人下楼我把“落地冲击力惩罚”和“前进速度奖励”放在一起结果策略学到了一个损招脚先落地瞬间保持关节刚度拉满让冲击力传感器读数变低代价是整条腿像个棍子一样砸下去膝关节磨损严重。后来我把落地冲击力惩罚改成了“关节力矩变化率的惩罚”才算堵住漏洞。第二个高频踩坑是迁移失败。策略在仿真里能时速5公里跑到真机上原地摔倒。排查了一圈发现真机电机存在约15毫秒的响应延迟而仿真里设的是理想零延迟。后来加了一个随机化的执行器延迟项再叠加随机地面摩擦迁移成功率才上来。这个教训很直接Sim-to-Real问题里时序延迟比单纯物理参数不匹配更隐蔽也更致命。第三个经验是关于仿真环境的物理参数校准。不要上来就开域随机化先把仿真电机模型校准到真机空载响应几乎一致再在10%范围内随机化。基准不准随机化随机化不出真效果只会让策略变成一个谁都不适配的“平庸包工头”。5.3 目前最推荐的入门路径和学习资源想系统学习这套演进我比较推荐的顺序是四条线并行。经典理论线Vukobratović的ZMP论文、Kajita的预览控制论文理解人形机器人“怎么靠脚站稳”的历史解法。强化学习实战线先在Isaac Lab或MuJoCo环境里训练一个简单的四足/双足代理跑通PPO熟悉状态空间、动作空间、奖励函数、训练监控这套基本流程。没有基础的话可以从《强化学习入门》类课程开始李宏毅、吴恩达这些公开课的早期内容都值得过一遍不用刷完理解奖励和策略更新逻辑就够了。世界模型进阶线读David Ha和Schmidhuber的《World Models》再复现Dreamer或DreamerV3。这类项目代码量适中能让你真正理解latent dynamics、imagined rollout、actor-critic在模型空间里怎么协同。3D世界模型方向的survey也值得看能帮你建立该领域完整版图。工程规范线学习系统辨识、域随机化、真机部署监控这套流程。真正决定一个RL机器人项目成败的往往不是论文里那几行算法而是这套工程基建。6. 常见问题速查三次转向里的高频困惑我整理了最近被问到最多、也是研究社区里讨论最热烈的几个问题用表格快速过一遍。问题我的答案RL普及后ZMP彻底没用了吗没有。ZMP思想仍是腿足机器人安全性的重要判据和规划参考。最实用的架构是ZMP做安全约束RL做动态控制。PPO是解决所有人形RL问题的最优解吗不是。PPO最稳妥、最常作为baseline样本效率要求高时考虑SAC离线数据驱动任务用IQL等离线RL算法。世界模型和大语言模型是一回事吗不是一回事但正在融合。大模型处理语言指令和任务分解世界模型负责物理推演和动作规划两者是上下级关系。世界模型可以直接用于真机实时控制吗目前大部分还不行更多用于离线训练数据生成和任务规划的“脑内预演”。底层需要传统控制或RL策略作为执行器。没有顶级GPU能入门人形RL吗可以。小规模问题一块中端游戏显卡就能跑训练时间多花点而已。真正吃资源的是大规模域随机化和世界模型训练。这个表格是我这些年答复咨询时整理出来的不权威但每一次都是实测过、掉过坑之后得出的经验。如果你在实践中碰到新问题建议先回到“状态空间、动作空间、奖励、迁移、安全”这五个维度去排查大概率能找到症结点。从我自己的项目体验来看人形机器人控制这三次转向最本质的东西其实不是算法本身而是人对“机器人如何认识世界、如何做决策”这件事的认知升级。ZMP让机器人学会了“按规则走稳”RL让机器人学会了“从经验中找最优”世界模型则试图让机器人“在脑海中预演然后决定”。每一条路线都没有真正消失它们只是在不同层次上各司其职。如果你正准备入行我的建议是别急着站队先把三条路线的底层逻辑都吃透再根据自己手里的硬件条件、数据资源和应用场景选出最合适的混搭方案。这样无论是做研究还是做产品你都能带着判断力去选择技术路线而不是被热点推着走。