ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

“具身智能扎堆流匹配”:Flow‑Matching全面取代Diffusion了?

2026/10/1 18:52:32 拓冰建站 浏览量
“具身智能扎堆流匹配”:Flow‑Matching全面取代Diffusion了? 从一只小纸船讲起看懂流匹配、Diffusion 与机器人运动规划的底层逻辑——本文出自《具身智能基础》专栏-第14篇目录01 先记住一个画面小纸船、水流和终点02 这个“向量场”从何而来03 具身智能为什么需要流匹配具身智能里流匹配输入什么、输出什么04 从速度场到轨迹积分是桥梁05 流匹配的数学原理分布到分布的确定性演化06 Diffusion是流匹配的特例差在确定与随机07 四个环节跑通训练不绑定设备但算力决定形态08 超长时序总有流匹配你肯定见过人形机器人干活的视频走得挺稳伸手也利索可总在某个瞬间“顿”一下——像是卡了一帧。这一下顿挫很多时候不全是电机的问题而是动作本身是被“一格一格算出来”的。离散的格子之间缺少连续过渡动作就容易顿。这个问题的答案不算新叫流匹配Flow-Matching。它不再是“下一步走哪一格”而是先学出一整个场——在每一个位置上、每一个时刻都有一个明确的推动方向。把起点扔进去被这个场一路推着走就得到一条连续的轨迹。流匹配到底是什么、为什么特别适合机器人、又和 Diffusion 是什么关系01 先记住一个画面小纸船、水流和终点流匹配的直观印象可以想象成一艘小纸船被放进一片有方向的水流里然后过一段时间后被水流推到另外一个位置上。这个小纸船从一个点起点运动到了另外一个点终点。但这里要先说清楚流匹配里的“点”不是地图上的“物理坐标点”而是高维空间里的一个“数据点”。图片、轨迹、视频都可以被表示成这样的高维点。先把这个点说清楚。比如说一张图片一张图片有长有宽长乘以宽的所有像素取值就构成一个高维点。更具体的比如在MNIST数据集里面一张数字图片是784维的一个高维点每个点的取值是0到255之间的灰度值。▲图| MNIST一张图是一个高维数据点同样的点也可以是一个轨迹。一条轨迹也是由多个维度组成的一个高维点。比如自动驾驶的常见的50点轨迹每个点都是一个2维坐标按先后顺序排列那么每条轨迹就是100维的一个点。这里是为了举例的一个简化表示。所以无论是一张图片或者是视频还是自动驾驶/机器人运动的轨迹……都可以表达为一个点高维点。那么再假设这个点的初始值是随机取的也就是它的每一个维度的取值都是一个随机数一般我们都会用高斯分布来取这么一个随机数。如果现在有一个力量会去推动每一个维度的取值让其变大或者变小不断地持续推动一步一步地推动最后停在有意义的水平上。此时最初的随机点变成了一个有意义的点它可能现在是一张人能识别的图片比如一只猫也可能是一条既满足约束、又节约能量的机械臂运动轨迹。▲图| 从无序到有序图源网络这个力量由于要推动高维点的每一个维度的值的变化所以它自己必然也是一个由很多分量的组成的向量。而且不止一个向量因为我们最初对点的初始位置选取是在可行范围内的任意地方。所以这个力量必须是一个向量场也就是每个位置上都有一个推动向量。第一步它被当前位置的向量推动第二步它到了新位置又被新位置的向量推动把所有推动带来的变化累积起来就是积分。在 0 到 1 范围内的积分完成了从起点到终点的连续运动。所谓归一化向量场是指在这个向量场里面的运动时间它是归一化的是从0到1这个范围。你把任何一个初始点放进这个场里头它就会被源源不断的场里面的推动向量推动着前进一直到终点。流匹配就是把一个高维数据“点”放进向量场在向量场推动下持续运动到另一个点。到达的点就是生成结果。这个“点”可以是一张图片也可以是一条轨迹。02 这个“向量场”从何而来用神经网络表达训练得来。输入输出输入要处理的点的每个维度取值输出该点当前位置所受到的推动向量。由于这个神经网络对输入的每一个点都可以输出对应的推动向量所以这个神经网络是一个向量场。它对可行范围之内的每一个点都有一个相应的向量输出。▲图 | 流匹配是神经网络来自网络怎么使用输入一个点位置输出这个位置受到的推动向量根据这个向量调整点位置再重复前面过程。就像一个小纸船被水流连续推动小纸船的连续位置变动通过累加获得也就是积分。怎么训练对每一对起点B无意义随机点、终点E有意义点比如有效轨迹或者有效图片假设它们的距离为1线性插值采样为一系列的中间点s1 1-t1*B t1 *Es2 (1-t2)*B t2*E......其中tn都是【01】之间的随机数t取值越来越大表示采样点越来越从起点靠近终点至于采样多少个点n是个超参数。前一个采样点到紧邻下一个采样点的向量差也就是“前一个点要加上什么样的向量才能变为下一个点”是label前一个点本身是feature。这样获得一对由feature和label特征和标签构成的训练数据。对每一对【起点B、终点E】都可以取得一系列训练数据来监督学习方式训练神经网络。当然采样方式有很多变种这里只是一种。不过这里会自然出现一个疑问。以生成图片为例随机选择的初始点怎么知道它最终是要生成哪一个有意义的图像呢是生成一匹马、一个人、还是一只猫答案是由初始点位置决定。就像开头那艘小纸船——把它放在水流的哪个位置它就漂向对应的终点。如果不希望这种放任自流的形式还可以有条件流匹配。所谓的条件就是在初始点上面附加一个类似于“提示词”的额外信息指定它要生成什么。这就从“随机生成”变成了“按条件生成”。03 具身智能为什么需要流匹配概念和训练都说清楚了接下来看流匹配在具身智能里的位置。具身智能设备在真实场景中完成交互、移动、操作等任务时最大的难点不是识别画面、感知环境而是持续变化场景下的状态更新与运动规划。现实环境不会保持固定不变物体位置、场景结构、运动阻力等条件会随时发生改变智能设备自身的运动姿态、移动速度也处于持续变动状态。一切都在流动。这里的“流”有两层意思一是连续不断二是光滑变化没有跳变。传统智能建模方式大多采用分段式、分步式的计算逻辑把连续的运动过程拆分成多个独立的离散步骤进行计算。每一次分步计算都会产生微小的计算偏差这些偏差会随着运行步数不断积累。设备运行时间越长、交互步骤越多整体偏差越明显最终会出现动作卡顿、姿态偏移、运动逻辑和物理规则冲突等问题。流匹配要解决的正是这件事。它可以把步数压到很低训练时用的是起点与终点之间的线性插值路径本身就是一条近乎笔直的线曲率小积分时用很少的步数就能贴近真实轨迹——误差还没来得及累积计算就已经结束。从实际应用看流匹配统一了智能设备的状态预测、动作生成、状态调整等任务。比如 π0 与 π0.5 的动作专家用流匹配生成连续动作NVIDIA 在 GR00T N1 的论文里直接写明用流匹配学习动作生成HuggingFace 的 SmolVLA 只有 0.45B 参数动作专家同样是用流匹配训出来的。具身智能里流匹配输入什么、输出什么流匹配的输入数据分为两类无需复杂的人工处理原始数据可以直接接入模型参与计算。第一类是智能设备的实时状态与环境观测数据。包含设备自身的空间姿态、运动速度、位置信息以及摄像头、深度传感器采集的场景特征、环境结构数据和相邻时刻的运动变化数据。这类数据完整记录了设备自身状态和周边环境的实时情况是模型判断运动趋势的基础依据。第二类是任务对应的目标状态分布数据。它不像目标位置、目标姿态数据的快照这类数据界定了任务完成时设备所有可行、合理的稳定状态范围明确了设备运动演化的最终边界。两类输入数据分别对应设备的初始运行状态范围和目标运行状态范围模型靠这两类数据完成从初始状态到目标状态的连贯运动推演输入数据的真实完整性直接决定设备后续运动规划的合理性。不过这里有一个需要重点区分的点流匹配的直接输出结果可不是设备可直接执行的运动轨迹或动作指令而是一套覆盖全部运行状态的速度变化规则也叫速度场。这套规则会标注设备在任意空间位置、任意运行时刻对应的运动方向和运动快慢是描述瞬时运动变化的底层计算依据。▲图 | 流匹配运作示意图来源网络为了保证运动规划平稳合理这套速度变化规则存在固定约束能有效避免运动方向突变、速度剧烈波动的问题确保后续推演的运动路径唯一且连贯。而单纯的瞬时速度规则无法直接指导设备运行——这也是流匹配的特点模型输出的速度场是底层微分层面的计算依据必须经过时序累积计算也就是积分运算才能把无数个瞬时运动状态整合起来生成完整、可直接用于设备控制的运动轨迹。04 从速度场到轨迹积分是桥梁流匹配从底层计算规则到最终可用轨迹的转换依靠常微分方程的时序积分实现模型训练完成后会生成完整的全域速度场覆盖设备运动的全部时刻和全部空间位置。对归一化时间区间做积分累加就能完成瞬时运动规律到完整运动路径的转换积分通用公式也就是常说的欧拉法为公式中代表设备最开始的观测状态。积分运算的作用是把每一个微小时刻的状态变化量叠加汇总最终得到设备的完整运动路径和最终状态。同一套速度场可以适应无数种初始状态通过差异化积分计算生成对应的专属运动轨迹.这也是流匹配能够适应各类动态场景、通用性极强的原因。在实际设备运行的工程场景中无法实现理论层面的精确连续积分全部采用离散数值积分的方式完成计算最常用的两种方式为欧拉积分和龙格-库塔积分。欧拉积分计算逻辑简单把完整的运动时间拆分为多个均等的短时段每一个时段都按照当前位置的速度完成状态更新计算量更小适合结构简单、实时性要求高的轻量化设备任务。四阶龙格-库塔积分的计算精度更高会通过多个采样点拟合单一时段的动态变化修正简单分步计算产生的微小偏差适合高精度、高维度的设备运动建模场景。经过积分运算生成的连贯运动轨迹就是流匹配体系中唯一可直接使用的最终结果能够直接指导设备完成姿态调整、连续动作输出和环境交互彻底解决传统离散计算带来的动作跳变、运行不稳等问题让设备运动完全贴合现实物理规则。05 流匹配的数学原理分布到分布的确定性演化流匹配的计算靠状态分布转换、连续系统推演、最优路径规划三类基础数学逻辑搭建。这和传统机器学习依靠数据拟合的简单逻辑很不同。流匹配是对整体状态分布的整体调整整个转换过程不会出现状态信息丢失、多余状态生成、局部状态异常等问题。这一特性让它可以处理各类复杂的非线性状态变化也是其能够适应高维度设备运动场景的优势。从标准化的数学定义来看设设备初始状态对应的分布密度函数为任务目标状态对应的分布密度函数为设置统一的时间区间规范整个演化过程的时长。模型会生成随时间和空间变化的速度场设备的所有运动状态都遵循固定的微分方程规则变化随着时间从0到1持续推进设备的初始状态分布会沿着既定路径持续调整、更新、重构最终平稳过渡到目标状态分布。整个变化过程是完全确定的没有随机变动因素每一个初始状态都对应唯一的演化路径和最终状态运动过程可以追溯和预判和带随机扰动的扩散模型演化方式形成明显区别。流匹配的模型训练逻辑是缩小模型生成的速度场和真实最优速度场的差距。算法会先生成不同时刻的中间状态分布通过数学推导得到每一时刻合理的真实速度变化规则以此作为参照标准。▲图 | 流匹配运作动图注意右上角t始终在【01】之间这解释了何时停止生成神经网络作为拟合工具持续学习、优化自身生成的速度场参数不断缩小和真实规则的差距直到模型生成的状态演化规律无限贴近最优标准。整个训练过程不需要额外添加复杂约束条件优化过程稳定不会出现训练停滞、局部最优的问题。流匹配的全部状态转换过程始终遵循固定的守恒方程这个方程的作用是保证整个运动演化过程中设备的状态信息总量保持恒定不会出现信息缺失、状态畸变等问题。通过统计空间内的状态流动情况实时约束状态的汇聚和扩散趋势让整体演化过程始终保持合理、合规。06 Diffusion是流匹配的特例差在确定与随机流匹配里点在向量场作用下从起点连续变动到终点每一步都受一个明确的向量指引不管严不严格它总是一个定值。训练时也是拿明确向量当标签。那么如果在训练和运动时加的不是确定向量而是一个随机噪音一般服从高斯分布呢——这就是 Diffusion 的思想。扩散模型的所有计算逻辑和演化规则都可以被流匹配的通用体系覆盖属于流匹配框架下的一种特殊简化形式不具备独立的底层理论体系。多数研究对两类模型的认知偏差主要源于混淆了理论层面的连续演化逻辑和工程落地中的分步采样形式。从基础数学逻辑来看扩散模型的加噪、去噪、采样、状态更新等所有流程都可以通过流匹配的方程推导得出其所有功能特性都被流匹配的能力范围包含。简单来说扩散模型是受限版本的流匹配而流匹配是完全通用的完整框架。从连续演化的统一视角看扩散模型可以看作流匹配框架中一种带随机扰动、路径受限的特殊形式。扩散模型的前向加噪流程对应固定参数、固定路径的简单状态转换按照固定比例逐步把真实的设备状态数据转化为标准噪声数据整个转换路径、变化速度、调整幅度都是固定不变的。这一过程完全舍弃了动态调整能力无法根据数据特征、场景变化优化状态演化路径只是流匹配众多状态转换形式中最简单、最固定的一种线性变换形式不具备复杂场景的适应能力。反向去噪、数据生成流程则是在确定性演化逻辑基础上增加了随机扰动。扩散模型实际使用的反向计算方程由流匹配基础方程叠加随机波动项推导而来。▲图 | 直观上流匹配是直来直去Diffusion是磕磕绊绊因为随机噪音让它有往复它的使用范围因此受到极强限制只能完成真实状态和噪声状态之间的双向转换演化路径只能是固定的线性路径无法实现任意两类状态分布之间的非线性转换。这种固定的约束条件让扩散模型的通用性大幅降低只能适应简单的生成任务。▲图 | 从另外一个角度可见流匹配没有往复Diffusion有往复来源网络而流匹配的通用框架没有任何固定约束不限制转换的状态类型、不固定演化路径、不锁定变化速度能够根据不同的场景特征、不同的任务需求动态调整状态演化的整体规则实现任意两种状态分布的最优转换。对比说来扩散模型就是流匹配通过限制转换对象、固定演化路径、增加随机波动后形成的简化模型流匹配具备的动态适应、非线性转换、全域最优规划等能力都是扩散模型不具备的特性。这也是流匹配能够突破扩散模型的性能局限适应复杂具身智能任务的原因。07 四个环节跑通训练不绑定设备但算力决定形态流匹配无法通过固定公式直接计算复杂场景的动态速度场必须依靠深度神经网络完成拟合计算。神经网络的作用是模拟复杂的时空变化规则输出连续、平滑、符合物理规律的速度参数而不是传统模型输出的离散分类结果或固定动作指令。整体算法流程分为四个环节依次完成中间状态生成 → 速度场拟合 → 误差统计 → 参数优化。网络结构可以根据设备状态维度、场景复杂程度灵活调整唯一的要求是保证生成的速度场平滑稳定确保后续积分推演的运动路径合理可用。流匹配算法本身不绑定任何硬件设备硬件的选择只由计算量大小决定。在简单场景、低维度设备运动任务中模型参数少、计算步骤少、积分迭代次数低整体计算压力较小。普通CPU的串行计算能力完全可以完成模型训练、状态求解、实时推理等全部任务能够满足低端边缘设备的运行需求在理论和工程层面都不存在使用限制适合轻量化终端设备部署。在高维度、多设备协同、场景复杂的大规模任务中流匹配需要处理海量的环境数据、状态数据包含大量矩阵运算、微分求解、积分累加操作整体计算压力大幅提升。GPU具备多并行计算能力可以同时处理大批量数据同步完成多项计算任务能够大幅缩短模型训练和实时推理的耗时。同时GPU的大容量、高带宽显存可以承载海量时序数据的读写和缓存操作解决高维数据计算带来的性能瓶颈大幅提升复杂场景下的运行效率。经过精简、压缩后的轻量化流匹配模型计算量大幅降低可以直接部署在嵌入式设备、移动端等低算力终端无需依赖云端高性能算力集群。08 超长时序总有流匹配流匹配为具身智能的动态建模提供了稳定通用的计算框架解决了传统离散计算方式的偏差累积、状态畸变、运动失配等问题实现了智能设备状态演化的平滑性和可解释性。作为流匹配框架的特殊简化版本扩散模型的功能和理论边界被完全包含在流匹配体系中这也体现了流匹配的通用性和拓展性。流匹配的运行不绑定固定硬件算力适应范围广可根据任务复杂度灵活选择运行设备工程落地门槛低适应各类终端和算力集群的部署需求。