ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

潜在世界动作模型要解决哪两大难题?人大团队提出 JEPA-WAM,刷新机器人操纵 SOTA

2026/8/26 20:17:35 拓冰建站 浏览量
潜在世界动作模型要解决哪两大难题?人大团队提出 JEPA-WAM,刷新机器人操纵 SOTA 基于 V-JEPA 共享预测器构建潜态 WAM联合时序表征提升机械臂域外泛化能力——从零搭建策略目录01 现有技术路线02 JEPA-WAM核心架构与三大创新设计时空联合当前-未来预测目标核心表征创新单共享预测器耦合时序建模与动作生成无侵入式适配现有预训练VLA模型03 仿真与真机双维度实验指标的收益与局限LIBERO系列仿真基准RoboTwin 2.0双臂仿真真实双机械臂真机测试消融实验优化要点04 总结上图来自中国人民大学、清华AIR、XYZ Embodied AI等团队的联合团队推出JEPA-WAM。基于预训练V-JEPA构建共享预测器潜态世界模型无需生成像素画面依靠时空联合表征实现跨场景强泛化仿真与真机双平台验证无大规模机器人预训练条件下LIBERO-Plus数据集79.2%成功率刷新同赛道最优水平适配现有成熟VLA模型无损提升鲁棒性。01 现有技术路线当前机器人VLA世界模型分为两条主流路线视频生成式WAM通过逐帧预测未来图像建模环境变化理论上能完整还原场景动态但推理阶段需要循环生成画面算力消耗巨大机械臂嵌入式设备很难实时运行同时像素重建会冗余记录光照、噪声等无关信息模型容易过拟合训练环境域外场景泛化能力弱。传统独立分支潜态WAM放弃像素生成直接在特征空间预测未来但设计上存在两种缺陷一是仅编码单帧未来特征丢失当前-未来画面之间的局部空间变化关系物体微小位移、遮挡等关键动作线索丢失二是时序预测网络和动作编码器完全分离时序损失无法反向优化生成动作的主干网络世界建模的增益很难传递给动作预测分支。▲四类潜态VLA范式对比图对比目前四类潜态VLA范式能直观看出JEPA-WAM差异化设计逻辑传统WAM世界建模与动作专家分属两套独立主干信息割裂专用潜动力学VLA单独搭建动力学模块作为动作输入监督信号间接带独立LAM分支VLA视觉主干输出特征后额外新增动力学子网络无法共享权重JEPA-WAM本文单Qwen共享预测器同时输出时序表征与动作特征时序损失直接优化主干不存在冗余分支。当前的JEPA衍生机器人方案如VLA-JEPA、JEPA-VLA仅将JEPA特征作为输入没有实现时序预测与动作生成耦合而JEPA-WAM首次把联合时空预测目标嵌入V-JEPA表征空间一套预测器完成两大任务从结构上解决特征复用不足的问题。02 JEPA-WAM核心架构与三大创新设计整套框架核心由冻结V-JEPA编码器、Qwen2.5-0.5B共享预测器、DiT动作专家三部分构成训练阶段开启时序预测分支部署时直接删除预测头仅保留动作推理链路不增加上线延迟。▲JEPA-WAM 整体架构与综合性能总览时空联合当前-未来预测目标核心表征创新绝大多数潜世界模型只单独编码未来单帧特征JEPA‑WAM 创新构造联合时序表征将当前帧与步后的未来帧沿时间维度堆叠送入冻结 V‑JEPA 统一编码输出同尺寸、保留分块空间信息的联合特征。同相机时序画面拼接V‑JEPA 原生双帧 tubelet 编码保证输出空间网格和单帧完全一致冻结目标编码器避免时序损失破坏预训练视觉能力多视图拼接全局、腕部相机特征有序拼接完整保留机械臂多视角空间对应关系。该表征不单独编码未来而是直接存储“当前→未来”全部局部变化物体移动区域、遮挡变化、手爪交互信息全部保存在分块token里。▲联合时序表征的空间变化可视化诊断图可视化结果显示联合表征的特征变化区域和画面RGB动态区域高度匹配模型能精准捕捉手爪、物体交互的局部变化不会丢失细粒度动作线索。▲JEPA-WAM详细推理流程图单共享预测器耦合时序建模与动作生成这是JEPA-WAM最关键的结构创新彻底解决时序监督无法作用于动作主干的行业痛点共享预测器选用轻量化Qwen2.5-0.5B输入V-JEPA视觉特征、语言指令、专用动作占位符token单次前向传播输出两组特征用于时序预测的视觉位置隐态保留原始 patch 空间排布送入 MLP 预测头对齐联合时序目标动作专用聚合表征单独送入 DiT 动作专家生成连续机械臂动作。训练总损失为动作匹配损失时序对齐损失加权和采用逐块余弦距离损失强制预测器学习画面时空变化基于流匹配预测连续机械臂动作序列。两套损失同步更新同一个 Qwen 主干时序学到的空间动态知识直接赋能动作预测不存在两套网络的信息壁垒。无侵入式适配现有预训练VLA模型JEPA-WAM并非独立全新模型可作为辅助监督模块无损接入π0.5等成熟大规模机器人预训练VLA无需改动原有视觉、动作推理通路。实现方式仅新增一组可学习Future Token在VLM输入序列末尾追加64个专用时序token输出隐态重塑为粗特征图上采样对齐V-JEPA联合目标维度额外增加时序对齐损失辅助训练。▲预训练VLA接入时序监督结构图在LIBERO-Plus数据集原生π0.5基线84.5%接入JEPA时序监督后提升至86.3%成为全赛道最优结果证明该时序范式对大尺度预训练VLA同样具备显著增益适配存量工业VLA算法。03 仿真与真机双维度实验指标的收益与局限实验覆盖LIBERO仿真单臂、RoboTwin 2.0双臂仿真、真实AgileX双机械臂三大平台区分“无机器人大规模预训练”“带预训练”两组基线横向对比指标不单纯追求纸面刷榜区分域内ID、域外OOD两种场景解读实际落地价值。LIBERO系列仿真基准LIBERO域内ID场景原生JEPA-WAM无预训练平均成功率96.7%和ResVLA、Fast-WAM等主流方案持平接入π0.5预训练模型后提升至97.8%域内性能无衰减证明时序监督不会破坏基础任务能力。▲LIBERO 数据集任务成功率%按是否使用大规模机器人预训练分组LIBERO-Plus域外OOD核心评测场景该数据集通过更换光照、物体摆放、背景、相机视角制造分布偏移专门测试泛化能力是行业核心鲁棒性标尺。无大规模机器人预训练组别JEPA-WAM 79.2%超越RoVLA、ResVLA等全部基线同赛道第一带预训练组别π0.5JEPA Obj达到86.3%整体榜单最优▲LIBERO-Plus 域外泛化数据集任务成功率%分维度数据显示相机偏移、物体布局变化、光照扰动下JEPA-WAM提升幅度最大证明联合时序表征对视觉扰动鲁棒性提升效果最突出。RoboTwin 2.0双臂仿真区分Clean标准场景、Random随机扰动场景物体乱序、视角切换原生JEPA-WAMClean 79.9%Random 36.9%远超无预训练基线π0.5叠加时序监督Clean场景75.4%→84.6%大幅提升Random扰动场景性能基本持平▲RoboTwin 2.0 仿真标准 / 随机扰动场景单任务成功率%推理效率补充单帧推理85ms11.76Hz对比ABot-M0125ms速度提升32%嵌入式机械臂控制器可实时运行不存在视频生成模型的算力瓶颈。真实双机械臂真机测试搭建6自由度双臂平台设计5类操作任务摆盘、堆叠、抽屉抓取分别测试标准ID环境、更换背景物体OOD环境▲真实双臂机器人五项操作任务的域内 / 域外实验结果轻量JEPA-WAM原生模型ID均值59.8%OOD均值54.2%对比原生π0ID51.8%/OOD22.5%域外泛化提升一倍以上π0.5叠加JEPA时序监督ID 77.5%→90.3%OOD72.5%→84.7%真机复杂物理交互下泛化增益稳定复现。真机实验核心价值仿真数据集的泛化优势不是纸面数字真实相机畸变、机械传动误差、物体摩擦力扰动场景下依旧成立具备工业落地可行性。消融实验优化要点表征层面联合时序目标仅未来帧特征差值分块空间对齐不可压缩主干层面时序监督作用于预测器最后一层效果最优中层辅助监督收益大幅下滑任务隔离专用动作占位符能避免时序特征干扰动作生成是平衡多任务的关键视觉基座V-JEPA自带时序表征能力替换DINOSigLIP基线域外平均直接提升3.8%。▲LIBERO-Plus 数据集分扰动维度消融实验结果04 总结JEPA-WAM跳出“生成像素”、“独立动力学分支”两大传统世界模型设计思维依托V-JEPA稠密分块表征搭建共享预测器用联合当前-未来时序目标精准捕捉场景局部时空变化让时序动态监督直接赋能动作生成主干。无论是从零训练轻量化VLA还是优化现有大规模预训练机器人策略都能稳定提升光照、视角、物体布局扰动下域外任务成功率同时保持低推理开销适配工业机械臂嵌入式硬件。该工作证明JEPA类自监督视频表征是解决VLA泛化瓶颈的优质底座后续若融合多模态传感、自适应时序偏移参数、语言条件时序目标有机会进一步拓展至动态工件、长步骤工业装配等高难度机器人任务。Ref论文标题JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling