ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

3.5万次真机实测:北京人形提出RoboAug,让机器人数据“少采也能泛化”(CoRL 2026)

2026/10/7 16:30:20 拓冰建站 浏览量
3.5万次真机实测:北京人形提出RoboAug,让机器人数据“少采也能泛化”(CoRL 2026) 机器人想要适应开放世界不一定要先收集覆盖所有场景的海量真机数据。——RoboAug目录01 机器人数据增广到底卡在哪02 一张标注图怎么‘变’出几百个场景第一步任务相关区域的一次性提取一张参考图完成跨轨迹匹配第二步语义数据增广生成完整背景而不是在遮挡区域里“脑补”第三步区域对比策略学习不仅让模型看见目标还要让它真正关注目标03 超过3万5千次的真机测试效果到底如何三种干扰同时出现RoboAug 仍保持领先面对 170 种新背景成功率达到 54%区域对比学习让注意力从背景回到操作对象04 数据并非越多越好增强比例存在“甜点区”05 RoboAug 带来的启示06 写在最后机器人学东西最贵的从来不是模型而是数据。换一块台面、换一种光照、旁边多一个无关物体刚训好的策略就可能“手抖”——这是具身智能走向真实场景的一道现实难题。过去主要有两条路一是大规模数据采集 预训练烧钱又耗时二是语义数据增广用生成模型换背景、加干扰物但前提是上游目标检测足够准确——而现实中视觉基础模型在机器人场景里经常“看走眼”一个错误的边界就可能把动作带偏。所以真正做起来远没有“换个背景图”这么简单。近日北京人形机器人创新中心等机构提出 RoboAug——一套区域对比数据增广框架。只需一张图的边界框标注就能自动生成不同背景、干扰物和光照的训练场景并显著提升模型性能并在三台真实机器人上完成了超过 3.5 万次测试。该工作已被CoRL 2026接收。▲图 1RoboAug 从受控训练场景出发通过区域提取、语义增强与区域对比学习提高策略在复杂背景、光照和杂物干扰下的泛化能力01 机器人数据增广到底卡在哪先回到问题本身。为什么机器人的泛化这么难真实世界里机器人面对的干扰主要来自三个方面复杂的背景、光照变化以及与任务无关的干扰物。这些因素叠加在一起策略很容易“认死理”——训练台面上抓得好好的换个花纹桌布就抓空。传统的“弱增广”比如随机裁剪、色彩抖动、轻微平移本质上只是给图像加噪声难以引入真实的语义变化对跨环境泛化帮助有限。进一步的做法是“语义增广”用大模型替换背景、添加干扰物同时保持机器人和目标物体不变。但它有一个隐藏前提——你得先准确知道哪块像素是机器人、哪块是目标物体。研究团队专门测试了一下在 33 个机器人操作任务、7576 条轨迹上用 GroundingDINO 和 LMMDet 这两个当前最强的开放世界检测器去做实例分割结果失败率很高——边界缺失、区域幻觉、物体被背景纹理“吃掉”一旦这些错误被传给生成模型前景就会被污染机器人学到的动作自然跟着跑偏。问题就在这里以前的生成式增广默认上游检测是完美的但真实机器人数据根本做不到这一点。因此RoboAug 解决的并不是简单的“背景生成”而是一个更基础的问题如何以极低标注成本稳定地找到整套机器人数据中的任务相关区域。02 一张标注图怎么‘变’出几百个场景RoboAug 的思路可以拆成三步。核心一句话只人工标一张图剩下的全自动覆盖整套轨迹。▲图 2RoboAug 的三阶段完整流程第一步任务相关区域的一次性提取一张参考图完成跨轨迹匹配对于每个任务只需要在一张参考图像中框出任务相关对象。RoboAug 先用 DINOv2 提取参考区域的视觉特征再用 GroundingDINO 在其他轨迹的首帧生成候选框通过特征相似度找到对应对象。这里的关键是让检测模型负责“找候选”而不是直接做最终判断。即使检测类别不够准确也可以借助参考图像的视觉特征筛掉无关区域、修正匹配结果而且不需要额外训练检测器。找到首帧对象后再用 SAM 2 完成分割和跟踪把结果传播到后续帧最终得到连续的像素级掩码人工标注的工作量被压缩到了一条轨迹标一次框。第二步语义数据增广生成完整背景而不是在遮挡区域里“脑补”获得任务区域的精确掩码后RoboAug 用大语言模型生成背景描述再通过 Stable Diffusion 3 Medium 合成完整背景并构建了 500 个模板覆盖木材、石材、复合材料等常见桌面环境。不同于直接在原图上修补背景RoboAug 先生成完整、连贯的新场景再将原图中的机械臂和任务对象叠加上去。这样既能避开机械臂遮挡带来的修补难题也能尽量保持物体几何和动作标签不变。换句话说RoboAug 改变的是“机器人在哪里工作”而不是“机器人正在操作什么”。第三步区域对比策略学习不仅让模型看见目标还要让它真正关注目标仅靠生成更多背景并不能保证策略不走捷径——增广后的图像里大部分仍是无关背景。为此RoboAug 引入区域对比学习Region-Contrastive LearningRCL。训练时根据掩码提取任务物体的区域特征拉近同类物体在不同场景中的表示推远不同类别的表示同时利用空间注意力强化真正有信息的区域。说白了就是逼着模型“别看花里胡哨的盯住该操作的目标”。这套方法不需要改动策略本身ACT、π0 都可以直接接入是一套可叠加在现有训练流程上的通用增强方案。03 超过3万5千次的真机测试效果到底如何为了避免只在单一机械臂或少量场景中验证RoboAug 在三台形态完全不同的机器人上做了验证单臂的 UR-5e、双臂的 AgileX以及人形机器人 Tien Kung 2.0三类机器人共覆盖 15 项任务从单臂抓取、放置和开抽屉到双臂叠碗、扶正杯子、摆放餐具和加热面包。每项任务采集 50 条真实专家轨迹最终完成超35,000 次真实机器人测试。▲图 3RoboAug 在 UR-5e、AgileX 与天工 2.0 上覆盖单臂和双臂操作任务。泛化测试的条件堆得很足背景170 种没见过的台面纹理从规则几何图案到杂乱花纹干扰物工作区里摆 10 个无关物体光照20 种动态变化的灯光三重因子组合同时换背景 加干扰物 变光照。▲图 4从原始环境到背景、干扰物、光照变化再到双因素和三因素组合测试。三种干扰同时出现RoboAug 仍保持领先不使用数据增强时UR-5e、AgileX 和天工 2.0 上的平均成功率分别只有 9%、16% 和 19%引入 RoboAug 后成功率分别提高到 47%、60% 和 67%。与最强数据增强基线 GenAug 相比RoboAug 在三类机器人上的相对提升分别达到 51.6%、76.4% 和 59.5%。这说明它的收益并不局限于某一种机器人本体。▲图 515 项任务在三因素变化下的完整结果。面对 170 种新背景成功率达到 54%研究团队进一步在 UR-PutCornPot 任务上测试了 170 种训练期间从未出现的桌面纹理包括规则几何图案、结构化设计和随机散布图案。RoboAug 的平均成功率达到 54.0%明显高于 GenAug 的 36.8%。随着背景图案变复杂两种方法都会受到影响但 RoboAug 的性能下降更缓说明策略更少依赖背景纹理。▲图 6RoboAug 在 170 种未见桌面纹理上的泛化表现。区域对比学习让注意力从背景回到操作对象Grad-CAM 可视化进一步展示了 RCL 的作用。没有 RCL 时策略的注意力容易散落在高频背景纹理或无关物体上加入 RCL 后即使同时改变背景、光照并加入干扰物模型仍能将注意力集中在抓取点和任务对象附近。▲图 7加入 RCL 后策略在复杂环境中仍能更准确地关注任务相关区域。消融实验也给出了一致结论在三个代表性任务上RoboAug 加入 RCL 后的平均成功率由 46% 提高到 56%在天工 2.0 的称重苹果任务中成功率从 68% 提高到 80%。在 LIBERO-Plus 仿真基准上RoboAug 对背景、干扰物和光照变化的平均成功率达到93.3%高于 RoboEngine-G 的 86.8% 和无增强 ACT 的 79.8%。04 数据并非越多越好增强比例存在“甜点区”文章还展示了一个容易被忽略的现象合成数据并不是越多越好。例如在 UR-StackBowl 任务中增强比例从 1:0 提升到 1:3、1:5 和 1:8 时未见背景上的表现持续提升但超过 1:15 后成功率反而明显下降。▲图 8增强比例呈倒 U 形趋势约 1:5 的原始数据与增强数据比例取得较好平衡适量的合成数据可以帮助模型摆脱对训练背景的依赖但比例过高也可能放大合成分布与真实世界之间的偏差。因此RoboAug 给出的经验不是“尽可能多地生成”而是以真实轨迹为锚点有控制地扩展视觉分布。论文中统一采用 5 倍扩展即 50 条真实轨迹搭配 250 条生成轨迹。05 RoboAug 带来的启示回头看 RoboAug它真正的贡献不在于“又造了一个生成模型”而在于拆掉了机器人数据增广中的四个默认假设第一不依赖大规模预训练数据。不需要先在海量真实场景里跑几百万条轨迹一套框架内就能解决。第二不依赖完美的上游视觉识别。不再赌VFM 能把所有物体都框对而是用人工标一帧 时序传播把标注误差控制住。第三它把掩码从图像合成工具变成了训练监督。过去语义掩码往往在生成新图片后就完成使命RoboAug 则继续用它构造区域对比目标直接约束视觉表征让策略学习什么应该保持不变。第四它证明了数据层方法也可以跨机器人、跨策略发挥作用。相比继续扩大预训练规模这条路线尤其适合真实数据有限、部署环境变化又很大的机器人任务。当然它也有边界每个新任务仍需标注一张参考图当前增广主要覆盖视觉环境无法直接扩展物体动力学和动作分布合成数据过多也可能带来性能下降。因此如何自动选择高价值的增强场景并进一步扩展到物理交互变化仍值得探索。06 写在最后RoboAug 已经给出了较为清晰答案机器人想要适应开放世界不一定要先收集覆盖所有场景的海量真机数据。找准任务相关区域、生成足够多样但标签可靠的视觉环境再让策略学会忽略无关变化一张标注也可以成为数百种场景的起点。让机器人少在数据里泡多在场景里见——用一张标注换几百个场景这件事的经济账在真实机器人开发里是算得过来的。Ref论文题目RoboAug: One Annotation to Hundreds of Scenes via Region-Contrastive Data Augmentation for Robotic Manipulation论文链接https://arxiv.org/abs/2602.14032项目主页https://x-roboaug.github.io/