ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

中国团队提出PhysicalRSI 1.0,比GPT-6 Astra节省百倍Tokens,霸榜RoboDojo~

2026/9/30 12:14:57 拓冰建站 浏览量
中国团队提出PhysicalRSI 1.0,比GPT-6 Astra节省百倍Tokens,霸榜RoboDojo~ 就在刚刚RoboDojo榜单又更新了。PhysicalRSI 1.0占据榜首并取得了36.27 Score、31.38% SR而研发团队则是港大MMLAB。我们也跑去和PhysicalRSI的团队沟通了下拿到了更多细节。这是一个非常简洁且高效的自进化具身智能系统基线让机器人根据任务改写自己的工具、代码、记忆、与技能再由物理环境选出更有能力的“下一代”。在官方榜单Precision维度Astra为4%PhysicalRSI提升明显。具体到插钥匙PhysicalRSI为39.33%GPT-6 Astra、π0.5与Simate-beta均为0%插管PhysicalRSI为66%三者分别为0%、3.33%与22%。π0.5本身也是PhysicalRSI能够调用的动作工具改进来自如何组织工具、代码、记忆与技能。此外相较于GPT-6 Astra在RoboDojo上全量测试一次需消耗20万人民币tokens费用PhysicalRSI 1.0仅用百分之一的成本比GPT-6 Astra的成功率提升了40%。PhysicalRSI 1.0项目链接https://mmlab.hk/research/PhysicalRSI原文链接中国团队提出PhysicalRSI 1.0比GPT-6 Astra节省百倍Tokens霸榜RoboDojo01 从训练动作模型到让通用大模型直接控制机器人OpenAI推出的通用大模型开始在机器人评测中超过专用策略。9 月GPT-6 Astra在 RoboDojo上取得28.97 Score、22.48%平均成功率超过报告比较的40个公开机器人策略。直接看图、理解指令、决定机械臂如何运动正在成为通用大模型的一项新能力。VLA、WAM 等路线从动作学习和物理预测入手通用大模型则将语义理解与任务推理带入控制过程。如今这些路线开始在同一套机器人任务上接受检验。但GPT-6 Astra的成绩也呈现出鲜明反差总体成绩领先精密操作成功率却只有4%。抓取之后怎样调整姿态、如何对准插孔、多步操作如何衔接仍是机器人必须解决的具体问题。而这次港大MMLAB团队提出的Physical Recursive Self-Improvement 则是让通用模型进一步参与这些控制问题的改进。一次任务留下的经验由此进入下一代智能体实际运行的代码与配置。看完一次失败的执行模型可以修改动作程序、更换工具、调整记忆与技能的调用方式生成不同的子代智能体再由环境中的任务表现决定保留哪个版本。我们了解到该方案是“System 1–2 协同自进化System 1–2 Co-Evolution”让负责理解与规划的“System 2”改进负责动作执行的“System 1”同时修改两者协作的Harness。02 GPT-6 Astra的短板主要在“理解之后”的控制过程先看看GPT-6 Astra的短板在哪里。插钥匙就是一个直观的例子。理解“把钥匙插进锁孔”并不难但机器人需要先抓住钥匙调整到可用的姿态必要时在两只手之间交接再让钥匙与锁孔对齐。前几步取得进展也可能在最后的插入环节失败。Astra的RoboDojo Precision成功率为4%说明通用推理能力尚未充分转化为精细控制能力。在GPT-as-policy设置中大模型根据观察直接选择运动目标再由底层接口转成机器人指令。PhysicalRSI 1.0 是希望把这两层职责组织得更有效“System 2”负责判断如何完成任务、分析哪里出错“System 1”用技能模型、控制程序和工具完成具体动作例如π0.5就只是其中一个可调用的动作工具。分工之后还需要持续改进。例如机械臂松开衣服后的回撤路径影响了后续折叠“System 2”就可以修改回撤程序下一次执行时“System 1”直接运行新程序。与此同时Harness也可以改变“System 2”读取哪些历史、何时检查结果、选择哪个工具。决策方式与执行能力都成为可修改、可评估、可继承的对象。这就是“System 1–2 Co-Evolution”要解决的问题将一次任务中的分析落实成下一代智能体实际运行的程序与配置。环境中的后续表现检验这次修改是否有效。03 Self-Harness让机器人改写自己完成任务的方法我们了解到PhysicalRSI 1.0 用Embodied Self-Harness实现这套协同自进化。Harness可以理解为智能体的工作程序。它把基模、工具、技能和记忆连接起来看到什么信息采用什么计划调用哪个技能保留哪些状态出现偏差后怎样处理。Self-harness 则让智能体自己修改这套工作程序。叠衣服的版本记录给出了一个具体例子。某个候选版本改动了释放衣物后的回撤方式下降时记录机械臂实际经过的关节位姿松开衣物后沿这条路径反向返回。参数home和descent每个回合重新测量。下一代继承的是“记录路径并沿路径回撤”的方法因此衣服位置变化后程序仍会按当前现场重新建立状态。Self-harness把这样的修改纳入选择过程父代读取任务录像、动作记录和评估反馈生成绑定不同工具、代码、记忆与技能的子代父代与子代进入环境评估表现更好的版本留下来继续产生下一代。不同候选可以修改不同环节新增代码也可能被淘汰。这里的“适者生存”由任务奖励或成功率具体定义。在叠衣服的迭代中不同版本先后探索了回撤路径、腕部对齐、目标选择和布料跟踪。这些记录让“自进化”可以对应到具体版本、具体代码与具体动作。04 一套简单有效的baseline在RoboDojo中取得第一RoboDojo仿真评测涵盖42个任务考察泛化、精密操作、长程任务、记忆与开放能力。基于此PhysicalRSI 1.0设计了一套极为简单但有效的基线。这套baseline的结构很直接多模态基模负责理解、规划和改写harnesscode-policy skills、π0.5与工具负责操作所有动作经PhysicalAPI****进入环境。例如代码技能可以把数字识别、排序和抓取串起来也可以保存被遮挡物体的位置或安排两只手的交接顺序。截至2026年9月28日PhysicalRSI 1.0在官方榜单取得36.27 Score / 31.38% SR位列第一。Simate-beta为33.95 / 27.96%GPT-6 Astra为28.97 / 22.48%单独使用π0.5为11.44 / 6.93%。PhysicalRSI的成功率比Astra高8.90个百分点比Simate-beta高3.42个百分点约为单独使用π0.5的4.53倍。05 从一个baseline走向具身自进化的研究基础设施RoboDojo 是PhysicalRSI 1.0的首个主要示例场。但我们觉得真正的意义在于它很有希望进一步建立具身自进化研究的基本标准“明确智能体可以修改哪些部分子代如何生成环境如何评估哪些修改能够被继承”。每一次能力提升都应能追溯到对应的版本、交互记录与选择过程。这也为后续成长为一套可扩展的具身自进化基础设施提供了很好的基础。