ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

一小时455次抓取,成功率100%!理想ME-Brain 1.0发布,两条闭环打通具身系统

2026/9/26 16:30:37 拓冰建站 浏览量
一小时455次抓取,成功率100%!理想ME-Brain 1.0发布,两条闭环打通具身系统 「连接记忆、认知与行动」目录01 模型能力之外还要有接手任务的系统能力02 执行闭环在真实世界的变化中把任务做对03 自进化闭环让今天的经历成为下一次任务的能力04 双域认知领先执行能力走向真机检验05 端侧部署让自进化走向本地06 从一次接手到长期协作人把杯子和熊猫玩偶放进收纳篮再将桌面恢复原状。接到开始指令后机器人依次完成同样的收纳。用户没有逐步告诉它先抓什么、再放哪里、任务要求来自刚刚发生的人类行为。这是理想 ME-Brain 的一段真实演示。从看到人怎么做到理解任务、组织动作、检查结果 ⼀次简单的收纳背后是认知、记忆与行动的连续协作。一次示范怎样变成机器人自己的执行计划现场发生变化它又该如何继续这些问题把具身智能的要求从“模型能理解什么”推向了“系统能完成什么”。理想发布的MachEmbodied-BrainME-Brain1.0将这些能力纳入⼀套完整的具身系统。两条相连的闭环构成了它的主线任务执行闭环让机器人根据目标与现场变化推进任务经验演化闭环让记忆与技能在交互中更新驱动部署后的系统级自进化。01 模型能力之外还要有接手任务的系统能力Agent Model Harness 已是常见的理解方式模型提供能力运行机制组织上下文、工具和执行。对机器人而言这套机制还必须深入物理世界把人的意图、环境变化和动作结果纳入同一条任务流程。ME-Brain 的认知核心 Cognitive Core 由 ME-VLM 承担在同一个模型中统一具身认知与多模态 Agent 能力。它理解现场也组织任务既决定下一步做什么也判断上一步是否做成。Action Model 将决策落实为机器人动作。其 Focus-VLWA 模型结合当前观察、视觉历史与局部未来预测为执行提供依据。Evolvable Memory 则持续整理观察和执行经历把即时状态、任务事件与可复用经验提供给不同模块。这套协作让模型能力有了连续发挥作用的方式人类示范可以成为任务来源环境事件可以改变执行时机动作反馈可以触发计划调整积累的经验则能够进入下一轮决策。02 执行闭环在真实世界的变化中把任务做对真实世界不会严格按照计划运行。目标可能被移动抓起的物体可能滑落下一步操作所需的条件也可能迟迟没有出现。一份开始时合理的计划执行到一半就可能不再适用。机器人要把任务做对必须能够判断现场发生了什么并据此修正接下来的行动。ME-Brain 的执行闭环正是围绕这种不确定性建立的。认知核心结合当前场景制定计划为子任务设置可观察的完成条件动作模型执行后新观察与执行结果返回认知核心由它判断任务是否完成、能否继续以及是否需要等待或重新规划。“规划—执行—观察—判断—重规划—再执行”让计划能够随着真实状态持续更新而不是在动作发出后失去对结果的掌握。这里最关键的能力是对物理执行情况作出正确判断。夹爪闭合不等于抓取成功物体移动了也不等于放到了正确位置。遮挡、接触关系和细微的状态变化都可能影响结论。Cognitive Core 需要理解这些物理信息才能区分动作已经完成、执行出现偏差还是条件尚未满足。具身认知能力因此直接决定了闭环能否有效纠偏。如果结果偏离预期系统会进一步分析问题来自感知、规划还是动作执行再更新任务进度与恢复策略。定位偏差和抓取后滑落需要不同的处理方式不能简单重复同一条指令。重新规划的作用就是把这些判断转成新的子任务与技能调用让后续行动重新对准任务目标。等待同样属于这一过程。在“等绿碗出现再把勺子放进去”的 Demo 中紫色碗、橙色碗先后进入工作区系统没有贸然执行而是保持监测。直到监测工具报告绿碗出现Agent 才被唤起重新获取现场图像确认勺子和目标碗的位置规划并执行放置最后检查勺子是否入碗、夹爪是否释放。这段演示呈现了条件未满足时的处理方式先等待再根据变化后的现场重新规划执行。等待、观察和行动被纳入同一条任务流程系统不必强行沿着已经不适用的步骤往下走。有效的调整还需要动作模型利用历史。Focus-VLWA 在视觉语言主干之外维护独立的视觉记忆库从本轮轨迹起点到当前均匀采样最多 32 帧头部相机图像。动作表示通过交叉注意力查询相关历史再用检索结果调节动作专家的中间特征世界模型专家则预测下一次交互事件附近的局部变化。当前动作因此能够同时参考眼前状态、历史线索与局部未来预测。闭环提高任务成功率的关键就在于让执行反馈持续修正后续决策减少错误沿着原计划累积。计划并不需要预先穷尽所有状况但系统必须具备发现偏差、等待条件和调整行动的能力。在这一执行机制之上ME-Brain 还展示了从人类行为中获取任务的能力。在收纳 Demo 中用户先将粉色杯子和熊猫玩偶放进白色篮子。系统记住示范待物品被拿回桌面、用户发出开始指令后重新观察现场调用已有操作能力依次完成收纳并检查结果。人类示范提供了“做什么、按什么顺序做”的依据执行闭环则负责结合当前环境将它落实。用户可以通过示范表达任务而不必逐条描述动作机器人仍然依靠观察、规划与结果验证来完成操作。在执行闭环的支撑下ME-Brain 进一步完成了长程手冲咖啡演示并在一小时的抓取演示中面向 100 多件物品累计完成 455 次抓取该次演示成功率达到 100%。从多步骤的长程任务到高频重复的持续作业这些演示展现了闭环系统持续把任务做对的能力。03 自进化闭环让今天的经历成为下一次任务的能力接手一次任务只是起点。更进一步的问题是机器人今天看过的示范、完成的操作、遇到的失败能否改变明天处理任务的方式ME-Brain 通过 Evolvable Memory 与认知核心的协作将能力积累延伸到部署之后。这里的自进化发生在系统层无须每次交互后重新训练模型系统就能更新外部记忆、技能及其调用策略使后续决策拥有新的经验依据。记忆因此不再只是保存过去的档案而是参与能力更新的机制。这条自进化路径从分层记忆开始。短期记忆保留密集的近期多模态状态为局部执行提供历史条件中期记忆将连续记录整理为关键事件和任务阶段支持进度管理与失败恢复长期记忆进一步提炼成功条件、失败模式和可复用经验服务后续任务。信息经过提炼但证据不会被切断。完整任务、子任务与关键事件通过节点关联中长期记忆仍保留通向底层记录的路径。系统既可以快速读取经验概要也可以回到具体的视觉、空间与动作信息判断这段经验是否适合当前场景。决定经验价值的是认知核心对执行过程的理解。同样一次“抓取失败”定位偏差与抓取后滑落意味着不同的问题。认知核心把状态变化、完成情况和失败原因写入记忆后续规划便能利用这些区别而不只是重复读到一句“上次失败了”。经验还会进一步改变技能库。按照报告描述的机制经过反复验证的成功操作可以组合为可复用技能已有技能的适用条件可以修订持续失败的技能则被替换。系统积累的既是“发生过什么”也是“什么条件下怎样做更合适”。前面的收纳 Demo 展示了这条路径的入口人类行为被保留为视觉记忆再用于机器人的规划与执行。在更完整的经验演化机制中人类示范与自主执行反馈都能成为经验来源经过整理、归因和复用进入后续任务。执行产生经验认知解释经验记忆组织经验技能更新再影响下一次执行。“执行—获取—演化—再执行”让两条闭环真正连成一体也为机器人从“训练后固定”走向“部署后演化”提供了一条系统路径。04 双域认知领先执行能力走向真机检验看懂人类行为、理解物理反馈、组织长程任务对认知核心提出了双重要求既有扎实的具身理解也有通用推理与工具调用能力。ME-VLM 将两者统一在同一个模型中。在技术报告所列具身模型的对比中Cognitive Core 的 ME-VLM 35B-A3B 版本在物理认知与数字 Agent 两类评测上均取得多项最高分。具身评测覆盖物理理解、长程规划、动作与执行、纠错四类能力。26 项基准中ME-VLM 35B-A3B 在 14 项取得最高分或并列最高分报告均分为 70.9较所列最强对照高 8.2 分。数字 Agent 评测覆盖多模态理解、工具与技能调用、长程规划、推理和指令跟随。16 项指标中ME-VLM 35B-A3B 在 13 项取得最高分或并列最高分。其中GPQA 为 78.7AIME25 为 72.9IFEval 为 86.9。这种双域能力为系统在物理场景中进行理解、推理与任务调度提供了模型基础。执行侧的表现则进一步由记忆任务、双臂仿真和真机操作检验。在涵盖计数、遮挡、历史指代与模仿的 16 项 RoboMME 任务中ME-Brain 平均成功率为 47.88%高于表中次高的 FrameSampling Modulation44.62%。在双臂仿真基准 RoboDojo 中ME-Brain 接受了 54 种配置、共 1296 次试验。按五类能力等权汇总后平均得分为 21.51、成功率为 16.03%均为报告列出的五个系统最高对照成绩来自官方榜单。其中ME-Brain 的记忆维度成功率为 24.67%表中次高为 9.11%。团队自建的真机基准 ME-RealBench 使用 Piper 双臂机器人六项任务各进行 10 次独立试验。ME-Brain 的平均成功率为 66.7%平均得分为 69.5均高于所测其他模型相比 DMO.5分别提升 11.7 个百分点和 12.8 分。05 端侧部署让自进化走向本地一个能够长期积累经验的机器人也需要在用户身边维护这些经验。环境观测、行为习惯与任务历史不断增加本地生成和调用记忆可以减少敏感信息在设备与云端之间的传输缩短记忆访问链路。通过与马赫 M100 的软硬件协同优化ME-Brain 的记忆、认知和行动三个核心模块已分别验证可在端侧独立运行。其中Evolvable Memory 已支持本地记忆生成、存储、演化和检索认知核心也提供面向端侧的 4B 版本。这让系统级自进化有了走向本地部署的工程基础。下一步团队将继续推进整套系统的轻量化适配让完整的认知、记忆与行动闭环在端侧协同运行。06 从一次接手到长期协作ME-Brain 下一阶段要推进的是让任务中的自主执行与任务之间的经验演化在更长时间里持续运转。随着交互增加系统需要区分哪些经验仍然有效哪些记录已经重复哪些细节值得保留。后续将进一步研究记忆压缩、冗余清理与动态活跃度监测结合任务相关性、访问频率和时效性管理记忆在保留关键经验的同时控制存储和检索成本。更长期的目标是让本地记忆逐渐积累对用户偏好、行为模式和需求的理解并随着生活环境与习惯变化持续更新。机器人与人的协作也由此有机会从一次性的任务交付走向带有经验积累的长期服务。团队还将通过长期运行、环境变化和技能复用的对照与消融实验检验记忆及技能更新对任务成功率、失败恢复能力和资源开销的影响让自进化的收益得到持续、可量化的验证。从看懂一次人类示范到主动等待合适时机再到根据执行结果调整计划ME-Brain 展示了机器人接手任务的不同方式。记忆驱动的自进化则让这些任务之间有了联系新的执行会留下经验积累的经验能够参与新的行动。让大模型进入真实任务既需要把眼前的事情做成也需要让过去的经历继续发挥作用。ME-Brain 用两条相连的闭环将可靠执行与部署后的持续演化纳入同一套系统。项目主页https://machembodied.com/ME-Brain/ME-Brain-1.0.html项目githubhttps://github.com/MachEmbodied/ME-Brain-1.0技术报告https://arxiv.org/abs/2609.24271