
摘要本文解读 CoRL 2025 论文《Enter the Mind Palace: Reasoning and Planning for Long-term Active Embodied Question Answering》。该论文提出长期主动具身问答LA-EQA这一新任务通过融合分层场景图构成的「记忆宫殿」长期记忆表示、世界实例—区域—视点三层语义引导搜索与基于信息价值VoI的早停判据让机器人既能回忆过去经历、又能主动探索当前环境回答带时间约束的问题。实验表明Mind Palace Exploration 取得 65.0% 的答案正确率超出最强基线 12.1 个百分点同时只检索 22.86 张图像比多帧 VLM 方案少 77.14%并在四足机器人于 1,000 平方米真实办公室的部署中平均节省 3–10 次房间搜索为长期具身智能与机器人记忆系统提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息长期主动具身问答为什么难研究主线从问题到结论基准/方法设计把历史压成可查询的图分类全景记忆宫殿的三个组件方法细节三层搜索与信息价值早停实验设计与结果结果对比总结关键发现局限性常见问题FAQ什么是长期主动具身问答LA-EQAMind Palace Exploration 和已有的记忆检索方法如 ReMEmbR有什么不同记忆宫殿为什么能同时提高正确率和效率VoI 早停是怎么工作的这个方法在真实机器人上跑得动吗这个工作的主要局限是什么参考链接论文基本信息项目内容标题英文Enter the Mind Palace: Reasoning and Planning for Long-term Active Embodied Question Answering标题中文Enter the Mind Palace长期主动具身问答的推理与规划作者M. Fadhil Ginting, Dong-Ki Kim, Xiangyun Meng, Andrzej Reinke, Bandi Jai Krishna, Navid Kayhani, Oriana Peltzer, David D. Fan, Amirreza Shaban, Sung-Kyun Kim, Mykel J. Kochenderfer, Ali Agha, Shayegan Omidshafiei机构Field AI · Stanford University会议CoRL 2025PMLR 305:5072–5106arXivhttps://arxiv.org/abs/2507.12846项目网站https://mind-palace-laeqa.github.io/长期主动具身问答为什么难具身问答Embodied Question Answering, EQA检验的是机器人对环境的语义理解。此前的设定只覆盖两端主动式要求机器人从零开始探索环境来收集信息情景式则要求机器人基于单段记录的轨迹作答。两者都有一个共同的天花板——它们只使用机器人当前的观测或单独一段情节记忆无法利用跨越多天、多月积累的经验。而现实中的机器人正在变得越来越长寿。当一台机器人连续运行数周甚至数月它会自然积累起海量观测作者指出单次运行就能产生上千张来自不同视角的图像而绝大多数问题其实只与其中少数几帧相关。把这些数据直接塞进模型上下文既低效——受限于上下文窗口——在长期设置下往往根本不可行。第二个难点来自搜索空间的组合爆炸。要回答问题机器人既要判断该回忆哪段历史又要判断该去环境里哪个地方看于是过去的观测与当下待探索的位置共同构成了一个巨大的联合搜索空间。没有先验的搜索代价高昂。论文由此提出LA-EQA机器人必须同时回忆过去经历并主动探索当前环境环境本身还会随时间改变外观与物体状态。作者把该任务形式化为五元组 $(Q, M, E, x_0, A^)$——问题、情景记忆列表、当前环境、初始位姿与标准答案每条情景记忆 $m_i [m_{i,1}, \cdots, m_{i,L}]$ 由若干位姿—图像观测对 $m_{i,j} (x_{i,j}, o_{i,j})$ 组成。机器人执行的策略 $\pi(a_k \mid x_k, h_k, Q)$ 在三种动作之间选择检索retrieve、探索explore与作答answer*。值得注意的是论文对既有基线做了清晰的能力刻画多帧 VLM 把 100 帧全量塞进上下文但不会主动探索Socratic LLM 只用文本描述、完全不检索图像ReMEmbR 用向量数据库做检索但仍然不探索两种主动式基线虽然会探索记忆表示却很粗糙。没有任何一个基线同时具备结构化的长期记忆与主动探索——这正是本文要填的空白。研究主线从问题到结论图 7Mind Palace 论文的研究主线——从 LA-EQA 问题定义到 65.0% 正确率的结论Mermaid 流程图基准/方法设计把历史压成可查询的图论文的核心主张来自一个认知科学类比人类使用记忆宫殿mind palace技术把需要记忆的信息与空间地标关联起来从而高效且可追溯地回忆。作者把这个思路搬到机器人上——把长期观测组织成结构化的空间记忆。具体地系统按小时、时段或周这样的宏观时间把长期历史切分成若干情节每个情节生成一个世界实例world instance用一张分层场景图 $G_i (\mathcal{V}_i, \mathcal{E}_i)$ 表示。场景图有两层节点视点节点 $w$从过去轨迹中采样的密集视点保存机器人位姿 $x$、图像、图中检测到的物体列表以及帧描述。这三者共同充当语言模型的检索索引。区域节点 $v$视点按空间与上下文相似度聚类而成带聚类质心与物体列表使大空间可以被增量搜索。全部世界实例构成记忆宫殿 $\mathcal{M} [G_0, G_1, \cdots, G_N]$。其中 $G_1, \cdots, G_N$ 是过去的长期记忆$G_0$ 是当下的世界实例——它在任务开始时只初始化区域节点因为环境状态与物体摆放可能已经改变并随机器人的探索实时更新。这一步的关键在于过去与当下被放进同一套表示因此检索和导航可以共用同一次图搜索。论文同时构建了第一个 LA-EQA 基准包含 3 个仿真场景与 2 个真实场景每个仿真场景生成 5–10 个跨天的变化真实数据来自一个工业场地和一间办公室共 11 条 30–60 分钟的轨迹时间跨度长达 6 个月。基准共 150 道题由 7 个人标注均匀覆盖 5 类时序推理Past回忆单次过去事件、Present只看当前环境、Multi-past综合多段历史、Past-present过去与当下联合推理、Past-present-future基于过去与当下预测未来。图 1三种 EQA 设定——只看当下、只回忆单段轨迹与本文的长期主动 EQA主动探索 跨多段长期记忆分类全景记忆宫殿的三个组件图 8Mind Palace Exploration 的三个组件及其子模块Mermaid 流程图方法细节三层搜索与信息价值早停推理与规划阶段在记忆宫殿上做三层递进的语义搜索这三步交替进行推理Reasoning over LA-EQA先问视觉语言模型——用当前的工作记忆 $h_k$存放动作、观测与先前推理步骤能否回答问题能则直接作答不能则由语言模型推理出目标物体或空间概念 $y$例如问题里明说的物体或做咖啡需要什么这类需要推断的线索。世界实例规划语言模型做两段式推理——先判断回答问题是否需要跨多个世界实例搜索还是只涉及某一个实例再据此选出并排序实例子序列。作者给了一个启发式引导优先回忆过去实例因为知道物体过去的位置能显著提高当下搜索的效率。区域规划在选定世界实例 $G_i$ 内规划区域序列本质是一个物体目标导航问题。语言模型输出目标 $y$ 出现在每个区域 $v$ 的概率再用前向搜索找出使搜索代价 $J$ 最小的区域序列。这里有一个巧妙的不对称设计在过去实例中机器人可以瞬移探索任意区域代价相同在当前实例中则按机器人当前位置到区域质心的路径长度计价。两种代价统一进入同一次搜索。视点探索与重规划语言模型依据场景图的文本信息挑选视点机器人则通过回忆记忆中的图像或导航到该视点现场拍摄来获取观测并把结果写回工作记忆直到视觉语言模型在图像中检测到目标 $y$ 或触达探索上限。方法同时给出了早停判据。给定一个包含当前实例的实例序列系统先用语言模型在当前世界实例上形成一个区域预测集即目标 $y$ 可能出现、且置信度高于阈值 $P(y) \geq 1-q$ 的区域集合该阈值可用保形预测conformal prediction校准。随后有两个立即停止历史检索的条件其一预测集只剩下一个区域其二继续检索不会改变下一步计划。第二个条件用信息价值Value of Information, VoI来量化——即检索一段额外记忆能带来的期望探索代价 $J$ 的下降量。如果新增观测不会改变最优动作VoI 就等于零此时继续检索纯属浪费。正是这条判据把平均检索图像数从 22.86 张进一步压到 15.73 张。图 2Mind Palace Exploration 的整体回路——(1) 统一过去记忆与环境表示(2) 接收问题(3) 推理出目标物体(4) 规划检索与探索策略(5) 更新工作记忆(6) 信息足够后作答实验设计与结果评测使用三个指标答案正确率与人工标注答案比对由语言模型打分、探索效率实际路径长度与 oracle 路径长度之比并按答案正确率加权可理解为 EQA 版的成功率加权路径长度以及记忆检索效率为回答问题而检索的过去图像张数。对照的五个基线是 Multi-Frame VLM、Socratic LLM、ReMEmbR、Active EQA以帧为记忆与 Active Socratic EQA。基准覆盖的场景包括两套仿真住宅HM3D、一个 Isaac Sim 仓库以及真实的办公室与工业场地——后两者由四足机器人长期巡检采集。图 3LA-EQA 基准的仿真与真实场景——模拟环境跨多天真实场景跨多个月主结果如下表所示方法答案正确率探索效率检索图像数Mind Palace本文65.0%0.4522.86Mind Palace 早停61.8%0.4215.73Multi-Frame VLM52.9%—100ReMEmbR46.1%—0Socratic LLM44.3%—0Active EQAFrames43.7%0.29100Active Socratic EQA36.8%0.190按题型拆开看本文的优势集中在需要过去信息的类别上。作者指出这主要因为图像比文字描述携带更丰富的视觉上下文能够回答关于物体属性、状态与摆放位置的问题——而这些恰恰是纯 caption 方案答不好的。在需要过去—当下联合推理的题型上本文的探索效率优势也最明显因为过去的记忆能帮助更准确地估计物体在各区域出现的概率。按记忆规模看本文的可扩展性同样突出随着情景数量增加它相对其它方法的优势持续扩大多帧 VLM 在相同的检索上限下性能明显下降图像覆盖度被摊薄而 ReMEmbR 保持稳定印证了检索式路线在长期问题上的价值。图 4五类时序推理问题上的表现——优势集中在 Past 与 Multi-past 题型图 5五个环境中随情景数episode变化的性能——本文优势随记忆规模单调增长真实世界硬件实验提供了最后的验证。一台四足机器人作为办公室助理覆盖 1,000 平方米、27 个区域它的可用记忆包括过去 4 天的 10 段巡检以及 2024 年 10 月至 2025 年 3 月的 6 次月度巡检轨迹总长约 2,645 米。在 7 道需要主动探索的题目上寻找工具、追踪包裹、识别连续多日无人使用的工位、解释办公室布局变化它相比没有记忆的机器人平均节省 3–10 次房间搜索。除了语言模型查询之外记忆存储与规划全部在机器人本地完成用户通过电脑远程提问机器人完成后回报答案。图 6真实办公室中的长期主动 EQA 硬件实验——检索过去记忆、导航探索、给出答案结果对比总结图 9结果对比总结——基线正确率、本文方法与 VoI 早停的检索开销Mermaid 流程图关键发现正确率提升 12.1 个百分点本文 65.0% 对比最强基线 Multi-Frame VLM 的 52.9%相比最弱的 Active Socratic EQA36.8%高出 28.2 个百分点。检索效率提升 77.14%本文平均只检索 22.86 张过去图像而多帧 VLM 方案需要 100 张且后者的正确率更低——说明 EQA 问题通常只需要少量与问题强相关的帧。探索效率 0.45为最强主动式基线 Active EQA0.29的 1.55 倍也远高于 Active Socratic EQA 的 0.19。早停几乎无损加入 VoI 早停后检索图像从 22.86 张降到 15.73 张减少 31.2%答案正确率仅从 65.0% 降到 61.8%。优势随记忆规模增长情景数越多本文相对基线的方法优势越大多帧 VLM 明显下降而 ReMEmbR 稳定。真实部署可行四足机器人在 1,000 平方米办公室、27 个区域、跨度 6 个月的真实数据上运行平均节省 3–10 次房间搜索。局限性作者诚实地列出了三条主要限制第一长期理解受限于过去轨迹的覆盖范围。真实实验中有一道题要求找出连续多日无人使用的工位但机器人每天只巡检一小时在未被覆盖的时间段里桌子其实被用过而记忆里它一直是空置的于是机器人选错了答案。这暴露出记忆的时间覆盖率问题——不是推理能力的缺陷而是数据覆盖的缺陷。作者认为这是一个有价值的方向让智能体意识到我的信息不足并主动向人类或其它智能体请求补充信息。第二瓶颈也在视觉语言模型本身。未能拿到满分的题目主要源于 VLM 的语义与空间理解能力漏检物体、计数错误、对物体功能属性的判断错误此外 VLM 常把机器人在同一区域拍到的所有物体都归到该区域而画面中其实含有其它区域的视角。作者指出更强的 VLM 或专用视觉模型可以直接替换进框架性能会随之提升。第三基准目前依赖专家手工设计。场景变化与题目均由团队人工构建限制了基准的规模化。作者尝试用语言模型生成题目但效果仍远不够好要在长期设置下自动化场景生成与题目生成还需要更多研究。常见问题FAQ什么是长期主动具身问答LA-EQALA-EQA 是论文提出的新任务机器人必须同时回忆过去经历与主动探索当前环境才能回答带时间约束的问题。它把主动式 EQA只探索、无长期记忆与情景式 EQA只用单段轨迹、无探索统一成一个更难的设定并用五元组 $(Q, M, E, x_0, A^*)$ 形式化。Mind Palace Exploration 和已有的记忆检索方法如 ReMEmbR有什么不同ReMEmbR 用向量数据库存储位姿、时间与图像描述并做检索但不支持主动探索也没有跨世界实例的结构化组织。Mind Palace Exploration 把长期记忆切成多个分层场景图世界实例让检索与导航共用同一次图搜索并用 VoI 判据决定何时停止回忆。结果是正确率 65.0% 对 46.1%优势达 18.9 个百分点。记忆宫殿为什么能同时提高正确率和效率关键在于过去与当下被放进同一套表示。视点节点携带的位姿、图像与帧描述充当检索索引区域节点让大空间可以被增量搜索而因为检索与探索共享同一张图机器人能用过去的物体位置先验来指导当下的搜索路径。因此它只用 22.86 张图像就达到了 65.0% 的正确率而多帧 VLM 需要 100 张却只有 52.9%。VoI 早停是怎么工作的系统先用语言模型在当前世界实例上形成区域预测集阈值 $P(y) \geq 1-q$ 可用保形预测校准随后有两个立即停止检索的条件——预测集只剩一个区域或继续检索不会改变下一步计划。第二个条件用信息价值衡量如果新增观测不会改变最优动作VoI 为 0检索就是浪费。实测把检索图像从 22.86 张降到 15.73 张正确率只下降约 3 个百分点。这个方法在真实机器人上跑得动吗论文给出了正面证据四足机器人在 1,000 平方米、27 个区域的真实办公室中作为助理运行使用过去 4 天的巡检记忆与 6 个月的月度巡检记录在 7 道需要主动探索的题目上平均节省 3–10 次房间搜索。除语言模型查询外记忆存储与规划全部在机器人本地完成。这个工作的主要局限是什么三条其一长期理解受限于过去轨迹的时间覆盖率未被巡检覆盖的时段发生的事情机器人无从得知其二答案正确率的缺口主要来自 VLM 的语义与空间理解能力如漏检、计数错误与区域归属错误其三基准的场景变化与题目仍依赖专家手工设计语言模型自动生成题目的效果尚不理想。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2507.12846项目主页含论文、视频与代码入口https://mind-palace-laeqa.github.io/基准代码仓库https://github.com/mind-palace-laeqa/benchmark论文正式出版页PMLR 305https://proceedings.mlr.press/v305/ginting25a.html关键基线 OpenEQACVPR 2024项目页https://open-eqa.github.io/关键基线 OpenEQA 代码与基准https://github.com/facebookresearch/open-eqa关键基线 ReMEmbRICRA 2025https://arxiv.org/abs/2409.13682同团队前作 SEEKRSS 2024https://arxiv.org/abs/2405.09822给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件