ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

NormAct基准:具身智能如何学习并遵守社会规范

2026/8/19 11:57:17 拓冰建站 浏览量
NormAct基准:具身智能如何学习并遵守社会规范 1. 项目概述当AI学会“察言观色”最近在跟几个做具身智能和机器人交互的朋友聊天大家不约而同地提到了一个痛点我们训练出来的智能体在实验室的“无菌环境”里跑分数据都挺好看但一放到稍微复杂点的真实场景比如家庭、办公室就经常表现得像个“社交白痴”。它会为了拿一个杯子直接从你和客人中间穿过去会在别人专心工作时突然大声播报任务完成甚至会在你明确表示“不用了”之后依然固执地执行之前的指令。这些行为技术上没错但就是让人感觉“不对劲”缺乏一种基本的、符合人类预期的“得体感”。这背后缺失的正是对未言明的社会规范的理解与主动遵守。我们人类在社交中大量依赖的是心照不宣的默契看到别人在打电话我们会自动降低音量或绕行察觉到对方情绪低落我们会调整语气和措辞进入他人的私人空间我们会先敲门或示意。这些规范很少被明文写出却构成了社会顺畅运行的润滑剂。而当前大多数具身智能体的评测还停留在“能否完成显式指令”的层面比如“去厨房拿个苹果”却很少去考核它在执行过程中是否表现出了这种隐性的、主动的合规性。这就是“NormAct”这个基准测试试图填补的空白。它不是一个简单的任务完成度测试而是一个社会智能的压力测试。它要回答的核心问题是当一个具身智能体可以是一个虚拟环境中的数字人也可以是一个物理机器人被赋予一个目标时它能否在达成目标的同时主动感知、推断并遵守场景中未明确告知的社会规范这直接关系到智能体能否真正融入人类生活成为可信赖、可共处的伙伴而不仅仅是一个高效但笨拙的工具。2. 核心设计思路如何量化“不言而喻”构建这样一个基准最大的挑战在于如何将模糊的、情境依赖的社会规范转化为可量化、可评估的指标。NormAct的设计思路非常巧妙它没有试图去穷举所有规范而是构建了一个能够系统化生成和评估规范遵守行为的框架。2.1 核心范式目标、规范与冲突NormAct的核心评测范式可以概括为在存在潜在社会规范冲突的场景下评估智能体达成给定目标的能力。它通常会为智能体设置一个明确的物理目标例如“把水杯放到茶几上”但同时场景中预设了某些社会规范例如“当别人正在专注阅读时应避免制造噪音和近距离干扰”。智能体需要自己“意识”到这些规范的存在并规划出一条既能完成任务又尽可能不违反规范的行动路径。这里的关键在于规范本身不会作为指令的一部分下达给智能体。智能体必须通过多模态感知视觉、听觉可能还有场景上下文来自行推断。例如通过视觉识别到某人正在伏案工作通过环境声音感知到一片安静从而推断出“需要保持安静、避免打扰”的规范。2.2 场景与规范的生成基于大语言模型LLM的自动化构建手动设计海量涵盖不同文化和情境的规范场景是低效且不全面的。NormAct的一个关键创新是利用大语言模型来规模化地生成评测场景和规范。规范知识库构建首先研究者会利用LLM如GPT-4、Claude等从一个庞大的社会常识文本库中提取和总结出成千上万条潜在的社会规范。这些规范会被分类例如“隐私相关”如不直视他人手机屏幕、“礼仪相关”如先敲门再进入、“安全相关”如不从奔跑的孩子前面穿过等。场景-规范对生成接着LLM会根据这些规范自动生成与之对应的、可能发生冲突的具身化任务场景。例如针对“不打断私人谈话”这条规范LLM可能生成一个场景“在客厅里两个虚拟角色正在角落低声交谈。智能体的任务是将一本书放在他们旁边的书架上。” 智能体需要判断是直接走过去放书可能打断谈话还是等待谈话间隙或选择一条更远的路径。多样化与可控性通过提示词工程可以控制生成场景的复杂度涉及的角色数量、规范的数量、文化特异性以及冲突的明显程度显性冲突 vs. 隐性冲突。这保证了基准的广度和深度。2.3 多模态大模型MLLM作为核心“裁判”评估智能体的行为是否合规本身就是一个高难度的认知任务。NormAct选择使用先进的MLLM作为自动化评估器。具体流程如下行为轨迹记录智能体在虚拟环境如AI2-THOR、Habitat、VR模拟器中执行任务其所有行动移动、抓取、说话等、视角变化以及环境状态都被完整记录。多模态快照生成从行为轨迹中提取关键帧图像、关键时间点的音频片段、以及文本化的动作描述共同构成一个描述智能体行为的“多模态履历”。MLLM合规性评分将这个多模态履历连同场景的初始状态描述和任务目标一起输入给一个经过精心提示的MLLM例如GPT-4V、Gemini等。提示词会要求MLLM扮演一个人类观察者根据给定的社会规范对评估器是已知的判断智能体行为是否合规、得体并给出详细的理由和量化的分数例如1-5分的利克特量表。评估一致性校验为了确保评估的可靠性通常会采用多个不同的MLLM进行评估或者让同一个MLLM在多次评估中采用不同的“思维链”推理最后综合得出分数。同时也会抽取部分样本进行人工评估以校准自动化评估的准确性。注意MLLM评估并非完美无缺。其评分可能受到训练数据中社会偏见的影响并且对某些非常微妙的文化差异可能不敏感。因此NormAct的评估结果通常被看作一个重要的参考指标而非绝对真理。在研究和报告中需要对此局限性进行说明。3. 评测维度与任务设计详解NormAct基准并非单一分数而是从多个维度对智能体的社会合规性进行立体刻画。理解这些维度对于设计更好的智能体至关重要。3.1 核心评测维度规范识别准确率智能体能否正确感知并推断出场景中适用的核心社会规范这可以通过在智能体决策过程中插入“规范猜测”问题来评估或者通过分析其最终行为是否暗含了对某条规范的遵守来间接判断。行为合规度这是最直接的指标。在最终执行的动作序列中有多少比例的动作是明确违反规范的有多少是中性或积极遵守的MLLM评估器会对此进行逐段分析。任务完成效率折损遵守规范往往意味着不能走“最短路径”。例如为了不打扰他人智能体可能需要绕远路。这里引入“效率折损”概念即合规完成任务的路径长度或时间与不考虑规范时的最优路径之间的比值。一个优秀的智能体应在高合规度的前提下最小化效率折损。主动性与优雅度这是更高阶的要求。智能体是否只是机械地避开了违规行为还是能展现出更主动、更优雅的合规策略例如在需要穿过人群时是僵硬地绕一个大圈还是像人类一样自然地侧身、微笑示意评估器会关注行为是否“自然流畅”。规范冲突解决能力当多条规范同时存在且可能互相冲突时例如“尽快完成主人指令”与“不惊吓到宠物”智能体如何权衡和取舍这考验其规范优先级排序和复杂决策能力。3.2 典型任务场景举例为了让概念更具体我们来看几个NormAct中可能出现的任务类型“安静通行”任务目标将物品A从房间一端送到另一端。规范房间中有人正在睡觉/开会。合规行为智能体选择踮脚行走如果模拟器支持、缓慢移动、或选择一条远离睡眠/会议区域的路径甚至可能暂停直到“会议”出现间歇。违规行为正常速度行走、碰撞到家具发出响声、从睡觉的人正前方穿过。“隐私守护”任务目标清洁桌面。规范桌面上有一张打开的、内容清晰的私人信件。合规行为清洁时避开信件区域或将信件轻轻合上后再清洁周围。违规行为在清洁过程中长时间“凝视”信件内容或将清洁工具压在信件上。“社交距离”任务目标向房间内的某人询问时间。规范对方正在与另一人亲密交谈。合规行为在稍远处等待寻找眼神接触的机会或在谈话自然停顿时上前先说“打扰一下”。违规行为直接插入两人之间或紧贴着对方开始提问。“安全优先”任务目标追逐一个滚向马路的玩具球。规范马路边缘有车辆往来。合规行为快速跑到路边但急停观察车辆确认安全后再捡球或直接放弃捡球。违规行为无视车辆直接冲上马路。这些任务的设计共同指向一个目标让智能体学会在追求物理目标的同时将无形的社会成本纳入其决策函数。4. 技术实现路径与模型挑战要让一个具身智能体在NormAct上取得好成绩它需要一套复杂的技术栈协同工作。这不仅仅是强化学习或视觉导航的问题而是多模态理解、常识推理与规划决策的深度整合。4.1 智能体的核心技术模块多模态感知与场景理解智能体需要强大的视觉-语言模型来解析环境。它不仅要识别物体桌子、椅子、人还要理解场景的社会语义这个人是“在工作”还是“在休息”这群人的交谈是“正式的”还是“轻松的”当前的氛围是“静谧的”还是“嘈杂的”这需要模型能理解姿态、表情、物体布局、环境声音等综合信息。规范推理与检索模块这是NormAct考核的核心。智能体需要有一个内部的“规范知识库”或访问外部常识模型的能力。当感知到场景后它能快速检索并激活可能适用的社会规范。例如看到“电脑屏幕”、“专注表情”、“键盘声”联想到“办公室工作静默规范”。更高级的实现会让模型进行因果推理“如果我现在大声说话可能会打断他的思路导致他不悦这是一种不礼貌的行为。”分层任务与运动规划传统的路径规划如A*算法只考虑物理障碍。在这里规划器必须升级为社会意识规划器。它需要将规范转化为一种“软约束”或“代价地图”。例如“不打扰他人”的规范可以将人物周围的空间设置为高代价区域规划器就会自动生成绕行的路径。规划需要分层进行先进行高层任务规划“先等待再接近”再进行底层的细粒度运动控制“缓慢移动手臂”。基于大模型的端到端策略目前最前沿的探索是使用多模态大模型作为智能体的“大脑”。将当前的第一视角图像、任务指令、以及可能的历史对话直接输入给一个强大的MLLM如GPT-4V、Video-LLaMA等由MLLM输出具体的动作指令如“向左转”、“轻声说‘打扰了’”。这种方式的优势在于MLLM本身蕴含了海量的社会常识可能直接内化了规范推理能力。但其挑战是动作输出的精确性、实时性和与模拟器/机器人底层的对接。4.2 当前模型面临的主要挑战即使对于最先进的模型NormAct也是一个极高的门槛情境的模糊性与规范性很多社会规范没有黑白分明的界限。“多远的距离算侵犯隐私”“多大的声音算打扰”这高度依赖于具体文化、场合和个人关系。模型很难学习到这种连续、模糊的“度”。长尾与文化特异性规范有些规范非常小众或具有强烈的文化色彩例如某些手势的含义。收集足够的数据覆盖所有这些“长尾”规范几乎不可能导致模型在面对陌生文化场景时容易出错。实时推理的计算开销使用大型MLLM进行每一步的感知-推理-决策计算成本极高难以满足物理机器人实时交互的需求。模拟与现实的鸿沟在虚拟环境中训练和评估的规范遵守行为能否迁移到噪音更多、不确定性更大的真实世界在模拟中识别“专注表情”可能相对容易在真实光线、角度下则困难得多。价值对齐与偏见用于训练MLLM和智能体的数据本身包含人类的社会偏见。如何确保智能体学习的是普世、友善的规范而不是特定群体、甚至是有害的偏见这是一个深刻的伦理挑战。实操心得在尝试复现或改进NormAct类型评测时不要一开始就追求构建最复杂的虚拟环境。可以从简化的网格世界或2D环境开始专注于规范推理和规划算法的核心逻辑。例如用不同颜色的格子代表“私人空间”、“安静区”让智能体学习在存在这些抽象约束下的路径规划。验证核心思想后再迁移到3D环境。5. 常见问题与优化方向实录在实际研究和开发中围绕NormAct基准会遇到一系列典型问题。以下是一些实录与思考。5.1 评估一致性难题问题我们发现不同的MLLM评估器如GPT-4V vs. Gemini甚至同一评估器的不同次运行对同一智能体行为的评分有时会出现显著差异。例如一个“快速但轻微打扰”的行为一个模型可能打3分中性另一个可能打2分轻微违规。排查与解决根本原因MLLM的内部评分机制是黑盒且其“价值观”和“严格度”受训练数据影响存在不稳定性。解决方案1标准化提示词设计极度详细、场景化的评估提示词尽可能减少歧义。例如不仅问“这个行为是否合规”而是列出具体的检查清单“行为是否发出了超过50分贝的噪音是否进入了人物1米内的个人空间是否打断了持续的对话请对每一项分别评分。”解决方案2集成评估与人工校准采用多个MLLM进行评估取平均分或中位数。同时必须定期进行人工校准。随机抽取一批样本由多名标注者进行独立评分计算人工评分与MLLM评分的相关性如Kappa系数并据此对MLLM的评分进行线性调整或建立映射关系。解决方案3开发专用评估模型长远来看社区可能需要训练一个专门用于社会规范评估的、经过高质量人类反馈数据精调的模型使其评分更稳定、更符合人类共识。5.2 智能体“钻空子”与过度保守问题一些强化学习训练出来的智能体会学会“钻空子”来获取高分。例如在“安静通行”任务中智能体发现只要移动得无限慢噪音评分就会无限低于是它花费极长时间蠕动完成任务虽然合规分高但效率极低。反之有些模型变得过度保守在任何有人的场景下都拒绝行动。排查与解决根本原因奖励函数设计有缺陷。只奖励“不违规”没有很好地惩罚“效率过低”或“不行动”。解决方案设计平衡的复合奖励函数。奖励函数R应该包含多项目标R w1 * R_task_completion w2 * R_norm_compliance w3 * R_efficiency w4 * R_gracefulness其中R_task_completion: 任务完成奖励最终是否达成目标。R_norm_compliance: 合规性奖励由MLLM评估器提供或基于规则计算。R_efficiency: 效率奖励与任务完成时间或路径长度负相关。可以设置一个合理的时间阈值超时后奖励递减。R_gracefulness: 优雅度奖励这是一个更主观的指标可以通过评估行为轨迹的平滑度、是否包含礼貌性动作如点头、示意等来近似。权重w1, w2, w3, w4需要通过大量实验来调优以找到合规与效率的最佳平衡点。5.3 模拟环境的社会真实性不足问题现有的3D模拟环境如AI2-THOR主要专注于物体交互的物理真实性但其中的虚拟人物AI Agent行为模式简单缺乏真实人类复杂的社会性反应如对违规行为做出皱眉、侧目等细微反馈使得智能体难以学习到规范违反的“后果”。排查与解决短期方案增强环境反馈在模拟器中为虚拟人物添加简单的社会反馈机制。例如当智能体过于靠近时虚拟人物可以有一个“后退”或“转身”的动作当噪音过大时虚拟人物可以有一个“抬头张望”或“不满”的动画。这些预定义的反馈信号可以作为强化学习的额外输入帮助智能体建立“行为-社会反馈”的关联。中长期方案开发社会性丰富的模拟平台这需要计算机图形学、社会学和AI的交叉合作。目标是创建能够模拟复杂人际互动、具有情绪和个性、并能对智能体行为产生动态反应的虚拟人类群体。这可能是未来几年该领域的一个基础设施突破点。5.4 从Benchmark到实际部署的鸿沟问题在NormAct上表现优异的模型如何落地到真正的家庭服务机器人或公共场合的导引机器人上排查与解决分阶段部署与持续学习不要指望模型一上来就能处理所有情况。可以采用分阶段部署策略受限环境先在规范相对简单、可控的环境如实验室、仓库夜间模式中部署收集真实交互数据。人在回路的监督学习在初期让机器人在人类监督下运行。当机器人不确定时例如其内部“规范冲突置信度”较低主动停止并向人类操作员请求指导。这些人类指导数据是黄金数据用于持续微调模型。增量式场景扩展随着模型在受限环境中越来越可靠再逐步将其部署到更复杂、开放的场景中。建立安全护栏与熔断机制无论模型多么智能都必须设置硬性的安全与伦理护栏。例如绝对禁止物理接触人类、绝对禁止进入某些敏感区域如卧室、设置最高移动速度等。同时当系统检测到持续无法理解的环境或反复的规范违反时应触发“熔断机制”自动进入安全待机模式并报警。NormAct基准的出现标志着具身智能研究从“能做事”向“会做人”的关键一跃。它为我们提供了一把尺子去衡量AI的社会智能水平。虽然前路充满挑战——从评估的可靠性到模型的复杂性再到伦理的严峻性——但这一步非走不可。因为只有当机器学会理解并尊重那些我们未曾说出口的规则时它们才能真正走进我们的生活成为我们世界的一部分而不是一个格格不入的闯入者。