ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Embodiment in multimodal large language models

2026/8/29 16:50:28 拓冰建站 浏览量
Embodiment in multimodal large language models 该文章聚焦多模态大型语言模型(MLLMs)的具身性问题,提出“双重具身框架”,指出当前MLLMs缺乏人类式的内部和外部具身体验,需通过整合这两种具身性来实现更贴近人类的认知与交互能力。一、文章主要内容总结当前MLLMs的优势与局限优势:在文本与视觉输入融合上进展显著,能处理图像描述、计算机视觉等多模态任务,涵盖视觉语言模型(如DeepMind的Flamingo、OpenAI的GPT - 4o)、视频语言模型(如VideoCLIP)等。局限:存在“莫拉维克悖论”,如无法正确识别轻微旋转的人体光点图;在动作基准测试中表现差,缺乏时空和语义基础;无身体体验,对“热”“饥饿”等概念的理解仅停留在统计层面,无经验基础。人类具身性的核心构成外部具身性:通过与外部世界的物理交互获取认知,如肢体动作、环境感知。内部具身性:包含内感受体验(如饥饿、体温感知)和内稳态调节(如血糖、水分平衡),是生存、情绪、记忆及亲社会行为(如共情)的基础。MLLMs具身性的改进方向外部具身性:现有研究集中于将MLLMs转化为“智能体AI”,通过机器人技术、虚拟环境交互实现物理动作规划与执行,如Action Space Adaptors(ASA)将模型输出转化为机器人动作。内部具身性:需新增内稳态调节、内部状态监测等机制,可借鉴软机器人的内感受硬件、循环