ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

从语言模型到作用于世界的系统:智能体AI在数字、社交、虚拟及物理环境中的进展与局限

2026/9/29 15:03:55 拓冰建站 浏览量
从语言模型到作用于世界的系统:智能体AI在数字、社交、虚拟及物理环境中的进展与局限 26年9月的综述论文“From Language Models to World-Acting Systems: Progress and Limits of Agentic AI across Digital, Social, Virtual, and Physical Environments”。这篇综述的核心:智能体能够调用的工具、操作的环境和改变的外部状态正在扩展,但这些进展尚不足以证明,它们可以长期、可靠、无人监督地完成开放环境中的任务。 作者因此主张,用“有充分依据的授权委托”来衡量进步,而不是单纯追求更高的自主程度。一、论文基本定位这是一篇批判性综述,而非系统性文献综述或定量元分析。它的主要任务是澄清概念、比较不同证据能够支持的结论,并提出研究议程。因此,阅读重点应放在其分析框架和论证上,而不是把它视为完整的技术目录或性能排行榜。它围绕一个问题展开:当语言模型获得改变外部世界的能力时,我们凭什么把任务交给它,又应当把权限交到什么程度?二、论文的核心分析框架分析对象是整个行动系统,而不是模型本身作者将智能体系统表示为:S=(M,H,E,U)这一划分的重要性在于:任务成功率往往是整个系统的属性,不能全部归功于模型能力。 同一个模型,配备不同工具接口、反馈方式和验证机制,表现可能不同。论文还区分了授权者、实际监督系统的操作员,以及受到系统影响的第三方。这些人未必是同一个主体。(图 1所示)用三个维度描述智能体,而不是排出一条“自主性等级”例如,一个只能执行短任务的智能体,也可能拥有很大的支付权限;一个能持续运行的模拟智能体,则未必有任何现实权限。因此,持续时间长、接口广、后果重大,都不能直接等同于更聪明或更可靠。区分三种不同的进步作者尤其强调:行动决策能力提升:更会选择行动、理解反馈和纠正错误。行动覆盖范围扩大:接入更多工具、应用、其他智能体和设备。保障能力提升:更可靠地授权、验证、限制损害和恢复状态。全文的中心论断是:在所审视的证据中,前两种进步比第三种更容易得到直接证明。(第 3.3 节)三、论文详细内容概述