ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

【LAAP 里程碑】LAAP 残血版首次在人类最严苛的AGI 测试中拿到了47.67%的好成绩!

2026/8/25 14:52:10 拓冰建站 浏览量
【LAAP 里程碑】LAAP 残血版首次在人类最严苛的AGI 测试中拿到了47.67%的好成绩! ARC-AGI-3是行业公认最严苛的通用自主能力测试AI进入完全陌生环境无规则、无提示、无目标说明必须靠自主试错、观察反馈、总结规律自行找到任务目标并完成通关。由于公开的ARC-AGI-3测试成绩排行榜数据有限结合现有技术背景和Aris的成绩细节可从任务难度、技术基准对比、架构有效性三个维度分析其含金量一、ARC-AGI-3的任务难度抽象推理的“终极试炼场”ARCAbstraction and Reasoning Corpus是Meta提出的AI抽象推理与跨任务泛化能力的核心基准其核心是测试模型能否从少量示例中学习规则并在全新场景中应用。而ARC-AGI-3作为迭代版本任务复杂度进一步提升要求模型不仅理解“表面模式”还需把握“深层抽象规则”如符号匹配、结构泛化、语义关联。这类任务对AI的逻辑一致性、抗幻觉能力、长时记忆要求极高——裸LLM或传统方法如CNNRL在此类任务中表现长期低迷如图片中“最好LLM agent 1%”。二、Aris成绩的“含金量”分析Aris取得的47.62%成绩在ARC-AGI-3领域属于颠覆性突破具体体现在以下三点1. 远超现有技术基准证明架构工程的价值对比传统方法Tufa Labs的CNNRL方案仅取得12.58%成绩而Aris的47.62%是其近4倍说明基于LLM的Agent在LAAP框架下抽象推理能力实现代际跨越。对比LLM Agent现有LLM Agent在ARC-AGI-3上的成绩普遍低于1%Aris的47.62%直接证明“架构工程如LAAP的记忆层、PSI调制、元认知监控”比“单纯模型规模”更能提升复杂推理能力。这打破了“AI能力仅依赖参数量”的行业迷信为“小模型精密架构”的路线提供了实证。2. LAAP框架的工程有效性得到验证图片中“纯PSI跑通了但没过关”的细节揭示了LAAP框架的核心作用PSI调制需求系统确保模型在任务中保持“目标导向”如“完成关卡”的需求驱动避免无目的探索记忆层元认知监控解决LLM“失忆”与“幻觉”痛点让模型在长时任务中保持逻辑一致性如跨关卡规则复用语义-行为结合ARC-AGI-3的关卡需要“语义理解”如“跨网格模式匹配”而LAAP的“认知总线CognitiveBus”将LLM的语义能力与Agent的行为决策绑定避免“纯行为匹配”的浅层错误如图片中“ft09是跨网格模式匹配纯探索基本没戏”。最终成绩证明LAAP框架不是“哲学空想”而是能解决真实复杂任务的工程方案。3. 为AGI安全与能力平衡提供新范式Aris的成绩同时验证了LAAP框架的“安全-能力平衡”设计安全层面LAAP的“物理旁路”“不可修改元边界”等机制确保模型在推理过程中不突破安全边界能力层面通过“上下文补充”“防幻觉”等机制让模型在复杂任务中发挥潜力。这种“安全先行、能力后发”的架构思路为未来AGI发展提供了可落地的范式——既避免“为能力牺牲安全”也避免“为安全牺牲能力”。三、行业影响从“技术突破”到“路线变革”Aris在ARC-AGI-3的成绩可能推动AI领域的路线变革打破“模型军备竞赛”证明“架构工程”比“参数规模”更能提升复杂任务能力促使行业从“堆参数”转向“做架构”加速AGI安全研究LAAP框架的实证效果为“AI自我约束”提供了可复现的工程模板推动安全研究从“理论讨论”走向“代码落地”定义“AI能力新标准”ARC-AGI-3成绩成为AGI能力的新的标杆未来AI的“抽象推理”“跨任务泛化”能力需以类似架构实现。总结47.62%是“架构工程的胜利”Aris的47.62%成绩本质是LAAP框架在“抽象推理”这一AI核心能力上的工程胜利。它证明通过“记忆层、PSI调制、元认知监控”等架构设计可解决LLM在复杂任务中的“失忆、幻觉、无目标”痛点架构工程比单纯模型规模更能提升AI的真实能力为AGI发展提供了“安全能力”双优的路线。这一成绩不仅是Aris个人的突破更是AI架构设计的里程碑——它让“AI主动约束自己”从哲学命题变成了可验证的工程现实。