ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

智谱清华唐杰:LLM Memory最新全景综述

2026/8/9 2:47:29 拓冰建站 浏览量
智谱清华唐杰:LLM Memory最新全景综述 过去两年记忆这个词在LLM圈子里被用滥了——KV Cache叫记忆RAG叫记忆Agent的向量库也叫记忆Titans的测试时训练还叫记忆。每个人都在谈记忆但没有人在同一个坐标系里谈。这篇来自清华唐杰也是市值5800亿智谱创始人、NUS和Bosch AI的综述做了一件吃力但必要的事给LLM的记忆机制建立一个统一的、以架构为中心的分类学。它把从注意力缓存、Mamba类循环状态、测试时训练TTT、MoE路由到Engram式查找存储这些看似毫不相关的技术全部放进同一个设计空间里比较。本综述相对于代表性以记忆为中心的综述的定位。读完你会有一个强烈的感受记忆正在从Scaling的副产品变成一等架构设计维度——这可能比单纯堆参数更深刻地影响下一代模型的形态。Figure 1LLM记忆的演进——从隐式、短暂的计算副产品到显式、持久、自适应的架构设计维度一、三轴分类法给记忆建坐标系这篇综述的核心贡献是一个三正交轴分类框架。任何记忆机制都可以沿这三条轴定位轴取值回答的问题表征Representation隐式 vs 显式存的是什么有没有独立的读写接口更新动态Update Dynamics离线 vs 在线什么时候更新训练期还是推理期持久性Persistence短期 vs 长期信息能影响多久的计算三条轴基本正交显式记忆可以离线MoE也可以在线Titans在线记忆可以短期滑动窗口注意力也可以长期Mamba。论文的Table I 把45个代表性系统按三轴逐一归类从2017年的Transformer到2026年的Mamba-3、Engram、Kaczmarz Linear Attention是目前我见过最全的一张记忆架构编年表。二、隐式记忆计算动态中的工作记忆Figure 3隐式记忆总览——注意力作为内容寻址记忆A、稀疏/选择性/结构化记忆B、循环序列记忆C2.1 注意力 可微分的内容寻址瞬时记忆自注意力本质上是一个可微分的、内容寻址的工作记忆历史token被编码为KV对新token通过query按内容检索。它在线更新、访问灵活但记忆是短期的、容量被上下文窗口锁死且随推理结束即被丢弃。两个值得注意的观察上下文窗口扩大 ≠ 记忆能力变强。实证研究表明长上下文模型经常用不满名义容量——理论记忆大小和实际利用率之间有鸿沟。StreamingLLM 本质是隐式淘汰策略滑窗保留少量”注意力锚点”token大部分历史被持续覆写。长程行为不是来自无限存储而是来自精心设计的访问模式。2.2 稀疏与选择性记忆的准入控制稀疏注意力Sparse Transformer、BigBird、Longformer从记忆视角看是在固定预算内重塑访问路径MoBA、NSA更进一步用学习到的路由替代固定模式做块级记忆访问控制。Selective Attention则是准入控制——决定哪些token值得被放大。RATTENTION的发现很精炼少量精心选择的全局记忆锚点就能显著稳定长上下文推理。统一视角注意力记忆的扩展方式不是”存更多”而是”更精细地控制准入、访问与保留”。2.3 循环序列记忆把历史压缩进状态这是2024-2026年最拥挤的赛道论文梳理得非常细线性注意力与SSM主线Linear Attention → GLA → Mamba/Mamba-2 →Mamba-3复数MIMO状态空间2026RWKV系列演进到RWKV-7向量门控广义delta规则。状态编辑语义Gated DeltaNet-2把”键侧擦除”和”值侧写入”解耦Kaczmarz Linear Attention把写入建模为键归一化投影Kalman Linear Attention引入不确定性感知的滤波更新。KDA / Kimi Linear通道级对角衰减 对角加低秩转移是Kimi Linear的循环核心。层级状态容量Log-Linear Attention用Fenwick树层级状态在”恒定大小状态”和”全量KV存储”之间找到对数级中间地带。循环记忆的代价也很明确状态与计算耦合缺乏灵活读写控制长程压缩会损失保真度。三、显式记忆可寻址、可持久、可写Figure 4显式记忆总览——参数化外部记忆A、查找/检索式记忆B、条件参数与MoEC、多时间尺度嵌套更新D显式记忆的定义性属性不是实现形式而是自主性存储的信息独立于即时计算图存在可以被独立于标准前向传播的机制更新、访问和维护。3.1 参数化记忆模块推理时也能长记性Titans专用记忆模块在推理时通过”惊讶度驱动的梯度信号”逐token更新——只改记忆参数不动骨干。TTT-E2E辅助参数子集在推理时对输入做端到端优化。In-Place TTT更激进——直接把FFN的down-projection矩阵当作可复用快权重记忆在标准MLP块内部赋予自主写语义。论文因此提出一个重要判断显式记忆不一定是一个独立的”记忆库”也可以是一个被赋予写语义的静态参数矩阵。MEMORYLLM / LM2固定大小的持久记忆槽/记忆池跨层嵌入前向自更新。解耦学习动态是这一路线的共同心法骨干编码通用能力记忆参数吸收上下文信息——缓解灾难性干扰但带来容量、更新稳定性和过拟合瞬时信号的新权衡。3.2 查找式记忆存储与计算解耦kNN-LM外部持久datastore跨推理调用存活——比KV Cache更”显式”。Engram2026哈希寻址的稀疏记忆槽把记忆稀疏性和专家稀疏性明确分开——MoE稀疏激活的是”参数化变换”Engram稀疏寻址的是”存储的记忆条目”。这个区分很关键查找记忆不能被还原为条件计算。PlugLM / ExplicitLM可编辑记忆库条目甚至是人类可读的token序列——让存储知识可检查、可定点更新。论文特意划清了与RAG的边界RAG靠外部编排管线这里讨论的是嵌入模型结构的持久存储——记忆库是架构组件不是工程外挂。3.3 MoE 参数空间里的条件记忆这是全文视角最新颖的一节MoE本质上是一种离线显式记忆。每个专家是一个持久的参数化记忆块路由器就是在参数空间上做”上下文相关的寻址”。Mixtral的专家涌现专业化、DeepSeek-MoE的细粒度专家划分都在强化这个解读MoE实现的是模块化、可选择性访问的持久知识记忆。3.4 多时间尺度更新记忆的时间维度Nested Learning引入层级化更新频率——不同参数子集以不同速率演化形成”快适应-慢适应”的连续谱直接呼应经典的快慢权重分解。这触及了稳定性-可塑性两难高频更新适应性强但易漂移低频更新稳定但迟钝。时间控制与结构持久性同等重要。三轴之外论文还分解了记忆怎么写的五类机制这是全篇最具工程参考价值的表格四、系统层混合架构、效率管理与评测4.1 混合架构从固定配比到信号门控层间交错SambaMamba滑窗注意力、JambaSSM-Attention混合块、LightTransfer把预训练Transformer的”懒惰层”替换为流式组件、Priming把混合化变成知识迁移问题。固定预算混合OLMo Hybrid、Kimi Linear、Hymba、Falcon-H1——注意力放在哪一层、哪个头都是设计时静态决定的。新趋势自适应混合路由。AMOR只在高熵位置激活事后注意力精炼块HAM让循环记忆处理每个token只把”循环状态预测不好的token”准入稀疏KV缓存。核心问题从”注意力该插在哪”变成**“哪些token值得高分辨率存储”**——混合记忆从静态层布局变成动态资源。4.2 记忆管理不是工程事后补丁而是架构设计轴CommVQKV向量量化、PagedAttentionKV分页虚拟化、Bottlenecked Transformers工作记忆周期性巩固覆写、Memory Caching缓存循环状态快照而非逐token KV——论文的立场是压缩、虚拟化、结构化稀疏重塑的是记忆的表征、访问与扩展方式这是架构问题不是系统运维问题。4.3 评测记忆不是一个标量NIAH、LongBench、RULER、L-Eval、SCROLLS各有分工但论文批评现有协议把”记忆容量”和”推理能力、Scaling效应”混为一谈。它呼吁把记忆性能分解为正交维度容量、保真度、持久性、抗干扰、效率——隐式和显式记忆需要不同的评测协议前者看长程依赖与噪声稳定性后者看更新一致性、检索精度与延迟。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】