ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

通义DeepResearch无需分块的原因:RAG在AI Agent领域的新变革

2026/8/27 15:41:22 拓冰建站 浏览量
通义DeepResearch无需分块的原因:RAG在AI Agent领域的新变革 先从一个面试场景开始尤其是简历上写了 DeepResearch 项目的同学很可能被这么问面试官 通义新出的那个 DeepResearch 有了解吗答DeepResearch 是阿里搞的一个 Agentic LLM 框架。它通过合成数据增量预训练 多阶段后训练让模型在做复杂研究任务时的多步推理和工具调用能力变得超级强。它有两种工作模式ReAct 模式 就是基础的思考-行动-观察循环走一步看一步。IterResearch 模式 这个是进阶版能处理超复杂的任务。它会做多轮研究每轮搞完还会写压缩笔记当成长期记忆然后再开始下一轮。整体目标就是让模型像个真正的研究员自己会上网、会分析、会总结最后给你一份报告。它的训练闭环是 Agentic CPT → SFT → RL最后通过 on-policy 强化学习让模型自己卷自己学会怎么更聪明地去推理。面试官为什么它不需要像传统 RAG那样做chunk呢答DeepResearch 虽然用到了外部检索但并不是传统意义上的 RAG。它没有预先 chunk 文档做 embedding而是通过 agent 动态检索网页、筛选、摘要化再整合。所以它是一个 Agentic RAG核心在检索增强推理Retrieval-Augmented Reasoning而不是生成。检索只是它推理过程中的一个动作而已。面试官那你觉得这种 Agent 架构未来会取代 RAG 吗答我觉得不会完全取代但是会融合。长上下文Long Context让模型能读得更多传统 RAG 让模型能读得准而 DeepResearch 其实在验证一条新路检索是模型自己行动的一部分而不是一个外部的外挂模块。未来的 Agent 框架肯定都是在工具调用、动态检索、长记忆这三者之间找平衡。好了面试结束。我们现在来看看官方的技术报告用大白话来说说它到底是怎么炼成一个SOTA的 Web Agent 的技术报告https://tongyi-agent.github.io/zh/blog/introducing-tongyi-deep-research/代码https://github.com/Alibaba-NLP/DeepResearchpaperhttps://arxiv.org/pdf/2510.24701核心脉络是一流的数据飞轮 两种推理模式 端到端的训练流程CPT→SFT→RL。SOTA成绩与核心理念DeepResearch 在好几个高难度基准HLE, BrowseComp, xBench上都拿了 SOTA超过了所有开源和闭源的对手。它的核心贡献是开源了一整套高水平 Agent 的构建方法论。数据飞轮无需人工标注的合成数据DeepResearch 的数据来自两个阶段增量预训练CPT数据打造强大的Agent基座传统大模型如 Qwen虽然具备强大的语言理解与生成能力但缺乏成为 Agent 所需的“思考—行动—反思”机制。它不知道何时调用工具也无法基于上下文做出多步推理与决策。为解决这一问题Tongyi 团队提出了数据合成系统 AgentFounder。AgentFounder 基于多源知识网页、知识图谱、工具调用结果、模型生成的轨迹数据等自动构造出海量符合 Agent 思维逻辑的预训练样本。系统通过重组与问题构建将知识片段转化为多风格的问题答案对模拟智能体在真实场景中的思维链与行动计划。例如“为了回答问题 X我需要先分析 Y再执行 Z”。这样的数据使模型在预训练阶段就能接触到有目标、有步骤、有反馈的推理过程。在此基础上AgentFounder 进一步生成三类动作数据单步规划解决局部子问题。递进式推理形成连续思考链。多步决策比较、评估多种方案并作出选择。这种方法允许系统在离线环境中全面探索推理—行动空间无需依赖外部 API即可低成本获得高质量训练样本。核心思想是让模型在预训练阶段就能学习决策链式样本而非单次问答从而增强推理稳定性与策略泛化能力。图中上方灰色部分为传统语言模型的原始推理轨迹Original Trajectory模型从问题 Q 出发依次生成推理步骤 S₁、S₂……Sₖ最终得到结果 Rₖ。下方黄色部分展示了 DeepResearch 的改进机制在每个推理步骤上模型不再只生成一个结果而是同时展开多个候选方案Solution 1 / 2 / 3再通过“选择—评估—判断”的方式形成新的决策路径。例如模型会在某一步选择 Solution[2]并最终输出判断 “My decision is [Correct]”。这种方法被称为 Step-level Scaling。模型在每个节点上多路径探索、逐步选择、自我校正最终形成图中所示的 High-order Action Synthesis Trajectory。本质上这种机制让模型在预训练阶段就学会“多路径思考—逐步推理—自我评估”的模式为后续的 SFT 与 RL 阶段提供了更稳定、更具策略性的智能体基座。后训练Post-training数据突破模型能力上限增量预训练(CPT) 让模型具备了基本的推理与行动能力,但要让它成为真正的专家,必须通过高质量的后训练数据进行监督微调(SFT)来进一步提升。为此DeepResearch 构建了端到端的自动化合成数据流程WebSailor / WebShaper 他们基于知识图谱和形式化建模能自动生成极其复杂的 Web QA 数据。迭代复杂性升级 (Iterative Complexity Upgrading) 由一个 Agent 生成种子问题再由另一个 Agent 借助检索、搜索和计算工具不断扩展与深化。每一轮输出都会成为下一轮输入形成自演化的难度升级链不断自我内卷使问题逐步接近博士级研究任务。融合两种轨迹 最后他们的数据里既包含了简单的 ReAct 轨迹也包含了下面要讲的 IterResearch 轨迹让模型见多识广。两种Rollout模式Agent如何思考模型训练好了怎么用它提供了两种模式ReAct模式基础版是什么 就是经典的“思考-行动-观察”循环严格遵守这个格式。特点 简单、通用。DeepResearch 在这个模式下配上128K长上下文表现已经很强了这证明了他们前面数据飞轮和训练流程的有效性。深度模式Deep ModeSOTA进阶版传统 ReAct 在长任务中容易出现「认知瓶颈」和「噪声累积」——模型的上下文会不断膨胀前面冗余的思考记录拖慢推理节奏。为此DeepResearch 引入了 IterResearch 范式让智能体能够在多轮循环中持续聚焦核心信息、清理无效上下文。核心机制IterResearchIterResearch 是 DeepResearch 的核心创新。它将一个复杂研究任务拆解为多个「研究回合Research Rounds」每一回合都包括思考与行动Think ActAgent 执行一次推理或工具调用综合与重构Synthesis Reconstruction回合结束时模型不会保留全部历史思维而是提炼出关键信息生成一份「核心报告Report」清洁工作空间Clean Workspace模型以这份报告为唯一输入开启下一轮推理从而避免冗余积累。如下图所示IterResearch 在每一轮结束后会清空旧上下文只保留压缩后的核心信息Central Memory并在新的精简工作空间中继续推理。如果当前行动Action是工具调用模型会通过环境Environment ε如 Search、Scholar、Browsing、Python获取结果并更新工作区如果是生成答案则直接进入综合阶段。这种循环形成了一个持续优化的「高质量思维链」既能防止噪声污染又能维持推理一致性。效果每一次迭代都让 Agent 的大脑保持清晰与紧凑从而支持超长任务的稳定推理。这种机制是 DeepResearch 获得 SOTA性能的关键。端到端Agent训练流程CPT → SFT → RL前面讲了数据和用法现在讲怎么训练。On-Policy强化学习RLSFT 只能让模型模仿专家RL 才能让模型超越专家。算法 他们用了 On-Policy 策略基于 GRPO 定制优化确保模型学到的是自己当前能力最匹配的信号。关键优化留一法 (Leave-one-out)在优势估计advantage estimation时去掉当前样本在批次中的贡献降低方差让梯度更稳定。过滤负样本Trajectory Filtering 训练中发现如果把格式错误、过长或失败的轨迹也算作负样本会导致梯度震荡甚至崩溃。因此DeepResearch 选择性地丢弃低质量轨迹只保留对学习稳定性有贡献的样本。图中的强化学习系统由四个核心模块组成Async Rollout Service异步生成模型的行为轨迹Rollout Worker与环境交互收集模型的行动—反馈Reward Service对轨迹进行打分生成奖励信号Automatic Synthetic Data高质量轨迹会被保留用于后续再训练。在交互环境中Agent 可同时访问真实任务环境如网页搜索、学术检索、Python 执行与模拟环境从而形成闭环强化学习循环。 这种异步收集 筛选优化的机制有效提高了训练效率与奖励稳定性防止格式崩溃format collapse并提升泛化能力。基础设施保证RL能跑起来仿真训练环境 RL 不能真的去实时联网训练又贵又慢又不稳定。他们用离线维基百科和自定义工具搞了个模拟环境让 Agent 在里面低成本、高效率地刷副本。稳定沙盒 确保工具调用如搜索有缓存、能重试不会因为网络波动导致 Agent 训练崩溃。自动数据管理 这就呼应了最开始的数据飞轮RL 过程中产生的新数据会反哺回数据池动态优化训练集。On‑Policy策略的异步框架在 rLLM 之上实现了异步强化学习训练推理框架多个智能体实例并行与模拟或真实环境交互独立生成轨迹。应用与总结最后通义DeepResearch已经在高德地图地图导航 Agent和通义法睿法律 Agent中落地。总结一下DeepResearch 之所以不需要传统 RAG 的Chunking是因为它从根本上改变了范式。传统 RAG 是一个静态系统模型是被动缝合你喂给它的碎纸片 (Chunks)。DeepResearch 是一个动态系统。模型是研究员它主动去获取完整的信息网页/文档然后利用IterResearch范式压缩笔记来管理自己的认知焦点再利用RL来优化自己的研究策略。所以RAG 不会被取代而是正在被 DeepResearch 这样的 Agent 框架吸收和升维——检索不再是一个外部模块而是 Agent 工具箱里一个最基础的动作而已。最后我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我整理出这套 AI 大模型突围资料包✅AI大模型学习路线图✅Agent行业报告✅100集大模型视频教程✅大模型书籍PDF✅DeepSeek教程✅AI产品经理入门资料如果你也想通过学大模型技术去帮助自己升职和加薪可以扫描下方链接​​为什么我要说现在普通人就业/升职加薪的首选是AI大模型人工智能技术的爆发式增长正以不可逆转之势重塑就业市场版图。从DeepSeek等国产大模型引发的科技圈热议到全国两会关于AI产业发展的政策聚焦再到招聘会上排起的长队AI的热度已从技术领域渗透到就业市场的每一个角落。智联招聘的最新数据给出了最直观的印证2025年2月AI领域求职人数同比增幅突破200%远超其他行业平均水平整个人工智能行业的求职增速达到33.4%位居各行业榜首其中人工智能工程师岗位的求职热度更是飙升69.6%。AI产业的快速扩张也让人才供需矛盾愈发突出。麦肯锡报告明确预测到2030年中国AI专业人才需求将达600万人人才缺口可能高达400万人这一缺口不仅存在于核心技术领域更蔓延至产业应用的各个环节。​​资料包有什么①从入门到精通的全套视频教程包含提示词工程、RAG、Agent等技术点② AI大模型学习路线图还有视频解说全过程AI大模型学习路线③学习电子书籍和技术文档市面上的大模型书籍确实太多了这些是我精选出来的④各大厂大模型面试题目详解⑤ 这些资料真的有用吗?这份资料由我和鲁为民博士共同整理鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。所有的视频教程由智泊AI老师录制且资料与智泊AI共享相互补充。这份学习大礼包应该算是现在最全面的大模型学习资料了。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。智泊AI始终秉持着“让每个人平等享受到优质教育资源”的育人理念‌通过动态追踪大模型开发、数据标注伦理等前沿技术趋势‌构建起前沿课程智能实训精准就业的高效培养体系。课堂上不光教理论还带着学员做了十多个真实项目。学员要亲自上手搞数据清洗、模型调优这些硬核操作把课本知识变成真本事‌​​​​如果说你是以下人群中的其中一类都可以来智泊AI学习人工智能找到高薪工作一次小小的“投资”换来的是终身受益应届毕业生‌无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型‌非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界‌。业务赋能 ‌突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型‌。获取方式有需要的小伙伴可以保存图片到wx扫描二v码免费领取【保证100%免费】