ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Agent 的 3 种工作大脑: ReAct · Reflection· 规划执行

2026/9/7 20:59:52 拓冰建站 浏览量
Agent 的 3 种工作大脑: ReAct · Reflection· 规划执行 开篇你手下其实有三个 AIHOOK · 三种性格的打工人基于ReAct、Reflection(反思)、Plan-And-Execute(规划执行)这三种架构的Agent你可以简单理解为它们就是三种性格的打工人。小 A 边查边干。你问他这周有哪些值得关注的开源项目他不会先列提纲而是先搜索看了结果再决定下一步搜什么走一步看一步。这是ReAct。**小 B 做完还要自己改。**第一版写好了他会自己通读一遍挑毛病然后重写再挑毛病再重写直到满意。这是反思(Reflection)。小 C 先交计划再动手。开工前先给你一份五步计划书然后按部就班执行。这是规划执行(Plan-And-Execute)。这三种模式就是 2026 年你在几乎任何主流 Agent 框架里都能见到的三种最基础的大脑。后面那些看着很唬人的架构LangGraph 的状态机、AutoGen 的多智能体、各种 Agent SDK 的编排拆开来看基本都是这三样的排列组合。所以搞懂这三样看任何框架文档都能秒懂它在干什么。02PART小白也能懂三种模式的定义BASICS · 三种大脑的运作方式ReAct边想边做做中学ReAct 是**Reasoning Acting推理 行动**的缩写。它不要求模型动手前想好一切而是把思考和行动织进同一个循环Thought我想 → Action我做 → Observation我看到了什么 → 再思考…用做饭打比方你进厨房不会先在脑子里完整模拟一遍番茄炒蛋再开火——你是先开火、倒油、下番茄炒着炒着发现汁水多了才决定大火收汁。ReAct 就是这个节奏每一步都根据刚刚看到的新信息决定下一步干什么。它解决的核心问题是很多问题在动手之前拿不到关键信息。“今天适合晨跑吗”——不查天气和空气质量模型永远答不准。ReAct 就是让它先想我需要数据→ 调工具 → 看到数据 → 再想根据数据怎么给建议 → 输出。现在的 Claude、ChatGPT 这类产品底层跑的就是这个循环。Reflection先做再自己挑刺反思模式让 Agent 当自己的质检员。它不在乎一次生成得对不对它赌的是——第二轮肯定比第一轮好。生成一版答案 → 自己评估有什么毛病 → 根据毛病重写 → 再评估 → 满意就交稿类比写完作文初稿你自己通读一遍圈出这段逻辑不通“这个例子太空”改出二稿。反思就是把这个自己审稿的动作制度化、循环化。为什么有用因为大模型有个毛病——它生成答案时是自信地编一次生成的答案经常流畅但不准确。给它一个二次机会审视自己的输出很多低级错误能自己揪出来。我实测过写代码任务加上一轮反思编译错误率能降一半以上数据在后面。注意反思有两副面孔自我反思同一个模型自己评价自己省钱但容易自我感觉良好和换裁判另一个模型当质检员也就是 LLM-as-Judge更客观但贵一倍。这俩差别很大后面细说。Plan-And-Execute先交计划再照单执行规划执行把 Agent 拆成两个角色**规划器Planner**负责把大任务拆成步骤清单**执行器Executor**负责一步步照做。Planner任务 → [步骤1, 步骤2, 步骤3, …]Executor逐条执行某步失败 → 带着失败原因回去重新规划类比出差前先做行程单——机票哪天、酒店订哪、第一天去哪。执行的时候就不用反复动脑子了照着单子走。它最大的收益是省 token规划只做一次执行每个步骤时上下文里只放当前这一步。代价是灵活性差——计划赶不上变化的时候它容易抓瞎。03PART开发者实战三种模式的核心循环HANDS-ON · 不贴完整代码只给骨架用同一个需求——“调研 2026 年值得关注的开源 Agent 框架”——看三种模式的核心循环长什么样。不贴完整代码只给骨架。ReAct一个 while 循环搞定…skeleton核心循环Thought → Action → Observationwhile 没交卷:思考(当前上下文) # Thought调工具(如果需要) # Action上下文 工具结果 # Observation每轮都重发完整历史 → token 贵的根源核心就一句话**每轮把完整对话历史重发一遍直到模型认为信息够了、直接回答。**这也是它 token 贵的根源。两个必踩的坑循环次数不能无限次max_steps 必须设——我见过 Agent 因为工具返回格式不对连调 50 次token 费比任务本身还贵工具返回格式必须和 schema 严格一致不一致模型会反复调同一个工具试图理解。反思生成 → 评估 → 重写…skeletonanswer 生成(问题) # 第一版答案while 评估(answer).分数 阈值: # 自己当质检员answer 重写(answer, 评估意见)阈值必须设否则白烧钱两个设计点要强调满意阈值必须设——反思不是免费的我见过团队把反思开到 5 轮结果 70% 的答案第一轮就是好的白烧了 4 轮的钱代码类任务自己反思就够写作/方案类建议换裁判模型——让模型自己夸自己写的东西和让人类自己夸自己一样不靠谱。规划执行规划器 执行器…skeletonplan 规划器(任务) # 拆成步骤清单for 步骤 in plan:执行器(步骤) # 每步只带当前步骤上下文某步失败 → 带着失败原因重新规划 (re-plan)省 token 的秘密就在每步只带当前步骤的上下文——不用每次重放整个任务背景。但省下来的代价是灵活性如果计划里第 2 步失败后面步数全部作废。所以生产环境必须带 re-plan没有 re-plan 的规划执行就是个精致的纸老虎。三版实测对比同一个需求、同一个模型在我本机各跑了一遍。数字是单次测试模型和 temperature 都会影响别当基准但量级和趋势是稳的指标ReAct规划执行反思(1 轮)模型调用次数8610token 消耗(约)42k18k55k输出质量中信息覆盖不错但有点跑偏中步骤清晰但漏了 License 维度高补漏删错中途出错时自动调整下一步需显式 re-plan只能改文字改不了已做动作三个数字一摆前面的三种性格就具象了小 AReAct最能随机应变但最费钱小 B反思质量最高但也最慢最贵而且它只能改稿子改不了已经干出去的事小 C规划执行最省钱但最怕意外04PART进阶思考区别与组合ARCHITECTURE · 怎么选以及它们其实总在一起先上一张完整的区别表这是全文的核心建议收藏维度ReActReflection规划执行一句话定义边想边做思考与行动交替先产出再自我评估重写先规划步骤再逐步执行决策时机每步实时决策产出后再决策改不改开工前一次性决策对外部信息依赖强专为此设计弱主要在文字层面打磨中执行阶段需要token 成本高每步重发全量上下文中高多几轮完整调用低上下文按步精简灵活性高能根据中间结果转向中只改进输出不改行为低计划错了后面全错典型翻车方式死循环、越查越偏过度反思改坏、自夸空转计划漏步骤、意外失败全崩适合场景信息不确定、需边查边决定质量是生命线、可反复改步骤明确、可提前规划三选一不生产环境都是组合拳讲个反直觉的事**真实生产环境里几乎没有哪个正经 Agent 只用其中一种。**我见过的架构基本是这个套路ReAct 是地基任何需要调用工具的循环默认就是它复杂任务外层套规划执行把大方向定死每个子步骤内部再跑 ReAct 应付细节交付前最后加一轮反思做质检把低级错误挡在门外。**举个例子**一个自动写行业调研报告的 Agent——规划执行负责定搜什么→看什么→怎么写的框架每个搜的子步骤内部用 ReAct 决定搜什么词、看哪几页最后整个报告生成完了反思环节通读一遍补漏删错。三种性格各司其职这才是 2026 年生产级 Agent 的真实长相。我的 3 个判断问题做技术选型时别问哪个最好问自己三个问题判断 1任务需要外部信息、可能中途转向需要 → 用 ReAct。这是它唯一不可替代的价值。判断 2任务 70% 的步骤能提前确定能 → 认真考虑规划执行token 直接省一半上面实测 42k → 18k。判断 3输出质量是生命线、且允许反复改是 → 加反思环节但轮数压到 2 轮以内。反思被严重高估了。80% 的质量提升在第一轮反思就拿到了第二轮边际收益骤降第三轮开始原地打转甚至改坏。它不是在提高质量而是在花两倍的钱买 15% 的质量提升值不值取决于场景。规划执行被严重低估了。大部分人一上来就写 ReAct因为它最通用。但很多任务根本不需要每步都重新思考——比如周报、批处理、定时报表这类结构固定的活。用规划执行 token 省一半稳定性还更高只是它的前提任务结构稳定经常被忽略导致翻车后被一棍子打死。2026 年的几点观察**各家官方 SDK 默认给 ReAct。**Claude 的 computer-use、OpenAI 的 agent 都是因为它最通用、最不会错。**LangGraph 把规划执行图式化。**变成显式的图结构你可以精确控制每个节点代价是心智负担。**反思正在被外包。**很多团队不再让 Agent 自我反思而是用另一个模型甚至规则去质检因为自己查自己天然不可靠。**趋势是进一步融合。**框架帮你做组合你只需要描述任务架构由框架替你拼。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】