从“Let‘s think step by step”到大模型思维链:5步训练流水线小白也能看懂,建议收藏学习! 本文深入解析了现代大语言模型LLM的训练流水线揭示了“思维链”CoT能力是如何从外部提示触发演变为模型内置能力的。文章详细介绍了预训练PT、继续预训练CPT、指令微调SFT、偏好对齐DPO/RLHF和可验证奖励强化学习RLVR五个关键步骤以及每个步骤对思维链能力发展的贡献。从最初通过大量数据隐式学习推理模式到通过精细化的训练使模型能够自主进行推理每个阶段都至关重要。最后文章展望了未来将这一能力扩展到更多任务的可能性强调了大模型“思考”能力的形成是整个训练流水线共同作用的结果。开篇用过推理模型的人都见过这个画面:问它一道数学题,回答区先冒出一大段think标签包裹的内容——模型在里面自言自语,列方程、试方案、推翻重来,想上几十秒到几分钟,然后才给出一个严丝合缝的答案。问它11?,同样的模型秒答,think里空空如也如下图。你没加任何 prompt,模型自己知道该想就想、该跳过就跳过。一个自然的问题:这种该想就想、该秒答就秒答的能力,是怎么训出来的?现代 LLM 的训练不是一次训完的。从原始的下一词预测开始,到最终能该想就想的对话模型,中间要走过五个阶段。每个阶段解决一件事,合在一起才是我们今天用的那些能该想就想的推理模型。这篇文章就沿着这条流水线一节一节走,重点回答两件事:完整训练流水线的五步分别在做什么思维链能力是从哪一步开始长出来的、又是在哪一步被钉进权重的会先讲清楚现代训练的骨架,再讲 CoT思维链 从外挂到内置的演化历史,最后总结每一步对思维链能力各自贡献了什么。以下内容基于课堂笔记和大模型协助理解完成文中部分案例和图片来自课件。一、训练在改变什么语言模型本质上是一个函数——输入一段文本,输出下一个词的概率分布。模型的参数决定了这个函数长什么样,而训练就是调参数。但语言模型的输出不是唯一确定的——“写一篇文章有无穷多个合理版本。所以模型真正学到的是:给定输入,词表里每个候选词的概率。好的 prompt 让这个概率分布更集中(比如加上以下是水果的分类”,apple 几乎只会接 fruit),好的训练让模型永久性地倾向于生成更好的输出。收窄输出分布有两条路改上下文(prompt):同一个模型,给不同 prompt,输出分布不同。举个具体的例子Prompt 1: 苹果→ 模型可能接:手机、水果、红色、公司、派……分布很散Prompt 2: 以下是水果的分类体系。苹果→ 模型几乎只会接:属于蔷薇科/是常见水果……分布急剧收窄同一个模型,参数一字未动,只是换了上下文,输出就从什么都有可能变成了高度确定。这就是 prompt 起效的本质——用上下文降低输出的熵。改参数(训练):训练一次,参数变了,同样输入的输出分布也变了。SFT 让模型该说什么话变了,RL 让模型哪种表达获得高分变了。这两条路的区别是理解整个训练流水线的关键。Prompt 是临时的收窄,训练是永久的收窄。CoT 一开始靠 prompt 触发(临时),后来演化成靠训练内置(永久)——这就是这篇文章要讲的故事。理解了这一点,再看训练流水线,每一步做的都是同一件事:通过一批新数据、新损失函数,把参数调整成一个新的函数。区别只在于用什么数据、什么信号。二、现代 LLM 的完整训练流水线主流路线的骨架每一步用的数据、目标、算力,都不一样。当前主流的基础模型基本都是这条路,只在细节上做取舍。一张图先把五步的定位讲清PT:原始预训练——潜在能力的容器PT 是训练里最大的一步——数据以 T tokens 计(头部模型的预训练数据量已达十几万亿 tokens),在传统训练流水线中算力占比可达 90% 以上。任务极其朴素:next-token prediction。给一段文本前面的 N 个词,预测第 N1 个词是什么,交叉熵作 loss。看起来简单,但只要数据足够多、模型足够大,几乎所有能力都会从这个任务中涌现出来——语法、事实、推理、代码、多语言、初步的指令跟随。GPT-3 论文 2020 年就展示了这一点模型只在 web 文本上做 next-token,却能不加微调地做翻译、问答、算术。2022 年 那篇 zero-shot CoT 论文的意义正在于此:只需一句 “Let’s think step by step”,推理链就浮现出来。这说明推理能力在预训练阶段已经形成——预训练语料里有大量数学解答、代码解释、逻辑论证的自然文本,模型隐式学到了推理的样子。但 PT 学到的推理是沉睡的——它平时倾向于直接给答案(因为训练语料里多数是陈述句),需要被触发才会走出来。让沉睡的推理变成默认行为,是后面几步的任务。CPT:继续预训练——补短板预训练完了,模型还是个什么都懂一点、什么都不精的通才。CPT 就是给它开小灶。同样是 next-token loss,只是数据换成特定领域或特定形式:领域自适应法律、医疗、代码。例如 CodeLlama Llama 2 500B 代码 tokens,通过 CPT 让代码能力大幅提升语言自适应Chinese-LLaMA LLaMA 中文语料长上下文扩展通过大量长文档 CPT RoPE scaling,把上下文从 4K 扩到 128K/1M推理密度提升混入更多数学、代码、竞赛题解——现代基础模型的 CPT 阶段都在悄悄加大这类数据比例这一步对 CoT 意味着什么? 提高推理链在训练数据里的密度。如果 PT 语料里推理相关文本占 5%,CPT 阶段可以把这个比例拉到 20%~30%。模型对如何一步一步推导这种表达形式,会更熟练、更倾向于生成。一个可观察的现象:CPT 阶段加了大量竞赛题解的模型,即使不做 SFT,给它一道题它也更容易自发用Solution: 开头,而不是直接给数字。SFT:指令微调——教会听人话PT 和 CPT 都是续写——给一段文本让模型接着写。但用户想要的是对话:我问一句,你答一句。SFT 就是把训练目标从续写改成回答:User: 帮我总结这段文字Assistant: 期望的回答数据形式变成(指令, 回答)对,训练方式还是 teacher forcing 交叉熵损失——让模型的输出跟标准回答逐 token 对齐。关键工程细节:SFT 的数据量比 PT 小几个数量级(几万到几百万条 vs 几十亿 tokens),但数据质量决定成败。灌一批低质量指令数据,模型会退化;灌一批高质量的,模型能力可以显著跃升。这一步对 CoT 意味着什么? 让模型学会先推理再答的输出格式。如果 SFT 数据里的回答长这样:{instruction: 23个苹果,吃了20,买了6个,现在几个?, response: 先减:23-203。再加:369。答:9。}模型就会学到数学题该先给推理再给答案这个格式。这是 CoT 从需要被 prompt 触发到默认输出的第一步。但这里有个陷阱:SFT 教的是推理链的样子,不是推理链管不管用。模型可以学会写一段看着专业的推理,最后答错。因为 SFT 的 loss 里,推理链和答案是一体的,都是跟标准答案对齐,没有信号告诉模型你这段推理真的帮到答对了吗?要根治这个问题,得靠后面的 RL。DPO / RLHF:偏好对齐——从标准答案到更好SFT 学的是这个回答是正确的。但人类偏好比这个复杂——同一个问题的两个正确回答,可能一个更好,一个更差(更礼貌、更简洁、更有条理)。偏好对齐就是训练模型学会什么是更好。传统 RLHF 三步(InstructGPT / ChatGPT 用的):SFT—— 已经做过了训练 Reward Model (RM)—— 用人工标注的(prompt, 好回答, 坏回答)对训一个打分模型PPO—— 用 RM 给策略打分,做 RL 更新Reward Model 是关键中转站。它把稀缺、离散的人类偏好信号,压缩成一个可微的打分函数,让策略能疯狂 rollout。RM 的训练思路是:给一对回答,让赢家的分数比输家高,差得越多越好。RLHF 有几个反复被踩的坑,后面单独讲。这里先说它的替代品——DPO (Direct Preference Optimization),2024 后逐渐取代 PPO 成主流。DPO 的洞察是:数学上可以推导出最优策略和 Reward Model 存在解析关系,所以不用真的训 RM——直接把偏好对的优化目标写成策略参数的 loss。省掉了 RM,省掉了 PPO 的复杂性,一步到位。这一步对 CoT 意味着什么? 让 CoT 的输出更符合人类喜好——不啰嗦、有条理、语气得体。但 DPO / RLHF 不能直接提升推理正确率,因为它优化的是人觉得好,而人无法可靠判断复杂推理链的正确性。人类偏好对推理链的评价很容易被看起来专业骗到——这就是所谓的 reward hacking。真正让推理变强的是下一步。RLVR:可验证奖励强化学习——推理的真训练前面 SFT/DPO 的共同问题:监督信号是模仿或人觉得好,都不是这段推理真的答对了吗的直接反馈。RLVR 换了思路——不问模型该怎么推理,只给可验证的最终奖励:问题 → 模型自由生成任意长 CoT → 检查答案对不对 → 打分 → RL 更新关键在于奖励必须可验证:数学题能不能求出跟标准答案一致的数值代码能不能通过预先写好的单元测试逻辑题形式化 checker 能不能通过这一步对 CoT 意味着什么? RLVR 是目前最有效且经过工业级验证的能让 CoT 真正起作用的训练方式。前面几步做的都是让 CoT 长得像 CoT——预训练埋种子、SFT 教格式、DPO 修辞美化。RLVR 是让 CoT 从表演变成工具的那一步。因为 RLVR 的奖励只看结果对不对,模型就必须找到真的能提升正确率的推理方式,而不是看起来在推理。三、Prompt 时代 vs 训练时代:CoT 从外挂到内置在把 RLVR 讲透之前,先把 CoT 的历史线厘清。因为 2022 年开始,CoT 经历了从外挂到内置的范式转移,这个转移正好跟训练流水线的演化同步。2022:CoT 由外部 prompt 触发两篇奠基论文奠定了 Prompt-CoT 范式。Few-shot CoT (Wei et al., 2022 Google Brain, NeurIPS 2022):在 few-shot 示例里,手写完整的推理链。PaLM-540B 在 GSM8K 上准确率大幅提升——推理性能第一次跃升。论文里的一个观察后来极其重要:CoT 只在大模型上有效。Wei 团队跨多个模型家族(GPT-3、LaMDA、PaLM)测下来,约百亿参数以下的模型加了 CoT 反而更差,几百 B 才有显著收益。同年 Wei 等人在另一篇论文中正式将这一现象命名为涌现能力(Emergent Abilities)——尽管这一概念的具体解释仍有学术争议,但 CoT 只在大模型上有效这一观察本身是稳固的。Zero-shot CoT (Kojima et al., 2022 东京大学 Google Research, NeurIPS 2022):比 Wei 那篇晚约四个月。做的事情更极端——连示例都不给,就在问题末尾加一句 “Let’s think step by step”,模型就自己推理。InstructGPT 在 GSM8K 上准确率翻倍有余。论文的意义比数字大得多:它说明推理能力早已在预训练中形成,一句 magic phrase 只是把它唤醒。这跟前面讲的PT 埋下推理种子完全对得上。Prompt-CoT 的四大痛点Prompt 触发 CoT 这条路,2022-2023 年跑得挺好,但当业界把大模型往真实产品放,痛点集中爆发:该不该 CoT,用户判断不了问11?也让它 step by step,又慢又蠢CoT 的深度没法调难题该多想、简单题该少想,prompt 做不到格式和推理绑死一旦训完,推理的语言模式就固化推理是模仿的,不是学的一大半 CoT 是装模作样——链条看着对,答案错要根治,只有一条路:让模型自己学会什么时候思考、思考多久、怎么思考,而不是靠 prompt 外挂。这条路的实现,靠的正是训练流水线里的 RLVR 那一步。2024-2025:内置 CoT 的四条训练路径从 2023 到 2025,业界摸索出了四条把 CoT 训进权重的路径,最强模型是四条组合:路径 1:SFT 阶段直接灌 CoT 数据 把(问题, 推理 答案)塞进 SFT。解决看起来会推理,但不解决推理真管用——因为 SFT 是模仿学习。路径 2:推理蒸馏 用头部推理模型生成大量推理链,SFT 到小模型。已有实验证明:7B 级蒸馏模型在 AIME 上可超越参数量数倍于己的开源推理模型——推理能力可以传递。局限是受老师上限约束。路径 3:自举(STaR / Rejection Sampling FT) 模型对一批题自己生成推理链 → 只留答对的 → 做 SFT → 重复。不依赖外部老师,但天花板受限——模型只能强化自己偶尔能做对的东西。路径 4:RLVR 就是前面讲的那步。这是目前最有效能让推理真变强的路径,也是当前最强推理模型的核心。现在的最强模型基本是路径 1 2/3 4的组合:先用少量 SFT 或蒸馏数据打个格式底子,再上 RLVR 放开炼。结语:训练流水线雕刻了思考这件事回到开篇的问题:该想就想、该秒答就秒答能力,是训练里哪一步来的?现在可以给一个精准的答案:PT 埋下推理的种子——预训练语料里的数学解答、代码解释、逻辑论证,让模型隐式学到推理长什么样CPT 加大推理密度——数学 / 代码 CPT 让推理相关表达更熟练SFT 教格式——让先推理再答成为默认输出模板DPO / RLHF 修辞美化——让推理链更符合人类偏好、更可读RLVR 是目前真正让 CoT 起核心作用的关键——用可验证奖励让模型自己发现哪种推理路径更容易答对,把推理从表演变成工具整个流水线共同雕刻出内置 CoT 这个能力。少一步都不完整——只有 PT 是死书生,只有 SFT 是背答案的学生,只有 RLVR 是能算但答得像天书。五步合一,才是能对话、能思考、能自己判断该想多久的现代大模型。这条路之后要走向哪?现在最活跃的方向是把 RLVR 从数学/代码扩展到其他任务——写作、决策、agent 行为。这些任务的可验证性没那么强,需要新的可验证奖励设计。从 “Let’s think step by step” 到推理模型全面爆发,不过四年。这四年里,大模型学会了思考——而且是被整条训练流水线一起练出来的,不是被某一步教出来的。下次你打开一个推理模型,看到它慢慢想上一阵再回答,可以想想:这一阵里模型在潜空间里走过的思维路径,是几万小时预训练埋下的种子、几千次 SFT 修剪出的格式、加上几万次 RL 更新雕刻出的思考习惯共同作用的结果。它是练会思考的,不是教会的。最后如果说程序员已经是高薪职业那么干AI的程序员就是高薪中的高薪。现在的市场已经用数据给程序员指明了方向学AI大模型就是冲刺高薪的最优解看着身边越来越多的同行转型大模型、拿到高薪offer很多人心里都动了心但真正的难题来了零基础小白不知道从哪入门有基础的程序员找不到系统学习路径实战项目练手无门面试不知道考什么别慌今天就给大家整理了一份【2026年最新版】AI大模型免费学习资源包覆盖从入门到实战、从理论到面试、从基础到进阶的全流程所有资料均已整理归档无冗余、无套路免费分享给每一位想抓住AI风口的程序员和小白扫码免费领取全部内容1、大模型系统化学习路线2、大模型学习书籍文档3、AI大模型最新行业报告4、大模型项目实战配套源码5、大模型大厂面试真题四阶段精细化学习规划附时间节点可直接照做结合上述资源给大家整理了一份可直接落地的四阶段学习规划总时长约2个月小白可循序渐进程序员可根据自身基础调整节奏高效掌握大模型核心能力快速实现从“入门”到“能落地、能面试”的跨越。第一阶段10天初阶应用该阶段让大家对大模型 AI有一个最前沿的认识对大模型 AI 的理解超过 95% 的人可以在相关讨论时发表高级、不跟风、又接地气的见解别人只会和 AI 聊天而你能调教 AI并能用代码将大模型和业务衔接。大模型 AI 能干什么大模型是怎样获得「智能」的用好 AI 的核心心法大模型应用业务架构大模型应用技术架构代码示例向 GPT-3.5 灌入新知识提示工程的意义和核心思想Prompt 典型构成指令调优方法论思维链和思维树Prompt 攻击和防范…第二阶段30天高阶应用该阶段我们正式进入大模型 AI 进阶实战学习学会构造私有知识库扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架抓住最新的技术进展适合 Python 和 JavaScript 程序员。为什么要做 RAG搭建一个简单的 ChatPDF检索的基础概念什么是向量表示Embeddings向量数据库与向量检索基于向量检索的 RAG搭建 RAG 系统的扩展知识混合检索与 RAG-Fusion 简介向量模型本地部署…第三阶段30天模型训练恭喜你如果学到这里你基本可以找到一份大模型 AI相关的工作自己也能训练 GPT 了通过微调训练自己的垂直大模型能独立训练开源多模态大模型掌握更多技术方案。到此为止大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗为什么要做 RAG什么是模型什么是模型训练求解器 损失函数简介小实验2手写一个简单的神经网络并训练它什么是训练/预训练/微调/轻量化微调Transformer结构简介轻量化微调实验数据集的构建…第四阶段20天商业闭环对全球大模型从性能、吞吐量、成本等方面有一定的认知可以在云端和本地等多种环境下部署大模型找到适合自己的项目/创业方向做一名被 AI 武装的产品经理。硬件选型带你了解全球大模型使用国产大模型服务搭建 OpenAI 代理热身基于阿里云 PAI 部署 Stable Diffusion在本地计算机运行大模型大模型的私有化部署基于 vLLM 部署大模型案例如何优雅地在阿里云私有部署开源大模型部署一套开源 LLM 项目内容安全互联网信息服务算法备案…扫码免费领取全部内容6、这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】