ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

面试官:讲讲GRPO 相较于 PPO 有哪些改变?

2026/9/24 5:34:01 拓冰建站 浏览量
面试官:讲讲GRPO 相较于 PPO 有哪些改变? 很多人第一次回答这道题会说“GRPO 就是把 PPO 的 Critic 去掉用一组答案的平均奖励代替价值函数。”这句话方向没错但只答到了表面。因为面试官只要再追问一句——“去掉 Critic 后优势函数怎么来PPO 的 clipping 还在不在KL 约束放哪了代价又是什么”——答案很容易立刻断线。真正准确的说法是GRPO 没有推翻 PPO 的近端更新框架而是重做了优势估计方式并顺手调整了采样组织和 KL 正则的位置。下面就把这条改造链拆开。GRPO 相比 PPO 改了什么 四句话讲清 GRPO如果面试时间很短可以这样答PPO 通常训练一个 Critic / Value Model用 GAE 估计每个 token 的优势GRPO 直接取消 Critic。GRPO 对同一个 prompt 一次采样一组回答用组内奖励的均值和标准差做相对归一化得到优势。PPO 的重要性采样比率和 clipping 仍然保留所以 GRPO 不是另起炉灶而是 PPO 的一个变体。原始 DeepSeekMath 版 GRPO 把 KL 惩罚直接写进优化目标而不是先揉进逐 token 奖励里。一句话压缩PPO 是“请一个专职裁判预测你在每一步还有多大胜算”GRPO 是“让同题选手互相比用组内名次直接产生训练信号”。 拆开揉碎先看 PPO 到底背了多少东西PPO 的关键不只是 clipping还有一位“价值裁判”在大模型 RLHF 的常见 PPO 配置里训练现场往往不止一个模型•Policy Model正在被更新的策略模型•Reference Model冻结的参考模型用来限制策略偏离初始分布•Reward Model给完整回答或中间步骤打分•Value Model / Critic预测当前位置未来能拿到多少回报。PPO 的策略目标里最有辨识度的是概率比率与裁剪通俗讲 衡量新策略相对旧策略把当前 token 变得更可能还是更不可能。这道clip像汽车限速器优势为正时别因为一次好结果就把概率猛推太高优势为负时也别一脚把概率踩到地板。但这里真正棘手的是 ——当前这个 token比基线好多少PPO 常借助 Critic 估计状态价值再用 GAEGeneralized Advantage Estimation广义优势估计综合即时奖励与后续价值。问题是大模型的一次动作不是“向左迈一步”而是生成一个 token奖励却常常到答案结束才出现。让 Critic 给漫长推理链中的每个位置准确估值并不轻松。更现实的压力是资源在 LLM 训练里Value Model 往往和 Policy Model 体量相近还要保存梯度、优化器状态和激活值。它不只是多挂一个模型而是多养一套训练中的大模型状态。PPO 与 GRPO 的优势估计方式对比PPO 借助价值模型估计优势GRPO 改用同一问题下多条回答的组内相对奖励。第一刀丨删掉 Critic但没有删掉“基线”GRPO 最核心的变化是不再训练 Value Model。可策略梯度不能没有基线。没有基线所有奖励都直接参与更新梯度方差会很大今天考题普遍容易大家都拿高分明天考题普遍很难大家都拿低分。只看绝对分数模型很难知道某个回答究竟是“真的好”还是“题本来就简单”。GRPO 的做法很像同场考试对同一个问题 从旧策略一次采样 个回答再分别得到奖励最后用组内统计量做标准化白话讲不问你绝对考了多少分只问你比同题考生的平均水平高了几个标准差。所以“GRPO 用平均奖励替代 Critic”仍然不够严谨。更完整的说法是它用同一 prompt 下的一组样本构造经验基线并在原始 outcome-supervision 版本中用均值中心化、标准差缩放后的组内相对奖励作为优势。GRPO 的组内相对优势GRPO 的基线来自同一 prompt 的样本组而不是由单独的价值网络预测。第二刀丨从“一条轨迹配估值”变成“同题多采样再比较”Critic 被拿掉后采样方式也必须跟着变。PPO 可以对轨迹中的状态逐步估值GRPO 则需要同一个 prompt 的多条 rollout因为组内均值和标准差必须有“组”才能算。这意味着训练单元从“一个问题—一个回答”变成了“一个问题—一组回答”。这带来两个直接结果。第一奖励天然变成相对信号。一道容易题即使所有答案绝对分数都高也只有优于组内其他答案的样本获得明显正优势一道难题里只要某条推理相对更好它仍可能产生有效更新。第二省下 Critic不等于所有计算都免费消失。GRPO 通常需要为每个 prompt 生成多条回答rollout 成本、序列长度、组大小 都会影响吞吐。它节省的是价值模型相关的显存和训练开销却可能增加生成侧的样本开销。这也是一个常见误区❌ GRPO 比 PPO 在所有维度都更省。✅ GRPO 显著简化了模型栈尤其省去 Value Model但组采样会带来额外 rollout 成本最终收益取决于模型大小、序列长度、组大小与系统实现。第三刀丨保留 PPO 的“刹车系统”不是放弃近端更新GRPO 名字换了但 PPO 最经典的稳定机制还在。对组内第 个回答的第 个 token同样计算新旧策略概率比再把组内优势 放进 PPO 风格的 clipped surrogate objective所以从算法血缘看GRPO 更像PPO 的车身与刹车还在只是拆掉了 Critic 这套导航系统换成同组车辆的实时排名来判断方向。这点很适合面试追问。如果有人说“GRPO 不要 PPO 了”你可以直接纠正它保留了 importance ratio、old policy 和 clipping改的是 advantage estimation不是把 PPO 的核心稳定更新机制全删了。第四刀丨KL 惩罚从 reward shaping 挪到 loss 里大模型做 RL 时还得防止策略为了讨好奖励而跑偏因此通常会用 Reference Model 做 KL 约束。DeepSeekMath 对 PPO 的描述是先把逐 token KL 惩罚揉进奖励而原始 GRPO 目标把 KL 项直接写进 loss白话讲PPO 的常见写法像是“先因偏离标准答案扣分再算你表现如何”GRPO 则是“相对表现和偏离惩罚分开记账最后一起优化”。这样做的直接好处是KL 惩罚不会搅进组内优势的计算相对奖励这条信号更干净。不过要诚实补一句PPO 在工程实践里有许多变体KL 可以作为 reward shaping、显式 loss甚至配合自适应系数。这里说的是DeepSeekMath 论文用来对照的 PPO 配置与原始 GRPO 写法不是宣称所有 PPO 实现都只能把 KL 放在奖励里。GRPO 保留裁剪与 KL 约束GRPO 延续 PPO 的裁剪更新并用参考策略 KL 约束策略漂移。一张表看懂GRPO 到底改了什么下面讲解了GRPO和PPO的对比维度PPOLLM 常见实现原始 GRPO真正变化算法骨架策略梯度 importance ratio clipping同样保留没换骨架优势估计Critic / Value Model GAE同题多回答的组内标准化奖励核心变化训练模型Policy、Reference、Reward、ValuePolicy、Reference、Reward无 Value减少一套可训练大模型状态采样组织轨迹采样并逐步估值每个 prompt 采样 条回答用组样本换 CriticKL 约束DeepSeekMath 对照写法中进入逐 token reward直接作为 loss 正则项信号解耦主要优势通用、成熟能做细粒度价值估计显存更友好适合可批量验证的推理任务工程取舍不同主要代价Critic 难训且昂贵依赖组内差异增加 rollout组大小敏感不是白捡性能别把 GRPO 神化丨它也有自己的软肋组内都一样学习信号就会变弱如果同一道题采样出的回答奖励几乎完全相同减去组均值后大家都接近 0模型几乎得不到区分信号。这在二元正确性奖励里很直观一组答案全错或者一组答案全对都缺少“谁比谁好”的信息。GRPO 更喜欢那种组内既有成功也有失败的题因为比较才有梯度。Outcome reward 的信用分配仍然很粗原始 outcome-supervision GRPO 会把整条回答的标准化终局奖励赋给该回答中的所有 token。也就是说一条 800 token 的推理最后答对了前面每个 token 都共享同一个优势。可真实情况可能是前 600 token 绕远路第 601 token 才误打误撞拐回来。只看终局得分很难精确判断哪一步真正有贡献。这也是为什么 DeepSeekMath 同时讨论了 process supervision如果能给推理步骤打分就能把奖励分配得更细但代价是过程奖励模型与标注更复杂。GRPO 不是“不要 Reward Model”Critic 和 Reward Model 经常被混为一谈。•Reward Model / Verifier回答“这份答案有多好”•Critic / Value Model回答“走到当前状态后预计未来还能拿多少回报”GRPO 删除的是后者不是前者。数学题可以用规则验证器判断最终答案也可以用奖励模型评估过程开放式对话依然需要可靠的偏好信号。为什么它特别适合数学与代码推理GRPO 并非只适用于数学但数学、代码这类任务和它格外合拍原因有三点同一道题可以自然采样多条解法组间比较的语义一致结果容易验证数学答案可判等代码可跑测试reward 相对可信推理链较长训练一个逐 token 准确估值的 Critic 更困难取消 Critic 的收益更明显。DeepSeekMath 论文报告在其 7B 模型和特定训练设置下GRPO 阶段让 Chain-of-Thought 模式的 GSM8K 从 82.9% 提升到 88.2%MATH 从 46.8% 提升到 51.7%。这是论文中的具体实验结果不能外推成“任何模型用 GRPO 都会涨这么多”。真正值得记住的不是某个百分比而是背后的工程判断当任务可以低成本地产生多条候选并获得可靠的相对奖励时用“组内比较”替代“额外训练一个价值模型”可能是一笔划算的交换。 面试怎么答才拿分按“保留—改变—代价”三步说推荐你按这个顺序回答第一步先说保留什么。GRPO 是 PPO 的变体仍保留 old policy、importance ratio 和 clipped surrogate objective用近端裁剪控制策略更新幅度。第二步再说改变什么。PPO 通常依赖 Critic 配合 GAE 估计 token-level advantageGRPO 删除 Critic对同一 prompt 采样一组回答按组内奖励均值和标准差归一化得到相对优势。原始论文还把 KL 惩罚直接放入 loss而不是混入 reward。第三步补上工程代价。GRPO 省掉 Value Model 的参数、激活和优化器状态显著减轻显存压力但它需要 group rollout依赖组内奖励差异终局奖励下的 token 级信用分配也较粗。如果面试官继续追问可以沿这三条展开• 为什么减均值能做 baseline、降低梯度方差• 一组奖励全相同时GRPO 为什么几乎学不到东西• outcome supervision 与 process supervision 下 分别怎么构造最后用一句话收住GRPO 的本质不是“把 PPO 简化一下”而是用同题多样本的相对比较替代 PPO 中昂贵的价值函数学习它省下 Critic却保留了 PPO 的裁剪与参考约束。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】