
标题When Do Larger Batches Help Scale LLM Reinforcement Learning?来源arXiv, 2608.29296v1️文章简介研究问题在固定硬件条件下增大批次大小能否真正减少大语言模型强化学习的目标达成时间主要贡献论文提出将学习效果与系统吞吐量分离的分析框架证明仅当吞吐量增益超过样本效率损失时增大批次才能加速训练。重点思路将训练进度率分解为样本效率 × 系统吞吐量推导出决策规则更大批量只有在其吞吐量增益超过所需样本量惩罚时才能缩短到达目标的总时间。算法层面在固定累积样本数的条件下通过平方根学习率缩放重新调参使不同批量配置在有限范围内呈现近似批量不变的学习曲线从而公平比较各配置的样本效率。系统层面利用自回归生成与训练之间的计算不对称性——生成阶段在低并发时受内存带宽瓶颈限制增大并发批量可摊薄权重加载开销而训练阶段的计算量随token数线性增长因此生成时间的增长可以亚线性于批量增长。实施两阶段调优策略首先重调超参数以维持样本效率不变其次在生成吞吐量未饱和前增大批次确保系统收益覆盖潜在的样本惩罚。分析总结在GRPO和PPO实验中采用平方根学习率缩放可在一定批次范围内实现近似批次不变性但固定学习率会导致样本效率下降抵消批次增大带来的速度优势。系统层面增大批次显著提升了生成吞吐量PPO中最高提升2.29倍GRPO中最高提升1.36倍而训练更新时间几乎与批次大小成正比。综合效果显示经过适当超参数重调的GRPO大批次配置可将目标达成时间缩短最多29%但若未重调学习率或批次过大超出不变性范围即使吞吐量高总耗时反而增加。存在临界生成批次和临界训练批次最优批次取决于两者谁先达到饱和需通过实际 profiling 确定平衡点。个人观点论文把大batch是否更快这个看似简单的问题拆成了算法和系统两个独立维度来量化揭示了LLM强化学习中特有的“生成-训练”计算不对称性。