ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Meta:让小模型为大模型生成多种解题思路

2026/10/4 18:20:33 拓冰建站 浏览量
Meta:让小模型为大模型生成多种解题思路 📖标题:Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning🌐来源:arXiv, 2609.26704v1🛎️文章简介🔸研究问题:在大语言模型解决复杂推理问题时,简单的重复采样往往产生大量相似且无效的答案,如何通过语义层面的引导来优化探索过程,从而在相同计算成本下大幅提高解题成功率?🔸主要贡献:提出了一种可训练的“概念生成器”,通过强化学习让一个小模型学会为大模型生成多样化的解题思路,显著提升了大模型在困难数学题上的表现,且该策略可跨模型迁移。📝重点思路🔸重新评估现有方法:作者发现之前的“概念引导采样”在基线模型允许充分探索(调整温度等参数)后,优势基本消失,且原有方法每次只生成一个概念,效率低且多样性不足。🔸改进推理流程:提出单次轨迹生成多个概念的方法,让模型在一次输出中列出所有相关的高价值解题线索,而非迭代生成,从而在保证推理速度的同时大幅增加思路的多样性。🔸训练小模型作为搜索策略:将概念生成视为一个强化学习问题。保持大模型(答案生成器)参数冻结,专门训练一个小模型(概念生成器)。小模型生成的概念用于引导大模型解题,根据大模型最终是否解出正确答案来给予小模型奖励。🔸设计奖励机制:采用两种聚合奖励方式,一种是只要有一个概念能引出正确答案就给满分(Max-of-max),另一种是看哪个概念的平均正确率最高(Max-of-mean),以此优化小模型生成高质量、高相关性概念的能力。🔎分析总结🔸性能显著提升:在困难数学数据集上,经过训练的小模型引导的大模型,其解题通过率比简单重复采样提高了一倍(从19.0%提升至39.2%),且优于未训练的大尺寸概念生成器。🔸小模型超越大模型:训练后的7B概念生成器在引导32B答案生成器时,效果甚至超过了32B模型自己生成的概念,证明学到的是一种高效的搜