ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

POLARIS 成绩单全解读:5大数学基准全面超越商业闭源模型的秘诀

2026/8/20 18:25:02 拓冰建站 浏览量
POLARIS 成绩单全解读:5大数学基准全面超越商业闭源模型的秘诀 POLARIS 成绩单全解读5大数学基准全面超越商业闭源模型的秘诀【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARISPOLARIS 是一个面向高级推理模型的大规模强化学习RL后训练开源方案全称是 APOst-training recipe for scaling RLon AdvancedReasonIng modelS。它仅用开源数据与学术级算力通过 GRPO 强化学习训练就把 Qwen3-4B 这类开源小模型推上数学巅峰——在 AIME24、AIME25、Minerva、Olympiad Bench、AMC23 五大数学基准上全面超越 Claude-4-Opus、Grok-3-Beta、o3-mini-high 等商业闭源模型。这篇 POLARIS 成绩单全解读将带你拆解它逆袭背后的 5 大训练秘诀。POLARIS 是什么一张成绩单看懂它的实力先看最直观的证据在 AIME25AI 数学奥赛级基准上POLARIS-4B-Preview 拿到 79.4 分超越 Claude-4-Opus75.5、Grok-3-Beta77.3、o3-mini-high73.0等商业闭源旗舰仅次于 235B 级的超大模型 Qwen3-235B-A22B81.5。注意图中红色条形左侧 Qwen3-4B 基线只有 65.6 分右侧 POLARIS-4B-Preview 直接飙升到 79.4 分一进一出提升近 14 分——而这只是一个 4B 参数的开源小模型。项目由港大 NLP 组与字节跳动 Seed 团队完成训练与评估代码基于 VeRL 构建数据集、代码、训练细节全部开源任何人都可以复现。5大数学基准成绩单全解读AIME24、AIME25、Minerva、Olympiad、AMC23POLARIS 用 5 个高难度数学基准全方位检验模型能力AIME24 / AIME25美国数学邀请赛真题avg32每题采样 32 次取平均分Minerva Math科学计算与数学证明类难题avg4Olympiad Bench奥数综合题集avg4AMC23美国数学竞赛题avg8模型AIME24AIME25MinervaOlympiadAMC23Qwen3-1.7B基线48.336.834.955.175.6POLARIS-1.7B-Preview66.953.038.963.885.8Qwen3-4B基线73.865.643.662.287.2POLARIS-4B-Preview81.279.444.069.194.8DeepSeek-R1-Distill-Qwen-7B基线55.039.736.756.881.9POLARIS-7B-Preview72.652.640.265.489.0三个尺寸的 POLARIS 在全部 5 项基准上都显著超过各自基座1.7B 版 AIME24 提升 18.6 分7B 版提升 17.6 分4B 版更把 AIME25 从 65.6 拉到 79.4、AMC23 冲到 94.8。结论很清晰只要基座具备推理潜力POLARIS 的强化学习训练配方就能把它榨出远超参数体量的成绩。秘诀一三阶段递进式强化学习训练越练越难POLARIS 的核心不是一锤子买卖而是三阶段递进式 GRPO 训练对应scripts/train/qwen3-4b/下的stage1.sh、stage2.sh、stage3.shStage 1 打基础用过滤后的 5.3 万条数学数据parquet/stage1/polaris-data-53K.parquet以温度 1.4 采样最大回复长度 39936 token先练出一个稳定解题的基座Stage 2 上难度把 checkpoint 转为 HF 格式重新搜索最优采样温度、剔除简单样本以温度 1.45、最大回复长度 48128 token 继续强化Stage 3 冲刺极限重复转权重 → 搜温度 → 去简单题 → 再训练的流程把能力推向饱和。每一阶段都在前一步成果上加码这与传统单轮 SFT/RL 有本质区别也是成绩单能持续爬升的关键。秘诀二动态数据清洗把送分题踢出训练集训练到中后期模型已能轻松做对大部分题目此时继续用简单题做 RL奖励信号几乎没有信息量。POLARIS 的解法是动态清洗数据drop_easy_data.py会统计上一阶段每道题的平均得分把得分高于 0.9几乎全员做对的样本直接删除只保留够难、值得练的题目进入下一阶段让有限算力全部花在刀刃上。秘诀三最优温度搜索让采样多样性恰到好处推理模型的采样温度直接决定轨迹多样性。POLARIS 的关键洞察是解码温度要从基座建议的 0.6 大幅提高到 1.4 以上但也不能超过训练温度。项目提供search_optimal_temperature.py在 1.4~1.6 区间按 0.05 步长自动搜索找到与上一阶段多样性分数最接近的最优温度通常为 1.4 或 1.45在探索更多解题路径与保持稳定性之间取得平衡。秘诀四精细化数学奖励函数保证 RL 信号纯净RL 训练最怕奖励信号脏。POLARIS 的奖励函数位于deepscaler/rewards/math_reward.py先从回复中提取\boxed{}答案再用 mathd 与 sympy 双引擎判分任一通过即判正确若启发式判分失败还会调用 LLM 作为 ORM结果奖励模型兜底复核最大程度避免判错了还硬训练的悲剧让每一步强化都建立在可靠反馈之上。秘诀五长上下文 动态采样把推理上限拉满POLARIS 对推理长度极其执着训练最大回复长度从 39K 一路提到 48K评测时更建议输出超过 64K token避免长推理被截断导致成绩倒退。同时开启动态采样trainer.dyn_sampling_polarisTrue与 Ulysses 序列并行让超长轨迹训练成为可能。成本方面4B 模型在 32 张 H800 上训练约 10 天batch size 128、rollout 8单步约 0.33 小时——对学术团队来说相当可复现。快速上手从零复现 POLARIS 的开源路径想自己跑一遍仓库提供了完整的数据、脚本与评估工具先克隆项目git clone https://gitcode.com/gh_mirrors/polaris34/POLARIS然后安装依赖pip install -e ./verl、pip install -e ./等按scripts/train/qwen3-4b/stage1.sh依次启动三阶段训练评测可用scripts/eval/eval_vllm_aime24.py、eval_vllm_aime25.py配合 vLLM 快速采样再用evaluation/grade.py一键打分基准数据就在evaluation/benchmarks/下复现结果可参考evaluation/results/。多机场景下train_with_ray.py还能免手动初始化 Ray一键拉起多节点训练。总结开源配方正在改写推理模型版图POLARIS 用一套三阶段递进 RL 动态数据清洗 最优温度搜索 精细化奖励函数 超长上下文的开源配方证明了强化学习在推理模型上的巨大潜力4B 级别的小模型也能在五大数学基准上正面击败商业闭源旗舰。对研究者而言它是一份可完整复现的标杆对普通开发者而言它更预示着开源模型 聪明的训练配方正在快速改写推理模型的版图。【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考