为什么让AI同时学多门课,反而会让它“偏科“越来越严重?

这项由上海人工智能实验室主导的研究发表于2026年7月,论文以预印本形式发布在arXiv平台,编号为arXiv:2607.16850v1,感兴趣的读者可以通过该编号检索完整论文。

一、一个让AI研究者头疼的老问题

假设你是一位私人教练,同时带着五个学员:一个想练长跑耐力,一个想练举重爆发力,一个想练瑜伽柔韧性,一个想练拳击速度,一个想练游泳协调性。如果你给所有人制定完全相同的训练计划,结果会怎样?举重运动员可能练得风生水起,但瑜伽学员会因为太多力量训练而受伤;长跑学员可能进步飞速,但游泳学员几乎没有水感训练。每个人的需求完全不同,却被同一套方案对待,最终的结果往往是强者越强、弱者越弱。

现代大型语言模型(也就是像ChatGPT、DeepSeek这类AI系统)的训练,面对的正是这样一个难题。这些AI不是只学一件事,它们需要同时学会数学推理、物理解题、写代码、回答科学问题、理解指令……每一类任务对AI来说,难度和特性都截然不同。上海AI实验室的研究团队发现,现有的AI训练方法在处理这种"多科目同时学习"时,存在一个根本性的隐患——它们让AI越来越偏科,而且这个偏科的趋势会随着训练不断自我强化。

这个研究的核心贡献,是找到了这种偏科现象背后的真正元凶,并提出了一套名为"组熵控制策略优化"(Group Entropy-Controlled Policy Optimization,简称GEPO)的解决方案。在十三个不同类型的测试项目上,这套方法的综合表现超过了目前主流的所有同类方法。

二、"熵":AI的一个重要体温计

在正式讲解这个研究之前,需要先理解一个关键概念——"熵"。这个词听起来很物理学,但其实可以用一个非常直观的比喻来理解。

把AI回答一道题的过程,想象成一个人在面对路口做选择。当这个人对路非常熟悉,他几乎不需要考虑,直接走上最常走的那条——这就是"低熵"状态,也就是AI非常确定自己要给出什么答案,它的选择空间很窄,几乎每次都走同一条路。相反,当这个人对路完全陌生,每个路口都可能选左也可能选右,每次走出的路线都不一样——这就是"高熵"状态,AI非常不确定,它的答案每次都可能大相径庭。

在AI的强化学习训练中,熵是衡量AI"探索程度"的晴雨表。高熵意味着AI还在积极探索各种可能的答案路径,这对于难题来说是健康的;低熵意味着AI已经倾向于集中在某几个固定的回答上,对于已经基本掌握的简单题来说这是好事,但如果来得太早,就意味着AI过早地锁定了一种思路,放弃了探索其他可能更好的解题方法。

研究团队通过实验观察到了一个非常有趣的现象:在同样一个正在训练的AI模型下,不同类型的题目会触发截然不同的熵水平。具体来说,物理题的平均熵值约为0.49,数学题约为0.60,而指令遵循类任务(比如"请用正式语气改写这段话")的熵值高达0.78。这就好比同一个学生,做选择题时思路很清晰(低熵),做作文时思绪万千、下笔困难(高熵)——这是完全正常的,因为题目本身的性质就不同。

三、现有方法的盲点:用同一把尺子量不同的事

现在的主流AI训练算法,在处理熵的问题上,大致分为两个层次的方法,但两者都有根本性的局限。

第一类是"全局熵控制",就是把整个模型当作一个整体,计算出一个平均熵值,然后统一调整。这就像用全班同学的平均身高来决定食堂餐桌的高度——平均值掩盖了个体差异,高个子要弯腰,矮个子够不着。当AI同时学习物理和指令遵循时,一个任务的熵已经很低了,另一个还很高,取平均之后得到一个中间值,对谁都不合适。

第二类是"词元级熵控制",粒度更细,细化到AI生成每一个字词时的不确定性。这虽然比全局方法更精细,但仍然没有解决根本问题:它只看到了单个字词的不确定性,却没有把不同任务类型之间的差异考虑进去。

在这两类方法之外,还有一个更严重的问题几乎被所有人忽视了。现有最流行的AI训练算法之一叫做GRPO(组相对策略优化),它的核心做法是:让AI对同一道题生成多个不同的答案,然后根据这些答案的好坏打分,再把分数"标准化"——也就是把每道题的分数转换成相对排名,高于平均分的答案得到正向激励,低于平均分的答案得到负向惩罚。

这个标准化操作本来是为了让不同题目的激励信号可以相互比较。但研究团队发现,这个假设在不同题目的熵差异很大时根本不成立。

四、偏科的恶性循环是怎么形成的

为了说清楚这个问题,需要从GRPO的激励机制说起。

当AI在某道题上得分的标准差很小(也就是所有答案质量差不多),标准化之后每个答案的激励信号都很弱,AI不会得到太强烈的"你做对了"或"你做错了"的信号。而当某道题上所有答案质量差异很大(比如大多数都错、偶尔一个对),正确答案得到的激励信号就会非常强烈,错误答案受到的惩罚则很分散、很轻微。

研究团队推导出了一个精确的数学关系:假设某道题上AI答对的概率是p,那么正确答案得到的激励强度是√((1-p)/p),错误答案受到的惩罚强度是√(p/(1-p))。当p很小(比如p=0.16,也就是只有16%的答案是对的),正确答案的激励强度会爆炸性地增大,而错误答案的惩罚则非常微弱。这就造成了一种极度扭曲的训练信号。

而这种扭曲,恰恰在高熵任务(如指令遵循)上最为严重,因为高熵任务往往对应着更低的正确率。研究团队在真实训练数据上验证了这一点:物理题(低熵)的优势分布接近对称;数学题(中等熵)呈现轻微的右偏斜;而指令遵循任务(高熵)的偏斜值高达2.32、峰度高达4.84,分布极度扭曲——绝大多数答案都只得到很小的负面信号,而极少数正确答案却得到了极端强烈的正向信号。

更糟糕的是,不同任务之间的标准化分数根本不处于同一参考系下。研究团队用两个命题严格证明了这一点:首先,当AI的熵越低,它的选择分布与"均匀分布"(也就是随机乱选)的偏差越大,这意味着低熵任务的分数分布被策略本身严重扭曲;其次,这种扭曲直接导致标准化之后的激励信号,在低熵任务上系统性地偏离了真实的奖励排名,而在高熵任务上则偏差较小。

这两个效应叠加在一起,创造出了一个令人担忧的循环:低熵任务(AI已经学得比较好的任务)产生了最强烈、最一致的训练梯度,进一步加强了AI在这些任务上的能力;而高熵任务(AI还需要更多探索的任务)产生了弱小、嘈杂的训练信号,学习效率越来越低。随着低熵任务越做越好,它的熵进一步降低,与高熵任务的差距越来越大,高熵任务受到的有效训练越来越少。偏科的剪刀就这样越张越大。

五、GEPO的解法:给每道题定制一把专属体温计

面对这个问题,上海AI实验室的团队提出的方案,核心思路是:不再用一把全局的尺子量所有任务,而是给每一组题目单独量一次体温,然后根据这个体温做出针对性的调整。

具体来说,GEPO的第一步是计算"组熵"。在GRPO的训练过程中,AI本来就需要对同一道题生成多个答案(通常是16个),GEPO利用这些已有的答案,直接计算这一组答案的平均熵值,把它称为该题目的"组熵"。这个计算完全免费,不需要额外生成任何答案,因为答案已经在那里了。为了让不同长度的答案之间可以公平比较,还会把总熵值除以平均答案长度,得到"每个词的熵"。

得到组熵之后,GEPO做的第二步是根据体温施加定制化的干预。具体规则如下:对于组熵很低的题目(AI已经非常确定,说明快要"固化"了),如果这道题里出现了答对的答案,就把给这个答案的正向激励适当削弱一点,避免AI在已经学得够好的方向上继续过度强化,防止它过早地锁死思路。对于组熵很高的题目(AI还在大量探索,说明这类任务还没学好),如果出现了答错的答案,就把给这个答案的负向惩罚适当减轻一点,避免AI还没来得及探索出好的解题路径,就因为大量的惩罚信号而放弃了探索。

这个干预是不对称的,也就是说,减轻低熵任务的正向激励,和减轻高熵任务的负向惩罚,用的是不同的力度。研究团队发现,低熵任务对干预更敏感:如果在低熵任务上过于激进地惩罚错误答案,会导致AI为了降低每个词的不确定性而快速缩短回答长度——这是一种病态行为,叫做"长度崩塌",表现为AI开始给出越来越简短甚至空洞的回答。因此,对低熵任务的干预要温柔,对高熵任务的干预可以更大胆。在实验中,对低熵任务的正向激励缩减系数设为0.5,对高熵任务的负向惩罚缩减系数设为0.2。

第三步是自适应阈值。怎么判断一道题的组熵是"低"还是"高"?这个标准不能固定死,因为不同的基础模型、不同的训练阶段,熵的绝对数值差异很大。GEPO的解决方案是:每一轮训练时,计算当前这一批题目的平均熵值和标准差,然后把"均值减去0.2个标准差"定义为低熵阈值,把"均值加上0.3个标准差"定义为高熵阈值。组熵低于低熵阈值的题目就触发低熵干预,高于高熵阈值的题目就触发高熵干预,介于两者之间的题目则完全保持原样,不做任何调整。

为了防止这个阈值因为某一批数据的偶然波动而剧烈跳动,GEPO还用了指数移动平均的方式把阈值平滑化——简单理解就是,新计算出的阈值只占10%的权重,历史积累的阈值占90%的权重(平滑系数γ=0.01),这样阈值会随着训练进展缓慢稳定地变化,不会因为某一批特别难或特别简单的题目而急剧波动。

六、实验结果:在十三个考场上的成绩单

研究团队用两个不同的基础模型来测试GEPO的效果,分别是Intern-S1-mini(一个轻量级多模态推理模型)和Qwen3.5-9B(一个纯文本推理模型)。测试覆盖了十三个不同的基准测试,包括数学竞赛(AIME2025、IMO-Bench)、数学视觉理解(MathVista)、物理推理(Physics、CMPhysBench)、指令遵循(IFBench)、代码生成(LiveCodeBench)、综合知识(MMLU-Pro、GPQA)、多模态理解(MMMU-Pro)、科学推理(SFE、MicroVQA)和图表理解(ChartQAPro)。

对比的基准方法包括:原始的GRPO算法、AEPO(一种基于熵的改进方法)、Clip-Cov和KL-Cov(两种基于概率协方差的覆盖率感知方法)。

在Intern-S1-mini上,GEPO在十三个测试中的七个上取得了最好成绩,综合平均分达到54.2,而GRPO、Clip-Cov、KL-Cov分别是51.5、51.5、51.8。AEPO在数学上表现不错,但在物理和指令遵循上表现欠佳,综合同样是51.8。尤其值得关注的是GEPO在数学竞赛类题目上的表现:AIME25从74.6提升到82.0,IMO-Bench从42.3提升到52.8,GPQA从65.1提升到69.2——这些都是极具挑战性的题目,提升幅度相当显著。

在Qwen3.5-9B上,GEPO的综合平均分达到71.2,高于GRPO的70.7、Clip-Cov的70.9和KL-Cov的69.9。AEPO在这个模型上表现大幅倒退,综合仅67.1,甚至不如原始的GRPO,这说明AEPO的固定熵控制策略对不同模型的适应性很差——当模型的熵特性发生变化时,AEPO的表现会出现明显下滑。GEPO的自适应阈值机制则无需任何调整就能自动适配新模型。

训练过程的稳定性差异同样引人注目。在Qwen3.5-9B的训练过程中,原始GRPO在训练到约170步时发生了灾难性崩溃,AIME25的准确率从约85%骤降至约40%,同时GPQA、MMMU-Pro、MathVista也同步大幅下滑。这是失控的熵增长导致的:没有任务感知的熵调节,模型的输出熵可以无限制地增长,最终产生混乱无意义的输出。AEPO虽然避免了完全崩溃,但表现出持续的震荡,始终无法稳定收敛。KL-Cov在同一模型上于100步后也发生了训练崩溃,推测原因是它使用了固定的熵阈值,无法适应不同任务的需求。GEPO则全程平稳上升,从未出现任何崩塌迹象。

通过观察不同任务的熵随训练步数的演变,可以更清楚地看到GEPO和AEPO的本质区别。AEPO会把所有任务的熵强行拉向相似的水平,抹平了不同任务之间本来应该存在的差异——这就像那位私人教练给所有学员制定了完全相同的训练量,不管你是举重还是瑜伽。GEPO则恰恰相反,它保留了不同任务之间的熵差异:需要更多探索的任务维持在较高的熵水平,而已经基本掌握的任务则自然降低到较低的熵水平,形成了一个健康的、因任务而异的"学习节奏"。

七、拆开来看,每个零件都不可缺少

研究团队还通过消融实验(也就是逐一去掉某个功能,看看成绩有什么变化)验证了GEPO各个组成部分的贡献。

去掉高熵控制(即不再减轻高熵任务的负向惩罚)时,综合成绩从54.2下降到51.3,下降幅度最大。这说明高熵控制是GEPO最关键的组件——如果不保护高熵任务的探索空间,AI会在高熵任务上因为大量惩罚信号而过早放弃探索,物理和AIME25这类需要深度推理的任务受损最严重。

去掉低熵控制(即不再减弱低熵任务的正向激励)时,综合成绩下降到52.6。低熵控制的主要作用是防止AI在已经学好的方向上过度强化,保持探索多样性,主要对IMO-Bench和指令遵循任务的贡献更为突出。

去掉不对称设计(把两个缩减系数设置为相同值)时,综合成绩下降到53.0。这说明区分对待两种熵状态、用不同力度进行干预,确实比一刀切的对称处理更有效。这个发现呼应了之前关于低熵任务对激进干预更敏感的分析:温柔对待低熵任务、大胆对待高熵任务,是符合各自特性的设计。

归根结底,这个研究讲述的是一个关于"因材施教"的故事。AI在同时学习多种不同性质的任务时,不同任务处于完全不同的学习阶段和探索状态,如果用统一的方式对待它们,强的会越来越强、弱的会越来越弱,最终形成一种高效率但高度偏科的AI。GEPO的方案是给每一组题目独立测量"探索体温",然后针对性地调整训练信号——已经学得很扎实的任务,稍微踩一踩油门,别让它抢占太多资源;还需要大量探索的任务,少用点刹车,给它更多空间去寻找正确路径。这种调整既不需要提前告诉AI哪些题是哪类任务,也不需要额外生成任何答案,成本几乎为零。

这对普通用户而言意味着什么?这项研究直接影响的是AI大模型的后训练质量。一个通过GEPO训练的AI,在回答你的数学问题和写作需求时,能做到更均衡:不会因为数学题"比较好训练"而把大量精力都投入数学,忽视了你的写作或代码需求。更重要的是,训练过程更稳定,意味着研究机构和企业在训练AI时的失败风险降低了,最终产出的模型质量更可靠。

有意深入了解技术细节的读者,可以通过arXiv编号2607.16850检索完整论文,作者来自上海人工智能实验室,论文包含完整的数学推导和实验细节。

Q&A

Q1:GRPO训练中为什么不同任务的激励信号会产生系统性的不平衡?

A:GRPO通过对同一道题的多个答案进行标准化处理来构建激励信号,但这种标准化隐含着一个前提:不同题目的激励信号在同一参考框架下可以相互比较。然而当不同任务的熵差异很大时,标准化后的分数分布本身就受到策略分布的扭曲,低熵任务产生的激励信号更强烈、更一致,高熵任务产生的信号更弱小、更嘈杂,导致训练资源被低熵任务系统性地抢占。

Q2:GEPO的自适应熵阈值和固定阈值相比有什么优势?

A:固定阈值在不同基础模型或训练阶段之间无法适应,因为不同模型的熵绝对数值差异很大,同一个固定阈值对某个模型可能合适,对另一个模型可能完全失效。GEPO的阈值基于当前批次的熵均值和标准差动态计算,并通过指数移动平均平滑,能自动跟随训练进展和模型特性调整,无需针对每个模型单独调参。

Q3:GEPO需要额外的计算开销或额外的数据标注吗?

A:GEPO不需要任何额外的计算开销,也不需要任何任务类型的标注信息。组熵的计算完全基于GRPO训练过程中已有的答案样本,属于零成本的"顺手"操作。整个方法作为GRPO的轻量扩展,可以直接集成到现有的基于分组的策略优化框架中,不改变采样流程,不增加模型参数。