字节跳动与中科院联手,让“截肢“后的AI大模型重新学会“写作“

这项由字节跳动、中国科学院软件研究所中文信息处理实验室及中国科学院大学联合开展的研究,以arXiv预印本形式于2026年7月14日公开发布,论文编号为arXiv:2607.13124。有兴趣深入了解技术细节的读者可通过该编号查询完整论文。

一、故事从一次"外科手术"开始

现代AI大语言模型,就像一座精密运转的大型工厂,拥有数十亿甚至数百亿个零部件协同工作。然而,运营这座工厂的成本极其高昂——每次生成一段文字,都需要消耗大量的计算资源和电力。为了降低成本,工程师们会对这座工厂进行"瘦身手术",把一些看似不那么重要的生产车间整个拆掉,让工厂用更少的零部件继续运转。这个过程在技术上叫做"结构化剪枝"。

这种瘦身方法有个天然的好处:拆掉整个车间之后,工厂的结构依然是标准的、通用的,不需要任何特殊设备就能继续运转,这一点比其他一些只是把零件打个洞或者压缩零件体积的方法要方便得多。

然而,手术之后出现了一个令人头疼的问题:工厂在做选择题方面表现依然不错(比如判断"这句话是正面的还是负面的"),但一旦要自己从头写一篇文章,质量就急剧下滑,甚至完全崩溃。这就好比一个人做了大脑手术后,还能回答"苹果是红色的吗"这种判断题,却已经没办法自己写一首诗或者讲一个故事了。

研究团队拿Qwen3-4B-Instruct这个模型做了实验。这个模型原本有36个"生产车间"(即Transformer层),研究人员将其中9个最不关键的车间拆掉,参数量减少了约25%。结果,这个经过手术的模型在解数学题上的准确率从88%暴跌到了1%,写代码的能力几乎归零,在各种开放式问答任务上也全面溃败。

这就是这篇论文想要解决的核心问题:如何在做完"缩减手术"之后,帮助这个受损的模型重新找回自由写作的能力?

二、一个关键发现:能力没有消失,只是被"压制"了

在寻找解决方案之前,研究团队先做了一件侦探式的工作——他们想搞清楚,手术之后,模型的写作能力到底是永远消失了,还是只是暂时被压制住了?

他们的测试方法很有趣:让这个受损的模型不只生成一次答案,而是生成很多次(比如64次),然后看这64次里有没有至少一次是正确的。结果非常出人意料:在解数学题方面,当允许尝试64次时,这个受损模型居然有91%的概率能给出正确答案,甚至略高于原始未受损模型直接给出的88%!

这说明什么?这说明正确的答案其实还藏在模型脑子里,只是模型每次开口"说话"时,不够自信,总是选择了错误的方向。就像一个真正懂得某道数学题的学生,因为过于紧张,每次考试时都写错了——但并不是因为他真的不会,而是因为某种"心理障碍"在作怪。

这个发现给了研究人员重要的方向:恢复这个模型的写作能力,本质上不是"重新教会它知识",而是"帮它找到表达知识的正确路径"。

三、另一个关键发现:模型在写着写着就开始"复读"

研究团队还发现了受损模型在生成文字时的另一个典型症状:它特别喜欢在生成一段内容之后,陷入无休止的重复循环。就像一个正在讲故事的人,讲到一半突然卡壳,然后开始反复说"然后……然后……然后……",永远跳不出这个循环。

在参数减少25%这个"临界点"上,模型生成的内容中有高达84%会在结尾部分陷入这种重复循环。更有意思的是,研究团队用数据证明了这些重复的"尾巴"几乎不携带任何有用的学习信息——重复部分的信息量(用一种叫做JSD散度的指标来衡量)只有正常部分的约1/35。换句话说,那些陷入循环的文字内容,就像一盘磁带卡碟之后反复播放的杂音,既没有新信息,也没有纠错的价值。

这个发现变成了后来设计解决方案时的核心出发点。

四、为什么常规"补课"方法效果不好

面对受损的模型,最直觉的修复方式是给它做"补课"——收集大量高质量的问答数据,让模型重新学习如何正确回答问题。研究团队系统地测试了几种常见的补课方法。

第一种是最简单的方式:直接拿人工整理好的标准答案,让模型对照着重新学习,类似于给学生发一本答案册让他抄。这种方法确实有一定效果,模型的综合评分从5.7分(满分假设为100分,原始模型约75分)提升到了21分左右,但依然远远不够。

第二种方式稍微聪明一些:让原始的、未受损的"老师模型"先把答案写出来,再让受损的"学生模型"去学习这些答案。这种方式效果略好,综合评分提升到约28分。

第三种方式更进一步:不仅让学生模型学习老师写的答案,还在每个词的层面上让学生参考老师的"词汇偏好"(即老师对每个可能的下一个词赋予的概率分布)。这种方式综合评分约30分。

但这三种方式都有一个共同的根本缺陷:它们都是让受损的模型去学习别人写的答案,而不是让模型在自己真实的"思考状态下"得到纠正。这就好比一个学生手抖写字总是抖,你给他看再多别人写的漂亮字帖都没用——你真正需要的,是在他自己拿笔写字、手刚开始抖的那一刻,立即告诉他"这里抖了,应该这样调整"。

五、正确的修复思路:在"自己的错误"上实时纠正

研究团队采用的核心方法叫做"在线策略蒸馏"(On-Policy Distillation,简称OPD)。这个名字听起来很学术,但背后的思路其实非常直观。

具体操作是这样的:让受损的学生模型自己生成文字,同时让原始的老师模型(也就是手术之前的完整版模型)站在旁边实时观看。学生每写一个字,老师就在心里给出一个参考答案——"这个位置我会选这些词,概率分别是这样的"。然后,通过一种数学上的"拉近"操作,让学生模型下次在同样位置时做出更接近老师的选择。

这个过程有几个重要特点。老师是完全"自给自足"的,不需要从外部找任何人标注数据或者设计奖励机制——老师就是模型自己在手术之前的状态,天然地知道"正确的分布"应该是什么样的。每一个生成的词都会得到老师的实时反馈,而不是只在整篇文章写完之后才得到一个"对"或"错"的裁决。最关键的是,学生是在自己实际生成的文字上被纠正,而不是在别人写的文字上。

从实验数据来看,这种方法的效果远超之前所有的补课方式,综合评分直接跳升到约48至50分,是受损未修复状态的将近9倍,也比最好的传统方法高出了将近18分。

六、但这里有个棘手的问题:老师在给无用内容打分

然而,直接套用这个在线实时纠正的方法,在实际操作中会遇到一个严重的效率问题:受损模型在训练初期生成的内容,有高达55%至75%都是那种陷入循环重复的"废话尾巴"。

当受损学生模型生成了一段循环废话,老师模型也跟着把这段废话读了一遍。问题在于,老师模型发现,这段废话其实挺"合理"的——在循环开始之后,继续循环确实是概率最高的选项!所以老师给出的反馈是"继续循环吧,这挺对的",而学生的分布也已经在循环这件事上与老师基本一致,双方都觉得循环是对的,从数学上看几乎没有任何可以改进的信号。

结果就是:在训练的最初阶段,大量的时间和计算资源都被浪费在处理那些无用的重复尾巴上,真正有价值的学习信号(也就是那些正常生成的、信息量丰富的前半段文字)却被稀释了。研究团队在实验中发现,用固定长度预算训练时,大约需要到第80步才能真正进入有效学习阶段,前80步几乎都是在原地踏步。

七、ShortOPD:从短到长,智能分配"学习时间"

为了解决这个问题,研究团队提出了他们的核心创新:ShortOPD,即"从短到长的在线策略蒸馏"。

核心思路可以这样理解:既然训练早期模型总是写着写着就开始循环废话,那就不要让它写那么长。把每次生成的最大长度限制到一个较短的范围内,让模型只写它目前还能写好的那部分。随着训练的进行,模型的能力逐渐恢复,循环废话越来越少,再逐步放开长度限制,允许模型挑战更长的生成任务。

但具体怎么判断"现在应该写多长"呢?研究团队设计了一套自动化的检测和控制系统,完全不需要人工介入。

这套系统会持续监测三个信号。第一个信号是"循环重复率":每批次生成的内容里,有多少比例陷入了终止性的循环重复?第二个信号是"截断率":那些没有陷入循环的生成内容里,有多少在达到当前最大长度限制时还没写完?第三个信号是"有效长度":每次生成的内容里,真正有用的部分(不含循环废话尾巴)平均有多长?

控制逻辑遵循两个规则:当循环率高时,把最大生成长度缩短,缩短到大约"当前有效长度的1.15倍"这个范围;当循环率低、且同时有大量内容在达到长度上限时还没写完(说明模型已经准备好挑战更长的内容了),就把最大生成长度提高25%。为了避免每批次的随机波动导致系统反复横跳,所有统计数据都经过指数移动平均来平滑处理,长度变化本身也经过平滑处理,避免突然剧烈变化。

这套系统的妙处在于:它不需要任何额外的计算——所有用于判断的数据,都是在正常训练过程中已经产生的,不需要额外跑一遍模型。

八、实验结果:数字说话

实验在数学、代码和开放式问答三个完全不同的领域同时进行,使用了超过45000个训练样本。受损模型在25%参数被剪掉后的综合评分约为5.7分。经过一轮ShortOPD训练后,综合评分达到约48.5分,恢复到了原始完整模型75.2分的64.5%。

在计算效率上,对比最直接的传统固定长度训练方式,ShortOPD节省了约71%的词元生成量,训练时间从35.9小时缩短到8.5小时,却只损失了不到2分的最终效果(48.5分对比50.2分,或49.6分)。换句话说,用约四分之一的训练时间,达到了接近完整训练的效果。

研究团队还测试了扩展训练轮次的效果:训练一轮综合评分为48.5分,两轮为53.5分,三轮达到55.4分,已经恢复到原始模型的73.7%。这说明随着更多训练,效果还能继续提升。

关于"稀疏奖励"方法(即只在整篇答案对了之后才给奖励的强化学习方式)的对比也很有说服力:同样只用数学题训练,使用强化学习的两种变体(PPO和GRPO)几乎没能改善受损模型(准确率分别提升0.23和1.59个百分点),而ShortOPD在同样的数学题上训练后准确率提升了约37个百分点。背后的原因很直接:受损模型很少能自己写出正确答案,所以几乎没有"正确答案"可以被奖励——奖励信号太稀疏,根本没有足够的信息来引导学习。

九、训练数据的覆盖范围也至关重要

研究团队还做了一组非常有启发性的消融实验:如果训练数据只覆盖部分领域,会怎样?

当训练数据去掉所有数学题时,模型在数学上的恢复几乎为零(GSM8K准确率只有8%,而完整数据集训练能达到62.7%)。当训练数据去掉所有代码题时,代码执行成功率暴跌到接近0(HumanEval只有0.61%,MBPP只有2.33%)。这说明,模型的写作能力必须在特定类型的任务上练习,才能在那类任务上得到恢复——没有数学题,就不会恢复数学写作能力;没有代码题,代码生成能力就无从修复。

这意味着训练数据的覆盖范围不是一个技术细节,而是整个恢复方案中的一个核心设计决策。如果你希望恢复某个领域的能力,就必须确保训练数据覆盖了那个领域的提示词。

十、一个有趣的发现:选择题和作文题的恢复互不相保

研究团队还附带测试了恢复后的模型在多项选择题上的表现。结果揭示了一个值得深思的现象:ShortOPD主要提升了生成写作能力,但在多项选择题上的准确率(67.6分)低于那些专门针对选择题优化的传统方法(SFT约74.9分,KD约74.4分)。

这并不令人意外——选择题考查的是在给定选项中打分排序的能力,而这恰好是传统方法(让模型学习外部写好的固定文本序列)擅长的事情。ShortOPD让模型在自己写作时更像原始模型,但这不等于让模型在看别人写的文字时也更像原始模型。

研究人员随后尝试了一种"组合拳":先用传统SFT方法做一轮基础训练,再用ShortOPD做第二轮训练。结果显示,这种组合方式在选择题(76.8分)和写作生成两个方向上都达到了接近原始完整模型的水平,说明两种方法是互补而非对立的。

说到底,这项研究解决的是一个长期被忽视的实用问题:AI模型压缩后的"写作能力崩溃"。过去大家只看选择题成绩,觉得压缩没问题,但真正部署时才发现模型已经不会好好写文章了。这项工作清晰地指出了问题所在,并提供了一套实验验证有效的解决方案——在模型自己的写作过程中实时纠正,并智能地管理训练初期的无效循环内容。

当然,研究团队也坦率地指出了工作的局限性:目前的实验主要集中在一种特定的剪枝方法和一个特定的模型系列上,25%的参数减少量是这个方案有效的"临界点",压缩超过这个比例,模型会进入更混乱的"胡言乱语"状态,这套方法是否依然有效还需要进一步验证。更大的模型、更多的剪枝方式,以及"到底压缩到什么程度就彻底没救了"这个边界问题,都留给了未来的研究。

对于普通人而言,这项研究意味着:未来你在手机、电脑或各类AI助手上用到的大语言模型,可能是经过了更充分剪枝压缩、运行更省电更快速的版本,但你与它对话时感受到的写作质量,并不会因此大打折扣。有兴趣深入了解技术细节的读者,可通过arXiv编号2607.13124查阅完整论文。

Q&A

Q1:结构化剪枝为什么会导致大语言模型写作能力崩溃?

A:结构化剪枝是将模型中整个"车间"(Transformer层)拆掉的操作。写作需要模型在生成每一个词时做出正确的概率选择,并沿着自己的选择继续生成,这是一个链式过程,任何一步出错都会累积放大。剪枝后,模型在这种链式生成时频繁选错方向,最终陷入循环重复,而选择题只需在给定选项里打分,受影响小得多。

Q2:ShortOPD训练时为什么要动态调整生成长度?

A:因为训练初期受损模型生成的内容大部分是无意义的循环废话,而处理这些废话既耗费计算资源,又几乎不能提供有效的学习信号(老师和学生在"循环是对的"这件事上高度一致,没有纠正空间)。动态缩短生成长度,让模型只写它目前能写好的部分,然后随着能力恢复再逐步放开长度,能把有限的训练资源集中在真正有价值的内容上。

Q3:为什么强化学习方法对受损模型几乎没有效果?

A:强化学习依赖"正确答案"才能给出奖励信号。但受损模型本身很少能自己写出正确答案,正确答案出现的概率极低,可供奖励的机会极少,学习信号极度稀疏,模型几乎得不到任何有意义的反馈。相比之下,ShortOPD在每一个词上都给出老师的参考分布,无论答案最终是否正确,每个词都有学习信号。