
2026年,三个实验室的AI模型被同时要求做一件事:用希腊语进行推理。不是用希腊语回答问题这个早就有模型能做到。而是用希腊语思考问题,把整个思考过程用希腊语写出来,让使用者能看懂、能审查、能纠错。结果发现,在这之前,没有一个模型真正做到过这件事。这篇论文出自一家叫Sophea AI的公司,他们选了三个各自代表不同技术路线的开源模型,阿里巴巴的Qwen、OpenAI的Gpt-OSS、英伟达的NemotronH,给它们做了同样的希腊语推理微调。原本的研究计划很简单:训练,测试准确率,发论文。但真正有意思的部分,是他们撞上的一连串意外。一开始,团队像所有人一样,盯着准确率这个数字看。训练前后对比,分数几乎没变。这在做模型微调的人眼里几乎是灾难性的结果,意味着几个月的工作可能白费了。于是他们做了一件几乎所有论文都不会做的事:换个随机种子,把训练重新跑一遍,其他什么都不变。结果分数上下浮动了7.7个百分点。这个数字比他们之前测试过的所有数据处理方法、所有训练配方调整带来的效果差异都要大。换句话说,过去几周他们辛辛苦苦调整语料库、换训练方案,以为自己在改进模型,实际上很可能只是在随机噪声里打转。随机种子*随机种子*决定模型初始参数和训练数据顺序的一个数字,理论上不应该影响最终效果的方向性,只应该带来微小抖动。这就像你想知道两杯咖啡哪杯更浓,但你从来没测过同一台咖啡机连续煮两杯的浓度差异有多大。如果连续煮出来的两杯咖啡浓度本身就能差出一大截,那你拿换了新豆子和没换豆子的两杯做对比,得出的结论可能完全是噪声在说话,不是豆子的功劳。团队之前一直在比较用了新语料和没用新语料这两杯咖啡的浓淡,却从没测过咖啡机本身的抖动有多大。如果不做这个种子对照实验,论文里原本准备写的五六个重要发现,可能没有一个是真的。这次意外的发现,把整篇论文的方向彻底改写了。团队开始意识到,准确率这个单一数字,对一个小语种推理模型来说,可能压根不是正确的度量方式。他们转而去看那些准确率这个数字根本捕捉不到的东西:模型到底用什么语言在思考,它花了多少计算资源,它能不能分辨题目的难易程度,它又在哪些地方悄悄退化了。零,一个惊人的数字在深入这些新维度之前,有一个数字值得单独拎出来说。研究团队测试了三个模型的基础版本,也就是没有经过任何希腊语推理微调的原版模型,给它们1000道希腊语题目,让它们开启思考模式作答。统计结果显示,这些基础模型在用希腊语思考的比例是:零。一千次尝试,零次成功。哪怕问题本身是希腊语写的,模型的内部推理过程也几乎从来不会切换到希腊语,而是习惯性地用英语打草稿,读起来像是我们需要用希腊语回答一个选择题……这样的中英混杂开场,然后再把最终答案翻译成希腊语呈现给用户。这意味着什么?意味着一个希腊用户提问,模型内心其实在用英语盘算,用户看到的希腊语答案,只是英语思考过程的翻译产物。如果这个思考过程出了错,用户根本没办法读懂中间发生了什么,更别提去纠正它。这就好比你请了一位翻译帮你处理合同谈判,对方开出的条件,翻译先在自己脑子里用他的母语盘算了一整套利弊,只把最后的结论翻译给你听。你以为你在直接参与谈判,其实你连谈判过程的一半都看不到。如果不让翻译的思考过程本身也变得透明,你永远无法判断这个结论是怎么来的,更没法在谈判过程中及时插话纠正方向。这个零就是整篇论文真正想解决的问题:如何让模型的思考过程,而不仅仅是最终答案,变得对希腊语用户可读、可审、可控。监督微调做到了什么*监督微调*SFT给模型展示大量问题-推理过程-答案的样本,让模型模仿着学会类似的推理方式,是目前训练AI模型最常用的方法之一。团队构建了一个包含约11.8万行希腊语数据的训练语料库,一半带有完整的推理过程记录,另一半是普通的问答对话数据。有意思的是,这些推理过程本身也是精心设计出来的,不是简单翻译英文数据集的内容。团队发现,直接把英文的推理链条翻译成希腊语,会得到一种整洁的总结,而不是真正展现思考轨迹的文字。所以他们改用另一种做法:让一个大模型重新用希腊语从头解答每一道题,只保留那些最终答案和标准答案一致的推理过程,答案不对的直接丢弃,绝不修补。这里有个细节值得展开讲讲。团队设计了一套打分标准来衡量什么样的推理文字才算好,核心看的不是对错,而是文字里有没有真实思考的痕迹,比如尝试了一种解法后发现不对、进行了自我验证、中途改变了方向。他们测试了一个公开的希腊语常识推理数据集,发现里面人工写的解释文字得分只有0.27分,几乎没有一条超过及格线;而用他们的方法重新生成的推理文字,得分跳到0.68分,97%都超过了及格线。这就像批改学生的解题过程,一份作业写着答案是C,因为其他选项都不对,另一份写着我先试了A,算出来不符合条件,又试了B,发现漏掉了一个前提,最后确认是C。两份作业的最终答案可能一模一样,但后一份才真正展示了这个人是怎么想问题的。如果只满足于第一种写法,你训练出来的模型学会的只是报答案的套路,而不是真正的推理习惯。微调之后,效果如何呢?论文给出的数字相当亮眼:四个正式发布的模型,推理过程用希腊语的比例从零跳到了97.4%到98.1%之间。语法评审也全面向好,四个模型的语法正确性都有提升,而且提升幅度最大的恰恰是原本表现最弱的那些模型。整体能力方面,和各自的基础模型相比,差距都在几个百分点以内,说明微调没有让模型变笨,只是让它换了个语言习惯思考。推理预算:省下来的钱去哪了除了语言切换,团队还测量了另一个维度:模型思考时到底花了多少字。在准确率完全相同的情况下,基础模型平均每道题要写1010个词的推理过程,而微调后的模型只需要150个词。这看起来是个巨大的进步,毕竟推理越简洁,理论上服务器成本越低。但这里藏着一个陷阱,团队管它叫分词膨胀问题。*分词*tokenizer fertilityAI模型不是按字计费的,而是按内部切分出的token数量计费,不同语言切分出的token数量差异很大。希腊语每个词平均要消耗2.3到2.5倍于英语的token数量。这意味着,如果你只看词数减少了多少,可能会得出一个错误的省钱结论,因为希腊语本身的token成本就更高。团队用每个模型自己的分词器重新计算了token成本,结果发现三个模型家族的表现截然不同:阿里的Qwen模型确实省钱了,微调后的token消耗只有基础模型的三分之一;英伟达的NemotronH打了个平手,基本没有变化;而OpenAI的Gpt-OSS反而更贵了,微调后的token消耗是原来的1.6倍。这就好比三家外卖平台都宣称配送时间缩短了,但你发现其中一家统计的是骑手实际骑车时间,另一家统计的是从下单到送达的总时间,第三家干脆换了个更堵车的路线来省油钱。如果你不把计费单位统一,光看缩短了这个说法,根本判断不出谁是真的省了成本。这也是为什么团队坚持用词数作为跨语言公平比较的单位,同时额外补充token数据,让读者自己看清楚哪个层面的省钱是真的省钱。模型能分辨难易吗这一部分的发现,可能是整篇论文里最能体现微调价值的地方。团队设计了一个指标,专门衡量模型是不是对着简单题目也使劲刷时间。他们统计每道题在所有测试模型上的平均推理长度,如果某个模型在一道至少80%的模型都能答对的简单题目上,推理长度却达到了平均值的三倍以上,就判定为超支。结果显示,基础模型在98%的简单题目上都出现了这种超支现象,而且更让人意外的是,它在简单题目和困难题目上的超支比例几乎一模一样,都在98%左右。这说明什么?说明基础模型压根不知道一道题是简单还是困难,它对每道题都用同样多的力气去想,无论这道题是不是三下五除二就能解决的。而微调后的模型,超支比例直接降到了0.2%到12%之间,并且在困难题目上花的时间明显比简单题目多。这就像一个刚入职的新员工,不管任务是回复一封简单邮件还是撰写一份复杂报告,都要反复检查修改二十遍,因为他分不清哪个任务值得认真对待、哪个任务简单处理就行;而一个有经验的老员工,简单邮件几分钟处理完,复杂报告才会花心思反复打磨。如果一个AI系统不具备判断任务难度的能力,即使它最终答案是对的,它消耗的算力成本也会高得不成比例,尤其是在需要大规模部署、每天处理成千上万个请求的场景下,这种一视同仁式的低效会被无限放大。被误判的遗忘微调一个模型,人们最担心的就是学了新的,忘了旧的,这在机器学习里叫灾难性遗忘。论文里有一段特别值得说的插曲。团队最初发现,微调后的模型在常识推理测试上,普遍出现了3个百分点左右的下滑,而且是十二个不同训练版本全部出现同样的下滑趋势。这看起来就是教科书级别的学了希腊语,忘了常识的证据。但当团队换了一种提问方式重新测试,要求模型只回答一个选项字母,而不是写一大段解释,这个下滑现象直接反转成了1.7个百分点的提升。真相是什么?真相是模型的常识判断能力从来没有丢失,只是当它被要求写长篇大论的推理过程时,某种格式上的习惯变化让它在最后给出答案时绊了一下。这不是能力问题,是表达方式的问题。这就像一个老师傅做菜手艺没退步,但你要求他一边炒菜一边用蹩脚的英语解说每一步操作,他解说时磕磕巴巴,你可能会误以为他厨艺变差了。让他用熟悉的方式操作、只在最后报菜名,他立刻恢复水平。如果只看一边解说一边炒菜这个特定场景下的表现,就下结论说他厨艺退步了,那就冤枉他了。团队还专门找了语言评审来打分,考察模型在语域控制该用正式语气还是随意语气和语法准确性上的表现。结果是语域控制在所有模型上都没有丢失甚至原本表现最弱的两个模型还有提升语法正确性更是全面进步进步最明显的恰恰是原本语法最差的模型。六次仪器说谎的经历这篇论文最让人印象深刻的地方,可能不是它证明了什么,而是它诚实地记录了自己被误导过多少次。团队总共遇到了六次自己搭建的测量工具出了问题的经历,每一次都曾让他们相信了一个后来被推翻的结论。第一次,他们的评分程序没有专门去找模型要求写的那句答案是某某的固定格式,而是扫描整个回答文本,让最后一次提到的选项获胜。这导致一个话痨型模型,哪怕正确说出了答案,又花大段篇幅解释为什么其他选项不对,最后被这套评分逻辑误判成了错误答案。这个漏洞在某次测试里制造出29.8个百分点的虚假优势,相当于18倍标准差,一个统计学上几乎不可能出现的极端偏差。第二次就是前面提到的常识推理假性遗忘事件。第三次更微妙:团队发现他们的逻辑推理测试题库里,有38.9%的题目和训练数据来自同一个题库,属于事实上的考试泄题,尽管表面看起来是两个独立的数据集。这种污染肉眼几乎看不出来,常规的文本重复检测方法也没能第一时间发现,是团队后来专门核查才揪出来的。第四次,团队用机器翻译的方式把一个英文数学测试集扩充成希腊语版本,却没意识到用来做翻译的AI模型,和用来生成训练数据的AI模型是同一个家族。结果微调后的模型对这种翻译腔调格外适应,在机器翻译的题目上得分虚高,而在人工翻译的对照组题目上,基础模型反而领先。这暴露了一个容易被忽略的坑:如果你用AI翻译搭建测试基准,又用同一个AI家族生成训练数据,你的微调模型会因为读懂了同一种翻译腔而作弊得分,而这种作弊,常规的数据污染检测完全查不出来,因为题目本身确实是全新的,只是口音被模型摸透了。第五次是个技术细节但影响深远的错误:希腊语和多数欧洲语言一样,用句点分隔千位,用逗号表示小数点,这和英语的书写习惯正好相反。团队的答案提取程序按照英语习惯处理数字,导致模型正确地用希腊语格式写出17.500十七点五千这样的答案时,被误判为17.2这样的错误数值。这个错误发现得晚,但影响范围小,只影响了个别测试题,没有改变论文的最终结论,但它揭示的问题很有普遍意义:给非英语语言设计的测试工具,必须专门检验它在目标语言自己的数字书写习惯下能不能正常工作,不然它会把流利的目标语言表达,误判成错误。第六次是在做强化学习实验时,团队发现某个默认设置悄悄地把要求模型深度思考的模式关掉了,导致他们花了四个GPU、整整四小时跑出来的结果,其实测的根本不是他们以为的那个模式,而是另一套设置下的数据,文件名却写着原本预期的模式名称。整个过程没有报错、没有警告,数字看起来完全合理,却是错的。这六次经历共同指向一个道理:一个自动化的测量工具,完全有可能对整门语言都产生系统性偏差,却在所有的英语测试里表现得完美无缺,不会露出任何破绽。这也是为什么团队反复强调,每一个行为指标都需要一个对照组来验证,而不是简单的归一化处理就能解决问题。三种训练配方的较量论文里还有一段独立的对比实验,虽然团队自己也说这不是论文的主线,但很值得单独讲讲,因为它解释了另一个重要的失败模式。训练语料库分成两半,一半带推理过程,一半是普通问答对话。团队试了三种组合方式。第一种,把两半数据混在一起,一次性训练。结果模型学会了不管三七二十一先给答案,哪怕明确要求它进行深度思考,它也有23.6%的概率直接跳过推理过程,交一份空白的思考记录。第二种,先用推理数据训练,再接着用混合数据继续训练。这修复了跳过思考的问题,空白思考记录的比例降到了1.3%以下,但带来了新麻烦:模型开始经常不按要求的格式给出最终答案,这个格式失败率从12%飙升到33%到40%。第三种,只用推理数据训练,完全不碰普通问答数据。这个方案的准确率和格式合规率都是最好的,代价是模型失去了直接对话不深度思考这个模式的能力。团队后来专门做了一个统计:把只用推理数据和两阶段混合训练这两种做法,累计跑了15次独立训练,用统计学方法对比,得出只用推理数据训练平均高出6.9个百分点这个结论,而且这个结果在概率上非常显著,不太可能是偶然。这也是整篇论文里,唯一一个经受住了随机种子噪声考验、真正站得住脚的准确率层面的发现。这就像开一家餐厅,同时经营外卖和堂食两种业务,如果厨师被要求两种订单混着做,他可能会习惯性地走捷径,把堂食也当外卖简化处理;如果先专门练一段时间精致堂食手艺,再插入外卖训练,堂食质量保住了,但上菜规范可能会乱套;如果干脆专心只做堂食,不接外卖单子,出品质量和规范性都是最好的但这家店就没法做外卖生意了。选哪种方案,取决于你到底需不需要外卖这项业务,这是一个业务取舍,不是谁天生更优越的问题。修复语言死锁前面提到,微调后的某个版本被明确要求用英语来思考时,却依然一字不差地用希腊语作答,一千次尝试,一次都没有听从指令。团队管这个现象叫语言死锁。深挖之后发现,问题的根源不在于教会模型说希腊语这件事本身,而在于训练数据只朝一个方向设计:全都是希腊语问题配希腊语推理。模型因此学会了一种过于死板的规则,不管指令怎么说,一律用希腊语思考。解决方法是重新设计训练数据,让希腊语问题配希腊语推理、英语问题配英语推理,两种语言方向都要覆盖到,并且严格筛选掉那些推理过程中途串台的样本。这个调整之后,重新训练出来的模型在1900道英语问题上,100%都用英语进行推理,一次语言混杂都没有出现。同时,在希腊语测试上,依然保持97.98%的希腊语推理比例。更进一步,团队还测试了能不能用明确指令让模型反着来,比如对一道希腊语题目下达请用英语思考的指令。这次,模型在44.8%到62.5%的情况下(不同模型家族表现不同)确实会切换到英语思考,虽然没能做到完全服从,但至少不再是铁板一块的0%了。这就像教一个孩子在家说中文、在学校说英文,如果你只教他家里永远说中文,他可能会养成一种固执的习惯,哪怕老师用英语明确要求他回答,他还是忍不住脱口而出中文。而如果你从小就让他知道这取决于场合和对方的要求,他才能真正学会随情境切换,即使不是每次都能做得完美。这揭示了一个更深的道理:教AI模型某种行为习惯的时候,如果训练数据本身缺乏方向上的多样性,模型学到的往往不是灵活运用这个能力,而是一条死板到近乎顽固的单行道规则。强化学习登场,补上SFT补不了的洞监督微调虽然做到了让模型用希腊语思考,但它有几个天生的软肋。*强化学习*RL不同于监督微调照着样本模仿,强化学习是让模型自己尝试,根据结果好坏给予奖励或惩罚,让模型自主摸索出更好的行为方式。*RLVR*全称带可验证奖励的强化学习,奖励信号来自可以客观核实的规则,而不是依赖另一个AI模型或人类主观打分。监督微调训练出来的Qwen模型,存在两个明确的缺陷:24%的希腊语问题,模型没有按要求的格式给出最终答案;3.5%的情况下,答案本该出现在最终回复里,却泄漏进了推理过程的文字里,没有正确分离。这两个问题,单纯靠模仿现成样本很难彻底根除,因为模仿学习从来没见过正确分离答案和推理这件事失败时会发生什么后果。团队设计了一套奖励机制,把这几个可以客观核对的指标直接作为强化学习的奖励信号:答案对不对、思考语言对不对、格式对不对、有没有在规定长度内结束、以及是否服从明确的语言切换指令。整套机制不需要依赖另一个AI模型来打分,因为AI裁判本身可能带有偏见或被投机取巧,而这套规则是完全客观、可审计的。在正式训练之前,团队还专门设计了28种作弊手法来测试这套奖励系统会不会被钻空子,比如让模型只写答案不写推理过程、写一堆流畅但毫无计算内容的废话、故意用代码块把英文内容伪装成合规格式等等。这个测试提前抓出了三个奖励机制本身设计上的漏洞,避免了模型学会投机取巧而不是真正改进。结果如何?在增加了一个随机奖励作为对照组的前提下(这个对照组奖励是完全随机给出的,用来验证效果是不是真的来自学习,而不是碰巧),强化学习把格式合规率从24%降到了2.5%,把答案泄漏率从3.5%降到了0%,而随机奖励对照组这两个数字几乎没有变化,证明这确实是有效学习带来的改善,不是巧合。至于能不能让模型更听话地服从语言切换指令这件事,强化学习让服从比例从44.8%提升到53.9%,提高了9.1个百分点,但没有达到团队预先设定的训练成功标准线,也就是说这个能力确实对奖励有反应,但还没被彻底教会。最让团队意外的是,他们原本担心的一件事没有发生:纯粹追求准确率的强化学习梯度,理论上可能会侵蚀模型好不容易学会的希腊语思考习惯,但实际测试下来,这个希腊语思考的比例在没有专门保护措施的情况下,依然保持在98%以上,几乎没有退化。这就像给一位新员工制定绩效考核,如果只考核完成任务的速度,他很可能会为了赶时间放弃你希望他保持的其他好习惯,比如认真核对细节。团队原本担心强化学习这个速度优先的考核方式,会让模型放弃辛苦养成的希腊语思考习惯,但测试下来这个习惯出乎意料地稳固,并没有被侵蚀。三个模型家族,三种脾气论文里还有一段特别接地气的内容,记录了团队在实际操作三个不同模型家族时踩过的坑,这些细节在正式的模型说明文档里根本查不到。阿里的Qwen模型,它的专家模块是以堆叠参数的形式存储的,导致适配器没办法直接加载回评估工具里,必须先把适配器合并进模型主体才能测试,团队为此白白损失了一整轮评估时间。它的基础版本还有个隐藏的坑:如果生成长度限制设得太短,大部分回答会被硬生生截断,导致准确率骤降到20.8分,而放宽限制后能跳到77.2分,这说明拿这类模型做对比测试时,如果不注意生成长度设置,测出来的根本不是模型能力,而是长度限制本身。OpenAI的Gpt-OSS模型走的是完全不同的路子,它不用常见的思考标签来标记推理过程,而是用专门的通道来区分推理内容和最终回答,如果评分程序是按另一种标记方式设计的,会读错整个内容。更麻烦的是,即使明确告诉它不要深度思考,它依然会在几乎所有情况下打开推理通道,这意味着不能简单地靠有没有出现推理标记来判断它是不是在思考。英伟达的NemotronH是个混合架构模型,它的专家模块是逐个独立存储的,导致适配器数量暴涨到4188个,是Qwen模型的一百多倍,训练速度因此慢了三到七倍。团队还发现三个隐藏的系统设置陷阱,任何一个没调对,轻则拖慢训练,重则导致训练报错或者训练完成后才在推理阶段崩溃,而且没有任何提前警告。这段经历传递出一个朴素但重要的教训:一套代码能在新模型上跑完全程,不代表它跑对了。写在后面读完这篇论文,最让我意外的不是模型学会了用希腊语思考,而是那个随机种子换一下,分数跳了7.7个百分点的发现。这个数字比论文里绝大多数精心设计的实验对比结果都要大,意味着如果没有做这次意外的对照实验,整篇论文很可能建立在一堆噪声之上而不自知。这让我想到一个更普遍的问题:我们平时看到的很多A方法比B方法好的结论,到底有多少是经受住了换个随机种子重跑一次这种最朴素检验的?这篇论文没有回避这个尴尬,反而把它当作核心发现之一写了出来,这种诚实本身,比论文里任何一个准确率数字都更值得记住。另一个让我反复琢磨的细节,是希腊语数字书写习惯和英语相反导致的评分错误。这提醒我,给非英语语言做AI工具的时候,那些看起来无关紧要的约定俗成,比如标点、数字格式、书写方向,恰恰是最容易被忽略、也最容易造成系统性偏差的地方。一个只在英语世界测试过的工具,拿到另一种语言里,可能连最基础的对错判断都会出问题,而且不会有任何警报提醒你。如果一个AI系统连数字的千位分隔符都可能读反,那些更复杂的、我们还没意识到需要检查的文化和语言差异,又藏了多少?QAQ1这篇论文测试的希腊语推理模型,准确率到底提升了没有?A几乎没有提升,最好的微调版本在测试基准上得分76.5,基础模型是77.2,差距在训练本身产生的随机波动范围之内。但准确率不是重点,重点是模型从完全不用希腊语思考,变成了97%以上都用希腊语思考,推理过程从此变得可读可审查。Q2为什么说随机种子换一下,分数能差7.7个百分点是个大问题?A因为这个数字比论文里测试过的所有数据处理方法、训练配方改进带来的效果差异都要大。这意味着如果不做这个种子对照实验,很多看起来有效的改进措施,可能只是随机噪声在起作用,根本不是真实的效果提升。Q3强化学习到底解决了监督微调没解决的什么问题?A主要解决了两个格式类问题,把不按要求格式给答案的比例从24%降到2.5%,把答案错误地泄漏进推理过程的比例从3.5%降到0%。同时它让模型服从用另一种语言思考这种明确指令的比例提高了9.1个百分点,但还没有完全教会这个能力。