ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

韩语AI能力体检报告:一场关于“到底哪里出了问题“的侦探游戏

2026/8/14 22:29:33 拓冰建站 浏览量
韩语AI能力体检报告:一场关于“到底哪里出了问题“的侦探游戏 你有没有想过这样一个问题如果一个AI模型用中文回答问题时表现变差了到底是因为它中文不好还是因为你问的问题本身对中文使用者来说就更难这听起来像个哲学问题但对做多语言AI评测的人来说,这是个每天都要面对的技术难题。2026年,一群韩国研究者遇到了同样的困境,只不过主角换成了韩语。他们发现,几乎所有现有的评测方法都在犯同一个错误把模型在韩语上表现差这一个笼统的结论,当成了最终答案。这就好比你去医院体检,报告只写了一句你身体不太好,却不告诉你是心脏问题、肝脏问题还是单纯的营养不良。这份报告除了让你焦虑,没有任何实际用处。研究者们想要的是一份精确到器官的体检报告模型在韩语上到底哪个环节掉了链子。于是,一个叫NOLLI的评测基准诞生了。为什么这件事这么难做先说说这个问题到底难在哪里。多语言AI评测有个老大难问题,叫做数据污染。 数据污染指测试用的题目在模型训练时就已经被看过了,导致模型不是在推理,而是在背答案,测出来的分数虚高且不可靠。像GSM8K和MATH这样的经典数学推理测试集,用久了之后都面临这个问题,因为它们是静态的,题目就那么些,模型公司迟早会在训练数据里偶遇这些题目。另一个更隐蔽的问题是,当你做英语和韩语的对比测试时,两边的题目往往根本不是一回事。你可能翻译了一道题,但翻译过程中难度已经悄悄变了,又或者你选的韩语特有题目本身就比英语题目更烧脑。这时候测出来的差距,到底是语言本身的问题,还是题目难度不匹配造成的假象?没人说得清。研究者面对这两个问题,想出的解法是既然要避免背答案,那就让题目自动生成,每次都是新的;既然要避免难度不可比,那就用同一套生成规则同时产出英语和韩语版本,再用一个参考模型的实际答题表现来校准难度,而不是靠人的主观判断。这个思路听起来简单,但落地起来极其麻烦,因为不同类型的题目难度根本不在一个尺度上。什么是简单的数独和什么是简单的密码破译,压根没法直接比较。这也是NOLLI这篇论文真正要解决的核心矛盾。NOLLI是什么:一场三层楼的语言实验NOLLI的全称直译过来就是逻辑的韩语发音,它是一个包含15种谜题类型、25个任务、总共7500道题目的评测基准。 NOLLI一个韩英双语的程序化生成谜题评测基准,专门用来诊断AI模型在韩语上表现变差的具体原因。它最巧妙的设计,是把所有任务按照韩语特殊程度分成了三层楼。第一层楼叫直接翻译。这一层的题目,比如数独、SAT逻辑谜题、找地雷,英文版和韩文版用的是完全相同的生成算法和参数,只是把题干文字换成对应语言。这就像同一份考卷,一份印成中文一份印成英文,考的知识点、难度、题量完全一致,唯一变量就是你用哪种语言读题。这一层的存在,就是为了纯粹地测试语言表达方式本身对模型答题的影响,把其他变量全部锁死。第二层楼叫文字系统改编。这一层包括密码破译和填字算术两种任务,它们在英语里操作的是罗马字母,但在韩语里,操作对象换成了谚文的字母。 谚文字母(jamo)韩语书写系统的最小构成单位,每个韩文方块字都是由一个初声辅音、一个中声元音,以及可选的一个终声辅音拼合而成,类似汉字的偏旁部首,但更规整、有固定拼合规则。举个例子,?这个字看起来是一个方块,但拆开来其实是初声?、中声?、终声?三个部件拼在一起的。这一层的题目,英语版和韩语版故意设计成不对等的,因为它们要测试的不是翻译准不准,而是模型处理这种特殊书写结构的能力强不强。第三层楼叫纯韩语任务。这五种任务在英语里根本找不到对应版本,因为它们扎根于韩国特有的文化系统或者文字本身的构造逻辑。论文里举了一个特别精彩的例子:韩语亲属称谓系统里有一个词叫????,翻译成英文得写成一长串外祖父的弟弟的妻子,英语里压根没有这么一个单独的词能对应。这就像你问一个外国人堂哥和表哥有什么区别,他可能完全无法理解,因为他们的语言里这两个词是同一个,而中文文化对父系母系、年龄大小的区分极其精细。这种差异不是翻译能力问题,是两种文化对关系的编码方式根本不同。如果不设计这三层楼结构会怎样?你只能笼统地说模型韩语差12个百分点,却完全不知道这12个点里,有几个点是因为语言表达本身,几个点是因为文字系统的特殊操作,几个点又是因为纯粹的文化知识缺失。三层楼结构,本质上是把一个模糊的诊断,拆解成了三个可以分别定位病灶的检查项目。难度不是你说了算,是模型说了算传统的做法是,研究者自己定义简单和困难,比如网格越大就越难、变量越多就越难。这篇论文认为这种做法本身就是个陷阱。 行为校准(Behavioral Calibration)不用生成器的结构参数比如格子大小来定义题目难度,而是先让一个固定的参考模型实际去做题,根据它的答题准确率把题目分成简单、中等、困难三档,再反过来调整生成器的参数,直到每一档的准确率都落在事先设定好的区间里。具体来说,研究团队选了Gemini 3 Flash这个模型作为标尺,设定简单档的目标准确率是75%上下10个百分点,中等档是50%上下10个百分点,困难档是25%上下10个百分点。然后针对每种题型,他们不停调整生成参数,直到这个标尺模型答题的准确率真的落进了对应的区间。这套流程听起来有点像给学生分班考试出题。你不能凭感觉说这套卷子应该是简单卷,你得先找一批具有代表性的学生来试做,如果及格率太高说明题目太简单需要加难度,如果全班都不及格说明题目太难需要减难度,反复调整直到及格率落在你想要的区间里。如果不这么做会怎样?论文里给出了一个特别扎心的反例整个基准里有15种题型,其中7种题型,如果你光看网格大小或者字符长度这类表面的结构参数,你会发现从简单档到困难档,这个参数根本没有变大,甚至有的还变小了。比如亲属关系这个任务,推理链条的长度(需要绕几层关系才能推出答案)从简单档的4到5步,反而缩短成了困难档的2到3步。但困难档的准确率却从77%暴跌到31%。真正让题目变难的,是干扰对话从15句暴增到112句,还有更多容易混淆的近亲称谓——比如??(大伯)和??(叔叔)这种发音结构相似、含义却不同的词。再比如密码破译任务的英文版,困难档的答案长度只有6到10个字符,反而比简单档的20到24个字符更短,可参考模型的准确率却暴跌了52个百分点。原因是困难档在维吉尼亚密码之上,又叠加了一层位置换位操作,复杂度是叠加式增长,不是线性增长的字符数能衡量的。这个发现挺打脸的。如果你只用字数网格大小这类看得见摸得着的指标来定义AI测试的难度,你可能完全测错了方向,因为AI真正觉得难的地方,往往藏在你看不见的约束密度、干扰信息量,或者需要执行的步骤深度里。15个模型的体检结果:语言本身几乎不是问题研究团队找来了15个模型做体检,分成三组GPT-5.5、Claude Opus 4.8、Gemini 3.1这三个尖子生属于前沿商业模型组;Qwen3.5系列、Gemma、gpt-oss、DeepSeek-V4-Flash、Llama系列属于国际开源模型组;EXAONE系列、Solar、Mi:dm属于韩国本土开发模型组。结果里最让人意外的一条结论是presentation-language(表现语言本身)造成的成绩差距小得几乎可以忽略。具体来说,在直接翻译这一层的8种题型上,12个有效模型的英韩准确率差距,范围是负2.7个百分点到正5.0个百分点。用统计学上的等效性检验(TOST)去验证,这个差距在正负10个百分点的误差范围内,统计上算是相等的。翻成人话就是:如果你的模型能正常处理这套基准里的通用逻辑题,那么单纯把题目从英语换成韩语,几乎不会拖累它的表现。这个发现有点反直觉。很多人的默认预期是,韩语作为一种资源相对少、语法结构和英语差异很大的语言,模型处理起来天然会吃亏。但数据显示,只要题目本质是逻辑推理(比如数独、找地雷、SAT逻辑谜题),语言外壳几乎不影响模型的真实能力发挥。但故事到这里还没完,因为一旦涉及到韩语独特的书写结构,情况就完全变了。密码破译暴跌68.7个百分点:问题出在哪论文里最戏剧性的一组对比,发生在密码破译和填字算术这两个任务之间。它们表面上看起来很像,都是在韩语的谚文字母(jamo)层面操作,但底层逻辑天差地别。填字算术要求模型把每个谚文字母当成一个不透明的符号塞进一个双射映射表里,类似解一道代数方程,你不需要理解这个字母长什么样,只需要把它当变量对待。密码破译则完全不同,模型必须先把一个完整的韩文方块字拆解成初声、中声、终声三个部件,对这些部件做索引运算,最后再把结果重新拼装回一个完整的方块字。这是一个拆开-计算-拼回去的完整流程,每一步都可能出错。数据显示,填字算术任务上,12个有效模型里有6个在韩语上的表现反而比英语更好,包括全部三个前沿模型。只有3个模型出现了明显的韩语劣势,而且都集中在33个百分点左右,这说明把jamo当不透明符号处理这件事,对大部分模型来说不算太难。但密码破译任务彻底崩盘了。几乎所有非前沿模型,只要在英语上有非零的准确率,到了韩语版本至少掉21个百分点。有四个模型(Qwen3.5-27B、EXAONE-4.0、Solar-100B、gpt-oss-120b)的英语准确率在21%到56%之间,到了韩语直接跌到1%以下,几乎是团灭。DeepSeek-V4-Flash的落差最夸张,英语74.3%对韩语5.7%,差了整整68.7个百分点。就连表现最好的前沿模型,也只有GPT-5.5勉强把这个差距拉平到正1.7个百分点。这背后的原因,研究者用另一个任务做了交叉验证。他们发现谚文合成(Jamo Composition)——一个专门测试拆解和重组韩文字母能力的纯韩语任务——的准确率,能高精度预测模型在密码破译上的表现,决定系数R?高达0.91。这意味着,一个模型如果在拆字重组这个基本功上练得扎实,它在更复杂的密码破译任务上大概率也能过关;反之,如果拆字这一步本身就摇摇欲坠,后面的多步骤操作只会把错误越滚越大。这就像搭积木。填字算术相当于给你一堆已经贴好标签的积木块,你只需要按标签对号入座;而密码破译相当于先把一整块积木拆散成零件,记住每个零件原来的位置,做完计算之后再原样拼回去。如果你连拆散再拼回去这个动作都做不利索,那不管中间的计算逻辑多简单,最后交出来的成品一定是歪的。这也是为什么论文反复强调:多步骤的字母级操作能力很可能才是韩语表现下滑的关键瓶颈,而不是韩语这门语言本身有什么诅咒。韩国本土模型的意外表现体检结果里还有一个值得单独拎出来说的现象:韩国本土开发的模型,并没有像大家预期的那样,在韩语任务上占据主场优势。EXAONE-4.0的25分制综合得分是25.1%,Solar-100B是14.1%,这两个成绩甚至不如同等规模的国际开源模型,比如Qwen3.5-27B拿到了44.4%。更极端的是,EXAONE-3.5和Mi:dm-2.0的总分都跌破了3%,基本可以归为地板模型,测出来的数据参考意义有限。这个结果推翻了一个直觉:本土开发的模型应该更懂本土语言。但训练数据的质量、模型规模、架构设计这些因素,显然比是不是本国团队做的更能决定最终表现。这也提醒我们,判断一个AI模型懂不懂某种语言,不能靠标签,得靠实测。亲属称谓:一个永远追不上的差距论文里还专门拎出了亲属关系这个任务做深入分析,因为它展现出一种和其他任务完全不同的规律。研究者把韩语特有的五种任务分成两类。第一类是规则应用型,包括四柱推算(传统的干支历法计算)、时间推算(涉及干支纪日的日期计算)、韩国传统单位换算,这些任务的特点是,只要你掌握了规则,严格执行下去就能得出答案。第二类是文化词库型,目前只有亲属关系这一个代表,它要求模型把一串关系链条(比如我的妈妈的爸爸的弟弟的妻子)映射成一个韩语里约定俗成的专有称谓,而这个称谓的含义在题目里根本没有给出解释,模型必须自己知道。规则应用型任务的表现有正有负,没有固定方向。比如GPT-5.5在这类任务上反而比它自己在直接翻译任务上的基线表现更好,领先11.6个百分点;但同一系列的Qwen3.5,不管是9B、27B还是397B这三个规模档位,全部呈现正向的劣势,分别落后14.5、15.6、13.3个百分点。这说明规则记不记得住、用不用得对,跟模型整体实力关系不算特别紧密。但亲属关系任务完全不同。12个有效模型里,全部12个都表现出正向的劣势,也就是说没有一个模型能在亲属关系任务上追平自己的韩语基线表现。更诡异的是,这个劣势和模型整体的综合实力几乎没有相关性(相关系数只有0.16),意味着模型越强,并不代表它越能补上这个知识窟窿。前沿模型组内部的排名甚至因此发生了倒挂。按综合实力,GPT-5.5是三个前沿模型里最强的,但在亲属关系任务上,它的表现反而是最差的,只有45.7%,落后基线整整36.7个百分点;而综合实力排名最低的Gemini 3.1,在亲属关系任务上反而做到了69.0%,几乎追平了自己的基线,只差4.7个百分点。这个现象挺有意思。它说明,像逻辑推理能力这种通用智力,和某个特定文化系统里的词汇知识完全是两条不同的赛道。你可以在一条赛道上遥遥领先,却在另一条赛道上原地踏步,而且这种踏步不会随着你变得更聪明而自动改善。这就好比一个数学天才,推导公式的能力天下无敌,但你问他姑父的父亲该怎么称呼,他照样可能一脸茫然,因为这不是逻辑问题,是记忆和文化浸润的问题。密码破译到底是怎么错的:错误分析里的细节论文里还做了一个非常细致的错误分析,专门解剖密码破译任务到底错在哪一步。研究者收集了11个有效模型在韩语密码破译任务上答错的2119道题目(排除了Llama-4-Maverick,因为它连英语版都只有0.7%的准确率,没有分析价值),把模型给出的错误答案和标准答案都拆解成谚文字母流,用编辑距离算法计算两者的相似度。 编辑距离(Levenshtein距离)衡量两个字符串之间差异程度的经典算法,计算把一个字符串变成另一个字符串最少需要多少次插入、删除或替换操作,数值越小说明两个字符串越相似。作为参照基准,研究者发现两段完全无关的正确答案之间,相似度大约是0.16(因为韩语字母本身的出现频率不均衡);而把密文和明文直接对比,相似度只有0.07,说明模型直接抄密文当答案的情况极少,发生率不到1%。真正有意思的发现是:那些谚文合成任务表现好的模型,即便最终密码破译答案是错的,它们拆出来的字母流跟标准答案的相似度依然很高。比如GPT-5.5能达到0.85,Qwen3.5-397B能达到0.89。而那些谚文合成表现差的模型,比如Solar-100B、EXAONE-4.0、gpt-oss-120b、Qwen3.5-27B,它们的相似度只有0.11到0.21,基本等同于瞎猜的水平。这个相似度和谚文合成准确率之间的相关系数达到0.75,统计上非常显著。唯一的例外是Qwen3.5-9B,它的谚文合成准确率只有12.3%,但密码破译错误答案的相似度却高达0.90,是个反常的孤例。研究者还额外做了两个排除测试,想确认这不是简单的错位或者偏移造成的假象。他们试着把一段本来正确的字母流重新按不同方式切分,或者对整个字母流做一个固定数值的偏移,结果这两种操作产生的匹配率都是0%。这说明,那些模型的失败不是差一点点就对了的低级失误,而是从更早的环节就已经出了系统性的偏差。这组分析很扎实地支撑了前面的结论:一个模型在字母拆解重组这件基本功上练得好不好,直接决定了它在更复杂的密码任务上是虽败犹荣还是一败涂地。写在后面读完这篇论文,最触动我的其实不是那些具体的百分比数字,而是它对评测这件事本身的态度。大部分AI评测论文关心的是哪个模型更强,但NOLLI关心的是强在哪、弱在哪、为什么。这种诊断式思维,其实更接近医学检查而不是竞赛排名,它承认一个笼统的分数背后,可能藏着完全不同的病因。亲属关系任务那组数据尤其让我印象深刻。综合实力最强的GPT-5.5,在这项任务上反而是三个前沿模型里最差的,而综合实力最弱的Gemini 3.1却几乎追平了自己的基线。这说明更聪明和更懂某种文化根本是两码事,一个模型可以在逻辑推理上碾压所有对手,却在姑父怎么称呼这种问题上跟一个五岁小孩差不多。密码破译崩盘那部分也值得反复琢磨。研究者没有停留在韩语差68.7个百分点这个表面结论上,而是硬生生找到了一个能预测这个差距的另一个变量,谚文合成能力,决定系数高达0.91。这种用一个变量解释另一个变量的手法,把一个模糊的语言问题,变成了一个可以被拆解、被验证、甚至可能被针对性修复的具体机制。如果这个思路能推广到更多语言、更多文化背景的评测里,我们对AI多语言能力的理解,可能会从一个笼统的分数,变成一张真正精细的能力地图。那么下一个问题是,类似韩语亲属称谓这样的文化词库型知识缺口,到底该靠更多训练数据填补,还是需要一种完全不同的架构设计才能真正解决?QAQ1NOLLI是什么?ANOLLI是一个韩英双语的程序化生成谜题评测基准,包含15种谜题类型、25个任务共7500道题目,专门用来精确诊断AI模型在韩语上表现变差的具体原因,而不是只给出一个笼统的分数差距。Q2为什么韩语密码破译任务的表现会暴跌68.7个百分点?A因为密码破译需要把韩文方块字拆解成初声、中声、终声三个字母部件,做完索引运算后再重新拼装回去,这是一个多步骤的拆解重组过程。研究发现,模型在谚文合成这项基本功上的表现,能高精度预测它在密码破译上的成绩,说明问题出在字母级别的多步骤操作能力上,而不是语言本身。Q3韩国本土开发的AI模型在韩语任务上表现更好吗?A并没有。数据显示EXAONE-4.0和Solar-100B等韩国本土模型的综合得分反而不如同等规模的国际开源模型比如Qwen3.5-27B,这说明本国团队开发并不等于更懂本国语言,模型的训练数据质量和架构设计才是决定表现的关键因素。