北京大学联手快手Kling团队打造“视频字幕图像定位器“
这项由北京大学、快手Kling团队、新加坡国立大学、南京大学、香港科技大学(广州)、香港中文大学、复旦大学、清华大学、上海人工智能实验室、中科院自动化所等多家机构联合开展的研究,以预印本形式于2026年7月30日发布,论文编号为arXiv:2607.28509,有兴趣深入了解的读者可通过该编号查阅完整原文。
你有没有遇到过这样的场景:你手边有一批照片——一个穿红裙子的女孩、一只棕色小狗、一座石桥、一把黄色雨伞——然后有一段视频,里面恰好出现了这些东西。现在有人让你写一段视频描述,要求你在提到"女孩"的时候注明这是第一张照片,提到"小狗"时注明是第五张照片,提到"石桥"时注明是第三张照片,以此类推——而且有几张照片根本没在视频里出现,你还得把它们挑出来忽略掉。
听起来既繁琐又需要极度细心,对吧?但对于做视频内容理解和生成的人工智能来说,这恰恰是一个关键难题。现有的AI可以把视频内容描述得有声有色,却没办法准确地把描述中的每个词语和对应的参考图片挂钩。于是,这支来自多所顶尖高校和工业界实验室的研究团队提出了一个全新的任务框架和对应的模型——**RefCaptioner**,专门来解决这件看似简单、实则相当棘手的事情。
---
一、这件事为什么很难做?
先用一个更贴近生活的比喻来理解这个挑战。假设你是一名博物馆的语音导览员,手边有一叠展品照片,但这些照片没有编号,而且混入了几张根本不在展厅里的图片。现在你需要边带观众参观,边随口说出"您现在看到的这幅画对应我手里的第X号照片,而您左手边的雕塑对应第Y号照片"——还要在恰当的时机忽略那些不属于展厅的照片,绝不能瞎指一通。
这件事大致有三类困难。
第一类困难是"哪张照片有用、哪张没用"。视频里可能只出现了10件东西,但给你准备了22张参考图片,其中一些是"干扰项"(论文里叫"distractor",也就是迷惑性无关图片)。AI必须准确区分哪些照片在视频里确实能找到对应物,哪些根本没出现过。如果一概全用,会凭空捏造不存在的对应关系;如果过于保守不敢用,又会丢失有用的信息。
第二类困难是"这张照片对应描述里的哪个词"。就算AI正确选出了所有有用照片,还得把每张照片贴到描述文字里正确的位置。比如"一位穿红裙子的女孩"对应第一张照片,而"她手里的黄色雨伞"对应第七张照片——这两个词虽然都和女孩有关,但所指的东西完全不同,不能互换。在多人物、多物体的复杂视频里,AI稍不留神就会张冠李戴。
第三类困难是"多张照片说的是同一个东西"。有时候同一个人或同一件物品被从不同角度拍了多张照片,它们应该一起附在描述里同一个词语的后面,而不是被当成不同的东西分散到句子各处。这要求AI能识别出"这三张照片其实说的都是同一个主体",并把它们归在一起。
这三个难题叠在一起,就是为什么以往的AI在这件事上总是出岔子的根本原因。
---
二、RefCaptioner的解题思路:先打基础,再精雕细琢
研究团队把训练RefCaptioner的过程比喻成培养一个新员工:先教他做事的基本规范,再通过反馈机制让他越做越精。整个训练分两个阶段。
第一阶段叫做"混合数据监督微调"。团队准备了两类训练材料:一类是专门制作的"带图片标注的视频描述",也就是在描述文字里正确标注了哪个词对应哪张图片的样本,这些样本都经过人工审核,确保内容准确;另一类是普通的详细视频描述,没有图片标注,主要用来让模型保持描述视频内容的基本能力。两类材料以相同比例混合训练。这样做的好处在于:专门的标注样本教会模型"怎么正确贴图片标签",而普通描述样本则防止模型在这个过程中忘了"怎么好好描述视频"。
这个阶段就像是给新员工发了一本操作手册,告诉他基本规则是什么、格式应该怎么写、大概什么情况下引用哪张图片——但光靠手册还远远不够,因为真实场景远比手册复杂。
第二阶段叫做"层次化覆盖折扣式强化学习",英文缩写是HCD-GRPO。这是整个方法的精华所在,需要多解释一些。
强化学习本质上是一种"奖惩机制":让模型生成多个候选描述,然后根据描述的质量打分,得分高的方向就多往那里走。HCD-GRPO把评分体系设计成了两个相互配合的模块。
第一个模块关注"描述视频内容的质量"。评分时,系统会先把描述里所有的图片标签去掉,得到一段纯文字描述,然后从六个维度来检查它描述得是否准确完整:主体(视频里有什么人或物)、外观(他们穿什么戴什么)、动作(在做什么)、背景(场景是哪里)、镜头运动(摄像机是怎么运动的)以及视觉风格(画面的整体感觉)。每个维度下有具体的考核点,系统会给每个点打0分、0.5分或1分。与此同时,系统还会用一批预先准备好的问答题来检验描述有没有包含错误信息——如果描述里出现了视频里根本没有的内容,就会被扣分。这种"覆盖越多得分越高,但包含错误信息就要折扣"的设计,让模型在追求完整性的同时不敢随意捏造。
第二个模块关注"图片标签使用的质量",包含三个子机制。其一是"正确绑定覆盖率"——只有当一张照片被选用且被贴到了描述里正确的词语后面,它才算作一个有效引用;那些选了却贴错位置的照片,不仅不加分,还相当于白选了,这防止了模型通过乱贴标签来刷高覆盖率。其二是"干扰项感知抑制机制"(DAES)——如果模型引用了一张在视频里根本找不到对应物的干扰图片,就会受到明确惩罚。其三是"跨图片语义一致性机制"(CRSC)——如果有多张照片拍的是同一个主体,模型必须把它们一起贴在同一个词语后面,才能得到满分;一旦把它们分散贴到不同词语上,就会被扣分。
把这两个模块合并起来打分,就是HCD-GRPO的最终奖励信号。如果模型输出了格式错误的图片标签,或者引用了根本不在参考池里的图片,整个得分会被强制压低到一个很小的上限值,防止模型走"技术漏洞"。
---
三、为了测试这套系统,团队专门造了一个考卷——MRVBench
在机器学习领域,一个新任务想要被大家认可,除了有解决方案,还需要有一套公认的测试标准。为此,研究团队构建了一个专门的评测基准,叫做MRVBench。
MRVBench包含462段测试视频,其中185段是AI生成的动画或合成视频,277段是真实拍摄的视频。配套的参考图片池共有3831张,平均每段视频对应大约8张候选图片,最多的情况下单个视频对应多达22张。此外,评测集还包含2172个问答题,用于检验模型是否准确理解了视频内容。大约60%的测试样本包含"多张图片对应同一个主体"的复杂映射情况,约40%的样本(大约185个)混入了干扰项。所有462个测试样本完全独立于训练数据,确保评测的公正性。
评测维度也相当全面。KP-Cov衡量描述文字覆盖了多少人工标注的视频关键信息点;VQA和VQA-Cov分别衡量描述是否支持正确回答视频相关问题以及覆盖了多少问题;Ref-Tag-P和Ref-Tag-R衡量模型选用图片的精准率和召回率;Ref-Bind衡量图片标签是否被贴到了正确的词语后面;Eff-Bind是一个综合指标,同时考察选对图片和贴对位置这两件事;Dist-Rej衡量干扰图片被正确排除的比例;FalseRef-Any衡量有多少测试样本里模型错误引用了至少一张干扰图片;Subj-R和Subj-F1评估多张描述同一主体的图片是否被正确归组。
所有模型的评测都由Gemini-3.1-Pro担任AI裁判,对结构化输出进行评分,确保评价标准的一致性。
---
四、实验结果:RefCaptioner在同类开源模型中拔得头筹
研究团队将RefCaptioner与一批代表性模型进行了横向比较,既有闭源的商业系统(包括Gemini-3.1-Pro和GPT-5.4),也有大量开源模型(包括InternVL3.5系列、Qwen3-VL系列、Qwen3.6系列、MiMo-VL、Keye-VL、ARC-Hunyuan-Video等)。
在MRVBench的综合得分(MRVScore)上,RefCaptioner以0.888分位居所有开源模型之首,与Gemini-3.1-Pro的0.897分仅差0.009分,并明显超过GPT-5.4的0.870分。值得一提的是,RefCaptioner是在8B参数规模的基础模型上训练而来的,而它超越了那些参数规模大得多的模型,比如38B的InternVL3.5、27B的Qwen3.6和32B的Qwen3-VL。
具体到各个子指标,情况更能说明问题。在参考图片的选取准确率(Ref-Tag-P)上,RefCaptioner达到0.994,接近满分;在召回率(Ref-Tag-R)上达到0.943,在所有模型中排名第一,连Gemini-3.1-Pro(0.938)都略低于它。在图片与词语的绑定准确率(Ref-Bind)上达到0.967,仅次于GPT-5.4的0.986但超过了Gemini-3.1-Pro的0.976。在干扰图片排除率(Dist-Rej)上达到0.985,超过了Gemini-3.1-Pro的0.978和GPT-5.4的0.993中的前者。在多图对应同一主体的一致性指标上(Subj-R和Subj-F1),RefCaptioner分别以0.817和0.869超过了Gemini-3.1-Pro(0.799和0.844)和GPT-5.4(0.609和0.718),表现最为突出。
这些数字背后的故事是:RefCaptioner在"选准图片、贴对位置、排除干扰、归组一致"这四件事上达到了一个相当均衡的高水平,而不是某一方面特别突出、另一方面明显短板。
---
五、"事后打补丁"为什么不如"从头学好"
研究团队还做了一个很有说服力的对比实验,专门回答一个直觉上合理的问题:既然现有的大模型已经能很好地描述视频,何不直接让它先生成普通描述,然后再过一遍把图片标签插进去?这种"两步走"的方案省去了专门训练的麻烦,听起来也挺有道理。
为了检验这种方案是否可行,团队让Qwen3-VL-8B、Qwen3-VL-32B、InternVL3.5-8B、InternVL3.5-38B各自先生成一段普通视频描述,再基于原始视频和参考图片对描述进行修订、插入图片标签,最后把修订后的描述拿来评测。
结果表明,两步走方案确实能在第一步积累一定的视频内容覆盖优势——比如Qwen3-VL-32B在这条路上得到了最高的KP-Cov分数(0.911),甚至超过了RefCaptioner的0.882。但一旦看图片标签的使用质量,差距就非常明显了:RefCaptioner在Ref-Tag-R(0.943对0.869)、Ref-Bind(0.967对0.840)、Subj-R(0.817对0.638)和Subj-F1(0.869对0.707)上全面领先于表现最好的两步走方案。
这个结果说明:事后往描述里插图片标签,能把标签"塞进去",却很难让标签"落在正确的位置上",更难让多张描述同一主体的图片被一致地归在同一个词语后面。图片选取和词语绑定需要在生成描述的过程中同步进行,而不是作为后期修订来完成。
---
六、不忘本行:普通视频描述能力没有退步
专门为一项特定任务训练模型,往往会有一个让人担心的代价:模型可能在新任务上表现得好,但在原本就擅长的事情上退步了。就像一个原本全科优秀的学生,为了冲击某一科的满分而荒废了其他科目。
研究团队特别在VDC和VCapsBench这两个专门评测普通视频描述质量的基准上做了测试,结果令人放心。在VDC的五个维度(摄像机动作、短片描述、背景、主要物体、详细描述)上,RefCaptioner在所有开源模型中均排名第一,最显著的提升出现在背景(73.23)、主要物体(73.50)和详细描述(70.11)三个维度,相比基础模型Qwen3-VL-8B-Instruct提升了5到6个百分点。在VCapsBench上,RefCaptioner的回答率(AR)达到66.13,覆盖率(CR)达到76.39,均为同类8B规模开源模型中最高。
这表明,多参考图像的训练不仅没有削弱模型描述视频内容的能力,反而通过更精细的局部绑定训练,让模型对主体、外观、背景等细节的感知更加敏锐。
---
七、参考图片越多越难——RefCaptioner的鲁棒性测试
参考图片的数量越多,任务难度就越高——不仅因为要处理的信息量更大,还因为干扰项更多、主体关系更复杂。研究团队把测试样本按照参考图片数量分为四组:2到4张、5到8张、9到12张、13张以上,分别计算"正确召回率×绑定准确率×干扰排除率"三项相乘得到的综合鲁棒性分数。
在最简单的2到4张组,RefCaptioner得到0.963,而GPT-5.4得0.922,Qwen3.6-35B-A3B得0.879。随着图片数量增加,所有模型的分数都有所下降,但RefCaptioner下降得最慢。在最难的13张以上组,RefCaptioner仍有0.769,GPT-5.4降到0.703,而Qwen3.6-35B-A3B则大幅滑落到0.398——几乎只有RefCaptioner的一半。
这说明RefCaptioner面对复杂多参考场景时,能够保持相当稳定的性能,而其他模型在参考图片数量上升后会出现较为明显的质量下降。
---
八、当AI生成的描述被用来重建视频,效果如何?
研究的最后一个维度评估了一个很实际的应用场景:把AI生成的带图片引用的描述,直接拿去驱动视频生成模型,看生成的视频和原始视频有多像。这相当于用"语言+图片"来重建视频,考察的是描述的实际可用性。
研究团队分别使用了Wan 2.1 VACE和Seedance 2.0两款视频生成工具进行重建实验,控制生成参数完全相同,唯一的变量是每个模型自己生成的描述文字和它所引用的参考图片子集。三位受过训练的评价者对重建结果进行盲测,用"好/相当/差"三档来评价RefCaptioner的重建效果相比其他模型是否更接近原始视频。
结果是:与Qwen3.6-35B-A3B相比,76%的评价者认为RefCaptioner的重建更好,仅14%认为更差;与InternVL3.5-38B相比,64%认为RefCaptioner更好;与Qwen3.6-27B相比,60%认为RefCaptioner更好。即便与商业闭源系统相比,RefCaptioner在对抗Gemini-3.1-Pro时有26%的评价者认为它更好,在对抗GPT-5.4时有30%认为它更好——考虑到这两个都是商业顶尖系统,而RefCaptioner是在8B参数的开源基础上训练的,这个结果相当有分量。
---
九、消融实验:每个设计决策都有其不可替代的作用
为了验证每一个训练组件是否真的必要,研究团队做了系统性的消融实验——也就是每次去掉一个模块,看性能有什么变化。
从基础模型直接做第一阶段的监督微调,相比不做微调的原始模型,主体一致性召回率(Subj-R)从0.471大幅提升到0.702,但视频问答准确率(VQA)从0.670略降到0.642。这说明第一阶段训练确实大幅改善了图片引用能力,但略微削弱了普通视频理解能力。
加入第二阶段的HCD-GRPO后,全部三个核心指标都到达最优:VQA恢复并超越到0.686,干扰排除率Dist-Rej升到0.985,主体召回率Subj-R升到0.817。然后逐一去掉三个奖励子模块:去掉事实描述奖励,VQA降幅最大,降到0.642;去掉干扰抑制机制DAES,Dist-Rej下降最明显,降到0.914;去掉跨图片一致性机制CRSC,Subj-R有所下降,降到0.778。三个子模块各有侧重,缺少任何一个都会在对应维度出现明显缺口,证明它们各司其职、缺一不可。
---
十、人类评价:专业标注者用排名投票给出了答案
除了自动化指标,研究团队还邀请了三位具有相关专业背景的研究生作为人类评价者,从MRVBench中随机抽取40段视频(20段AI生成,20段真实拍摄),让评价者在看完视频和参考图片后,对来自GPT-5.4、Gemini-3.1-Pro、Qwen3.6-35B-A3B、Qwen3-VL-8B-Instruct和RefCaptioner这五个模型的描述进行盲测排名,同时评判每个模型的图片绑定是否正确。
在偏好排名上(1分最好,5分最差),RefCaptioner获得了1.75的平均排名,是所有五个模型中最低(即最受偏好)的,明显优于Qwen3.6-35B-A3B(2.48)和Qwen3-VL-8B-Instruct(4.10),也超过了Gemini-3.1-Pro(2.02)和GPT-5.4(4.65)。
在图片绑定正确率上,RefCaptioner达到0.99,与Gemini-3.1-Pro和GPT-5.4的1.00接近,但明显高于Qwen3.6-35B-A3B(0.96)和Qwen3-VL-8B-Instruct(0.93)。
一个有趣的现象是:五个模型的绑定准确率都相当高(都在0.93以上),但偏好排名却差异悬殊。这说明仅仅"图片标签插得准确"还不够,描述本身的表达结构和内容组织方式同样深刻影响着人们的阅读体验。研究团队解释说,他们刻意将训练描述组织成六个维度(主体、外观、动作、背景、视觉风格、镜头运动),引导模型以符合人类阅读习惯的方式展开描述,这让RefCaptioner的输出更接近人类在描述视频时自然使用的表达逻辑。
---
归根结底,这项研究解决的是一个听起来很具体、但实际上非常基础的问题:AI在描述一段视频时,能不能同时指出"我说的这个东西对应你手里的哪张图片"。现有的模型虽然能把视频讲得头头是道,却很难精准地把话语和图片对上号,尤其是在图片数量多、存在干扰项、同一主体有多个参考图的情况下。
RefCaptioner通过两阶段训练的组合拳——先用混合数据打好基础格式,再用设计精巧的多维奖励机制精雕细琢——在同等规模的开源模型中达到了目前最好的水平,甚至在部分关键指标上超过了那些体量大得多的商业模型。更重要的是,这种能力的获得没有以牺牲普通视频描述质量为代价,模型在原本就擅长的事情上反而做得更好了。
对于关心视频内容理解、视频编辑、视频生成的研究者和从业者来说,这项工作提供了一个可以直接参考和复用的技术路径。评测基准MRVBench也已经公开,为这个新兴方向的后续研究提供了一把公认的量尺。
---
Q&A
Q1:RefCaptioner和普通视频描述模型的主要区别是什么?
A:普通视频描述模型只能生成文字描述,不会明确指出描述里的某个词对应哪张参考图片。RefCaptioner的核心能力在于,它能在生成描述时同时在每个词语后面贴上对应的图片标签,还能识别哪些图片是干扰项而不予引用,以及把描述同一主体的多张图片归并到同一个位置标注,是一种带"图片定位"功能的视频描述模型。
Q2:MRVBench评测基准会对外公开吗?
A:根据论文说明,研究团队计划公开MRVBench的测试集及其评测标注,供学术研究使用,但数据的发布范围取决于各数据来源的许可协议。训练语料库因涉及多来源版权问题不会公开,但测试集会在符合数据授权的前提下对外发布,供其他研究者用来评测自己的模型。
Q3:HCD-GRPO中的三个奖励模块分别起什么作用?
A:三个模块各管一个方向:事实描述奖励负责保证描述文字本身的准确性和完整性,防止模型捏造视频里没有的内容;干扰项感知抑制机制(DAES)专门惩罚引用了视频里根本不存在对应物的图片这一行为;跨图片语义一致性机制(CRSC)则专门针对"多张照片描述同一个主体"的情况,要求模型把它们统一贴在同一个词语后面。三者分工明确,缺少任何一个都会在对应维度出现显著的性能下滑。