ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

当AI说“这张图里有只猫“时,它到底说对了多少,又漏掉了多少

2026/8/20 4:34:33 拓冰建站 浏览量
当AI说“这张图里有只猫“时,它到底说对了多少,又漏掉了多少 你有没有想过这样一个问题如果让十个不同的AI给同一张照片写说明文字你怎么判断哪个写得好大部分人的第一反应是写得越详细越好呗。但事情没那么简单。有的AI会写出一大段话恨不得把图里能看到的每一根睫毛都描述出来可惜错误百出把蓝色说成绿色把左边说成右边。也有的AI惜字如金,写出来的句子每一个字都对,但只描述了图片里十分之一的内容。这两种说明文字到底哪个更有用这个问题不是抽象的学术争论。图片说明文字也就是caption图像描述文本是训练几乎所有多模态AI的核心燃料。你现在用的能看图说话的AI助手还有能根据文字画图的生成模型背后都是靠海量的图片文字描述数据喂出来的。如果这些描述文字本身质量参差不齐那训练出来的AI能力上限也就被锁死了。来自中国科学院大学和中科院自动化所的研究团队做了一件挺较真的事情他们把图片说明文字写得好不好这个模糊的问题拆解成了两个可以精确测量的维度,然后去验证这两个维度到底分别对哪种下游AI任务更重要。这项工作叫CAPEval。一个被长期混淆的问题全面和准确从来不是一回事我们先从一个具体的例子开始。假设有一张游乐园的照片里面有紫色的过山车轨道、人造棕榈树、一个装满白色泡沫的游泳池还有背景里的城市天际线。现在有两段描述文字第一段写了五百个字几乎把画面里能看到的所有元素都点到了但里面有一处把紫色的过山车轨道说成了粉色。第二段只写了一百个字只描述了游泳池和棕榈树但每一句话都准确无误。传统的图片说明评估方法比如老牌的BLEU、METEOR、CIDEr这些指标会把这两段文字压缩成一个单一的分数,然后告诉你哪个更好。但这个单一分数背后,其实混杂了两种完全不同的东西一个是这段话覆盖了多少真实信息覆盖度一个是这段话里说的东西有多少是对的准确度。这就好比你让两个学生写读后感一个学生洋洋洒洒写了五页纸把书里的情节都提了一遍但记错了好几个人名和事件顺序;另一个学生只写了半页,但每个细节都精准无误。如果老师只给一个综合分,你根本不知道该表扬谁的哪种能力。如果不把这两种能力分开打分你既没法告诉第一个学生你的问题出在准确性上也没法告诉第二个学生你该多写点。CAPEval做的第一件事就是把这两种能力从一个混沌的总分里拆出来变成两个独立的、可以分别测量的指标。**覆盖度Coverage衡量的是描述文字触及了多少真实存在的信息准确度Precision衡量的是这些被提到的信息里有多少是真的对。**这两个概念听起来简单但真正难的是怎么把它们量化。怎么给一张图片打分先造一份标准答案再拆成50道判断题要衡量覆盖度和准确度你得先有一个客观的参照系,不能靠感觉。CAPEval的做法是,先请专业标注员为每张图片写一段极其详尽的人工描述,当作标准答案Ground Truth简称GT。 Ground-Truth CaptionGT caption由人工标注员撰写的、被当作参照标准的图片描述文字用来对比其他AI生成的描述是否准确全面。这份标准答案有多详细?论文里给出的示例平均长度达到346个单词,最长的一份能有545个单词。标注员被要求覆盖五个方面画面里的主体和场景关系、图中出现的所有文字内容原样照抄不做翻译、摄影美学层面的属性比如色调和光线、如果有人物则描述其外貌姿态还有一些特殊的图像属性比如是否有水印或者是拼接图。而且标注要求极其严格只能写客观可见的内容不能猜测不能重复描述同一个东西两次。写完之后这份长篇描述还要经过第二个标注员的审核才能定稿。但光有一段长文字标准答案还不够,因为你没法直接拿一段AI生成的文字和一段人工标准答案做逐字对比来打分,两段话措辞不同,顺序不同,根本没法机器判断。于是CAPEval做了第二步把这段长文字标准答案拆解成一份份原子化的检查清单。 原子化检查清单Atomic Checklist把一段完整的图片描述拆解成一条条只包含单一事实、可以用是/否回答的判断题。比如图中是否提到了紫色的过山车轨道过山车轨道是否被描述为紫色这类问题分开列出。还是拿游乐园那张照片举例标注员会把那五百字的描述拆解成是否提到了紫色过山车轨道、轨道是否被描述为弯曲向上、左侧的大棕榈树是否被描述为遮挡了视线这样一条条独立的判断题。论文里公布的完整示例里,这一张图片被拆出了56道判断题,涵盖了从物体识别到空间关系的方方面面。平均下来每张图片能拆出大约50条这样的判断题覆盖了物体实例、属性、关系、图像整体信息、文字、人物、界面元素、世界知识这八个语义维度。这个设计的巧妙之处在于它把一个模糊的这段话写得好不好的问题,转化成了一堆具体的、可以机器批量判断的是/否小问题。这就好比考试改卷与其让老师凭感觉打一个这篇作文写得不错的模糊分数不如把作文拆成是否点明了主题、是否有具体例证、是否有语法错误这样一条条评分细则每一条都能客观核对。如果不拆解成这么细的原子问题评判标准就只能靠打分者的主观感受不同的人打出来的分数根本没法比较也没法告诉AI具体是哪里错了。有了这份检查清单之后接下来的打分过程就变得机械化了。研究团队用一个叫Qwen2.5-72B的大语言模型当裁判让它只根据候选AI生成的描述文字逐条判断检查清单里的每一项是提到且正确、提到但错误还是完全没提到。 Qwen2.5-72B阿里巴巴开发的一个拥有720亿参数的大语言模型在CAPEval中被用作自动裁判负责判断候选描述文字是否正确覆盖了检查清单里的每一条事实。基于这三种判断结果覆盖度和准确度这两个分数就可以用简单的公式算出来了。覆盖度等于提到且正确的条目数加上提到但错误的条目数除以检查清单总条目数衡量的是这段描述文字敢不敢提这些事实。准确度等于提到且正确的条目数除以提到且正确加上提到但错误的条目数衡量的是提到的东西里有多少是真的对。300张图片14965条检查项这份基准数据集有多扎实光有方法论还不够评测的图片本身质量也很关键。研究团队精心挑选了300张图片覆盖四大类场景日常场景与物体、人物与活动、文字与界面、设计与知识类图片。这些图片来源广泛分辨率跨度极大最高能达到8000乘以6618像素比很多同类基准测试用的图片清晰度高出一大截。为什么图片分辨率这么重要?因为分辨率越高,图片里能承载的细节就越多,也就越能考验AI描述文字的精细程度。一张模糊的照片,你怎么写都容易蒙对;但一张8K分辨率的照片,里面藏着的每一处细节都可能成为AI说错话的陷阱。整个数据集累计标注了14965条检查项平均每张图片49.88条覆盖率达到100%的维度包括物体实例、属性、关系和整体图像信息这四类是每张图片都会涉及的基础维度。而文字、人物、界面、世界知识这四个维度则根据图片内容按需出现比如只有出现了人物的图片才会有人物相关的检查项。跟同类型的基准测试比起来CAPEval的密度优势非常明显。论文里给出的对比数据显示此前的基准测试比如NoCaps、Flickr30K标准答案平均只有16到18个单词检查清单条目更是少到只有1到3条。而CAPEval的标准答案平均346个单词检查清单平均50条几乎是此前工作的十几倍到几十倍。这个密度差距意味着什么?就像用放大镜和用肉眼去检查同一件产品的瑕疵,肉眼能发现的问题可能就那么几个明显的,但放大镜下会暴露出更多细微的缺陷。检查清单越密集越能精确捕捉AI描述文字里那些细枝末节的错漏而不是只看个大概齐。十个AI记者上场谁写得又全又准有了打分工具接下来就该请AI来实战考试了。研究团队挑选了来自四个模型家族的十个开源图片描述模型包括InternVL3.5系列1B、4B、8B、38B四种规模、Qwen3-VL系列4B、8B、32B、LLaVA-OneVision-1.5系列4B、8B还有GLM-4.6V-Flash另外还拿了几个闭源的顶尖模型比如Gemini和GPT-5.5做参照对比。结果非常有意思。闭源的顶尖模型确实两项指标都表现不错比如Gemini-3.1-Pro的覆盖度达到80.2分准确度更是高达82.5分,两头都硬。但在开源模型阵营里,覆盖度的分数从41.2一路跨越到68.5准确度的分数从45.1跨越到86.1跨度都相当大。更关键的发现是覆盖度和准确度这两个指标之间压根没有一种分数越高就越同步的正相关关系。有的模型走的是广撒网路线比如InternVL3.5-1B覆盖度能到48.3但准确度只有65.2说明它敢说很多东西但说错的概率也不低。而InternVL3.5-4B和8B这两个模型走的是相反的路线覆盖度只有45.0和46.5但准确度分别达到73.5和72.6说话谨慎但说出来的基本靠谱。这就好比两种记者写新闻报道一种记者敢写敢猜报道信息量很大但经常出错需要更正;另一种记者惜字如金,每篇报道字字有据,但读者总觉得信息量不够。如果杂志社不区分这两种能力单独考核,只看稿子写得好不好这个笼统评价,那这两位记者永远没法各自扬长避短。真正的悬念这些性格不同的说明文字喂给下游AI训练之后会怎样前面说的都还只是给图片说明文字本身打分属于纸上谈兵。研究团队真正的野心在于他们想搞清楚这些覆盖度高但准确度低或者准确度高但覆盖度低的说明文字拿去训练AI模型之后到底哪种更管用。这一步是整篇论文里我认为最扎实的地方因为他们做的是一个真正的端到端对照实验。什么意思?就是把图片描述文字当成唯一的变量,其他所有条件——用的图片、模型架构、训练步数、优化器设置——全部锁死不变只换掉训练用的说明文字来源。这样一来如果下游AI的表现出现了差异那这个差异就只能归因于说明文字本身的质量差异而不是别的什么干扰因素。 端到端评测End-to-End Evaluation不只是孤立地给AI生成的描述文字打分而是把这些文字实际用于训练下游模型通过下游模型的最终表现来反推描述文字的真实价值。这个思路听起来朴素,但此前的行业惯例其实并不是这么做的。此前大多数评测基准比如DOCCI和DetailCaps都只是把生成的描述文字当作孤立的输出去打分从没有真正测试过这些描述文字拿去训练模型之后效果如何。这就好比你去评价一种食材的好坏只闻了闻味道就下结论却从来没有真正把它做成菜端上桌尝过。CAPEval搭建了两条理解类任务的训练流水线和两条生成类任务的训练流水线。理解类任务也就是让AI看图回答问题的视觉语言模型VLM用了两种不同的视觉编码器和语言模型组合一种是CLIP配Vicuna-7B另一种是SigLIP配Qwen3-4B。 视觉语言模型VLMVision-Language Model能同时处理图片和文字的AI模型典型能力是看图回答问题、描述图片内容。生成类任务也就是根据文字生成图片的文生图模型T2I用了Stable Diffusion 3.5 Medium和Qwen-Image两种主流的扩散模型架构进行微调。 文生图模型T2IText-to-Image根据输入的文字描述生成对应图片内容的AI模型。整个训练过程分为两个阶段。第一阶段是视觉语言对齐阶段两条理解类流水线都用同样一批558K的固定描述文字数据这一步不引入任何变量。真正的变量出现在第二阶段的正式训练里研究团队从COCO、SAM、LLaVA/LCS这几个公开数据集里抽取了120万张图片然后分别用十个不同的AI模型给这些图片生成描述文字用这120万套不同来源的描述文字去训练同样架构的模型其余配置全部保持一致。生成类任务这边同理从同一批120万图片池里抽取5万张用于Stable Diffusion的微调10万张用于Qwen-Image的微调配套的说明文字同样是十个不同AI模型各自生成的一套。理解类模型训练完之后要在16个基准测试上做全面考核包括通用多模态理解能力、多模态推理能力、视觉感知能力和幻觉鲁棒性这四大类。生成类模型则在T2I-CompBench、GenEval和DPG-Bench这三个基准上考核分别对应组合式生成能力、物体级准确度和长指令跟随能力。反直觉的发现不是模型越大说明文字就越有用先说一个在InternVL3.5这个模型家族内部观察到的现象这个现象直接颠覆了很多人的默认预期。按照常理推断同一个模型家族里参数规模越大的版本理解能力应该越强写出的图片描述应该也越有价值拿去训练下游模型效果理应更好。但实际数据完全不是这样。InternVL3.5家族里的1B、4B、8B三个版本,在理解类任务的下游得分排名是1B58.5分大于4B57.5分大于8B57.3分。而在生成类任务里排名又变成了4B71.6分大于8B71.0分大于1B70.1分。**这意味着最大的模型未必是最有用的说明文字来源。**为什么会这样答案就藏在覆盖度和准确度这两个指标里。1B模型虽然参数最少但它的覆盖度反而是三者中最高的48.3也就是说它虽然模型小但敢写愿意把画面里更多的东西都提一嘴。而4B模型的准确度是三者中最高的73.5说明它虽然规模不算最大但写出来的每句话可信度更高。这就好比一个刚毕业的实习记者和一个经验丰富的资深编辑同时去采访一个新闻事件。实习记者写得没那么老练但初生牛犊不怕虎把现场看到的每个细节都事无巨细地记下来哪怕有些细节记录得不够精准。而资深编辑则更谨慎只写自己有把握的部分字字斟酌但篇幅相对克制。如果你要的是一份信息量足够全面的初稿去做后续加工实习记者的稿子可能反而更有用但如果你要的是一份直接能拿去发表的定稿编辑的稿子显然更靠谱。模型规模大小跟它到底适合哪种任务完全是两码事。系统性回归分析理解任务靠覆盖度生成任务靠准确度单看InternVL3.5家族内部的这个现象还只能算个案例说服力有限。研究团队接下来做了一件更严谨的事情把十个不同家族、不同规模的AI模型的覆盖度和准确度分数和它们各自训练出来的下游模型表现放在一起做统计学上的回归分析。具体的做法是对每一条下游任务的流水线分别拟合一个线性回归模型用覆盖度和准确度这两个变量去预测下游得分,然后看每个变量的系数大小和统计显著性也就是p值p值越小说明这个变量和结果之间的关联越不可能是巧合。 p值p-value统计学中用来衡量某个观察到的关联是不是纯属偶然的一个数值p值越小说明这个关联越有可能是真实存在的而不是随机波动造成的假象。结果非常一致而且和InternVL3.5家族内部观察到的规律完全吻合。对于理解类任务覆盖度是显著的正向预测变量。在SigLIP配Qwen3的流水线上覆盖度的回归系数是正0.118p值是0.026,这个数值小于常规统计学里0.05的显著性门槛说明这个关联是真实可靠的。而准确度的p值高达0.274远超显著性门槛说明准确度和理解任务表现之间的关系从统计上看更像是噪音站不住脚。在CLIP配Vicuna的流水线上同样如此覆盖度系数正0.215p值0.047勉强踩线显著准确度的p值是0.445同样不显著。对于生成类任务情况完全反过来了。在Stable Diffusion 3.5这条流水线上准确度的回归系数是正0.189p值小于0.001这是极强的显著性信号。而覆盖度的p值是0.322完全不显著。在Qwen-Image这条流水线上准确度系数正0.235p值同样小于0.001覆盖度的p值是0.171,依旧不显著。**理解类任务偏爱覆盖度广的描述文字生成类任务偏爱准确度高的描述文字这个规律在四条完全独立的训练流水线里反复得到验证。**这个结果背后的道理其实可以想明白。理解类模型的核心任务是让AI见多识广学会识别各种各样的视觉概念和它们之间的关系说明文字覆盖的语义范围越广模型接触到的视觉概念种类就越多学习的素材就越丰富。哪怕这些描述文字里偶尔有个别错误只要总体覆盖面广模型依然能从海量样本里提炼出正确的规律个别噪声会被大量数据平均掉。而生成类模型的任务完全不同它要根据一句话精确地画出对应的画面这时候文字和图像之间的对应关系必须精确无误。如果训练数据里的说明文字经常把颜色、位置这些具体细节说错模型学到的就是错误的文字图像映射关系之后你让它按提示词画图它画出来的东西自然也会文不对题。这就好比教一个学徒画肖像画如果师傅一直告诉他这个人的眼睛是蓝色的其实是棕色学徒学到的就是一套错误的对应关系以后每次遇到类似描述都会画错;但如果只是让学徒多看各种各样的人物画像积累见识,哪怕偶尔师傅讲错一两个细节,学徒的整体审美判断力依然能培养起来。如果不区分这两种任务对说明文字的不同需求用同一批数据不加区分地喂给理解模型和生成模型两边都得不到最适合自己的训练素材。一个例外幻觉问题准确度才是关键前面说理解类任务偏爱覆盖度广的说明文字但这个规律有一个重要的例外那就是幻觉问题。 幻觉HallucinationAI在描述或回答时编造出图片里根本不存在的内容是多模态AI一个常见且棘手的缺陷。研究团队专门针对HallusionBench、POPE、AMBER这三个专测幻觉能力的基准做了单独的回归分析结果显示准确度的p值是0.124虽然没有达到严格的统计显著性门槛但明显比覆盖度的p值高达0.914更有说服力。这个发现说明了一件很直观的道理如果你想让AI少说错话那么训练数据里的说明文字本身就得少说错话。你没法指望用一堆错漏百出的训练素材训出一个从不胡说八道的模型。这跟前面覆盖度主导的整体理解能力形成了一个有意思的对照,说明理解得全和不瞎编乱造这两种能力,其实分别对应着说明文字的不同质量维度。这项工作到底带来了什么回过头来梳理一下CAPEval这项工作解决的核心问题是把长期以来被混为一谈的说明文字质量拆解成了覆盖度和准确度两个可以独立测量的维度并且通过大规模、多流水线的端到端对照实验验证了这两个维度对不同下游任务的影响存在显著且一致的差异。这个发现对实际做数据工程的人来说价值非常具体。如果你正在为训练一个视觉语言模型准备说明文字数据你应该优先选择那些愿意多说、覆盖面广的描述文字来源哪怕它偶尔犯点小错也无妨。而如果你在为训练一个文生图模型准备数据你反而应该更看重描述文字的可靠性,宁可信息量少一点,也不能出现张冠李戴的错误。这种思路其实可以类比到更广泛的场景里去。企业招人的时候常常也会陷入类似的误区招聘方喜欢用一个笼统的综合素质分去评价候选人却忽略了不同岗位其实需要完全不同的能力组合。销售岗位可能更需要广撒网、见人说人话的沟通面容错率相对较高而财务审计岗位则必须句句为实一个数字算错都可能是灾难性的。如果拿同一套综合分标准去筛选这两类完全不同的岗位招错人的概率自然会大幅上升。这项工作的意义恰恰在于提醒我们评价一件事物的好坏从来都不该只用一个笼统的分数了事而应该先搞清楚这件事物到底是要服务于哪个具体目的。写在后面读完这篇论文我印象最深的其实不是那个覆盖度对应理解、准确度对应生成的核心结论而是InternVL3.5那组数据背后透露出的一个更微妙的东西模型参数量这个我们习以为常的质量代理指标在具体的下游应用场景里可能压根靠不住。我们太习惯用参数规模去判断一个AI模型好不好了8B听起来就应该比4B强这几乎成了一种下意识的信仰。但这篇论文用一个干净利落的对照实验告诉你真正重要的从来不是参数量本身而是这个模型产出的数据性格跟你要用它做什么事情之间到不到位。还有一个细节值得单独说一下那就是研究团队构建检查清单的方式。他们没有让AI裁判直接对着图片打分而是先让人工写出极其详尽的标准答案再把这段文字拆解成一条条原子化的判断题最后才让AI裁判去比对候选文字和检查清单。这个先人工写长文本、再拆解成检查清单的两步走设计其实是在用人力去校准机器评判的边界避免让AI自己既当运动员又当裁判。这让我想到一个还没有被回答的问题如果说明文字本身还可以细分成覆盖度和准确度那视频描述、3D场景描述这些更复杂的多模态数据是不是也存在类似的、被我们长期混为一谈的多个独立维度这篇论文打开的可能只是冰山一角。QAQ1CAPEval是什么ACAPEval是一个针对图片说明文字caption的解耦评测基准它把传统评测里混为一谈的单一质量分数拆解成覆盖度Coverage和准确度Precision两个独立指标并通过实际训练下游AI模型来验证这两个指标各自的价值。Q2为什么说图片说明文字的覆盖度和准确度是两回事A覆盖度衡量的是描述文字提到了多少真实存在的画面信息准确度衡量的是提到的这些信息里有多少是对的。研究发现这两个指标之间没有正相关关系有的AI模型敢写但容易出错有的AI模型写得少但基本靠谱二者是完全独立的能力维度。Q3CAPEval的研究发现对训练AI模型有什么实际用处A研究发现视觉语言理解类模型的训练更依赖说明文字的覆盖度广不广而文生图生成类模型更依赖说明文字的准确度高不高。这意味着做数据工程时应该根据下游任务目标针对性地挑选或优化说明文字来源而不是用一个笼统的质量分数去筛选数据。