ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

AI生成的视频,到底是完成了任务,还是在自娱自乐?

2026/9/19 21:35:40 拓冰建站 浏览量
AI生成的视频,到底是完成了任务,还是在自娱自乐? 你有没有想过这样一个问题如果给AI一张纸币的照片让它生成一段把纸币折成乌龟的视频AI最容易犯的错误是什么不是折得不像乌龟。而是它可能直接生成一只真的乌龟。这听起来有点荒谬但这恰恰是当下视频生成模型最容易踩的坑。它完成了乌龟这个结果,却抛弃了纸币这个前提。任务看似达成了但它跟你给的那张照片已经没有任何关系了。这就是中国科学技术大学联合FrameX.AI等机构的研究者们在一篇名为《SemComp-Bench》的论文里想要揪出来的问题。他们发现现在评价AI生成视频好不好大家关注的都是画面清不清晰、动作连不连贯、这个物体像不像那个物体却很少有人问一个更根本的问题这段视频到底有没有完成任务完成任务的同时有没有骗一下你的眼睛用一个毫不相干的东西替换掉你给它的参考对象一个被所有人忽略的评价维度先说说这件事到底难在哪儿。过去几年,视频生成模型突飞猛进,Sora、Veo、Kling这些名字你可能都听过,它们生成的视频已经能做到画面精致、运动流畅、甚至能理解复杂的文字指令。学术圈用来评价这些模型的工具也越来越成熟比如VBench、EvalCrafter这类基准测试它们衡量的是画面质量、时间上的连贯性、指令有没有被听懂。但这些基准测试有一个共同的盲点。它们几乎都在测试过程却没有真正测试结果。换句话说,如果你让AI生成给这个人化个万圣节骷髅妆的视频现有的评价体系可能会关注这个人的脸有没有变形、化妆的手法动作是否流畅但很少有人真正去核验视频最后那一帧这个人脸上到底有没有出现骷髅妆如果化妆化到一半突然换了个完全不认识的人的脸这算不算完成任务**这正是论文提出的核心概念:语义任务完成型视频生成(Semantic Task Completion Video Generation)。**它要求生成的视频同时满足两件事结果真的达成了并且这个结果和你提供的参考图片之间保持着语义层面上说得通的关系。 语义任务完成一种以结果为导向的视频生成任务范式,强调最终状态是否达成目标,以及这个最终状态是否和参考图片存在合理的高层语义对应关系,而不要求过程完整或者画面像素级一致。这里有个细节值得琢磨:论文特别强调,评价只看结果,不要求完整的中间过程。这意味着如果你让AI生成把生鸡蛋煎成煎蛋的视频你不需要它把打蛋、倒油、翻面这些步骤都拍出来哪怕直接给你一个已经煎好的蛋只要这个蛋在语义上能对应上你最初那颗生鸡蛋比如蛋壳花纹之类的细节其实是可以忽略的但这确实是鸡蛋变成的煎蛋这个逻辑必须成立那就算通过。这个设定听起来有点反直觉。我们平时评价一段教程类视频,总觉得步骤越完整越好。但研究者的思路恰恰相反,他们认为:**过程不重要,重要的是这个视频有没有骗你**。它给你看了一个折纸乌龟,这只乌龟到底是从你那张纸币变出来的,还是它偷懒直接找了张乌龟的照片糊弄过去。想象一下你去工厂验收一批定制家具。你不需要盯着工人从头到尾锯木头、上漆、组装的每一个动作你只需要打开最后送来的成品检查一下:这真的是我下单的那种木材做的桌子吗还是他们随便找了个类似的桌子糊弄我。如果厂家换了材料却告诉你反正看起来差不多这批货是不合格的,即便中间的生产流程录像看起来无比专业流畅。视频生成模型现在最大的问题,就是很多时候它给你交了一张看起来差不多的成品,却悄悄换了材料。造一套能验真假的数据集SemComp-Data要检验AI是不是在偷梁换柱,首先得有一套靠谱的测试题。研究者们没有选择自己编造任务场景,而是走了一条更聪明的路从真实世界的视频里抠出天然配对的题目。他们的原始素材来自一个叫Koala-36M的大规模视频数据集,里面有海量的真实生活视频。 Koala-36M一个大规模的真实场景视频数据集,收录了大量涵盖不同主题的完整视频内容,常用于视频生成和视频理解相关研究的数据来源。研究者的思路是这样的既然现实中已经有大量记录从A变成B的完整过程的视频比如某人拍了个完整的钩织毛线帽子的教程那为什么不直接从这些真实视频里截取起点画面和结果片段把它们打包成一个天然真实、任务一定可行的测试题呢这么做的好处显而易见。如果任务是人工编出来的,你很难保证这个任务真的能实现,万一把石头变成金子这种根本不可能完成的任务混进了测试集,那测试结果就毫无意义。但如果这个任务本来就是真人拍出来完成的,那至少能证明:这事儿是能干成的而且干成之后长什么样,是有真实参照的。为了把这些原始视频加工成标准化的测试题,团队设计了一条四阶段的处理流水线。第一阶段叫候选筛选。团队先用标题里的关键词比如访谈新闻幕后花絮这些词把那些高度依赖旁白解说、无法单靠画面判断内容的视频筛掉因为这类视频没办法只靠看来验证任务有没有完成。剩下的视频会被抽帧拼成一张缩略概览图,交给一个视觉语言模型分类,归到六个大领域里去比如手工与精细制作美妆时尚美食烹饪园艺宠物艺术与精密工艺运动健身。 视觉语言模型(VLM)一类能同时理解图像和文字的人工智能模型,可以看懂图片内容并用自然语言描述、回答关于图片的问题,论文中用它来做视频内容的自动化分类和质量判断。第二阶段是状态挖掘。团队先针对每个具体任务类别比如组装耳机美容工具清洁人工定义好什么样的画面算是起点状态什么样的画面算是完成状态。接着让VLM在完整视频里定位出符合这两种状态定义的时间点抽出对应的画面。为了防止VLM找错,还设计了一道质检程序把两张没有标注的候选帧混在一起,再让VLM单独判断哪张是完成态如果它猜错了说明这两帧的对应关系本身就存在歧义这组数据直接被扔掉。第三阶段是视频延展。有了确定的结果时刻之后,系统会围绕这个时刻,截取一小段视频片段让它有大约3到4秒的时长既能看清楚结果状态又不会拖进太多无关内容。第四阶段是指令结构化,团队让VLM为每个样本生成两版指令一版是简短版不超过30个单词遵循动词参考图主体介词结果状态这样的固定模板一版是详细版包含背景、光线、颜色、形状等更细的信息。这一步之所以重要,是因为研究者在预实验里发现一个有趣的现象。如果直接让VLM看着两张图起点和结果随便写指令,它经常会写出一堆没用的细节比如提到画面里出现的品牌logo、屏幕上的文字水印之类的噪音信息这些跟任务本身没什么关系,却会干扰后续的评价。所以他们特意约束VLM,只提炼出任务的核心动作关系。除了写指令,这一步还要做一件很关键的事:判断哪些属性必须保留哪些可以随意改变。因为不同类型的任务需要保留的重点是不一样的。 对齐类型(Alignment Type)论文定义的四种语义关联方式分别是物体元素(关注物体种类、材质、数量等)、人物身份(关注同一个人的脸和身体特征要保持一致)、物体外观(关注某个特定物体实例的具体样貌比如颜色花纹)、场景(关注空间布局和背景关系)。举个例子来说明为什么要区分这四种类型。如果任务是给同一个人化个万圣节妆,那这个人的脸和身份必须保持一致,不能化完妆之后变成另一个人,这属于人物身份这一类但如果任务是把设计图纸变成实际盖好的房子,这时候你要盯着的重点是空间布局和结构对不对得上,而不是要求砖头的具体颜色纹理跟图纸上画的一模一样这属于场景这一类。如果你不区分这些类型,笼统地要求所有画面元素都一比一还原参考图,会出什么问题很多任务会被误判为失败。比如把生鸡蛋煎成煎蛋这个任务生鸡蛋是圆的、亮晶晶的煎蛋是扁的、颜色发白发黄形状彻底变了但这变化本身就是任务要求的一部分。如果强行要求外观一致,那所有状态转变类的任务全都无法通过测试这套评价体系也就失去了意义。最终团队从大约2万个原始视频里处理出了1273条这样的标准化测试样本并进一步挑出了一个包含60条样本、六大领域各占10条的小规模均衡子集叫做SemComp-Core用作后续实验的主战场。SemComp-Bench把裁判的标准写清楚有了测试题还得有靠谱的判卷人。这篇论文选择继续用视觉语言模型来当裁判但他们没有简单粗暴地让VLM打个分数而是设计了一整套结构化的是非题逼着裁判把判断依据说清楚。整套评价体系拆成了两个维度结果达成度(Outcome Achievement简称OA)和生成可靠性(Generation Reliability简称GR)。先说结果达成度。它包含四道判断题。第一道题叫结果实现,问的是视频里到底有没有出现指令要求的那个结果哪怕只是粗粒度的、大概对上就行,先不管细节像不像参考图。第二道题叫语义关联,问的是这个已经实现的结果跟参考图片、跟指令里说的具体要求对不对得上号包括物体种类、外观、材质、结构、数量这些细节。第三道题叫关键实体一致性,它检查视频从头到尾,那些任务相关的关键物体或人物,有没有莫名其妙地消失、被替换或者悄悄换了材质、外观、身份。第四道题叫全局视觉连贯性,它检查整段视频有没有出现那种像PPT翻页一样、场景突然整体切换的诡异情况。这四道题必须全部通过,才能给这条样本记一分。这是个一票否决的严格标准哪怕前两道都答对了,只要人物脑袋突然换了个人,或者画面莫名其妙从室内跳到了室外,这条样本照样算失败。为什么要设计成这种一票否决的严苛模式,而不是每道题单独打分求个平均值设想你在验收一份合同翻译。你可能会说这份翻译大意上翻对了、用词也很准确但如果这份合同里有一整段莫名其妙缺失或者张冠李戴地插入了别的内容你还会说这是一份合格的翻译吗显然不会。任何一个环节出问题,整份文件的可信度都会崩掉。视频生成同理,哪怕前三项都做得漂亮,只要画面里出现一次角色偷换,这段视频的完成度就应该被判定为不及格,因为它已经不能被信任了。再来看生成可靠性,这个维度关注的完全是另一件事不管任务有没有完成画面本身是不是物理上说得通、看起来干净。它有五道题物理合理性(有没有明显违反物理常识的画面,比如东西悬空飘着)、视觉清晰度(画面是否模糊、曝光是否异常)、无伪影渲染(有没有出现莫名其妙的噪点、色块、空白区域)、场内时空连贯性(同一场景内有没有闪烁、局部变形、瞬间重影)、文字与界面完整性(画面里出现的文字、图标是否清晰可辨)。这五道题都是失败导向型的也就是说只有当VLM回答否即没有发现这个问题这道题才算通过。这套体系设计得很巧妙的一点在于它把任务有没有完成和画面质量好不好这两件事彻底拆开来评价。你可以想象一个学生考试,一份卷子既要考答案对不对也要单独考字写得工整不工整两者互不干扰,但都要单独给分。这样才能诊断出模型到底是哪个环节出了问题是压根没理解任务要求还是理解对了但画面渲染出了岔子。七个模型上考场最高分只有37.8%理论说完了,该看真实成绩单了。研究者拿这套评价体系测试了七个具有代表性的视频生成模型包括字节跳动的Seedance 2.0、阿里的Wan2.2系列TI2V-5B和I2V-A14B两个版本、CogVideoX1.5、SkyReels-V2、腾讯的HunyuanVideo-1.5以及Phantom-1.3B。每次评价团队都会让VLM独立进行三次判断在不同时间调用三次取平均值以此减少单次判断的随机波动带来的误差。先看结果达成度的成绩单。| 模型 | 结果实现率 | 语义关联率 | 实体一致性率 | 视觉连贯性率 | 综合OA分 ||---|---|---|---|---|---|| Seedance 2.0 | 0.839 | **0.744** | 0.444 | 0.594 | 20.0% || Wan2.2-TI2V-5B | 0.589 | 0.400 | **0.689** | **0.922** | 23.3% || Wan2.2-I2V-A14B | 0.800 | 0.528 | 0.628 | 0.789 | 28.3% || CogVideoX1.5-5B-I2V | 0.550 | 0.389 | 0.506 | 0.744 | 14.4% || SkyReels-V2-I2V-14B | 0.733 | 0.489 | 0.522 | 0.772 | 22.8% || HunyuanVideo-1.5-720P | **0.878** | 0.706 | 0.583 | 0.794 | **37.8%** || Phantom-1.3B | 0.539 | 0.356 | 0.322 | 0.511 | 3.9% |这张表最扎眼的数字是最后一列。表现最好的HunyuanVideo-1.5综合达标率也只有37.8%,也就是说即便是当下最强的模型之一,十条任务里也只有不到四条能做到结果真的实现了、跟参考图对得上、过程中没有实体乱跑、画面没有突然切场景这四件事同时成立。**这个数字意味着,当前的视频生成模型在语义任务完成这件事上,及格率不到四成。**更有意思的是模型之间的性格差异。Seedance 2.0在结果实现和语义关联这两项上表现很强,单看这两个数字它几乎是全场最佳但因为实体一致性和视觉连贯性这两项拖了后腿综合分反而只排在中游。反过来Wan2.2-TI2V-5B在实体一致性和视觉连贯性两项上是全场最高但它在结果实现和语义关联上表现平庸,综合分同样不出彩。这说明了一件事:目前没有哪个模型能同时把完成任务和不出岔子这两件事都做到位。有的模型敢想敢做,任务完成度高但过程容易翻车有的模型比较保守稳妥,画面稳定不出错但压根没往正确的方向努力。这就像考试里,有人擅长解难题但计算总是出错,有人计算特别仔细但只会做简单题,两种人都拿不了高分,只有两方面都强的人才能真正拿到高分,而目前还没有哪个模型做到这一点。再看生成可靠性的成绩单。| 模型 | 物理合理 | 视觉清晰 | 无伪影 | 场内连贯 | 文字完整 | GR分 ||---|---|---|---|---|---|---|| Seedance 2.0 | 0.883 | **0.994** | **0.994** | **0.739** | **0.978** | **91.8%** || Wan2.2-TI2V-5B | 0.794 | 0.978 | 0.889 | 0.722 | 0.889 | 85.4% || Wan2.2-I2V-A14B | **0.911** | 0.972 | 0.967 | 0.672 | 0.928 | 89.0% || CogVideoX1.5-5B-I2V | **0.944** | 0.811 | 0.772 | 0.583 | 0.828 | 78.8% || SkyReels-V2-I2V-14B | 0.778 | 0.922 | 0.739 | 0.328 | 0.789 | 71.1% || HunyuanVideo-1.5-720P | 0.800 | 0.939 | 0.883 | 0.472 | 0.861 | 79.1% || Phantom-1.3B | 0.778 | 0.972 | 0.856 | 0.506 | 0.728 | 76.8% |Seedance 2.0在这里彻底翻身,拿到全场最高的91.8%。有意思的是,它在结果达成度排名倒数第二20.0%却在生成可靠性上排名第一。这说明它更擅长把画面拍得漂亮、稳定、干净,却相对不太擅长真正把任务给完成好。这两个榜单几乎完全对不上号,恰好证明了论文最开始想说的那个观点画面好看和任务做对是两件不能混为一谈的事。还有一个共性问题浮出水面所有模型在场内时空连贯性这一项上的得分普遍偏低,最低只有0.328最高也只有0.739。这说明当下的视频生成模型有一个共同的短板单帧画面可以拍得很精美但让画面在一个连续场景里稳定地演变下去,却是个更难的活儿。这也侧面解释了为什么很多AI生成视频,截个图看着很惊艳,连起来播放却总觉得哪里怪怪的。文生视频还是图生视频差距有多大论文还专门做了一组对照实验,拿三个模型家族Wan2.2、CogVideoX1.5、HunyuanVideo-1.5分别测试了图生视频I2V,基于参考图片文字指令生成和纯文生视频T2V,只靠文字指令生成两种模式的差异。| 模型 | 模式 | 指令类型 | 结果实现 | 语义关联 | 实体一致 | 视觉连贯 | OA分 ||---|---|---|---|---|---|---|---|| Wan2.2-A14B | I2V | 详细 | 0.800 | 0.528 | 0.628 | 0.789 | **28.3%** || Wan2.2-A14B | T2V | 详细 | 0.889 | 0.522 | 0.317 | 0.117 | 4.4% || Wan2.2-A14B | T2V | 简短 | 0.389 | 0.111 | 0.806 | 0.250 | 0.6% || HunyuanVideo-1.5 | I2V | 详细 | 0.878 | 0.706 | 0.583 | 0.794 | **37.8%** || HunyuanVideo-1.5 | T2V | 详细 | 0.833 | 0.606 | 0.389 | 0.133 | 4.4% || HunyuanVideo-1.5 | T2V | 简短 | 0.550 | 0.100 | 0.761 | 0.178 | 1.7% |这组数据说明了一个非常朴素但重要的道理给AI一张参考图片,和只给它一段文字描述,效果天差地别。以HunyuanVideo-1.5为例,同样是详细指令图生视频模式的综合分是37.8%,纯文生视频模式直接跌到4.4%,差了将近九倍。这个差距主要不是来自任务有没有实现这一项两种模式其实差不多而是来自语义关联度实体一致性视觉连贯性这三项的全面崩盘,尤其是视觉连贯性,从0.794骤降到0.133。这个现象其实很好理解。你给AI一张具体的参考图片,相当于给了它一个明确的锚点它可以时时刻刻拿这张图对照着生成后续画面就像画家对着照片写实作画。但如果你只给一段文字,AI只能凭着对文字的理解自己想象出一个物体全靠脑内构建,没有一个稳定的视觉参照物贴着走画面很容易越走越飘,最后跟最初设想的样子渐行渐远。这就好比让两个人分别复述一件东西的样子。一个人手里拿着照片照着描述,另一个人只是听了一句话描述就凭记忆去转述给第三个人。第一个人复述出来的准确度显然会高得多,因为他随时可以核对参照物,而第二个人全靠脑子里那个模糊的印象,传几次话之后早就走形了。如果AI完全脱离参考图片它就成了那个只靠记忆转述的人越往后画面越容易失控。还有一个更细腻的发现在纯文生视频模式下,详细指令的表现总是好于简短指令主要靠结果实现和语义关联这两项撑起来但简短指令反而在实体一致性和视觉连贯性上得分更高。这里面藏着一个耐人寻味的权衡关系。详细指令信息量大能把想要的结果说得更清楚但同时也给AI出了一道更难的综合题,它得同时兼顾更多要求,协调难度陡增容易在执行过程中翻车。简短指令因为要求简单AI生成起来更从容画面不容易崩,但正因为要求太模糊,它很可能压根没往正确方向走。这就跟布置任务时的详细说明书和一句话吩咐类似:说明书写得越细执行起来越容易漏东西出错一句话吩咐虽然执行流畅但很可能理解跑偏,做出来的东西根本不是你想要的。论文之外这件事还牵动着什么这篇论文并没有孤立地出现。它站在了一整条研究脉络上。在视频生成基准测试这个方向上,此前的VBench和后续的VBench、VBench-2.0已经建立起一套相对成熟的画面质量评价体系覆盖视觉保真度、时间连贯性等维度。也有研究开始关注物理合理性和常识约束问题比如探讨视频生成模型是否符合基本物理规律的一系列工作。这些工作共同构成了当下视频生成评价体系的基础但它们始终没有正面回答任务到底完成了没有这个问题这正是SemComp-Bench想要填补的空白。在模型能力这条线上,从早期的CogVideoX、HunyuanVideo到后来的Wan2.2、Seedance 2.0模型的生成质量在过去两年里确实进步飞快从画面精细度到指令遵循能力都有明显提升。但这篇论文用一套新的检验标尺告诉我们画面越来越漂亮不代表任务真的越做越准。这提示未来的模型改进方向,可能需要专门针对结果导向的语义一致性去做优化而不只是继续堆叠画质和分辨率。写在后面读完这篇论文,我印象最深的不是那些百分比数字而是那道折纸乌龟的例子背后藏着的逻辑陷阱。一个AI模型完全可以在看起来完成了任务这件事上表现得极其自信,同时在这真的是你要的那个东西吗这件事上悄悄作弊。这种作弊甚至不需要模型有意识地骗人它可能只是因为生成一只普通乌龟比生成一只由特定纸币折叠出的乌龟容易得多于是它选择了那条阻力最小的路。这让我想到一个更大的问题随着AI生成内容越来越多地进入创作、教学、演示这些实用场景,看起来对和真的对之间的距离可能会成为一个长期被低估的风险点。如果一段AI生成的产品演示视频,把参考商品的关键特征悄悄替换掉了观众很可能根本察觉不出来因为整段视频看起来天衣无缝。那个37.8%的数字,或许比它字面意思更值得警惕。它不是说AI做得还不够好而是说,我们现在还没有足够好的方法去发现它到底做得好不好。QAQ1SemComp-Bench是什么ASemComp-Bench是一套评价视频生成模型的基准测试体系它不只关注画面质量更关注AI生成的视频是否真正完成了指令要求的任务同时是否与参考图片保持了语义层面的对应关系而不是偷偷用一个不相关的画面替代。Q2为什么现有的视频生成模型评价体系不够用A因为现有基准测试主要衡量画面清晰度、时间连贯性和指令遵循程度却很少验证生成结果是否真正达成了任务目标也很少检查生成的结果是否与参考图片存在合理的语义关联容易漏掉任务看似完成但实际偏离参考对象的情况。Q3测试结果显示AI视频生成模型表现如何A七个代表性模型中表现最好的HunyuanVideo-1.5综合达标率只有37.8%说明当前模型在同时做到完成任务、语义对得上、实体不乱跑、画面不突变这四件事上普遍不及格图生视频模式明显优于纯文字生成模式。