西班牙巴斯克大学团队:当AI学会“看见“情绪的模糊地带 这项由西班牙巴斯克大学UPV/EHU、意大利萨伦托大学与意大利国家研究委员会应用科学与智能系统研究所CNR、以及马来西亚克兰丹大学数据科学与计算学院联合开展的研究以预印本形式于2026年7月14日发布在学术平台arXiv上编号为arXiv:2607.13250。这项研究的核心是为第11届ABAW野外情感行为分析竞赛提交的解决方案名为AffectFlow-DINO致力于让AI更真实地理解人脸上的情绪信号。一、情绪识别为什么这么难每个人都有过这样的体验在一张模糊的照片里你看到一个人嘴角微微上扬却说不清楚他到底是在笑还是只是放松了肌肉。人脸上的情绪信号天生就带有模糊性尤其是在现实生活中拍摄的照片里——光线不好、角度刁钻、遮挡严重或者表情本身就很细微。这对人眼来说已经够难了对AI系统来说更是一个巨大的挑战。现有的AI情绪识别系统大多像一个过于自信的学生给它一张脸它会毫不犹豫地说这是愤怒可信度99%——即便这张脸其实可能是愤怒、也可能是厌恶、还可能是强忍着悲伤。这种非此即彼的确定性判断恰恰忽略了人类情绪本身的复杂性和不确定性。研究团队面对的是一个特别复杂的任务不只是识别一个情绪而是同时完成三件事。第一件是估计效价valence即情绪的积极或消极程度和唤起度arousal即情绪的强烈程度这两个连续的数值数值范围在-1到1之间就像给一段音乐打悲伤程度和激昂程度的分数。第二件是把人脸表情分成八种类别中性、愤怒、厌恶、恐惧、高兴、悲伤、惊讶和其他。第三件是检测十二种动作单元Action Units简称AU也就是面部肌肉的具体运动比如眉毛上扬、嘴角下拉等每一种都是独立的是否激活判断。这三件事必须同时完成而且使用的是同一批照片。更麻烦的是这批数据极度不平衡——高兴和中性的样本多得要命恐惧和厌恶却少到可怜前者是后者的八倍以上。对于动作单元来说情况更为极端有一种AU在68%的照片里都是激活状态而另一种却只有不到3%的照片里出现两者相差了整整29倍。二、一个懂得也许的AI研究团队提出了一个核心思路可以用一个比喻来理解普通的AI识别系统像一个只会说是或否的裁判而他们新设计的系统更像一个有经验的法医鉴定师会说根据现有证据最可能的结论是A但B和C也有相当的可能性这张脸的表情存在一定的模糊空间。为了实现这个思路研究团队引入了一种叫做条件整流流Conditional Rectified Flow的技术。这个名字听起来很深奥但核心想法其实相当直观。把AI的预测过程比作一场从噪声出发的旅程系统先随机生成一团情绪噪声然后通过学习好的路径把这团噪声一步步引导到最终的预测结果。整流流的特点是这条引导路径尽可能地走直线不绕弯子这让整个过程既快又稳定。更关键的是由于起点是随机的每次旅程可以从不同的噪声出发最终到达的位置会略有不同形成一个预测的分布范围。系统在推理时会同时运行多条旅程默认是16条然后对结果取平均就像问了16位专家同样的问题再汇总答案一样。这种方法既给出了具体的预测又给出了预测的不确定性范围——当多条旅程的终点高度集中时说明这张脸的情绪比较明确当终点分散时说明这张脸确实很难读懂。整个预测结果被打包成一个22维的向量里面同时包含了效价、唤起度、8种表情的概率以及12种动作单元的激活状态。这22个维度被当作一个整体在同一个空间里完成整流流的传输让不同类型的情绪信息可以相互影响和约束。三、系统的搭建方式在技术实现上研究团队构建的系统分成了几个紧密配合的部分就像一条流水线。第一个环节是视觉编码器使用的是一个叫做DINOv3 ViT-S/16的预训练模型。这是一种基于视觉变换器Vision Transformer架构的模型通过一种叫做DINO的自监督学习方式预训练能够把一张224×224的人脸图片转换成一个包含丰富语义信息的特征向量。研究团队选择它而非另一种常见预训练方式MAE掩码自编码器的原因是DINO的训练方式让它特别善于捕捉空间上局部化的特征而面部动作单元恰恰就是这样的信号——眉毛上扬是眉毛那块区域的变化不是整张脸的变化。在早期实验中视觉编码器的参数是冻结不动的后续才进行微调。第二个环节是共享投影头把编码器输出的特征向量通过一个线性变换和激活函数映射到768维的工作空间形成一个统一的情绪嵌入表示。第三个环节是三个独立的确定性预测头分别对应效价-唤起度回归输出在-1到1之间、表情分类输出8个类别的概率、以及动作单元检测输出12个二分类结果。每个预测头都是一个两层的MLP多层感知机带有层归一化、GELU激活函数和Dropout正则化。这三个头的预测结果会直接计算损失函数并反向传播梯度。第四个环节就是核心创新——条件整流流头。它接受图像嵌入、当前时间步的噪声-目标插值以及时间步的正弦编码作为输入学习预测当前位置到目标位置的速度向量。训练时对于每个样本系统会随机采样一个时间点t0到1之间的均匀分布和一个随机噪声构造出插值状态然后让流网络学习从这个状态到真实目标的方向。损失函数是预测速度与真实速度之间的均方误差同时使用一个二值掩码来处理标注缺失的问题——如果某张图没有表情标注那么表情相关的速度维度就不计入损失这样缺失的标注不会干扰整个学习过程。训练的总体目标是两部分的加权和确定性多任务损失加上β倍的流损失。通过大量实验研究团队发现β取0.5或1.0时效果最好最终选用β1.0作为默认值。四、数据的倒三角难题研究使用的数据集叫做s-Aff-Wild2这是专门为这类挑战提供的野外人脸图像数据集。训练集包含142,382帧但标注并不完整有103,917帧有效价-唤起度标注90,645帧有表情标注103,316帧有动作单元标注。更麻烦的是同时拥有三种标注的帧只占总数的36.6%这意味着大部分时候系统只能从部分信号中学习。验证集包含26,876帧效价-唤起度和动作单元的标注是完整的但表情标注只覆盖了15,440帧。数据的严重不平衡是这个任务最棘手的地方。在表情类别上其他类占27.4%中性占26.5%高兴占20%三者合计超过七成而恐惧只有3.4%厌恶只有3.5%二者加起来还不到7%。对动作单元来说AU25嘴唇分开在68%的有效训练行中是激活状态而AU15嘴角下拉和AU23嘴唇收紧的正样本率只有2-5%整体不平衡比高达29:1。这种不平衡对普通的训练方式来说是致命的损失函数会被多数类主导少数类的学习信号被淹没。系统在高兴和中性上表现很好但对恐惧几乎视而不见——不是因为学不会而是因为恐惧的样本太少训练时根本没机会充分学习。五、一系列实验揭示的规律研究团队进行了系统性的消融实验覆盖了26种不同的设计选择逐步解开了每个组件的贡献。这些实验的结果像一个逐步拼图的过程每块拼图都揭示了一个规律。最基础的对比是三种训练方式的比较。只用确定性监督没有流损失的模型在验证集上得到PMT L 0.793只用流损失没有确定性任务损失的模型得到0.773两者联合训练的AffectFlow得到0.826。两种不匹配的反常实验——用流模型去做确定性解码或者用确定性模型去做流解码——都会造成系统崩溃分别是0.402和0.408清楚地说明两种训练目标和两种解码方式必须配套使用。这个结果揭示了一个重要机制确定性损失帮助共享嵌入学习到更好的情绪区分特征进而提升流模型的质量而流损失则在不损害确定性头的前提下额外学会了概率分布。在效价-唤起度预测上流解码比确定性解码有显著提升效价CCC协同相关系数衡量连续预测质量的指标越接近1越好从0.232提升到0.290提升幅度达0.058。这个规律在所有实验中都保持一致连续型目标效价和唤起度从分布平均中受益最多因为这类信号本身就有多义性取多次预测的平均会平滑掉随机误差趋近真实值。流损失权重β的实验显示β在0.5到1.0之间是一个稳定的平台区效果没有明显差别一旦β升到2.0流目标过于主导总体性能反而下降。推理效率实验显示采样数N从1增加到8时效果有明显改善但从8到32几乎没有变化说明整流流的直线轨迹特性让它只需少数步骤就能稳定。欧拉积分步数T从10到50的变化影响也很小表明这个轻量级的流模型并不需要太多积分步骤。六、冻结的编码器撑不住微调才是关键在冻结视觉编码器的情况下最好的成绩已经被逼到了极限。研究团队决定尝试用一个很小的学习率1e-5是主学习率1e-4的十分之一对视觉编码器进行端到端微调让它适应情绪识别这个具体任务。结果是立竿见影的PMT L从冻结骨干网络时的最好结果0.831一跃升至1.045是整个研究中单步最大的提升。然而微调带来了一个意外微调后确定性解码1.045反而比流解码0.928表现更好与冻结情况下的规律相反。研究团队分析认为这是因为骨干网络适应后确定性头变得更强而流头的参数没有同步更新处于跟不上的状态。解决方案是在微调过程中重新激活流目标也就是说在低学习率微调骨干网络的同时也让流损失继续起作用。当β0.5时流重调版本的确定性解码达到1.062当β1.0时确定性解码进一步提升到1.073主要受益于效价CCC的大幅改善从0.308提升到0.387。加上每个AU独立阈值校准后这个版本达到1.123是该研究在基础配置下的最高成绩。在β1.0的情况下流解码反而比β0.5时稍差0.931对比0.956说明更强的流目标让确定性头受益但同时让流的分布形状发生了变化不那么适合直接用流采样来解码。研究团队观察到在所有经过微调的变体中确定性解码都优于流解码这表明流目标更像是一种帮助共享表示更好地结构化的正则化工具而非最终解码时的必选路径。七、用逆向加权对抗不平衡面对严重的类别不平衡研究团队尝试了一系列方法结果有喜有忧。在处理表情不平衡方面他们先后尝试了四种修改直接增大表情损失的权重、使用焦点损失Focal Loss这种方法会自动降低简单样本的权重、提升难样本的权重、给每个任务单独设一个投影头以及把这些方法组合起来。结果这四种方法全部失败——不仅没能提升表情识别的宏平均F1还反而拉低了效价-唤起度的预测质量。核心原因在于不管损失函数怎么变形只要样本本身的分布没变训练时多数类的梯度信号就会持续压制少数类。真正有效的是使用加权随机采样器WeightedRandomSampler也就是在每个epoch里给少数类的样本更高的被抽到的概率。这种结构性的数据采样改变真正解决了梯度被多数类淹没的问题使表情宏平均F1从0.212提升到0.251是所有冻结骨干网络实验中表情识别的最好结果。对动作单元来说研究团队为每个AU的二分类损失设置了正样本权重权重等于负样本数量除以正样本数量。AU15的正样本权重因此高达41AU23则是33.7。这种方法把AU的平均F1从0.384提升到了0.427是有效的。不过当这种方法与流解码结合时会出现问题经过正样本加权训练后模型预测的概率分布形状发生了系统性偏移而流模型学到的是未加权状态下的目标分布两者不兼容导致流解码的性能大幅下降。这说明一旦使用流模型训练时的分布特性必须与流模型的假设保持一致。八、不需要重训练后校准能拯救被压制的信号整个研究中最令人印象深刻的发现之一来自一个完全无需重新训练的后处理步骤阈值校准。普通的动作单元检测默认使用0.5作为判定阈值也就是说如果sigmoid函数输出的概率超过50%就判定为激活。但研究团队发现对于那些极少激活的AU来说由于训练时正样本太少模型学到的概率值系统性地偏低。AU15的sigmoid输出几乎永远不会超过0.5哪怕模型确实学到了一些区分信号。这就像一个明明知道答案的学生因为太过保守每次答题都把正确答案压在心里不说出来。解决方法是在验证集上单独为每个AU搜索最优阈值找到能最大化F1的临界点。AU15的最优阈值可能只有0.1AU25经常激活的最优阈值可能是0.55。这种每个AU独立校准的方式让平均AU F1提升了约0.06个百分点而且对所有检查点都有效AU15的F1从接近0直接恢复到10.8%AU23从0.5%恢复到18.9%。完全相同的逻辑也被应用到了表情识别上。对表情来说问题不是阈值而是logit分数的相对大小。系统的默认预测方式是取8个类别中logit最大的那个但由于训练时其他和中性的样本压倒性地多这两个类的logit系统性地比其他类大导致系统几乎从不预测恐惧或悲伤。后校准的做法是在验证集上为每个类别学习一个独立的加权系数相当于给弱势类别人为补偿。校准的效果极其显著恐惧的F1从3.8%跳升到33.1%提升了29个百分点悲伤从17.1%提升到28.2%厌恶从46.5%提升到50.7%。而高兴和其他这样的多数类几乎没有变化。宏平均F1PEXP R从0.296提升到0.350整体PMT L从1.123提升到1.177这是全研究最好的验证集结果。这个发现验证了一个重要的观点严重的类别不平衡会压制模型学到的信号但不会抹除它。模型确实学会了识别恐惧表情的特征只是被压制在了表层之下。阈值校准相当于一把钥匙把这些潜藏的信号重新释放出来而且完全不需要重新训练是一种极高性价比的改进手段。九、更大的骨干网络和翻转增强的得失研究团队还对比了用更大的ViT-B/16拥有86M参数而ViT-S/16只有约22M参数替代默认骨干网络的效果。结果是效价预测明显改善CCC-V从0.387提升到0.416AU平均F1校准后也略有提升0.507 vs. 0.502但表情识别的宏平均F1下降了0.041从0.296降到0.255。这种效价改善与表情下降之间的权衡导致总体校准后PMT L1.116低于ViT-S的最好结果1.123。研究团队推测ViT-B在20个epoch内难以充分适应表情识别任务需要更长的训练或更仔细的调参。水平翻转测试时增强TTA的效果则完全是负面的所有三个子任务的得分都下降了。原因很直观面部动作单元有很强的空间方向性比如嘴角一侧下拉在水平翻转后会变成另一侧打乱了模型对方向性AU的判断导致预测一致性下降。十、整体成果的全景综合所有实验研究团队构建了一条清晰的性能提升路径。从最基础的确定性预测PMT L 0.793出发加入整流流后升到0.826引入每AU独立阈值校准后升到0.888骨干网络微调是最大的单步跳跃直接到达1.045加上AU校准达到1.101在微调的同时重调流头β1.0进一步升到1.073再加AU校准达到1.123最后加入表情后校准达到全研究最高点1.177。整个过程相比官方基线的0.45提升了超过0.72也就是提升了约160%。研究团队还发现厨房水槽式的组合把类别加权交叉熵和AU正样本加权同时用于微调并没有进一步改善与单纯微调1.045相比得到1.041说明这类不平衡处理策略在骨干网络冻结时有效但一旦整个模型端到端优化它们反而会干扰梯度分配拉低效价-唤起度的性能。微调之后流头重调是比样本重加权更有效的提升路径。与此同时补丁软池化Patch Soft-PoolPSP方法也就是在CLS token的基础上额外学习196个空间补丁token的加权平均让冻结骨干网络下的确定性预测达到0.859是冻结情况下最好的未校准结果说明空间信息对动作单元检测确实有帮助但没有与骨干网络微调结合测试。说到底这项研究告诉我们一件很有意思的事让AI承认自己不确定反而能让它预测得更准。通过把情绪识别建模为一个概率分布而非单一答案研究团队构建的系统在效价-唤起度这类本身就模糊的目标上获得了实实在在的提升。而那些被类别不平衡压制在底层的少数类信号并没有真的消失——只是需要一把正确的钥匙才能找到。这对于我们思考AI系统如何面对现实世界中的模糊性和不平衡性提供了一个清晰而实用的参考框架。未来如果能在这个基础上加入时序信息毕竟表情是随时间变化的不是一张静止的图片以及更充分的多任务联合缩放训练与当前顶尖水平之间的差距或许可以进一步缩小。有兴趣深入了解技术细节的读者可以通过arXiv编号2607.13250查询完整论文。QAQ1AffectFlow-DINO和普通表情识别AI有什么区别A普通表情识别AI只给出一个确定答案比如这是愤怒。AffectFlow-DINO则会同时运行多次预测取平均值并且能感知预测的不确定程度。这让它在表情本身模糊的情况下表现更稳定尤其是效价情绪积极/消极程度的预测质量明显更好。Q2后校准是什么意思为什么不用重训练就能提升效果A后校准是指在模型训练完成后只在验证数据上调整判断的门槛比如把某个动作单元的激活阈值从0.5调低到0.1。模型其实已经学到了识别稀有类别的能力只是默认设置让它不敢说。调整门槛相当于告诉它放开胆子说不改模型参数却能直接把恐惧表情的F1从3.8%拉到33.1%。Q3动作单元识别为什么这么难数据不平衡具体影响有多大A动作单元指的是面部具体肌肉的运动比如嘴唇分开AU25或嘴角下拉AU15。在训练数据里AU25出现在68%的样本里而AU15只出现在2.4%里两者相差29倍。用同一套标准训练下来模型对AU25很熟悉对AU15几乎视而不见在默认阈值下AU15的F1接近零。后校准能把它恢复到10.8%说明信号其实存在只是被淹没了。