ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

simGCD - Parametric Classification for Generalized Category Discovery: A Baseline Study

2026/8/12 15:31:28 拓冰建站 浏览量
simGCD - Parametric Classification for Generalized Category Discovery: A Baseline Study 摘要GCD那篇论文里认为参数化的分类器会在旧类上过拟合所以用非参数化的半监督k-means来替代本文从这里提出挑战认为并不是过拟合导致效果差而是不可靠的伪标签导致的问题并且发现了两种偏置一个是分类器会更偏向已知类别另一个是模型对新类和旧类的预测分布不均衡。因此提出基于熵正则化的参数化分类器方法取得了比较好的结果。希望成为一个强有力的基线。——简而言之就是对开山之作回避的方式提出挑战并给出解决方案走另一条路线取损失函数。1、引言之前的模型都是在大量有标注数据下训练的但是很多任务并不能有充分的标注数据所以开始聚焦在无标签数据上半监督是一种近年来的GCD又进一步拓宽了边界。一般来说有两种技术路线1、生成通用的强有力特征来促进新类的发现表示学习、自监督方式 2、生成伪标签来引导参数化分类器标签和伪标签数据联合优化框架和分类器前任工作用kmeans代替参数化分类器会增大计算复杂度并且kmeans不能反向传播梯度所以不能联合优化分类边界。这启发了作者探究的动机导致参数化分类器方法失效的原因到底是什么在有监督的条件下验证了以前的范式得出的结论是不可靠的伪标签以及两个偏差才是根因。我觉得这些都是现象吧算根因吗基于这些发现提出一种简单的参数化分类器的方法。表示学习上参考GCD分类器上对于有标签数据采用交叉熵损失无标签数据采用自蒸馏同一张图像的一种增强视图产生伪标签监督另一种增强视图。还引入了一个熵正则项通过促使模型在所有可能的类别上给出更加均匀的标签预测来克服预测不均衡问题。贡献重新审视参数化分类器失败的原因并给出三个关键因素提出一个简单的可以联合优化的参数化分类器方法实验2、相关工作半监督学习开放世界半监督广义类别发现深度聚类3、探究参数化分类器失败的原因从表示学习和新类上的伪标签质量两个组件探究——一直觉得伪标签质量是一个现象而不是根因就觉得伪标签质量很难可迁移3.1 探索设置表示学习用GCD一样的方法有标签样本用有监督对比学习所有样本都做自监督对比学习真实的标签不会使用只是用来学习有效的特征。分类器计算类别和特征的余弦相似度为每一个类别学习一个类别中心图像特征与哪个类别中心最相似就更可能被预测为哪个类别。训练设置损失和表征学习解耦这里是用来诊断分类器的有效性都是用交叉熵损失来训练分类器所以Oracle supervision其实是一种理想情况如果我的标签质量够高分类器效果会好吗3.2 用哪种表示来构建分类器以往的分类器用的是投影层的输出GCD用的是主干网络的输出在这两种表示上用四种不同的训练方式。对旧类而言backbone 特征基本一直更适合分类对新类而言backbone 特征具有更高上限但其优势依赖高质量伪标签。3.3 表示学习应该解耦还是联合优化以往的参数化分类器方法中通常会利用分类目标对网络进行联合微调但是GCD用了kmeans后聚类过程不会反向传播影响表示学习完全解耦。所以作者想探讨联合训练是否导致了以往参数化分类器识别新类别性能下降究竟是改善表示还是会导致学习到的表示被错误的伪标签带偏。——不知道怎么形容肯定会被带偏啊联合训练本身不是好或坏它的效果取决于分类监督是否可靠3.4 问题在于有偏差的预测结果表示学习和联合训练的研究说明这两个设计本身没问题只是可靠的伪标签是很重要的不可靠的伪标签会带来什么结果呢真实新类样本→被预测为旧类随着训练进行旧类原型通常会学得更稳定分类器更容易把不确定的无标签样本分配给旧类。错误的新类伪标签又会进一步强化旧类原型于是形成循环新类样本被预测为旧类→旧类获得更多伪标签→旧类原型更强→更多新类样本被预测为旧类.有效证明了参数化分类器并非不能用于 GCD构造了一个很强、很简洁的 baseline通过自蒸馏和熵正则化改善了伪标签训练但没有从根本上解决“如何获得可信的新类监督”仍依赖预训练特征中已经存在较好的新类结构。4、本文方法在GCD的框架之上联合训练一个带有自蒸馏和熵正则化的参数化分类器对比表示学习原型分类器学习对比表示学习就是有标签的用有监督对比学习并且所有样本加上自监督对比学习4.2 参数化分类器先初始化一组原型C特征和原型计算余弦相似度经过softmax之后得到软标签而增强视图经过sharp之后得到软伪标签。对于有标签数据直接用真实标签和软标签计算交叉熵对于无标签数据用伪标签计算交叉熵进行引导并且对于无标签样本加一个簇的平均正则项。第一项是交叉熵第二项是簇平均正则项5、实验这部分懒得看了6、总结选择了GCD放弃的道路方向不用聚类做而是继续用分类器。通过实验展示了高质量的伪标签是重要的但是解决方法里没有从这里突破。下一步可以探讨的是怎么构造一个可靠的伪标签怎么确定一个伪标签的质量是可靠的。旧类偏置问题修正方向旧类和候选新类原型是否应使用不同的更新强度是否根据旧类相似度判断样本的新颖性是否需要对旧类和新类进行分组归一化