ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

IS(Inception Score)与 FID(Fréchet Inception Distance)

2026/9/6 4:35:34 拓冰建站 浏览量
IS(Inception Score)与 FID(Fréchet Inception Distance) ISInception Score与 FIDFréchet Inception Distance二者都是 GAN、扩散模型最常用的无参考 / 有参考图像生成客观评估指标都复用 Inception‑v3 预训练网络但设计思路、输入、优缺点完全不同。1. Inception Score (IS)用来自动评估图像生成模型输出的质量 多样性。只输入生成图像不需要真实图片。公式ISexp⁡(Ex∼pgen[DKL(p(y∣x)∥p(y))])IS\exp\big(\mathbb{E}_{x\sim p_{gen}} \big[D_{KL}\big(p(y|x)\parallel p(y)\big)\big]\big)ISexp(Ex∼pgen​​[DKL​(p(y∣x)∥p(y))])两层评估逻辑单张图像质量(p(y|x))输入一张生成图Inception‑v3 输出各类别概率分布。图片清晰、物体明确分类器置信度高概率集中熵小图模糊噪声大概率分散。生成样本整体多样性(p(y))全部生成图片统计得到的平均类别分布。生成图片类别丰富(p(y))趋近均匀分布多样性高模式坍塌只生成少数几类多样性下降。✅IS 越高越好缺点不和真实图像做对比。就算生成现实不存在的怪异图像只要分类器自信、类别分散IS 依然可以很高。对模式坍塌有一定容忍少量图片反复复制采样只要类别不同IS 依旧虚高。Inception‑v3 在 ImageNet1k 训练非 ImageNet 数据集漫画、人脸、医学图评估不准。2. FID Fréchet Inception Distance用来衡量生成图像分布和真实图像分布之间的差距;必须同时输入生成图像集合 真实图像集合。把图像送入 Inception‑v3取中间特征向量不是分类输出概率把图像集合建模为多维高斯分布计算真实分布与生成分布之间 Fréchet 距离。FID∥μr−μg∥22Tr(ΣrΣg−2(Σr12ΣgΣr12)12)\text{FID} \left\|\mu_r-\mu_g\right\|_2^2 \mathrm{Tr}\Big(\Sigma_r\Sigma_g - 2\left(\Sigma_r^{\frac{1}{2}}\Sigma_g\Sigma_r^{\frac{1}{2}}\right)^{\frac{1}{2}}\Big)FID∥μr​−μg​∥22​Tr(Σr​Σg​−2(Σr21​​Σg​Σr21​​)21​)μr,Σr\mu_r,\Sigma_rμr​,Σr​真实图片特征的均值、协方差μg,Σg\mu_g,\Sigma_gμg​,Σg​生成图片特征的均值、协方差✅FID 越低越好FID0 代表两个分布完全一致两层评估逻辑均值项(|\mu_r-\mu_g|_2^2)捕捉特征空间整体偏移比如生成图整体偏色、画风跑偏。协方差迹项捕捉样本多样性模式坍塌时生成样本特征集中协方差收缩FID 显著上升。缺点强依赖样本数量样本少的时候均值协方差估计不稳定数值抖动ImageNet 实验通常至少 5k‑10k 张图。依赖 Inception‑v3 预训练特征跨域数据集效果会下降。集合层面指标FID 低 ≠ 每一张图都好看少量坏样本不会剧烈拉高 FID。IS vs FID 对比表表格对比项ISInception ScoreFID所需数据仅生成图像生成图像 真实参考图像集网络使用部分Inception 输出层分类概率Inception 中间层特征向量核心目标图片可识别度、生成样本内部多样性生成分布贴近真实图像分布的程度好坏方向分数越高越好分数越低越好模式坍塌敏感度低容易被欺骗高坍塌会明显恶化 FID是否对标真实世界❌ 不对比真实图✅ 和真实图片做分布比对论文定位辅助参考指标图像生成主流核心指标实操读论文注意点现代扩散论文优先看 FIDIS 只做辅助CFG 引导强度 w 变大FID 先下降w 过大后出现伪影FID 重新上涨IS 高不能说明生成图真实只能说明 “分类器能识别图里物体”小样本下的 FID 没有可信度一定要看论文采样多少张图像计算指标。补充文生图场景IS/FID 都是集合统计想要评估图片和文本 prompt 匹配度看 CLIP‑Score。如果你需要我可以顺带把 IS、FID、CLIP‑Score 三者放到一起做一页速记方便看论文的时候快速查阅。