生成质量评估:FID·CLIP Score·人评

进阶 约 25 分钟 评估FIDCLIP Score人工评价指标进阶专题
前置知识点(建议先学)
学习状态:

一句话定义

生成质量的定量评估靠三类代理指标:FID 度量「生成分布与真实分布的距离」(保真+多样性)、IS 衡量「类内清晰度与类间多样性」、CLIP Score 度量「图文对齐」(可控性),但任何定量指标都压不过人的判断,最终裁决仍是人评。

为什么重要

读模型榜单、比较两次微调效果、回答「我的 LoRA 有没有变好」都绕不开指标。更重要的是知道指标的盲区:FID 高的模型不一定难看(分布参考集不同)、CLIP Score 高不一定美(只测对齐)——理解每个指标在 kp-004 三维度坐标里的位置,才能既用指标又不被指标骗。

前置知识

kp-004(保真/多样性/可控性框架——指标是三维度的人工代理)。

核心概念

原理与机制

FID:把每张图过 Inception 网络取倒数第二层特征,对生成集与真实集各估一个高斯 N(μ, Σ),距离为:

FID = ‖μr − μg‖² + Tr( Σr + Σg − 2(ΣrΣg)1/2 )

同时惩罚「均值偏移」(保真)与「协方差收缩」(多样性),故被视为 kp-004 前两维的联合代理。使用三戒:样本量——FID 估计在小样本(<1 万)下方差大、普遍偏高,社区小样本 FID 只作趋势参考;参考集固定——与不同真实集算出的 FID 不可横比;Inception 域偏移——Inception 见过的是 ImageNet,对插画/艺术风格的特征表达有偏。IS 是 FID 的前代:熵项设计使「类内确定 + 类间多样」得高分,但对模式坍缩不敏感(坍缩到少数类时类内仍可「确定」)、且不含条件信息,现多退居历史文献。CLIP Score 直接给可控性打分:cos(CLIP(img), CLIP(text)),成本低、可大批量跑,是提示词遵循度的标准代理;盲区是只测对齐不测质量——一张惨不忍睹但内容对题的图也能拿高分。人评:成对比较(A/B 哪张好)与多档打分是最终标准,代价是贵且慢;大规模人评数据(如人类偏好排序集)反过来训练美学评估模型,成为「自动人评」。

指标选择决策:比较分布级质量与多样性 → FID(大样本、同参考集);测提示词遵循 → CLIP Score;交付判断与模型选型 → 人评(哪怕 5 个人的 A/B)。三者对应 kp-004 三角的不同的边——没有单一指标覆盖三角。

公式与推导

FID 公式(上行)的构造逻辑:二维高斯的 Fréchet 距离有闭式解(均值项 + 迹项),把它搬到 Inception 特征空间;迹项中的 (Σ_rΣ_g)^{1/2} 是矩阵平方根,数值实现用特征分解。推导层面需理解的两点:均值项 ≈ 集合级「平均长相」差异(保真),迹项捕捉形状/多样性差异;两者都低才是「分布像」。

图示

指标测什么(kp-004 坐标)成本主要盲区
FID保真+多样性(分布级)高(需大样本)参考集依赖、Inception 偏置
IS清晰度+多样性中不测对齐、对坍缩钝感
CLIP Score可控性(对齐)低不测质量、CLIP 自身偏置
人评三角全测最高主观、难复现

直观类比

FID 像「两组学生的成绩分布对比」——平均值差多少(保真)、离散度像不像(多样性),但看不出「谁更有创造力」(可控性);CLIP Score 像「答题对没对」(对题),不管卷面(质量);人评是「面试官综合印象」——贵,但说了算。

实例或案例

常见误区

自测题

  1. 写出 FID 公式并说明均值项与迹项分别惩罚什么。

答案要点:‖μ_r−μ_g‖² + Tr(Σ_r+Σ_g−2(Σ_rΣ_g)^{1/2});均值项惩罚保真偏移,迹项惩罚分布形状/多样性差异。

  1. 为什么 CLIP Score 不能替代人评?

答案要点:只测图文对齐,不测画质与美感;一张对题但劣质的图可得高分。

  1. 用 500 张样本算出的 FID 差距 2 分,能下结论吗?

答案要点:不能——小样本 FID 方差大,差距在噪声区间内,需扩大样本或改用人评。

与其他知识点的关系

kp-004 是指标设计的理论坐标;kp-025 的失败率统计是人评的细分维度;kp-027 的一致性评估常用「同提示多样本方差」这类派生量。

延伸阅读

FID 原始论文(Heusel et al., NeurIPS 2017)第 2 节的推导;CLIP 论文的 zero-shot 分类实验是「CLIP 作评估器」的思想源头。

相关知识点