一句话定义
生成质量的定量评估靠三类代理指标:FID 度量「生成分布与真实分布的距离」(保真+多样性)、IS 衡量「类内清晰度与类间多样性」、CLIP Score 度量「图文对齐」(可控性),但任何定量指标都压不过人的判断,最终裁决仍是人评。
为什么重要
读模型榜单、比较两次微调效果、回答「我的 LoRA 有没有变好」都绕不开指标。更重要的是知道指标的盲区:FID 高的模型不一定难看(分布参考集不同)、CLIP Score 高不一定美(只测对齐)——理解每个指标在 kp-004 三维度坐标里的位置,才能既用指标又不被指标骗。
前置知识
kp-004(保真/多样性/可控性框架——指标是三维度的人工代理)。
核心概念
- FID(Fréchet Inception Distance):两组图像在 Inception 网络特征空间中,用高斯近似后的 Fréchet 距离。
- IS(Inception Score):用 Inception 分类器衡量生成图的类内确信度与类间分布均匀度。
- CLIP Score:图文嵌入的余弦相似度,代理「提示词遵循度」。
- 人评(human evaluation):成对比较或打分(如美学分、MPS 类人工偏好打分),金标准。
- 参考集敏感性:FID 数值依赖参考统计集,跨数据集的 FID 不可比。
原理与机制
FID:把每张图过 Inception 网络取倒数第二层特征,对生成集与真实集各估一个高斯 N(μ, Σ),距离为:
FID = ‖μr − μg‖² + Tr( Σr + Σg − 2(ΣrΣg)1/2 )
同时惩罚「均值偏移」(保真)与「协方差收缩」(多样性),故被视为 kp-004 前两维的联合代理。使用三戒:样本量——FID 估计在小样本(<1 万)下方差大、普遍偏高,社区小样本 FID 只作趋势参考;参考集固定——与不同真实集算出的 FID 不可横比;Inception 域偏移——Inception 见过的是 ImageNet,对插画/艺术风格的特征表达有偏。IS 是 FID 的前代:熵项设计使「类内确定 + 类间多样」得高分,但对模式坍缩不敏感(坍缩到少数类时类内仍可「确定」)、且不含条件信息,现多退居历史文献。CLIP Score 直接给可控性打分:cos(CLIP(img), CLIP(text)),成本低、可大批量跑,是提示词遵循度的标准代理;盲区是只测对齐不测质量——一张惨不忍睹但内容对题的图也能拿高分。人评:成对比较(A/B 哪张好)与多档打分是最终标准,代价是贵且慢;大规模人评数据(如人类偏好排序集)反过来训练美学评估模型,成为「自动人评」。
指标选择决策:比较分布级质量与多样性 → FID(大样本、同参考集);测提示词遵循 → CLIP Score;交付判断与模型选型 → 人评(哪怕 5 个人的 A/B)。三者对应 kp-004 三角的不同的边——没有单一指标覆盖三角。
公式与推导
FID 公式(上行)的构造逻辑:二维高斯的 Fréchet 距离有闭式解(均值项 + 迹项),把它搬到 Inception 特征空间;迹项中的 (Σ_rΣ_g)^{1/2} 是矩阵平方根,数值实现用特征分解。推导层面需理解的两点:均值项 ≈ 集合级「平均长相」差异(保真),迹项捕捉形状/多样性差异;两者都低才是「分布像」。
图示
| 指标 | 测什么(kp-004 坐标) | 成本 | 主要盲区 |
|---|---|---|---|
| FID | 保真+多样性(分布级) | 高(需大样本) | 参考集依赖、Inception 偏置 |
| IS | 清晰度+多样性 | 中 | 不测对齐、对坍缩钝感 |
| CLIP Score | 可控性(对齐) | 低 | 不测质量、CLIP 自身偏置 |
| 人评 | 三角全测 | 最高 | 主观、难复现 |
直观类比
FID 像「两组学生的成绩分布对比」——平均值差多少(保真)、离散度像不像(多样性),但看不出「谁更有创造力」(可控性);CLIP Score 像「答题对没对」(对题),不管卷面(质量);人评是「面试官综合印象」——贵,但说了算。
实例或案例
- 微调对比实战:两次 LoRA 各生成 2000 张与固定真实集算 FID——只能得出「分布距离趋势」,交稿前仍需 20 张抽样人评定稿;小样本 FID 的「3 分之差」远在噪声区间内,不足为凭。
- CLIP Score 陷阱:把提示词写成模型训练 caption 的模板句(「trending on artstation」),对齐分飙升而画面平庸——对齐分可被语料锚点「刷」高(与 kp-025 的语义污染同源)。
- 榜单读法:两模型 FID 相近时看人评,人评也相近时看风格偏好——指标排名 ≠ 使用体验排名。
常见误区
- 误区一:FID 低 = 图好看。FID 是分布级代理,Inception 特征空间对「人眼敏感的美感」不完整;且跨参考集不可比。
- 误区二:CLIP Score 高 = 质量高。它完全不测画质;画质要靠人评或美学模型。
- 误区三:小样本 FID 可以精确排名。万张以下 FID 方差显著,差距小于噪声的排名没有意义。
自测题
- 写出 FID 公式并说明均值项与迹项分别惩罚什么。
答案要点:‖μ_r−μ_g‖² + Tr(Σ_r+Σ_g−2(Σ_rΣ_g)^{1/2});均值项惩罚保真偏移,迹项惩罚分布形状/多样性差异。
- 为什么 CLIP Score 不能替代人评?
答案要点:只测图文对齐,不测画质与美感;一张对题但劣质的图可得高分。
- 用 500 张样本算出的 FID 差距 2 分,能下结论吗?
答案要点:不能——小样本 FID 方差大,差距在噪声区间内,需扩大样本或改用人评。
与其他知识点的关系
kp-004 是指标设计的理论坐标;kp-025 的失败率统计是人评的细分维度;kp-027 的一致性评估常用「同提示多样本方差」这类派生量。
延伸阅读
FID 原始论文(Heusel et al., NeurIPS 2017)第 2 节的推导;CLIP 论文的 zero-shot 分类实验是「CLIP 作评估器」的思想源头。