一句话定义
评价生成模型有三个互相牵制的基础维度:保真(fidelity,单张图的真实感与质量)、多样性(diversity,覆盖分布的广度)与可控性(controllability,输出服从条件的程度),几乎所有调参本质都在三者间做交换。
为什么重要
它是贯穿全库的「总账框架」:CFG 调高是可控性换多样性(kp-010);模式坍缩是保真吃掉多样性(kp-004 本节的 GAN 教训);步数与采样器是保真与速度的交换(kp-009)。把每个旋钮翻译成「谁换谁」,调参就从玄学变成策略。此外,这个框架也是 kp-026 各评估指标的设计出发点——FID 侧重分布级质量与多样性,CLIP Score 只测可控性中的对齐一项。
前置知识
kp-001(分布视角);kp-002(各谱系的大致特征,用于举例)。
核心概念
- 保真(fidelity):单样本质量——细节、结构合理性、伪影多少。
- 多样性(diversity):同条件下多次采样的差异度,即分布覆盖面。
- 可控性(controllability):输出与条件(提示词、控制图)的一致程度,含语义对齐与结构对齐。
- 模式坍缩(mode collapse):生成器只产出少数几种样本,多样性崩塌。
- 保真—多样性权衡(fidelity-diversity trade-off):分布级此消彼长关系。
原理与机制
三个维度分别对应分布的不同侧面:保真衡量「采样点落在高密度区」,多样性衡量「采样点铺开整个分布」,可控性衡量「条件 c 把采样约束到正确的子区域」。它们天然紧张:
- 保真 vs 多样性:把采样集中到分布峰值附近(低温/强引导),单图更精致但千图一面;铺开采样则平均质量下降。GAN 时代的模式坍缩是极端案例——生成器发现少数「必赢」样本后放弃其余,判别器局部失守,多样性归零。
- 可控性 vs 多样性:条件越强,p(x|c) 越尖锐,子区域越窄。CFG 的引导强度 w 直接是这台「交换机」:w=1 完全放弃引导、w 大则提示词句句照办但画面趋于过饱和与同质化(kp-010 给出公式)。
- 保真 vs 可控性:强约束(如严格 ControlNet 轮廓)会迫使模型在数据分布外插值,局部细节失真;放宽约束则细节恢复但服从度下降。
现代系统的进步大多不是「三赢」,而是把交换曲线整体外推:更大的骨干与更好的条件注入让同样可控性水平下的保真与多样性都更高,但交换关系本身仍在。
图示
三角互为张力:任何一个调参动作(CFG、步数、温度类参数、控制强度)都在这条三角边上移动位置。
直观类比
像餐厅三选一:只做三道招牌菜(保真高、多样性低)、什么都做(多样性高、单道平庸)、完全按客人点单(可控性高、厨师无发挥)。任何厨房都难三者满分。
实例或案例
- GAN 数字实验的教训:早期 MNIST GAN 只生成「1」和「7」且极其逼真——保真 100、多样性 10,典型模式坍缩。
- CFG 旋钮实测(SD 系):w=5 时同一提示词多次出图差异大(多样性高);w=14 时构图趋同、色彩过饱和(可控性高、多样性低、局部保真受损)。
- 评估映射:FID 同时隐含保真与多样性信息;CLIP Score 只给可控性的对齐分;人工评价(kp-026)才能三角全看。
常见误区
- 误区一:「质量」只有一个数。说「模型 A 比 B 好」必须问在哪个维度、什么条件下;保真排行榜第一名可能可控性很差。
- 误区二:多样性越高越好。生产场景常需要稳定可复现(kp-027 一致性),多样性此时是成本。
- 误区三:模式坍缩是「生成器坏了」。它是博弈动力学失衡的系统性结果,不是单点 bug,调参(如特征匹配、多样性正则)只能缓解。
自测题
- CFG 引导强度调大,三个维度各自怎么变?
答案要点:可控性↑、多样性↓、保真先升后降(过高出现过饱和伪影)。
- 什么是模式坍缩?它牺牲了哪个维度?
答案要点:生成器收敛到少数样本类型;牺牲多样性换取局部保真。
- 为什么 FID 不能完整评价三个维度?
答案要点:FID 主要刻画分布距离(保真+多样性的混合),不含条件对齐信息,无法测可控性。
与其他知识点的关系
kp-010 用公式实现「可控性↔多样性」交换;kp-009 是「保真↔速度」的交换;kp-026 给三个维度各自的可测量代理;kp-027 展示何时要主动压低多样性。
延伸阅读
Ho & Salimans《Classifier-Free Diffusion Guidance》对引导强度与样本质量/多样性关系的原始分析;GAN 原始论文第 5 节关于不均衡博弈的讨论。