生成质量三维度:保真·多样性·可控性

入门 约 15 分钟 评估保真度多样性可控性基础概念
前置知识点(建议先学)
学习状态:

一句话定义

评价生成模型有三个互相牵制的基础维度:保真(fidelity,单张图的真实感与质量)、多样性(diversity,覆盖分布的广度)与可控性(controllability,输出服从条件的程度),几乎所有调参本质都在三者间做交换。

为什么重要

它是贯穿全库的「总账框架」:CFG 调高是可控性换多样性(kp-010);模式坍缩是保真吃掉多样性(kp-004 本节的 GAN 教训);步数与采样器是保真与速度的交换(kp-009)。把每个旋钮翻译成「谁换谁」,调参就从玄学变成策略。此外,这个框架也是 kp-026 各评估指标的设计出发点——FID 侧重分布级质量与多样性,CLIP Score 只测可控性中的对齐一项。

前置知识

kp-001(分布视角);kp-002(各谱系的大致特征,用于举例)。

核心概念

原理与机制

三个维度分别对应分布的不同侧面:保真衡量「采样点落在高密度区」,多样性衡量「采样点铺开整个分布」,可控性衡量「条件 c 把采样约束到正确的子区域」。它们天然紧张:

  1. 保真 vs 多样性:把采样集中到分布峰值附近(低温/强引导),单图更精致但千图一面;铺开采样则平均质量下降。GAN 时代的模式坍缩是极端案例——生成器发现少数「必赢」样本后放弃其余,判别器局部失守,多样性归零。
  2. 可控性 vs 多样性:条件越强,p(x|c) 越尖锐,子区域越窄。CFG 的引导强度 w 直接是这台「交换机」:w=1 完全放弃引导、w 大则提示词句句照办但画面趋于过饱和与同质化(kp-010 给出公式)。
  3. 保真 vs 可控性:强约束(如严格 ControlNet 轮廓)会迫使模型在数据分布外插值,局部细节失真;放宽约束则细节恢复但服从度下降。

现代系统的进步大多不是「三赢」,而是把交换曲线整体外推:更大的骨干与更好的条件注入让同样可控性水平下的保真与多样性都更高,但交换关系本身仍在。

图示

保真⇄多样性⇄可控性⇄保真

三角互为张力:任何一个调参动作(CFG、步数、温度类参数、控制强度)都在这条三角边上移动位置。

直观类比

像餐厅三选一:只做三道招牌菜(保真高、多样性低)、什么都做(多样性高、单道平庸)、完全按客人点单(可控性高、厨师无发挥)。任何厨房都难三者满分。

实例或案例

常见误区

自测题

  1. CFG 引导强度调大,三个维度各自怎么变?

答案要点:可控性↑、多样性↓、保真先升后降(过高出现过饱和伪影)。

  1. 什么是模式坍缩?它牺牲了哪个维度?

答案要点:生成器收敛到少数样本类型;牺牲多样性换取局部保真。

  1. 为什么 FID 不能完整评价三个维度?

答案要点:FID 主要刻画分布距离(保真+多样性的混合),不含条件对齐信息,无法测可控性。

与其他知识点的关系

kp-010 用公式实现「可控性↔多样性」交换;kp-009 是「保真↔速度」的交换;kp-026 给三个维度各自的可测量代理;kp-027 展示何时要主动压低多样性。

延伸阅读

Ho & Salimans《Classifier-Free Diffusion Guidance》对引导强度与样本质量/多样性关系的原始分析;GAN 原始论文第 5 节关于不均衡博弈的讨论。

相关知识点