一句话定义
主流图像生成技术分为四大谱系——变分自编码器(VAE)、生成对抗网络(GAN)、扩散模型(Diffusion)与自回归模型(Autoregressive),它们是同一目标(学分布、能采样)的四条不同技术路线。
为什么重要
看懂谱系才能看懂产品:Stable Diffusion = VAE + 扩散的混合体;StyleGAN 是纯 GAN 巅峰;DALL-E 一代是自回归。判断一个新模型「是什么血统」,等于预判它的速度、稳定性和伪影特征。谱系视角也是历史视角——2022 年后扩散几乎一统文生图(见 kp-030),但 VAE 与 GAN 的思想以组件形式活在每个现代系统里。
前置知识
kp-001(生成式建模的目标与 p(x|c) 框架)。
核心概念
- VAE(Variational Autoencoder,变分自编码器):编码器把图像压成带噪声的隐变量,解码器重建;训练目标含重建项与 KL 正则项,隐空间因此平滑可采样。
- GAN(Generative Adversarial Network,生成对抗网络):生成器造假、判别器辨伪,零和博弈逼出逼真样本;隐式学分布,不需要显式概率。
- 扩散模型(Diffusion Model):前向逐步加噪至纯噪声,训练网络逆转每一步去噪;采样时从噪声出发迭代还原。
- 自回归(Autoregressive):把图像离散成 token 序列,按 p(x) = ∏ p(x_i | x_{<i}) 从左到右(或逐块)生成,与语言模型同构。
原理与机制
四条路线对「怎么从噪声/隐变量到图像」给出不同答案,各自的训练信号也不同:
| 谱系 | 训练信号 | 采样方式 | 优点 | 短板 |
|---|---|---|---|---|
| VAE | 重建 + KL 下界 | 一次前向 | 隐空间平滑、训练稳定 | 输出偏糊、细节弱 |
| GAN | 对抗博弈 | 一次前向 | 快、锐利 | 训练不稳、模式坍缩(见 kp-004) |
| 扩散 | 预测噪声(MSE) | 多步迭代去噪 | 质量与多样性俱佳、可控性强 | 多步迭代慢(由采样器缓解,见 kp-009) |
| 自回归 | 逐 token 交叉熵 | 串行生成 | 与 LLM 同构、可扩展 | 量化损失、序列长、成本高 |
现代系统的关键趋势是混合:潜空间扩散(kp-008)用 VAE 做压缩前端、用扩散做生成主体,正是两条谱系的合流;DALL-E 系则把 CLIP(对比学习表征)与自回归/扩散分别组合出两代产品。
图示
直观类比
- VAE 像压缩包:存「大概样子」,解压略有失真(所以偏糊)。
- GAN 像造假币者与验钞员的军备竞赛,最后假币以假乱真。
- 扩散像雕塑家:从一块「噪声大理石」里逐刀凿出形体。
- 自回归像接龙写小说:每次只能写下一个 token,写完全篇。
实例或案例
- Stable Diffusion / SDXL:VAE(编码压缩)+ U-Net 扩散 + CLIP 条件的混合体系(kp-008 详述)。
- StyleGAN 系列:纯 GAN,风格向量控制人脸属性,至今仍用于人脸/编辑任务。
- DALL-E 一代(2021):CLIP 表征 + 自回归生成 token;DALL-E 二代改走「CLIP 潜空间 + 扩散」路线——同一个产品线完成谱系切换。
- 早期 AI 绘画(2015–2019):GAN(如渐进生长 GAN)主导;2020 年 DDPM 论文后扩散逐渐接管。
常见误区
- 误区一:「扩散模型是 VAE 的变种」。两者目标函数与生成路径完全不同;SD 只是借用 VAE 做压缩组件。
- 误区二:「GAN 已经死了」。GAN 在速度敏感场景(实时风格化、人脸编辑)仍活跃,且其判别思想影响了 GAN-free 时代的评估指标(如 FID,见 kp-026)。
- 误区三:「自回归慢所以被淘汰」。自回归思想在多模态统一模型中强势回归(图像 token 化后由 LLM 式架构处理),并非单纯的技术死胡同。
自测题
- 为什么 VAE 输出普遍偏糊而 GAN 锐利?
答案要点:VAE 以像素级重建 + KL 为目标,对不确定性取平均导致模糊;GAN 的对抗信号以「骗过判别器」为准,奖励锐利逼真,代价是训练不稳与坍缩。
- Stable Diffusion 属于哪个谱系?严格说呢?
答案要点:日常称扩散模型;严格说是「潜空间扩散」——VAE 压缩 + 扩散生成的混合架构。
- 自回归图像生成的核心假设是什么?
答案要点:把图像当作序列,用链式法则分解 p(x) = ∏ p(x_i|x_{<i}),逐 token 条件采样。
与其他知识点的关系
kp-005 起的模块 02 深入扩散谱系;kp-008 讲 VAE 与扩散的合流(潜空间扩散);kp-026 的 FID 源自 GAN 时代的评估需求;kp-030 给出四谱系的时间线。
延伸阅读
Kingma & Welling 的 VAE 原始论文(ICLR 2014)引言;Goodfellow 的 GAN 原始论文(NeurIPS 2014);Dhariwal & Nichol《Diffusion Models Beat GANs on Image Synthesis》(NeurIPS 2021)标记了谱系权柄交接。