生成模型四大谱系:VAE·GAN·扩散·自回归

入门 约 20 分钟 谱系VAEGAN扩散模型自回归历史脉络
前置知识点(建议先学)
学习状态:

一句话定义

主流图像生成技术分为四大谱系——变分自编码器(VAE)、生成对抗网络(GAN)、扩散模型(Diffusion)与自回归模型(Autoregressive),它们是同一目标(学分布、能采样)的四条不同技术路线。

为什么重要

看懂谱系才能看懂产品:Stable Diffusion = VAE + 扩散的混合体;StyleGAN 是纯 GAN 巅峰;DALL-E 一代是自回归。判断一个新模型「是什么血统」,等于预判它的速度、稳定性和伪影特征。谱系视角也是历史视角——2022 年后扩散几乎一统文生图(见 kp-030),但 VAE 与 GAN 的思想以组件形式活在每个现代系统里。

前置知识

kp-001(生成式建模的目标与 p(x|c) 框架)。

核心概念

原理与机制

四条路线对「怎么从噪声/隐变量到图像」给出不同答案,各自的训练信号也不同:

谱系训练信号采样方式优点短板
VAE重建 + KL 下界一次前向隐空间平滑、训练稳定输出偏糊、细节弱
GAN对抗博弈一次前向快、锐利训练不稳、模式坍缩(见 kp-004)
扩散预测噪声(MSE)多步迭代去噪质量与多样性俱佳、可控性强多步迭代慢(由采样器缓解,见 kp-009)
自回归逐 token 交叉熵串行生成与 LLM 同构、可扩展量化损失、序列长、成本高

现代系统的关键趋势是混合:潜空间扩散(kp-008)用 VAE 做压缩前端、用扩散做生成主体,正是两条谱系的合流;DALL-E 系则把 CLIP(对比学习表征)与自回归/扩散分别组合出两代产品。

图示

噪声 / token 起点→GAN:一步映射|VAE:解码一步|扩散:N 步去噪|自回归:逐 token→图像

直观类比

实例或案例

常见误区

自测题

  1. 为什么 VAE 输出普遍偏糊而 GAN 锐利?

答案要点:VAE 以像素级重建 + KL 为目标,对不确定性取平均导致模糊;GAN 的对抗信号以「骗过判别器」为准,奖励锐利逼真,代价是训练不稳与坍缩。

  1. Stable Diffusion 属于哪个谱系?严格说呢?

答案要点:日常称扩散模型;严格说是「潜空间扩散」——VAE 压缩 + 扩散生成的混合架构。

  1. 自回归图像生成的核心假设是什么?

答案要点:把图像当作序列,用链式法则分解 p(x) = ∏ p(x_i|x_{<i}),逐 token 条件采样。

与其他知识点的关系

kp-005 起的模块 02 深入扩散谱系;kp-008 讲 VAE 与扩散的合流(潜空间扩散);kp-026 的 FID 源自 GAN 时代的评估需求;kp-030 给出四谱系的时间线。

延伸阅读

Kingma & Welling 的 VAE 原始论文(ICLR 2014)引言;Goodfellow 的 GAN 原始论文(NeurIPS 2014);Dhariwal & Nichol《Diffusion Models Beat GANs on Image Synthesis》(NeurIPS 2021)标记了谱系权柄交接。

相关知识点