历史脉络:从 GAN 王朝到扩散时代

前沿 约 25 分钟 历史脉络GAN扩散模型人物前沿
前置知识点(建议先学)
学习状态:

一句话定义

图像生成的十年主线是一条「范式接力」:2014 GAN 开创对抗生成 → 2015 扩散思想萌芽 → 2018–2019 GAN 全盛 → 2020 DDPM 让扩散登台 → 2021 扩散胜过 GAN → 2022 潜空间扩散引爆开源生态 → 2023–2024 控制生态成熟与流匹配/DiT 接棒,驱动力始终是「算力 × 数据 × 开源」的乘积。

为什么重要

懂脉络才能预判方向:今天的每个热点(流匹配、统一多模态架构、个性化生态)都是十年主线的延长线,而非凭空出现。同时,历史帮你识别「轮回」——GAN 未死、自回归回归——避免把「当前主流」误当「永恒真理」,这是领域学习者与工具使用者的分界。

前置知识

kp-002(四大谱系——本节是谱系的时间轴展开)。

核心概念

原理与机制

历史不是事件流水账,而是三条驱动力的乘积史:

  1. 算力:GAN 时代单卡可训是繁荣前提;扩散因多步迭代一度被视为「算力奢侈」,直到潜空间压缩(kp-003/kp-008)把成本压到消费级——2022 年的开源爆发本质是一次成本事件。
  2. 数据:LAION 类图文对索引补齐了文生图的数据弹药,也埋下 kp-028 的版权争议伏笔——数据层与算法层的历史是同一枚硬币。
  3. 开源与社区:SD 权重开放 → ControlNet/LoRA 插件化 → 生态网络效应,这条「发布-插件-反哺」循环是开源线与闭源产品分道演进的结构性原因。

范式更替的机制解释:GAN 赢在一步采样快、输在博弈不稳定与模式坍缩(kp-004);扩散赢在训练稳定 + 似然可控 + 天然适配条件注入(交叉注意力接口),输在多步慢——采样器研究(kp-009)与蒸馏补上了短板,胜利由此固化。每次「更替」都是「稳定性 × 可扩展性」对「速度」的兑换。

图示

2014 GAN→2015 扩散萌芽→2018–19 StyleGAN 巅峰→2020 DDPM→2021 扩散胜出→2022 SD 开源→2023 控制/LoRA 生态→2024 流匹配/DiT

直观类比

像王朝更替史:GAN 武功盖世但内乱不断(博弈失衡),扩散单兵战力(单步速度)稍逊但体制稳定(训练稳 + 条件接口好);潜空间压缩是「税收改革」,让消费级硬件养得起大军;开源则是「开科取士」,天下英才(社区)尽入彀中。

实例或案例

常见误区

自测题

  1. 复述 2014→2024 的八个关键节点。

答案要点:GAN 元年 → 扩散萌芽 → StyleGAN 巅峰 → DDPM → 扩散胜出 → SD 开源 → 控制生态 → 流匹配/DiT。

  1. 「2022 年开源爆发是成本事件」如何论证?

答案要点:组件均非新发明;潜空间压缩把多步迭代的算力成本压到消费级 + 权重开放触发社区网络效应。

  1. GAN 为什么让位?它的哪些遗产延续至今?

答案要点:博弈不稳定与坍缩 vs 扩散的稳定与条件接口;遗产包括 FID 评估与速度敏感场景的应用。

与其他知识点的关系

kp-002 是谱系静态图,本节是其时间轴;kp-005/kp-008 是「DDPM→LDM」的技术细节;kp-023 是其 2024 后的延展;kp-028 是 2023 节点的社会层投影。

延伸阅读

DDPM 与 LDM 两篇论文的引言合读,即是「扩散如何从实验室走向公众」的第一手叙述;Dhariwal & Nichol(NeurIPS 2021)是范式交接的判词。

相关知识点