潜空间扩散:Stable Diffusion 架构

核心 约 25 分钟 ★ 最小路径 Stable Diffusion潜空间扩散LDM架构核心原理最小路径
前置知识点(建议先学)
学习状态:

一句话定义

潜空间扩散模型(Latent Diffusion Model,LDM,Stable Diffusion 的学术底座)= VAE 压缩前端 + 在潜码上训练的扩散模型 + 经交叉注意力注入的条件编码器,三者拼成你在 ComfyUI 里看到的那张「checkpoint」。

为什么重要

这是本库从理论通向实践的一座桥:此后所有知识点(提示词、采样参数、工作流、模型谱系)讨论的对象都是这套三件套架构。理解「checkpoint 里到底装了什么」,才能解释模型加载节点为何要拆出 MODEL/CLIP/VAE 三个出口、为什么换 VAE 会偏色、为什么文本理解力由独立的文本编码器决定且可单独替换。

前置知识

kp-006(扩散训练/采样);kp-003(VAE 压缩与潜码)。

核心概念

原理与机制

架构分工如下:VAE 把 512×512×3 压成 64×64×4 潜码(压缩比约 48 倍,kp-003),训练后冻结;扩散模型在潜码上执行 kp-005/kp-006 的全套加噪-去噪流程,因空间缩小 64 倍而把多步迭代变得可交互;文本编码器把提示词变成 token 嵌入序列,经交叉注意力在每个去噪步参与引导。三者在推理时的串联即标准文生图管线(kp-022 拆解到参数级):提示词 → 文本编码 → 初始潜码(种子)→ 迭代去噪(每步含 CFG)→ VAE 解码 → 像素图。

为什么这个架构赢了:像素空间扩散(如早期 DALL-E 二代的扩散部分)每步成本高到只能离线使用;LDM 把计算主体移到潜空间后,单卡可实时出图,开源生态由此引爆。条件机制的选点也很关键:LDM 放弃了把文本嵌入拼接进卷积输入的做法,改在领域无关的交叉注意力层注入,使同一骨干天然兼容文本/语义图/布局等多种条件形态——ControlNet(kp-014)正是搭在这一接口上的后续发明。

提示词→文本编码器(CLIP)↘ 噪声 z_T(种子)→U-Net 迭代去噪(交叉注意力 ← 文本)→z₀→VAE 解码→图像

公式与推导

训练目标即 kp-006 的 L_simple,只是把 x₀ 换成潜码 z₀ = E(x):L = E‖ε − ε_θ(z_t, t, c)‖²,其中 c 为文本编码。解码端 x̂ = D(z₀)。无新增数学,重点在「在哪个空间执行」。

直观类比

整套系统像出版流水线:VAE 是「缩略图摄影师」(把原作缩成小样、定稿时放大);U-Net 是「在小样上作画的主笔」;文本编码器是「把客户需求转成笔记的编辑」,笔记(K/V)摊在主笔案头,每画一笔都翻一眼。checkpoint 不是一个「画家」,而是摄影师 + 主笔 + 编辑三人的打包合同。

实例或案例

常见误区

自测题

  1. 写出 LDM 三件套各自在推理链中的位置。

答案要点:文本编码器在最前端(条件)、扩散主干在中段(迭代去噪)、VAE 在两端(编码参考图时)与末端(解码输出)。

  1. 为什么 LDM 比像素空间扩散更适合交互式使用?

答案要点:计算主体在缩小 64 倍的潜空间,多步迭代成本下降一至两个数量级。

  1. 「换 VAE 偏色」用三件套的语言怎么解释?

答案要点:潜码坐标系属于训练它的编码器;换用另一 VAE 解码,同一潜码被映射到不同色彩统计。

与其他知识点的关系

kp-011 展开三件套中条件注入的注意力数学;kp-021/kp-022 把本架构翻译成节点图与参数清单;kp-023 沿三件套的各自演进讲模型谱系。

延伸阅读

Latent Diffusion 论文(CVPR 2022)第 3–4 节:两阶段训练与交叉注意力条件化的设计动机。

相关知识点