一句话定义
潜空间扩散模型(Latent Diffusion Model,LDM,Stable Diffusion 的学术底座)= VAE 压缩前端 + 在潜码上训练的扩散模型 + 经交叉注意力注入的条件编码器,三者拼成你在 ComfyUI 里看到的那张「checkpoint」。
为什么重要
这是本库从理论通向实践的一座桥:此后所有知识点(提示词、采样参数、工作流、模型谱系)讨论的对象都是这套三件套架构。理解「checkpoint 里到底装了什么」,才能解释模型加载节点为何要拆出 MODEL/CLIP/VAE 三个出口、为什么换 VAE 会偏色、为什么文本理解力由独立的文本编码器决定且可单独替换。
前置知识
kp-006(扩散训练/采样);kp-003(VAE 压缩与潜码)。
核心概念
- 三件套:VAE(编码/解码)、去噪网络(U-Net 或 DiT)、文本编码器(CLIP,新系另有 T5)。
- checkpoint:三件套权重打包的发布形态;生态里另有只含 LoRA/embedding 的派生文件。
- 交叉注意力注入(cross-attention injection):条件不经拼接进入网络,而是在每个注意力层以 K/V 来源注入(机制见 kp-011)。
- 第一阶段预训练 + 第二阶段扩散:LDM 论文的两阶段训练法——先训 VAE,再冻结 VAE 训扩散。
原理与机制
架构分工如下:VAE 把 512×512×3 压成 64×64×4 潜码(压缩比约 48 倍,kp-003),训练后冻结;扩散模型在潜码上执行 kp-005/kp-006 的全套加噪-去噪流程,因空间缩小 64 倍而把多步迭代变得可交互;文本编码器把提示词变成 token 嵌入序列,经交叉注意力在每个去噪步参与引导。三者在推理时的串联即标准文生图管线(kp-022 拆解到参数级):提示词 → 文本编码 → 初始潜码(种子)→ 迭代去噪(每步含 CFG)→ VAE 解码 → 像素图。
为什么这个架构赢了:像素空间扩散(如早期 DALL-E 二代的扩散部分)每步成本高到只能离线使用;LDM 把计算主体移到潜空间后,单卡可实时出图,开源生态由此引爆。条件机制的选点也很关键:LDM 放弃了把文本嵌入拼接进卷积输入的做法,改在领域无关的交叉注意力层注入,使同一骨干天然兼容文本/语义图/布局等多种条件形态——ControlNet(kp-014)正是搭在这一接口上的后续发明。
公式与推导
训练目标即 kp-006 的 L_simple,只是把 x₀ 换成潜码 z₀ = E(x):L = E‖ε − ε_θ(z_t, t, c)‖²,其中 c 为文本编码。解码端 x̂ = D(z₀)。无新增数学,重点在「在哪个空间执行」。
直观类比
整套系统像出版流水线:VAE 是「缩略图摄影师」(把原作缩成小样、定稿时放大);U-Net 是「在小样上作画的主笔」;文本编码器是「把客户需求转成笔记的编辑」,笔记(K/V)摊在主笔案头,每画一笔都翻一眼。checkpoint 不是一个「画家」,而是摄影师 + 主笔 + 编辑三人的打包合同。
实例或案例
- ComfyUI 的 CheckpointLoader 节点有三个输出口:MODEL、CLIP、VAE——正对应三件套;KSampler 吃 MODEL,CLIPTextEncode 吃 CLIP,VAE Decode 吃 VAE(kp-021 用节点图重新表述本节)。
- 实践中的「模型混血」:主干用 A 模型、文本编码器借自 B、VAE 换成修复强化版——因为三件套接口独立,可分别替换(但文本编码器与主干需配套训练,乱配会语义错乱)。
- SD1.5 三件套规模(截至 2026-10 公开资料):U-Net 约 8.6 亿、CLIP 文本塔约 1.23 亿、VAE 约 8400 万参数——U-Net 占绝对大头,决定显存基线。
常见误区
- 误区一:「Stable Diffusion 是一个模型」。它是三个模型协作的系统;「换模型」的实践里换 VAE、换文本编码器、换主干的效果与风险各不相同。
- 误区二:文本编码器可与主干随意互换。交叉注意力的 K/V 空间由成对训练确定,跨系混用(如把 SD1.5 的 CLIP 接到 SDXL 主干)会导致提示完全失效或语义漂移。
- 误区三:潜码中「已经」有细节。潜码只有语义布局,纹理细节由 VAE 解码器按统计规律补出——这解释了为什么不同 VAE 解码同一潜码质感不同。
自测题
- 写出 LDM 三件套各自在推理链中的位置。
答案要点:文本编码器在最前端(条件)、扩散主干在中段(迭代去噪)、VAE 在两端(编码参考图时)与末端(解码输出)。
- 为什么 LDM 比像素空间扩散更适合交互式使用?
答案要点:计算主体在缩小 64 倍的潜空间,多步迭代成本下降一至两个数量级。
- 「换 VAE 偏色」用三件套的语言怎么解释?
答案要点:潜码坐标系属于训练它的编码器;换用另一 VAE 解码,同一潜码被映射到不同色彩统计。
与其他知识点的关系
kp-011 展开三件套中条件注入的注意力数学;kp-021/kp-022 把本架构翻译成节点图与参数清单;kp-023 沿三件套的各自演进讲模型谱系。
延伸阅读
Latent Diffusion 论文(CVPR 2022)第 3–4 节:两阶段训练与交叉注意力条件化的设计动机。