一句话定义
开源文生图主线沿「SD1.5(2022,U-Net+CLIP,512 基准)→ SDXL(2023,更大 U-Net+双编码器,1024 基准)→ SD3/3.5(2024,MM-DiT+流匹配+T5)→ Flux(2024,12B 流匹配)」演进,三代跨越了「架构、训练目标、文本理解」三条轴线。
时效声明:模型版本迭代极快,本节以 2026-10 时点的主流格局为快照;「机制与轴线」长期有效,「版本与参数」仅为示例。
为什么重要
选错基座是一切调参努力的隐形上限:提示词写得再好,基座没有的文本理解力变不出来;显存不够时再好的模型也跑不起来。谱系知识让你能按「生态、硬件、任务」三轴选型,也让你看懂每次新模型发布时宣传语的机制含义(「换流匹配」意味着什么、「MM-DiT」改变了哪条链路)。
前置知识
kp-008(三件套)、kp-007(U-Net/DiT 骨干)、kp-011(文本编码器)。
核心概念
- SD1.5:U-Net(~8.6 亿参数)+ 单 CLIP(77 token)+ VAE,512² 基准,生态史上最厚(LoRA/ControlNet/微调产物最多)。
- SDXL:U-Net 扩至约 26 亿 + 双文本编码器(CLIP ViT-L + OpenCLIP bigG),1024² 基准,宽高比自适应条件。
- SD3/3.5:MM-DiT 架构(文本与图像 token 同堆栈联合注意力)+ 流匹配目标 + T5 文本塔,文本遵循力跃迁。
- Flux:12B 参数流匹配 MM-DiT 系(Black Forest Labs,SD 原班人马创立),指令遵循与文字渲染强,资源需求高。
- 流匹配(flow matching):把「噪声↔数据」建模为直线路径的插值回归,训练目标从 ε 预测变为速度场预测,采样轨迹更直、低步数更稳。
原理与机制
三代演进正好对应三条机制轴。架构轴(kp-007):SD1.5/SDXL 的卷积 U-Net 被证明可扩展性有限——SDXL 用「加宽加深 + 更多注意力层」榨性能;SD3 起换 MM-DiT,把 LLM 式缩放律引入图像生成,此后「更大=更好」重新成立。目标轴(kp-006):ε 预测 → v 预测 → 流匹配,本质是把「去噪轨迹」从弯曲的随机过程优化成近似直线——直线轨迹允许更少的积分步数,这是新一代模型「少步数也不崩」的数学根据(与 kp-009 呼应)。文本轴(kp-011):单 CLIP(词袋级)→ 双 CLIP(更宽语义)→ 叠加 T5(真正的句法理解),文字渲染与复杂指令遵循的提升主要来自这条轴。
选型三轴(示例快照,随生态变化):
| 轴 | 推荐 | 理由 |
|---|---|---|
| 生态/二次创作最厚 | SD1.5 / SDXL | LoRA、ControlNet、历史资产最多;SDXL 兼顾质量 |
| 消费级显存(≤8G) | SD1.5、SDXL(fp16/tiled) | 主干小、有成熟分块方案 |
| 文本渲染/复杂指令 | SD3.5 / Flux | T5 + 流匹配 + 大参数的合力 |
| 追求最高质量、显存充裕 | Flux 系 | 12B 级、机制最新 |
兼容性注意:三代的潜码分辨率约定(kp-003)、文本编码器空间(kp-008 误区三)、采样器适用性(kp-009 的 Turbo 类绑定)互不通用——「跨代混装」是工作流报错的高发区。
图示
三条轴:架构(卷积 U-Net → Transformer)、目标(ε → v → 流)、文本(CLIP → +T5)。
直观类比
像三代相机:SD1.5 是「胶片单反」——配件二手市场最繁荣;SDXL 是「全画幅数码」——底片更大、镜头通用性开始分家;SD3/Flux 是「新一代微单」——换了取景原理(流匹配),老镜头要转接环(兼容层)才能用。
实例或案例
- 8G 显存跑 Flux:量化版 + 大显存换出策略可行但慢;同硬件跑 SDXL fp16 流畅——「最好的模型」与「你能跑的模型」常不是同一个。
- 文字渲染对比:给三系模型同一提示「a sign that says OPEN」:SD1.5/SDXL 常出乱码,SD3.5/Flux 多数能写对——文本轴升级的直接证据。
- 社区资产复用:想把 SD1.5 时代的珍藏 LoRA 搬上 SDXL——不兼容,需找 SDXL 版或用 SDXL 基座重训(权重空间不通用,kp-015)。
常见误区
- 误区一:新模型全面碾压旧模型。在生态资产、小显存适配、特定风格微调密度上,SD1.5/SDXL 仍是许多工作流的理性选择;「先进」与「合适」是两个维度。
- 误区二:SDXL 是 SD3 的前代。SDXL 与 SD3 分属不同架构世代(U-Net 系 vs MM-DiT 系),命名连续但技术断代。
- 误区三:流匹配是「另一种扩散」。它是同一框架内的训练目标与轨迹形状改良(kp-006 的 v/流参数化延伸),前向加噪-反向去噪的世界观未变。
自测题
- 三代演进的三条机制轴分别是什么?
答案要点:架构(U-Net→MM-DiT)、训练目标(ε→v→流匹配)、文本编码(CLIP→+T5)。
- 为什么流匹配系模型低步数更稳?
答案要点:流匹配把噪声到数据的轨迹优化为近似直线,直线轨迹用更少的数值积分步即可逼近。
- SD1.5 的 LoRA 为什么不能直接用于 SDXL?
答案要点:两者权重空间与网络结构不同,低秩增量绑定原基座的权重坐标系。
与其他知识点的关系
kp-007 的骨干演进是架构轴的细节;kp-006/kp-009 的目标与采样联系目标轴;kp-011 联系文本轴;kp-021/kp-024 决定「加载哪个、跑不跑得动」。
延伸阅读
SDXL 论文(ICLR 2024)关于分辨率条件与双编码器的设计动机;SD3 论文(ICML 2024)第 1~2 节对流匹配与 MM-DiT 的论证。