开源模型谱系:SD1.5·SDXL·SD3·Flux

进阶 约 25 分钟 模型谱系SD1.5SDXLSD3Flux流匹配进阶专题
前置知识点(建议先学)
学习状态:

一句话定义

开源文生图主线沿「SD1.5(2022,U-Net+CLIP,512 基准)→ SDXL(2023,更大 U-Net+双编码器,1024 基准)→ SD3/3.5(2024,MM-DiT+流匹配+T5)→ Flux(2024,12B 流匹配)」演进,三代跨越了「架构、训练目标、文本理解」三条轴线。

时效声明:模型版本迭代极快,本节以 2026-10 时点的主流格局为快照;「机制与轴线」长期有效,「版本与参数」仅为示例。

为什么重要

选错基座是一切调参努力的隐形上限:提示词写得再好,基座没有的文本理解力变不出来;显存不够时再好的模型也跑不起来。谱系知识让你能按「生态、硬件、任务」三轴选型,也让你看懂每次新模型发布时宣传语的机制含义(「换流匹配」意味着什么、「MM-DiT」改变了哪条链路)。

前置知识

kp-008(三件套)、kp-007(U-Net/DiT 骨干)、kp-011(文本编码器)。

核心概念

原理与机制

三代演进正好对应三条机制轴。架构轴(kp-007):SD1.5/SDXL 的卷积 U-Net 被证明可扩展性有限——SDXL 用「加宽加深 + 更多注意力层」榨性能;SD3 起换 MM-DiT,把 LLM 式缩放律引入图像生成,此后「更大=更好」重新成立。目标轴(kp-006):ε 预测 → v 预测 → 流匹配,本质是把「去噪轨迹」从弯曲的随机过程优化成近似直线——直线轨迹允许更少的积分步数,这是新一代模型「少步数也不崩」的数学根据(与 kp-009 呼应)。文本轴(kp-011):单 CLIP(词袋级)→ 双 CLIP(更宽语义)→ 叠加 T5(真正的句法理解),文字渲染与复杂指令遵循的提升主要来自这条轴。

选型三轴(示例快照,随生态变化):

轴推荐理由
生态/二次创作最厚SD1.5 / SDXLLoRA、ControlNet、历史资产最多;SDXL 兼顾质量
消费级显存(≤8G)SD1.5、SDXL(fp16/tiled)主干小、有成熟分块方案
文本渲染/复杂指令SD3.5 / FluxT5 + 流匹配 + 大参数的合力
追求最高质量、显存充裕Flux 系12B 级、机制最新

兼容性注意:三代的潜码分辨率约定(kp-003)、文本编码器空间(kp-008 误区三)、采样器适用性(kp-009 的 Turbo 类绑定)互不通用——「跨代混装」是工作流报错的高发区。

图示

SD1.5(2022)U-Net·CLIP·512→SDXL(2023)大 U-Net·双编码器·1024→SD3/3.5(2024)MM-DiT·流匹配·T5→Flux(2024)12B·流匹配

三条轴:架构(卷积 U-Net → Transformer)、目标(ε → v → 流)、文本(CLIP → +T5)。

直观类比

像三代相机:SD1.5 是「胶片单反」——配件二手市场最繁荣;SDXL 是「全画幅数码」——底片更大、镜头通用性开始分家;SD3/Flux 是「新一代微单」——换了取景原理(流匹配),老镜头要转接环(兼容层)才能用。

实例或案例

常见误区

自测题

  1. 三代演进的三条机制轴分别是什么?

答案要点:架构(U-Net→MM-DiT)、训练目标(ε→v→流匹配)、文本编码(CLIP→+T5)。

  1. 为什么流匹配系模型低步数更稳?

答案要点:流匹配把噪声到数据的轨迹优化为近似直线,直线轨迹用更少的数值积分步即可逼近。

  1. SD1.5 的 LoRA 为什么不能直接用于 SDXL?

答案要点:两者权重空间与网络结构不同,低秩增量绑定原基座的权重坐标系。

与其他知识点的关系

kp-007 的骨干演进是架构轴的细节;kp-006/kp-009 的目标与采样联系目标轴;kp-011 联系文本轴;kp-021/kp-024 决定「加载哪个、跑不跑得动」。

延伸阅读

SDXL 论文(ICLR 2024)关于分辨率条件与双编码器的设计动机;SD3 论文(ICML 2024)第 1~2 节对流匹配与 MM-DiT 的论证。

相关知识点