一致性生成:固定种子与角色一致性

进阶 约 25 分钟 一致性角色种子参考注入进阶专题实践
前置知识点(建议先学)
学习状态:

一句话定义

一致性生成分两级:输出级靠确定性采样链(固定种子 + 全同参数)复现任意单张图;主体级让同一角色/风格跨图保持一致,需要 LoRA、参考注入(IP-Adapter/FaceID)或 inpainting 链路等技术把「主体身份」从单图采样中解耦出来。

为什么重要

商业交付(绘本主角、品牌视觉、连续分镜)的核心诉求从来不是「一张好图」而是「一套一致的图」,而这恰恰与扩散模型的天然倾向(每次采样都是新样本)相反。理解两级一致性的机制差异,才能选对方案:能用种子解决的不要上重型工具,需要主体级一致的知道该训练还是该注入。

前置知识

kp-009(确定性采样)、kp-015(LoRA)、kp-016(参考注入)、kp-012(img2img)。

核心概念

原理与机制

输出级:由 kp-009 的确定性性质直接保证——DDIM(σ=0)/Euler/DPM++ 2M 下,种子决定初始高斯张量,同链同参逐像素复现。两个工程提醒:随机性来源(如祖先采样器、随机种子节点)必须排除;「复现」绑定模型权重——基座更新一个版本,同种子即为另一条轨迹,发布复现配方时应锁定模型哈希。

主体级的三条路线,机制各异:

  1. 训练侧(LoRA/DreamBooth):把主体的视觉特征写进权重(kp-015)。一致性最强(特征内化于模型)、构图自由度最大;代价是训练成本与「触发词绑定」。适合长线项目(系列绘本主角)。
  2. 推理侧(参考注入):IP-Adapter 把参考图的语义嵌入每步注入(kp-016),FaceID 变体用人脸特征强化身份。免训练、即插即用;一致性弱于训练侧(依赖参考图质量),适合快速批量。
  3. 编辑链(img2img/inpainting):小重绘幅度或掩码重绘「就地改」——kp-012/kp-013 机制的组合拳,适合「以某张定稿为锚」的少量变体。

正交叠加:主体一致(怎么画得像他)与构图一致(怎么摆得一样)是两个轴——前者用 LoRA/IP-Adapter,后者用 ControlNet/固定种子。多角色同框是两者的高难度合奏:每个角色配各自 LoRA/参考(多 IP-Adapter 加权),构图用控制图锚定,冲突率随角色数上升(注意力竞争,kp-011 的 K/V 带宽有限)。

公式与推导

本节不适用——一致性是采样确定性(kp-009)与条件注入(kp-011/kp-015/kp-016)性质的应用组合,无新数学。

图示

主体轴:LoRA(训练)/ IP-Adapter(注入)×构图轴:ControlNet / 固定种子 / 小 s img2img=跨图一致的角色分镜

直观类比

输出级复现像「同一份菜谱同一炉火做两遍」(参数锁定即出同菜);主体级一致像「让同一位演员出演不同剧集」——要么签长期合同(LoRA 训练,演员进剧组)、要么每场化妆参照定妆照(IP-Adapter 参考注入);ControlNet 则是「剧本的走位图」,管站位不管长相。

实例或案例

常见误区

自测题

  1. 输出级与主体级一致性的机制差异是什么?

答案要点:输出级靠确定性采样链复现单图;主体级需把主体身份从单次采样解耦(训练或注入)。

  1. 为什么 LoRA 方案的跨图一致性通常优于 IP-Adapter?

答案要点:LoRA 把特征写入权重(内化),IP-Adapter 依赖单张参考图的嵌入(语义级、受参考质量约束)。

  1. 「同种子换模型版本不复现」说明种子复现的什么性质?

答案要点:复现绑定整条采样链含模型权重;权重变即轨迹变,交付需锁定模型哈希。

与其他知识点的关系

kp-009 的确定性是输出级的理论基础;kp-015/kp-016 是主体级的两条路线;kp-014 提供构图轴;kp-020 的种子管理是流程层接口。

延伸阅读

DreamBooth 论文(CVPR 2023)对「主体驱动生成」问题的定义仍是主体级一致性的标准表述;IP-Adapter 论文第 4 节的消融实验展示了注入强度与身份相似度的关系。

相关知识点