一句话定义
图生图(img2img)把参考图按目标噪声水平加噪后作为采样起点,重绘幅度(denoising strength)就是这个水平的高低旋钮:低则贴着原图走,高则几乎重新画。
为什么重要
它是所有「基于已有图再创作」功能(换风格、放大精修、外扩、高清修复二段式)的共同底层。理解重绘幅度的噪声学含义,就能预判每个档位的行为、解释「为什么 0.4 保构图 0.8 出新图」,也能看懂放大工作流里那个隐藏的 img2img 步骤到底在做什么。
前置知识
kp-008(潜空间管线);kp-009(采样轨迹与时刻表)。
核心概念
- 参考图编码:x_ref 经 VAE 编码为潜码 z_ref。
- 重绘幅度 s(strength,0~1):映射到起始时刻 t₀,决定向 z_ref 注入多少噪声。
- 中途接入:采样不再从 t=T 开始,而从 t₀ 开始,之后走正常去噪链。
- 低强度修图 / 高强度重绘:s 小保留原图结构,s 大由提示词主导。
原理与机制
利用 kp-005 的闭式解,把参考图「拖回」到时间轴中间某点:
zt₀ = √ᾱt₀ · zref + √(1 − ᾱt₀) · ε, t₀ 由 s 映射(s→1 则 t₀→T)
从 z_{t₀} 出发执行常规去噪(每步仍含 CFG 与文本条件)。s 的信息学读法:√ᾱ_{t₀} 是原图信号残留比例——s=0.3 时约七成信号保留,输出是「同一张画的精修」;s=0.75 时信号只剩约一成,输出主要由提示词决定、原图只贡献低频构图影子。因此 s 不是「模糊度」而是「原始信息存活率」。与 SDEdit 的关系:此机制学术上即 SDEdit 提出的「加噪再去噪」编辑范式,LDM 把它做成了产品参数。与种子的交互:s 中高时,初始噪声 ε 的种子重新获得支配权,同图不同种子结果差异大——「图生图保构图」只在小 s 区间成立。
放大精修(hires fix)的原理:先低分辨率出图,把结果放大后作为 img2img 输入、用小 s(0.3~0.5)精修,模型在更高潜码分辨率上补出细节而不改变构图——kp-024 从算力角度再看这条链。
公式与推导
推导直接复用 kp-005:闭式解对任意 t 成立,故无需训练任何新组件即可编辑。s 与 t₀ 的具体映射由工具的调度实现决定(如 SD WebUI 的 strength 线性映射到时刻表),因此同一 s 在不同采样器/调度下的实际噪声水平不同——换采样器后需重新校准 s。
图示
对比文生图:文生图从 t=T 的纯噪声出发;图生图从中途 t₀ 出发,原信号残留 √ᾱ_t₀。
直观类比
s 像「临摹的自由度」:s=0.2 是描红(只修笔锋);s=0.5 是照着构图重新上色换风格;s=0.9 是只记得「大概有个房子」后的自由创作。噪声就是橡皮——擦多少,决定你是在「改画」还是「重画」。
实例或案例
- 照片转油画:s=0.45~0.6 + 风格提示词,构图保留、笔触替换——社区「风格迁移三件套」中最稳的一档。
- 线稿上色:s=0.6~0.8,线稿的黑色线条作为高对比信号在较高 s 下仍能幸存,色彩由提示词填充。
- 放大二段式:1024 输出后放大至 2048,img2img s=0.35 精修——细节密度提升而构图不动(kp-024 给出显存账)。
常见误区
- 误区一:denoising strength = 画面模糊度。它是在采「原始信号保留多少」,视觉上的「变糊」只是中间态表象。
- 误区二:图生图永远保构图。s 大于约 0.7 后种子噪声主导低频结构,构图开始脱离原图。
- 误区三:s 数值跨工具通用。映射到时刻表的方式因实现而异,换采样器/调度后同数值行为不同。
自测题
- 写出图生图的起始潜码公式并指出 s 的作用。
答案要点:z_{t₀}=√ᾱ_{t₀}·z_ref+√(1−ᾱ_{t₀})·ε;s 控制 t₀ 即原图信号残留比例。
- 为什么 s=0.4 的输出常被描述为「精修」?
答案要点:ᾱ_{t₀} 尚大,原图约六成信号保留,去噪只在高频细节上做文章。
- 放大精修工作流的核心思想是什么?
答案要点:放大后的图作 img2img 输入、小 s 去噪,让模型在新分辨率补细节而保构图。
与其他知识点的关系
kp-013 在此机制上加掩码限制作用区域;kp-024 算放大链的时间显存账;kp-027 的「构图一致性」本质是小 s 或控制工具的应用。
延伸阅读
SDEdit 论文(ICLR 2022)是「加噪-去噪」编辑范式的出处;Latent Diffusion 论文 4.3 节将其纳入 LDM 条件框架。