图生图与重绘幅度

核心 约 20 分钟 图生图img2img重绘幅度去噪强度核心原理
前置知识点(建议先学)
学习状态:

一句话定义

图生图(img2img)把参考图按目标噪声水平加噪后作为采样起点,重绘幅度(denoising strength)就是这个水平的高低旋钮:低则贴着原图走,高则几乎重新画。

为什么重要

它是所有「基于已有图再创作」功能(换风格、放大精修、外扩、高清修复二段式)的共同底层。理解重绘幅度的噪声学含义,就能预判每个档位的行为、解释「为什么 0.4 保构图 0.8 出新图」,也能看懂放大工作流里那个隐藏的 img2img 步骤到底在做什么。

前置知识

kp-008(潜空间管线);kp-009(采样轨迹与时刻表)。

核心概念

原理与机制

利用 kp-005 的闭式解,把参考图「拖回」到时间轴中间某点:

zt₀ = √ᾱt₀ · zref + √(1 − ᾱt₀) · ε,  t₀ 由 s 映射(s→1 则 t₀→T)

从 z_{t₀} 出发执行常规去噪(每步仍含 CFG 与文本条件)。s 的信息学读法:√ᾱ_{t₀} 是原图信号残留比例——s=0.3 时约七成信号保留,输出是「同一张画的精修」;s=0.75 时信号只剩约一成,输出主要由提示词决定、原图只贡献低频构图影子。因此 s 不是「模糊度」而是「原始信息存活率」。与 SDEdit 的关系:此机制学术上即 SDEdit 提出的「加噪再去噪」编辑范式,LDM 把它做成了产品参数。与种子的交互:s 中高时,初始噪声 ε 的种子重新获得支配权,同图不同种子结果差异大——「图生图保构图」只在小 s 区间成立。

放大精修(hires fix)的原理:先低分辨率出图,把结果放大后作为 img2img 输入、用小 s(0.3~0.5)精修,模型在更高潜码分辨率上补出细节而不改变构图——kp-024 从算力角度再看这条链。

公式与推导

推导直接复用 kp-005:闭式解对任意 t 成立,故无需训练任何新组件即可编辑。s 与 t₀ 的具体映射由工具的调度实现决定(如 SD WebUI 的 strength 线性映射到时刻表),因此同一 s 在不同采样器/调度下的实际噪声水平不同——换采样器后需重新校准 s。

图示

参考图 z_ref加噪至 t₀(由 s 决定)z_t₀(半原图半噪声)去噪轨迹(CFG+提示词参与)输出 z₀ → 解码

对比文生图:文生图从 t=T 的纯噪声出发;图生图从中途 t₀ 出发,原信号残留 √ᾱ_t₀。

直观类比

s 像「临摹的自由度」:s=0.2 是描红(只修笔锋);s=0.5 是照着构图重新上色换风格;s=0.9 是只记得「大概有个房子」后的自由创作。噪声就是橡皮——擦多少,决定你是在「改画」还是「重画」。

实例或案例

常见误区

自测题

  1. 写出图生图的起始潜码公式并指出 s 的作用。

答案要点:z_{t₀}=√ᾱ_{t₀}·z_ref+√(1−ᾱ_{t₀})·ε;s 控制 t₀ 即原图信号残留比例。

  1. 为什么 s=0.4 的输出常被描述为「精修」?

答案要点:ᾱ_{t₀} 尚大,原图约六成信号保留,去噪只在高频细节上做文章。

  1. 放大精修工作流的核心思想是什么?

答案要点:放大后的图作 img2img 输入、小 s 去噪,让模型在新分辨率补细节而保构图。

与其他知识点的关系

kp-013 在此机制上加掩码限制作用区域;kp-024 算放大链的时间显存账;kp-027 的「构图一致性」本质是小 s 或控制工具的应用。

延伸阅读

SDEdit 论文(ICLR 2022)是「加噪-去噪」编辑范式的出处;Latent Diffusion 论文 4.3 节将其纳入 LDM 条件框架。

相关知识点