术语表
共 53 条;括注指向定义该术语的知识点。
| 术语 | 英文 | 一句话释义 |
|---|---|---|
| 生成式模型 | generative model | 学习数据分布 p(x) 并能从中采样的模型(kp-001) |
| 判别式模型 | discriminative model | 建模 p(y\ |
| 条件生成 | conditional generation | 给定条件 c 从 p(x\ |
| 潜空间 | latent space | 模型学到的低维连续表示空间,生成与编辑在此进行(kp-003) |
| 潜码 | latent code | 图像经编码器压缩后的低维张量,SD 系典型 64×64×4(kp-003) |
| 感知压缩 | perceptual compression | 丢弃人眼不敏感信息、保留语义结构的压缩(kp-003) |
| VAE | Variational Autoencoder | 以重建+KL 训练的编码-解码生成模型,潜空间扩散的前端(kp-002) |
| GAN | Generative Adversarial Network | 生成器与判别器对抗博弈的隐式生成框架(kp-002) |
| 自回归 | autoregressive | 把图像离散为 token 序列逐个生成的范式(kp-002) |
| 扩散模型 | diffusion model | 前向逐步加噪、训练网络逆转去噪的生成范式(kp-005/kp-006) |
| 前向过程 | forward process | 按噪声调度逐步加高斯噪声直至纯噪声的固定马尔可夫链(kp-005) |
| 反向过程 | reverse process | 学习 p(x_{t−1}\ |
| 噪声调度 | noise schedule | 每步加噪强度序列 β_t,决定信号衰减曲线(kp-005) |
| ᾱ(阿尔法累计量) | cumulative alpha | ᾱ_t=∏α_s,表示 t 时刻原始信号保留比例(kp-005) |
| 信噪比 | SNR | ᾱ_t/(1−ᾱ_t),信号与噪声方差之比,随 t 下降(kp-005) |
| 重参数化 | reparameterization | 把随机变量写成确定性函数加独立噪声的技巧(kp-005) |
| 简化损失 | L_simple | DDPM 把变分下界简化成的噪声预测 MSE(kp-006) |
| 噪声预测网络 | ε_θ | 输入含噪样本与时刻、输出噪声估计的网络(kp-006) |
| U-Net | U-Net | 编解码对称、带跳连的多尺度卷积骨干(kp-007) |
| DiT | Diffusion Transformer | 图像切块后用 Transformer 块去噪的骨干(kp-007) |
| 时间嵌入 | time embedding | 把时刻 t 编码为向量注入网络每层(kp-007) |
| 潜空间扩散 | Latent Diffusion | 在 VAE 潜码上做扩散的架构,Stable Diffusion 底座(kp-008) |
| 交叉注意力 | cross-attention | Query 取自图像特征、Key/Value 取自文本嵌入的注意力(kp-011) |
| CLIP | CLIP | 图文对对比学习得到的联合嵌入模型(kp-011) |
| 文本编码器 | text encoder | 把提示词转成 token 嵌入序列的模型(kp-011) |
| 采样器 | sampler | 组织从噪声到图像完整轨迹的数值策略(kp-009) |
| 祖先采样 | ancestral sampling | 每步注入新随机噪声的随机采样方式(kp-009) |
| 确定性采样 | deterministic sampling | 同种子必得同图的非随机采样(DDIM σ=0 等,kp-009) |
| 步数 | steps | 去噪迭代次数,每步一次网络前向(kp-009/kp-024) |
| 无分类器引导 | CFG | 用条件与无条件预测差值外推强化引导的采样技巧(kp-010) |
| 引导强度 | guidance scale (w) | CFG 的外推倍数,平衡可控性与多样性(kp-010) |
| 负向提示词 | negative prompt | 占用 CFG 基线分支、把生成推离特定特征的描述(kp-018) |
| 图生图 | img2img | 参考图加噪至中间时刻再去噪的生成方式(kp-012) |
| 重绘幅度 | denoising strength | 图生图中参考图信号残留比例的旋钮(kp-012) |
| 局部重绘 | inpainting | 掩码区域内重生成、区域外保持原样的编辑(kp-013) |
| 外扩 | outpainting | 向画布外扩展并补全新增区域的编辑(kp-013) |
| 潜码混合 | latent blending | 每步把掩码外区域拉回参考轨迹的混合操作(kp-013) |
| ControlNet | ControlNet | 用可训练副本与零卷积把结构条件注入冻结主干的适配器(kp-014) |
| 零卷积 | zero convolution | 初始权重为零、可学习的注入卷积(kp-014) |
| LoRA | Low-Rank Adaptation | 冻结权重、训练低秩增量 ΔW=BA 的微调法(kp-015) |
| 秩 | rank (r) | LoRA 增量矩阵的容量旋钮(kp-015) |
| 文本反演 | Textual Inversion | 只优化一个 token 嵌入来学新概念的方法(kp-015) |
| DreamBooth | DreamBooth | 全参数微调加类先验保持的个性化方法(kp-015) |
| 图像提示 | image prompt / IP-Adapter | 把参考图嵌入经解耦注意力注入条件的适配器族(kp-016) |
| 提示词 | prompt | 描述目标分布子区域的文本条件(kp-017) |
| 权重语法 | prompt weighting | (word:1.2) 类对 token 注意力贡献缩放的语法(kp-019) |
| 种子 | seed | 初始高斯噪声的随机种子,决定输出初始命运(kp-022) |
| 流匹配 | flow matching | 把噪声到数据建模为直线插值回归的训练目标(kp-023) |
| FID | Fréchet Inception Distance | 两组图像在特征空间的高斯距离,代理保真+多样性(kp-026) |
| CLIP Score | CLIP Score | 图文嵌入余弦相似度,代理提示词遵循度(kp-026) |
| 一致性 | consistency | 跨图保持输出复现(输出级)或主体身份(主体级)的性质(kp-027) |
| 隐水印 | invisible watermark | 生成时嵌入内容的可解码统计标记(kp-029) |
| 内容凭证 | C2PA | 记录生成/编辑历史的加密签名元数据规范(kp-029) |