一句话定义
生成式图像模型(generative image model)是学习训练图像集合的概率分布 p(x),并能从该分布中采样新图像的神经网络模型。
为什么重要
它是整幅 AIGC 图像版图的地基:无论 Stable Diffusion、Midjourney 还是 Flux,本质都是「学了分布、再抽样」这一件事的不同实现。分清「生成」与「判别」两种建模思路,决定了你能不能看懂后面所有机制——扩散模型在学什么、条件 c 在哪里起作用、为什么换个提示词输出会变。此外,理解「分布」这个抽象概念后,很多经验现象(多样性、模式坍缩、种子决定构图)都会从魔法变成可推理的必然。
前置知识
无硬性前置。了解概率论中最基本的高斯分布 N(μ, σ²) 与「概率密度」一词即可,本节自足。
核心概念
- 数据分布 p(x):把「所有看起来像训练集的图像」看作一个概率分布,真实图像出现在高概率区。
- 采样(sampling):从学到的分布中抽取一个具体样本,即「生成一张图」。
- 判别式模型(discriminative model):建模 p(y|x),回答「这张图是什么」,如分类器。
- 生成式模型(generative model):建模 p(x) 或 p(x|c),回答「像这样的图长什么样」。
- 条件生成(conditional generation):给定条件 c(文本、图像、掩码)建模 p(x|c),是文生图的形式化描述。
- 隐变量(latent variable):分布内部的低维压缩表示,生成通常先采 z 再映射到图像。
原理与机制
生成问题可以写成两个任务:一是密度估计——判断某张图在这个分布下出现概率多大;二是采样——反过来从分布中抽出一张图。现代深度生成模型通常不显式写出 p(x) 的解析形式,而是学一个从易采样的简单分布(标准高斯 N(0, I))到复杂图像分布的变换:
z ∼ 𝒩(0, I) ⟶ Gθ(z, c) ⟶ x(一张图像)
不同谱系的差别就在于「这个变换怎么学、学得像不像」:GAN 用对抗博弈、VAE 用变分下界、扩散用迭代去噪、自回归用逐块预测(见 kp-002)。条件生成为每个 c 定义一个分布 p(x|c):把 c 编码成向量或序列后注入网络,同一段文字就对应分布中一个被「圈定」的子区域——提示词工程(模块 04)本质上是在这个子区域里导航。
公式与推导
本节不适用——本知识点只需建立 p(x) 与 p(x|c) 的概念框架,具体函数形式留给 kp-005、kp-006 的扩散推导。
直观类比
判别式模型像鉴定师:看一张画,判断真伪与流派(输入图像、输出标签);生成式模型像画师:学习大量画作后,从空画布开始画出新作品(输入噪声、输出图像)。鉴定师不需要会画画,画师也不必然擅长鉴定——这解释了为什么生成任务在历史上比分类任务难突破。
实例或案例
- 输入一段文字「一只戴墨镜的猫,赛博朋克风格」,Stable Diffusion 内部把文本编码为条件 c,从高斯噪声出发采样出一张此前不存在的图——这是 p(x|c) 的一次抽样,不是从数据库里检索图片。
- 人脸生成(如早期 GAN 系列)展示「无条件生成」:不设条件,模型自由采样出千姿百态的假人脸。
常见误区
- 误区一:模型「记住」了训练图片。模型学的是分布的统计结构而非逐张存储;输出与训练图高度相似通常意味着过拟合或提示词恰好指向某张特定作品,机制上仍是抽样而非复制。
- 误区二:生成 = 检索。检索是从有限集合里挑,生成是从连续分布里采;前者样本空间有限,后者原则上能产出训练集中不存在的组合。
- 误区三:把「判别式 AI」(如图像分类)的能力直接外推到生成。两者的优化目标、评价指标、失败形态完全不同。
自测题
- 用一句话说明判别式与生成式建模的目标差异。
答案要点:判别式建模 p(y|x)(图像到标签),生成式建模 p(x) 或 p(x|c)(噪声/条件到图像)。
- 「文生图」在概率语言里对应什么?
答案要点:条件生成,即从条件分布 p(x|c) 中采样,c 为文本编码。
- 为什么说「模型记住训练图」在机制上不准确?
答案要点:模型存储的是网络权重中压缩的分布统计,生成是采样过程;与训练样本雷同属于分布重叠或过拟合,不是查表输出。
与其他知识点的关系
kp-002 展开四种实现谱系;kp-003 解释变换的中间表示「潜空间」;kp-004 给出衡量生成好坏的三个维度;模块 02 全部内容是本节 p(x|c) 框架的扩散特例。
延伸阅读
Goodfellow 等 2014 年 GAN 论文的引言部分对「生成 vs 判别」的经典论述;Sohl-Dickstein 等 2015 年论文是扩散思路的最早雏形,可只读引言。