什么是生成式图像模型

入门 约 15 分钟 ★ 最小路径 生成模型基础概念数据分布条件生成最小路径
学习状态:

一句话定义

生成式图像模型(generative image model)是学习训练图像集合的概率分布 p(x),并能从该分布中采样新图像的神经网络模型。

为什么重要

它是整幅 AIGC 图像版图的地基:无论 Stable Diffusion、Midjourney 还是 Flux,本质都是「学了分布、再抽样」这一件事的不同实现。分清「生成」与「判别」两种建模思路,决定了你能不能看懂后面所有机制——扩散模型在学什么、条件 c 在哪里起作用、为什么换个提示词输出会变。此外,理解「分布」这个抽象概念后,很多经验现象(多样性、模式坍缩、种子决定构图)都会从魔法变成可推理的必然。

前置知识

无硬性前置。了解概率论中最基本的高斯分布 N(μ, σ²) 与「概率密度」一词即可,本节自足。

核心概念

原理与机制

生成问题可以写成两个任务:一是密度估计——判断某张图在这个分布下出现概率多大;二是采样——反过来从分布中抽出一张图。现代深度生成模型通常不显式写出 p(x) 的解析形式,而是学一个从易采样的简单分布(标准高斯 N(0, I))到复杂图像分布的变换:

z ∼ 𝒩(0, I)  ⟶  Gθ(z, c)  ⟶  x(一张图像)

不同谱系的差别就在于「这个变换怎么学、学得像不像」:GAN 用对抗博弈、VAE 用变分下界、扩散用迭代去噪、自回归用逐块预测(见 kp-002)。条件生成为每个 c 定义一个分布 p(x|c):把 c 编码成向量或序列后注入网络,同一段文字就对应分布中一个被「圈定」的子区域——提示词工程(模块 04)本质上是在这个子区域里导航。

公式与推导

本节不适用——本知识点只需建立 p(x) 与 p(x|c) 的概念框架,具体函数形式留给 kp-005、kp-006 的扩散推导。

直观类比

判别式模型像鉴定师:看一张画,判断真伪与流派(输入图像、输出标签);生成式模型像画师:学习大量画作后,从空画布开始画出新作品(输入噪声、输出图像)。鉴定师不需要会画画,画师也不必然擅长鉴定——这解释了为什么生成任务在历史上比分类任务难突破。

实例或案例

常见误区

自测题

  1. 用一句话说明判别式与生成式建模的目标差异。

答案要点:判别式建模 p(y|x)(图像到标签),生成式建模 p(x) 或 p(x|c)(噪声/条件到图像)。

  1. 「文生图」在概率语言里对应什么?

答案要点:条件生成,即从条件分布 p(x|c) 中采样,c 为文本编码。

  1. 为什么说「模型记住训练图」在机制上不准确?

答案要点:模型存储的是网络权重中压缩的分布统计,生成是采样过程;与训练样本雷同属于分布重叠或过拟合,不是查表输出。

与其他知识点的关系

kp-002 展开四种实现谱系;kp-003 解释变换的中间表示「潜空间」;kp-004 给出衡量生成好坏的三个维度;模块 02 全部内容是本节 p(x|c) 框架的扩散特例。

延伸阅读

Goodfellow 等 2014 年 GAN 论文的引言部分对「生成 vs 判别」的经典论述;Sohl-Dickstein 等 2015 年论文是扩散思路的最早雏形,可只读引言。

相关知识点