一句话定义
AI 生成图的失败高度模式化——肢体崩坏、文字乱码、过饱和烧穿、提示词元素缺失、语义污染重复——每一种都能回溯到「训练数据 + 条件机制 + 采样外推」三个成因层,诊断即按此三层定位。
为什么重要
会用工具和会修图之间隔着一层「诊断能力」。失败模式不是玄学诅咒,而是机制的可观测投影:知道每个失败的成因层,就能从 kp-018 的负向词、kp-020 的迭代路径与 kp-013/kp-014 的修复工具中精准选武器,而不是把所有咒语都贴一遍。本知识点也是「机制学以致用」的总验收——每个失败都能在前面知识点里找到出处。
前置知识
kp-010(CFG 外推)、kp-011(文本条件与 token)、kp-006(采样误差累积),建议配套 kp-020 的排错表使用。
核心概念
- 肢体崩坏(尤其是手):手指数量/关节错误,最著名的高频失败。
- 文字乱码:提示词要求文字时出现伪字形。
- 过饱和/烧穿(burn-in):色彩过曝、对比度爆炸、高光死白。
- 元素缺失/提示词遵循失败:写了但没画。
- 语义污染与重复:训练语料的标签泄漏(prompt leaking)导致的既视感构图;或元素无限复制(重复人脸、重复物体)。
原理与机制
三层成因框架,逐个失败归位:
成因层一:训练数据与编码器(模型层面,调参只能缓解)。手部崩坏的三重根源:训练图中手部常被遮挡、模糊,本身就是低质量样本;人手是高自由度铰接结构,构图阶段(低频)「手」只占几个潜码格,细节阶段(高频)才发现结构已定死;注意力在远小于手尺寸的区域上纠缠。文字乱码根源:CLIP 类文本塔把词映射为语义而非字形,训练图中的文字多为水印/招牌等低分辨率样本,模型从未学会「可读字形的渲染」——SD3/Flux 的改进正来自 T5 + 数据治理(kp-023 文本轴)。这一层的失败首选换模型/换工具,其次才是负向词。
成因层二:条件机制(提示词与参数层面)。元素缺失:token 截断(77 上限,kp-011)、语义冲突互斥(kp-017 误区)、或该词在编码器分布中太弱(kp-019 的权重前提)。过饱和:CFG 过高或权重堆叠把采样外推出训练分布(kp-010 的 w 行为分区),负向单过长同理。语义污染:训练 caption 的模板句(「trending on artstation」类)成为分布中的强锚点,提示词一旦沾边就整图滑向语料风格。
成因层三:采样与数值(过程层面,可换参数规避)。重复元素:采样轨迹在低步数下陷入循环模式(高阶求解器低步数的已知现象);局部伪影:VAE 解码的统计补全在分布外潜码上失真(kp-008 误区三),表现为纹理糊斑或色块;数值问题:fp16 的 VAE 溢出黑图(kp-022)。
诊断流程:症状 → 判层(换种子不消失=非层三;改提示词无效=疑层一;调 CFG/权重立刻变化=层二)→ 层内选武器 → 若层一且高频,用 kp-013 局部重绘或换基座(kp-023)。
公式与推导
本节不适用——本知识点是机制(kp-006/kp-010/kp-011)在失效形态上的推论汇总,不引入新数学。
图示
| 症状 | 主成因层 | 首选武器 | 机制出处 |
|---|---|---|---|
| 手部崩坏 | 层一 | 局部重绘(kp-013)+ 负向定向词 + 换基座 | kp-006/kp-003 |
| 文字乱码 | 层一 | 选 T5 系模型(kp-023)或后期加字 | kp-011 |
| 过饱和烧穿 | 层二 | 降 CFG / 清权重堆叠 | kp-010 |
| 元素缺失 | 层二 | 加权(kp-019)/ 查截断 / 去冲突 | kp-011/kp-017 |
| 重复元素 | 层三 | 加步数 / 换采样器 | kp-009 |
| 糊斑/色块 | 层三 | 换 VAE / fp32 解码 | kp-008/kp-022 |
直观类比
像老司机听发动机异响判故障:敲缸声指向点火正时(层二:参数),金属摩擦声指向机油(层一:模型),只有冷车响是热胀冷缩(层三:过程)。异响清单背得再多,不懂「声音从哪个系统发出」就只能送修——机制就是那张系统图。
实例或案例
- 诊断实例一:十连发出图只有两张手正常。判层:换多个种子仍有 → 非层三;去负向手部词无改善 → 疑层一;换 SDXL→SD3.5 系基座手部合格率显著上升 → 确认层一,根因是旧基座的训练数据短板。
- 诊断实例二:「一只猫」总变成「七只猫排排坐」。层三特征:加步数后缓解——低步数下重复模式是采样循环,与提示词无关。
- 诊断实例三:图整体偏洋红。查链路环节⑤(kp-022)——换了第三方 VAE 未配套,换回配套 VAE 恢复。
常见误区
- 误区一:所有失败都怪提示词。层一(数据/模型)的失败改一万次提示词也无效,先判层再动手。
- 误区二:负向词是万能修复。负向只能推离「模型分布中存在的方向」,对层一的结构性缺陷只有缓解作用。
- 误区三:失败是随机的。所有失败模式都有确定性成因,换种子只改变「这次是否踩中」,不改变踩中概率本身——降概率要动成因层。
自测题
- 三层成因框架是什么?「过饱和」属于哪层?
答案要点:训练数据/模型、条件机制/参数、采样与数值;过饱和属层二(CFG/权重外推)。
- 为什么手部是重灾区?给出至少两个机制根源。
答案要点:训练样本质量差 + 低频构图阶段结构已定死 + 注意力纠缠;细节由 VAE 统计补全(kp-003)加剧。
- 「改提示词无效」提示什么?
答案要点:问题大概率在层一(模型/数据)或层三(采样过程),应换基座或调采样参数而非继续改词。
与其他知识点的关系
kp-018 的负向策略与本节症状一一挂钩;kp-020 排错表是本节的操作化版本;kp-013/kp-014 是层一失败的修复工具;kp-026 的定量评估是「失败率」的统计化。
延伸阅读
Conwell & Ullman 对 DALL-E 2 等模型系统性失败(尤其是物体关系与计数)的实测分析;社区失败案例库(如模型发布页的已知问题清单,注意时效)。