常见失败模式与成因诊断

核心 约 20 分钟 失败模式手部崩坏文字乱码过饱和诊断核心原理
前置知识点(建议先学)
学习状态:

一句话定义

AI 生成图的失败高度模式化——肢体崩坏、文字乱码、过饱和烧穿、提示词元素缺失、语义污染重复——每一种都能回溯到「训练数据 + 条件机制 + 采样外推」三个成因层,诊断即按此三层定位。

为什么重要

会用工具和会修图之间隔着一层「诊断能力」。失败模式不是玄学诅咒,而是机制的可观测投影:知道每个失败的成因层,就能从 kp-018 的负向词、kp-020 的迭代路径与 kp-013/kp-014 的修复工具中精准选武器,而不是把所有咒语都贴一遍。本知识点也是「机制学以致用」的总验收——每个失败都能在前面知识点里找到出处。

前置知识

kp-010(CFG 外推)、kp-011(文本条件与 token)、kp-006(采样误差累积),建议配套 kp-020 的排错表使用。

核心概念

原理与机制

三层成因框架,逐个失败归位:

成因层一:训练数据与编码器(模型层面,调参只能缓解)。手部崩坏的三重根源:训练图中手部常被遮挡、模糊,本身就是低质量样本;人手是高自由度铰接结构,构图阶段(低频)「手」只占几个潜码格,细节阶段(高频)才发现结构已定死;注意力在远小于手尺寸的区域上纠缠。文字乱码根源:CLIP 类文本塔把词映射为语义而非字形,训练图中的文字多为水印/招牌等低分辨率样本,模型从未学会「可读字形的渲染」——SD3/Flux 的改进正来自 T5 + 数据治理(kp-023 文本轴)。这一层的失败首选换模型/换工具,其次才是负向词。

成因层二:条件机制(提示词与参数层面)。元素缺失:token 截断(77 上限,kp-011)、语义冲突互斥(kp-017 误区)、或该词在编码器分布中太弱(kp-019 的权重前提)。过饱和:CFG 过高或权重堆叠把采样外推出训练分布(kp-010 的 w 行为分区),负向单过长同理。语义污染:训练 caption 的模板句(「trending on artstation」类)成为分布中的强锚点,提示词一旦沾边就整图滑向语料风格。

成因层三:采样与数值(过程层面,可换参数规避)。重复元素:采样轨迹在低步数下陷入循环模式(高阶求解器低步数的已知现象);局部伪影:VAE 解码的统计补全在分布外潜码上失真(kp-008 误区三),表现为纹理糊斑或色块;数值问题:fp16 的 VAE 溢出黑图(kp-022)。

诊断流程:症状 → 判层(换种子不消失=非层三;改提示词无效=疑层一;调 CFG/权重立刻变化=层二)→ 层内选武器 → 若层一且高频,用 kp-013 局部重绘或换基座(kp-023)。

公式与推导

本节不适用——本知识点是机制(kp-006/kp-010/kp-011)在失效形态上的推论汇总,不引入新数学。

图示

症状主成因层首选武器机制出处
手部崩坏层一局部重绘(kp-013)+ 负向定向词 + 换基座kp-006/kp-003
文字乱码层一选 T5 系模型(kp-023)或后期加字kp-011
过饱和烧穿层二降 CFG / 清权重堆叠kp-010
元素缺失层二加权(kp-019)/ 查截断 / 去冲突kp-011/kp-017
重复元素层三加步数 / 换采样器kp-009
糊斑/色块层三换 VAE / fp32 解码kp-008/kp-022

直观类比

像老司机听发动机异响判故障:敲缸声指向点火正时(层二:参数),金属摩擦声指向机油(层一:模型),只有冷车响是热胀冷缩(层三:过程)。异响清单背得再多,不懂「声音从哪个系统发出」就只能送修——机制就是那张系统图。

实例或案例

常见误区

自测题

  1. 三层成因框架是什么?「过饱和」属于哪层?

答案要点:训练数据/模型、条件机制/参数、采样与数值;过饱和属层二(CFG/权重外推)。

  1. 为什么手部是重灾区?给出至少两个机制根源。

答案要点:训练样本质量差 + 低频构图阶段结构已定死 + 注意力纠缠;细节由 VAE 统计补全(kp-003)加剧。

  1. 「改提示词无效」提示什么?

答案要点:问题大概率在层一(模型/数据)或层三(采样过程),应换基座或调采样参数而非继续改词。

与其他知识点的关系

kp-018 的负向策略与本节症状一一挂钩;kp-020 排错表是本节的操作化版本;kp-013/kp-014 是层一失败的修复工具;kp-026 的定量评估是「失败率」的统计化。

延伸阅读

Conwell & Ullman 对 DALL-E 2 等模型系统性失败(尤其是物体关系与计数)的实测分析;社区失败案例库(如模型发布页的已知问题清单,注意时效)。

相关知识点