一句话定义
应对「图是不是 AI 画的」有两类技术:溯源类(主动标注,如元数据凭证 C2PA 与生成时嵌入的隐水印)与检测类(被动判别,用分类器猜「像不像 AI 生成」),前者可验证但可被剥离,后者无需配合但误报漏报严重——两者都是概率性证据而非真伪证明。
为什么重要
平台强制标注、政策对「AI 内容标识」的要求、以及「这张图是不是假的」的日常判断,都建立在这两类技术之上。理解其原理与失效面(水印怎么被去掉、检测器为何误判),才能正确使用证据:知道隐水印「看不见但能洗掉」,就知道它适合合规自证而非防伪;知道检测器「高置信也非铁证」,就不会拿它当审判工具。
前置知识
kp-001(生成机制,理解「检测器在检测什么」);kp-003(频率/统计视角,理解隐水印的嵌入域)。
核心概念
- C2PA(内容来源与真实性联盟规范):加密签名的元数据链,记录内容的生成/编辑历史(凭证)。
- 隐水印(invisible watermark):生成时嵌入像素/频域的统计模式,肉眼不可见、可用解码器读出。
- 被动检测器:在生成图统计特征(频谱规律、伪影分布)上训练的分类器。
- 抗性攻击面:重压缩、截图、裁剪、去噪可剥离水印;对抗扰动可欺骗检测器。
- 概率证据属性:两类技术的输出都是置信度,不是「真/假」判定。
原理与机制
溯源类为什么可信又可弃:C2PA 把「谁在何时用什么生成了这张图」做成签名哈希链——验证时核对签名即可确认「元数据未被篡改」,这解决了「元数据本身可信」的问题(传统 EXIF 谁都能写)。但它的信任模型是「跟随文件」:文件被截图、重编码、裁剪后,凭证链断裂——不可剥离的恰恰只是「被篡改痕迹」,内容本身脱离了凭证。隐水印的思路相反:把信息刻进内容本身。主流实现(如 SD 系内置隐水印)在解码后的像素域嵌入低幅度的统计模式(DCT/变换域编码),鲁棒性权衡清晰:幅度高则抗压缩但可见伪影,幅度低则隐形但易被重采样抹除。被动检测器学习「AI 图的统计指纹」:早期 GAN 图有可检测的上采样频谱周期性;扩散图指纹更弱(经过 VAE 解码与采样链的多次变换,指纹被「洗」向自然图像统计),导致检测器在新模型上泛化性差——「用旧模型指纹抓新模型」是检测失效的机制根源,模型每迭代一代,检测器就要重训一轮,攻防永远滞后。
正确的心智模型:三类技术回答的问题不同——C2PA 回答「这个文件的来历是否可信」(需配合),隐水印回答「这张图是否由带水印的工具生成」(可被洗),检测器回答「这张图像不像 AI 画的」(可误判)。没有一个单独给出「真/假」的终审;可信结论来自「凭证 + 水印 + 检测 + 来源核实」的证据组合,而非任何单项。
公式与推导
本节不适用——水印嵌入用信号处理而非扩散数学;检测器是普通分类器(其评估逻辑同 kp-026 的指标观:精确率/召回率/泛化性)。
图示
| 技术 | 回答的问题 | 需生成方配合 | 主要失效面 |
|---|---|---|---|
| C2PA 凭证 | 文件来历可信吗 | 是 | 截图/重编码断链 |
| 隐水印 | 是某工具生成的吗 | 是 | 压缩/裁剪/去噪洗除 |
| 被动检测器 | 像不像 AI 画的 | 否 | 模型换代泛化失效、误报 |
直观类比
C2PA 像「公证处盖章的履历」——文件在则可信,照片翻拍后章就没了;隐水印像「纸里织入的荧光丝」——验钞灯一照就见,但重新造纸(重编码)就没了;检测器像「老刑警的直觉」——经验丰富但会认错人,且新型犯罪(新模型)一出现直觉就过期。
实例或案例
- 平台标注实践(截至 2026-10):主流生成产品在导出图写入 C2PA 类凭证或自带标识;社交媒体逐步要求 AI 内容自标——「合规自证」已是交付流程的一部分。
- 水印洗除实测常识:SD 系内置隐水印经一次高质量重压缩常能保留,经截图 + 社交平台再压缩常丢失——这解释了「平台检测依赖水印时准确率波动」。
- 检测器误报现场:对低压缩伪影密集的摄影旧图,检测器偶发「高置信 AI」——使用结论时必须报置信区间与来源佐证,不可单独定罪。
常见误区
- 误区一:水印 = 防伪。水印是「溯源辅助」而非「防伪锁」,攻击面(重编码/去噪)决定它防君子不防执意者。
- 误区二:检测器说 AI 生成就是 AI 生成。被动检测是概率判别,误报真实存在(对摄影图尤甚),结论必须组合证据。
- 误区三:C2PA 可证明「图是真的」。它证明的是「该文件自签发后的完整性」,无法证明初始内容真实(签发的可以就是一张 AI 图)。
自测题
- 三类技术分别回答什么问题?
答案要点:C2PA 证文件来历完整性、隐水印证生成工具来源、检测器判统计相似性;无单项真伪终审。
- 为什么扩散图的检测比早期 GAN 图更难?
答案要点:VAE 解码与采样链变换把统计指纹「洗」向自然图像,指纹弱化、跨模型泛化差。
- C2PA 能证明「这张图不是 AI 生成」吗?
答案要点:不能;它只证明文件自签发后未被篡改,签发内容本身可以是任何来源。
与其他知识点的关系
kp-003 的「感知压缩丢高频」解释水印嵌入与洗除的频域逻辑;kp-026 的指标思维迁移到检测器的评估;kp-028 的合规工作流是本节技术的使用场景。
延伸阅读
C2PA 官方规范(内容凭证的技术定义与信任模型);各生成平台的内容标注与水印说明文档(随产品演进,注意时效)。