来源:对 Ho 等 2020,arXiv 2006.11239 全文的收口 + 本单元各章覆盖盘点。 --- ## 全篇一条线 目标是提高真图密度 $p_\theta(x_0)$,但其不可算(§3),故换为可算上界 $L$(§3,公式 3),拆成每步 $L_{t-1}$(§4,公式 5),每步对齐已知 $x_0$ 时的前向后验(§5,公式 6/7),固定方差后只需对齐中心(§6,公式 8),对齐中心等价于预测噪声(§7,公式 11/12),最后去掉权重得 $L_\text{simple}$(§8,公式 14)。训练让网络从含噪图预测噪声,采样从纯噪声逐步还原(§9)。 --- ## 各章对应论文结构 | 论文位置 | 内容 | 对应章节 | 覆盖 | |---|---|---|---| | §2 背景 | 两条链定义(eq 1、2)、上界(eq 3)、闭式(eq 4)、拆解(eq 5) | 01、02 | ✅ 全 | | 附录 A | eq 17–22 逐步拆解 | 02(§4 推导折叠) | ✅ 全 | | §3.2 + eq 6/7 | 前向后验 | 03 | ✅ 全(贝叶斯 + 配方法逐行) | | §3.2 + eq 8–12 | 固定方差、改写中心、预测噪声 | 04 | ✅ 全 | | §3.3 + eq 13 | $L_0$ 离散解码器 | 05(§8 支线) | 结论 + 直觉,积分细节从略 | | §3.4 + eq 14 | $L_\text{simple}$ 与权重讨论 | 05 | ✅ 全 | | 算法 1 / 2 | 训练与采样 | 05(§9 代码) | ✅ 全 | | §4 实验 | FID、消融、插值、率失真 | 本章「论文实验一页结论」 | 结论已收,细节从略 | ## 论文实验,一页结论 质量:无条件 CIFAR10 拿到 FID 3.17、IS 9.46(当时的无条件 SOTA,好过多数条件模型);用完整变分界 $L$ 训练码长(似然)更好、用 $L_\text{simple}$ 训练画质更好,「密度高不等于样本好」在这里有实锤。 消融(Table 2,为什么预测噪声):预测 $\tilde\mu$ 配不加权 MSE 直接训崩;学习反向方差 $\Sigma_\theta$ 训练不稳;$\epsilon$ 预测 + $L_\text{simple}$ 全场最佳。「预测噪声」不是审美偏好,是消融赢家。 渐进生成与率失真:沿采样过程用公式 4 反解 $\hat x_0$ 看半成品,大尺度结构先出现、细节最后;率失真曲线显示大半码长花在人眼不可感知的细节上,论文由此称扩散模型是出色的有损压缩器。 插值:把 $q$ 当随机编码器,两张真图各加噪到 $x_t$、潜空间线性插值、再反向解码,姿态肤色发型平滑过渡;$t$ 越大插值越粗粒度($t=1000$ 时已是全新样本)。 ## 下一步 - 下一单元 DDIM:把「生成绑死在马尔可夫链反向」拆掉,训练目标只认边缘,链条可换、可去随机、可跳步。DDPM 的 $\bar\alpha_t$ 在那边改叫 $\alpha_t$(累积量),进门先看它的符号约定。 - 本单元的闭式(公式 4)、前向后验(公式 6/7)、$L_\text{simple}$(公式 14)会被 DDIM、Score-SDE、EDM 反复引用,是整个扩散系列的地基。