来源:对 Karras 等,2022,arXiv:2206.00364 全文的收口 + 本单元 §0–§7 的覆盖盘点。 读法:§8.1 一页纸把整篇论文串成一条线;§8.2 各章覆盖了论文哪些;§8.3 推导深度盘点;§8.4 下一步。 --- ## §8.1 整篇论文,一页纸 一句话:**EDM 把扩散模型拆成四类互相独立的旋钮(采样、噪声调度、preconditioning、训练),用统一的 $\sigma$ 语言逐个调到最优,得到 CIFAR-10 35 NFE、FID 1.79/1.97,ImageNet-64 随机采样 511 NFE、FID 1.36 的又快又稳。** 顺着本单元走一遍: 1. 统一语言(§1)。$\sigma$ 是噪声水平、$p(x;\sigma)$ 是加噪分布、$D(x;\sigma)$ 是最优去噪器(论文式(2))。一条桥把去噪器变 score:$\nabla_x\log p=(D-x)/\sigma^2$(论文式(3)),形状就是高斯 score 把均值换成去噪输出。EDM 训 $D$、用时换 score。 2. 概率流 ODE(§2)。$\mathrm dx=-\dot\sigma\sigma\nabla_x\log p\,\mathrm dt$(论文式(1),即 Score-SDE 的 VE 概率流 ODE)。取 $\sigma(t)=t$、$s(t)=1$ 化成 $\mathrm dx/\mathrm dt=(x-D(x;t))/t$,切线永远指向去噪输出、轨迹近似直,这是能少步的根。 3. 确定性采样(§3)。Heun 二阶(起点+落点斜率取平均,$O(h^3)$,末步退回欧拉)比 Euler 省步;步长按论文式(5) 的 $\rho=7$ 调度,在小 $\sigma$ 处排密。 4. 随机采样(§4)。广义 SDE(论文式(6))= 概率流 ODE + 强度 $\beta$ 的 Langevin。Langevin 主动把样本拉回正确边缘、纠正累积误差。采样器每步「先 churn 加噪、再 Heun 降回」,旋钮 $S_{churn}/S_{tmin}/S_{tmax}/S_{noise}$。 5. preconditioning(§5)。$D_\theta=c_{skip}x+c_{out}F_\theta(c_{in}x;c_{noise})$(论文式(7));论文式(8) 露出有效目标;由「输入单位方差 → $c_{in}$、目标单位方差 → $c_{out}$ 含 $c_{skip}$、$c_{out}$ 最小 → $c_{skip}$」推出四个缩放($c_{noise}$ 经验)。作用是稳训练。 6. 训练配方(§6)。$\lambda(\sigma)=1/c_{out}^2$(各 $\sigma$ 有效权重相等)、$\ln\sigma\sim\mathcal N(P_{mean},P_{std}^2)$(力气集中在中间噪声水平)、非泄漏增广。这一步(配置 E、F)主降 FID。 7. 设计空间 + 结果(§7)。Table 1 四类旋钮;Table 2 显示 preconditioning 稳训练、损失+噪声分布主降 FID;CIFAR-10 1.79/1.97(35 NFE)、ImageNet-64 1.36(随机采样 511 NFE)。 --- ## §8.2 各章对应论文结构 | 论文位置 | 内容 | 对应章节 | 覆盖 | |---|---|---|---| | §1 引言 | 动机、设计空间思想 | §0 | ✅ 全 | | §2 | $p(x;\sigma)$、$\sigma_{data}$、去噪器 $D$、$\nabla\log p=(D-x)/\sigma^2$(论文式(2)(3)) | §1 | ✅ 全 | | §2 | 概率流 ODE(论文式(1))、缩放 $s(t)$ 与广义 ODE(论文式(4)) | §2 | ✅ 全($s(t)$/论文式(4) 入折叠) | | §2 结尾 + Table 1 | 统一框架、四类旋钮相互独立 | §0、§7 | ✅ 全 | | §3 | Heun 二阶(Alg.1)、$\{\sigma_i\}$ 调度(论文式(5), $\rho$)、$\sigma(t)=t$ 轨迹曲率(Fig 3) | §2、§3 | ✅ 全(步长误差分析要点已给,严格版 App D.1 从略) | | §4 | 广义 SDE(论文式(6))、Langevin churn、随机采样器(Alg.2) | §4 | ✅ 全(Euler–Maruyama 对比入折叠) | | §5 | preconditioning(论文式(7)(8), $c_{*}$)、$\lambda$、噪声分布、增广、结果 Table 2 | §5、§6、§7 | ✅ 全 | | 附录 A–F | 严格证明、VP/VE/iDDPM 逐列换算、$\sigma$ 调度分析、实验超参 | 散在各章折叠与 §5.4 主线 | ✅ preconditioning 推导(B.6)已给完整(§5.4 主线);VP/VE/iDDPM 逐列公式、步长误差分析(附录 D.1)严格版从略 | **论文正文的概念主线,本单元各章都有对应。** 推导深度见 §8.3。 --- ## §8.3 推导深度盘点 给到完整、可自己复现的:概率流 ODE 化简(§2,$\sigma(t)=t$ 那步逐行)、Heun 采样与 $\sigma_i$ 调度公式(§3)、preconditioning 四个缩放从第一性原理的完整推导(§5.4 主线,对应论文附录 B.6:输入/目标单位方差 + $c_{out}$ 最小化求导)、损失加权 $\lambda=1/c_{out}^2$(§6)。 给到结论 + 直觉、严格推导指到出处的:去噪器↔score(论文式(3))是 Tweedie 公式,结论给全、严格推导指向论文 [22]/附录 B.3;广义 SDE(论文式(6))给出三项结构与直觉,Song SDE 是 $\beta=\dot\sigma/\sigma$ 特例,严格推导指向附录 B.5。 从略的:VP/VE/iDDPM 在 Table 1 里逐列的换算公式(属旧方法、已在 Score-SDE 单元)、$\sigma$ 步长误差分析的严格版(附录 D.1,仅给「$\rho=3$ 均衡误差、$5\!-\!10$ 对图像更好」的结论)。 --- ## §8.4 下一步 - 进下一单元 Classifier-Free Guidance(CFG)(学习计划里 EDM 之后就是它)。EDM 的 $\sigma$ 语言、去噪器、概率流 ODE 会一直用下去。 - $\sigma$ 语言在 Flow Matching 还要用(学习计划 §10),EDM 这套「去噪器 + 直轨迹 ODE」是理解 Flow 的好台阶。 - 别忘了还有 EDM2(Karras, Aittala, Lehtinen, Hellsten, Aila, Laine,2023,《Analyzing and Improving the Training Dynamics of Diffusion Models》,arXiv:2312.02696,CVPR 2024):本篇 EDM 的续作,专攻训练动力学。核心是把网络层重新设计成「幅度保持」(让激活、权重、更新的幅度在训练全程期望上稳住),治好 ADM 架构(Dhariwal & Nichol 2021《Diffusion Models Beat GANs》那套扩散 U-Net,EDM 的 ImageNet-64 模型用的就是它)训练时幅度乱漂、失衡的毛病,ImageNet-512 FID 从 2.41 提到 1.81;外加一个独立贡献 post-hoc EMA(训练跑完再挑 EMA 长度,不必为调它重训)。定位:**它是精修、不是新支柱**,不引入新的采样或理论概念,属于「想深挖训练、冲 SOTA FID」时再回头看的深潜。主线仍是先 CFG、再 Flow Matching,EDM2 放它俩之后(或按需插)。 - 若要动手:EDM 的采样器(§3 Heun + 论文式(5) 调度)可直接作为 drop-in 换到你跑过的 SD 类模型上提速;训练配方(§6)需要重训。 --- ## 本节一条线 EDM = 把扩散拆成采样、噪声调度、preconditioning、训练四类独立旋钮,用统一 $\sigma$ 语言重讲 Score-SDE:去噪器 $D$ 就是 score(论文式(3)),概率流 ODE 取 $\sigma(t)=t$ 后轨迹近似直(论文式(1)),采样用 Heun 二阶 + 论文式(5) 调度少步、必要时加 Langevin 搅动(论文式(6)、Alg.2),网络套 preconditioning(论文式(7),$c_{*}$ 由单位方差推出)稳训练,损失 $\lambda=1/c_{out}^2$ 与对数正态噪声分布主降 FID,成果 CIFAR-10 1.79/1.97(35 NFE)、ImageNet-64 1.36(随机采样 511 NFE)。本单元各章覆盖论文正文主线,preconditioning 推导给完整(附录 B.6),VP/VE/iDDPM 逐列换算与步长误差分析严格版从略。下一单元 CFG 直接接上。