来源:Ho、Jain、Abbeel,2020,arXiv 2006.11239,NeurIPS 2020。公式号与论文一致。符号约定与常用公式卡见本单元 00_导读。
这一节讲:§6 固定反向方差,$L_{t-1}$ 从两个高斯的 KL 塌成两个中心的距离(公式 8);§7 把标准答案中心改写成只含 $x_t$ 和 $\epsilon$(公式 10),网络取同形(公式 11),对齐中心变成预测噪声(公式 12),并给出采样一步。
---
## §6 固定方差,只剩对齐中心
**这一步**:标准答案备好了,这一节让网络去对齐它。$L_{t-1}$ 是两个高斯之间的 KL,看着吓人;把不需要学的东西逐一钉死之后,它塌成一个朴素得多的东西:两个中心的距离。
**结论**:$L_T$ 不含 $\theta$,丢弃;反向方差固定为常数 $\sigma_t^2 I$(取 $\beta_t$ 或 $\tilde\beta_t$,效果相近);$L_{t-1}$ 化为公式 8——中心差的平方。
> [!abstract] 公式 8 · $L_{t-1}$ 只剩中心差
> $L_{t-1} = \mathbb{E}_q\Big[\frac{1}{2\sigma_t^2}\|\tilde\mu_t(x_t,x_0) - \mu_\theta(x_t,t)\|^2\Big] + C$
> 外层 $\mathbb{E}_q$ 对 $x_t,x_0$(等价于 $x_0,\epsilon$)求期望——$\tilde\mu_t,\mu_\theta$ 都随 $x_t$ 变、是随机量;$C$ 不依赖 $\theta$。不论 $\sigma_t^2$ 取 $\beta_t$ 还是 $\tilde\beta_t$,训练 $L_{t-1}$ 即让网络中心 $\mu_\theta$ 逼近标准答案中心 $\tilde\mu_t$。
> [!note]- 旁注:$L_T$ 为何丢弃、方差为何固定(支线)
> **$L_T$**:$L_T=D_\text{KL}(q(x_T\mid x_0)\|p(x_T))$ 完全由前向闭式(公式 4)与固定的 $p(x_T)=\mathcal{N}(0,I)$ 决定,不含 $\theta$,对优化为常数、丢弃。
> **固定方差**:论文把反向方差设为不学的常数 $\Sigma_\theta=\sigma_t^2 I$(取 $\sigma_t^2=\beta_t$ 或 $\tilde\beta_t$,效果相近)。论文还给了两档的身份:$\beta_t$ 对 $x_0\sim\mathcal{N}(0,I)$ 的数据最优、$\tilde\beta_t$ 对 $x_0$ 为固定一点的数据最优,是反向过程熵上下界对应的两个极端,真实数据落在两者之间,故取哪个都行。方差固定后,反向这一步唯一可变的是中心 $\mu_\theta$。
> [!note]- 推导:两个高斯的 KL,交叉项归零
> **锚点**:§4 工具框的 KL 定义 $D_\text{KL}(q\|p)=\mathbb{E}_q[\log q-\log p]$、00_导读「符号约定」里高斯取对数那条、§5 公式 6 的标准答案 $q=\mathcal{N}(\tilde\mu_t,\tilde\beta_t I)$、§1 公式 1 配固定方差后的网络 $p_\theta=\mathcal{N}(\mu_\theta,\sigma_t^2 I)$。
>
> **① 把两个 log 写成高斯指数形。** $\log q$、$\log p_\theta$ 即高斯密度取对数。用 00_导读「符号约定」那条 $\log\mathcal{N}(x;\mu,\sigma^2 I)=-\frac{1}{2\sigma^2}\|x-\mu\|^2+c(\sigma)$(高斯 = 归一化常数 × $\exp$,对数化为平方项加常数 $c(\sigma)=-\frac{N}{2}\log 2\pi\sigma^2$),分别代入 $q,p_\theta$:
> $\log q=-\frac{1}{2\tilde\beta_t}\|x_{t-1}-\tilde\mu_t\|^2+c(\tilde\beta_t),\qquad \log p_\theta=-\frac{1}{2\sigma_t^2}\|x_{t-1}-\mu_\theta\|^2+c(\sigma_t)$
> 相减($c$ 只含方差、不含 $\theta$ 与 $x_{t-1}$,为常数,归入 $C$):
> $\log q-\log p_\theta=-\frac{1}{2\tilde\beta_t}\|x_{t-1}-\tilde\mu_t\|^2+\frac{1}{2\sigma_t^2}\|x_{t-1}-\mu_\theta\|^2+\text{常数}$
>
> **② 对 $q$ 求期望**(随机量为 $x_{t-1}$,在 $q$ 下 $x_{t-1}\sim\mathcal{N}(\tilde\mu_t,\tilde\beta_t I)$)。系数只含方差、为常数,提到 $\mathbb{E}$ 外。
> - **第一项** $-\frac{1}{2\tilde\beta_t}\mathbb{E}_q\|x_{t-1}-\tilde\mu_t\|^2$:$\mathbb{E}_q\|x_{t-1}-\tilde\mu_t\|^2$ 是 $x_{t-1}$ 减其自身中心 $\tilde\mu_t$ 的平方期望,即**方差定义**,等于 $N\tilde\beta_t$。不含 $\theta$,归入 $C$。
> - **第二项** $\frac{1}{2\sigma_t^2}\mathbb{E}_q\|x_{t-1}-\mu_\theta\|^2$:减的是 $\mu_\theta$,非 $x_{t-1}$ 自身中心,不能直接套方差。**加减配项**引入 $\tilde\mu_t$:
> $x_{t-1}-\mu_\theta=(x_{t-1}-\tilde\mu_t)+(\tilde\mu_t-\mu_\theta)$
> 取范数平方,用 $\|a+b\|^2=\|a\|^2+2a^\top b+\|b\|^2$ 展开:
> $\|x_{t-1}-\mu_\theta\|^2=\|x_{t-1}-\tilde\mu_t\|^2+2(x_{t-1}-\tilde\mu_t)^\top(\tilde\mu_t-\mu_\theta)+\|\tilde\mu_t-\mu_\theta\|^2$
> 求期望:第一块 → 方差,归入 $C$;**交叉项** $(\tilde\mu_t-\mu_\theta)$ 不随机、提到期望外,剩 $\mathbb{E}_q(x_{t-1}-\tilde\mu_t)=0$,整项为零;第三块 $\|\tilde\mu_t-\mu_\theta\|^2$ 不含随机量、原样留下,含 $\theta$,即待优化项。
>
> **③ 收尾。** 把不含中心差的项记作 $C$,先得**单步 KL**($x_t,x_0$ 固定时对 $x_{t-1}$ 积分的精确结果):
> $D_\text{KL}\big(q(x_{t-1}\mid x_t,x_0)\,\|\,p_\theta(x_{t-1}\mid x_t)\big)=\frac{1}{2\sigma_t^2}\|\tilde\mu_t-\mu_\theta\|^2+C$
> 它不带期望(KL 的积分已消去 $x_{t-1}$)。再套公式 5 中 $L_{t-1}$ 外层对 $x_t,x_0$ 的 $\mathbb{E}_q$,即公式 8:
> $L_{t-1}=\mathbb{E}_q\Big[\frac{1}{2\sigma_t^2}\|\tilde\mu_t-\mu_\theta\|^2\Big]+C$
> ($\tilde\mu_t,\mu_\theta$ 随 $x_t$ 变,此层期望不可省;§7 将写成 $\mathbb{E}_{x_0,\epsilon}$。)
---
## §7 对齐中心 = 预测噪声
**这一步**:对齐中心还差最后一步翻译。标准答案中心 $\tilde\mu_t$ 里,$x_t$ 采样时本来就在手里,再把 $x_0$ 用闭式反解掉,唯一未知的只剩当初加进去的那份噪声 $\epsilon$。于是网络的任务从「预测中心」塌成「预测噪声」,DDPM 最出名的那句话在这一节诞生。
**结论**:把 $\tilde\mu_t$ 改写成只含 $x_t$ 与 $\epsilon$(公式 10),反向中心取同形、只把 $\epsilon$ 换成网络的 $\epsilon_\theta$(公式 11),代回公式 8,$L_{t-1}$ 化为预测噪声的均方误差(公式 12)。
> [!abstract] 公式 11 · 反向中心(只缺一份噪声)
> $\mu_\theta(x_t,t) = \frac{1}{\sqrt{\alpha_t}}\Big(x_t - \frac{\beta_t}{\sqrt{1-\bar\alpha_t}}\,\epsilon_\theta(x_t,t)\Big)$
> [!abstract] 公式 12 · $L_{t-1}$ 落到预测噪声
> $L_{t-1} = \mathbb{E}_{x_0,\epsilon}\!\Big[\frac{\beta_t^2}{2\sigma_t^2\,\alpha_t(1-\bar\alpha_t)}\big\|\epsilon - \epsilon_\theta(x_t,t)\big\|^2\Big]$
> [!note]- 推导一:把 $\tilde\mu_t$ 改写成只含 $x_t$ 与 $\epsilon$(论文 eq 9 → eq 10)
> **锚点**:§2 公式 4 的重参数化 $x_t(x_0,\epsilon)=\sqrt{\bar\alpha_t}x_0+\sqrt{1-\bar\alpha_t}\,\epsilon$(论文用 $x_t(x_0,\epsilon)$ 强调 $x_t$ 是 $x_0,\epsilon$ 的函数),及 §5 公式 7 的 $\tilde\mu_t(x_t,x_0)=\frac{\sqrt{\bar\alpha_{t-1}}\beta_t}{1-\bar\alpha_t}x_0+\frac{\sqrt{\alpha_t}(1-\bar\alpha_{t-1})}{1-\bar\alpha_t}x_t$。
>
> 论文 **eq 9** 是把反解的 $x_0$ 代入公式 8 的 $\tilde\mu_t$(尚未化简):$L_{t-1}-C=\mathbb{E}_{x_0,\epsilon}[\frac{1}{2\sigma_t^2}\|\tilde\mu_t(x_t,\tfrac{1}{\sqrt{\bar\alpha_t}}(x_t-\sqrt{1-\bar\alpha_t}\epsilon))-\mu_\theta(x_t,t)\|^2]$。下面将 $\tilde\mu_t$ 化简到底即 **eq 10**。
>
> **① 反解 $x_0$。** 从公式 4 解出 $x_0$:
> $x_0=\frac{1}{\sqrt{\bar\alpha_t}}\big(x_t-\sqrt{1-\bar\alpha_t}\,\epsilon\big)$
> **② 代入 $\tilde\mu_t$ 的 $x_0$ 项。** 公式 7 第一项系数记 $c_0=\frac{\sqrt{\bar\alpha_{t-1}}\beta_t}{1-\bar\alpha_t}$。用 $\bar\alpha_t=\alpha_t\bar\alpha_{t-1}$,即 $\sqrt{\bar\alpha_t}=\sqrt{\alpha_t}\sqrt{\bar\alpha_{t-1}}$,把 $c_0 x_0$ 里的 $\sqrt{\bar\alpha_{t-1}}$ 与分母 $\sqrt{\bar\alpha_t}$ 约去:
> $c_0 x_0=\frac{\sqrt{\bar\alpha_{t-1}}\beta_t}{1-\bar\alpha_t}\cdot\frac{1}{\sqrt{\alpha_t}\sqrt{\bar\alpha_{t-1}}}\big(x_t-\sqrt{1-\bar\alpha_t}\,\epsilon\big)=\frac{\beta_t}{(1-\bar\alpha_t)\sqrt{\alpha_t}}\big(x_t-\sqrt{1-\bar\alpha_t}\,\epsilon\big)$
> 拆成 $x_t$ 项与 $\epsilon$ 项($\epsilon$ 项里 $\sqrt{1-\bar\alpha_t}$ 约去分母一个,剩 $\sqrt{1-\bar\alpha_t}$ 在分母):
> $c_0 x_0=\frac{\beta_t}{(1-\bar\alpha_t)\sqrt{\alpha_t}}\,x_t-\frac{\beta_t}{\sqrt{1-\bar\alpha_t}\,\sqrt{\alpha_t}}\,\epsilon$
> **③ 合并 $x_t$ 系数。** 公式 7 第二项 $c_t x_t$ 的 $c_t=\frac{\sqrt{\alpha_t}(1-\bar\alpha_{t-1})}{1-\bar\alpha_t}$,把 $\sqrt{\alpha_t}$ 写成 $\frac{\alpha_t}{\sqrt{\alpha_t}}$ 以便通分:$c_t=\frac{\alpha_t(1-\bar\alpha_{t-1})}{(1-\bar\alpha_t)\sqrt{\alpha_t}}$。与 ② 的 $x_t$ 系数相加:
> $\frac{\alpha_t(1-\bar\alpha_{t-1})}{(1-\bar\alpha_t)\sqrt{\alpha_t}}+\frac{\beta_t}{(1-\bar\alpha_t)\sqrt{\alpha_t}}=\frac{\alpha_t(1-\bar\alpha_{t-1})+\beta_t}{(1-\bar\alpha_t)\sqrt{\alpha_t}}$
> 分子即 §5 的化简 $\alpha_t(1-\bar\alpha_{t-1})+\beta_t=1-\bar\alpha_t$,与分母 $(1-\bar\alpha_t)$ 约去,$x_t$ 系数为 $\frac{1}{\sqrt{\alpha_t}}$。
> **④ $\epsilon$ 系数** 只来自 ②:$-\frac{\beta_t}{\sqrt{1-\bar\alpha_t}\sqrt{\alpha_t}}=-\frac{1}{\sqrt{\alpha_t}}\cdot\frac{\beta_t}{\sqrt{1-\bar\alpha_t}}$。两块拼合(提出公因子 $\frac{1}{\sqrt{\alpha_t}}$),即论文 eq 10 中 $\tilde\mu_t$ 的化简形:
> $\tilde\mu_t=\frac{1}{\sqrt{\alpha_t}}\Big(x_t-\frac{\beta_t}{\sqrt{1-\bar\alpha_t}}\,\epsilon\Big)\qquad(\text{公式 10})$
> 中心只含两项:$x_t$(采样时已知)与 $\epsilon$(唯一未知)。
> [!note]- 推导二:网络取同形 → 中心差只剩噪声差 → 代回得公式 12
> **锚点**:推导一的公式 10,及 §6 公式 8 的 $L_{t-1}=\frac{1}{2\sigma_t^2}\|\tilde\mu_t-\mu_\theta\|^2$。
>
> **① 网络中心取同形。** 中心只缺 $\epsilon$,故让网络预测 $\epsilon$、记 $\epsilon_\theta$,反向中心按公式 10 写:
> $\mu_\theta=\frac{1}{\sqrt{\alpha_t}}\Big(x_t-\frac{\beta_t}{\sqrt{1-\bar\alpha_t}}\,\epsilon_\theta\Big)\qquad(\text{公式 11})$
> **② 相减,$x_t$ 抵消。** 两式同形,相减后 $x_t$ 项消去,只差噪声:
> $\tilde\mu_t-\mu_\theta=\frac{1}{\sqrt{\alpha_t}}\cdot\frac{\beta_t}{\sqrt{1-\bar\alpha_t}}\,(\epsilon_\theta-\epsilon)$
> **③ 平方**(范数平方消去符号,$\|\epsilon_\theta-\epsilon\|^2=\|\epsilon-\epsilon_\theta\|^2$):
> $\|\tilde\mu_t-\mu_\theta\|^2=\frac{1}{\alpha_t}\cdot\frac{\beta_t^2}{1-\bar\alpha_t}\,\|\epsilon-\epsilon_\theta\|^2=\frac{\beta_t^2}{\alpha_t(1-\bar\alpha_t)}\|\epsilon-\epsilon_\theta\|^2$
> **④ 代回公式 8**(中心差平方移入 $\mathbb{E}_{x_0,\epsilon}$,系数为常数提入):
> $L_{t-1}=\mathbb{E}_{x_0,\epsilon}\Big[\frac{1}{2\sigma_t^2}\cdot\frac{\beta_t^2}{\alpha_t(1-\bar\alpha_t)}\|\epsilon-\epsilon_\theta\|^2\Big]=\mathbb{E}_{x_0,\epsilon}\Big[\frac{\beta_t^2}{2\sigma_t^2\alpha_t(1-\bar\alpha_t)}\|\epsilon-\epsilon_\theta(x_t,t)\|^2\Big]$
> 对齐中心化为:网络从含噪图 $x_t$ 与步数 $t$ 预测所加噪声 $\epsilon$,与真噪声求平方差。
> [!abstract] 采样一步(训练后执行)
> $x_{t-1} = \frac{1}{\sqrt{\alpha_t}}\Big(x_t - \frac{1-\alpha_t}{\sqrt{1-\bar\alpha_t}}\,\epsilon_\theta(x_t,t)\Big) + \sigma_t z,\qquad z \sim \mathcal{N}(0,I)$
> 即从 $p_\theta(x_{t-1} \mid x_t) = \mathcal{N}(\mu_\theta,\sigma_t^2 I)$ 抽样 = 中心 $\mu_\theta$(公式 11,$\beta_t=1-\alpha_t$)+ 缩放噪声 $\sigma_t z$。
> [!note]- 支线:论文自认的主要贡献,ε 预测连通 score matching 与 Langevin
> 论文 §3.2 和附录 C 反复强调:换成预测 $\epsilon$ 的参数化后,训练目标(公式 12)形同「多噪声级上的去噪 score matching」,采样(算法 2)形同「退火 Langevin 动力学」,$\epsilon_\theta$ 扮演的是数据密度梯度(score)的角色。论文把这条连通列为自己的主要贡献之一,本笔记主线为了推导紧凑没有展开。你已在 Score-SDE 单元见过这条线的全貌:$\hat\epsilon$ 与 score 只差一个负号和缩放,DDPM 的这段话正是那一整套理论的起点。
---
## 本节一条线
$L_T$ 不含 $\theta$ 丢弃、反向方差固定为常数后,KL 展开中交叉项归零,只剩中心差 $\frac{1}{2\sigma_t^2}\|\tilde\mu_t-\mu_\theta\|^2$(公式 8);用闭式反解 $x_0$ 代入 $\tilde\mu_t$,化简成只含 $x_t$ 与 $\epsilon$ 的公式 10,唯一未知只剩 $\epsilon$;网络取同形换上 $\epsilon_\theta$(公式 11),相减 $x_t$ 抵消,$L_{t-1}$ 落成预测噪声的加权 MSE(公式 12)。