来源:Song 等,2021,arXiv:2011.13456,ICLR 2021。本节只做一件事:把整篇论文铺在你已知的版图上(公式从第 1 节开始)。
记号:本节是地图,为从你已会的知识搭桥,沿用 DDPM/DDIM 符号 $\bar\alpha_t$(累积量,论文写作 $\alpha_i:=\prod_{j\le i}(1-\beta_j)$)与 $\bar x$(VE 坐标,论文直接在 $x$ 上用 $\sigma(t)$)。从第 1 节起正文一律用论文符号;凡需要 DDPM 帮助理解处,都会当场标明「这是 DDPM 记号」。
读法:本节是地图。读完你应当能说出「这篇论文里,哪些是我已经会的老朋友换了身衣服、哪些才是真新东西」。
---
## §0.1 一句话定位
这篇论文做的事:**把「加噪—去噪」从你熟的离散 $T$ 步搬到连续时间 $t\in[0,T]$,用一个随机微分方程(SDE)统一描述;并指出反向生成只需要一个量,score。**两条历史上分开的线(你会的 DDPM/DDIM,和你没正式学的 NCSN)在这里汇成一条河,而 DDPM、DDIM 都成了它的特例。
---
## §0.2 三个「其实你已经会」的锚点
这一步:先按住焦虑,**这篇论文对你全新的内容,比看上去少得多。**三个最硬的地方,你其实已经站在门里了。
锚点一 · 概率流 ODE + 欧拉,你亲手验证过。
你在 DDIM 那节已经证明:确定性 DDIM($\eta=0$)就是某条 ODE 的一阶欧拉离散,跳步 = 大步长欧拉。本论文的核心对象之一「概率流 ODE」(后面式13)就是把你那条 ODE 推广到任意 SDE。读到那里时,你是在认出老朋友。
锚点二 · 你的 $\bar x$ 坐标,就是论文里的另一条河 VE。
你 DDIM 里用的 $\bar x = x/\sqrt{\bar\alpha}$、$\sigma=\sqrt{(1-\bar\alpha)/\bar\alpha}$,恰好就是本论文 VE 过程的坐标。你早就在 VE 坐标里跑过代码,只是没人告诉你那条河叫 VE。(严格推导留到第2、3节。)
锚点三 · 你训的 $\varepsilon$ 网络,本质是 score 网络。
你 DDPM 预测的 $\varepsilon$,和本论文的核心量 score,只差一个标量系数。所以你**已经训过一个 score 模型**了。(精确系数第1节推。)
结论:**真正要从零学的只有两块,① NCSN/VE 那条线的训练目标和采样(Langevin);② 把这一切写成连续时间 SDE 的形式语言。**其余都是你已有知识的推广或换装。
---
## §0.3 一块总牌子:两条河是两个不同的东西
⚠️ 你历史上栽过 VP↔VE 的混。先把牌子立这儿,后面每次出现都回看:
> [!example] 两条河 · 一座桥(DDPM/NCSN 锚点)
> VP(variance preserving):DDPM/DDIM 那条线。加噪时信号被 $\sqrt{\bar\alpha}$ 缩小、噪声补进来,总方差守恒。
> VE(variance exploding):NCSN。加噪时信号原样保留,噪声标准差 $\sigma$ 一路涨到很大,总方差爆炸。
> 桥:$\bar x = x/\sqrt{\bar\alpha}$。对 VP 的状态除以信号系数,就落到 VE 坐标。同一个过程,两种坐标。
---
## §0.4 天际线预览(这些式子第3–6节才推,先混个脸熟)
下面四个量是全篇的地标。现在只要知道它们长在哪、对应哪一节。
> [!danger]- 四个地标(论文式预览,第一遍可不看)
> 前向 SDE(把加噪写成连续时间),第3节:
> $\mathrm{d}x = f(x,t)\,\mathrm{d}t + g(t)\,\mathrm{d}w$
> 反向 SDE(反着跑,只多一个 score),第4节:
> $\mathrm{d}x = \big[\,f(x,t) - g(t)^2\,\nabla_x\log p_t(x)\,\big]\mathrm{d}t + g(t)\,\mathrm{d}\bar w$
> 概率流 ODE(同样的边缘,但确定性;你的主场),第6节:
> $\mathrm{d}x = \big[\,f(x,t) - \tfrac{1}{2}g(t)^2\,\nabla_x\log p_t(x)\,\big]\mathrm{d}t$
> score(唯一要学的量),第1节:
> $s_\theta(x,t) \approx \nabla_x\log p_t(x)$
看出来没有:**反向 SDE 和概率流 ODE,除了 score 都是前向 SDE 的 $f$、$g$ 白送的**;两者唯一的差别是 $g^2$ 前的系数($1$ 还是 $\tfrac12$)和有没有那个随机项 $\mathrm{d}\bar w$。这就是后面所有内容的骨架。
---
## §0.5 第一遍只抓三件事
1. score 是什么(第1节)。
2. VP / VE / sub-VP 三种 SDE 怎么对应你已学的(第2、3节)。
3. 概率流 ODE 怎么让 DDPM/DDIM 变成特例(第6节)。
其余(反向 SDE 的严格性、PC 采样、架构、可控生成)第一遍当背景走过即可。
---
## §0.6 十二节路径
- 第0节 入口重定向 ← 你在这
- 第1节 score 是什么
- 第2节 VE / NCSN(你的 $\bar x$ 就是 VE)
- 第3节 前向 SDE(DDPM→VP,NCSN→VE,sub-VP)
- 第4节 反向 SDE(只缺 score)
- 第5节 训 score(连续时间训练目标)
- 第6节 概率流 ODE(DDIM 是它的特例)
- 第7节 PC 采样 + Langevin
- 第8节 似然与隐空间编辑(概率流 ODE 的两个红利)
- 第9节 架构改进 + 结果
- 第10节 可控生成 + 逆问题(补全/上色;下单元 CFG 的桥)
- 第11节 总结与覆盖率
---
## 本节一条线
这篇论文把离散扩散搬进连续时间的 SDE,统一 VP(你会的)和 VE(NCSN)两条河,反向生成只靠 score。你已经握着三个锚点,概率流 ODE+欧拉、$\bar x$=VE 坐标、$\varepsilon$ 网络=score 网络,所以最硬的第一道坎,你已进门一半。下一节先把「score 是什么」钉死。