来源:Song 等,2021,arXiv:2011.13456,ICLR 2021。本节只做一件事:把整篇论文铺在你已知的版图上(公式从第 1 节开始)。 记号:本节是地图,为从你已会的知识搭桥,沿用 DDPM/DDIM 符号 $\bar\alpha_t$(累积量,论文写作 $\alpha_i:=\prod_{j\le i}(1-\beta_j)$)与 $\bar x$(VE 坐标,论文直接在 $x$ 上用 $\sigma(t)$)。从第 1 节起正文一律用论文符号;凡需要 DDPM 帮助理解处,都会当场标明「这是 DDPM 记号」。 读法:本节是地图。读完你应当能说出「这篇论文里,哪些是我已经会的老朋友换了身衣服、哪些才是真新东西」。 --- ## §0.1 一句话定位 这篇论文做的事:**把「加噪—去噪」从你熟的离散 $T$ 步搬到连续时间 $t\in[0,T]$,用一个随机微分方程(SDE)统一描述;并指出反向生成只需要一个量,score。**两条历史上分开的线(你会的 DDPM/DDIM,和你没正式学的 NCSN)在这里汇成一条河,而 DDPM、DDIM 都成了它的特例。 --- ## §0.2 三个「其实你已经会」的锚点 这一步:先按住焦虑,**这篇论文对你全新的内容,比看上去少得多。**三个最硬的地方,你其实已经站在门里了。 锚点一 · 概率流 ODE + 欧拉,你亲手验证过。 你在 DDIM 那节已经证明:确定性 DDIM($\eta=0$)就是某条 ODE 的一阶欧拉离散,跳步 = 大步长欧拉。本论文的核心对象之一「概率流 ODE」(后面式13)就是把你那条 ODE 推广到任意 SDE。读到那里时,你是在认出老朋友。 锚点二 · 你的 $\bar x$ 坐标,就是论文里的另一条河 VE。 你 DDIM 里用的 $\bar x = x/\sqrt{\bar\alpha}$、$\sigma=\sqrt{(1-\bar\alpha)/\bar\alpha}$,恰好就是本论文 VE 过程的坐标。你早就在 VE 坐标里跑过代码,只是没人告诉你那条河叫 VE。(严格推导留到第2、3节。) 锚点三 · 你训的 $\varepsilon$ 网络,本质是 score 网络。 你 DDPM 预测的 $\varepsilon$,和本论文的核心量 score,只差一个标量系数。所以你**已经训过一个 score 模型**了。(精确系数第1节推。) 结论:**真正要从零学的只有两块,① NCSN/VE 那条线的训练目标和采样(Langevin);② 把这一切写成连续时间 SDE 的形式语言。**其余都是你已有知识的推广或换装。 --- ## §0.3 一块总牌子:两条河是两个不同的东西 ⚠️ 你历史上栽过 VP↔VE 的混。先把牌子立这儿,后面每次出现都回看: > [!example] 两条河 · 一座桥(DDPM/NCSN 锚点) > VP(variance preserving):DDPM/DDIM 那条线。加噪时信号被 $\sqrt{\bar\alpha}$ 缩小、噪声补进来,总方差守恒。 > VE(variance exploding):NCSN。加噪时信号原样保留,噪声标准差 $\sigma$ 一路涨到很大,总方差爆炸。 > 桥:$\bar x = x/\sqrt{\bar\alpha}$。对 VP 的状态除以信号系数,就落到 VE 坐标。同一个过程,两种坐标。 --- ## §0.4 天际线预览(这些式子第3–6节才推,先混个脸熟) 下面四个量是全篇的地标。现在只要知道它们长在哪、对应哪一节。 > [!danger]- 四个地标(论文式预览,第一遍可不看) > 前向 SDE(把加噪写成连续时间),第3节: > $\mathrm{d}x = f(x,t)\,\mathrm{d}t + g(t)\,\mathrm{d}w$ > 反向 SDE(反着跑,只多一个 score),第4节: > $\mathrm{d}x = \big[\,f(x,t) - g(t)^2\,\nabla_x\log p_t(x)\,\big]\mathrm{d}t + g(t)\,\mathrm{d}\bar w$ > 概率流 ODE(同样的边缘,但确定性;你的主场),第6节: > $\mathrm{d}x = \big[\,f(x,t) - \tfrac{1}{2}g(t)^2\,\nabla_x\log p_t(x)\,\big]\mathrm{d}t$ > score(唯一要学的量),第1节: > $s_\theta(x,t) \approx \nabla_x\log p_t(x)$ 看出来没有:**反向 SDE 和概率流 ODE,除了 score 都是前向 SDE 的 $f$、$g$ 白送的**;两者唯一的差别是 $g^2$ 前的系数($1$ 还是 $\tfrac12$)和有没有那个随机项 $\mathrm{d}\bar w$。这就是后面所有内容的骨架。 --- ## §0.5 第一遍只抓三件事 1. score 是什么(第1节)。 2. VP / VE / sub-VP 三种 SDE 怎么对应你已学的(第2、3节)。 3. 概率流 ODE 怎么让 DDPM/DDIM 变成特例(第6节)。 其余(反向 SDE 的严格性、PC 采样、架构、可控生成)第一遍当背景走过即可。 --- ## §0.6 十二节路径 - 第0节 入口重定向 ← 你在这 - 第1节 score 是什么 - 第2节 VE / NCSN(你的 $\bar x$ 就是 VE) - 第3节 前向 SDE(DDPM→VP,NCSN→VE,sub-VP) - 第4节 反向 SDE(只缺 score) - 第5节 训 score(连续时间训练目标) - 第6节 概率流 ODE(DDIM 是它的特例) - 第7节 PC 采样 + Langevin - 第8节 似然与隐空间编辑(概率流 ODE 的两个红利) - 第9节 架构改进 + 结果 - 第10节 可控生成 + 逆问题(补全/上色;下单元 CFG 的桥) - 第11节 总结与覆盖率 --- ## 本节一条线 这篇论文把离散扩散搬进连续时间的 SDE,统一 VP(你会的)和 VE(NCSN)两条河,反向生成只靠 score。你已经握着三个锚点,概率流 ODE+欧拉、$\bar x$=VE 坐标、$\varepsilon$ 网络=score 网络,所以最硬的第一道坎,你已进门一半。下一节先把「score 是什么」钉死。