# 期望
**期望就是加权平均:随机变量每个可能取值,按它出现的概率加权,再加起来。**记号 $E[X]$。**这一课的写法核心是「线性性质」,扩散里算 $E[x_t]$ 全靠那几条。**
> [!abstract] 定义
> 随机变量 $X$ 的期望,是各取值乘以它的概率,加总:
> 离散(取值可数):
> $E[X]=\sum_x x\,p(x)$
> 连续(有密度 $p(x)$):
> $E[X]=\int x\,p(x)\,\mathrm{d}x$
> 直观:加权平均,概率大的取值占的份量大。
> [!note]- $p(x)$ 是概率还是密度
> 离散($X$ 取值数得清):$p(x)=P(X=x)$,就是「$X$ 正好等于 $x$」的概率,$0$ 到 $1$ 的数。
> 连续(像高斯):$p(x)$ 是概率密度,不是概率。
> - 取到某个精确点的概率是 $0$(一个点没宽度),所以 $p(x)$ 不是「在 $x$ 处的概率」。
> - 概率要积一段才有:$P(a\le X\le b)=\int_a^b p(x)\,\mathrm{d}x$。
> - 密度可以大于 $1$,只要 $\int p(x)\,\mathrm{d}x=1$。
> 直观:$p(x)$ 是「单位长度上的概率」。期望里 $x\,p(x)\,\mathrm{d}x$ 的 $p(x)\,\mathrm{d}x$,才是宽 $\mathrm{d}x$ 那一丝概率。扩散全是连续分布,基本按密度用。
> [!abstract] 线性性质(写法主力)
> 常数倍提得出:
> $E[aX]=a\,E[X]$
> 加常数:
> $E[X+b]=E[X]+b$
> 合起来:
> $E[aX+b]=a\,E[X]+b$
> 相加拆得开(就算 $X,Y$ 不独立也成立):
> $E[X+Y]=E[X]+E[Y]$
> 常数的期望是它自己:
> $E[c]=c$
> [!note]- 为什么是线性的(一句话)
> 期望就是「按概率加权再求和 / 积分」。求和、积分本来就能把常数倍提到外面、把相加拆成两份,所以期望对「相加」和「常数倍」是透明的。
⚠️ 线性只对「相加、常数倍」成立。$E[XY]$、$E[X^2]$、$E[g(X)]$ 一般不能把 $E$ 直接塞进去,比如 $E[X^2]\neq (E[X])^2$。这一课只用加法和常数倍那几条,别越界(平方那条,下一课讲方差会用到)。
> [!abstract] 例一,已知 $E[X]=\mu$,求 $E[2X+3]$
> $E[2X+3]$
> 常数倍 2 提出,常数 3 的期望是它自己:
> $=2\,E[X]+3$
> 代入 $E[X]=\mu$:
> $=2\mu+3$
> [!abstract] 例二,重参数化的均值(扩散关键)
> > $\varepsilon\sim\mathcal{N}(0,1)$,意思是 $\varepsilon$ 服从标准正态分布,均值 0、方差 1。它关于 0 对称,所以 $E[\varepsilon]=0$,这点下一课细讲。$\mu,\sigma$ 是常数。求 $E[\mu+\sigma\varepsilon]$:
> $E[\mu+\sigma\varepsilon]$
> $\mu$ 是常数,$\sigma$ 提出:
> $=\mu+\sigma\,E[\varepsilon]$
> 代入 $E[\varepsilon]=0$:
> $=\mu+\sigma\cdot 0=\mu$
> **重参数化 $x=\mu+\sigma\varepsilon$ 的均值就是 $\mu$,噪声 $\varepsilon$ 平均下来不偏。**
> [!question]- 练习六道。已知 $E[X]=\mu$、$E[Y]=\nu$,$\varepsilon\sim\mathcal{N}(0,1)$ 即 $E[\varepsilon]=0$,$\sigma$、$x_0$、$\bar\alpha$ 当常数
> 一,$E[3X]$
> 二,$E[X-4]$
> 三,$E[2X+5]$
> 四,$E[X+Y]$
> 五,$E[\sigma\varepsilon]$
> 六,$E\left[\sqrt{\bar\alpha}\,x_0+\sqrt{1-\bar\alpha}\,\varepsilon\right]$(DDPM 前向均值)
> [!note]- 练习答案
> 第一题
> $E[3X]$
> 常数 3 提出:
> $=3\,E[X]$
> 代 $E[X]=\mu$:
> $=3\mu$
> 第二题
> $E[X-4]$
> 减去常数 4:
> $=E[X]-4$
> 代入:
> $=\mu-4$
> 第三题
> $E[2X+5]$
> 2 提出,5 是常数的期望:
> $=2\,E[X]+5=2\mu+5$
> 第四题
> $E[X+Y]$
> 相加拆开:
> $=E[X]+E[Y]=\mu+\nu$
> 第五题
> $E[\sigma\varepsilon]$
> $\sigma$ 提出:
> $=\sigma\,E[\varepsilon]=\sigma\cdot 0=0$
> 第六题
> $E\left[\sqrt{\bar\alpha}\,x_0+\sqrt{1-\bar\alpha}\,\varepsilon\right]$
> 相加拆开:
> $=E\left[\sqrt{\bar\alpha}\,x_0\right]+E\left[\sqrt{1-\bar\alpha}\,\varepsilon\right]$
> 第一项整个是常数;第二项把 $\sqrt{1-\bar\alpha}$ 提出:
> $=\sqrt{\bar\alpha}\,x_0+\sqrt{1-\bar\alpha}\,E[\varepsilon]$
> 代入 $E[\varepsilon]=0$:
> $=\sqrt{\bar\alpha}\,x_0+\sqrt{1-\bar\alpha}\cdot 0=\sqrt{\bar\alpha}\,x_0$
> [!note]- $E[x_t]=\sqrt{\bar\alpha}\,x_0$ 是什么
> 它是这个分布的均值,也就是分布的中心,一个概括数。
> 完整的分布(分布形式)是 $\mathcal{N}(\text{均值},\ \text{方差})$,由两个数定:中心,加散开。这里我们拿到第一个,中心;方差(管散开)下一课算。
> $\sqrt{\bar\alpha}\,x_0$ 是 $x_t$ 里来自原图的那一块:原图 $x_0$ 乘上系数 $\sqrt{\bar\alpha}$,把它调暗。给定 $x_0$,这一块就定死了(确定值,不随机),所以 $x_t$ 的随机噪声不在这块,全在另一块、记在方差里。
> 累乘体现在系数上:$\sqrt{\bar\alpha}<1$,$t$ 越大越小,信号被调得越暗。淡多少由累乘 $\bar\alpha$ 记着($\bar\alpha$ 是各步 $\alpha$ 连乘起来的),每加一步噪声,系数 $\sqrt{\bar\alpha}$ 缩一点。所以这一块本身不含噪声,但它的系数记着噪声已经堆了多少。
> 直观:$E[\varepsilon]=0$ 是大量噪声样本的平均(对称,正负抵消)。每个 $x_t$ 带着自己那次的噪声,散在中心 $\sqrt{\bar\alpha}\,x_0$ 周围,它们的平均落点正是这个中心。
> $t$ 越大中心越往 0 缩,信号越来越少,几乎只剩噪声。