# 期望 **期望就是加权平均:随机变量每个可能取值,按它出现的概率加权,再加起来。**记号 $E[X]$。**这一课的写法核心是「线性性质」,扩散里算 $E[x_t]$ 全靠那几条。** > [!abstract] 定义 > 随机变量 $X$ 的期望,是各取值乘以它的概率,加总: > 离散(取值可数): > $E[X]=\sum_x x\,p(x)$ > 连续(有密度 $p(x)$): > $E[X]=\int x\,p(x)\,\mathrm{d}x$ > 直观:加权平均,概率大的取值占的份量大。 > [!note]- $p(x)$ 是概率还是密度 > 离散($X$ 取值数得清):$p(x)=P(X=x)$,就是「$X$ 正好等于 $x$」的概率,$0$ 到 $1$ 的数。 > 连续(像高斯):$p(x)$ 是概率密度,不是概率。 > - 取到某个精确点的概率是 $0$(一个点没宽度),所以 $p(x)$ 不是「在 $x$ 处的概率」。 > - 概率要积一段才有:$P(a\le X\le b)=\int_a^b p(x)\,\mathrm{d}x$。 > - 密度可以大于 $1$,只要 $\int p(x)\,\mathrm{d}x=1$。 > 直观:$p(x)$ 是「单位长度上的概率」。期望里 $x\,p(x)\,\mathrm{d}x$ 的 $p(x)\,\mathrm{d}x$,才是宽 $\mathrm{d}x$ 那一丝概率。扩散全是连续分布,基本按密度用。 > [!abstract] 线性性质(写法主力) > 常数倍提得出: > $E[aX]=a\,E[X]$ > 加常数: > $E[X+b]=E[X]+b$ > 合起来: > $E[aX+b]=a\,E[X]+b$ > 相加拆得开(就算 $X,Y$ 不独立也成立): > $E[X+Y]=E[X]+E[Y]$ > 常数的期望是它自己: > $E[c]=c$ > [!note]- 为什么是线性的(一句话) > 期望就是「按概率加权再求和 / 积分」。求和、积分本来就能把常数倍提到外面、把相加拆成两份,所以期望对「相加」和「常数倍」是透明的。 ⚠️ 线性只对「相加、常数倍」成立。$E[XY]$、$E[X^2]$、$E[g(X)]$ 一般不能把 $E$ 直接塞进去,比如 $E[X^2]\neq (E[X])^2$。这一课只用加法和常数倍那几条,别越界(平方那条,下一课讲方差会用到)。 > [!abstract] 例一,已知 $E[X]=\mu$,求 $E[2X+3]$ > $E[2X+3]$ > 常数倍 2 提出,常数 3 的期望是它自己: > $=2\,E[X]+3$ > 代入 $E[X]=\mu$: > $=2\mu+3$ > [!abstract] 例二,重参数化的均值(扩散关键) > > $\varepsilon\sim\mathcal{N}(0,1)$,意思是 $\varepsilon$ 服从标准正态分布,均值 0、方差 1。它关于 0 对称,所以 $E[\varepsilon]=0$,这点下一课细讲。$\mu,\sigma$ 是常数。求 $E[\mu+\sigma\varepsilon]$: > $E[\mu+\sigma\varepsilon]$ > $\mu$ 是常数,$\sigma$ 提出: > $=\mu+\sigma\,E[\varepsilon]$ > 代入 $E[\varepsilon]=0$: > $=\mu+\sigma\cdot 0=\mu$ > **重参数化 $x=\mu+\sigma\varepsilon$ 的均值就是 $\mu$,噪声 $\varepsilon$ 平均下来不偏。** > [!question]- 练习六道。已知 $E[X]=\mu$、$E[Y]=\nu$,$\varepsilon\sim\mathcal{N}(0,1)$ 即 $E[\varepsilon]=0$,$\sigma$、$x_0$、$\bar\alpha$ 当常数 > 一,$E[3X]$ > 二,$E[X-4]$ > 三,$E[2X+5]$ > 四,$E[X+Y]$ > 五,$E[\sigma\varepsilon]$ > 六,$E\left[\sqrt{\bar\alpha}\,x_0+\sqrt{1-\bar\alpha}\,\varepsilon\right]$(DDPM 前向均值) > [!note]- 练习答案 > 第一题 > $E[3X]$ > 常数 3 提出: > $=3\,E[X]$ > 代 $E[X]=\mu$: > $=3\mu$ > 第二题 > $E[X-4]$ > 减去常数 4: > $=E[X]-4$ > 代入: > $=\mu-4$ > 第三题 > $E[2X+5]$ > 2 提出,5 是常数的期望: > $=2\,E[X]+5=2\mu+5$ > 第四题 > $E[X+Y]$ > 相加拆开: > $=E[X]+E[Y]=\mu+\nu$ > 第五题 > $E[\sigma\varepsilon]$ > $\sigma$ 提出: > $=\sigma\,E[\varepsilon]=\sigma\cdot 0=0$ > 第六题 > $E\left[\sqrt{\bar\alpha}\,x_0+\sqrt{1-\bar\alpha}\,\varepsilon\right]$ > 相加拆开: > $=E\left[\sqrt{\bar\alpha}\,x_0\right]+E\left[\sqrt{1-\bar\alpha}\,\varepsilon\right]$ > 第一项整个是常数;第二项把 $\sqrt{1-\bar\alpha}$ 提出: > $=\sqrt{\bar\alpha}\,x_0+\sqrt{1-\bar\alpha}\,E[\varepsilon]$ > 代入 $E[\varepsilon]=0$: > $=\sqrt{\bar\alpha}\,x_0+\sqrt{1-\bar\alpha}\cdot 0=\sqrt{\bar\alpha}\,x_0$ > [!note]- $E[x_t]=\sqrt{\bar\alpha}\,x_0$ 是什么 > 它是这个分布的均值,也就是分布的中心,一个概括数。 > 完整的分布(分布形式)是 $\mathcal{N}(\text{均值},\ \text{方差})$,由两个数定:中心,加散开。这里我们拿到第一个,中心;方差(管散开)下一课算。 > $\sqrt{\bar\alpha}\,x_0$ 是 $x_t$ 里来自原图的那一块:原图 $x_0$ 乘上系数 $\sqrt{\bar\alpha}$,把它调暗。给定 $x_0$,这一块就定死了(确定值,不随机),所以 $x_t$ 的随机噪声不在这块,全在另一块、记在方差里。 > 累乘体现在系数上:$\sqrt{\bar\alpha}<1$,$t$ 越大越小,信号被调得越暗。淡多少由累乘 $\bar\alpha$ 记着($\bar\alpha$ 是各步 $\alpha$ 连乘起来的),每加一步噪声,系数 $\sqrt{\bar\alpha}$ 缩一点。所以这一块本身不含噪声,但它的系数记着噪声已经堆了多少。 > 直观:$E[\varepsilon]=0$ 是大量噪声样本的平均(对称,正负抵消)。每个 $x_t$ 带着自己那次的噪声,散在中心 $\sqrt{\bar\alpha}\,x_0$ 周围,它们的平均落点正是这个中心。 > $t$ 越大中心越往 0 缩,信号越来越少,几乎只剩噪声。