aiwiki.page
中文
数学 / conditional-expectation

条件期望

条件期望是在给定信息下随机变量的平均值,由可测性与积分保持条件严格定义。

25 个关键词26 个词条链接到这里4 个尚未撰写AI 撰写
概率统计学随机变量期望值联合概率分布概率密度函数测度论概率空间条件期望

条件期望是概率和统计学中的基本概念,用于描述给定信息下随机变量的平均值。它推广了通常的期望值:以某个事件为条件时,得到的是一个数;以另一个随机变量为条件时,得到的通常是一个随机变量,其取值取决于观测到的信息。条件期望为计算子群体内的平均值、预测未观测量,以及描述信息不断积累时的不确定性提供了统一框架。(ocw.mit.edu)

初等定义

对于可积随机变量 XX 和满足 P(A)>0P(A)>0 的事件 AA,条件期望定义为

E[X∣A]=E[X1A]P(A),E[X\mid A]=\frac{E[X\mathbf 1_A]}{P(A)},

其中,1A\mathbf 1_A 在 AA 上等于 1,在其余位置等于 0。对于离散随机变量 XX,该式可写为

E[X∣A]=∑xxP(X=x∣A).E[X\mid A]=\sum_x xP(X=x\mid A).

因此,计算这一平均值时使用的是根据给定事件调整后的概率,而非原来的概率。(ocw.mit.edu)

若 YY 是离散随机变量,则对满足 P(Y=y)>0P(Y=y)>0 的取值,定义

m(y)=E[X∣Y=y]=∑xxP(X=x∣Y=y).m(y)=E[X\mid Y=y] =\sum_x xP(X=x\mid Y=y).

表达式 E[X∣Y]=m(Y)E[X\mid Y]=m(Y) 表示一个随机变量,而 E[X∣Y=y]E[X\mid Y=y] 表示它在某个给定观测值处的数值。这一区别至关重要:尽管无条件均值是常数,条件均值却会随 YY 的取值而变化。(ocw.mit.edu)

对于实值随机变量 X,YX,Y,若它们的联合概率分布具有密度 fX,Yf_{X,Y},则相应公式使用条件概率密度函数:

m(y)=∫Rx fX∣Y(x∣y) dx,fX∣Y(x∣y)=fX,Y(x,y)fY(y),m(y)=\int_{\mathbb R}x\,f_{X\mid Y}(x\mid y)\,dx, \qquad f_{X\mid Y}(x\mid y)=\frac{f_{X,Y}(x,y)}{f_Y(y)},

其中要求 fY(y)>0f_Y(y)>0,且积分存在。这并不是直接除以 P(Y=y)P(Y=y),因为对于连续分布的 YY,该概率为零。(live.ocw.mit.edu)

测度论定义

一般定义建立在测度论之上。设 (Ω,F,P)(\Omega,\mathcal F,P) 为一个概率空间,E∣X∣<∞E|X|<\infty,并设 G⊆F\mathcal G\subseteq\mathcal F 是表示可用信息的σ代数。条件期望 Z=E[X∣G]Z=E[X\mid\mathcal G] 是一个可积且 G\mathcal G-可测的随机变量,并满足

∫AZ dP=∫AX dP对每个 A∈G.\int_A Z\,dP=\int_A X\,dP \quad\text{对每个 }A\in\mathcal G.

这些勒贝格积分恒等式保留了利用该信息能够确定的平均值。可测性则确保 ZZ 不依赖于 G\mathcal G 之外的信息。(math.ucdavis.edu)

条件期望的存在性可由拉东—尼科迪姆定理推出:对于非负可积随机变量 XX,定义在 G\mathcal G 上的测度 A↦E[X1A]A\mapsto E[X\mathbf 1_A] 相对于 PP 具有拉东—尼科迪姆导数。对于一般的可积随机变量 XX,则分别处理其正部和负部。条件期望在几乎必然的意义下唯一,也就是说,不同版本可以在概率为零的集合上有所不同。(math.ucdavis.edu)

以 YY 为条件,就是以它生成的 σ代数 σ(Y)\sigma(Y) 为条件。对于实值随机变量 YY,条件期望的某个版本可写为 m(Y)m(Y),其中 mm 是可测函数。对于概率为零的单个观测值,其对应的函数值不一定能唯一确定;额外的正则性条件可以帮助选取一个便于使用的版本。(math.ucdavis.edu)

主要性质

对于可积随机变量,条件期望具有线性性和保序性。对 G\mathcal G-可测的随机变量取条件期望,其值保持不变。若 XX 与 G\mathcal G 具有统计独立性,则

E[X∣G]=E[X]几乎必然成立.E[X\mid\mathcal G]=E[X] \quad\text{几乎必然成立}.

独立性是这一恒等式成立的充分条件,但仅凭该恒等式不能断定独立性。(math.ucdavis.edu)

“提出已知量”规则指出,对于有界且 G\mathcal G-可测的随机变量 WW,有

E[WX∣G]=WE[X∣G].E[WX\mid\mathcal G]=W E[X\mid\mathcal G].

塔式性质指出,若 H⊆G\mathcal H\subseteq\mathcal G,则

E[E[X∣G]∣H]=E[X∣H].E[E[X\mid\mathcal G]\mid\mathcal H] =E[X\mid\mathcal H].

因此,利用较粗的信息对基于较细信息的估计再取平均,结果等同于直接基于较粗信息作出的估计。其特例是全期望公式:

E[E[X∣G]]=E[X].E[E[X\mid\mathcal G]]=E[X].

上述涉及随机变量相等的恒等式均在几乎必然的意义下成立。(people.math.wisc.edu)

条件形式的詹森不等式给出

φ(E[X∣G])≤E[φ(X)∣G],\varphi(E[X\mid\mathcal G]) \leq E[\varphi(X)\mid\mathcal G],

其中 φ\varphi 为凸函数,并假定相关期望存在。特别地,取条件期望不会增大绝对值的期望:

E∣E[X∣G]∣≤E∣X∣.E|E[X\mid\mathcal G]|\leq E|X|.

(samuel-drapeau.info)

预测与几何解释

当 E[X2]<∞E[X^2]<\infty 时,条件期望是 XX 在希尔伯特空间 L2L^2 中向由 G\mathcal G-可测随机变量构成的闭子空间的正交投影。其残差满足

E[(X−E[X∣G])W]=0,E[(X-E[X\mid\mathcal G])W]=0,

其中 WW 可以是任意平方可积且 G\mathcal G-可测的随机变量。这里的正交性是相对于内积 E[UV]E[UV] 而言的。(samuel-drapeau.info)

因此,在所有基于 G\mathcal G 的平方可积预测中,E[X∣G]E[X\mid\mathcal G] 使均方误差最小。对于已观测到的预测变量 YY,最优预测为 m(Y)=E[X∣Y]m(Y)=E[X\mid Y]。与线性回归不同,这种优化并不将预测限制为线性函数;最优条件均值可以是非线性的。(ocw.mit.edu)

方差分解与随机过程

对于平方可积随机变量 XX,条件方差定义为

Var⁡(X∣G)=E[(X−E[X∣G])2∣G].\operatorname{Var}(X\mid\mathcal G) =E[(X-E[X\mid\mathcal G])^2\mid\mathcal G].

由全方差公式可得

Var⁡(X)=E[Var⁡(X∣G)]+Var⁡(E[X∣G]).\operatorname{Var}(X) =E[\operatorname{Var}(X\mid\mathcal G)] +\operatorname{Var}(E[X\mid\mathcal G]).

这一公式将总变异分解为两部分:按给定信息划分的各组内部剩余变异的平均值,以及各组条件均值之间的变异。(ocw.mit.edu)

在随机过程中,随时间递增的滤过(概率论) (Ft)(\mathcal F_t) 表示各时刻可用的信息。可积适应过程 MtM_t 若满足

E[Mt∣Fs]=Ms,s≤t,E[M_t\mid\mathcal F_s]=M_s,\qquad s\leq t,

则称为鞅。对于可积的终端量 ZZ,过程 Mt=E[Z∣Ft]M_t=E[Z\mid\mathcal F_t] 由塔式性质满足这一恒等式,表示随着信息增加,对同一量依次作出的估计。(people.math.wisc.edu)