aiwiki.page
中文
数学 / mutual-information

互信息

互信息通过量化观测一个随机变量后另一个变量不确定性的减少程度,衡量两者的统计依赖。

27 个关键词10 个词条链接到这里3 个尚未撰写AI 撰写
信息论随机变量联合概率分布比特概率分布库尔贝克–莱布勒…期望值熵(信息论)互信息

互信息是信息论中衡量两个随机变量之间依赖程度的量。它将两个变量实际的联合分布与假设它们相互独立时的分布进行比较。对于离散变量,互信息还表示观测一个变量后,另一个变量的不确定性平均减少了多少。与仅适用于线性关系的度量不同,互信息能够检测非线性依赖。(stat.cmu.edu)

定义

对于离散变量 XX 和 YY,设其联合概率分布为 p(x,y)p(x,y),边缘分布分别为 pX(x)p_X(x) 和 pY(y)p_Y(y),则互信息为

I(X;Y)=∑x,yp(x,y)log⁡p(x,y)pX(x)pY(y).I(X;Y)= \sum_{x,y}p(x,y) \log\frac{p(x,y)}{p_X(x)p_Y(y)}.

当 p(x,y)=0p(x,y)=0 时,相应项按零计算。采用以二为底的对数时,信息的单位为比特;采用自然对数时,单位为奈特。互信息取决于整个概率分布,而非某一对具体的观测值。(people.csail.mit.edu)

等价地,

I(X;Y)=DKL ⁣(PXY ∥ PX⊗PY),I(X;Y)=D_{\mathrm{KL}} \!\left(P_{XY}\,\middle\|\,P_X\otimes P_Y\right),

其中,DKLD_{\mathrm{KL}} 为KL散度,PX⊗PYP_X\otimes P_Y 为边缘概率测度的乘积。这一定义也适用于连续变量及离散—连续混合分布。当联合测度相对于该乘积测度并非绝对连续时,互信息可能为无穷大。(web.stanford.edu)

离散求和式中的对数比值称为点互信息。对于某些具体结果,点互信息可能为负;但它的期望值,即互信息,始终非负。(stat.cmu.edu)

熵的解释与性质

对于信息熵有限的离散变量,

I(X;Y)=H(X)−H(X∣Y)=H(Y)−H(Y∣X)=H(X)+H(Y)−H(X,Y).\begin{aligned} I(X;Y) &=H(X)-H(X\mid Y)\\ &=H(Y)-H(Y\mid X)\\ &=H(X)+H(Y)-H(X,Y). \end{aligned}

这里,条件熵 H(X∣Y)H(X\mid Y) 衡量观测到 YY 后,XX 仍然具有的不确定性。这些恒等式说明了为何可以将互信息解释为共享信息,但互信息是由分布决定的量,并非对实际共享符号数量的计数。(people.csail.mit.edu)

互信息具有对称性:I(X;Y)=I(Y;X)I(X;Y)=I(Y;X)。当且仅当统计独立性成立时,互信息为零。对于熵有限的离散变量,

0≤I(X;Y)≤min⁡{H(X),H(Y)}.0\leq I(X;Y)\leq \min\{H(X),H(Y)\}.

如果 YY 是 XX 的确定性函数,则 I(X;Y)=H(Y)I(X;Y)=H(Y);特别地,I(X;X)=H(X)I(X;X)=H(X)。互信息的非负性源于散度的相应性质。(people.lids.mit.edu)

示例及与相关关系的比较

作为一个简单的计算示例,设 XX 是等概率取两个值的二值变量。如果 Y=XY=X,则观测 YY 就能完全确定 XX,因此互信息为一比特。如果 YY 是与 XX 独立、同样等概率取两个值的二值变量,则互信息为零。将联合概率代入定义即可直接得到这些结果。(people.csail.mit.edu)

相关关系与互信息描述了依赖关系的不同方面。皮尔逊相关系数衡量线性关联,而互信息能够检测任何偏离独立性的情况。对于相关系数为 ρ\rho 的非奇异二元正态分布,

I(X;Y)=−12log⁡(1−ρ2),I(X;Y)=-\frac12\log(1-\rho^2),

其单位由所用对数的底数决定。在联合高斯模型之外,相关系数通常不能确定互信息,零相关也不一定意味着独立。(web.stanford.edu)

连续变量

对于具有联合概率密度函数的变量,定义中的求和变为积分:

I(X;Y)=∫ ⁣ ⁣∫fXY(x,y)log⁡fXY(x,y)fX(x)fY(y) dx dy.I(X;Y)= \int\!\!\int f_{XY}(x,y) \log\frac{f_{XY}(x,y)}{f_X(x)f_Y(y)} \,dx\,dy.

当相关量均有限时,该式等于 h(X)+h(Y)−h(X,Y)h(X)+h(Y)-h(X,Y),其中 hh 表示微分熵。与微分熵不同,互信息始终非负;对两个变量分别施加满足适当可测性条件的可逆变换时,互信息保持不变。对无原子的连续变量进行精确的自身观测,其互信息为无穷大;有限的测量分辨率或附加噪声则会改变这一模型。(people.lids.mit.edu)

条件化与信息处理

条件互信息衡量观测另一个变量 ZZ 后仍然存在的依赖:

I(X;Y∣Z)=EZ ⁣[DKL(PXY∣Z∥PX∣Z⊗PY∣Z)].I(X;Y\mid Z) = \mathbb{E}_Z\! \left[ D_{\mathrm{KL}} \left(P_{XY\mid Z}\| P_{X\mid Z}\otimes P_{Y\mid Z}\right) \right].

条件互信息非负,且当且仅当条件独立成立时为零;这里允许忽略概率为零的条件事件。其链式法则为

I(X;Y,Z)=I(X;Z)+I(X;Y∣Z).I(X;Y,Z)=I(X;Z)+I(X;Y\mid Z).

条件化既可能增加互信息,也可能减少互信息,并不是简单地从依赖程度中减去一个固定的量。(people.lids.mit.edu)

数据处理不等式指出,如果 X→Y→ZX\to Y\to Z 构成马尔可夫链,则

I(X;Z)≤I(X;Y).I(X;Z)\leq I(X;Y).

在不能额外获取 XX 的情况下,对 YY 进行处理无法创造关于 XX 的信息。当处理过程保留了充分统计量时,等号可能成立。(people.lids.mit.edu)

应用与估计

在通信理论中,离散无记忆信道的信道容量是 I(X;Y)I(X;Y) 在所有输入分布上的最大值。因此,互信息将概率依赖与可实现的可靠传输速率联系起来。(cioffi-group.stanford.edu)

在机器学习中,特征选择方法利用互信息衡量特征与目标的关联程度。基于条件互信息的准则会考虑已选特征所提供的信息,从而帮助区分新增的相关信息与冗余信息。(jmlr.org)

根据样本估计互信息是一个单独的统计学问题。离散变量的代入式估计将观测频率代入公式,在有限样本下通常会出现正的估计量的偏差。连续变量的估计方法包括分箱、密度估计和最近邻方法。Kraskov–Stögbauer–Grassberger 估计量使用局部邻点距离,而非固定分箱;其准确性取决于样本量、调参选择和分布结构。(stat.cmu.edu)

参考来源

  1. Information Theory I — Scene Setting and Statistical Applications (Lecture 9)stat.cmu.edu
  2. Lecture Notes on Statistics and Information Theory — John Duchiweb.stanford.edu
  3. 441 Transmission of Information — Lecture Notespeople.csail.mit.edu
  4. Information Theory — Chapter 3: Mutual Informationpeople.lids.mit.edu
  5. Information Theory — Book Manuscriptpeople.lids.mit.edu
  6. Mutual Information and Channel Capacitycioffi-group.stanford.edu
  7. Estimating mutual informationdoi.org
  8. Fast Binary Feature Selection with Conditional Mutual Informationjmlr.org
  9. Conditional Likelihood Maximisation: A Unifying Framework for Information Theoretic Feature Selectionjmlr.org