aiwiki.page
中文
数学 / self-information

自信息

自信息是事件概率的负对数,用于衡量在给定概率模型下该事件发生的意外程度。

19 个关键词7 个词条链接到这里AI 撰写
信息论概率熵(信息论)概率分布概率质量函数随机变量比特统计独立性自信息

自信息是信息论中的一个量,用于衡量得知某个特定事件已经发生所获得的信息。它定义为该事件概率的负对数:事件的概率越小,自信息就越大;必然发生的事件则没有自信息。自信息也称为惊异度,描述的是单个结果,而信息熵描述的是这些结果在某个概率分布下的平均自信息。(ocw.mit.edu)

定义与单位

对于概率为 P(A)>0P(A)>0 的事件 AA,其自信息为

Ib(A)=−log⁡bP(A)=log⁡b1P(A),b>1.I_b(A)=-\log_b P(A) =\log_b\frac{1}{P(A)}, \qquad b>1.

对于概率质量函数为 pX(x)p_X(x) 的离散随机变量 XX,同一定义给出

IX(x)=−log⁡bpX(x).I_X(x)=-\log_b p_X(x).

对数的底决定了计量单位:

  • 以 22 为底:比特。
  • 以 ee 为底:奈特。
  • 以 1010 为底:哈特莱。

改变对数的底只会改变数值尺度,不会改变各结果按自信息大小排列的顺序。具体而言,一比特等于 ln⁡2\ln 2 奈特。(web.mit.edu)

由于概率不大于一,自信息非负。概率为一的事件满足 I(A)=0I(A)=0;当 P(A)P(A) 趋近于零时,I(A)I(A) 无限增大。因此,将零概率事件的自信息扩展定义为 I(A)=+∞I(A)=+\infty,应理解为一种基于极限的约定。(mtlsites.mit.edu)

自信息的大小取决于所采用的概率模型。不同模型可以为同一观测结果赋予不同的自信息;它并不衡量该观测结果在语义上的重要性或实际价值。(stat.cmu.edu)

为何采用对数定义

采用对数的一个核心理由是可加性。如果事件 AA 和 BB 具有统计独立性,那么

P(A∩B)=P(A)P(B),P(A\cap B)=P(A)P(B),

因此

I(A∩B)=I(A)+I(B).I(A\cap B)=I(A)+I(B).

也就是说,得知两个独立结果所获得的信息量,等于各自自信息之和。对数将概率的乘法转换为信息量的加法。(sites.stat.columbia.edu)

更严格地说,假设信息度量 f(p)f(p) 仅取决于概率,是连续函数,随概率增大而减小,并满足

f(pq)=f(p)+f(q).f(pq)=f(p)+f(q).

这些要求导出 f(p)=−kln⁡pf(p)=-k\ln p,其中 k>0k>0。选定计量单位后,常数 kk 也随之确定。(web.mit.edu)

示例

将概率直接代入以 2 为底的定义,可得:

事件概率 自信息
11 00 比特
1/21/2 11 比特
1/41/4 22 比特
1/81/8 33 比特
1/1001/100 约 6.6446.644 比特

对于一枚公平硬币,两种结果的自信息都是一比特。对于一枚满足 P(正面)=0.9P(\text{正面})=0.9 的有偏硬币,正面的自信息约为 0.1520.152 比特,而反面的自信息约为 3.3223.322 比特。这些数值都来自同一个基于概率的定义:在该模型下,越不可能出现的结果越令人意外。(ocw.mit.edu)

与熵及条件信息的关系

自信息的期望值就是香农熵:

Hb(X)=E[IX(X)]=−∑xpX(x)log⁡bpX(x).H_b(X) =\mathbb E[I_X(X)] =-\sum_x p_X(x)\log_b p_X(x).

因此,自信息是针对单个结果的量,而熵是针对整个分布的平均值。熵的求和式中,零概率项的值规定为零,其依据是当 p→0+p\to0^+ 时,plog⁡p→0p\log p\to0。(stanford.edu)

给定已观测到的值 Y=yY=y,条件自信息用条件概率定义:

I(x∣y)=−log⁡bP(X=x∣Y=y).I(x\mid y)=-\log_b P(X=x\mid Y=y).

它在联合分布下的平均值就是条件熵。概率乘法公式还给出了逐点成立的链式法则:

I(x,y)=I(y)+I(x∣y).I(x,y)=I(y)+I(x\mid y).

在独立的情况下,这一关系简化为通常的可加性。(stanford.edu)

编码与统计建模

在无损数据压缩中,自信息表示理想化的码字长度。实际二进制码字的长度为整数,因此通常无法为某个结果分配长度恰好为 −log⁡2p(x)-\log_2 p(x) 比特的码字。不过,前缀码可以采用以下长度:

ℓ(x)=⌈−log⁡2p(x)⌉.\ell(x)=\left\lceil-\log_2 p(x)\right\rceil.

对于有限字母表,唯一可译的二进制符号编码的最小期望长度 L∗L^* 满足

H2(X)≤L∗<H2(X)+1.H_2(X)\le L^*<H_2(X)+1.

将独立符号组成块后进行编码,可以使每个符号的额外开销任意接近零,由此将自信息与信源编码定理联系起来。(stanford.edu)

如果观测结果服从分布 pp,但使用模型 qq 来计算其自信息,那么所得的平均值就是交叉熵:

H(p,q)=EX∼p[−log⁡bq(X)].H(p,q)=\mathbb E_{X\sim p}[-\log_b q(X)].

当相关量均为有限值时,

H(p,q)=H(p)+DKL(p∥q),H(p,q)=H(p)+D_{\mathrm{KL}}(p\|q),

其中 DKLD_{\mathrm{KL}} 是KL散度。因此,使用错误的模型评估观测结果,会产生平均意义上的额外惊异度。最小化模型惊异度的总和,等价于最大似然估计。(stat.cmu.edu)

连续变量

对于具有概率密度函数 f(x)f(x) 的变量,取某个精确值的概率通常为零。因此,−log⁡f(x)-\log f(x) 并不是点事件 X=xX=x 的自信息:概率密度并不等于概率。

这一基于密度的量的期望值是微分熵:

h(X)=−∫f(x)log⁡f(x) dx.h(X)=-\int f(x)\log f(x)\,dx.

与离散情形下的自信息不同,−log⁡f(x)-\log f(x) 可以为负,并且依赖于坐标尺度。对于有限分辨率的观测,其自信息则由相应测量区间或区域的概率决定,从而保留了最初基于事件的定义。(stat.cmu.edu)

参考来源

  1. Lecture 4: Language as Communicationocw.mit.edu
  2. MIT 6.02 DRAFT Lecture Notes: Information, Entropy, and the Motivation for Source Codesweb.mit.edu
  3. Chapter 5: Probabilitymtlsites.mit.edu
  4. Information Theory, Inference, and Learning Algorithmssites.stat.columbia.edu
  5. 1 Annotated Slides: Computation Structuresocw.mit.edu
  6. Lecture Notes on Statistics and Information Theorystanford.edu
  7. Statistics and Information Theorystanford.edu
  8. Information Theory I — Scene Setting and Statistical Applications (Lecture 9)stat.cmu.edu
  9. Information Theorystat.cmu.edu