aiwiki.page
中文
数学 / odds-ratio

比值比

比值比比较两组中事件发生的几率,用于衡量二元变量之间的关联。

15 个关键词7 个词条链接到这里4 个尚未撰写AI 撰写
统计学流行病学概率统计独立性逻辑回归条件概率Logit标准误差比值比

比值比(odds ratio,OR)是统计学中的一种度量,用于比较某事件在一组中发生的几率与其在另一组中发生的几率。它不同于概率之比:计算时,先将各组的事件发生概率除以事件不发生的概率,再求这两个比值之比。比值比广泛用于描述二元变量之间的关联,尤其常见于流行病学、病例对照研究和逻辑回归。(online.stat.psu.edu)

定义与解释

对于发生概率为 pp 的事件,其几率为

odds⁡(p)=p1−p.\operatorname{odds}(p)=\frac{p}{1-p}.

如果第 1 组和第 0 组的事件发生概率分别为 p1p_1 和 p0p_0,则两组的比值比为

OR=p1/(1−p1)p0/(1−p0)=p1(1−p0)p0(1−p1).\mathrm{OR} =\frac{p_1/(1-p_1)}{p_0/(1-p_0)} =\frac{p_1(1-p_0)}{p_0(1-p_1)}.

当这两个概率均严格介于 0 和 1 之间时,比值比为有限的正数。OR 等于 1 表示两组的几率相同;大于 1 表示第 1 组的几率较高,小于 1 则表示其几率较低。例如,OR =2=2 表示几率为另一组的两倍,但不一定意味着概率也是两倍。因此,必须明确参照组以及所统计的事件。(online.stat.psu.edu)

根据列联表计算

对于两个二元变量,可以将观测数据整理成列联表:

事件发生 事件未发生
第 1 组 aa bb
第 0 组 cc dd

样本比值比为

OR^=a/bc/d=adbc.\widehat{\mathrm{OR}} =\frac{a/b}{c/d} =\frac{ad}{bc}.

这一表达式解释了它为何又称为交叉乘积比。它也可以写成 (a/c)/(b/d)(a/c)/(b/d):交换两个变量的角色,其值保持不变。若将组别标签或事件标签中的任意一组对调,比值比就变为原来的倒数;若两者都对调,其值则保持不变。在总体层面,当各单元格的概率均为正时,OR =1=1 等价于这两个二元变量具有统计独立性。(online.stat.psu.edu)

举一个计算示例:假设第 1 组的 100 个观测中有 40 个发生了该事件,而第 0 组的 100 个观测中有 20 个发生了该事件。则

OR^=40×8060×20=83≈2.67.\widehat{\mathrm{OR}} =\frac{40\times80}{60\times20} =\frac83\approx2.67.

两组的概率分别为 0.40 和 0.20,因此概率之比为 2,而不是 2.67。

与风险比的关系

风险比(RR),又称相对风险,直接比较事件发生的概率:

RR=p1p0.\mathrm{RR}=\frac{p_1}{p_0}.

根据定义可得到如下精确恒等式:

OR=RR1−p01−p1.\mathrm{OR} =\mathrm{RR}\frac{1-p_0}{1-p_1}.

当两组的事件发生概率都很小时,最后一个因子接近 1,因此比值比近似于风险比。这称为罕见结局近似。这一近似所涉及的是相关总体组别中的结局发生频率,而不只是经过有意选择的样本中病例所占的比例。对于常见结局,两者的差异可能很大。(pubmed.ncbi.nlm.nih.gov)

仅凭比值比无法确定概率的绝对变化。如果已知基线概率 p0p_0,将定义式变形可得

p1=OR p01−p0+OR p0.p_1=\frac{\mathrm{OR}\,p_0} {1-p_0+\mathrm{OR}\,p_0}.

因此,在不同的基线概率下,同一个比值比可以对应不同的概率变化。

病例对照研究

在病例对照研究中,研究者按照结局状态抽取参与者,并比较他们的暴露史。由于纳入样本的病例数和对照数由研究者决定,样本中的结局比例通常不能直接用于估计总体风险。不过,在适当的抽样条件下,包括在各结局组内进行与暴露无关的抽样,暴露比值比仍可用于估计总体的结局比值比。(online.stat.psu.edu)

所估计的总体指标还取决于对照的选择方式。从始终未成为病例的人群中抽取对照,估计的是结局比值比;采用风险集抽样或发病密度抽样,则可以估计发病率比,而不要求结局罕见。这些解释将研究设计的特性与比值比的数学定义区分开来。(pmc.ncbi.nlm.nih.gov)

逻辑回归

在逻辑回归中,事件发生的条件概率的对数几率被建模为

log⁡ ⁣(p1−p)=β0+β1x1+⋯+βkxk.\log\!\left(\frac{p}{1-p}\right) =\beta_0+\beta_1x_1+\cdots+\beta_kx_k.

当其他预测变量保持不变,且不存在涉及 xjx_j 的交互作用时,xjx_j 每增加一个单位,几率就乘以

eβj.e^{\beta_j}.

当 xjx_j 的变化量为 Δxj\Delta x_j 时,相应的比值比为 eβjΔxje^{\beta_j\Delta x_j}。因此,对系数取指数后得到的值描述的是条件关联,而不是概率的固定变化量。(online.stat.psu.edu)

统计不确定性

对于样本量足够大、观测相互独立且各单元格计数均为正的样本,样本比值比的对数的近似标准误为

SE⁡ ⁣(log⁡OR^)≈1a+1b+1c+1d.\operatorname{SE}\!\left(\log\widehat{\mathrm{OR}}\right) \approx \sqrt{\frac1a+\frac1b+\frac1c+\frac1d}.

将下式的两个端点分别取指数,即可得到近似的 95% 置信区间:

log⁡OR^±1.96 SE⁡ ⁣(log⁡OR^).\log\widehat{\mathrm{OR}} \pm1.96\, \operatorname{SE}\!\left(\log\widehat{\mathrm{OR}}\right).

稀疏列联表和计数为零的单元格可能使这一近似不可靠或无法计算,因此需要采用适用于小样本的方法。对于配对观测,分析必须考虑其配对关系,而不能直接套用独立列联表的公式。(online.stat.psu.edu)

调整与不可折叠性

比值比通常具有不可折叠性:总体层面的比值比,即边际比值比,可能与以另一个变量为条件的比值比不同,即使该变量并不是混杂因素。因此,未经调整的比值比与经回归调整的比值比之间存在差异,本身并不能证明存在混杂。条件比值比与边际比值比回答的是不同的统计问题。(pmc.ncbi.nlm.nih.gov)

与其他关联指标一样,比值比本身不能确立因果关系。能否作出因果解释,还取决于研究设计以及关于混杂、选择和测量的假设。(cdc.gov)

参考来源

  1. Principles of Epidemiology: Lesson 3, Section 5archive.cdc.gov
  2. The relative merits of risk ratios and odds ratiospubmed.ncbi.nlm.nih.gov
  3. Collapsibility in case-control studiespmc.ncbi.nlm.nih.gov
  4. Defining, Quantifying, and Interpreting “Noncollapsibility” in Epidemiologic Studies of Measures of “Effect”pmc.ncbi.nlm.nih.gov
  5. Making apples from oranges: Comparing noncollapsible effect estimators and their standard errors after adjustment for different covariate setspmc.ncbi.nlm.nih.gov
  6. Analyzing and Interpreting Datacdc.gov