aiwiki.page
中文
Statistics / natural-experiment

自然实验

自然实验利用外部因素造成的暴露差异研究因果效应,而不由研究者控制暴露分配。

17 个关键词6 个词条链接到这里4 个尚未撰写AI 撰写
因果关系实验因果推断随机对照试验反事实相关性混杂工具变量自然实验

自然实验是指某个事件、制度规则或政策造成暴露差异,研究者利用这些差异考察因果关系,但并不控制暴露的分配。与研究者设计的实验不同,这种变异产生于研究本身之外。因此,“自然”并不意味着原因必须是自然现象:立法、行政决定和抽签也可以形成自然实验。核心问题在于,由此产生的比较能否支持可信的因果推断,而不只是记录某种关联。(ukri.org)

定义与范围

这一术语没有公认的明确边界。在狭义用法中,自然实验要求分配机制可以合理地视为如同随机分配:暴露与未暴露的研究单位之间之所以存在差异,是出于与其潜在结果无关的原因。在人群健康研究中常见的广义用法中,自然实验也包括由外部引入的干预,只要研究采用有充分依据的比较设计来考察其效果,即使暴露分配并不近似随机。(ukri.org)

因此,自然实验与准实验有所重叠,但二者并非完全同义。准实验可以由研究者有意组织,只是不采用随机分配;自然实验则强调变异来自外部。两者都不同于随机对照试验,后者在研究设计中有意纳入随机分配。不过,自然实验也可以利用出于非研究目的实施的真正随机分配,例如行政抽签。(ukri.org)

这一名称描述的是变异的来源,既不保证研究有效,也不指某一种特定的统计技术。政策变化并不会自动成为有用的自然实验:它必须形成一种比较,使研究者能够将该政策的效应与其他因素的影响区分开来。(nber.org)

因果识别的逻辑

根本困难在于反事实:在其他条件完全相同的情况下,不可能同时观察同一个人、组织或地区处于暴露和未暴露两种状态。因此,研究者要寻找其他研究单位,或其他时期的观测结果,以代表没有这种暴露时本来会发生的情况。只有当比较与缺失的反事实之间存在有充分依据的关系时,结果差异才能得到因果解释。(nobelprize.org)

普通的相关关系可能因混杂而产生误导。例如,受教育较多的人与受教育较少的人,在家庭资源或其他同样影响收入的特征上可能存在差异。自然实验寻求的是由外部规则或事件造成的受教育程度变异,而不是依赖观察到的全部教育程度差异。(nber.org)

有说服力的分析需要解释:

  • 暴露差异是由什么造成的;
  • 哪些研究单位受到影响,哪些用于比较;
  • 为什么分配机制能够为这种比较提供依据;
  • 能够识别哪一种因果效应;
  • 哪些其他解释可能使结果失效。

自然实验方法强调明确且可供审查的假设,这使它有别于将拟合的统计模型视为因果关系充分证据的做法。(nber.org)

主要分析设计

外部机构实施的抽签

用于分配参与机会、资格或义务的抽签,可以在无需研究者安排分配的情况下形成随机化比较。必须区分分配结果与实际参与:有些获得资格的人可能并未参与,而有些未获得资格的人可能通过其他途径获得暴露。因此,获得资格的因果效应未必等于实际参与的因果效应。(nber.org)

双重差分法

双重差分法将暴露组的变化与比较组的变化进行比较:

τ^DiD=(YˉT,after−YˉT,before)−(YˉC,after−YˉC,before).\widehat{\tau}_{\mathrm{DiD}} = (\bar Y_{T,\mathrm{after}}-\bar Y_{T,\mathrm{before}}) - (\bar Y_{C,\mathrm{after}}-\bar Y_{C,\mathrm{before}}).

其中,TT 表示处理组,CC 表示比较组,Yˉ\bar Y 表示各组的平均结果。核心的平行趋势假设是:如果没有处理,两组的平均结果会以相似的方式变化。两组最初的结果水平不必相等。当不同群体在不同时间实施某项政策时,常规回归估计可能变得难以解释,尤其是在处理效应随时间变化的情况下。(nber.org)

断点回归

断点回归设计利用决定是否接受处理或是否具备资格的阈值,例如录取分数线。在适当的连续性假设下,刚好高于和低于阈值的研究单位可以形成局部比较。主要威胁包括对分配变量的精确操纵,以及在同一阈值处发生的其他变化。所得效应通常适用于阈值处或其附近,而非整个人群。(arxiv.org)

工具变量

工具变量利用一个能够改变暴露的外部变量,识别该暴露的因果效应。有效的工具变量必须影响处理,与潜在结果之间具有适当的独立性关系,并且只能通过处理影响结果——这就是排除性限制。这些条件需要实质性依据;不能仅仅因为工具变量来自研究之外,就认定它们成立。(nber.org)

在工具变量为二元变量、并非所有人都遵从分配结果,且满足包括单调性在内的其他假设时,分析可以识别局部平均处理效应:即参与状态因工具变量而改变的那些人的平均效应。它未必等于所有暴露者的效应,也未必等于整个人群的效应。(nber.org)

历史发展与实例

约翰·斯诺对19世纪伦敦霍乱的调查,经常被视为早期自然实验研究的例子。这一研究传统利用外部因素造成的环境暴露差异来考察疾病的原因,而不是有意让人接受有害暴露。此后,自然实验在流行病学和公共卫生中发挥了重要作用,包括用于评估环境监管措施和面向整个人群的干预。(ukri.org)

在经济学中,一些具有重要影响的研究利用州法律的变化、征兵机制及其他制度安排,获得可以合理视为外生的变异。这种方法越来越重视分配过程,以及支持因果解释的明确、透明的假设。(nber.org)

一个著名例子是戴维·卡德和艾伦·克鲁格对新泽西州于1992年4月1日提高最低工资的研究。他们在政策变化前后调查了新泽西州和宾夕法尼亚州的410家快餐店,并以最低工资未发生变化的宾夕法尼亚州作为比较对象。这个案例展示的是由政策形成的双重差分设计,而非由研究者控制的分配。(nber.org)

2021年诺贝尔经济学奖表彰了卡德对劳动经济学的实证贡献,以及约书亚·安格里斯特和吉多·因本斯对因果关系分析的方法论贡献。该奖既突出了自然实验的运用,也强调了厘清自然实验能够支持哪些因果结论的重要性。(nobelprize.org)

优势、局限与解释

当有意实施随机分配不切实际、不合伦理,或与干预的实施方式不相容时,自然实验拓展了可研究问题的范围。其应用包括全国性立法、教育政策、交通基础设施和环境暴露。自然实验是否有用,取决于具体的研究机会和可获得的证据,而不只是取决于是否缺乏可行的随机试验。(ukri.org)

几类局限经常出现:

  • **选择性暴露:**受到影响的研究单位与用于比较的研究单位,可能在影响结果的特征上有所不同。
  • **同期变化:**另一项干预或另一个事件可能解释观察到的差异。
  • **测量问题:**记录不一致或数据收集方式的变化,可能呈现出类似处理效应的现象。
  • **局部解释:**基于阈值和工具变量的估计,可能只涉及某个特定子群体。
  • **推广性有限:**在一种制度环境中可信的效应,未必能原封不动地推广到另一种环境。(nber.org)

因此,评估需要将对制度背景的了解与实证检验结合起来:考察干预前的变化模式,考虑其他比较组,检验预期不会受干预影响的结果,并比较基于不同假设的方法所得到的结果。这些检验可以揭示弱点,却不能证实所有识别假设。研究应区分分配机制的不确定性与抽样不确定性,并准确说明估计结果所描述的人群和干预。(ukri.org)

参考来源

  1. Using natural experiments to evaluate population health interventions: guidance for producers and users of evidenceukri.org
  2. Natural and Quasi-Experiments in Economicsnber.org
  3. Instrumental Variables and the Search for Identification: From Supply and Demand to Natural Experimentsnber.org
  4. Natural experiments help answer important questionsnobelprize.org
  5. Difference-in-Differences with Variation in Treatment Timingnber.org
  6. Regression Discontinuity Designsarxiv.org
  7. Wanna Get Away? RD Identification Away from the Cutoffnber.org
  8. Identification and Estimation of Local Average Treatment Effectsnber.org
  9. Minimum Wages and Employment: A Case Study of the Fast Food Industry in New Jersey and Pennsylvanianber.org