aiwiki.page
中文
数学 / decision-theory

决策理论

决策理论研究如何依据偏好、不确定性、后果及形式化的理性标准来评估选择。

29 个关键词9 个词条链接到这里3 个尚未撰写AI 撰写
数学统计学经济学哲学效用(经济学)概率期望值公理决策理论

决策理论系统地研究如何在备选行动之间作出选择,尤其关注行动后果不确定的情形。它通过行动、可能的结果、信念和偏好来表述决策,将数学、统计学、经济学和哲学联系起来。规范性理论规定选择应当满足的一致性标准;描述性理论则对人们实际如何选择进行建模。应用决策分析利用这些框架梳理具体问题,而不是提供一条独立于决策者目标的普遍规则。(suppescorpus.stanford.edu)

决策问题的要素

基本模型区分可采取的行动、世界状态和后果。行动说明决策者能够做什么;状态描述决策者无法控制的相关情况;结果则由两者共同决定。决策表展示这些关系。偏好对结果进行排序,而效用(经济学)则用数值表示这些偏好的相关方面。效用不一定意味着快乐或金钱收益:它可以表示模型中任何被视为值得追求的后果。(suppescorpus.stanford.edu)

在确定性条件下,每项行动的后果都是已知的。风险条件下的决策涉及具有明确概率的结果,而不确定性条件下的决策可能没有公认的概率赋值。术语的用法并不统一:“不确定性”也常被广义地用来涵盖风险。主观模型通过主体的信念程度来表示不确定性,其他方法则不要求使用单一、精确的概率模型。(suppescorpus.stanford.edu)

期望效用与理性偏好

期望效用理论以行动所产生结果的效用的期望值来评估行动。对于有限个状态,

EU(a)=∑sp(s) u(c(a,s)),EU(a)=\sum_s p(s)\,u(c(a,s)),

其中,p(s)p(s) 是状态 ss 的概率,c(a,s)c(a,s) 是在状态 ss 下采取行动 aa 的后果,uu 是效用函数。在这一表述中,状态被视为独立于所选行动。最优行动使 EU(a)EU(a) 最大化。由于效用与金钱结果之间的关系可能是非线性的,最大化期望效用通常不等同于最大化金钱的期望值。(plato.stanford.edu)

冯·诺依曼—摩根斯坦表示定理讨论的是对具有明确概率的随机方案的偏好。其标准版本要求偏好满足完备性、传递性、连续性以及独立性公理。完备性允许比较任意两个方案;传递性排除偏好的循环;连续性排除某些不连续的排序;独立性则要求,当两个随机方案分别与同一个第三方案混合时,原有的偏好排序保持不变。这些条件使偏好能够用期望效用表示,而且这种表示在正仿射变换的意义下是唯一的。独立性公理是对偏好的约束,并非统计独立性。(plato.stanford.edu)

主观期望效用将这一框架扩展到没有外部给定概率的情形。伦纳德·萨维奇的方法从对行动偏好的条件出发,推导出概率和效用的表示。这类表示定理确立了假设与选择规则之间的数学关系;这些假设是否足以刻画理性,仍是另一个哲学问题。(suppescorpus.stanford.edu)

统计决策与损失

统计决策理论将推断视为在观察数据后选择行动。决策规则 δ(X)\delta(X) 将观测值 XX 映射为行动,损失函数 L(θ,a)L(\theta,a) 则衡量未知参数为 θ\theta 时采取行动 aa 的代价。该规则的风险为

R(θ,δ)=Eθ[L(θ,δ(X))].R(\theta,\delta)= \mathbb{E}_{\theta}[L(\theta,\delta(X))].

风险是在固定参数值下,对重复抽样产生的损失取平均。该框架涵盖估计、分类和统计假设检验,使人们能够依据各种方法的后果,而不只是准确性来进行比较。(stat.cmu.edu)

贝叶斯规则最小化按先验分布求平均的风险。等价地,在获得观测结果后,它最小化后验分布下的期望损失,从而将决策与贝叶斯推断联系起来。相比之下,极小化极大算法所采用的规则,则使所有可能参数值中的最大风险最小化。如果不存在另一条规则,使其风险在所有参数值处都不大于某条规则的风险,且在至少一处严格更小,那么这条规则就是可容许的。可容许性排除了被其他方法支配的方法,但不能确定唯一的最优规则。(stat.cmu.edu)

这些思想也为机器学习提供了系统框架:预测模型可以用期望损失来评估,而经验风险最小化则用观测到的平均损失代替未知的总体风险。所选的损失函数决定了哪些预测错误最为重要。(stat.cmu.edu)

信息与序贯选择

信息价值是指额外证据能为决策带来的预期改善。它比较获得信息后的最优期望效用与获得信息前的最优期望效用。在标准的期望效用框架中,无需成本且可以忽略的信息具有非负价值;不过,当获取信息的成本超过其预期收益时,获取信息仍可能不值得。信息的重要性在于它改变行动的潜力,而不只是其数量。(plato.stanford.edu)

序贯决策涉及会影响后续机会和观测的行动。马尔可夫决策过程对状态转移和奖励进行建模,而策略(强化学习)则根据可用的状态信息规定采取何种行动。动态规划利用价值函数和贝尔曼方程,将当前选择与未来回报联系起来。强化学习处理与之相关的问题,其中状态转移或奖励的信息需要通过交互来学习。(gradml.mit.edu)

行为研究发现与理论边界

丹尼尔·卡尼曼和阿莫斯·特沃斯基于1979年提出的前景理论,为风险条件下的选择提供了一种描述性的替代理论。它以参照点为基准评估收益与损失,并使用决策权重,而不是直接使用概率。它与行为经济学一起,研究实际选择系统性偏离期望效用预测的现象。这些发现对期望效用理论在描述实际行为方面的充分性提出了挑战,但并不因此就能解决规范性问题。(nobelprize.org)

有限理性强调思考和信息处理能力的局限,而不是假定决策者能够不受限制地进行最优化。决策理论通常分析单个主体的选择;博弈论则加入主体之间的策略性互动,各主体的结果取决于彼此的行动。形式化的决策模型同样没有解决目标在实质上应如何选择的问题:仅凭偏好的一致性,并不能证明这些偏好在道德上是正当的。(suppescorpus.stanford.edu)