博弈论是研究策略互动的数学分支:在这类情境中,一个参与者的决策所产生的后果取决于其他参与者的决策。一个博弈需要明确参与者、可用策略、信息和收益。决策理论关注个体如何在给定环境中作出决策,而博弈论则明确地将其他决策者纳入环境模型。它的核心问题涉及激励、预期、协调与冲突,并不局限于娱乐性游戏。(ocw.mit.edu)
历史发展
作为一门现代数学学科,博弈论通过约翰·冯·诺依曼与奥斯卡·摩根斯特恩于1944年出版的《博弈论与经济行为》逐渐成形。他们的工作为分析策略选择和经济互动建立了系统框架。1950年,约翰·纳什提出了一种一般性的均衡概念,并证明了在允许随机化策略的条件下,有限博弈存在这种均衡。(nobelprize.org)
此后的研究进一步处理了参与者掌握不同信息或依次作出决策的情境。约翰·海萨尼发展了分析不完全信息博弈的方法,莱因哈德·泽尔滕则提出了均衡精炼概念,用以区分可信的策略行为与依靠不可信威胁维持的均衡。纳什、海萨尼和泽尔滕因对非合作博弈均衡的分析,共同获得了1994年诺贝尔经济学奖。(doi.org)
模型、策略与信息
博弈中的参与者称为博弈者,可以代表个人、企业或其他决策单位。策略规定了博弈者如何行动。在序贯博弈中,策略是一套完整的应变计划,其中也包括在可能永远不会出现的情境下如何决策。收益表示博弈者对各种结果的偏好,不一定是金钱回报。(ocw.mit.edu)
标准式博弈列明博弈者、策略集和收益函数。两人有限博弈通常用收益矩阵表示。扩展式博弈则描述决策的先后顺序、随机事件以及博弈者能够观察到的内容,通常以博弈树呈现。信息集将某个博弈者无法区分的决策节点归为一组。(ocw.mit.edu)
纯策略选择一套确定的行动计划。混合策略则在纯策略集合上指定一个概率分布;对其进行评价通常需要计算收益的期望值。完美信息意味着博弈者在行动时能够观察到此前的行动。完全信息则涉及对博弈结构的了解,包括各博弈者的收益函数。这是两个不同的条件:同时行动的博弈可以具有完全信息,却不具有完美信息。(ocw.mit.edu)
均衡与策略激励
纳什均衡是一种策略组合:在其他博弈者保持策略不变时,任何博弈者都无法通过单独改变自己的策略来提高收益。因此,每个博弈者的策略都是对其他博弈者策略的最优回应。纳什存在性定理保证,在允许混合策略的情况下,任何博弈者人数有限且纯策略数量有限的博弈都至少存在一个均衡。该定理并不保证均衡唯一,也不保证存在纯策略均衡。(mit.edu)
严格占优策略是指,无论对手如何选择,该策略带来的收益都高于所有其他策略。但这类策略不一定存在。更一般地说,均衡依赖的是彼此相容的选择,而不是某种在所有情况下都最优的行动。零和博弈在每一种结果下的收益总和都为零;一名博弈者的所得恰好抵消另一名博弈者的所失。大多数经济互动并不一定具有这种结构。(mit.edu)
在序贯情境中,子博弈精炼均衡要求策略在每一个子博弈中都构成纳什均衡。逆向归纳法从最后的决策开始向前倒推,用于求解有限的完美信息博弈。在贝叶斯博弈中,私人信息通过博弈者的类型以及对其他博弈者类型的信念来表示,从而为分析信息不对称提供框架。(ocw.mit.edu)
合作与重复互动
非合作博弈论分析个体的策略与激励;“非合作”并不意味着合作行为不可能发生。合作博弈论则通常研究联盟能够实现什么,以及如何分配联盟获得的收益,并往往假定协议具有可强制执行性。协议的执行本身也可以纳入非合作博弈模型。(doi.org)
囚徒困境展示了个体激励与共同利益之间的冲突。每名博弈者都在合作与背叛之间作出选择。无论另一名博弈者选择哪一种行动,背叛都会带来更高的收益;然而,相互合作给双方带来的收益都高于相互背叛。因此,最终的均衡并不是双方共同偏好的结果。(ocw.mit.edu)
在重复博弈中,当前的行动可能影响未来的回应。当博弈者足够重视未来收益时,可信的奖励或惩罚可能维持合作。仅有重复互动还不够:结果取决于博弈期限、监督条件和偏好。在终点已知且具有完全信息的标准有限次重复囚徒困境中,逆向归纳法得出的结果是每一轮都选择背叛。(ocw.mit.edu)
应用与局限
在经济学中,博弈论用于建立议价、寡头垄断和策略性竞价的模型。拍卖理论研究拍卖规则如何与竞标者的信息和激励相互作用。机制设计则将通常的问题反过来处理:通过选择规则,力求在参与者拥有私人信息并进行策略选择的情况下,仍然实现指定的结果。工程领域的应用包括路由、网络资源分配和分布式决策。(ocw.mit.edu)
均衡是一种数学上的一致性条件,并不保证公平、整体效率,也不保证与实际观察到的行为相符。预测取决于如何对策略、偏好、信息和预期建模。存在多个均衡时,如果没有额外假设,结果可能无法确定;而均衡的存在本身也不意味着有高效的计算方法能够求出它。因此,相关研究也考察学习过程、实验中观察到的行为,以及求解均衡的计算复杂性。(doi.org)