一些有关Game Theory(博弈论)的学习记录
前言:
以下是笔者学习【耶鲁大学】博弈论 课程中整理的内容,因为笔者实在是懒的自己找书啃。有些内容可能结合自己的研究方向(Multiple-Agent-System)简单拓展。
一、Prisoner’s Dilemma 囚徒困境
1.1 四个重要结论
定义 1.1:Strictly Dominant Strategy 严格优势策略
假如策略在无论对手选择何种应对的情况下的收益都高于策略,则称策略为相对的严格优势策略;
结论 1.1:不要使用严格劣势策略
我们假设参与博弈的行为人都是理性的(和经济学中定义的理性经济人类似),都希望追求更高的收益(当前,每个人衡量收益大小的标准有不同,对收益的看法显然也会影响决策);
结论 1.2:理性的选择可能导致更糟的结果
显然,如果双方均追求对于个人收益的最大化,可能导致双输;
如何破解囚徒困境?
沟通并不能解决这个困境,在缺乏强制力介入的情况下,沟通缺乏意义,可能有效的方式是有强制力的合同(比如书面合同)、重复博弈、教育。
结论 1.3:如欲得之,必先知之 If you want to get it, you must know it first
如果我们不知道一个人或一场博弈中的收益情况,那么我们就不可能获得收益;
结论 1.4:换位思考 Put yourself in others’ shoes and try to figure out what they’ll do
假如我们知道另一方的收益情况,那么如果我们确认对方会根据 结论 1.1 选择某种策略,那么我们可以根据对方的选择选择对于自己收益更高的那种,即使站在自己的角度,并没有严格优势策略;
1.2 Grade Game 积分游戏
关于耶鲁大学《博弈论》课程上的积分游戏的具体推导见下,懒地打了。。。
积分游戏推导

1.3 Ingredients of a game 博弈的要素
- Players 参与者;
- Strategies 策略;
- : 的某个特定策略;
- : 的策略集合;
- : 一次博弈,即所有参与者的策略组合;
- Payoff 收益;
- Assumption 假设:每个参与者都知道其他人的可能策略和收益,即博弈者之间信息透明;
- : 一次博弈中除了之外的其他所有参与者的策略;
定义符号后,我们给出更严格的严格优势策略的定义:
定义 1.1 Plus:Strictly Dominant Strategy 严格优势策略
‘s strategy is strictly dominated by ‘s strategy if for all ;
1.4 Hannibal 汉尼拔
Ben教授通过汉尼拔进军罗马的例子,引入了弱优势策略,弱优势策略允许了一部分策略组下收益相等而不是严格大于;
定义 1.1 Extension:Weakly Dominant Strategy 弱优势策略
‘s strategy is weakly dominated by ‘s strategy if for all , and for some ;
关于汉尼拔的具体推导见下:
汉尼拔

1.5 Iterative Deletion 迭代剔除劣势策略
该策略要求参与者首先找到所有劣势策略,剔除它们,然后再重新审视整个博弈,如此往复。一个具体的例子如下:
每人选择一个1到100之间的数字,谁选的数字最接近平均数的三分之二,则获得胜利。
- 第一层:假设大家选取的数字是在 0 ~ 100 间随机分布的,那么 average 约等于50,50的2/3应该是33左右;但是问题也很明显,大家不会都进行随机选择;
- 第二层:我认为别人都按照第一层的思路进行思考,即大部分人都会选择33,那么我应该选择 33 * 2/3 = 22;
- 第三层:从这一层开始,使用了博弈论的框架,即假设参与者都是理性的。那么,选择大于67的数字属于弱劣势策略(除非大家均选择100);那么大于67的数字就被剔除了;按照这个思路,我选择45;
- 第四层:如果大家都考虑到了上面一层,那么基于第三层,现在选择大于45的也变成了弱劣势策略;按照这个思路,我应该选择30;
按照这个逻辑一直持续下去,30 ~ 20、20 ~ 13,不断持续剔除下去,那么最终所有人都会选择1;
但1就是正确答案吗?
得到1需要反复迭代、剔除,即需要我不断知道别人都想到了上一层,即我知道你知道我知道你知道(无限套娃)我是理性的,即 Common Knowledge 共同知识 。
定义 1.5:共同知识
共同知识是指某个信息或事件不仅被所有参与者知晓,而且所有参与者都知道其他参与者也知道该信息,并且知道其他参与者也知道其他人知道该信息,如此无限递归。
即:所有人都是理性的;所有人都知道所有人是理性的;所有人都知道所有人都知道所有人是理性的……
1.6 The Median-Voter Theorem 中位选民定理
该定理事实上只是迭代剔除劣势策略在政治学上的一个应用。并且该模型还是简化了现实问题,存在不少问题;
首先,对于2个候选人A和B,他们的立场用 1 ~ 10 数字表示,假定每个数字对应10%的选民,选民仅按立场的接近程度进行投票;如果立场的接近程度相同,则一半一半;候选人的目标就是最大化选票,即收益;
容易发现,1和10为劣势策略,具体推导如下:如果A选择2,那么
- 当B选1时,;
- 当B选2时,;
- 当B选3时,;
- 当B选4时,;
以此类推,后面都是2优于1并且均相差;
选2严格优于选1,根据对称性,选9也严格优于选10。
越接近中间就优于两侧吗?并不,可以算一个例子:如果A选择3,那么
当B选择1时,,即A选3并不严格优于选2;
但是如果按照迭代剔除的思想,剔除劣势策略1和10之后,那么接下来策略2和9就变成了劣势策略,以此类推,最优的策略是选5和选6;这就是中位选民定理;
这个模型存在以下问题:
- 选民并非平均分布;
- 选民并非完全根据立场来投票,即考量因素往往是多维度的;
- 选民往往会根据候选人过去的行为判断立场而并非按候选人所声称的;
- 选民存在弃票;
- 候选人往往大于2个;
- 大选之前还有初选;
- …
1.7 Best Response 最优对策
如果站在双方的角度,都不存在严格最优对策,那么站在我的角度,假设另一方采取某策略的概率是,据此计算我选择每个策略的期望收益;
二、Nash Equilibrium 纳什均衡
2.1 Penalty Kick Game 足球比赛

考虑以上情形。数字表示进球的可能性,比如 4 代表点球者有 40% 点进,对于守门员就是 40% 失球,用 -4 表示。按照 1.7 节中的最优对策,可以画出点球者使用 3 种不同策略时,期望收益和守门员扑向右侧的概率的关系。

- 从图中可见,点球者向中间射门,在守门员采取任何扑救的情况下,都不是最优策略;
结论 2.1:
不要选择在任何情况下都不是最优对策的策略。
当然,这个模型还是相当简化的。
Def ‘s strategy is a BR (Best Response) to the strategy of other players if for all .
定义可能并不是很好理解,简单来说,就是对于所有玩家 的可能策略 ,如果策略 的效用不低于其他策略的效用,那它就是一个最优应对;换句话说, 是使得 最大的策略。
还有一个更广义的定义:
Def ‘s strategy is a BR to the belief about the others’ choices if for all .
这和上述情形类似,事实上就是引入了不确定性;当其他玩家的选择不再是确定的,而是存在一种概率信念 (即“我认为对手可能这么选的概率是多少”),我们就不能只考虑一个确定的对手策略组合,而是要对可能结果取期望。(马上就要引入纳什均衡的主题了)
2.2 Partnership Game 商业合作
这种博弈常用于商业合作,甚至于任何合作项目中,用来分析个人的努力如何影响总收益、合作是否可持续、是否存在“搭便车”现象等。
妈的,我寻思这不是小组作业吗?
一个典型的模型结构如下:
- 设有两个玩家 ,每人选择一个努力水平 ,努力有成本,但共同创造总收益;
- 总产出函数(合作创造的收益):,其中 ,体现了协同效应;
- 努力成本函数:;
- 收益分配:两个玩家平分产出,也就是每人拿到 ;
关于协同和边际效应,将在之后叙述。
自然,可以计算出对于每个玩家的收益,或者说效用函数为:
此时,另一个玩家的策略集合并不是一个离散的(努力或者完全不努力),而是一个连续的取值,自然难以画出图像进行求解。那么如果要计算玩家效用的最大化,就需要对 求导了。
先求一阶导数:
求一阶导数是不够的,因为无法判断是极大值还是极小值,所以继续求二阶导数:
恒小于 表示效用函数关于 是严格凹的,这意味着效用在 上存在唯一最大值。即在给定对方努力 的情况下,玩家 的最优努力是:
这是玩家 i 的最优反应函数。同样,对于另一名玩家,显然这是对称的。
按照课上的情形,取 ,可以画出两者的最优反应函数如下图:

无限套娃,最终逼近交点,即 ,该交点意味着博弈双方均达到了平衡,即这是双方在没有外部协调机制、各自最大化自己效用时,最终均衡下的努力水平。
但这对企业整体的收益并非最优解,原因也很简单,和努力程度和协同效应越大都没啥关系,即使协同效应,即 进一步增加,合伙人还是只获得产出的 50%,边际成本却全自己承担,所以 Nash 均衡下的努力水平仍是次优的(即低于社会最优);
在经济学上,这种就称之为外部性;
正外部性:一个人的行为对他人带来额外好处,但他自己无法完全内化这个收益;
简单来说,你的努力对别人有“正外部性”,但在博弈中,你只能拿到产出的一部分(比如一半),所以你没有激励为别人多努力;结果就是:所有人都努力得比社会最优要少,也就是激励不足。
也可以通过图像进一步验证,如果协同效应 减少,两条直线的交点会向原点方向持续下移,即双方投入的努力均变少。
这种博弈也被称为策略互补博弈(Strategic Complements Game)。
在这里给出 NE 的标准定义:
Def a strategy profile is a NE(Nash Equilibrium) if and only if .
简单来说,就是“你做了最优选择,假设别人不变;别人也做了最优选择,假设你不变。没有人想自己单独改变。”纳什均衡是一个自我实现的信念,既博弈双方都认为事情会如此发展,最后事情也确实如此发展了,双方都不后悔。
课上还举了几个非连续决策空间的例子,找到双方对策 BR 的重合点就是 NE ,比较基础,这里就偷懒跳过了。
纳什均衡可以和第一章中的优劣势策略建立起一定的联系:
- 所有严格优势策略均衡都是纳什均衡;
- 纳什均衡不一定由严格优势策略构成;
- 严格劣势策略不可能出现在纳什均衡中;(被迭代剔除了)
- 弱劣势策略可能出现在纳什均衡中;
2.3 Investment Game 投资游戏
博弈对象包括全体同学,策略是投资 10 元,收益是净赚 5 元,但是要满足 90% 的人都选择了投资,或者不投资并无收益。很显然,这里的 NE 有 2 种情况,要么都投资,要么都不投资。
初始情况非常重要,如果第一次博弈中,更多的人站在了不投资的这一方,那么在下一轮投资中,更多的人也会不投资,最终在不断重复博弈过程中达到 (0,0) 的 NE ;但如果一开始就有超过 90% 的人选择投资,那么结果会达到 (1,1) 的 NE 。
现实中的案例包括:如腾讯的 QQ 和微信,在面世后就会面对协调博弈,安装的这些沟通软件的人必须要大于一个阈值,彼此才会有收益;股票交易所,如果上市的公司数量、交易量等大于阈值,则会形成良性循环;银行挤兑的问题,储户要么都不跑,要么一起跑,很多历史案例中银行本身并没有问题,但是由于预期变化,储户们选择了一起跑,那么就寄了。
注意它和囚徒困境的区别,囚徒困境中,沟通并不能有效解决问题,但是本情形属于协调博弈(Coordination Game),通过沟通,可以引导参与者从一个 NE 向另一个 NE 移动,这种移动是符合自身利益的,并非舍弃优势策略,所以并不需要强制力的介入,领导力在其中发挥了重要作用。
2.4 Battle Of Sex 性别大战
考虑情侣约会决定看什么电影的情形:

很显然,选择看白雪公主对双方都是严格劣势策略,所以先剔除。然后会发现存在两个 NE ,但与之前情形的区别是,这次双方对于选择哪种 NE 有利益上的冲突。
2.5 Cournot Duopoly 古诺双寡头模型
古诺双寡头模型(Cournot Duopoly Model) 是博弈论和产业组织理论中的一个经典模型,用来描述两个厂商(寡头)在同时决定产量的条件下如何竞争,并分析均衡市场价格与产量。
- 博弈者:生产同质化商品的两家厂商(Firm 1 和 Firm 2);
- 策略:选择生产某种同质化产品的产量 及 ;
- 然后市场上形成一个统一价格:,其中 ;
- 厂商成本函数:(单位成本,或者说边际成本为常数 );
- 每个厂商的利润函数: ,其中 ,即厂商 把对方产量当作已知,最大化自己的利润,与之前的商业合作类似;
同样,对 求一阶导数,设导数为 ,得到最优反应函数(Best Response Function):
进一步求二阶导数: ,所以该点为极大值点。

显然,NE 为两条曲线的交点,即 。不同于投资或者合作,付出的努力越多收益也越多,这里,企业继续增加产量对自己并没有好处,属于策略替代博弈(Strategic Substitute);这里的替代并不是指生产产品上的替代,而是策略替代,即我的策略实施的越多,你的策略实施的就越少,反之亦然。
现在,我们考虑以下情形,如果两家企业协议,各自生产垄断产量的一半,即 ,如果两家均遵守协议,这种产量安排就等价于一个双头垄断,实现利润最大化。
但现实情况并非如此:
- 如果另一方按协议不动,你偷偷多产一点,你能多赚;
- 另一方料到了你会偷偷多产,那么他就会根据你的产量调整到 BR ,即也进行多产;
- 如此博弈,那么最终又回到了 NE ,即古诺产量;
就算两方能严格遵守协议,在寡头联合操控市场、价格抬高之后:高价格和高利润就会吸引新企业进入市场,使得产量扩大,原来的两人“垄断协议”会被打破。
2.6 Bertrand competition 伯特兰模型
它与古诺模型是有部分相似之处的,首先,他们研究的都是不完全竞争市场(Imperfect Competition),即是市场上企业数量有限,或存在某种市场势力(market power),企业可以影响价格或产量,不再是完全竞争中那种“价格接受者”。模型的基本设定如下:
- 博弈者:仍是两家生产同质产品的企业;
- 策略:选择某种同质化产品的价格,分别记为 和 ,为方便分析,假定 ;
- 生产成本:假定边际成本仍为常数 ;
- 市场总需求量: , 为 中的较小者;
- 两家的销量: ;( 同理)
- 企业的收益: ;( 同理)
不难发现,与古诺模型的区别就是,古诺模型中,企业决定产量,而伯特兰模型中,企业决定价格。那么,伯特兰模型中,BR 是什么?
简单解释一下:
- 当 定价小于成本时,我从事生产将会亏本,所以应该选择退出市场, 就相当于把市场份额全部让给另一家企业了;
- 当 时,我需要做的就是比另一家企业定价稍微低一点点,这样我就能最大化利润,并且占有全部市场份额;
- 当 时,那么我们五五开;
- 当 时,我需要做的就是大于等于成本,即一起生产但不都赚,或者直接退出市场;
容易发现 是一个纳什均衡点,还有别的吗?比如 ?
当 时,企业 1 的 BR 应该是 ;然后站在另一家企业的角度考虑,当 时,BR 应该是 ,你会发现也是不断向 移动。
结果就产生了一个悖论:两个厂商居然会像“完全竞争市场”一样,把价格压到边际成本。这与我们观察到的现实不符(现实中寡头通常有市场势力)!伯特兰悖论(Bertrand Paradox) 说明,该模型本身预测的太极端了,或者说,需要对它的假设进行修正。
2.6* 应对伯特兰悖论的扩展模型 —— 线性城市模型 Linear City Model
该模型假设:
- 一条长度为 1 的线段,代表“线性城市”;
- 消费者均匀分布在这条线上;
- 两家企业分别设在线上的不同位置(通常是 0 和 1);
- 消费者购买时,不仅考虑价格,还考虑与厂商的距离成本。
虽然两个企业仍生产同质化产品,但由于地理位置,变相引入了差异化。这里并不一定需要一定是地理位置,可能是消费者对同一品类的不同品牌的偏好性(比如可口可乐 and 百事可乐)。
- Firm 1 在 ,Firm 2 在 ;
- 消费者在 ;
- 厂商价格为 、 ;
- 消费者有交通成本(或者就是产品“差异化”不适配的心理成本): ;(注意这里与课程的差异,课程使用了 ,而标准的线性城市模型似乎使用的是 ,我在这里先使用后者进行求解);
一个消费者在位置 ,面临两种选择:
- 从 Firm 1 购买,支付 ;
- 从 Firm 2 购买,支付 ;
显然,消费者会选择成本更小的,我们首先找出这条直线上的分界点:
即为无差异点:
- 位于左侧()的消费者选择 Firm 1;
- 位于右侧()的消费者选择 Firm 2。
由于消费者在直线上均匀分布,自然可以计算出 Firm 1 和 Firm 2 的市场份额以及对应利润函数:
然后是经典微积分环节:
则有:

不难求得纳什均衡 ,双方定价相等,且各占有一半市场,并且定价高于成本,均获利,解决了伯特兰悖论。
如果像课上一样改成凸运输成本?
同样,先求解无差异点:
可以发现,和线性成本下完全一致,那么之后的运算也是一样的。
2.7 Candidate-Voter Model 选民投票
该模型与 1.6 的中位选民模型基本类似,选民均匀分布,但有以下区别:
- 候选人数量不固定;
- 候选人不能自行选择立场,简单来说,选民是知道这个候选人是什么成分的;
- 博弈者:选民/候选人(选民也可以参选,参选了就变成候选人了);
- 策略:参选或不参选;
- 收益:设胜选收益为 ,参选成本为 ,并且对于选民 ,如果选民 成功,则还需要额外付出 的成本(可以理解为对政治立场与自己不同的人获胜的不爽);
可能你会觉得与中位选民类似,但事实上情况要复杂很多:
- 如果候选人人数 = 0 ,并不存在 NE ,因为此时任何一个人参选,都会获得更高的收益;
- 如果候选人人数 = 1 , 如果总人数为奇数,那么最中间的人参选达到 NE ;
- 如果候选人人数 = 2 ,如果总人数为偶数,,并且候选人为中间两位时达到 NE ;(考虑如果 1 ~ 10 个选民,选民 4 如果不参选,选民 5 和 6 平局,收益为 ,如果参选,那么将会导致选民 6 获胜,收益为 ,所以选民 4 不会参选,该情形属于纳什均衡)
该情形比较复杂,这一就不一一罗列。我们考虑参选人的立场最远能极端到什么程度,现在假设有选民 1 ~ 9 ,假如选民 2 、5 、8 参选,那么它们得票的概率是一致的。可以说,在均匀的直线上,这三个位置正好是三方打平的临界状态。当两个候选人从临界位置向中间靠拢的时候,即便是正中间的选民也不可能通过参选获胜了,反之,当两个候选人从临界位置向两端偏离的时候,可以通过参选获胜的中间区域扩大。
Lesson 1:该选民投票模型有很多 NE ,并且并非如中位选民模型一般位于中间;
Lesson 2:任意选民参选可能导致一个立场偏离自己更远的候选人获胜;
Lesson 3:如果在两人参选的均衡中两人位置偏离中间太远,即太极端,那么中间位置的选民可以参选并获胜;
Lesson 4:先猜后证。
2.8 Location Model 选址模型
- 博弈者:10w 个高个子 and 10w 个矮个子;
- 策略:选择东城区或西城区居住,每个城区可以住 10w 人;
- 收益: ,其中 表示与自己同类的人的数量;
画图可以看出这个收益函数是倒 U 型的,在同类人数量 时收益达到峰值();如果同类太少,则不合群,收益低;反之,如果同类太多,则拥挤、缺多样性,收益也低;
采用先猜后证的方法,不难看出 2 种纳什均衡,10 万个同类人全住在一个城区(比如东区),异类人住在另一城区(西区),这样,大家的收益都是 。证明也并不难,考虑:东城区住着 10 万个高个子,西城区住着 10 万个矮个子;(反过来一样)
对于单个高个子,是否想搬到西城区?搬过去之后,收益变为 !不搬;反过来,单个矮子也不搬,所以没人想改变选择,确实是 NE !这就是一种种族隔离的均衡。
还有一种纳什均衡,就是每个城区都高个子和矮个子都五五开混居。因为任意个人搬家,都会导致他自己的收益略微降低。
但是,可不要小看个体的影响,一旦如果一个个体搬家了,原来城区中所有同类的收益均会受损,并且此时搬家成了他们的 BR 。事实上,混居的均衡是不稳定的,或者说是弱均衡。而种族隔离的均衡是严格均衡且稳定。
在本次博弈中,50% 就是临界点 Tipping Point,一旦越过了 50% 的临界点,那么原有的均衡将“失衡”,向着另一个均衡的方向快速发展,尽管人们更偏好原有的均衡。
不过,如果博弈中,所有人都选择了一个地方呢?那么根据规则,将由政府进行随机分配(中央调控)。
Lesson 1:建模时的琐碎细节可以导致巨大的区别;
Lesson 2:社会随机分配的结果好于自主选择(根据大数定律);
简单解释一下,如果让个体自主选择,会因策略性行为、聚集心理、博弈效应而偏离整体最优;而随机分配则避免这些效应,在大样本下平均结果更好(靠近期望)。
Lesson 3:在一个区域看到了种族隔离现象,不能等价于人们偏好隔离状态。
Lesson 4:随机分配政策的合理性;
Lesson 5:可以由个人的随机化选择替代系统随机(中央调控);
最后一点就引入了接下来一节的混合策略。注意,我在前两章讲的都是纯策略,即博弈者确定性地选择一个动作,而对于混合策略,玩家选择的是一个概率分布,即以一定概率在多个动作中随机选择一个行动。
三、Mixed Strategies 混合策略
3.1 Rock, Paper, Scissors 剪刀石头布
显然,剪刀石头布游戏中,我单纯的采取某种策略,比如每次博弈都出剪刀,那么对方的 BR 就是出石头,那么你的 BR 就是出布,如此循环,并非 NE ,这时候就需要混合策略了。
设 Player 1 使用混合策略 ,分别是出石头、剪刀、布的概率。Player 2 使用混合策略 。则有:
- Player 1 出石头时的预期收益为: ;
- Player 1 出剪刀时的预期收益为: ;
- Player 1 出布时的预期收益为: ;
显然,如果出某个动作的预期收益比另外两个高,那就会只出期望高的那个动作,退化为纯策略,所以,需要使得 ,可解得 。同理也解得 。
此时双方均达到了 BR ,所以 是 NE 。
Def a mixed strategy is a randomization over i’s pure strategies.
is the probability that assigns to pure strategy .
Lesson 1:如果一个混合策略是 BR ,那么这个混合策略中的每一个纯策略必然也都是 BR ,并且每一个策略的预期收益相同。
这点由加权平均数的角度理解就行,混合策略的收益是期望,所以结果必定界于纯策略中最大的收益和最小的收益之间,如果该混合策略是最优反应,那么其中的所有纯策略必然收益最大且相同。
Def a mixed strategy profile is a mixed NE if for each Player , is a BR to .
Lesson 2:如果混合最优策略中某一纯策略的采用概率大于 0 ,那么这个纯策略必然是最优反应。
3.2 Tennis Match 网球比赛
假设有 2 个选手正在进行网球比赛,选手 1 要选择打左边还是打右边,选手 2 需要预判向左还是向右防守。博弈矩阵如下,数字表示得分概率:

显然,不存在纯策略的 NE 。那么混合策略呢?
不妨设选手 1 在达到 NE 时的混合策略为 ,选手 2 在达到 NE 时的混合策略为 。
那么,选手 2 的混合策略如果希望达到 NE ,应该使得选手 1 选左或选右都没有区别,即每一个纯策略预期收益都相同,则 ,由此可解得 。
那么对于选手 1 的混合策略是同理的:
所以,双方分别采用混合策略 是 NE 。简单解释一下,如果选手 1 选择左边的概率大于 0.7 ,那么选手 2 就应该选择始终防守左边(退化为纯策略);如果选手 2 选择左边的概率大于 0.6 ,那么选手 1 就应该始终进攻右边。
现在,假如选手 2 的反手击球(往左)能力提升了呢?比如,博弈矩阵的 处变为 ,并且该信息对双方都是透明的,即对手也知道选手 2 的能力进步了。
我们先从直觉的角度看这个问题,如果选手 2 的反手能力提升:
- 直接影响:选手 2 更倾向于打反手球, 增大;
- 间接/战略影响:由于信息透明,选手 1 会减少打反手球,那么选手 2 也会相应减少打反手球, 减小;
该问题的关键是,谁起了主导地位?即最后的 是增大还是减小?
求解 NE 如下:
即, 减小,战略/间接影响发挥了主导作用。同样,对于选手 1 呢?既然选手 2 减小了反手球的概率,那么从直觉来看,选手 1 进攻左边的概率也会减小,即 减小,你也可以通过计算验证,此处省略。
以下是对于上述得出的混合策略是最优策略的证明:
对于选手 1 ,其选择左边的收益为 ,选择右边的收益为 ,采用混合策略的收益为 。显然,采用纯策略也并非严格有利,对于其他的混合策略,其收益也肯定界于较高的纯策略收益和较低的纯策略收益之间。
由此也可以得出一个新结论:
Lesson 3:混合策略是否是最优策略,只需证明改选纯策略是否严格有利即可。
3.3 Battle Of Sex Ⅱ 性别大战 Ⅱ
与之前提到的类似,博弈矩阵如下:

显然,(选择1,选择1)和(选择2,选择2)都是 NE 。只要通过沟通便能达到均衡。但如果现实中,并没有事先沟通,协调失败的情况也是常有的。那么就需要考虑混合策略。计算混合策略下的 NE 的方法已经在上面一节给出了,这里直接计算。
设男方采用混合策略 ,女方采用混合策略 。
来简单验证一下 是 NE ,对于男方,选择 1 的收益为 ,选择 2 的收益为 ,混合策略的收益也为 ,改选纯策略并非严格有利的策略。对于女方也类似。
这里混合策略中的概率,并不一定是字面意义上的随机化。可以理解为实际约会中,对手对你会怎么做的一种猜测。
至于为什么混合策略的期望收益只有 ,这是因为纯策略下,双方见面成功,但是混合策略下,双方只有 的概率见面成功。
3.4 Tax Payer 纳税人
考虑以下情形:

如图,纯策略下并不存在 NE 。同上,计算混合策略:
设税务人员采用的混合策略为 ,纳税者采用的策略为 。
混合策略下, 。容易验证。即对于税务人员以 的概率进行审查(或者说审查 的纳税人),而对于纳税者,以 的概率选择如实纳税。当然,这都是从个体采取的策略来理解的。
还有一种理解是,这里的概率不一定要理解为策略的随机化,也可以视为采取不同策略的人的比例,比如该案例的总体中,有 选择如实纳税,即可以用来预测比例。
接下来,从政策制定者的角度考虑,如果你发现逃税者的比例很高,并希望通过提升偷税漏税的惩罚力度来减少逃税者,会发生什么呢?假如博弈矩阵变化如下:

我们希望计算 ,即逃税者的比例,需要计算税务人员的期望收益,即:
和之前一样,纳税意愿并没有改变。不改变税务人员的收益,自然不会改变纳税人的纳税意愿。新均衡只改变了 ,容易计算出 会减小,即税务人员审查的力度下降了。
四、Evolution 进化论
4.1 Simplified Model 简化模型
简化的模型有以下假设:
- 种群内部竞争;
- 博弈者之间的各类情况互为镜像;
- 博弈者们身处一个大数量的种群中,随机配对博弈;
- 相对成功的策略会增长;
- 不存在基因重组,即只考虑无性繁殖;
现在,假如一个大种群中的所有个体都采用了相同策略 ,但是某一时刻有一部分个体发生了“变异”,改为采用策略 ,如果发生变异的个体采用的策略只可能导致灭绝,那么则称原策略 是进化稳定(Evolutionarily Stable) 的。
继续以囚徒困境为例:

C 和 D 分别代表合作/不合作。现在,假设所有鼠鼠都是天生理性的,都会选择合作。显然,如果都是合作型鼠鼠,无论如何随机配对,互相都有收益,能无限繁衍下去。
现在,假如突然产生了变异,出现了一只不合作鼠鼠,它随机配对到一个合作型鼠鼠进行博弈,于是这个合作型鼠鼠会死,不合作鼠鼠活下去并无性生殖,不合作鼠鼠越来越多,不会灭绝。
显然,合作策略下,发生突变的个体并不会灭绝,所以合作策略并不是一个进化稳定的策略。或者你也可以通过计算期望收益,假设合作的个体占种群的 :
显然,不合作个体的收益更大,它们不会灭绝,并且不合作才是进化稳定(ES)的策略。由此案例我们可以得出 2 个结论:
Lesson 1:自然选择的结果可能是糟糕的。
Lesson 2:严格劣势策略一定不是 ES ,会在进化中被淘汰。
为什么该模型会推出与现实似乎有些相悖的结论呢?简单来说,就是因为该模型假设的是无性繁殖,没有考虑基因的融合。
再考虑以下博弈:

假如种群中的所有个体天生都会选择 c ,c 是 ES 吗?考虑 b 入侵 c 的情况,设 b 占比为 ,则:
由于 是一个无穷小量,所以 ,所以 c 不是 ES 。但 b 和 c 是对称的,同样可以推出 b 也不是 ES 。
该博弈中的 NE 不难推出是 (a, a)、(b, c) 和 (c, b) 。如果一个策略不是 NE ,那么肯定是不能形成进化稳定的,因为必然会出现有利变动入侵该策略。所以进化稳定策略一定是 NE 。
反过来成立吗,即 NE 一定是进化稳定策略吗?并非如此,可以看以下例子:

NE = (a, a) and (b, b) ,而 (b, b) 并不是进化稳定的,因为:
事实上,NE 与最优策略的交集才是进化稳定策略,即:
Lesson 3:严格纳什均衡和进化稳定策略互为充要条件。
最后,我们再从生物学和经济学的视角分别给出进化稳定的标准定义:
定义 4.1:在 2 个玩家的对称博弈(symmetric game)中,一个纯策略满足进化稳定策略(Evolutionarily Stable)当满足以下条件:
满足 对于其余所有策略 和对足够小的正数 。
简单来说,就是少量使用其他策略 的突变者不能获得更高收益,即突变体不能成功“入侵”,则称策略 是进化稳定策略。
定义 4.2:在 2 个玩家的对称博弈(symmetric game)中,一个纯策略满足进化稳定策略(Evolutionarily Stable)当满足以下条件:
如果 是一个对称纳什均衡,那么 ;如果 ,则 。
经济学上的定义涵盖了 2 种情况,第一种情况属于严格 NE ,而第二种情况,即弱纳什均衡,则还需要进一步满足边界情况,即使突变个体和原始个体在博弈时收益还不错,但突变个体之间博弈收益极低。
这两个定义是等价的。
持续更新中…
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!



