12 年级
条件概率与贝叶斯定理
当已知另一个事件已经发生时,一个事件的概率会如何变化。
直观直觉:新信息会改变发生的可能性
掷两颗均匀的六面骰子,设 A 为两颗骰子点数之和等于 8 的事件,通常情况下 P(A)=365,因为在 36 个等可能的组合中,恰好有五个组合 (2,6),(3,5),(4,4),(5,3),(6,2) 之和为该值。现在假设有人偷看了第一颗骰子,并告诉你它显示 5;把这称为事件 B。知道 B 之后,样本空间从全部 36 个组合缩小到第一颗骰子为 5 的 6 个组合,而在这 6 个组合中只有 (5,3) 之和为 8。这个额外信息把 A 的概率从 365 变为 61——这个更新后的值记作 P(A∣B),称为在已知 B 的条件下 A 的条件概率。
一个两阶段试验的概率树:第一层分支按满足哪个条件(例如选中了哪个坛子,或病人是否患病)来划分样本空间,第二层的每条分支都标有一个条件概率,如 P(A∣B)。沿一条路径相乘得到 P(A∩B),而对所有以 A 结尾的路径求和则得到全概率 P(A)。中学条件概率的定义
定义: 条件概率
对同一样本空间中的两个事件 A 与 B,当 P(B)>0 时,在已知 B 的条件下 A 的条件概率为 P(A∣B)=P(B)P(A∩B)。直观地说,一旦知道 B 已经发生,样本空间就被限制为 B,而 P(A∣B) 衡量的是这个受限空间中有多大比例同时也属于 A。
P(A∣B)=P(B)P(A∩B) 这里 P(A∩B) 是 A 与 B 同时发生的概率,而 P(B) 是条件事件的概率,它必须为正,因为除以 P(B)=0 是没有意义的。改写这个定义可得乘法法则 P(A∩B)=P(B)⋅P(A∣B),由对称性,当 P(A)>0 时也有 P(A∩B)=P(A)⋅P(B∣A);这条法则可以自然地推广到多个事件的链条。
P(A∩B)=P(B)⋅P(A∣B)=P(A)⋅P(B∣A) 一个值得专门命名的特殊情形是独立性:A 与 B 独立,恰好是指知道 B 并不会为 A 提供新信息,即 P(A∣B)=P(A),这等价于 P(A∩B)=P(A)⋅P(B)。当 A 与 B 不独立时,两个条件概率 P(A∣B) 与 P(B∣A) 一般是不同的数,混淆它们是概率论中最常见的错误之一。
特殊情形下的条件概率| A 与 B 的关系 | P(A∣B) 的值 | 原因 |
|---|
| 独立 | P(A∣B)=P(A) | B 不携带关于 A 的信息 |
| A 蕴含 B(即 A⊆B) | P(A∣B)=P(B)P(A) | 因为 A∩B=A |
| A 与 B 互斥 | P(A∣B)=0 | 因为 A∩B=∅ |
大学全概率公式与贝叶斯定理
设 B1,B2,…,Bn 是样本空间 Ω 的一个划分,即当 i=j 时 Bi∩Bj=∅,且 B1∪B2∪⋯∪Bn=Ω,并且对每个 i 都有 P(Bi)>0。那么对任意事件 A,都有 P(A)=∑i=1nP(Bi)⋅P(A∣Bi)。
为什么成立?
由于 Bi 划分了 Ω,事件 A 自动被切成 n 个互不相交的部分,每个部分都落在某个 Bi 之内;把用乘法法则表示的每个部分的概率相加,就能不重不漏地还原出整个 P(A)。
证明
第一步(用 Bi 划分 A):对每个 i=1,…,n,令 Ai=A∩Bi。由于 Bi 两两不相交,Ai 也两两不相交;又因为 B1∪⋯∪Bn=Ω⊇A,所以 A 中的每个结果都恰好属于某一个 Ai,于是 A=A1∪A2∪⋯∪An,且这个并是不相交的。
第二步(把不相交部分的概率相加):由于概率对两两不相交的事件具有可加性,P(A)=P(A1)+P(A2)+⋯+P(An)=∑i=1nP(A∩Bi)。
第三步(用乘法法则改写每一项):对每个 i,由乘法法则得 P(A∩Bi)=P(Bi)⋅P(A∣Bi),由于 P(Bi)>0,该式有意义。
第四步(代回原式):把第二步中每个 P(A∩Bi) 替换为 P(Bi)⋅P(A∣Bi),恰好得到 P(A)=∑i=1nP(Bi)⋅P(A∣Bi),即为所证。
设 B1,B2,…,Bn 是 Ω 的一个划分,对每个 i 都有 P(Bi)>0,又设 A 是满足 P(A)>0 的事件。那么对每个 i,都有 P(Bi∣A)=∑j=1nP(Bj)⋅P(A∣Bj)P(Bi)⋅P(A∣Bi)。
为什么成立?
贝叶斯定理把条件化的方向反过来:它从每个假设 Bi 之下证据 A 出现的可能性出发(这通常容易知道或测量),再反推出在证据 A 已经被观测到之后每个假设成立的可能性(这通常才是我们真正想知道的),做法是根据每个假设对 A 的解释程度,对先验概率 P(Bi) 重新加权。
证明
第一步(用两种方式写出 P(Bi∩A)):双向应用乘法法则,得 P(Bi∩A)=P(Bi)⋅P(A∣Bi),又因为 P(A)>0,也有 P(Bi∩A)=P(A)⋅P(Bi∣A)。
第二步(令两个表达式相等并求解):令 P(Bi∩A) 的两个表达式相等,得 P(A)⋅P(Bi∣A)=P(Bi)⋅P(A∣Bi),两边同除以 P(A),得 P(Bi∣A)=P(A)P(Bi)⋅P(A∣Bi)。
第三步(用全概率公式展开分母):由于 B1,…,Bn 划分了 Ω,由全概率公式得 P(A)=∑j=1nP(Bj)⋅P(A∣Bj)。
第四步(代入完成证明):把第二步中的 P(A) 替换为这个和式,恰好得到 P(Bi∣A)=∑j=1nP(Bj)⋅P(A∣Bj)P(Bi)⋅P(A∣Bi),这正是贝叶斯定理。
大学实际应用与典型例题
贝叶斯定理是医学诊断(在得到检测结果后更新患病的可能性)、垃圾邮件过滤(在看到邮件用词后更新其为垃圾邮件的可能性)、法律推理(在获得新证据后更新有罪的可能性),以及机器学习分类器(在观察到特征后更新标签的可能性)背后的数学核心。下面两个例子把全概率公式和贝叶斯定理应用到具体数字上,其中包括医学检测中假阳性的经典悖论。
例题: 球是从哪个坛子中取出的?
有两个坛子。坛子I中有 3 个红球和 7 个蓝球;坛子II中有 6 个红球和 4 个蓝球。随机选一个坛子,选中坛子I的概率为 P(Urn I)=0.4,选中坛子II的概率为 P(Urn II)=0.6,然后从选中的坛子里取出一个球。取出的球是红色的。求它来自坛子I的概率。
解答
第一步:设 R 为取出的球是红色的事件。在坛子I中,P(R∣Urn I)=103;在坛子II中,P(R∣Urn II)=106。
第二步:由于坛子I与坛子II划分了选坛子这一步骤,由全概率公式得 P(R)=P(Urn I)⋅P(R∣Urn I)+P(Urn II)⋅P(R∣Urn II)=0.4⋅0.3+0.6⋅0.6=0.12+0.36=0.48。
第三步:由贝叶斯定理得 P(Urn I∣R)=P(R)P(Urn I)⋅P(R∣Urn I)=0.480.12=41,所以尽管坛子I被选中的次数更少,看到红球后它来自坛子I的概率仍只有 25%,因为坛子II产生红球的可靠程度是它的两倍。
例题: 医学检测中的假阳性悖论
某种疾病影响了 1% 的人口,因此对随机选取的一个人有 P(D)=0.01。该病的检测灵敏度为 99%,即 P(+∣D)=0.99,特异度为 95%,即 P(−∣Dc)=0.95(因此假阳性率为 P(+∣Dc)=0.05)。随机抽取一人检测结果为阳性。求 P(D∣+),即该人确实患病的概率。
解答
第一步:D 与 Dc(患病、不患病)划分了整个人群,P(D)=0.01,P(Dc)=0.99。
第二步:对检测结果为阳性这一事件应用全概率公式,P(+)=P(D)⋅P(+∣D)+P(Dc)⋅P(+∣Dc)=0.01⋅0.99+0.99⋅0.05=0.0099+0.0495=0.0594。
第三步:由贝叶斯定理得 P(D∣+)=P(+)P(D)⋅P(+∣D)=0.05940.0099=61,只有约 16.7%。
第四步:这就是假阳性悖论:即使检测的灵敏度高达 99%、特异度高达 95%,大多数阳性结果仍然是假警报,因为疾病本身很罕见,99% 的健康人群所贡献的假阳性(0.0495)远远超过 1% 的患病人群所贡献的真阳性(0.0099)。
已知 P(A)=0.4、P(B)=0.5、P(A∩B)=0.2,求 P(A∣B)。
某筛查检测的灵敏度为 99%,特异度为 99%。在患病率为 1% 的人群中,随机抽取一人检测结果为阳性。P(D∣+)(四舍五入到整数百分比)是多少?
设 B1,B2,…,Bn 是样本空间 Ω 的一个划分,且对每个 i 都有 P(Bi)>0。下列哪个公式对任意事件 A 正确给出 P(A)?
事件 A 与 B 满足 P(B)>0。下列哪个等式恰好是 A 与 B 相互独立的定义?