MathLabs

概率与统计

贝叶斯统计

随着新数据到来,把先验信念更新为后验信念的统计学方法。

直观随着新证据的到来更新信念

假设有人递给你一枚硬币,问你:它公平吗?在你哪怕抛一次之前,你可能相信它大概接近公平,但并不确定——把这称为你的先验信念。现在你抛了10次,看到8次正面。这些数据应当使你的信念转向"可能偏向正面",但又不完全抛弃你之前所相信的。贝叶斯统计正是把先验信念与新数据结合起来,得到更新后的后验信念的精确机制。

一个向下弯曲的峰,其顶点偏向中心右侧,示意性地表示后验分布被观测数据从对称先验中拉出。
贝叶斯 Beta–Binomial 更新:在 nn 次试验观测到 k≈npk \approx np 次成功后,平缓的灰色先验 Beta(2,2)\mathrm{Beta}(2,2) 收缩为集中在 pp 附近的紫色后验密度。

大学贝叶斯更新:从先验到后验

定义: 先验、似然、后验

对于未知参数 θ\theta,先验分布 π(θ)\pi(\theta) 编码了在看到数据 xx 之前对 θ\theta 的信念。似然 L(x∣θ)L(x\mid\theta) 表示对每个 θ\theta 值,观测数据出现的可能性有多大。贝叶斯定理把它们结合成后验分布:π(θ∣x)∝L(x∣θ) π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\,\pi(\theta)——后验正比于似然乘以先验。

π(θ∣x)∝L(x∣θ) π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\,\pi(\theta)

比例符号背后隐藏着一个归一化常数 m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta'(称为边际似然或证据),它不依赖于 θ\theta,只是把乘积 L(x∣θ)π(θ)L(x\mid\theta)\pi(\theta) 重新缩放,使 π(θ∣x)\pi(\theta\mid x) 对全部 θ\theta 积分为 11,就像任何其他概率密度一样。

π(θ∣x)=L(x∣θ)π(θ)∫L(x∣θ′)π(θ′) dθ′\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{\int L(x\mid\theta')\pi(\theta')\,d\theta'}

若 θ\theta 具有先验密度 π(θ)\pi(\theta),数据 xx 具有似然 L(x∣θ)L(x\mid\theta),则给定 xx 时 θ\theta 的后验密度为 π(θ∣x)=L(x∣θ)π(θ)m(x)\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{m(x)},其中 m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta';等价地 π(θ∣x)∝L(x∣θ)π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\pi(\theta)。

为什么成立?

这不过是把条件密度的定义同时应用于 θ\theta 与 xx:后验就是 (θ,x)(\theta,x) 的联合密度除以仅 xx 的边际密度,而联合密度分解为先验乘以似然。

证明

(θ,x)(\theta,x) 的联合密度可以两种方式分解:分解为 π(θ)L(x∣θ)\pi(\theta)L(x\mid\theta)(先验乘以似然,根据将似然定义为给定 θ\theta 时 xx 的条件密度),也分解为 π(θ∣x)m(x)\pi(\theta\mid x)m(x)(后验乘以 xx 的边际密度,根据将后验定义为给定 xx 时 θ\theta 的条件密度)。由于两个表达式等于同一个联合密度,故 π(θ)L(x∣θ)=π(θ∣x)m(x)\pi(\theta)L(x\mid\theta)=\pi(\theta\mid x)m(x)。

解出 π(θ∣x)\pi(\theta\mid x),在 m(x)>0m(x)>0 的前提下得到 π(θ∣x)=L(x∣θ)π(θ)m(x)\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{m(x)}。

还需验证 m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta' 确实是正确的归一化常数:对分解式 π(θ)L(x∣θ)=π(θ∣x)m(x)\pi(\theta)L(x\mid\theta)=\pi(\theta\mid x)m(x) 两边关于 θ\theta 积分,左边由定义得 ∫π(θ)L(x∣θ) dθ=m(x)\int \pi(\theta)L(x\mid\theta)\,d\theta=m(x),右边由于 π(⋅∣x)\pi(\cdot\mid x) 是概率密度而得 m(x)∫π(θ∣x) dθ=m(x)×1m(x)\int\pi(\theta\mid x)\,d\theta=m(x)\times1。两边相符,确认了 m(x)m(x) 的一致性,且 π(θ∣x)\pi(\theta\mid x) 按密度要求积分为 11。

大学共轭先验:Beta-二项模型

定义: 共轭先验

如果后验分布仍停留在与先验相同的分布族中,只是参数被更新了,就称这个先验族对该似然是共轭的。这把贝叶斯更新从一个积分(计算 m(x)m(x))变成了对该族参数的简单算术——这正是在现代计算方法出现之前,共轭先验一直是贝叶斯统计主力工具的原因。

π(θ)=θα−1(1−θ)β−1B(α,β),0<θ<1\pi(\theta)=\dfrac{\theta^{\alpha-1}(1-\theta)^{\beta-1}}{B(\alpha,\beta)},\qquad 0<\theta<1

若 θ∼Beta(α,β)\theta\sim\mathrm{Beta}(\alpha,\beta) 为先验,且在给定 θ\theta 时,nn 次独立试验中观测到 kk 次成功(即 k∣θ∼Binomial(n,θ)k\mid\theta\sim\mathrm{Binomial}(n,\theta)),则后验为 θ∣k∼Beta(α+k, β+n−k)\theta\mid k\sim\mathrm{Beta}(\alpha+k,\ \beta+n-k)。

为什么成立?

二项似然贡献因子 θk(1−θ)n−k\theta^k(1-\theta)^{n-k},而 Beta 先验贡献 θα−1(1−θ)β−1\theta^{\alpha-1}(1-\theta)^{\beta-1};把它们相乘只是把指数相加,恰好落在另一个 Beta 密度的形状上。

证明

在给定 θ\theta 时,nn 次试验中观测到 kk 次成功的似然为 L(k∣θ)=(nk)θk(1−θ)n−kL(k\mid\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k}。由上面的后验比例定理,π(θ∣k)∝L(k∣θ)π(θ)=(nk)θk(1−θ)n−k⋅θα−1(1−θ)β−1B(α,β)\pi(\theta\mid k)\propto L(k\mid\theta)\pi(\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k}\cdot\dfrac{\theta^{\alpha-1}(1-\theta)^{\beta-1}}{B(\alpha,\beta)}。

因子 (nk)\binom{n}{k} 与 B(α,β)B(\alpha,\beta) 不依赖于 θ\theta,故可并入比例常数:π(θ∣k)∝θk(1−θ)n−k⋅θα−1(1−θ)β−1=θ(α+k)−1(1−θ)(β+n−k)−1\pi(\theta\mid k)\propto\theta^{k}(1-\theta)^{n-k}\cdot\theta^{\alpha-1}(1-\theta)^{\beta-1}=\theta^{(\alpha+k)-1}(1-\theta)^{(\beta+n-k)-1}。

这最后一个表达式恰好就是 Beta(α+k,β+n−k)\mathrm{Beta}(\alpha+k,\beta+n-k) 密度的核(θ\theta 相关的部分)。由于在 (0,1)(0,1) 上具有该核的概率密度只有唯一的归一化常数(根据 Beta 函数的定义,即 1/B(α+k,β+n−k)1/B(\alpha+k,\beta+n-k)),后验必然恰好是 π(θ∣k)=θ(α+k)−1(1−θ)(β+n−k)−1B(α+k,β+n−k)\pi(\theta\mid k)=\dfrac{\theta^{(\alpha+k)-1}(1-\theta)^{(\beta+n-k)-1}}{B(\alpha+k,\beta+n-k)},即 θ∣k∼Beta(α+k,β+n−k)\theta\mid k\sim\mathrm{Beta}(\alpha+k,\beta+n-k)。

例题: 对网站点击率进行A/B测试

在进行实验之前,一位分析师为按钮的真实点击率 θ\theta 设置了一个弱信息先验 Beta(2,2)\mathrm{Beta}(2,2)(以0.5为中心,但把握不大)。向 n=20n=20 名访客展示该按钮后,有 k=7k=7 人点击了它。求后验分布及其均值。

解答

由 Beta-二项共轭性,后验为 Beta(α+k, β+n−k)=Beta(2+7, 2+13)=Beta(9,15)\mathrm{Beta}(\alpha+k,\ \beta+n-k)=\mathrm{Beta}(2+7,\ 2+13)=\mathrm{Beta}(9,15)。

Beta(a,b)\mathrm{Beta}(a,b) 分布的均值为 a/(a+b)a/(a+b),故后验均值为 9/(9+15)=9/24=0.3759/(9+15)=9/24=0.375:看到数据后,分析师对点击率的最佳点估计从先验均值 0.50.5 移动到了 0.3750.375,同时被拉向——但并不等于——原始样本比例 7/20=0.357/20=0.35,因为先验仍然贡献了一部分权重。

大学可信区间与置信区间

定义: 可信区间

θ\theta 的 (1−α)(1-\alpha) 可信区间是满足 ∫LUπ(θ∣x) dθ=1−α\int_L^U \pi(\theta\mid x)\,d\theta=1-\alpha 的任意区间 [L,U][L,U]:它是关于 θ\theta 的一个直接概率陈述,是在数据 xx 已被观测之后,由后验分布计算得到的。

这与频率学派的置信区间是本质上不同的对象。置信区间是由一个程序构造出来的:若将其应用于许多假设的样本,它会以已知的比例捕捉到真实(固定)的 θ\theta;一旦从手头的具体数据计算出一个具体区间,θ\theta 要么在其中,要么不在——再没有概率可言。而可信区间则把 θ\theta 本身当作具有分布的量,因此"θ\theta 落在 [L,U][L,U] 中的概率"始终是一个有意义的陈述。

可信区间与置信区间的比较
方面贝叶斯可信区间频率学派置信区间
什么是随机的θ\theta 被当作随机的,具有后验分布;一旦观测到数据,区间就固定了θ\theta 是固定的未知常数;区间本身才是随机对象,随样本而变化
解释给定观测数据,θ\theta 落在该区间内的概率是 1−α1-\alpha在重复抽样中,按此方法构造的区间有 1−α1-\alpha 的比例会包含真实的 θ\theta
是否依赖先验是——先验 π(θ)\pi(\theta) 直接进入后验否——仅由似然与抽样分布计算得出

进阶超越共轭:对后验进行采样

共轭先验很优雅,但大多数现实模型——参数众多、具有层次结构、似然非标准——都没有共轭形式,因此归一化常数 m(x)m(x) 没有闭式积分。马尔可夫链蒙特卡洛(MCMC)方法完全绕过了这个积分:它们构造一条平稳分布恰好就是后验 π(θ∣x)\pi(\theta\mid x) 的马尔可夫链,然后模拟这条链,并用所得样本上的简单平均来近似任何后验量(均值、可信区间或其他任何量),而完全不需要计算 m(x)m(x)。

大学实际应用与典型例题

贝叶斯更新出现在任何需要根据带噪声的证据修正信念的场合:医生解读诊断检测结果、垃圾邮件过滤器对邮件分类、搜救队更新搜索地点、航天器导航系统融合传感器读数——所有这些都在运行某种版本的"后验 ∝\propto 似然 ×\times 先验"。

例题: 为什么阳性检测结果不能证明患病

某种罕见疾病影响 1%1\% 的人群(P(D)=0.01P(D)=0.01)。某检测的灵敏度为 99%99\%(P(+∣D)=0.99P(+\mid D)=0.99),假阳性率为 5%5\%(P(+∣¬D)=0.05P(+\mid \lnot D)=0.05)。随机抽取的一人检测呈阳性。求 P(D∣+)P(D\mid +)。

解答

由全概率公式,P(+)=P(+∣D)P(D)+P(+∣¬D)P(¬D)=0.99×0.01+0.05×0.99=0.0099+0.0495=0.0594P(+)=P(+\mid D)P(D)+P(+\mid\lnot D)P(\lnot D)=0.99\times0.01+0.05\times0.99=0.0099+0.0495=0.0594。

贝叶斯定理给出 P(D∣+)=P(+∣D)P(D)P(+)=0.00990.0594≈0.167P(D\mid +)=\dfrac{P(+\mid D)P(D)}{P(+)}=\dfrac{0.0099}{0.0594}\approx0.167。

尽管这项检测看起来非常准确(灵敏度99%,假阳性率仅5%),阳性结果实际上仍只意味着约 16.7%16.7\% 的患病概率——因为该疾病罕见,来自庞大健康人群的假阳性数量超过了来自极小患病人群的真阳性数量。这正是贝叶斯更新在起作用:较低的先验 P(D)=0.01P(D)=0.01 把后验拉得远低于检测本身的准确率数字。

例题: 从平坦先验到偏斜后验

为估计一枚硬币的偏差 θ\theta,一位怀疑者从完全无信息的 Beta(1,1)\mathrm{Beta}(1,1) 先验(在 (0,1)(0,1) 上均匀分布)出发。抛掷该硬币10次,观察到8次正面后,求后验分布及其均值与众数。

解答

在 α=β=1\alpha=\beta=1、n=10n=10、k=8k=8 的 Beta-二项共轭性下,后验为 Beta(1+8, 1+2)=Beta(9,3)\mathrm{Beta}(1+8,\ 1+2)=\mathrm{Beta}(9,3)。

后验均值为 9/(9+3)=9/12=0.759/(9+3)=9/12=0.75。当 a,b>1a,b>1 时,Beta(a,b)\mathrm{Beta}(a,b) 分布的众数为 (a−1)/(a+b−2)(a-1)/(a+b-2),此处为 8/10=0.88/10=0.8。

先验是一个平坦、对称、不偏向任何值的峰;后验则是一个明显不对称的峰,峰值接近 0.80.8,这正是本页顶部小部件示意的"峰从对称先验偏移"——10次抛掷中8次正面,即便样本量很小,也确实把信念拉向了一枚有偏的硬币。

在 Beta(2,3)\mathrm{Beta}(2,3) 先验下,观测到 n=10n=10 次试验中 k=4k=4 次成功后,后验分布是什么?

在本页的医学检测例子中,阳性结果只给出约 16.7%16.7\% 的患病后验概率,远低于该检测 99%99\% 的灵敏度。这说明了什么?

下列哪种说法正确描述了 95%95\% 贝叶斯可信区间,并与 95%95\% 频率学派置信区间形成对比?

对于 Beta(9,3)\mathrm{Beta}(9,3) 后验,后验均值 E[θ]E[\theta] 是多少?

参考文献

  1. Andrew Gelman, John B. Carlin, Hal S. Stern, David B. Dunson, Aki Vehtari, Donald B. Rubin (2013). Bayesian Data Analysis (3rd ed.)
  2. Matthew D. Hoffman, Andrew Gelman (2014). The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo · arXiv:1111.4246