← 返回 资料库 › 概率与统计 › 统计学 概率与统计
贝叶斯统计 随着新数据到来,把先验信念更新为后验信念的统计学方法。
直观 随着新证据的到来更新信念 假设有人递给你一枚硬币,问你:它公平吗?在你哪怕抛一次之前,你可能相信它大概接近公平,但并不确定——把这称为你的先验信念 。现在你抛了10次,看到8次正面。这些数据应当使你的信念转向"可能偏向正面",但又不完全抛弃你之前所相信的。贝叶斯统计 正是把先验信念与新数据结合起来,得到更新后的后验信念 的精确机制。
贝叶斯 Beta–Binomial 更新:在 n n n 次试验观测到 k ≈ n p k \approx np k ≈ n p 次成功后,平缓的灰色先验 B e t a ( 2 , 2 ) \mathrm{Beta}(2,2) Beta ( 2 , 2 ) 收缩为集中在 p p p 附近的紫色后验密度。 大学 贝叶斯更新:从先验到后验 定义: 先验、似然、后验
对于未知参数 θ \theta θ ,先验分布 π ( θ ) \pi(\theta) π ( θ ) 编码了在看到数据 x x x 之前对 θ \theta θ 的信念。似然 L ( x ∣ θ ) L(x\mid\theta) L ( x ∣ θ ) 表示对每个 θ \theta θ 值,观测数据出现的可能性有多大。贝叶斯定理把它们结合成后验分布 :π ( θ ∣ x ) ∝ L ( x ∣ θ ) π ( θ ) \pi(\theta\mid x)\propto L(x\mid\theta)\,\pi(\theta) π ( θ ∣ x ) ∝ L ( x ∣ θ ) π ( θ ) ——后验正比于似然乘以先验。
π ( θ ∣ x ) ∝ L ( x ∣ θ ) π ( θ ) \pi(\theta\mid x)\propto L(x\mid\theta)\,\pi(\theta) π ( θ ∣ x ) ∝ L ( x ∣ θ ) π ( θ ) 比例符号背后隐藏着一个归一化常数 m ( x ) = ∫ L ( x ∣ θ ′ ) π ( θ ′ ) d θ ′ m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta' m ( x ) = ∫ L ( x ∣ θ ′ ) π ( θ ′ ) d θ ′ (称为边际似然 或证据 ),它不依赖于 θ \theta θ ,只是把乘积 L ( x ∣ θ ) π ( θ ) L(x\mid\theta)\pi(\theta) L ( x ∣ θ ) π ( θ ) 重新缩放,使 π ( θ ∣ x ) \pi(\theta\mid x) π ( θ ∣ x ) 对全部 θ \theta θ 积分为 1 1 1 ,就像任何其他概率密度一样。
π ( θ ∣ x ) = L ( x ∣ θ ) π ( θ ) ∫ L ( x ∣ θ ′ ) π ( θ ′ ) d θ ′ \pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{\int L(x\mid\theta')\pi(\theta')\,d\theta'} π ( θ ∣ x ) = ∫ L ( x ∣ θ ′ ) π ( θ ′ ) d θ ′ L ( x ∣ θ ) π ( θ ) 若 θ \theta θ 具有先验密度 π ( θ ) \pi(\theta) π ( θ ) ,数据 x x x 具有似然 L ( x ∣ θ ) L(x\mid\theta) L ( x ∣ θ ) ,则给定 x x x 时 θ \theta θ 的后验密度为 π ( θ ∣ x ) = L ( x ∣ θ ) π ( θ ) m ( x ) \pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{m(x)} π ( θ ∣ x ) = m ( x ) L ( x ∣ θ ) π ( θ ) ,其中 m ( x ) = ∫ L ( x ∣ θ ′ ) π ( θ ′ ) d θ ′ m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta' m ( x ) = ∫ L ( x ∣ θ ′ ) π ( θ ′ ) d θ ′ ;等价地 π ( θ ∣ x ) ∝ L ( x ∣ θ ) π ( θ ) \pi(\theta\mid x)\propto L(x\mid\theta)\pi(\theta) π ( θ ∣ x ) ∝ L ( x ∣ θ ) π ( θ ) 。
为什么成立? 这不过是把条件密度的定义同时应用于 θ \theta θ 与 x x x :后验就是 ( θ , x ) (\theta,x) ( θ , x ) 的联合密度除以仅 x x x 的边际密度,而联合密度分解为先验乘以似然。
证明 ( θ , x ) (\theta,x) ( θ , x ) 的联合密度可以两种方式分解:分解为 π ( θ ) L ( x ∣ θ ) \pi(\theta)L(x\mid\theta) π ( θ ) L ( x ∣ θ ) (先验乘以似然,根据将似然定义为给定 θ \theta θ 时 x x x 的条件密度),也分解为 π ( θ ∣ x ) m ( x ) \pi(\theta\mid x)m(x) π ( θ ∣ x ) m ( x ) (后验乘以 x x x 的边际密度,根据将后验定义为给定 x x x 时 θ \theta θ 的条件密度)。由于两个表达式等于同一个联合密度,故 π ( θ ) L ( x ∣ θ ) = π ( θ ∣ x ) m ( x ) \pi(\theta)L(x\mid\theta)=\pi(\theta\mid x)m(x) π ( θ ) L ( x ∣ θ ) = π ( θ ∣ x ) m ( x ) 。
解出 π ( θ ∣ x ) \pi(\theta\mid x) π ( θ ∣ x ) ,在 m ( x ) > 0 m(x)>0 m ( x ) > 0 的前提下得到 π ( θ ∣ x ) = L ( x ∣ θ ) π ( θ ) m ( x ) \pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{m(x)} π ( θ ∣ x ) = m ( x ) L ( x ∣ θ ) π ( θ ) 。
还需验证 m ( x ) = ∫ L ( x ∣ θ ′ ) π ( θ ′ ) d θ ′ m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta' m ( x ) = ∫ L ( x ∣ θ ′ ) π ( θ ′ ) d θ ′ 确实是正确的归一化常数:对分解式 π ( θ ) L ( x ∣ θ ) = π ( θ ∣ x ) m ( x ) \pi(\theta)L(x\mid\theta)=\pi(\theta\mid x)m(x) π ( θ ) L ( x ∣ θ ) = π ( θ ∣ x ) m ( x ) 两边关于 θ \theta θ 积分,左边由定义得 ∫ π ( θ ) L ( x ∣ θ ) d θ = m ( x ) \int \pi(\theta)L(x\mid\theta)\,d\theta=m(x) ∫ π ( θ ) L ( x ∣ θ ) d θ = m ( x ) ,右边由于 π ( ⋅ ∣ x ) \pi(\cdot\mid x) π ( ⋅ ∣ x ) 是概率密度而得 m ( x ) ∫ π ( θ ∣ x ) d θ = m ( x ) × 1 m(x)\int\pi(\theta\mid x)\,d\theta=m(x)\times1 m ( x ) ∫ π ( θ ∣ x ) d θ = m ( x ) × 1 。两边相符,确认了 m ( x ) m(x) m ( x ) 的一致性,且 π ( θ ∣ x ) \pi(\theta\mid x) π ( θ ∣ x ) 按密度要求积分为 1 1 1 。
大学 共轭先验:Beta-二项模型 定义: 共轭先验
如果后验分布仍停留在与先验相同的分布族中,只是参数被更新了,就称这个先验族对该似然是共轭 的。这把贝叶斯更新从一个积分(计算 m ( x ) m(x) m ( x ) )变成了对该族参数的简单算术——这正是在现代计算方法出现之前,共轭先验一直是贝叶斯统计主力工具的原因。
π ( θ ) = θ α − 1 ( 1 − θ ) β − 1 B ( α , β ) , 0 < θ < 1 \pi(\theta)=\dfrac{\theta^{\alpha-1}(1-\theta)^{\beta-1}}{B(\alpha,\beta)},\qquad 0<\theta<1 π ( θ ) = B ( α , β ) θ α − 1 ( 1 − θ ) β − 1 , 0 < θ < 1 若 θ ∼ B e t a ( α , β ) \theta\sim\mathrm{Beta}(\alpha,\beta) θ ∼ Beta ( α , β ) 为先验,且在给定 θ \theta θ 时,n n n 次独立试验中观测到 k k k 次成功(即 k ∣ θ ∼ B i n o m i a l ( n , θ ) k\mid\theta\sim\mathrm{Binomial}(n,\theta) k ∣ θ ∼ Binomial ( n , θ ) ),则后验为 θ ∣ k ∼ B e t a ( α + k , β + n − k ) \theta\mid k\sim\mathrm{Beta}(\alpha+k,\ \beta+n-k) θ ∣ k ∼ Beta ( α + k , β + n − k ) 。
为什么成立? 二项似然贡献因子 θ k ( 1 − θ ) n − k \theta^k(1-\theta)^{n-k} θ k ( 1 − θ ) n − k ,而 Beta 先验贡献 θ α − 1 ( 1 − θ ) β − 1 \theta^{\alpha-1}(1-\theta)^{\beta-1} θ α − 1 ( 1 − θ ) β − 1 ;把它们相乘只是把指数相加,恰好落在另一个 Beta 密度的形状上。
证明 在给定 θ \theta θ 时,n n n 次试验中观测到 k k k 次成功的似然为 L ( k ∣ θ ) = ( n k ) θ k ( 1 − θ ) n − k L(k\mid\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k} L ( k ∣ θ ) = ( k n ) θ k ( 1 − θ ) n − k 。由上面的后验比例定理,π ( θ ∣ k ) ∝ L ( k ∣ θ ) π ( θ ) = ( n k ) θ k ( 1 − θ ) n − k ⋅ θ α − 1 ( 1 − θ ) β − 1 B ( α , β ) \pi(\theta\mid k)\propto L(k\mid\theta)\pi(\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k}\cdot\dfrac{\theta^{\alpha-1}(1-\theta)^{\beta-1}}{B(\alpha,\beta)} π ( θ ∣ k ) ∝ L ( k ∣ θ ) π ( θ ) = ( k n ) θ k ( 1 − θ ) n − k ⋅ B ( α , β ) θ α − 1 ( 1 − θ ) β − 1 。
因子 ( n k ) \binom{n}{k} ( k n ) 与 B ( α , β ) B(\alpha,\beta) B ( α , β ) 不依赖于 θ \theta θ ,故可并入比例常数:π ( θ ∣ k ) ∝ θ k ( 1 − θ ) n − k ⋅ θ α − 1 ( 1 − θ ) β − 1 = θ ( α + k ) − 1 ( 1 − θ ) ( β + n − k ) − 1 \pi(\theta\mid k)\propto\theta^{k}(1-\theta)^{n-k}\cdot\theta^{\alpha-1}(1-\theta)^{\beta-1}=\theta^{(\alpha+k)-1}(1-\theta)^{(\beta+n-k)-1} π ( θ ∣ k ) ∝ θ k ( 1 − θ ) n − k ⋅ θ α − 1 ( 1 − θ ) β − 1 = θ ( α + k ) − 1 ( 1 − θ ) ( β + n − k ) − 1 。
这最后一个表达式恰好就是 B e t a ( α + k , β + n − k ) \mathrm{Beta}(\alpha+k,\beta+n-k) Beta ( α + k , β + n − k ) 密度的核(θ \theta θ 相关的部分)。由于在 ( 0 , 1 ) (0,1) ( 0 , 1 ) 上具有该核的概率密度只有唯一的归一化常数(根据 Beta 函数的定义,即 1 / B ( α + k , β + n − k ) 1/B(\alpha+k,\beta+n-k) 1/ B ( α + k , β + n − k ) ),后验必然恰好是 π ( θ ∣ k ) = θ ( α + k ) − 1 ( 1 − θ ) ( β + n − k ) − 1 B ( α + k , β + n − k ) \pi(\theta\mid k)=\dfrac{\theta^{(\alpha+k)-1}(1-\theta)^{(\beta+n-k)-1}}{B(\alpha+k,\beta+n-k)} π ( θ ∣ k ) = B ( α + k , β + n − k ) θ ( α + k ) − 1 ( 1 − θ ) ( β + n − k ) − 1 ,即 θ ∣ k ∼ B e t a ( α + k , β + n − k ) \theta\mid k\sim\mathrm{Beta}(\alpha+k,\beta+n-k) θ ∣ k ∼ Beta ( α + k , β + n − k ) 。
例题: 对网站点击率进行A/B测试
在进行实验之前,一位分析师为按钮的真实点击率 θ \theta θ 设置了一个弱信息先验 B e t a ( 2 , 2 ) \mathrm{Beta}(2,2) Beta ( 2 , 2 ) (以0.5为中心,但把握不大)。向 n = 20 n=20 n = 20 名访客展示该按钮后,有 k = 7 k=7 k = 7 人点击了它。求后验分布及其均值。
解答 由 Beta-二项共轭性,后验为 B e t a ( α + k , β + n − k ) = B e t a ( 2 + 7 , 2 + 13 ) = B e t a ( 9 , 15 ) \mathrm{Beta}(\alpha+k,\ \beta+n-k)=\mathrm{Beta}(2+7,\ 2+13)=\mathrm{Beta}(9,15) Beta ( α + k , β + n − k ) = Beta ( 2 + 7 , 2 + 13 ) = Beta ( 9 , 15 ) 。
B e t a ( a , b ) \mathrm{Beta}(a,b) Beta ( a , b ) 分布的均值为 a / ( a + b ) a/(a+b) a / ( a + b ) ,故后验均值为 9 / ( 9 + 15 ) = 9 / 24 = 0.375 9/(9+15)=9/24=0.375 9/ ( 9 + 15 ) = 9/24 = 0.375 :看到数据后,分析师对点击率的最佳点估计从先验均值 0.5 0.5 0.5 移动到了 0.375 0.375 0.375 ,同时被拉向——但并不等于——原始样本比例 7 / 20 = 0.35 7/20=0.35 7/20 = 0.35 ,因为先验仍然贡献了一部分权重。
大学 可信区间与置信区间 定义: 可信区间
θ \theta θ 的 ( 1 − α ) (1-\alpha) ( 1 − α ) 可信区间 是满足 ∫ L U π ( θ ∣ x ) d θ = 1 − α \int_L^U \pi(\theta\mid x)\,d\theta=1-\alpha ∫ L U π ( θ ∣ x ) d θ = 1 − α 的任意区间 [ L , U ] [L,U] [ L , U ] :它是关于 θ \theta θ 的一个直接概率陈述,是在数据 x x x 已被观测之后,由后验分布计算得到的。
这与频率学派的置信区间 是本质上不同的对象。置信区间是由一个程序构造出来的:若将其应用于许多假设的样本,它会以已知的比例捕捉到真实(固定)的 θ \theta θ ;一旦从手头的具体数据计算出一个具体区间,θ \theta θ 要么在其中,要么不在——再没有概率可言。而可信区间则把 θ \theta θ 本身当作具有分布的量,因此"θ \theta θ 落在 [ L , U ] [L,U] [ L , U ] 中的概率"始终是一个有意义的陈述。
可信区间与置信区间的比较 方面 贝叶斯可信区间 频率学派置信区间 什么是随机的 θ \theta θ 被当作随机的,具有后验分布;一旦观测到数据,区间就固定了θ \theta θ 是固定的未知常数;区间本身才是随机对象,随样本而变化解释 给定观测数据,θ \theta θ 落在该区间内的概率是 1 − α 1-\alpha 1 − α 在重复抽样中,按此方法构造的区间有 1 − α 1-\alpha 1 − α 的比例会包含真实的 θ \theta θ 是否依赖先验 是——先验 π ( θ ) \pi(\theta) π ( θ ) 直接进入后验 否——仅由似然与抽样分布计算得出
进阶 超越共轭:对后验进行采样 共轭先验很优雅,但大多数现实模型——参数众多、具有层次结构、似然非标准——都没有共轭形式,因此归一化常数 m ( x ) m(x) m ( x ) 没有闭式积分。马尔可夫链蒙特卡洛(MCMC) 方法完全绕过了这个积分:它们构造一条平稳分布恰好就是后验 π ( θ ∣ x ) \pi(\theta\mid x) π ( θ ∣ x ) 的马尔可夫链,然后模拟这条链,并用所得样本上的简单平均来近似任何后验量(均值、可信区间或其他任何量),而完全不需要计算 m ( x ) m(x) m ( x ) 。
常见错误. 可信区间与置信区间有时在数值上会很接近(例如具有平坦先验和大样本的 Beta 后验,就很像通常教科书中的置信区间),但这种数值上的巧合并不能使它们成为同一种陈述 。一个常见的错误是计算出其中一种,却随意用另一种的解释来描述它——说"θ \theta θ 落在这个置信区间内的概率是95%"是频率学派程序所不允许的范畴错误,这句话恰恰只对可信区间才成立。 历史注记
本页核心的规则可以追溯到托马斯·贝叶斯的论文《论机会学说中一个问题的解法》,该文由理查德·普赖斯于贝叶斯去世后的1763年发表。皮埃尔-西蒙·拉普拉斯不久后独立重新发现并大大扩展了同样的推理,并将其应用于从天文学到人口统计学的各类问题——安德雷·柯尔莫哥洛夫在1933年给出的概率公理化基础,后来把建立在其上的贝叶斯学派与频率学派都置于了同一个严格的基础之上。
大学 实际应用与典型例题 贝叶斯更新出现在任何需要根据带噪声的证据修正信念的场合:医生解读诊断检测结果、垃圾邮件过滤器对邮件分类、搜救队更新搜索地点、航天器导航系统融合传感器读数——所有这些都在运行某种版本的"后验 ∝ \propto ∝ 似然 × \times × 先验"。
例题: 为什么阳性检测结果不能证明患病
某种罕见疾病影响 1 % 1\% 1% 的人群(P ( D ) = 0.01 P(D)=0.01 P ( D ) = 0.01 )。某检测的灵敏度为 99 % 99\% 99% (P ( + ∣ D ) = 0.99 P(+\mid D)=0.99 P ( + ∣ D ) = 0.99 ),假阳性率为 5 % 5\% 5% (P ( + ∣ ¬ D ) = 0.05 P(+\mid \lnot D)=0.05 P ( + ∣ ¬ D ) = 0.05 )。随机抽取的一人检测呈阳性。求 P ( D ∣ + ) P(D\mid +) P ( D ∣ + ) 。
解答 由全概率公式,P ( + ) = P ( + ∣ D ) P ( D ) + P ( + ∣ ¬ D ) P ( ¬ D ) = 0.99 × 0.01 + 0.05 × 0.99 = 0.0099 + 0.0495 = 0.0594 P(+)=P(+\mid D)P(D)+P(+\mid\lnot D)P(\lnot D)=0.99\times0.01+0.05\times0.99=0.0099+0.0495=0.0594 P ( + ) = P ( + ∣ D ) P ( D ) + P ( + ∣ ¬ D ) P ( ¬ D ) = 0.99 × 0.01 + 0.05 × 0.99 = 0.0099 + 0.0495 = 0.0594 。
贝叶斯定理给出 P ( D ∣ + ) = P ( + ∣ D ) P ( D ) P ( + ) = 0.0099 0.0594 ≈ 0.167 P(D\mid +)=\dfrac{P(+\mid D)P(D)}{P(+)}=\dfrac{0.0099}{0.0594}\approx0.167 P ( D ∣ + ) = P ( + ) P ( + ∣ D ) P ( D ) = 0.0594 0.0099 ≈ 0.167 。
尽管这项检测看起来非常准确(灵敏度99%,假阳性率仅5%),阳性结果实际上仍只意味着约 16.7 % 16.7\% 16.7% 的患病概率——因为该疾病罕见,来自庞大健康人群的假阳性数量超过了来自极小患病人群的真阳性数量。这正是贝叶斯更新在起作用:较低的先验 P ( D ) = 0.01 P(D)=0.01 P ( D ) = 0.01 把后验拉得远低于检测本身的准确率数字。
例题: 从平坦先验到偏斜后验
为估计一枚硬币的偏差 θ \theta θ ,一位怀疑者从完全无信息的 B e t a ( 1 , 1 ) \mathrm{Beta}(1,1) Beta ( 1 , 1 ) 先验(在 ( 0 , 1 ) (0,1) ( 0 , 1 ) 上均匀分布)出发。抛掷该硬币10次,观察到8次正面后,求后验分布及其均值与众数。
解答 在 α = β = 1 \alpha=\beta=1 α = β = 1 、n = 10 n=10 n = 10 、k = 8 k=8 k = 8 的 Beta-二项共轭性下,后验为 B e t a ( 1 + 8 , 1 + 2 ) = B e t a ( 9 , 3 ) \mathrm{Beta}(1+8,\ 1+2)=\mathrm{Beta}(9,3) Beta ( 1 + 8 , 1 + 2 ) = Beta ( 9 , 3 ) 。
后验均值为 9 / ( 9 + 3 ) = 9 / 12 = 0.75 9/(9+3)=9/12=0.75 9/ ( 9 + 3 ) = 9/12 = 0.75 。当 a , b > 1 a,b>1 a , b > 1 时,B e t a ( a , b ) \mathrm{Beta}(a,b) Beta ( a , b ) 分布的众数为 ( a − 1 ) / ( a + b − 2 ) (a-1)/(a+b-2) ( a − 1 ) / ( a + b − 2 ) ,此处为 8 / 10 = 0.8 8/10=0.8 8/10 = 0.8 。
先验是一个平坦、对称、不偏向任何值的峰;后验则是一个明显不对称的峰,峰值接近 0.8 0.8 0.8 ,这正是本页顶部小部件示意的"峰从对称先验偏移"——10次抛掷中8次正面,即便样本量很小,也确实把信念拉向了一枚有偏的硬币。
研究前沿 截至 2026 年
共轭先验的算术只能解决实际贝叶斯模型中很窄的一部分。对于复杂模型(参数众多、具有层次结构、似然非共轭),现代实践依赖于马尔可夫链蒙特卡洛算法,例如哈密顿蒙特卡洛及其自调参变体No-U-Turn采样器,它们在Stan、PyMC、NumPyro等概率编程语言中实现,让使用者只需写出模型,后验采样交给软件处理。活跃的研究方向包括:将MCMC扩展到机器学习中常见的海量数据集(通过随机梯度和子采样变体,以部分精确性换取速度);在高维或多峰后验中诊断采样器尚未 收敛的情形,这一问题目前仍只被部分解决;以及诸如变分推断之类更快的近似替代方法,它把后验计算转化为一个优化问题,代价是其精度并不总是容易量化。
在 B e t a ( 2 , 3 ) \mathrm{Beta}(2,3) Beta ( 2 , 3 ) 先验下,观测到 n = 10 n=10 n = 10 次试验中 k = 4 k=4 k = 4 次成功后,后验分布是什么?
B e t a ( 6 , 9 ) \mathrm{Beta}(6,9) Beta ( 6 , 9 ) B e t a ( 4 , 10 ) \mathrm{Beta}(4,10) Beta ( 4 , 10 ) B e t a ( 2 , 3 ) \mathrm{Beta}(2,3) Beta ( 2 , 3 ) B e t a ( 6 , 3 ) \mathrm{Beta}(6,3) Beta ( 6 , 3 ) 在本页的医学检测例子中,阳性结果只给出约 16.7 % 16.7\% 16.7% 的患病后验概率,远低于该检测 99 % 99\% 99% 的灵敏度。这说明了什么?
较低的先验(疾病罕见)使后验远低于仅凭检测准确率所暗示的值——基础比率效应 该检测毫无用处 一旦观测到数据,先验信息就永远不再重要 灵敏度本身总能决定后验
下列哪种说法正确描述了 95 % 95\% 95% 贝叶斯可信区间,并与 95 % 95\% 95% 频率学派置信区间形成对比?
给定观测数据,θ \theta θ 落在该区间内的概率为 0.95 0.95 0.95 在 95 % 95\% 95% 的重复实验中会产生完全相同的数值区间 它不需要先验分布 在任何模型中它都与置信区间在数学上完全相同 对于 B e t a ( 9 , 3 ) \mathrm{Beta}(9,3) Beta ( 9 , 3 ) 后验,后验均值 E [ θ ] E[\theta] E [ θ ] 是多少?
0.75 0.75 0.75 0.8 0.8 0.8 0.9 0.9 0.9 0.6 0.6 0.6