MathLabs

Xác suất và Thống kê

Thống kê Bayes

Một hướng tiếp cận thống kê cập nhật niềm tin tiên nghiệm thành niềm tin hậu nghiệm khi có dữ liệu mới.

Trực giácCập nhật niềm tin khi có bằng chứng mới

Giả sử bạn được đưa một đồng xu và được hỏi: nó có cân đối không? Trước khi tung dù chỉ một lần, có thể bạn tin rằng nó gần như cân đối, nhưng chưa chắc chắn — gọi đây là niềm tin tiên nghiệm của bạn. Bây giờ bạn tung 10 lần và thấy 8 lần ngửa. Dữ liệu đó nên khiến niềm tin của bạn dịch chuyển về phía "có lẽ lệch về mặt ngửa", mà không vứt bỏ hoàn toàn điều bạn từng tin trước đó. Thống kê Bayes là bộ máy chính xác để kết hợp niềm tin tiên nghiệm với dữ liệu mới nhằm có được niềm tin đã cập nhật, gọi là niềm tin hậu nghiệm.

Một đỉnh cong xuống có đỉnh lệch sang phải so với tâm, minh họa sơ đồ một phân phối hậu nghiệm bị dữ liệu quan sát kéo ra khỏi tiên nghiệm đối xứng.
Cập nhật Bayes Beta–Binomial: sau khi quan sát k≈npk \approx np lần thành công trong nn phép thử, phân phối tiên nghiệm mờ màu xám Beta(2,2)\mathrm{Beta}(2,2) nhọn lại thành mật độ hậu nghiệm màu tím quanh pp.

Đại họcCập nhật Bayes: từ tiên nghiệm đến hậu nghiệm

Định nghĩa: Tiên nghiệm, hàm hợp lý, hậu nghiệm

Với tham số chưa biết θ\theta, phân phối tiên nghiệm π(θ)\pi(\theta) mã hóa niềm tin về θ\theta trước khi thấy dữ liệu xx. Hàm hợp lý L(x∣θ)L(x\mid\theta) cho biết dữ liệu quan sát được có khả năng xảy ra bao nhiêu ứng với mỗi giá trị của θ\theta. Định lý Bayes kết hợp chúng thành phân phối hậu nghiệm: π(θ∣x)∝L(x∣θ) π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\,\pi(\theta) — hậu nghiệm tỉ lệ với hàm hợp lý nhân tiên nghiệm.

π(θ∣x)∝L(x∣θ) π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\,\pi(\theta)

Ký hiệu tỉ lệ giấu đi một hằng số chuẩn hóa m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta' (gọi là hàm hợp lý biên hay bằng chứng), không phụ thuộc vào θ\theta và chỉ đơn giản thu nhỏ lại tích L(x∣θ)π(θ)L(x\mid\theta)\pi(\theta) sao cho π(θ∣x)\pi(\theta\mid x) tích phân bằng 11 trên toàn bộ θ\theta, giống hệt mọi mật độ xác suất khác.

π(θ∣x)=L(x∣θ)π(θ)∫L(x∣θ′)π(θ′) dθ′\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{\int L(x\mid\theta')\pi(\theta')\,d\theta'}

Nếu θ\theta có mật độ tiên nghiệm π(θ)\pi(\theta) và dữ liệu xx có hàm hợp lý L(x∣θ)L(x\mid\theta), thì mật độ hậu nghiệm của θ\theta cho trước xx là π(θ∣x)=L(x∣θ)π(θ)m(x)\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{m(x)}, với m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta'; tương đương π(θ∣x)∝L(x∣θ)π(θ)\pi(\theta\mid x)\propto L(x\mid\theta)\pi(\theta).

Vì sao đúng?

Đây không gì khác hơn định nghĩa mật độ điều kiện áp dụng cho θ\theta và xx đồng thời: hậu nghiệm là mật độ đồng thời của (θ,x)(\theta,x) chia cho mật độ biên của riêng xx, và mật độ đồng thời được phân tích thành tiên nghiệm nhân hàm hợp lý.

Chứng minh

Mật độ đồng thời của (θ,x)(\theta,x) phân tích theo hai cách: thành π(θ)L(x∣θ)\pi(\theta)L(x\mid\theta) (tiên nghiệm nhân hàm hợp lý, theo định nghĩa hàm hợp lý là mật độ điều kiện của xx cho trước θ\theta) và thành π(θ∣x)m(x)\pi(\theta\mid x)m(x) (hậu nghiệm nhân mật độ biên của xx, theo định nghĩa hậu nghiệm là mật độ điều kiện của θ\theta cho trước xx). Vì cả hai biểu thức đều bằng cùng một mật độ đồng thời, π(θ)L(x∣θ)=π(θ∣x)m(x)\pi(\theta)L(x\mid\theta)=\pi(\theta\mid x)m(x).

Giải ra π(θ∣x)\pi(\theta\mid x) cho π(θ∣x)=L(x∣θ)π(θ)m(x)\pi(\theta\mid x)=\dfrac{L(x\mid\theta)\pi(\theta)}{m(x)}, với điều kiện m(x)>0m(x)>0.

Còn lại cần kiểm tra m(x)=∫L(x∣θ′)π(θ′) dθ′m(x)=\int L(x\mid\theta')\pi(\theta')\,d\theta' đúng là hằng số chuẩn hóa: lấy tích phân cả hai vế của phân tích π(θ)L(x∣θ)=π(θ∣x)m(x)\pi(\theta)L(x\mid\theta)=\pi(\theta\mid x)m(x) theo θ\theta, vế trái trở thành ∫π(θ)L(x∣θ) dθ=m(x)\int \pi(\theta)L(x\mid\theta)\,d\theta=m(x) theo định nghĩa, và vế phải trở thành m(x)∫π(θ∣x) dθ=m(x)×1m(x)\int\pi(\theta\mid x)\,d\theta=m(x)\times1 vì π(⋅∣x)\pi(\cdot\mid x) là mật độ xác suất. Cả hai vế khớp nhau, xác nhận m(x)m(x) nhất quán và π(θ∣x)\pi(\theta\mid x) tích phân bằng 11 như yêu cầu của một mật độ.

Đại họcTiên nghiệm liên hợp: mô hình Beta-Nhị thức

Định nghĩa: Tiên nghiệm liên hợp

Một họ tiên nghiệm được gọi là liên hợp với một hàm hợp lý nếu hậu nghiệm vẫn ở trong cùng họ đó, chỉ với các tham số đã cập nhật. Điều này biến việc cập nhật Bayes từ một tích phân (tính m(x)m(x)) thành phép số học đơn giản trên các tham số của họ đó — lý do tiên nghiệm liên hợp là công cụ chủ lực của thống kê Bayes trước khi các phương pháp tính toán hiện đại ra đời.

π(θ)=θα−1(1−θ)β−1B(α,β),0<θ<1\pi(\theta)=\dfrac{\theta^{\alpha-1}(1-\theta)^{\beta-1}}{B(\alpha,\beta)},\qquad 0<\theta<1

Nếu θ∼Beta(α,β)\theta\sim\mathrm{Beta}(\alpha,\beta) là tiên nghiệm và, cho trước θ\theta, quan sát được kk thành công trong nn phép thử độc lập (nên k∣θ∼Binomial(n,θ)k\mid\theta\sim\mathrm{Binomial}(n,\theta)), thì hậu nghiệm là θ∣k∼Beta(α+k, β+n−k)\theta\mid k\sim\mathrm{Beta}(\alpha+k,\ \beta+n-k).

Vì sao đúng?

Hàm hợp lý Nhị thức đóng góp một thừa số θk(1−θ)n−k\theta^k(1-\theta)^{n-k}, còn tiên nghiệm Beta đóng góp θα−1(1−θ)β−1\theta^{\alpha-1}(1-\theta)^{\beta-1}; nhân hai cái này chỉ đơn giản là cộng các số mũ, rơi đúng vào hình dạng của một mật độ Beta khác.

Chứng minh

Hàm hợp lý quan sát kk thành công trong nn phép thử cho trước θ\theta là L(k∣θ)=(nk)θk(1−θ)n−kL(k\mid\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k}. Theo định lý tỉ lệ hậu nghiệm ở trên, π(θ∣k)∝L(k∣θ)π(θ)=(nk)θk(1−θ)n−k⋅θα−1(1−θ)β−1B(α,β)\pi(\theta\mid k)\propto L(k\mid\theta)\pi(\theta)=\binom{n}{k}\theta^k(1-\theta)^{n-k}\cdot\dfrac{\theta^{\alpha-1}(1-\theta)^{\beta-1}}{B(\alpha,\beta)}.

Các thừa số (nk)\binom{n}{k} và B(α,β)B(\alpha,\beta) không phụ thuộc θ\theta, nên có thể gộp vào hệ số tỉ lệ: π(θ∣k)∝θk(1−θ)n−k⋅θα−1(1−θ)β−1=θ(α+k)−1(1−θ)(β+n−k)−1\pi(\theta\mid k)\propto\theta^{k}(1-\theta)^{n-k}\cdot\theta^{\alpha-1}(1-\theta)^{\beta-1}=\theta^{(\alpha+k)-1}(1-\theta)^{(\beta+n-k)-1}.

Biểu thức cuối này chính là hạt nhân (phần phụ thuộc θ\theta) của mật độ Beta(α+k,β+n−k)\mathrm{Beta}(\alpha+k,\beta+n-k). Vì một mật độ xác suất trên (0,1)(0,1) với hạt nhân này có hằng số chuẩn hóa duy nhất (chính là 1/B(α+k,β+n−k)1/B(\alpha+k,\beta+n-k), theo định nghĩa hàm Beta), hậu nghiệm phải chính xác là π(θ∣k)=θ(α+k)−1(1−θ)(β+n−k)−1B(α+k,β+n−k)\pi(\theta\mid k)=\dfrac{\theta^{(\alpha+k)-1}(1-\theta)^{(\beta+n-k)-1}}{B(\alpha+k,\beta+n-k)}, tức θ∣k∼Beta(α+k,β+n−k)\theta\mid k\sim\mathrm{Beta}(\alpha+k,\beta+n-k).

Ví dụ: Kiểm thử A/B tỉ lệ nhấp chuột của một trang web

Trước khi chạy thử nghiệm, một nhà phân tích đặt tiên nghiệm Beta(2,2)\mathrm{Beta}(2,2) ít mang thông tin lên tỉ lệ nhấp chuột thật θ\theta của một nút bấm (tập trung ở 0.5, nhưng không quá chắc chắn). Sau khi hiển thị nút bấm cho n=20n=20 khách truy cập, k=7k=7 người nhấp vào. Tìm phân phối hậu nghiệm và giá trị kỳ vọng của nó.

Lời giải

Theo tính liên hợp Beta-Nhị thức, hậu nghiệm là Beta(α+k, β+n−k)=Beta(2+7, 2+13)=Beta(9,15)\mathrm{Beta}(\alpha+k,\ \beta+n-k)=\mathrm{Beta}(2+7,\ 2+13)=\mathrm{Beta}(9,15).

Giá trị kỳ vọng của phân phối Beta(a,b)\mathrm{Beta}(a,b) là a/(a+b)a/(a+b), nên kỳ vọng hậu nghiệm là 9/(9+15)=9/24=0.3759/(9+15)=9/24=0.375: sau khi thấy dữ liệu, ước lượng điểm tốt nhất của nhà phân tích cho tỉ lệ nhấp chuột dịch từ kỳ vọng tiên nghiệm 0.50.5 xuống 0.3750.375, trong khi vẫn bị kéo về phía — chứ không bằng — tỉ lệ mẫu thô 7/20=0.357/20=0.35, vì tiên nghiệm vẫn đóng góp một phần trọng số.

Đại họcKhoảng tin cậy Bayes so với khoảng tin cậy tần suất

Định nghĩa: Khoảng tin cậy Bayes

Một khoảng tin cậy Bayes mức (1−α)(1-\alpha) cho θ\theta là bất kỳ khoảng [L,U][L,U] nào với ∫LUπ(θ∣x) dθ=1−α\int_L^U \pi(\theta\mid x)\,d\theta=1-\alpha: đây là một phát biểu xác suất trực tiếp về θ\theta, được tính từ hậu nghiệm sau khi dữ liệu xx đã được quan sát.

Đây thực sự là một đối tượng khác với khoảng tin cậy kiểu tần suất. Khoảng tin cậy tần suất được xây từ một quy trình mà, khi áp dụng cho nhiều mẫu giả định, sẽ bắt được θ\theta thật (cố định) một tỉ lệ đã biết số lần; một khi một khoảng cụ thể được tính từ dữ liệu cụ thể đang có, θ\theta hoặc nằm trong đó hoặc không — không còn xác suất nào để nói tới nữa. Ngược lại khoảng tin cậy Bayes coi chính θ\theta có một phân phối, nên "xác suất θ\theta nằm trong [L,U][L,U]" luôn là một phát biểu có ý nghĩa.

Khoảng tin cậy Bayes so với khoảng tin cậy tần suất
Khía cạnhKhoảng tin cậy BayesKhoảng tin cậy tần suất
Cái gì ngẫu nhiênθ\theta được coi là ngẫu nhiên, có phân phối hậu nghiệm; khoảng thì cố định một khi dữ liệu đã quan sátθ\theta là hằng số chưa biết cố định; chính khoảng mới là đối tượng ngẫu nhiên, thay đổi theo từng mẫu
Cách diễn giảiCho trước dữ liệu quan sát, xác suất θ\theta nằm trong khoảng là 1−α1-\alphaQua lấy mẫu lặp lại, tỉ lệ 1−α1-\alpha các khoảng xây theo cách này sẽ chứa θ\theta thật
Có phụ thuộc tiên nghiệm khôngCó — tiên nghiệm π(θ)\pi(\theta) đi trực tiếp vào hậu nghiệmKhông — chỉ tính từ hàm hợp lý và phân phối mẫu

Nâng caoNgoài liên hợp: lấy mẫu hậu nghiệm

Tiên nghiệm liên hợp thanh lịch, nhưng hầu hết mô hình thực tế — nhiều tham số, cấu trúc phân cấp, hàm hợp lý không chuẩn — không có dạng liên hợp, nên hằng số chuẩn hóa m(x)m(x) không có tích phân dạng đóng. Các phương pháp chuỗi Markov Monte Carlo (MCMC) né hoàn toàn tích phân đó: chúng xây một chuỗi Markov có phân phối dừng chính xác bằng hậu nghiệm π(θ∣x)\pi(\theta\mid x), rồi mô phỏng chuỗi đó và dùng các mẫu thu được để xấp xỉ bất kỳ đại lượng hậu nghiệm nào (kỳ vọng, khoảng tin cậy, hay bất cứ gì khác) bằng các trung bình đơn giản trên các mẫu, mà không bao giờ phải tính m(x)m(x).

Đại họcỨng dụng thực tiễn và ví dụ minh họa

Cập nhật Bayes xuất hiện ở bất cứ đâu một niềm tin cần được điều chỉnh trước bằng chứng có nhiễu: bác sĩ diễn giải một xét nghiệm chẩn đoán, bộ lọc thư rác phân loại một email, đội tìm kiếm cứu nạn cập nhật nơi cần tìm, và hệ thống dẫn đường tàu vũ trụ hợp nhất các số liệu cảm biến — tất cả đều chạy một phiên bản nào đó của "hậu nghiệm ∝\propto hàm hợp lý ×\times tiên nghiệm".

Ví dụ: Vì sao xét nghiệm dương tính không phải là bằng chứng mắc bệnh

Một bệnh hiếm gặp ảnh hưởng đến 1%1\% dân số (P(D)=0.01P(D)=0.01). Một xét nghiệm có độ nhạy 99%99\% (P(+∣D)=0.99P(+\mid D)=0.99) và tỉ lệ dương tính giả 5%5\% (P(+∣¬D)=0.05P(+\mid \lnot D)=0.05). Một người ngẫu nhiên có kết quả dương tính. Tìm P(D∣+)P(D\mid +).

Lời giải

Theo công thức xác suất toàn phần, P(+)=P(+∣D)P(D)+P(+∣¬D)P(¬D)=0.99×0.01+0.05×0.99=0.0099+0.0495=0.0594P(+)=P(+\mid D)P(D)+P(+\mid\lnot D)P(\lnot D)=0.99\times0.01+0.05\times0.99=0.0099+0.0495=0.0594.

Định lý Bayes khi đó cho P(D∣+)=P(+∣D)P(D)P(+)=0.00990.0594≈0.167P(D\mid +)=\dfrac{P(+\mid D)P(D)}{P(+)}=\dfrac{0.0099}{0.0594}\approx0.167.

Dù xét nghiệm trông rất chính xác (độ nhạy 99%, chỉ 5% dương tính giả), kết quả dương tính vẫn chỉ có nghĩa khoảng 16.7%16.7\% khả năng thực sự mắc bệnh — vì bệnh hiếm, số dương tính giả từ nhóm dân số khỏe mạnh đông đảo vượt số dương tính thật từ nhóm dân số mắc bệnh nhỏ bé. Đây chính là cập nhật Bayes đang hoạt động: tiên nghiệm thấp P(D)=0.01P(D)=0.01 kéo hậu nghiệm xuống thấp hơn nhiều so với các con số chính xác của bản thân xét nghiệm.

Ví dụ: Từ tiên nghiệm phẳng đến hậu nghiệm lệch

Để ước lượng độ lệch θ\theta của một đồng xu, một người hoài nghi bắt đầu với tiên nghiệm Beta(1,1)\mathrm{Beta}(1,1) hoàn toàn không mang thông tin (đều trên (0,1)(0,1)). Sau khi tung đồng xu 10 lần và thấy 8 lần ngửa, tìm phân phối hậu nghiệm, kỳ vọng và mốt của nó.

Lời giải

Theo tính liên hợp Beta-Nhị thức với α=β=1\alpha=\beta=1, n=10n=10, k=8k=8: hậu nghiệm là Beta(1+8, 1+2)=Beta(9,3)\mathrm{Beta}(1+8,\ 1+2)=\mathrm{Beta}(9,3).

Kỳ vọng hậu nghiệm là 9/(9+3)=9/12=0.759/(9+3)=9/12=0.75. Mốt của phân phối Beta(a,b)\mathrm{Beta}(a,b) với a,b>1a,b>1 là (a−1)/(a+b−2)(a-1)/(a+b-2), cho 8/10=0.88/10=0.8 ở đây.

Tiên nghiệm là một đỉnh phẳng, đối xứng, không thiên về giá trị nào; hậu nghiệm là một đỉnh lệch rõ rệt, đạt đỉnh gần 0.80.8, đúng là "đỉnh dịch chuyển khỏi tiên nghiệm đối xứng" mà widget ở đầu trang này minh họa sơ đồ — 8 lần ngửa trên 10 lần tung đã thực sự kéo niềm tin về phía đồng xu lệch, dù cỡ mẫu còn nhỏ.

Với tiên nghiệm Beta(2,3)\mathrm{Beta}(2,3), sau khi quan sát k=4k=4 thành công trong n=10n=10 phép thử, phân phối hậu nghiệm là gì?

Trong ví dụ xét nghiệm y tế trên trang này, kết quả dương tính chỉ cho khoảng 16.7%16.7\% khả năng mắc bệnh hậu nghiệm, thấp hơn nhiều so với độ nhạy 99%99\% của xét nghiệm. Điều này minh họa gì?

Phát biểu nào mô tả đúng một khoảng tin cậy Bayes 95%95\%, đối lập với một khoảng tin cậy tần suất 95%95\%?

Với một hậu nghiệm Beta(9,3)\mathrm{Beta}(9,3), kỳ vọng hậu nghiệm E[θ]E[\theta] là bao nhiêu?

Tài liệu tham khảo

  1. Andrew Gelman, John B. Carlin, Hal S. Stern, David B. Dunson, Aki Vehtari, Donald B. Rubin (2013). Bayesian Data Analysis (3rd ed.)
  2. Matthew D. Hoffman, Andrew Gelman (2014). The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo · arXiv:1111.4246