MathLabs

Xác suất và Thống kê

Luật số lớn và định lý giới hạn trung tâm

Vì sao trung bình của các biến ngẫu nhiên độc lập ổn định dần, và vì sao — sau khi chuẩn hóa — chúng trông giống đường cong hình chuông: bất đẳng thức Chebyshev, luật số lớn yếu và mạnh, và định lý giới hạn trung tâm.

Trực giácVì sao trung bình ổn định dần

Tung một đồng xu cân đối một lần thì không ai đoán trước được là mặt sấp hay ngửa. Tung 10.000 lần thì tỉ lệ mặt ngửa gần như chắc chắn gần 0,5, dù mỗi lần tung riêng lẻ vẫn không đoán trước được. Sự ngẫu nhiên không biến mất — nó bị pha loãng: từng kết quả riêng lẻ vẫn ngẫu nhiên, nhưng trung bình của chúng ngày càng dễ đoán hơn khi ta thu thập thêm nhiều lần.

Một mặt 3D hình chuông, đạt đỉnh ở tâm và giảm dần đều về 0 theo mọi hướng, là đồ thị của z = e^(-r^2) với r là khoảng cách tới tâm.
Mặt Gauss hai biến z=e−r2z = e^{-r^2}: hình dạng chuông sẽ xuất hiện khi cộng nhiều đóng góp ngẫu nhiên độc lập — đó là định lý giới hạn trung tâm, được nói tới ở phần sau của trang này.

Đại họcBất đẳng thức Chebyshev: biến ngẫu nhiên có thể lệch xa đến đâu?

Định nghĩa: Bất đẳng thức Chebyshev

Với một biến ngẫu nhiên XX có kỳ vọng hữu hạn μ\mu và phương sai σ2\sigma^2, bất đẳng thức Chebyshev chặn lượng xác suất có thể nằm xa kỳ vọng, chỉ dùng σ2\sigma^2 — không cần giả thiết gì về hình dạng phân phối của XX.

P(∣X−μ∣≥k)≤σ2k2,k>0P(|X-\mu|\ge k)\le \frac{\sigma^2}{k^2}, \qquad k>0

Với biến ngẫu nhiên XX có kỳ vọng hữu hạn μ\mu và phương sai σ2\sigma^2, và mọi k>0k>0: P(∣X−μ∣≥k)≤σ2k2P(|X-\mu|\ge k)\le \dfrac{\sigma^2}{k^2}.

Vì sao đúng?

Áp dụng bất đẳng thức Markov cho biến ngẫu nhiên không âm (X−μ)2(X-\mu)^2 ta được P((X−μ)2≥k2)≤E[(X−μ)2]/k2=σ2/k2P((X-\mu)^2 \ge k^2) \le E[(X-\mu)^2]/k^2 = \sigma^2/k^2; biến cố (X−μ)2≥k2(X-\mu)^2 \ge k^2 chính là ∣X−μ∣≥k|X-\mu| \ge k.

Chứng minh

Trước hết ta chứng minh bất đẳng thức Markov: với biến ngẫu nhiên không âm Y≥0Y\ge0 và mọi a>0a>0, chặn theo chỉ báo Y≥a⋅1{Y≥a}Y\ge a\cdot\mathbb{1}_{\{Y\ge a\}} đúng tại mọi điểm, vì trên biến cố {Y≥a}\{Y\ge a\} vế phải bằng a≤Ya\le Y, còn nơi khác vế phải là 0≤Y0\le Y. Lấy kỳ vọng cả hai vế vẫn giữ nguyên bất đẳng thức: E[Y]≥aP(Y≥a)E[Y]\ge aP(Y\ge a), suy ra P(Y≥a)≤E[Y]/aP(Y\ge a)\le E[Y]/a.

Bây giờ áp dụng bất đẳng thức Markov cho biến ngẫu nhiên không âm Y=(X−μ)2Y=(X-\mu)^2 với ngưỡng a=k2a=k^2: P((X−μ)2≥k2)≤E[(X−μ)2]/k2P((X-\mu)^2\ge k^2)\le E[(X-\mu)^2]/k^2. Theo định nghĩa phương sai, E[(X−μ)2]=σ2E[(X-\mu)^2]=\sigma^2, nên vế phải chính bằng σ2/k2\sigma^2/k^2.

Cuối cùng, hai biến cố ở hai vế của bất đẳng thức Markov trùng nhau: (X−μ)2≥k2  ⟺  ∣X−μ∣≥k(X-\mu)^2\ge k^2 \iff |X-\mu|\ge k (cả hai vế đều không âm nên bình phương giữ nguyên thứ tự). Thay vào ta được P(∣X−μ∣≥k)≤σ2/k2P(|X-\mu|\ge k)\le\sigma^2/k^2, chính là bất đẳng thức Chebyshev.

Ví dụ: Một chặn nhanh

Biến ngẫu nhiên XX có kỳ vọng μ=10\mu = 10 và phương sai σ2=4\sigma^2 = 4. Chặn P(∣X−10∣≥4)P(|X - 10| \ge 4).

Lời giải

P(∣X−10∣≥4)≤σ2/42=4/16=0.25P(|X-10|\ge 4) \le \sigma^2/4^2 = 4/16 = 0.25: dù phân phối của XX có hình dạng gì, xác suất lệch từ 4 trở lên so với kỳ vọng không quá 25%.

Ví dụ: Ước lượng π bằng Monte Carlo

Để ước lượng π\pi, máy tính lấy mẫu nn điểm độc lập (Ui,Vi)(U_i,V_i) phân phối đều trên hình vuông [−1,1]2[-1,1]^2 và đếm tỉ lệ điểm rơi vào trong hình tròn đơn vị. Vì sao điều này hội tụ về π\pi, và cần khoảng bao nhiêu mẫu nn (dùng bất đẳng thức Chebyshev) để ước lượng lệch không quá 0.010.01 so với π\pi với xác suất ít nhất 0.990.99?

Lời giải

Đặt Yi=1{Ui2+Vi2≤1}Y_i=\mathbb{1}_{\{U_i^2+V_i^2\le1\}} để chỉ báo điểm thứ ii rơi vào trong hình tròn đơn vị. Vì điểm phân phối đều trên hình vuông diện tích 44 và hình tròn có diện tích π\pi, nên E[Yi]=π/4E[Y_i]=\pi/4. Định nghĩa ước lượng π^n=4n∑i=1nYi\hat\pi_n=\frac{4}{n}\sum_{i=1}^nY_i, do đó E[π^n]=πE[\hat\pi_n]=\pi.

Theo luật số lớn yếu đã chứng minh ở trên, 1n∑i=1nYi→π/4\frac1n\sum_{i=1}^nY_i\to\pi/4 theo xác suất, nên π^n→π\hat\pi_n\to\pi theo xác suất: đây chính là lý do mô phỏng Monte Carlo hoạt động — lấy trung bình các mẫu ngẫu nhiên độc lập hội tụ về giá trị kỳ vọng thật.

Với một cỡ mẫu cụ thể, Var(Yi)=π4(1−π4)≈0.168\mathrm{Var}(Y_i)=\frac{\pi}{4}\left(1-\frac{\pi}{4}\right)\approx0.168 (phương sai Bernoulli), nên Var(π^n)=16 Var(Yi)/n\mathrm{Var}(\hat\pi_n)=16\,\mathrm{Var}(Y_i)/n. Bất đẳng thức Chebyshev cho P(∣π^n−π∣≥0.01)≤16×0.168n×0.0001P(|\hat\pi_n-\pi|\ge0.01)\le\frac{16\times0.168}{n\times0.0001}; yêu cầu vế này không quá 0.010.01 buộc n≥2.7×106n\ge2.7\times10^{6} — hàng triệu mẫu để đạt độ chính xác hai chữ số thập phân, đó là lý do các phương pháp Monte Carlo trong thực tế ưa dùng các biến thể rẻ hơn, giảm phương sai tốt hơn, nhưng chính luật số lớn mới là thứ đảm bảo sự hội tụ.

Ví dụ: Gộp rủi ro trong danh mục bảo hiểm

Khoản bồi thường hàng năm của mỗi người tham gia bảo hiểm XiX_i có kỳ vọng μ=500\mu=500 và độ lệch chuẩn σ=2000\sigma=2000 (đơn vị đô la Mỹ; bồi thường hiếm nhưng lớn), và các khoản bồi thường của n=10000n=10000 người tham gia trong một quỹ được coi là độc lập cùng phân phối. Dùng định lý giới hạn trung tâm, ước lượng mức phí bảo hiểm mỗi người sao cho trung bình bồi thường của quỹ vượt quá mức đó với xác suất khoảng không quá 0.00130.0013.

Lời giải

Đặt Xˉn\bar X_n là trung bình bồi thường trên toàn quỹ. Theo luật số lớn yếu, Xˉn→μ=500\bar X_n\to\mu=500 khi quỹ lớn dần, nên việc gộp nhiều người tham gia độc lập khiến trung bình bồi thường có thể dự đoán được dù mỗi khoản bồi thường riêng lẻ XiX_i rất biến động — đây chính là toàn bộ logic kinh tế của bảo hiểm.

Theo định lý giới hạn trung tâm đã chứng minh ở trên, Xˉn\bar X_n xấp xỉ phân phối chuẩn với kỳ vọng μ\mu và phương sai Var(Xˉn)=σ2/n=40\mathrm{Var}(\bar X_n)=\sigma^2/n=40 với n=10000n=10000, cho độ lệch chuẩn sd(Xˉn)=40≈6.32\mathrm{sd}(\bar X_n)=\sqrt{40}\approx6.32 đô la — nhỏ hơn rất nhiều so với độ biến động 20002000 đô la của một khoản bồi thường đơn lẻ.

Với phân phối chuẩn, P(Xˉn>μ+3 sd(Xˉn))≈P(Z>3)≈0.0013P(\bar X_n>\mu+3\,\mathrm{sd}(\bar X_n))\approx P(Z>3)\approx0.0013 với ZZ là phân phối chuẩn tắc. Vậy đặt mức phí ở μ+3 sd(Xˉn)≈519\mu+3\,\mathrm{sd}(\bar X_n)\approx519 đô la mỗi người giữ xác suất trung bình bồi thường của quỹ vượt mức phí ở khoảng 0.13%0.13\% — định lý giới hạn trung tâm chính là thứ cho phép công ty bảo hiểm biến rủi ro cá nhân cực kỳ khó đoán thành rủi ro tổng hợp hẹp, định giá được.

Đại họcLuật số lớn yếu

Định nghĩa: Hội tụ theo xác suất

Một dãy biến ngẫu nhiên YnY_n hội tụ theo xác suất về hằng số cc nếu với mọi ε>0\varepsilon > 0, P(∣Yn−c∣>ε)→0P(|Y_n - c| > \varepsilon) \to 0 khi n→∞n \to \infty: khả năng lệch lớn co dần về 0, dù với một nn cố định nào đó, lệch lớn vẫn có thể xảy ra.

Cho X1,X2,…X_1, X_2, \dots là các biến ngẫu nhiên độc lập cùng phân phối, có kỳ vọng hữu hạn μ\mu. Khi đó trung bình mẫu Xˉn=1n∑i=1nXi\bar X_n = \frac{1}{n}\sum_{i=1}^n X_i hội tụ theo xác suất về μ\mu khi n→∞n \to \infty.

Vì sao đúng?

Var(Xˉn)=σ2/n→0\mathrm{Var}(\bar X_n) = \sigma^2/n \to 0 (khi σ2\sigma^2 hữu hạn), nên bất đẳng thức Chebyshev cho P(∣Xˉn−μ∣≥ε)≤σ2/(nε2)→0P(|\bar X_n - \mu| \ge \varepsilon) \le \sigma^2/(n\varepsilon^2) \to 0. (Định lý đầy đủ chỉ cần kỳ vọng hữu hạn, bằng một lập luận cắt cụt tinh tế hơn, nhưng chứng minh qua Chebyshev là trường hợp riêng dễ hình dung nhất.)

Chứng minh

Cho Xˉn=1n∑i=1nXi\bar X_n=\frac1n\sum_{i=1}^nX_i là trung bình mẫu của nn bản sao độc lập cùng phân phối của XX có kỳ vọng μ\mu và, để dùng chứng minh qua Chebyshev, phương sai hữu hạn σ2\sigma^2. Tính tuyến tính của kỳ vọng cho E[Xˉn]=μE[\bar X_n]=\mu.

Tính độc lập khiến các phương sai cộng được: Var(Xˉn)=1n2∑i=1nVar(Xi)=σ2n\mathrm{Var}(\bar X_n)=\frac1{n^2}\sum_{i=1}^n\mathrm{Var}(X_i)=\frac{\sigma^2}{n}, vì mỗi XiX_i đóng góp Var(Xi)=σ2\mathrm{Var}(X_i)=\sigma^2 và các số hạng chéo Cov(Xi,Xj)\mathrm{Cov}(X_i,X_j) với i≠ji\ne j triệt tiêu do tính độc lập.

Cố định bất kỳ ε>0\varepsilon>0 và áp dụng bất đẳng thức Chebyshev đã chứng minh ở trên cho Xˉn\bar X_n: P(∣Xˉn−μ∣≥ε)≤Var(Xˉn)ε2=σ2nε2P(|\bar X_n-\mu|\ge\varepsilon)\le\frac{\mathrm{Var}(\bar X_n)}{\varepsilon^2}=\frac{\sigma^2}{n\varepsilon^2}.

Khi n→∞n\to\infty, vế phải σ2/(nε2)→0\sigma^2/(n\varepsilon^2)\to0 với mọi ε>0\varepsilon>0 cố định, đây chính là định nghĩa hội tụ theo xác suất. Vậy Xˉn→μ\bar X_n\to\mu theo xác suất.

Một dạng của kết quả này lần đầu được Jacob Bernoulli chứng minh, công bố sau khi ông mất vào năm 1713 trong Ars Conjectandi — dạng sớm nhất của luật số lớn, cho tỉ lệ thành công trong các phép thử lặp lại kiểu tung đồng xu.

Nâng caoLuật số lớn mạnh

Định nghĩa: Hội tụ hầu chắc chắn

Một dãy YnY_n hội tụ hầu chắc chắn về cc nếu P(lim⁡n→∞Yn=c)=1P(\lim_{n\to\infty} Y_n = c) = 1: cả dãy thực sự ổn định tại cc với hầu hết mọi kết cục, mạnh hơn hội tụ theo xác suất (chỉ kiểm soát từng nn riêng lẻ).

Cho X1,X2,…X_1, X_2, \dots là các biến ngẫu nhiên độc lập cùng phân phối, có kỳ vọng hữu hạn μ\mu. Khi đó Xˉn→μ\bar X_n \to \mu hầu chắc chắn khi n→∞n \to \infty.

Vì sao đúng?

Chứng minh kinh điển (Kolmogorov, 1933) dùng bất đẳng thức Kolmogorov — một dạng mạnh hơn của Chebyshev, kiểm soát toàn bộ quỹ đạo của các tổng riêng cùng lúc — cùng với lập luận trên dãy con; tinh vi hơn nhiều so với chứng minh một dòng bằng Chebyshev cho luật yếu.

Chứng minh

Ta phác thảo chứng minh với giả thiết thêm (thường gặp trong giáo trình) rằng XX có mô-men bậc bốn hữu hạn E[X4]<∞E[X^4]<\infty; phát biểu tổng quát chỉ cần kỳ vọng hữu hạn nhưng cần lập luận cắt cụt tinh tế hơn (Kolmogorov, 1933). Sau khi căn giữa, giả sử E[X]=0E[X]=0 (thay XiX_i bởi Xi−μX_i-\mu trong toàn bộ), và đặt Sn=∑i=1nXiS_n=\sum_{i=1}^nX_i.

Khai triển E[Sn4]=∑i,j,k,lE[XiXjXkXl]E[S_n^4]=\sum_{i,j,k,l}E[X_iX_jX_kX_l] trên toàn bộ n4n^4 bộ chỉ số. Tính độc lập và E[X]=0E[X]=0 triệt tiêu mọi số hạng có một chỉ số xuất hiện đúng một lần (thừa số đó có kỳ vọng bằng 00), chỉ còn lại nn số hạng có cả bốn chỉ số bằng nhau và 3n(n−1)3n(n-1) số hạng ghép thành hai cặp chỉ số bằng nhau khác nhau. Điều này cho E[Sn4]=nE[X4]+3n(n−1)σ4≤Cn2E[S_n^4]=nE[X^4]+3n(n-1)\sigma^4\le Cn^2 với hằng số CC chỉ phụ thuộc E[X4]E[X^4] và σ2\sigma^2.

Chia cho n4n^4: E[(Snn)4]≤Cn2E\left[\left(\frac{S_n}{n}\right)^4\right]\le\frac{C}{n^2}. Lấy tổng theo nn, ∑n=1∞E[(Snn)4]≤∑n=1∞Cn2<∞\sum_{n=1}^\infty E\left[\left(\frac{S_n}{n}\right)^4\right]\le\sum_{n=1}^\infty\frac{C}{n^2}<\infty vì ∑1/n2\sum 1/n^2 hội tụ.

Một tổng các biến ngẫu nhiên không âm với tổng kỳ vọng hữu hạn thì bản thân nó phải hữu hạn hầu chắc chắn (hội tụ đơn điệu), nên ∑n=1∞(Snn)4<∞\sum_{n=1}^\infty\left(\frac{S_n}{n}\right)^4<\infty hầu chắc chắn, điều này buộc từng số hạng phải tiến về 0: (Snn)4→0\left(\frac{S_n}{n}\right)^4\to0, tức Snn→0\frac{S_n}{n}\to0 hầu chắc chắn. Đảo ngược phép căn giữa cho Xˉn→μ\bar X_n\to\mu hầu chắc chắn, chính là luật số lớn mạnh.

Nâng caoĐịnh lý giới hạn trung tâm

Xˉn−μσ/n →d N(0,1)as n→∞\frac{\bar X_n - \mu}{\sigma/\sqrt{n}} \ \xrightarrow{d}\ N(0,1) \quad \text{as } n \to \infty

Cho X1,…,XnX_1, \dots, X_n độc lập cùng phân phối, có kỳ vọng μ\mu và phương sai hữu hạn σ2>0\sigma^2 > 0. Khi n→∞n \to \infty, trung bình mẫu đã chuẩn hóa Xˉn−μσ/n\dfrac{\bar X_n - \mu}{\sigma/\sqrt{n}} hội tụ theo phân phối về phân phối chuẩn tắc N(0,1)N(0,1) — bất kể hình dạng phân phối gốc của XiX_i.

Vì sao đúng?

Về mặt trực giác, hàm sinh mô-men (hoặc hàm đặc trưng) của tổng đã chuẩn hóa hội tụ từng số hạng về hàm của N(0,1)N(0,1) qua khai triển Taylor, vì chỉ kỳ vọng và phương sai còn sống sót sau khi chuẩn hóa — mọi mô-men bậc cao hơn bị 'rửa trôi' khi n→∞n \to \infty. Đó là lý do vì sao cùng một hình chuông xuất hiện dù phân phối gốc của XiX_i trông ra sao.

Chứng minh

Với biến ngẫu nhiên ZZ, hàm đặc trưng của nó là φZ(t)=E[eitZ]\varphi_Z(t)=E[e^{itZ}]. Chuẩn hóa mỗi XiX_i bằng cách đặt Zi=Xi−μσZ_i=\frac{X_i-\mu}{\sigma}, để E[Zi]=0, E[Zi2]=1E[Z_i]=0,\ E[Z_i^2]=1, và trung bình mẫu đã chuẩn hóa trở thành tổng của các biến này: Tn=1n∑i=1nZi=Xˉn−μσ/nT_n=\frac{1}{\sqrt n}\sum_{i=1}^nZ_i=\frac{\bar X_n-\mu}{\sigma/\sqrt n}.

Vì các ZiZ_i độc lập cùng phân phối, hàm đặc trưng của một tổng bằng tích các hàm đặc trưng: φTn(t)=[φZ ⁣(tn)]n\varphi_{T_n}(t)=\left[\varphi_Z\!\left(\frac{t}{\sqrt n}\right)\right]^n.

Vì E[Z]=0E[Z]=0 và E[Z2]=1E[Z^2]=1, khai triển Taylor của φZ\varphi_Z gần 00 cho φZ(s)=1−s22+o(s2)\varphi_Z(s)=1-\frac{s^2}{2}+o(s^2). Thay s=t/ns=t/\sqrt n: φZ ⁣(tn)=1−t22n+o ⁣(1n)\varphi_Z\!\left(\frac{t}{\sqrt n}\right)=1-\frac{t^2}{2n}+o\!\left(\frac1n\right).

Nâng lên lũy thừa nn và dùng giới hạn quen thuộc (1+cn+o(1/n))n→ec\left(1+\frac{c}{n}+o(1/n)\right)^n\to e^{c}: φTn(t)=[1−t22n+o ⁣(1n)]n→e−t2/2\varphi_{T_n}(t)=\left[1-\frac{t^2}{2n}+o\!\left(\frac1n\right)\right]^n\to e^{-t^2/2}. Vì e−t2/2e^{-t^2/2} chính là hàm đặc trưng của phân phối chuẩn tắc N(0,1)N(0,1), định lý liên tục Lévy chuyển hội tụ điểm của hàm đặc trưng này thành hội tụ theo phân phối: Tn→dN(0,1)T_n\xrightarrow{d}N(0,1).

Ba định lý, ba câu hỏi về Xˉn\bar X_n
Kết quảCâu hỏi trả lờiLoại phát biểu
Bất đẳng thức ChebyshevXX có thể lệch bao xa so với μ\mu?Chặn với mẫu hữu hạn, mọi phân phối
Luật số lớn yếuXˉn\bar X_n có tiến về μ\mu không?Hội tụ theo xác suất
Luật số lớn mạnhCả dãy Xˉn\bar X_n có ổn định tại μ\mu không?Hội tụ hầu chắc chắn
Định lý giới hạn trung tâmĐộ dao động của Xˉn\bar X_n có hình dạng gì?Hội tụ theo phân phối, về N(0,1)N(0,1)

Các kết quả hội tụ này là động cơ đứng sau thống kê: ước lượng hỏi làm sao biến trung bình mẫu thành khoảng tin cậy cho μ\mu, còn kiểm định giả thuyết hỏi làm sao dùng cùng phép xấp xỉ chuẩn để quyết định giữa các giả thuyết cạnh tranh về một tổng thể.

Luật số lớn yếu nói rằng khi n→∞n \to \infty, trung bình mẫu Xˉn\bar X_n của các biến ngẫu nhiên độc lập cùng phân phối với kỳ vọng μ\mu

Bất đẳng thức Chebyshev P(∣X−μ∣≥k)≤σ2/k2P(|X-\mu|\ge k) \le \sigma^2/k^2 cần giả thiết gì về phân phối của XX?

Theo định lý giới hạn trung tâm, phân phối của trung bình mẫu đã chuẩn hóa (Xˉn−μ)/(σ/n)(\bar X_n - \mu)/(\sigma/\sqrt{n}) tiến gần tới, khi n→∞n \to \infty,

Sau 10 lần liên tiếp ra mặt ngửa với một đồng xu cân đối, luật số lớn cho biết rằng

Tài liệu tham khảo

  1. Sheldon Ross (2019). A First Course in Probability
  2. Rick Durrett (2019). Probability: Theory and Examples
  3. Andrey Kolmogorov (1933). Grundbegriffe der Wahrscheinlichkeitsrechnung