MathLabs

Xác suất và Thống kê

Biến ngẫu nhiên và phân phối

Kết quả số của các thí nghiệm ngẫu nhiên, mô tả bằng xác suất của mỗi giá trị có thể.

Trực giácTrực giác: Biến sự ngẫu nhiên thành con số

Tung một đồng xu, gieo một con xúc xắc, đo chiều cao của người tiếp theo bước vào phòng — mỗi thí nghiệm ngẫu nhiên này đều có một kết cục không thể đoán trước. Biến ngẫu nhiên đơn giản là một quy tắc gán một con số cho mỗi kết cục có thể, nhờ đó thay vì nói về các kết cục mơ hồ, ta có thể tính toán với con số: cộng, lấy trung bình, vẽ đồ thị.

Phân phối nhị thức dạng cột, phủ đường cong xấp xỉ Gauss.
Phân phối nhị thức Bin(n,p)\mathrm{Bin}(n, p) (cột tím) cùng đường cong xấp xỉ chuẩn Gauss (cam): chỉnh nn và pp để thấy kỳ vọng npnp và độ lệch chuẩn np(1−p)\sqrt{np(1-p)} thay đổi.

Phổ thôngBiến ngẫu nhiên rời rạc và liên tục

Định nghĩa: Biến ngẫu nhiên rời rạc

Biến ngẫu nhiên XX là rời rạc nếu nó chỉ nhận một danh sách hữu hạn hoặc đếm được các giá trị, mỗi giá trị có xác suất riêng. Hàm khối xác suất (PMF) của nó là P(X=x)P(X=x), và vì XX chắc chắn nhận một giá trị nào đó nên tổng xác suất của mọi giá trị có thể phải bằng 1.

∑xP(X=x)=1\sum_x P(X=x) = 1

Phân phối rời rạc nổi tiếng nhất đếm số lần thành công trong các phép thử độc lập lặp lại. Nếu một phép thử thành công với xác suất pp và được lặp lại nn lần, số lần thành công XX tuân theo phân phối nhị thức:

P(X=k)=(nk)pk(1−p)n−kP(X=k) = \binom{n}{k}p^k(1-p)^{n-k}

Ở đây nn là số phép thử cố định, pp là xác suất thành công của mỗi phép thử, và (nk)\binom{n}{k} đếm số cách sắp xếp kk lần thành công trong nn phép thử, vì bất kỳ cách sắp xếp nào trong số đó cũng cho đúng kk lần thành công và n−kn-k lần thất bại.

Định nghĩa: Biến ngẫu nhiên liên tục

Biến ngẫu nhiên liên tục có thể nhận bất kỳ giá trị nào trong một khoảng số thực, do đó P(X=x)=0P(X=x)=0 với mọi điểm đơn lẻ xx. Thay vì PMF, nó có một hàm mật độ xác suất (PDF) f(x)f(x), và xác suất được tính bằng diện tích dưới ff trên một khoảng.

f(x)=1σ2πe−(x−μ)2/2σ2f(x) = \frac{1}{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/2\sigma^2}

Đây là hàm mật độ chuẩn (Gauss): μ\mu là trung bình, đánh dấu tâm của hình chuông, còn σ\sigma là độ lệch chuẩn, điều khiển hình chuông rộng hay hẹp. Nhiều sai số đo lường và đại lượng tự nhiên được xấp xỉ tốt bởi đường cong này.

Biến ngẫu nhiên rời rạc so với liên tục
Khía cạnhRời rạcLiên tục
Hàm mô tảHàm khối xác suất P(X=x)P(X=x)Hàm mật độ xác suất f(x)f(x)
Xác suất tại một giá trị chính xácCó thể dươngLuôn bằng 00
Cách tính xác suấtTổng: ∑xP(X=x)\sum_x P(X=x)Tích phân: ∫abf(x) dx\int_a^b f(x)\,dx
Ví dụ điển hìnhNhị thức (số lần thành công)Chuẩn (giá trị đo lường)

Đại họcKỳ vọng và Phương sai

Kỳ vọng E[X]E[X] là giá trị trung bình về lâu dài của XX nếu thí nghiệm được lặp lại nhiều lần, với mỗi giá trị có thể được cân theo khả năng xảy ra của nó:

E[X]=∑xxP(X=x)E[X] = \sum_x xP(X=x)

Mỗi giá trị có thể xx được nhân với xác suất P(X=x)P(X=x) của nó rồi cộng lại; kỳ vọng có tính tuyến tính, nên E[aX+b]=aE[X]+bE[aX+b] = aE[X]+b với các hằng số a,ba,b. Phương sai đo mức độ phân tán của XX quanh E[X]E[X], và dễ tính nhất bằng công thức rút gọn:

Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2

Công thức này nói rằng phương sai bằng trung bình của X2X^2 trừ đi bình phương của trung bình của XX; độ lệch chuẩn σ=Var(X)\sigma = \sqrt{\mathrm{Var}(X)} sau đó đưa độ phân tán trở về cùng đơn vị với chính XX.

Nếu XX tuân theo phân phối nhị thức với nn phép thử và xác suất thành công pp, thì E[X]=npE[X] = np.

Vì sao đúng?

Một biến đếm nhị thức chỉ là tổng của nhiều phép thử có/không nhỏ, và kỳ vọng của một tổng luôn bằng tổng các kỳ vọng — bất kể các phép thử tương tác thế nào — nên ta chỉ cần tính đóng góp trung bình của một phép thử.

Chứng minh

Viết X=X1+X2+⋯+XnX = X_1 + X_2 + \cdots + X_n, trong đó XiX_i bằng 11 nếu phép thử thứ ii thành công và bằng 00 nếu không. Mỗi XiX_i là một biến ngẫu nhiên Bernoulli với P(Xi=1)=pP(X_i=1)=p và P(Xi=0)=1−pP(X_i=0)=1-p, nên kỳ vọng của nó là E[Xi]=1⋅p+0⋅(1−p)=pE[X_i] = 1\cdot p + 0\cdot(1-p) = p.

Kỳ vọng có tính tuyến tính với mọi biến ngẫu nhiên, dù chúng có độc lập hay không: E[X1+X2+⋯+Xn]=E[X1]+E[X2]+⋯+E[Xn]E[X_1+X_2+\cdots+X_n] = E[X_1]+E[X_2]+\cdots+E[X_n]. Tính tuyến tính này suy ra trực tiếp từ định nghĩa kỳ vọng như một tổng có trọng số, vì các tổng và tổng có trọng số luôn có thể sắp xếp lại.

Áp dụng tính tuyến tính cho X=X1+⋯+XnX = X_1+\cdots+X_n ta được E[X]=E[X1]+⋯+E[Xn]=p+p+⋯+p⏟n times=npE[X] = E[X_1]+\cdots+E[X_n] = \underbrace{p+p+\cdots+p}_{n \text{ times}} = np, đúng như công thức đã nêu.

Với mọi biến ngẫu nhiên XX có trung bình hữu hạn, Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2.

Vì sao đúng?

Định nghĩa của phương sai liên quan đến việc bình phương một hiệu, điều này khó tính trực tiếp; khai triển bình phương đó và dùng tính tuyến tính của kỳ vọng biến nó thành hai đại lượng dễ tính, E[X2]E[X^2] và E[X]E[X], mà ta đã biết cách tính.

Chứng minh

Theo định nghĩa, Var(X)=E[(X−μ)2]\mathrm{Var}(X) = E[(X-\mu)^2] với μ=E[X]\mu = E[X]. Khai triển bình phương bên trong kỳ vọng: (X−μ)2=X2−2μX+μ2(X-\mu)^2 = X^2 - 2\mu X + \mu^2.

Áp dụng tính tuyến tính của kỳ vọng cho từng số hạng: E[(X−μ)2]=E[X2]−2μE[X]+μ2E[(X-\mu)^2] = E[X^2] - 2\mu E[X] + \mu^2. Vì μ\mu là hằng số (không phụ thuộc vào kết cục) nên có thể đưa ra ngoài kỳ vọng ở số hạng giữa và số hạng cuối.

Thay E[X]=μE[X] = \mu trở lại: E[X2]−2μ⋅μ+μ2=E[X2]−2μ2+μ2=E[X2]−μ2E[X^2] - 2\mu\cdot\mu + \mu^2 = E[X^2] - 2\mu^2 + \mu^2 = E[X^2] - \mu^2. Thay μ\mu bằng E[X]E[X] cho đúng Var(X)=E[X2]−E[X]2\mathrm{Var}(X) = E[X^2] - E[X]^2 như đã nêu.

Đại họcỨng dụng thực tiễn và Ví dụ minh họa

Các biến nhị thức mô hình hóa số lần đạt/không đạt ở khắp nơi: sản phẩm lỗi trên dây chuyền sản xuất, lượt nhấp vào quảng cáo, đột biến trên một đoạn DNA. Các biến chuẩn mô hình hóa các đại lượng được tạo thành từ nhiều ảnh hưởng nhỏ độc lập: sai số đo lường, chiều cao con người, lợi nhuận danh mục đầu tư, và nhiễu nền trong thiết bị điện tử. Cả hai giúp kỹ sư, nhà khoa học và nhà phân tích biến khái niệm mơ hồ về "tính ngẫu nhiên" thành một con số có thể tính toán được.

Ví dụ: Bóng đèn lỗi trên dây chuyền sản xuất

Một nhà máy xuất xưởng bóng đèn theo lô. Mỗi bóng đèn độc lập bị lỗi với xác suất p=0.1p = 0.1. Trong một lô n=8n = 8 bóng đèn, xác suất để đúng k=2k = 2 bóng bị lỗi là bao nhiêu?

Lời giải

Số bóng đèn lỗi XX tuân theo phân phối nhị thức với n=8n=8 và p=0.1p=0.1, vì mỗi bóng đèn là một phép thử độc lập, hoặc lỗi hoặc không.

Thay vào PMF: P(X=2)=(82)(0.1)2(0.9)6P(X=2) = \binom{8}{2}(0.1)^2(0.9)^6. Hệ số nhị thức là (82)=28\binom{8}{2} = 28, đếm số cách chọn 2 trong 8 bóng đèn là những bóng bị lỗi.

Tính các lũy thừa, (0.1)2=0.01(0.1)^2 = 0.01 và (0.9)6≈0.531441(0.9)^6 \approx 0.531441, nên P(X=2)=28×0.01×0.531441≈0.1488P(X=2) = 28 \times 0.01 \times 0.531441 \approx 0.1488. Khoảng 15% khả năng đúng hai bóng đèn trong lô bị lỗi.

Ví dụ: Chiều cao và phân phối chuẩn

Chiều cao nam giới trưởng thành trong một quần thể xấp xỉ phân phối chuẩn với trung bình μ=170\mu = 170 (cm) và độ lệch chuẩn σ=6\sigma = 6 (cm). Khoảng bao nhiêu phần trăm nam giới có chiều cao từ 164164 đến 176176 cm?

Lời giải

Chuyển hai chiều cao biên sang điểm zz dùng Z=X−μσZ = \frac{X-\mu}{\sigma}: với X=164X=164, z1=164−1706=−1z_1 = \frac{164-170}{6} = -1, và với X=176X=176, z2=176−1706=1z_2 = \frac{176-170}{6} = 1.

Khoảng 164<X<176164 < X < 176 chính xác là phạm vi trong vòng một độ lệch chuẩn quanh trung bình, tức là −1<Z<1-1 < Z < 1 theo đơn vị chuẩn hóa.

Với đường cong chuẩn tắc, quy tắc kinh nghiệm (từ tích phân hàm mật độ chuẩn) cho P(−1<Z<1)≈0.6827P(-1 < Z < 1) \approx 0.6827, nên khoảng 68% nam giới nằm trong khoảng chiều cao đó.

Cho X∼Binomial(n=5,p=0.4)X \sim \mathrm{Binomial}(n=5, p=0.4). Giá trị P(X=2)P(X=2) bằng bao nhiêu?

Phát biểu nào mô tả đúng sự khác biệt giữa PMF rời rạc và PDF liên tục?

Một biến ngẫu nhiên rời rạc thỏa X∈{0,1,2}X \in \{0,1,2\} với P(X=0)=0.2P(X=0)=0.2, P(X=1)=0.5P(X=1)=0.5, P(X=2)=0.3P(X=2)=0.3. Giá trị E[X]E[X] bằng bao nhiêu?

Điểm thi chuẩn hóa xấp xỉ phân phối chuẩn với μ=500\mu = 500 và σ=100\sigma = 100. Dùng quy tắc kinh nghiệm, khoảng bao nhiêu phần trăm thí sinh đạt điểm trên 600600?

Tài liệu tham khảo

  1. Charles M. Grinstead, J. Laurie Snell (1997). Introduction to Probability
  2. Sheldon Ross (2019). A First Course in Probability