MathLabs

Xác suất và Thống kê

Thống kê mô tả

Tóm tắt dữ liệu bằng các đại lượng như trung bình, trung vị, độ lệch chuẩn, và trình bày bằng biểu đồ.

Trực giácTrực giác: Kể câu chuyện của dữ liệu bằng vài con số

Hãy tưởng tượng một giáo viên có 30 điểm kiểm tra, hoặc một chủ cửa hàng có doanh số một tháng theo từng ngày. Không ai muốn nhìn chằm chằm vào 30 con số riêng lẻ để hiểu chuyện gì đã xảy ra. Thống kê mô tả nén cả một bộ dữ liệu thành một vài con số — một giá trị điển hình, mức độ phân tán của các giá trị — để ta có thể so sánh, tóm tắt và phát hiện điều bất thường chỉ bằng một cái nhìn.

Một đường cong bất đối xứng có đoạn tăng và đoạn lõm, minh họa hình dạng dữ liệu bị lệch thay vì đối xứng.
Một phân phối đếm lệch phải (Poisson với tham số λ=np\lambda = np): tăng nn hoặc pp để thấy trọng tâm dịch sang phải và hình dáng trở nên đối xứng hơn.

Phổ thôngĐo trung tâm: Trung bình, Trung vị, Mốt

Định nghĩa: Trung bình

Trung bình (hay số trung bình) của nn giá trị dữ liệu x1,x2,…,xnx_1, x_2, \ldots, x_n là tổng của tất cả chúng chia cho số lượng giá trị. Nó dùng đến mọi giá trị trong bộ dữ liệu, nên nhạy cảm với các giá trị bất thường lớn hoặc nhỏ.

xˉ=1n∑i=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i

Ở đây xˉ\bar x là trung bình, nn là số lượng giá trị dữ liệu, và xix_i là giá trị thứ ii được cộng vào. Dấu gạch ngang trên xx là ký hiệu chuẩn cho "trung bình của xx".

Định nghĩa: Trung vị và Mốt

Trung vị là giá trị ở giữa khi dữ liệu được sắp xếp từ nhỏ đến lớn (hoặc trung bình của hai giá trị giữa, nếu nn chẵn). Mốt là giá trị xuất hiện nhiều lần nhất. Không giống trung bình, trung vị bỏ qua việc các giá trị cực trị cách xa bao nhiêu — chỉ thứ hạng của chúng mới quan trọng — điều này khiến nó chống chịu được với giá trị ngoại lai.

Vậy nên dùng đại lượng nào? Nếu dữ liệu tương đối đối xứng và không có giá trị cực trị, trung bình hiệu quả và dùng hết mọi thông tin. Nếu dữ liệu có giá trị ngoại lai hoặc bị lệch nặng — như thu nhập hộ gia đình hay giá nhà — trung vị cho một giá trị "điển hình" đại diện hơn.

So sánh trung bình, trung vị và mốt
Đại lượngĐịnh nghĩaCó nhạy với ngoại lai?
Trung bìnhTổng các giá trị chia cho số lượngCó — mọi giá trị đều được tính
Trung vịGiá trị ở giữa khi đã sắp xếpKhông — chỉ thứ hạng quan trọng
MốtGiá trị xuất hiện nhiều nhấtKhông

Phổ thôngĐo độ phân tán: Độ lệch chuẩn và Tứ phân vị

Hai bộ dữ liệu có thể có cùng trung bình nhưng trông hoàn toàn khác nhau — một bộ tập trung chặt chẽ, một bộ phân tán rộng. Độ lệch chuẩn ss nắm bắt điều này bằng cách đo khoảng cách điển hình của một giá trị dữ liệu tới trung bình:

s=1n∑i=1n(xi−xˉ)2s = \sqrt{\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar{x})^2}

Mỗi độ lệch xi−xˉx_i-\bar x được bình phương (để độ lệch âm và dương không triệt tiêu nhau), lấy trung bình, rồi căn bậc hai đưa đơn vị trở về thang đo gốc của dữ liệu. ss nhỏ nghĩa là dữ liệu tập trung chặt quanh xˉ\bar x; ss lớn nghĩa là nó phân tán rộng.

IQR=Q3−Q1IQR = Q_3 - Q_1

Tứ phân vị chia dữ liệu đã sắp xếp thành bốn phần bằng nhau: Q1Q_1 (đi được 25% chặng đường), trung vị (50%), và Q3Q_3 (75%). Khoảng tứ phân vị IQR=Q3−Q1IQR = Q_3-Q_1 đo độ phân tán của nửa giữa dữ liệu và, giống trung vị, chống chịu được giá trị ngoại lai — đây chính xác là điều một biểu đồ hộp vẽ ra: một hộp từ Q1Q_1 đến Q3Q_3 với một đường tại trung vị.

Với mọi bộ dữ liệu x1,x2,…,xnx_1, x_2, \ldots, x_n có trung bình xˉ\bar x, ∑i=1n(xi−xˉ)=0\sum_{i=1}^{n}(x_i-\bar x) = 0.

Vì sao đúng?

Trung bình được định nghĩa chính xác như điểm cân bằng của dữ liệu — hãy nghĩ tới một bập bênh với các quả cân tại mỗi xix_i — nên các giá trị trên trung bình phải cân bằng chính xác với các giá trị dưới nó, nếu không xˉ\bar x đã không phải là điểm cân bằng.

Chứng minh

Khai triển tổng bằng cách phân phối: ∑i=1n(xi−xˉ)=∑i=1nxi−∑i=1nxˉ\sum_{i=1}^{n}(x_i-\bar x) = \sum_{i=1}^{n}x_i - \sum_{i=1}^{n}\bar x. Tổng thứ hai cộng hằng số xˉ\bar x với chính nó nn lần, nên ∑i=1nxˉ=nxˉ\sum_{i=1}^{n}\bar x = n\bar x.

Theo định nghĩa, xˉ=1n∑i=1nxi\bar x = \frac{1}{n}\sum_{i=1}^{n}x_i, nên nhân cả hai vế với nn ta được nxˉ=∑i=1nxin\bar x = \sum_{i=1}^{n}x_i. Đây chính xác là cùng đại lượng với tổng thứ nhất trong khai triển ở trên.

Thay lại, ∑i=1n(xi−xˉ)=∑i=1nxi−nxˉ=∑i=1nxi−∑i=1nxi=0\sum_{i=1}^{n}(x_i-\bar x) = \sum_{i=1}^{n}x_i - n\bar x = \sum_{i=1}^{n}x_i - \sum_{i=1}^{n}x_i = 0, điều này chứng minh khẳng định.

Nếu một bộ dữ liệu mới được tạo bởi yi=axi+by_i = ax_i+b với các hằng số a,ba,b, thì yˉ=axˉ+b\bar y = a\bar x+b và độ lệch chuẩn mới là sy=∣a∣sxs_y = |a|s_x.

Vì sao đúng?

Dịch mỗi điểm dữ liệu cùng một lượng bb sẽ dịch trung bình đi cùng lượng đó nhưng không thay đổi mức độ phân tán tương đối giữa các điểm; nhân mỗi điểm với aa sẽ nhân cả trung bình và độ phân tán với aa (dùng ∣a∣|a| vì độ phân tán không thể âm).

Chứng minh

Với trung bình: yˉ=1n∑i=1nyi=1n∑i=1n(axi+b)=an∑i=1nxi+1n∑i=1nb=axˉ+b\bar y = \frac{1}{n}\sum_{i=1}^{n}y_i = \frac{1}{n}\sum_{i=1}^{n}(ax_i+b) = \frac{a}{n}\sum_{i=1}^{n}x_i + \frac{1}{n}\sum_{i=1}^{n}b = a\bar x + b, dùng 1n∑xi=xˉ\frac{1}{n}\sum x_i = \bar x và 1n∑i=1nb=b\frac{1}{n}\sum_{i=1}^{n}b = b.

Với độ phân tán, trước tiên chú ý yi−yˉ=(axi+b)−(axˉ+b)=a(xi−xˉ)y_i-\bar y = (ax_i+b)-(a\bar x+b) = a(x_i-\bar x): độ dịch hằng số bb triệt tiêu hoàn toàn, chỉ còn lại độ lệch đã được nhân lên.

Bình phương rồi lấy trung bình, sy2=1n∑i=1n(yi−yˉ)2=1n∑i=1na2(xi−xˉ)2=a2sx2s_y^2 = \frac{1}{n}\sum_{i=1}^{n}(y_i-\bar y)^2 = \frac{1}{n}\sum_{i=1}^{n}a^2(x_i-\bar x)^2 = a^2 s_x^2. Lấy căn bậc hai hai vế cho sy=∣a∣sxs_y = |a|s_x, vì căn bậc hai luôn không âm.

Phổ thôngỨng dụng thực tiễn và Ví dụ minh họa

Thống kê mô tả có mặt khắp nơi: một nhà phân tích thể thao so sánh trung bình đánh bóng với trung bình toàn giải, một nhà máy theo dõi độ lệch chuẩn của kích thước chi tiết để phát hiện vấn đề chất lượng, một cơ quan thời tiết báo cáo lượng mưa trung vị vì một năm lũ lụt duy nhất sẽ làm méo trung bình, và một công ty báo cáo doanh thu theo quý cùng với một giá trị điển hình và một thước đo biến động.

Ví dụ: Một giá trị ngoại lai làm lệch trung bình

Một gia sư ghi lại 6 điểm kiểm tra: 5,6,7,7,8,95, 6, 7, 7, 8, 9. Ở bài kiểm tra cuối, một lỗi nhập liệu thay 99 bằng 5050. So sánh trung bình và trung vị trước và sau lỗi này.

Lời giải

Trước lỗi: trung bình là 5+6+7+7+8+96=426=7\frac{5+6+7+7+8+9}{6} = \frac{42}{6} = 7, và sắp xếp dữ liệu 5,6,7,7,8,95,6,7,7,8,9 cho trung vị 7+72=7\frac{7+7}{2}=7 (trung bình của hai giá trị giữa). Trung bình và trung vị khá gần nhau.

Sau lỗi, dữ liệu trở thành 5,6,7,7,8,505,6,7,7,8,50. Trung bình giờ là 5+6+7+7+8+506=836≈13.83\frac{5+6+7+7+8+50}{6} = \frac{83}{6} \approx 13.83 — bị kéo lên rất cao bởi một giá trị sai duy nhất.

Dữ liệu đã sắp xếp vẫn là 5,6,7,7,8,505,6,7,7,8,50, nên trung vị vẫn là 7+72=7\frac{7+7}{2}=7, hoàn toàn không bị ảnh hưởng. Đây chính xác là lý do trung vị được ưa chuộng khi bộ dữ liệu có thể chứa lỗi nhập liệu hoặc giá trị ngoại lai cực đoan.

Ví dụ: So sánh độ ổn định bằng độ lệch chuẩn

Hai cầu thủ ghi điểm trong 5 trận. Cầu thủ A: 9,10,11,12,139, 10, 11, 12, 13. Cầu thủ B: 1,6,11,16,211, 6, 11, 16, 21. Cả hai có cùng trung bình, nhưng cầu thủ nào ổn định hơn? Tính độ lệch chuẩn của mỗi người để so sánh.

Lời giải

Cả hai bộ dữ liệu đều có trung bình 1111: với A, 9+10+11+12+135=555=11\frac{9+10+11+12+13}{5}=\frac{55}{5}=11; với B, 1+6+11+16+215=555=11\frac{1+6+11+16+21}{5}=\frac{55}{5}=11.

Với cầu thủ A, độ lệch so với 1111 là −2,−1,0,1,2-2,-1,0,1,2, bình phương 4,1,0,1,44,1,0,1,4 tổng lại là 1010, nên phương sai là 105=2\frac{10}{5}=2 và độ lệch chuẩn là sA=2≈1.41s_A=\sqrt{2}\approx 1.41.

Với cầu thủ B, độ lệch là −10,−5,0,5,10-10,-5,0,5,10, bình phương 100,25,0,25,100100,25,0,25,100 tổng lại là 250250, nên phương sai là 2505=50\frac{250}{5}=50 và sB=50≈7.07s_B=\sqrt{50}\approx 7.07. Vì sA<sBs_A < s_B, cầu thủ A ghi điểm ổn định hơn nhiều dù cả hai đều trung bình 1111 điểm mỗi trận.

Tính trung bình của bộ dữ liệu 2,4,4,6,92, 4, 4, 6, 9.

Đại lượng đo xu hướng trung tâm nào ít bị ảnh hưởng nhất bởi một giá trị ngoại lai cực đoan duy nhất trong dữ liệu?

Với bộ dữ liệu 1,2,3,4,51, 2, 3, 4, 5, độ lệch chuẩn ss bằng bao nhiêu?

Một biểu đồ hộp của thời gian giao hàng (phút) cho thấy Q1=20Q_1=20 và Q3=35Q_3=35. Khoảng tứ phân vị bằng bao nhiêu?

Tài liệu tham khảo

  1. David Freedman, Robert Pisani, Roger Purves (2007). Statistics
  2. David S. Moore, William I. Notz (2020). The Basic Practice of Statistics