Bỏ qua

Chương 46: Phân phối chuẩn

Câu hỏi mở đầu

Tổng của nhiều đại lượng ngẫu nhiên không chỉ ổn định quanh trung bình mà còn có một hình dạng đặc biệt: hình chuông. Hình dạng ấy là gì, và vì sao nó xuất hiện khắp nơi, từ chiều cao đến sai số đo?

Một hình dạng không ai đặt hàng

Chương 45, phân phối của tỉ lệ mặt ngửa co lại quanh 0,5 khi số lần tung tăng, và ở mọi cỡ nó mang cùng một dáng: cao ở giữa, thấp dần đều về hai bên. Tung một con xúc xắc thì phân phối phẳng, sáu cột bằng nhau. Cộng hai con thì được một mái nhà. Cộng năm con, rồi ba mươi con, mái nhà tròn dần thành một cái chuông, và cái chuông ấy khớp gần như hoàn hảo với một đường cong duy nhất, vẽ từ một công thức duy nhất.

Phân phối của tổng 1, 2, 5 và 30 con xúc xắc so với đường cong chuẩn
Phân phối chính xác của tổng \(n\) con xúc xắc (cột xanh) và đường cong chuẩn có cùng kỳ vọng và phương sai (đường cam), với \(n = 1, 2, 5, 30\). Từ \(n = 5\), hai thứ gần như trùng nhau.

Không ai thiết kế xúc xắc để tổng của chúng có hình chuông. Một con xúc xắc không biết gì về hình chuông; nó chỉ có sáu mặt ngang nhau. Hình chuông tự xuất hiện khi cộng nhiều thứ ngẫu nhiên độc lập, dù từng thứ có phân phối rất khác nhau: đồng xu, xúc xắc, những sai số nhỏ trong một phép đo. Đó là cấu trúc nguyên thủy của chương: khi một đại lượng là tổng của nhiều ảnh hưởng nhỏ, độc lập, không ảnh hưởng nào lấn át, thì hình dạng của nó gần như không phụ thuộc vào từng ảnh hưởng, mà chỉ phụ thuộc vào hai con số, kỳ vọng và phương sai của tổng. Mọi chi tiết khác bị xóa nhòa.

Vì sao cấu trúc này phải xuất hiện, dù chưa ai đặt tên cho nó? Vì cộng dồn là một phép biến đổi được lặp đi lặp lại, và hình chuông là hình dạng sống sót qua nó. Cộng hai đại lượng độc lập có phân phối chuẩn thì lại được một phân phối chuẩn; trong các phân phối có phương sai hữu hạn, chỉ phân phối chuẩn giữ nguyên hình dạng khi cộng hai bản độc lập của nó rồi co giãn lại. Mọi phân phối khác, cộng dồn đủ nhiều lần, bị kéo về phía nó, như những viên bi lăn về đáy một cái chén. Kỳ vọng và phương sai sống sót vì chúng cộng được (Chương 44); mọi đặc điểm khác của từng ảnh hưởng tan đi trong tổng. Abraham de Moivre tìm ra đường cong này năm 1733 khi xấp xỉ phân phối nhị thức cho nhiều lần tung đồng xu; Laplace và Gauss về sau dùng nó để mô tả sai số trong các phép đo thiên văn.

Còn một điều nữa phải giải quyết trước. Tổng xúc xắc nhảy từng bước 1, nhưng chiều cao hay sai số đo có thể là bất kỳ số thực nào trong một khoảng. Xác suất để một người cao đúng 165 cm, không lệch một phần tỉ milimét, là 0; nếu gán cho mỗi giá trị một xác suất dương thì tổng sẽ vượt 1, như ở Chương 41. Cách thoát ra là rải xác suất dọc trục số như rải cát: một đường cong cho biết lớp cát dày bao nhiêu ở mỗi điểm, và xác suất rơi vào một khoảng là lượng cát trên khoảng ấy, tức diện tích dưới đường cong trên khoảng ấy (Chương 37). Các cột của tổng xúc xắc là bản rời rạc của cùng ý tưởng: mỗi cột rộng 1, nên diện tích của nó bằng chiều cao của nó, bằng xác suất.

Ký hiệu

Một biến ngẫu nhiên liên tục (continuous random variable) \(X\) được mô tả bằng một hàm mật độ (probability density function) \(f\): \(f(x) \geq 0\) với mọi \(x\), tổng diện tích dưới đồ thị của \(f\) bằng 1, và

\[ P(a \leq X \leq b) = \int_a^b f(x)\,dx. \]

Hai hệ quả đáng nhớ. Thứ nhất, \(P(X = a) = 0\) với mọi \(a\), vì một đoạn thẳng không có diện tích; nên với biến liên tục, viết \(\leq\) hay \(<\) cũng vậy. Thứ hai, \(f(x)\) không phải một xác suất, nó có thể lớn hơn 1: nó là xác suất trên một đơn vị độ dài. Kỳ vọng và phương sai được định nghĩa như ở Chương 44, với tổng thay bằng tích phân: \(E[X] = \int x f(x)\,dx\)\(\mathrm{Var}(X) = \int (x - \mu)^2 f(x)\,dx\), lấy trên cả trục số. Tích phân trên cả trục số là một tích phân suy rộng (improper integral): \(\int_{-\infty}^{\infty}\) nghĩa là giới hạn của các tích phân trên những đoạn ngày càng dài, như tổng vô hạn ở Chương 31 là giới hạn của các tổng hữu hạn.

Phân phối chuẩn \(N(\mu, \sigma^2)\) có hàm mật độ

\[ f(x) = \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x - \mu)^2}{2\sigma^2}}. \]

Hãy đọc công thức từ trong ra ngoài.

  • \(z = \frac{x - \mu}{\sigma}\) đo khoảng cách từ \(x\) tới kỳ vọng bằng đơn vị độ lệch chuẩn. Số này gọi là điểm z (z-score) của \(x\).
  • \(e^{-z^2/2}\) tạo dáng chuông: bằng 1 tại \(z = 0\), đối xứng hai bên, và giảm cực nhanh: khoảng \(0{,}135\) tại \(z = 2\), \(0{,}011\) tại \(z = 3\), \(1{,}5 \cdot 10^{-8}\) tại \(z = 6\). Bình phương trong số mũ làm hai đuôi mỏng đi nhanh hơn hẳn hàm mũ \(e^{-z}\) của Chương 29.
  • \(\frac{1}{\sigma\sqrt{2\pi}}\) chỉ là hằng số làm tổng diện tích bằng 1: \(\int e^{-z^2/2}\,dz = \sqrt{2\pi}\) trên cả trục số (Định lý 3), và kéo giãn theo chiều ngang \(\sigma\) lần thì phải nén theo chiều đứng \(\sigma\) lần. Con số \(\pi\) của đường tròn xuất hiện trong một công thức về xác suất; lời giải thích cần tích phân trên mặt phẳng, nằm ngoài cuốn sách.

Hai tham số \(\mu\)\(\sigma^2\) đúng là kỳ vọng và phương sai của phân phối (Mệnh đề 4). Viết \(X \sim N(\mu, \sigma^2)\), đọc là "\(X\) có phân phối chuẩn với kỳ vọng \(\mu\) và phương sai \(\sigma^2\)". Trường hợp \(\mu = 0\), \(\sigma = 1\) gọi là phân phối chuẩn tắc (standard normal distribution); biến của nó thường được gọi là \(Z\). Theo Chương 38, nguyên hàm của \(e^{-x^2}\) không viết được bằng các hàm quen thuộc, nên các xác suất của phân phối chuẩn được tính bằng máy và ghi thành bảng:

\(z\) 0 0,5 1 1,5 1,9 2 2,5 3
\(P(Z \geq z)\) 0,500 0,309 0,159 0,067 0,029 0,023 0,006 0,001

Với \(z\) âm, dùng tính đối xứng: \(P(Z \leq -z) = P(Z \geq z)\). Từ bảng suy ra quy tắc 68–95–99,7 (68–95–99.7 rule): một đại lượng có phân phối chuẩn nằm trong khoảng một độ lệch chuẩn quanh kỳ vọng với xác suất khoảng 68%, trong hai độ lệch chuẩn khoảng 95%, trong ba độ lệch chuẩn khoảng 99,7%.

Đường cong chuẩn với các vùng một, hai và ba độ lệch chuẩn
Quy tắc 68–95–99,7: diện tích dưới đường cong chuẩn trong khoảng một, hai, ba độ lệch chuẩn quanh kỳ vọng.

Định lý giới hạn trung tâm (central limit theorem) nói rằng hình chuông ở đầu chương không phải tình cờ: nếu \(X_1, \dots, X_n\) độc lập, cùng phân phối, với kỳ vọng \(\mu\) và phương sai \(\sigma^2\) hữu hạn, thì khi \(n\) lớn, tổng \(S_n\) có phân phối xấp xỉ \(N(n\mu, n\sigma^2)\), tức điểm z của nó, \(\frac{S_n - n\mu}{\sigma\sqrt n}\), có phân phối xấp xỉ chuẩn tắc (Định lý 5). Một minh họa cơ học là bảng Galton (Galton board), mang tên Francis Galton: những viên bi rơi qua nhiều hàng đinh, gặp mỗi đinh thì lệch trái hay phải với xác suất như nhau. Vị trí cuối cùng của một viên bi là số lần lệch phải, một tổng của các biến chỉ báo độc lập, có phân phối nhị thức; số đường đi tới mỗi ô là một hệ số nhị thức, như các đường đi trên lưới ở Chương 40.

Bảng Galton với 12 hàng đinh và phân phối của ô cuối cùng
Trái: một đường đi của viên bi qua 12 hàng đinh. Phải: xác suất viên bi rơi vào mỗi ô, \(\binom{12}{k} \cdot \frac{1}{2^{12}}\), và đường cong chuẩn có cùng kỳ vọng 6 và phương sai 3.

Làm bằng tay

Ví dụ 1 (chiều cao). Giả sử chiều cao của phụ nữ trưởng thành trong một cộng đồng có phân phối \(N(165, 7^2)\), đơn vị centimét (giả định). Chiều cao 179 cm có điểm z là \(\frac{179 - 165}{7} = 2\), nên tỉ lệ người cao trên 179 cm là \(P(Z > 2) \approx 0{,}023\), khoảng 2,3%. Theo quy tắc 68–95–99,7, khoảng 68% số người cao từ 158 đến 172 cm, và khoảng 95% cao từ 151 đến 179 cm.

Ví dụ 2 (so hai điểm thi). An được 8,4 điểm Toán ở một kỳ thi có điểm trung bình 6 và độ lệch chuẩn 1,5; Bình được 8,2 điểm Văn ở một kỳ thi có điểm trung bình 7 và độ lệch chuẩn 0,8 (giả định). Hai con số 8,4 và 8,2 không so trực tiếp được, vì hai kỳ thi có thang khác nhau. Điểm z thì so được: của An là \(\frac{8{,}4 - 6}{1{,}5} = 1{,}6\), của Bình là \(\frac{8{,}2 - 7}{0{,}8} = 1{,}5\). So với những người cùng thi, An nổi bật hơn một chút.

Ví dụ 3 (tổng 100 lần tung xúc xắc). Gọi \(S\) là tổng. Theo Chương 44, \(E[S] = 100 \cdot 3{,}5 = 350\)\(\mathrm{Var}(S) = 100 \cdot \frac{35}{12} \approx 291{,}7\), nên độ lệch chuẩn khoảng \(17{,}08\). Theo định lý giới hạn trung tâm, \(S\) có phân phối xấp xỉ \(N(350;\ 17{,}08^2)\). Tính \(P(S \geq 376)\): vì \(S\) chỉ nhận giá trị nguyên, "\(S \geq 376\)" cũng là "\(S > 375{,}5\)", và lấy mốc ở giữa hai số nguyên cho xấp xỉ tốt hơn. Điểm z là \(\frac{375{,}5 - 350}{17{,}08} \approx 1{,}49\), gần \(1{,}5\), nên xác suất khoảng \(0{,}067\). Máy tính cho con số chính xác, tính bằng cách cộng dồn phân phối của từng con xúc xắc: khoảng \(0{,}0678\).

Ví dụ 4 (xấp xỉ chuẩn cho phân phối nhị thức). Tung đồng xu cân đối 100 lần; số lần ngửa \(X\) có kỳ vọng 50 và độ lệch chuẩn \(\sqrt{100 \cdot 0{,}5 \cdot 0{,}5} = 5\). Xác suất có từ 60 lần ngửa trở lên: điểm z của \(59{,}5\)\(\frac{59{,}5 - 50}{5} = 1{,}9\), nên \(P(X \geq 60) \approx 0{,}029\); con số chính xác là khoảng \(0{,}0284\). Bất đẳng thức Chebyshev của Chương 45 chỉ bảo đảm \(P(\lvert X - 50 \rvert \geq 10) \leq \frac{25}{100} = 0{,}25\); hình chuông cho biết con số thật của xác suất hai phía ấy, khoảng \(0{,}057\).

Ví dụ 5 (sai số của một cuộc khảo sát). Hỏi ngẫu nhiên 1000 người, 520 người ủng hộ một chính sách: tỉ lệ trong mẫu là \(\hat p = 0{,}52\). Tỉ lệ ấy là trung bình của 1000 biến chỉ báo, nên theo định lý giới hạn trung tâm nó có phân phối xấp xỉ chuẩn, quanh tỉ lệ thật \(p\), với độ lệch chuẩn \(\sqrt{\frac{p(1 - p)}{n}}\). Thay \(p\) chưa biết bằng \(\hat p\): \(\sqrt{\frac{0{,}52 \cdot 0{,}48}{1000}} \approx 0{,}0158\). Trong khoảng 95% số lần, \(\hat p\) nằm cách \(p\) không quá hai độ lệch chuẩn, nên ta báo cáo

\[ \hat p \pm 2\sqrt{\frac{\hat p (1 - \hat p)}{n}} = 0{,}52 \pm 0{,}032, \]

tức tỉ lệ ủng hộ thật có lẽ nằm trong khoảng từ 48,8% đến 55,2%. Con số \(\pm 3{,}2\) điểm phần trăm gọi là biên sai số (margin of error) của cuộc khảo sát. Khoảng này chứa cả những giá trị dưới 50%, nên khảo sát chưa đủ để khẳng định đa số ủng hộ. Nói chính xác, "95%" ở đây nói về phương pháp: lập khoảng theo cách này thì trong khoảng 95% số cuộc khảo sát, khoảng sẽ chứa tỉ lệ thật.

Ranh giới

Mỗi giá trị riêng lẻ có xác suất 0, nhưng một giá trị nào đó vẫn xảy ra. Với biến liên tục, \(P(X = 165) = 0\), và điều này đúng với mọi giá trị; vậy mà chiều cao của một người cụ thể vẫn là một con số. Trong mô hình liên tục, xác suất 0 không có nghĩa là không thể. Khi ta nói "cao 165 cm", ta đang nói về một khoảng, như từ \(164{,}5\) đến \(165{,}5\) cm, và khoảng ấy có xác suất dương.

Không phải cái gì cũng chuẩn: phân phối lệch. Giả sử một khoản vốn mỗi năm được nhân với \(1{,}3\) hoặc \(0{,}8\), hai khả năng ngang nhau và các năm độc lập (giả định). Sau 10 năm, kỳ vọng của số lần vốn được nhân lên là \(1{,}05^{10} \approx 1{,}63\), vì mỗi năm có hệ số kỳ vọng \(\frac{1{,}3 + 0{,}8}{2} = 1{,}05\). Nhưng kết quả ở giữa, 5 năm tăng và 5 năm giảm, chỉ là \(1{,}3^5 \cdot 0{,}8^5 = 1{,}04^5 \approx 1{,}22\), và khoảng 62% khả năng vốn kết thúc dưới mức kỳ vọng. Phân phối lệch hẳn về một phía: vài kết quả rất lớn kéo kỳ vọng lên. Lý do: đại lượng này là một tích, không phải một tổng. Logarit biến tích thành tổng, nên logarit của nó mới gần chuẩn (hình phải). Những đại lượng hình thành do nhân nhiều tỉ lệ tăng trưởng, như tài sản tích lũy qua nhiều năm đầu tư, thường có phân phối lệch (skewed distribution) như thế.

Phân phối của số lần vốn được nhân lên sau 10 năm, trên thang thường và thang logarit
Mỗi năm vốn nhân với \(1{,}3\) hoặc \(0{,}8\) (giả định). Trái: sau 10 năm, phân phối lệch hẳn về bên phải; kỳ vọng \(\approx 1{,}63\) nằm bên phải kết quả ở giữa \(\approx 1{,}22\). Phải: cùng phân phối ấy, trên thang logarit, cân đối như một phân phối nhị thức.

Đuôi dày. Giả sử biến động giá mỗi ngày của một tài sản có phân phối như sau (giả định): 95% số ngày là ngày yên ả, biến động theo \(N(0, 1)\); 5% số ngày là ngày sóng gió, biến động theo \(N(0, 4^2)\). Phân phối gộp lại có kỳ vọng 0 và phương sai \(0{,}95 \cdot 1 + 0{,}05 \cdot 16 = 1{,}75\). Nếu ai đó dùng một phân phối chuẩn với cùng kỳ vọng và phương sai để mô tả nó, thì một biến động từ 6 độ lệch chuẩn trở lên có xác suất khoảng \(2 \cdot 10^{-9}\) mỗi ngày: khoảng một lần trong 1,4 triệu năm. Trong mô hình gộp, xác suất ấy là khoảng \(0{,}0024\) (bài B9): khoảng một lần trong 420 ngày, lớn hơn chừng một triệu lần. Một phân phối có đuôi dày (heavy tail) như thế có những biến cố cực đoan thường xuyên hơn hẳn điều phân phối chuẩn dự đoán, và dùng mô hình chuẩn cho nó là đánh giá thấp rủi ro một cách thảm họa.

Mật độ của phân phối chuẩn và của một phân phối đuôi dày trên thang logarit
Mật độ của phân phối chuẩn (xanh) và của phân phối gộp đuôi dày (cam, giả định), cùng kỳ vọng và phương sai, trục đứng theo thang logarit. Ở khoảng cách 6 độ lệch chuẩn, hai mật độ chênh nhau hàng triệu lần.

Định lý giới hạn trung tâm có điều kiện. Nó cần các ảnh hưởng độc lập (bài C3 cho thấy điều gì xảy ra khi chúng là bản sao của nhau) và có phương sai hữu hạn; với trò chơi St. Petersburg của Chương 44, tổng không tiến về hình chuông nào. Nó cũng là một phát biểu về giới hạn: với \(n\) cụ thể, xấp xỉ tốt ở phần giữa, kém hơn khi phân phối gốc lệch (bài B3) và kém nhất ở những đuôi xa, nơi sai số tương đối có thể rất lớn.

Phát biểu chặt chẽ

Định nghĩa 1 (hàm mật độ). Cho hàm \(f \geq 0\) liên tục trên \(\mathbb{R}\), trừ có thể tại hữu hạn điểm. Tích phân suy rộng \(\int_{-\infty}^{\infty} f(x)\,dx\) là giới hạn của \(\int_{-a}^{a} f(x)\,dx\) khi \(a \to \infty\) (với \(f \geq 0\), giới hạn này luôn tồn tại, hữu hạn hoặc bằng \(+\infty\)). Ta nói \(f\) là một hàm mật độ nếu tích phân ấy bằng 1. Biến ngẫu nhiên \(X\) có hàm mật độ \(f\) nếu \(P(a \leq X \leq b) = \int_a^b f(x)\,dx\) với mọi \(a \leq b\); khi ấy \(E[X] = \int_{-\infty}^{\infty} x f(x)\,dx\) (nếu \(\int \lvert x \rvert f(x)\,dx\) hữu hạn) và \(\mathrm{Var}(X) = \int_{-\infty}^{\infty} (x - \mu)^2 f(x)\,dx\).

Một biến ngẫu nhiên có hàm mật độ không thể sống trên một tập \(\Omega\) đếm được như ở Chương 41: nếu mỗi thế giới có trọng số dương thì giá trị của biến tại thế giới ấy có xác suất dương. Xây dựng \(\Omega\) cho nó cần lý thuyết độ đo, nằm ngoài cuốn sách; ở đây ta lấy Định nghĩa 1 làm điểm xuất phát, và mọi điều cần biết về \(X\) đều nói qua \(f\).

Định nghĩa 2 (phân phối chuẩn). Cho \(\mu \in \mathbb{R}\)\(\sigma > 0\). Biến ngẫu nhiên \(X\) có phân phối chuẩn \(N(\mu, \sigma^2)\) nếu nó có hàm mật độ \(f(x) = \frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x - \mu)^2}{2\sigma^2}}\). Phân phối chuẩn tắc là \(N(0, 1)\), với hàm mật độ \(\varphi(z) = \frac{1}{\sqrt{2\pi}} e^{-\frac{z^2}{2}}\).

Định lý 3 (không chứng minh trong sách). \(\int_{-\infty}^{\infty} e^{-\frac{z^2}{2}}\,dz = \sqrt{2\pi}\). Do đó \(\varphi\) là một hàm mật độ.

Mệnh đề 4 (chuẩn hóa). Nếu \(X \sim N(\mu, \sigma^2)\) thì \(Z = \frac{X - \mu}{\sigma} \sim N(0, 1)\). Ngoài ra \(E[X] = \mu\)\(\mathrm{Var}(X) = \sigma^2\).

Chứng minh. Với mọi \(a \leq b\), biến cố \(\{a \leq Z \leq b\}\)\(\{\mu + \sigma a \leq X \leq \mu + \sigma b\}\), nên

\[ P(a \leq Z \leq b) = \int_{\mu + \sigma a}^{\mu + \sigma b} \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{(x - \mu)^2}{2\sigma^2}}\,dx = \int_a^b \frac{1}{\sigma\sqrt{2\pi}}\, e^{-\frac{z^2}{2}} \cdot \sigma\,dz = \int_a^b \varphi(z)\,dz, \]

theo công thức đổi biến số \(x = \mu + \sigma z\), \(dx = \sigma\,dz\) (Mệnh đề 5 của Chương 38). Vậy \(Z \sim N(0, 1)\). Hàm \(z\varphi(z)\) lẻ nên \(E[Z] = 0\) (bài C1), và ta chấp nhận không chứng minh rằng \(\int z^2 \varphi(z)\,dz = 1\), tức \(\mathrm{Var}(Z) = 1\). Vì \(X = \mu + \sigma Z\), các quy tắc của Chương 44 (vẫn đúng cho biến có hàm mật độ) cho \(E[X] = \mu\)\(\mathrm{Var}(X) = \sigma^2\). \(\square\)

Định lý 5 (định lý giới hạn trung tâm; không chứng minh trong sách). Cho \(X_1, \dots, X_n\) độc lập, cùng phân phối, với kỳ vọng \(\mu\) và phương sai \(\sigma^2\), \(0 < \sigma^2 < \infty\), và \(S_n = X_1 + \dots + X_n\). Khi đó với mọi \(a < b\),

\[ \lim_{n \to \infty} P\left(a \leq \frac{S_n - n\mu}{\sigma\sqrt n} \leq b\right) = \int_a^b \varphi(z)\,dz. \]

Với mọi \(n\), biến \(\frac{S_n - n\mu}{\sigma\sqrt n}\) đã có kỳ vọng 0 và phương sai 1 theo Chương 44; định lý nói về hình dạng của nó. Chứng minh cần những công cụ nằm ngoài cuốn sách.

Hệ quả 6 (de Moivre và Laplace). Nếu \(X\) có phân phối nhị thức với \(n\) phép thử và xác suất thành công \(p\), \(0 < p < 1\), thì với mọi \(a < b\), \(P\left(a \leq \frac{X - np}{\sqrt{np(1 - p)}} \leq b\right) \to \int_a^b \varphi(z)\,dz\) khi \(n \to \infty\).

Chứng minh. \(X\) là tổng của \(n\) biến chỉ báo độc lập, mỗi biến có kỳ vọng \(p\) và phương sai \(p(1 - p) > 0\) (Hệ quả 7 của Chương 44); áp dụng Định lý 5. \(\square\)

Sợi chỉ

  • S1. Bất biến qua biến đổi. Hình chuông là điểm hút của phép "cộng nhiều thứ độc lập rồi co giãn lại": cộng các phân phối chuẩn độc lập lại được phân phối chuẩn, và mọi phân phối có phương sai hữu hạn, cộng dồn đủ nhiều lần, đều bị kéo về nó. Qua phép cộng, chỉ kỳ vọng và phương sai được giữ lại.
  • S5. Rời rạc và liên tục. Phân phối nhị thức rời rạc tiến về phân phối chuẩn liên tục; tổng của Chương 44 thành tích phân; các cột rộng 1 của tổng xúc xắc và bảng Galton là tổng Riemann của Chương 37 cho diện tích dưới đường cong.
  • S7. Xấp xỉ và sai số. Biên sai số \(\pm 2\sqrt{\frac{\hat p(1 - \hat p)}{n}}\) của một cuộc khảo sát là quy tắc 95% áp vào trung bình mẫu. Xấp xỉ chuẩn tốt ở phần giữa và kém ở đuôi xa, và dùng nó cho một phân phối đuôi dày có thể sai hàng triệu lần.
  • S4. Cục bộ và toàn cục. Vô số ảnh hưởng nhỏ, cục bộ, độc lập tạo ra một hình dạng toàn cục không phụ thuộc vào chi tiết của từng ảnh hưởng.

Tóm tắt

  • Một biến ngẫu nhiên liên tục được mô tả bằng hàm mật độ: xác suất là diện tích dưới đường cong, và mỗi giá trị riêng lẻ có xác suất 0.
  • Phân phối chuẩn \(N(\mu, \sigma^2)\) có mật độ \(\frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x - \mu)^2}{2\sigma^2}}\): điểm z đo khoảng cách bằng độ lệch chuẩn, \(e^{-z^2/2}\) tạo dáng chuông, hằng số phía trước làm diện tích bằng 1.
  • Quy tắc 68–95–99,7: khoảng 68%, 95%, 99,7% nằm trong một, hai, ba độ lệch chuẩn quanh kỳ vọng.
  • Chuẩn hóa \(z = \frac{x - \mu}{\sigma}\) đưa mọi phân phối chuẩn về phân phối chuẩn tắc, và cho phép so những đại lượng có thang khác nhau.
  • Định lý giới hạn trung tâm: tổng của nhiều biến độc lập, cùng phân phối, phương sai hữu hạn có phân phối xấp xỉ chuẩn; vì thế hình chuông xuất hiện khắp nơi.
  • Biên sai số của một cuộc khảo sát là \(\pm 2\sqrt{\frac{\hat p(1 - \hat p)}{n}}\), khoảng \(\pm 3{,}2\) điểm phần trăm với 1000 người.
  • Không phải cái gì cũng chuẩn: tích của nhiều yếu tố cho phân phối lệch, và phân phối đuôi dày có những biến cố cực đoan thường hơn hẳn điều mô hình chuẩn dự đoán.

Bài tập

A. Tư duy

A1. Với mô hình chiều cao liên tục, xác suất để một người cao đúng 170 cm bằng 0. Vậy vì sao câu "khá nhiều người cao 170 cm" vẫn có nghĩa?

Lời giải

Câu ấy nói về chiều cao đã được làm tròn: "cao 170 cm" nghĩa là chiều cao nằm trong một khoảng, chẳng hạn từ \(169{,}5\) đến \(170{,}5\) cm. Khoảng ấy có độ dài dương nên có diện tích dương dưới đường mật độ, tức xác suất dương. Xác suất 0 chỉ thuộc về giá trị chính xác tuyệt đối, thứ không dụng cụ đo nào ghi được.

A2. Điểm thi của một lớp trên thang 0 đến 10 có trung bình 6 và độ lệch chuẩn 3. Điểm ấy có thể có phân phối gần chuẩn không?

Lời giải

Khó. Một phân phối chuẩn với kỳ vọng 6 và độ lệch chuẩn 3 đặt khoảng 2,3% số người trên 12 điểm và khoảng 2,3% dưới 0 điểm, những điểm không thể có. Hơn nữa, điểm 10 chỉ cách trung bình \(\frac43\) độ lệch chuẩn, nên phần trên 10 của đường chuông, khoảng 9%, đều phải dồn vào những điểm bị chặn. Phân phối thật của một đại lượng bị chặn hai đầu mà độ phân tán lớn như thế phải khác hình chuông, chẳng hạn bị dồn về hai đầu thang điểm.

A3. Một đại lượng hình thành do cộng nhiều ảnh hưởng nhỏ độc lập, một đại lượng khác hình thành do nhân nhiều tỉ lệ tăng trưởng độc lập. Đại lượng nào có khả năng có phân phối gần chuẩn hơn? Còn đại lượng kia thì sao?

Lời giải

Đại lượng thứ nhất là một tổng, nên theo định lý giới hạn trung tâm nó có phân phối gần chuẩn. Đại lượng thứ hai là một tích; logarit của nó là tổng các logarit của những tỉ lệ tăng trưởng, nên chính logarit ấy mới gần chuẩn. Bản thân đại lượng thì có phân phối lệch về bên phải, với kỳ vọng bị vài kết quả rất lớn kéo lên cao hơn kết quả ở giữa, như ví dụ về vốn đầu tư ở mục Ranh giới.

B. Tính toán

B1. Với chiều cao \(N(165, 7^2)\) ở Ví dụ 1, tính tỉ lệ người cao trên 172 cm và tỉ lệ người thấp hơn 151 cm.

Lời giải

172 cm có điểm z bằng 1: tỉ lệ trên 172 cm là \(P(Z > 1) \approx 0{,}159\), khoảng 16%. 151 cm có điểm z bằng \(-2\): tỉ lệ dưới 151 cm là \(P(Z < -2) = P(Z > 2) \approx 0{,}023\).

B2. Một túi gạo đóng bằng máy có khối lượng \(N(10;\ 0{,}1^2)\) kg (giả định). (a) Tỉ lệ túi nhẹ hơn \(9{,}8\) kg là bao nhiêu? (b) Giữ nguyên độ lệch chuẩn, phải chỉnh kỳ vọng thành bao nhiêu để tỉ lệ ấy chỉ còn khoảng \(0{,}1\%\)?

Lời giải

(a) \(9{,}8\) kg có điểm z bằng \(\frac{9{,}8 - 10}{0{,}1} = -2\), nên tỉ lệ khoảng \(0{,}023\), tức 2,3%. (b) Theo bảng, \(P(Z \leq -3) \approx 0{,}001\), nên cần \(9{,}8\) kg nằm dưới kỳ vọng 3 độ lệch chuẩn: kỳ vọng \(9{,}8 + 3 \cdot 0{,}1 = 10{,}1\) kg.

B3. Tung một con xúc xắc 180 lần. Dùng xấp xỉ chuẩn để ước lượng xác suất mặt 6 xuất hiện từ 40 lần trở lên. Con số chính xác là khoảng \(0{,}032\); vì sao xấp xỉ ở đây kém hơn Ví dụ 4?

Lời giải

Số mặt 6 có kỳ vọng \(180 \cdot \frac16 = 30\) và độ lệch chuẩn \(\sqrt{180 \cdot \frac16 \cdot \frac56} = \sqrt{25} = 5\). Điểm z của \(39{,}5\)\(\frac{39{,}5 - 30}{5} = 1{,}9\), nên xác suất khoảng \(0{,}029\). Xấp xỉ kém hơn Ví dụ 4 vì phân phối nhị thức với \(p = \frac16\) lệch về bên phải (đuôi phải dài hơn đuôi trái), còn đường chuông thì cân đối; với \(p = \frac12\), phân phối nhị thức cân đối sẵn.

B4. Một cuộc khảo sát hỏi ngẫu nhiên 400 người và được \(\hat p = 0{,}5\). Tính biên sai số. Cần hỏi bao nhiêu người để biên sai số còn một nửa? Để biên sai số chỉ còn \(\pm 1\) điểm phần trăm khi \(\hat p\) gần \(0{,}5\)?

Lời giải

Biên sai số \(2\sqrt{\frac{0{,}5 \cdot 0{,}5}{400}} = 2 \cdot 0{,}025 = 0{,}05\), tức \(\pm 5\) điểm phần trăm. Muốn biên sai số còn một nửa phải có gấp 4 lần số người: 1600 người. Muốn \(2\sqrt{\frac{0{,}25}{n}} \leq 0{,}01\) thì \(\sqrt n \geq 100\), tức \(n \geq 10.000\) người.

B5. Với tổng \(S\) của 100 lần tung xúc xắc ở Ví dụ 3, tìm một số nguyên \(t\) để \(P(S \geq t)\) khoảng \(0{,}023\).

Lời giải

Theo bảng, \(P(Z \geq 2) \approx 0{,}023\), nên cần \(\frac{t - 0{,}5 - 350}{17{,}08} \approx 2\), tức \(t \approx 350 + 34{,}16 + 0{,}5 \approx 384{,}7\): lấy \(t = 385\). (Con số chính xác \(P(S \geq 385)\) là khoảng \(0{,}0216\).)

B6. Trên bảng Galton 12 hàng, tính chính xác xác suất để viên bi rơi vào một trong các ô 10, 11, 12, rồi so với xấp xỉ chuẩn.

Lời giải

Chính xác: \(\frac{\binom{12}{10} + \binom{12}{11} + \binom{12}{12}}{2^{12}} = \frac{66 + 12 + 1}{4096} = \frac{79}{4096} \approx 0{,}019\). Xấp xỉ: số lần lệch phải có kỳ vọng 6 và độ lệch chuẩn \(\sqrt{12 \cdot \frac14} = \sqrt3 \approx 1{,}73\); điểm z của \(9{,}5\)\(\frac{3{,}5}{1{,}73} \approx 2{,}02\), nên xác suất khoảng \(0{,}022\). Ở đuôi, với chỉ 12 hàng đinh, xấp xỉ lớn hơn con số thật khoảng 12%.

B7. Đo một đại lượng 36 lần độc lập, mỗi lần có độ lệch chuẩn 12 (đơn vị bất kỳ). Dùng định lý giới hạn trung tâm ước lượng xác suất trung bình của 36 lần đo lệch khỏi giá trị thật từ 4 đơn vị trở lên, rồi so với cận Chebyshev.

Lời giải

Trung bình có độ lệch chuẩn \(\frac{12}{\sqrt{36}} = 2\), nên lệch từ 4 trở lên là lệch từ 2 độ lệch chuẩn trở lên: xác suất khoảng \(2 \cdot 0{,}023 \approx 0{,}046\). Chebyshev chỉ cho cận \(\frac{2^2}{4^2} = 0{,}25\). Biết phân phối xấp xỉ chuẩn cho một con số chặt hơn nhiều.

B8. Như ví dụ ở mục Ranh giới, nhưng mỗi năm vốn nhân với \(1{,}5\) hoặc \(0{,}6\), hai khả năng ngang nhau (giả định). Tính kỳ vọng của số lần vốn được nhân lên sau 10 năm, kết quả ở giữa (5 năm tăng, 5 năm giảm), và xác suất vốn kết thúc dưới mức ban đầu.

Lời giải

Hệ số kỳ vọng mỗi năm vẫn là \(\frac{1{,}5 + 0{,}6}{2} = 1{,}05\), nên kỳ vọng sau 10 năm vẫn là \(1{,}05^{10} \approx 1{,}63\). Kết quả ở giữa là \(1{,}5^5 \cdot 0{,}6^5 = 0{,}9^5 \approx 0{,}59\): mất 41% vốn. Vốn kết thúc dưới mức ban đầu khi \(1{,}5^k \cdot 0{,}6^{10 - k} < 1\), tức khi số năm tăng \(k\) không quá 5, với xác suất \(\frac{1 + 10 + 45 + 120 + 210 + 252}{1024} = \frac{638}{1024} \approx 62\%\). Cùng một kỳ vọng tăng trưởng, nhưng biến động mạnh hơn làm kết quả điển hình tệ đi hẳn.

B9. Với phân phối đuôi dày ở mục Ranh giới, độ lệch chuẩn là \(\sqrt{1{,}75} \approx 1{,}3229\). Biết \(P(\lvert Z \rvert \geq 1{,}984) \approx 0{,}047\)\(P(\lvert Z \rvert \geq 7{,}937)\) gần như bằng 0, tính xác suất một ngày có biến động từ 6 độ lệch chuẩn trở lên.

Lời giải

6 độ lệch chuẩn là \(6 \cdot 1{,}3229 \approx 7{,}937\). Ngày yên ả có biến động theo \(N(0, 1)\), nên vượt \(7{,}937\) gần như không thể. Ngày sóng gió có biến động theo \(N(0, 4^2)\); vượt \(7{,}937\) nghĩa là điểm z của nó vượt \(\frac{7{,}937}{4} \approx 1{,}984\), xác suất khoảng \(0{,}047\). Theo công thức xác suất toàn phần: \(0{,}95 \cdot 0 + 0{,}05 \cdot 0{,}047 \approx 0{,}0024\).

C. Phản ví dụ và chứng minh

C1. Chứng minh \(E[Z] = 0\) với \(Z \sim N(0, 1)\).

Lời giải

Hàm \(g(z) = z\varphi(z)\) là hàm lẻ: \(g(-z) = -z\varphi(z) = -g(z)\), vì \(\varphi(-z) = \varphi(z)\). Do đó với mọi \(a > 0\), \(\int_{-a}^{a} g(z)\,dz = 0\): phần diện tích bên trái và bên phải bằng nhau và trái dấu. Tích phân trên cả trục số là giới hạn của các tích phân này, nên bằng 0; nó hữu hạn vì \(\int_0^\infty z\varphi(z)\,dz = \frac{1}{\sqrt{2\pi}}\) (nguyên hàm của \(z e^{-z^2/2}\)\(-e^{-z^2/2}\)). \(\square\)

C2. Cho \(X \sim N(\mu, \sigma^2)\) và hai số \(c > 0\), \(d\). Chứng minh \(cX + d \sim N(c\mu + d,\ c^2\sigma^2)\).

Lời giải

Với \(a \leq b\): \(P(a \leq cX + d \leq b) = P\left(\frac{a - d}{c} \leq X \leq \frac{b - d}{c}\right) = \int_{(a - d)/c}^{(b - d)/c} \frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{(x - \mu)^2}{2\sigma^2}}\,dx\). Đổi biến \(y = cx + d\), \(dy = c\,dx\): \(x - \mu = \frac{y - (c\mu + d)}{c}\), và tích phân thành \(\int_a^b \frac{1}{c\sigma\sqrt{2\pi}} e^{-\frac{(y - (c\mu + d))^2}{2c^2\sigma^2}}\,dy\), đúng là mật độ của \(N(c\mu + d,\ c^2\sigma^2)\). \(\square\)

C3. Tung một con xúc xắc một lần, được \(X_1\), rồi đặt \(X_2 = \dots = X_n = X_1\). Chứng minh rằng với mọi \(n \geq 12\), biến chuẩn hóa \(\frac{S_n - 3{,}5n}{\sigma\sqrt n}\), với \(\sigma = \sqrt{\frac{35}{12}}\), không bao giờ nằm trong đoạn \([-1; 1]\). Điều này mâu thuẫn với định lý giới hạn trung tâm không?

Lời giải

\(S_n = nX_1\), nên biến chuẩn hóa bằng \(\frac{\sqrt n\,(X_1 - 3{,}5)}{\sigma}\). Vì \(\lvert X_1 - 3{,}5 \rvert \geq 0{,}5\), trị tuyệt đối của nó ít nhất \(\frac{0{,}5\sqrt n}{\sigma} \geq \frac{0{,}5\sqrt{12}}{1{,}708} \approx 1{,}014 > 1\) khi \(n \geq 12\). Vậy xác suất nằm trong \([-1; 1]\) bằng 0, trong khi phân phối chuẩn tắc cho khoảng \(0{,}68\). Không mâu thuẫn: các \(X_i\) không độc lập, nên giả thiết của Định lý 5 không thỏa. \(\square\)

Câu hỏi để ngỏ

Đến giờ mỗi biến ngẫu nhiên đứng một mình. Khi hai đại lượng cùng biến động, như giờ học và điểm thi, quảng cáo và doanh số, làm sao đo mức độ chúng "đi cùng nhau"? Và đi cùng nhau có nghĩa là cái này gây ra cái kia không?