← Về danh sách
AI & Dữ liệu
#베르누이분포#기하분포#확률분포#통계#130회
Cập nhật lần cuối · 2026-09-13

Phân phối Bernoulli và phân phối hình học

1. Tổng quan

A. Định nghĩa

Phân phối Bernoulli (Bernoulli distribution) là phân phối xác suất rời rạc cho một lần thử duy nhất chỉ có hai kết quả thành công/thất bại, còn phân phối hình học (Geometric distribution) là phân phối xác suất rời rạc cho số lần thử cần thiết cho đến khi xuất hiện thành công đầu tiên khi lặp lại phép thử Bernoulli có xác suất thành công p.

Cả hai phân phối đều xuất phát từ 'phép thử Bernoulli (Bernoulli trial)'. Phép thử Bernoulli là thí nghiệm xác suất trong đó ① chỉ có hai kết quả thành công và thất bại, ② xác suất thành công p của mỗi lần thử là không đổi, và ③ các lần thử độc lập với nhau. Mọi hiện tượng có thể trả lời bằng "có/không" như tung đồng xu, phán định sản phẩm đạt/lỗi, có nhấp vào quảng cáo hay không đều có thể xem là phép thử Bernoulli. Trên nền tảng chung này, "quan sát cái gì làm biến ngẫu nhiên" là điều phân biệt hai phân phối.

Phân phối Bernoulli chú ý tới bản thân kết quả của một lần thử, như "tung đồng xu một lần có ra mặt ngửa không". Biến ngẫu nhiên X là biến chỉ thị (indicator variable) nhận giá trị 1 nếu thành công, 0 nếu thất bại, và đối tượng quan sát là giá trị của kết quả. Ngược lại, phân phối hình học chú ý tới thời gian chờ (số lần thử) cho đến thành công đầu tiên, như "phải tung bao nhiêu lần cho đến khi mặt ngửa xuất hiện lần đầu". Tức là phân phối hình học mô hình hóa tình huống lặp lại cùng một phép thử Bernoulli và chờ cho đến khi thành công. Một bên đo 'kết quả', bên kia đo 'độ dài của sự chờ đợi'.

Khi làm rõ khác biệt góc nhìn này, cách hai phân phối mở rộng thành phân phối nhị thức và nhị thức âm cũng được kết nối một cách tự nhiên. Nếu tăng số lần thử n của phân phối Bernoulli và đếm 'số lần thành công' thì được phân phối nhị thức, còn nếu tổng quát hóa 'thành công đầu tiên' của phân phối hình học thành 'thành công thứ r' thì được phân phối nhị thức âm. Nói cách khác, cả bốn phân phối là một dòng dõi vươn ra từ cùng một gốc là phép thử Bernoulli, và nếu phân loại hiện tượng thành 'một lần·số lần thành công·đến thành công đầu tiên·đến thành công thứ r' thì có thể quyết định nên dùng phân phối nào.

B. Bối cảnh ra đời và sự cần thiết

Các hiện tượng nhị phân (binary) chia thành thành công/thất bại cực kỳ phổ biến trong thực tế. Đỗ hay trượt, linh kiện lỗi hay không, khách truy cập website có chuyển đổi mua hàng hay không, có đáp ứng thuốc trong thử nghiệm lâm sàng hay không đều thuộc loại này. Để xử lý những hiện tượng này bằng xác suất thay vì ước lượng bằng mắt, cần một mô hình toán học biểu diễn kết quả bằng số (0/1) và tính được kỳ vọng, phương sai của phân phối đó. Phân phối Bernoulli và phân phối hình học là những công cụ cơ bản nhất.

Đặc biệt, phân phối hình học xử lý bài toán chờ (waiting) "mất bao lâu cho đến khi thành công lần đầu". Số chu kỳ cho đến khi sản phẩm hỏng lần đầu (độ tin cậy), số lần truy cập cho đến khi khách hàng mới thanh toán lần đầu (phễu marketing), số lần thử lại cho đến khi được nối máy với tư vấn viên ở tổng đài (hàng đợi) đều là bài toán chờ đến thành công đầu tiên. Nếu phân phối Bernoulli xử lý 'một lần phán định', thì phân phối hình học xử lý 'thành công đầu tiên trong sự lặp lại', nên hai phân phối trở thành nền tảng xác suất của quản lý chất lượng, phân tích độ tin cậy, A/B test và lý thuyết hàng đợi.

2. Dòng dõi và góc nhìn quan sát của hai phân phối

Trước hết, tổ chức thành cấu trúc cách hai phân phối rẽ ra từ một gốc là phép thử Bernoulli. Hình dưới đây cho thấy toàn bộ dòng dõi: phân phối được chia theo đối tượng quan sát (kết quả một lần vs số lần đến thành công đầu tiên), rồi lại mở rộng thành nhị thức và nhị thức âm.

flowchart LR
  B["Phép thử Bernoulli<br/>Xác suất thành công p, độc lập"] --> BE["Phân phối Bernoulli<br/>(Kết quả 1 lần X∈{0,1})"]
  B --> GE["Phân phối hình học<br/>(Số lần X đến thành công đầu tiên)"]
  BE --> BN["Phân phối nhị thức<br/>(Số lần thành công trong n lần)"]
  GE --> NB["Phân phối nhị thức âm<br/>(Số lần đến thành công thứ r)"]
  BN --> PO["Phân phối Poisson<br/>(Giới hạn n→∞, p→0)"]
  style B fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
  style BE fill:#fff4e5,stroke:#d9822b
  style GE fill:#fff4e5,stroke:#d9822b

Cốt lõi của dòng dõi này là hướng quan sát. Phân phối Bernoulli và nhị thức theo hướng "cố định số lần thử và đếm số lần thành công" (cố định số lần → quan sát thành công), còn phân phối hình học và nhị thức âm theo hướng ngược lại "cố định số lần thành công và đếm số lần thử cho đến lúc đó" (cố định thành công → quan sát số lần). Ví dụ, "trả lời đúng bao nhiêu câu trong 10 câu" là nhị thức, "phải làm bao nhiêu câu cho đến khi trả lời đúng lần đầu" là hình học. Việc cùng một bài thi mà mô hình thay đổi tùy theo đặt cái gì làm ẩn số là nguyên nhân phổ biến khiến chọn sai phân phối trong thực tiễn, nên thói quen xác định hướng này trước tiên là rất quan trọng.

A. Phân phối Bernoulli — biến chỉ thị của một lần thử

Phân phối Bernoulli là phân phối rời rạc đơn giản nhất. Biến ngẫu nhiên X chỉ có hai giá trị thành công (1) và thất bại (0), hàm khối xác suất là P(X=1)=p, P(X=0)=1−p, viết gộp thành một công thức là P(X=x)=pˣ(1−p)¹⁻ˣ (x=0,1). Kỳ vọng là E(X)=0·(1−p)+1·p=p, tức chính xác suất thành công là giá trị trung bình. Phương sai là Var(X)=p(1−p), đạt cực đại 0.25 khi p=0.5 và hội tụ về 0 khi p càng gần 0 hoặc 1. Điều này khớp với trực giác rằng xác suất thành công càng cực đoan thì độ bất định (biến động) của kết quả càng nhỏ.

Sức mạnh thực sự của phân phối Bernoulli nằm ở chỗ nó là khối xây dựng (building block) của các phân phối phức tạp hơn. Cộng n biến ngẫu nhiên Bernoulli độc lập sẽ được phân phối nhị thức, và sự thật này là điểm khởi đầu để suy ra nhiều định lý của thống kê học. Ví dụ, trên dây chuyền sản xuất có tỷ lệ lỗi p=0.02, lấy một sản phẩm để xem có lỗi hay không là phép thử Bernoulli, còn lấy 100 sản phẩm và đếm số lỗi thì được phân phối nhị thức B(100, 0.02).

Lấy A/B test làm ví dụ thực tiễn. Nếu xác suất một người dùng nhấp vào nút là p=0.12, việc nhấp hay không của từng người dùng tuân theo Bernoulli(0.12). Chỉ số tỷ lệ chuyển đổi (conversion rate) rốt cuộc là trung bình của nhiều phép thử Bernoulli, và căn cứ để sai số chuẩn của tỷ lệ nhấp mẫu được tính bằng √(p(1−p)/n) chính là phương sai Bernoulli p(1−p). Tức là phải hiểu phân phối Bernoulli thì mới tiến tới được tính toán lực kiểm định và cỡ mẫu — "cần thu thập bao nhiêu mẫu để phát hiện khác biệt có ý nghĩa thống kê".

B. Phân phối hình học — chờ đến thành công đầu tiên

Biến ngẫu nhiên X của phân phối hình học là "số thứ tự của lần thử xuất hiện thành công đầu tiên", hàm khối xác suất là P(X=k)=(1−p)ᵏ⁻¹·p (k=1,2,3,…). Công thức này chuyển nguyên văn biến cố "(k−1) lần trước đều thất bại ((1−p)ᵏ⁻¹) và thành công ở lần thứ k (p)", nên diễn giải rất rõ ràng. Kỳ vọng là E(X)=1/p, tức khi xác suất thành công là p thì trung bình phải thử 1/p lần mới đạt thành công đầu tiên. Phương sai là Var(X)=(1−p)/p².

Kỳ vọng 1/p này rất trực quan. Đồng xu có xác suất ngửa 1/2 trung bình cần 2 lần, còn xác suất ra mặt 6 của xúc xắc (1/6) trung bình cần tung 6 lần mới thành công lần đầu. p càng nhỏ thì 1/p càng lớn, nên khớp chính xác với lẽ thường "biến cố càng hiếm thì càng phải chờ lâu". Tuy nhiên, cần lưu ý phân phối hình học là phân phối bất đối xứng có đuôi dài về bên phải. Trung bình là 6 không có nghĩa là phần lớn thành công quanh lần thứ 6, mà trong một số ít trường hợp có thể phải chờ lâu hơn nhiều, nên phương sai rất lớn: (1−p)/p²=(5/6)/(1/36)=30. Nếu chỉ nhìn trung bình để lập kế hoạch sẽ bỏ sót rủi ro đuôi (long tail), nên trong thực tiễn phải xem kèm phân vị (quantile) như "với xác suất 95% thì thành công trong bao nhiêu lần".

Cũng cần lưu ý rằng có hai quy ước định nghĩa. Nếu định nghĩa như ở đây là tổng số lần thử X(=1,2,3,…) đến thành công đầu tiên thì E(X)=1/p, nhưng quy ước định nghĩa là số lần thất bại Y(=0,1,2,…) trước thành công đầu tiên cũng được dùng rộng rãi, khi đó E(Y)=(1−p)/p (Y=X−1). Hai định nghĩa chỉ khác nhau ở điểm bắt đầu quan sát là 1 hay 0, bản chất là như nhau, nhưng trong bài thi hay phần mềm (ví dụ: hàm của NumPy, R) phải xác nhận đang dùng quy ước nào để giá trị không bị lệch.

C. So sánh xác suất, kỳ vọng, phương sai

Đặt cạnh nhau xác suất, kỳ vọng, phương sai của hai phân phối, khác biệt góc nhìn sẽ lộ ra qua công thức. Bảng dưới đây là phần tóm tắt, và sau bảng sẽ giải thích lại ý nghĩa từng giá trị bằng lời.

Phân loại Phân phối Bernoulli Phân phối hình học
Đối tượng quan sát Thành công/thất bại của 1 lần thử Số lần thử đến thành công đầu tiên
Hàm khối xác suất P(X=1)=p, P(X=0)=1−p P(X=k)=(1−p)^(k−1)·p
Không gian mẫu X ∈ {0, 1} X ∈ {1, 2, 3, …}
Kỳ vọng E(X)=p E(X)=1/p
Phương sai p(1−p) (1−p)/p²
Đặc tính tiêu biểu Biến chỉ thị·đơn vị cơ bản của nhị thức Tính không nhớ (memoryless)
Ví dụ Tung đồng xu 1 lần có ngửa không Số lần tung đến mặt ngửa đầu tiên

Đối chiếu đáng chú ý trong bảng là kỳ vọng tạo thành quan hệ nghịch đảo p ↔ 1/p. Xác suất thành công cao (trung bình Bernoulli lớn) thì gặp thành công đầu tiên sớm (trung bình hình học nhỏ), nên hai đại lượng biến đổi ngược chiều. Ngoài ra, phương sai Bernoulli là giá trị hữu hạn đạt cực đại tại p=0.5 (0.25), còn phương sai hình học phân kỳ ra vô cùng khi p tiến về 0. Điều này có nghĩa là độ bất định của "tình huống chờ thành công hiếm hoi" về bản chất là lớn, và trở thành lý do thống kê cần đặt dư phòng (buffer) rộng rãi khi thiết kế độ tin cậy và hàng đợi.

3. Quan hệ mở rộng với các phân phối liên quan

Phép thử Bernoulli là điểm xuất phát của nhiều phân phối. Nhìn dòng dõi này dưới dạng luồng xử lý sẽ làm rõ tiêu chí chọn phân phối phù hợp với tình huống. Sơ đồ dưới đây thể hiện quy trình chọn phân phối theo câu hỏi "cố định cái gì và quan sát cái gì".

flowchart TB
  Q0{"Kết quả có phải chỉ<br/>2 loại thành công/thất bại?"} -->|Không| ETC["Xem xét phân phối khác<br/>(đa thức·chuẩn v.v.)"]
  Q0 -->|Có| Q1{"Có cố định<br/>số lần thử không?"}
  Q1 -->|"1 lần"| BER["Phân phối Bernoulli"]
  Q1 -->|"n lần"| BIN["Phân phối nhị thức<br/>Quan sát số lần thành công"]
  Q1 -->|"Lặp đến khi thành công"| Q2{"Đếm đến thành công<br/>thứ mấy?"}
  Q2 -->|"Thứ 1"| GEO["Phân phối hình học"]
  Q2 -->|"Thứ r"| NEG["Phân phối nhị thức âm"]
  BIN --> POI["Biến cố hiếm n→∞, p→0<br/>Xấp xỉ Poisson"]
  style BER fill:#fff4e5,stroke:#d9822b
  style GEO fill:#fff4e5,stroke:#d9822b

Tổng hợp dòng dõi này thành bảng như sau, và tiếp theo sẽ giải thích 'tại sao' của từng quan hệ.

Phân phối Quan hệ Tham số tiêu biểu
Phân phối nhị thức Số lần thành công trong n lần thử Bernoulli n, p
Phân phối nhị thức âm Số lần thử đến thành công thứ r (tổng quát hóa hình học, r=1 là hình học) r, p
Phân phối Poisson Số biến cố xảy ra trên một đơn vị thời gian/không gian (giới hạn của nhị thức) λ=np
Phân phối mũ Phiên bản liên tục của phân phối hình học (thời gian chờ đến biến cố đầu tiên) λ

Phân phối nhị thức là tổng tự nhiên của Bernoulli. Thực hiện n lần phép thử Bernoulli(p) giống nhau và đếm số lần thành công S=X₁+…+Xₙ thì S~B(n,p), và kỳ vọng np, phương sai np(1−p) là n lần kỳ vọng và phương sai của mỗi Bernoulli. Phân phối nhị thức âm là tổng quát hóa phân phối hình học thành "đến thành công thứ r", với r=1 thì đúng là phân phối hình học. Phân phối Poisson thu được như giới hạn của nhị thức khi n rất lớn, p rất nhỏ và np=λ không đổi, được dùng để đếm 'số biến cố hiếm' như cuộc gọi đến, lỗi phát sinh. Cuối cùng, phân phối mũ là phiên bản thời gian liên tục của phân phối hình học, và hai phân phối tạo thành cặp ở chỗ cùng có tính không nhớ. Việc từ một phép thử Bernoulli phát sinh ra cả một họ phân phối bao gồm cả rời rạc lẫn liên tục như vậy chính là khung xương của mô hình hóa xác suất.

4. Tính không nhớ và các tình huống áp dụng thực tiễn

Tính chất đặc trưng nhất của phân phối hình học là tính không nhớ (Memoryless property). Biểu diễn bằng công thức là P(X>m+n | X>m)=P(X>n), nghĩa là "xác suất phải chờ thêm n lần nữa khi đã thất bại m lần" bằng "xác suất phải chờ n lần ngay từ đầu". Tức là lịch sử thất bại trong quá khứ không ảnh hưởng gì tới xác suất thành công trong tương lai. Trong các phân phối rời rạc, chỉ phân phối hình học có tính không nhớ, và trong các phân phối liên tục thì chỉ có phân phối mũ.

Tính chất này có vẻ trái trực giác nên gây hiểu lầm trong thực tiễn. Ví dụ, tung đồng xu cân đối sáu lần đều ra sấp mà tin rằng "giờ đã đến lúc ra ngửa" là ngụy biện của con bạc (Gambler's fallacy). Vì mỗi lần thử là độc lập nên xác suất ra ngửa của lần tung tiếp theo vẫn chỉ là 1/2. Tính không nhớ chính là cách diễn đạt khác của tính độc lập này, và phải hiểu nó mới xây dựng đúng các mô hình độ tin cậy và hàng đợi. Tuy nhiên, nhiều hệ thống trong thực tế (linh kiện bị mài mòn, tỷ lệ chuyển đổi cải thiện nhờ học hỏi) có các lần thử không độc lập nên tính không nhớ không đúng; trước khi áp dụng mô hình phải kiểm tra trước "xác suất thành công p có thực sự không đổi không".

Các tình huống áp dụng thực tiễn rất rộng. Thứ nhất là phát hiện lỗi trong chất lượng phần mềm. Nếu xác suất một test case bắt được một lỗi cụ thể là p=0.3, số lần kiểm thử cần thiết để tái hiện lỗi đó lần đầu tuân theo phân phối hình học với trung bình 1/0.3≈3.3 lần. Thứ hai là truyền lại trên mạng. Trên liên kết có xác suất truyền gói tin thành công p=0.9, số lần thử đến lần truyền thành công đầu tiên tuân theo phân phối hình học với trung bình 1/0.9≈1.11 lần, nhưng khi tỷ lệ mất gói tăng làm p=0.5 thì trung bình tăng vọt lên 2 lần. Thứ ba là chuyển đổi marketing. Nếu tỷ lệ chuyển đổi mua hàng mỗi lượt truy cập là p=0.05, tính ra trung bình cần 20 lượt truy cập để một người thanh toán lần đầu, và đây là căn cứ thiết kế ngân sách hiển thị quảng cáo retargeting. Cả ba tình huống đều cho thấy công thức đơn giản '1/p' gắn trực tiếp với hoạch định tài nguyên.

5. Chuyên sâu — Hướng ra đề dự kiến và chiến lược cấu trúc bài thi

Trong kỳ thi Kỹ sư chuyên nghiệp Quản lý Thông tin, phân phối xác suất thường được ra đề dưới dạng tự luận "Hãy giải thích khác biệt giữa hai phân phối và bàn về ứng dụng thực tiễn" hơn là bài toán tính riêng lẻ (ví dụ: các kỳ thi liên quan đến thống kê như kỳ thi thứ 130). Vì vậy, cấu trúc 4 bước hiệu quả cho bài làm là: ① trình bày chính xác định nghĩa và hàm khối xác suất của hai phân phối, ② suy ra hoặc so sánh kỳ vọng, phương sai, ③ giải thích quan hệ mở rộng theo dòng dõi Bernoulli→nhị thức→hình học→nhị thức âm kèm hình vẽ, rồi ④ kết thúc bằng đặc tính cốt lõi như tính không nhớ và cạm bẫy như ngụy biện của con bạc qua tình huống cụ thể.

Đặc biệt, những điểm người chấm dùng để phân loại là đã diễn đạt rõ bằng lời "khác biệt góc nhìn (kết quả một lần vs chờ đến thành công đầu tiên)" hay chưa và đã giải thích đối chiếu kỳ vọng p↔1/p bằng ví dụ số hay chưa. Chỉ liệt kê công thức sẽ là yếu tố bị trừ điểm, nên tốt hơn là đưa vào những ví dụ kiểm chứng được ngay như đồng xu (p=1/2, trung bình 2 lần), xúc xắc (p=1/6, trung bình 6 lần) để tăng độ tin cậy của lập luận. Ngoài ra, nếu liên kết với thực tiễn CNTT như tính cỡ mẫu cho A/B test, truyền lại trên mạng, phân tích độ tin cậy thì 'góc nhìn Kỹ sư chuyên nghiệp' sẽ lộ rõ và có lợi cho điểm cao.

Gần đây, các phân phối này được chú ý trở lại trong bối cảnh phân tích dữ liệu và học máy. Hồi quy logistic là mô hình xem mỗi quan sát là một biến ngẫu nhiên Bernoulli và cực đại hóa log-likelihood của nó, và trong khám phá (exploration) của học tăng cường, số lần thử đến phần thưởng đầu tiên cũng được mô hình hóa bằng phân phối hình học. Thêm một hai câu về các ứng dụng mới này có thể cho thấy khái niệm không dừng ở lý thuyết mà kết nối với công nghệ hiện hành.

6. Các điểm cần cân nhắc và hàm ý

  1. Chọn phân phối bắt đầu từ 'hướng quan sát'. Phải xác định trước hiện tượng là 'kết quả một lần·số thành công trong n lần·đến thành công đầu tiên·đến thành công thứ r' thì mới chọn đúng mô hình giữa Bernoulli, nhị thức, hình học, nhị thức âm. Nhầm hướng sẽ làm lệch toàn bộ phép tính kỳ vọng và phương sai, nên phải xử lý như chiếc cúc áo đầu tiên của mô hình hóa.

  2. Kiểm chứng giả định (độc lập, p không đổi) là tiền đề áp dụng. Cả hai phân phối chỉ đúng khi các lần thử độc lập và xác suất thành công p không đổi. Trong tình huống p thay đổi hoặc các lần thử phụ thuộc nhau như linh kiện bị mài mòn hay tỷ lệ chuyển đổi cải thiện nhờ học hỏi, tính không nhớ bị phá vỡ, nên phải thay thế bằng mô hình không thuần nhất (p phụ thuộc thời gian) hoặc kỹ thuật phân tích sống sót (survival analysis).

  3. Không chỉ nhìn trung bình mà xem cả phương sai và đuôi. Phân phối hình học là phân phối bất đối xứng có đuôi dài về bên phải nên giá trị không tập trung quanh trung bình (1/p). Trong thiết kế độ tin cậy, hàng đợi, SLA, phải xác định dung lượng dự phòng dựa trên phân vị 95, 99 thay vì thời gian chờ trung bình thì mới kiểm soát được rủi ro đuôi.

  4. Góc nhìn dòng dõi (họ) mở rộng ứng dụng. Bernoulli dẫn tới nhị thức và hồi quy logistic, hình học dẫn tới nhị thức âm và phân phối mũ, nhị thức dẫn tới Poisson. Thay vì học thuộc từng phân phối riêng lẻ, nếu hiểu chúng như một họ phát sinh từ một phép thử Bernoulli thì có thể giải các bài toán ở những miền khác nhau như A/B test, quản lý chất lượng, độ tin cậy, học tăng cường bằng một khung nhất quán.

  5. Cảnh giác với ngụy biện của con bạc. Tính không nhớ chính là tính độc lập, nên quan niệm rằng thất bại liên tiếp làm tăng xác suất thành công lần sau là sai. Hiểu lầm này làm méo mó quyết định về chất lượng và rủi ro, nên điều quan trọng là xây dựng thành văn hóa tổ chức việc diễn giải xác suất dựa trên dữ liệu.

Tài liệu tham khảo


Tóm tắt một câu: Phân phối Bernoulli biểu diễn thành công/thất bại của một lần thử (kỳ vọng p, phương sai p(1−p)), phân phối hình học biểu diễn số lần thử đến thành công đầu tiên (kỳ vọng 1/p, tính không nhớ); cả hai đều xuất phát từ phép thử Bernoulli nhưng khác nhau ở góc nhìn 'quan sát kết quả' và 'quan sát sự chờ đợi', và cùng tạo thành một họ phân phối mở rộng sang nhị thức, nhị thức âm, Poisson và phân phối mũ.