Tương quan (Correlation) và Nhân quả (Causation)
1. Tổng quan
A. Định nghĩa
Tương quan là quan hệ thống kê biểu thị xu hướng cùng biến đổi của hai biến, còn nhân quả là quan hệ có hướng trong đó sự thay đổi của một biến (nguyên nhân) trực tiếp gây ra sự thay đổi của biến khác (kết quả). Câu châm ngôn nổi tiếng nhất của phân tích dữ liệu, "Tương quan không hàm ý nhân quả (Correlation does not imply causation)", cô đọng mối quan hệ giữa hai khái niệm.
Lý do sự phân biệt này có tầm quan trọng căn bản trong phân tích dữ liệu là vì 'nếu nhầm tương quan thành nhân quả, ta sẽ chỉ ra sai nguyên nhân và hệ quả là dồn nguồn lực vào những biện pháp lạc hướng'. Một ví dụ kinh điển: vào mùa hè, doanh số kem và số vụ đuối nước có tương quan dương mạnh. Tuy nhiên, ăn kem không gây ra đuối nước, và cấm bán kem cũng không làm giảm đuối nước. Cả hai hiện tượng chỉ là kết quả của việc cùng bị đẩy lên bởi một biến thứ ba ẩn là 'cái nóng mùa hè' (biến gây nhiễu, Confounder). Nếu đọc sai tương quan này thành nhân quả, có thể nảy ra chính sách vô lý kiểu 'hãy quản lý kem để phòng chống đuối nước'.
Việc hai biến cùng chuyển động chỉ cho ta biết 'cái gì cùng biến đổi', còn hướng và sự tồn tại của nhân quả — 'cái gì gây ra cái gì' — đòi hỏi kiểm chứng riêng (thực nghiệm hoặc suy luận nhân quả). Đặc biệt, trong thời đại dữ liệu lớn, khi số lượng biến tăng bùng nổ, vô số tương quan giả (spurious correlation) phát sinh thuần túy do ngẫu nhiên được quan sát thấy. Dữ liệu càng nhiều không có nghĩa sự thật tự nhiên lộ ra, mà ngược lại, rủi ro bị đánh lừa bởi các mẫu hình ngẫu nhiên càng lớn. Vì vậy, năng lực phân biệt chính xác tương quan và nhân quả là điểm xuất phát của năng lực hiểu dữ liệu (data literacy) và là điều kiện tiên quyết của việc ra quyết định đáng tin cậy.
B. Bối cảnh ra đời và sự cần thiết
Khi việc ra quyết định dựa trên dữ liệu (Data-Driven Decision Making) lan rộng khắp doanh nghiệp và chính phủ, kết quả phân tích ngày càng thường được chuyển ngay thành quyết định chính sách, đầu tư và sản phẩm. Lúc này, nếu nhà phân tích vội vàng diễn giải tương quan thành nhân quả, cả tổ chức sẽ đi sai hướng. Chẳng hạn, chỉ dựa vào tương quan 'khách hàng tiếp xúc với một kênh marketing nhất định có tỷ lệ mua cao' mà dồn ngân sách vào kênh đó, rồi sau mới lộ ra rằng thực chất 'khách hàng vốn đã có ý định mua cao xem kênh đó nhiều (nhân quả ngược hoặc thiên lệch chọn mẫu)', thì ngân sách bị lãng phí. Ngoài ra, mô hình học máy chỉ học tương quan chứ không hiểu nhân quả, nên mô hình chỉ dựa vào tương quan sẽ giảm mạnh năng lực dự báo khi môi trường thay đổi. Do đó, việc rèn luyện phương pháp luận để phân biệt hai quan hệ và kiểm chứng nhân quả được đòi hỏi như yếu tố cốt lõi của chuyên môn phân tích dữ liệu.
2. Cấu trúc và so sánh hai quan hệ
Sự khác biệt giữa tương quan và nhân quả nằm ở 'có hay không có tính định hướng' và 'điều kiện thành lập'. Sơ đồ khái niệm dưới đây biểu thị cấu trúc trong đó tương quan không dẫn thẳng đến nhân quả, và sơ đồ tiếp theo biểu thị các con đường khác nhau mà tương quan được quan sát.
flowchart TB
C["Tương quan: A và B cùng biến đổi"] -.->|"Không nhất thiết đúng"| K["Nhân quả: nguyên nhân → kết quả"]
Z["Biến gây nhiễu Z(biến thứ ba)"] --> A["Biến A"]
Z --> B["Biến B"]
A -.->|"Tương quan bề ngoài"| B
style K fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
style Z fill:#fef3e8,stroke:#ed8f2f,stroke-width:2px
Điểm cốt lõi mà sơ đồ này muốn nói là tương quan quan sát được giữa A và B không nhất thiết có nghĩa là nhân quả trực tiếp 'A→B' hay 'B→A'. Trong hình, nếu biến gây nhiễu Z đồng thời làm A và B chuyển động, thì A và B trông như có tương quan mạnh dù không hề có nhân quả nào giữa chúng (tương quan bề ngoài, đường nét đứt). Tương quan là quan hệ đối xứng không có hướng, nên tự nó không thể phân biệt A là nguyên nhân của B, B là nguyên nhân của A, hay cả hai đều là kết quả của Z. Ngược lại, nhân quả là quan hệ bất đối xứng, có hướng đi từ nguyên nhân đến kết quả.
| Phân loại | Tương quan | Nhân quả |
|---|---|---|
| Ý nghĩa | Xu hướng cùng biến đổi | Nguyên nhân gây ra kết quả |
| Tính định hướng | Không có (đối xứng) | Có (nguyên nhân → kết quả) |
| Đo lường, kiểm chứng | Hệ số tương quan (−1 ~ +1) | Thực nghiệm (RCT), suy luận nhân quả |
| Quan hệ thành lập | Có thể tồn tại mà không có nhân quả | Thường đi kèm tương quan |
| Hàm ý cho ra quyết định | "Cái gì cùng biến đổi" | "Thay đổi cái gì thì kết quả thay đổi" |
Diễn giải bảng bằng lời: tương quan có thể định lượng 'cường độ cùng biến đổi' bằng giá trị từ −1 đến +1 như hệ số tương quan Pearson, nhưng giá trị đó lớn cũng không phải là bằng chứng của nhân quả. Ngược lại, nếu nhân quả tồn tại thì thường cũng quan sát được tương quan (vì nguyên nhân thay đổi thì kết quả cũng thay đổi), nhưng chiều ngược lại không đúng. Chính tính bất đối xứng này khiến hai khái niệm dễ nhầm lẫn nhưng lại khác nhau một cách quyết định.
A. Ba điều kiện thành lập quan hệ nhân quả
Từ thời triết gia John Stuart Mill, người ta thường cho rằng để khẳng định quan hệ nhân quả tồn tại thì phải đồng thời thỏa mãn ba điều kiện. Thứ nhất là đồng biến (covariation), tức nguyên nhân và kết quả phải thực sự cùng biến đổi (sự tồn tại của tương quan). Thứ hai là đi trước về thời gian (temporal precedence), tức nguyên nhân phải xảy ra trước kết quả về mặt thời gian. Thứ ba, và khó nhất, là loại trừ các giải thích khác (non-spuriousness), tức quan hệ quan sát được không được giải thích bởi yếu tố thứ ba như biến gây nhiễu.
Hệ số tương quan chỉ xác nhận được điều kiện thứ nhất, không cho biết điều kiện thứ hai và thứ ba. Đặc biệt, điều kiện thứ ba (loại trừ gây nhiễu) khó thỏa mãn hoàn toàn chỉ bằng quan sát, nên như sẽ thấy dưới đây, cần đến thực nghiệm hoặc các kỹ thuật suy luận nhân quả tinh vi. Nguyên nhân căn bản khiến việc phán đoán nhân quả khó khăn chính là 'cái khó của việc loại trừ' này.
B. Những điểm cần lưu ý khi diễn giải hệ số tương quan
Hệ số tương quan Pearson, chỉ số tiêu biểu để định lượng tương quan, có giới hạn là chỉ nắm bắt cường độ quan hệ 'tuyến tính' giữa hai biến. Nếu hai biến có quan hệ phi tuyến rõ rệt như hình chữ U, thì dù thực tế liên hệ chặt chẽ, hệ số tương quan Pearson vẫn có thể gần bằng 0. Ngược lại, nếu tồn tại một số ít giá trị ngoại lai (outlier) cực đoan, hệ số tương quan có thể bị thổi phồng hoặc đảo chiều bất kể xu hướng thực tế. Bộ tứ Anscombe (Anscombe's quartet) nổi tiếng cho thấy bốn bộ dữ liệu có hệ số tương quan và trung bình giống hệt nhau nhưng hình dạng biểu đồ phân tán hoàn toàn khác nhau, nhắc nhở rằng không được chỉ tin vào một con số mà nhất định phải kiểm tra phân phối bằng đồ thị. Vì vậy, trước khi lấy hệ số tương quan làm căn cứ cho nhân quả, cần thận trọng xem xét cả hình dạng quan hệ, giá trị ngoại lai và cỡ mẫu.
3. Các trường hợp tương quan không phải nhân quả và ví dụ
Các trường hợp quan sát được tương quan nhưng không phải nhân quả trực tiếp có thể tổng hợp thành ba loại chính. Mỗi loại phát sinh vì những lý do khác nhau và cách ứng phó cũng khác nhau.
| Loại | Nguyên lý | Ví dụ tiêu biểu |
|---|---|---|
| Biến gây nhiễu (nguyên nhân chung) | Biến thứ ba Z ảnh hưởng đến cả A và B | Doanh số kem↔đuối nước (nắng nóng) |
| Ngẫu nhiên (tương quan giả) | Phát sinh ngẫu nhiên trong dữ liệu đa biến | Lượng tiêu thụ phô mai của một quốc gia↔số người chết do chăn |
| Nhân quả ngược (nhầm hướng) | Hướng nhân quả ngược với thực tế | "Người đi bệnh viện thường xuyên thì ốm hơn" |
A. Tương quan bề ngoài do biến gây nhiễu (nguyên nhân chung)
Tương quan bề ngoài do biến gây nhiễu là loại phổ biến nhất và nguy hiểm nhất trong thực tiễn trong ba loại. Như ví dụ kem–đuối nước ở trên, khi một nguyên nhân chung (nắng nóng) đồng thời đẩy hai kết quả lên, thì giữa hai kết quả quan sát được tương quan mạnh dù hoàn toàn không có nhân quả trực tiếp. Khi đó, dù điều chỉnh nhân tạo một trong hai biến, biến còn lại cũng không nhúc nhích. Đó chính là lý do chặn bán kem cũng không làm giảm đuối nước.
Trong thực tiễn, những cấu trúc nguyên nhân chung như vậy ẩn nấp khắp nơi. Tương quan 'thành phố có quy mô kinh tế càng lớn thì số vụ tội phạm, số bệnh viện, số quán cà phê đều càng nhiều' chỉ là kết quả của nguyên nhân chung là dân số và quy mô đô thị cùng thổi phồng mọi biến, chứ quán cà phê không gây ra tội phạm. Trong marketing, quan sát 'tháng nào quảng cáo TV nhiều thì doanh thu cũng cao' cũng có thể là do nguyên nhân chung là mùa cao điểm (lễ tết, cuối năm) đồng thời kéo ngân sách quảng cáo và doanh thu lên. Biện pháp là nhận diện trước các biến gây nhiễu bị nghi ngờ và kiểm soát chúng bằng phân tầng, ghép cặp, hiệu chỉnh hồi quy, rồi xác nhận xem quan hệ có còn tồn tại sau khi kiểm soát hay không.
B. Tương quan giả do ngẫu nhiên
Tương quan giả do ngẫu nhiên là cái bẫy đặc biệt trở nên nghiêm trọng trong thời đại dữ liệu lớn. Khi có hàng nghìn cặp biến để so sánh, rất nhiều cặp trong đó cho hệ số tương quan cao thuần túy do ngẫu nhiên dù không hề có liên hệ nhân quả hay cấu trúc nào. Như ví dụ 'lượng tiêu thụ phô mai bình quân đầu người theo năm và số người chết do vướng vào ga trải giường' cùng biến động trong nhiều năm, có thể phát hiện vô số tổ hợp mà về thống kê là tương quan rõ rệt nhưng theo lẽ thường không thể có nhân quả.
Bản chất của vấn đề này nằm ở kiểm định bội (multiple comparisons). Càng kiểm định nhiều quan hệ, xác suất ngẫu nhiên xuất hiện kết quả 'trông có vẻ có ý nghĩa' càng cao. Việc lục lọi dữ liệu một cách mù quáng không có giả thuyết cụ thể để chỉ chọn ra các tương quan có ý nghĩa — nạo vét dữ liệu (data dredging), p-hacking — gói ghém sự ngẫu nhiên đó thành sự thật. Biện pháp phòng vệ là xác định trước giả thuyết trước khi phân tích (đăng ký trước), áp dụng hiệu chỉnh kiểm định bội (như Bonferroni), và tái lập tương quan đã phát hiện trên dữ liệu mới độc lập.
C. Nhân quả ngược (nhầm hướng)
Nhân quả ngược là lỗi chỉ ra hướng của nguyên nhân và kết quả theo chiều ngược lại. Điển hình là nhìn tương quan 'người hay đi bệnh viện thì ốm hơn' rồi kết luận 'đi bệnh viện làm bệnh nặng thêm'. Thực tế là vì ốm nên mới đi bệnh viện, nên mũi tên nhân quả hoàn toàn ngược lại. Tương tự, quan sát 'người sử dụng phòng khám cai thuốc lá có tỷ lệ mắc bệnh phổi cao' cũng bị đảo hướng, vì những người đã chịu tác hại của hút thuốc mới tìm đến phòng khám.
Manh mối then chốt để nhận ra nhân quả ngược là 'đi trước về thời gian' trong các điều kiện thành lập nhân quả đã nêu. Xác nhận bằng dữ liệu chuỗi thời gian hoặc dữ liệu dọc xem nguyên nhân có xảy ra trước kết quả hay không sẽ giúp xác định hướng. Tuy nhiên, trong cấu trúc vòng lặp mà hai biến ảnh hưởng qua lại lẫn nhau (feedback loop), ngay cả việc xác định trước sau cũng không dễ, nên cần thêm sự hiểu biết về cơ chế lý thuyết.
D. Ví dụ ứng dụng trong ngành — A/B testing của Netflix và thương mại điện tử
Lĩnh vực tiêu biểu nơi sự phân biệt tương quan và nhân quả quyết định doanh thu thực tế là văn hóa thực nghiệm của các dịch vụ số. Các doanh nghiệp như Netflix, Amazon không đánh giá 'thumbnail nào kích thích lượt nhấp' hay 'thay đổi thuật toán gợi ý có làm tăng thời gian xem không' chỉ bằng tương quan log đơn thuần. Nếu chỉ xem log, có thể xuất hiện tương quan 'người dùng xem thumbnail lớn thì xem lâu hơn', nhưng đó có thể chỉ là thiên lệch chọn mẫu, khi những người dùng vốn đã quan tâm đến nội dung đó tình cờ được hiển thị thumbnail lớn.
Vì vậy, họ dùng A/B testing, phân bổ ngẫu nhiên người dùng vào hai phiên bản, để tách riêng và đo lường chỉ hiệu ứng nhân quả. Ví dụ, chia ngẫu nhiên hàng triệu người, chỉ hiển thị UI mới cho một nhóm rồi so sánh tỷ lệ chuyển đổi và thời gian lưu lại; nhờ phân bổ ngẫu nhiên, các đặc tính khác của hai nhóm triệt tiêu nhau về trung bình, chỉ còn lại 'khác biệt thực sự do thay đổi UI gây ra'. Trong thương mại điện tử cũng vậy, người ta thực nghiệm hàng trăm thay đổi nhỏ như màu nút thanh toán hay câu hướng dẫn giao hàng, và chỉ áp dụng toàn diện những thay đổi đã được xác nhận có hiệu ứng nhân quả có ý nghĩa thống kê. Việc nội tại hóa nền tảng thực nghiệm như 'cơ chế thể chế để không nhầm tương quan thành nhân quả' là điểm chung của các doanh nghiệp dẫn đầu về dữ liệu.
4. Chuyên sâu: Phương pháp luận suy luận nhân quả và xu hướng mới nhất
Nỗ lực vượt qua tương quan để làm rõ nhân quả gần đây đã nổi lên thành chủ đề cốt lõi của khoa học dữ liệu, và phương pháp luận chia thành hai hướng chính là tiếp cận thực nghiệm và tiếp cận quan sát.
Chuẩn mực của tiếp cận thực nghiệm là thử nghiệm đối chứng ngẫu nhiên (RCT, Randomized Controlled Trial). Khi phân bổ ngẫu nhiên đối tượng vào nhóm can thiệp và nhóm đối chứng, các điều kiện ngoài biến nguyên nhân trở nên giống nhau về trung bình ở hai nhóm, nên biến gây nhiễu được kiểm soát tự động. A/B testing của dịch vụ web và ứng dụng chính là áp dụng nguyên lý này vào thực tiễn, cho người dùng tiếp xúc ngẫu nhiên với hai phiên bản để đo lường một cách nhân quả xem một thay đổi UI cụ thể có thực sự 'gây ra' thay đổi tỷ lệ chuyển đổi hay không. Nhờ cơ chế phân bổ ngẫu nhiên, kết quả A/B testing có thể được diễn giải không phải như tương quan đơn thuần mà như ước lượng hiệu ứng nhân quả.
Khi chỉ có dữ liệu quan sát và thực nghiệm là không thể hoặc phi đạo đức (ví dụ: nhân quả giữa hút thuốc và ung thư phổi), người ta dùng các kỹ thuật suy luận nhân quả (Causal Inference). Tiêu biểu là ghép cặp theo điểm xu hướng (Propensity Score Matching) để ghép nhóm đối chứng tương tự nhóm can thiệp rồi so sánh, phương pháp sai khác kép (Difference-in-Differences) để đối chiếu thay đổi trước–sau khi thực thi chính sách và giữa các nhóm, và biến công cụ (Instrumental Variable), hồi quy gián đoạn (RDD) để né tránh gây nhiễu. Gần đây, mô hình nhân quả cấu trúc (SCM), do-calculus và sơ đồ nhân quả (DAG) của Judea Pearl được trích dẫn rộng rãi làm nền tảng lý thuyết, và học máy nhân quả (Causal ML) kết hợp với học máy đang được nghiên cứu sôi nổi, chẳng hạn ước lượng hiệu ứng can thiệp cá nhân hóa (HTE). Tuy nhiên, suy luận nhân quả dựa trên dữ liệu quan sát phụ thuộc vào giả định mạnh là 'không có biến gây nhiễu nào không được đo lường', nên khi diễn giải kết quả cần thận trọng xem xét cả tính hợp lý của giả định và tránh khẳng định dứt khoát.
Sơ đồ khái niệm dưới đây tổng hợp luồng ra quyết định thực tiễn, xuất phát từ tương quan quan sát được để phán định có phải nhân quả hay không. Khi phát hiện tương quan, không kết luận ngay là nhân quả, mà lần lượt loại trừ các giải thích thay thế rồi chia đường kiểm chứng theo khả năng thực nghiệm.
flowchart TD
S["Quan sát tương quan(hệ số tương quan có ý nghĩa)"] --> Q1{"Đã loại trừ khả năng<br/>ngẫu nhiên/giả?"}
Q1 -->|Không| X1["Kiểm chứng tái lập·hiệu chỉnh kiểm định bội"]
Q1 -->|Có| Q2{"Đã xác nhận đi trước<br/>về thời gian (loại trừ nhân quả ngược)?"}
Q2 -->|Không| X2["Xác định hướng bằng dữ liệu dọc"]
Q2 -->|Có| Q3{"Có thể kiểm soát<br/>biến gây nhiễu?"}
Q3 -->|Có thể thực nghiệm| R["RCT / A/B testing"]
Q3 -->|Không thể thực nghiệm| I["Suy luận nhân quả(ghép cặp·DID·IV)"]
R --> C["Ước lượng hiệu ứng nhân quả"]
I --> C
style C fill:#e8f0fe,stroke:#2f6fed,stroke-width:2px
Cốt lõi của luồng này là phán định nhân quả không phải 'một lần kiểm định thống kê' mà là 'quá trình loại bỏ từng giải thích thay thế'. Chỉ sau khi vượt qua cả ba cửa ải — loại trừ ngẫu nhiên, xác nhận hướng, kiểm soát gây nhiễu — mới có thể thận trọng khẳng định nhân quả. Nếu bỏ qua bất kỳ cửa ải nào, rủi ro rơi vào lỗi kiểu kem–đuối nước đã nêu vẫn còn đó.
Các phương pháp luận này được áp dụng khác nhau tùy lĩnh vực. Trong y học và dịch tễ học, phân bổ ngẫu nhiên thường phi đạo đức, nên người ta kết hợp nghiên cứu thuần tập, nghiên cứu bệnh–chứng với tiêu chí phán đoán nhân quả của Bradford Hill (cường độ liên hệ, tính nhất quán, quan hệ liều–đáp ứng, v.v.) để phán đoán nhân quả tổng hợp. Trong kinh tế học và đánh giá chính sách, thực nghiệm tự nhiên (natural experiment), sai khác kép và hồi quy gián đoạn được dùng rộng rãi, còn trong IT và marketing, A/B testing là chuẩn trên thực tế. Lý do mỗi lĩnh vực phát triển những công cụ khác nhau là vì 'khả năng thực nghiệm' và 'ràng buộc đạo đức' khác nhau theo lĩnh vực, nhưng trong mọi trường hợp mục tiêu đều như nhau — loại trừ gây nhiễu và tách riêng hiệu ứng thuần của nguyên nhân.
5. Các điểm cần cân nhắc và hàm ý
- Cách chắc chắn nhất để kiểm chứng nhân quả là thực nghiệm (RCT, A/B testing). Vì phân bổ ngẫu nhiên kiểm soát biến gây nhiễu, trong tình huống có thể, nên ưu tiên cân nhắc thiết kế thực nghiệm trước phân tích quan sát. Đây là lý do thực nghiệm được gọi là 'tiêu chuẩn vàng (gold standard)' của nhân quả.
- Khi không thể thực nghiệm, kiểm soát gây nhiễu bằng kỹ thuật suy luận nhân quả. Tận dụng ghép cặp theo điểm xu hướng, sai khác kép, biến công cụ, mô hình nhân quả cấu trúc (DAG), v.v., nhưng nhất định phải xem xét cùng lúc các giả định nhận dạng mà mỗi kỹ thuật yêu cầu (không có gây nhiễu, xu hướng song song, v.v.) có được thỏa mãn hay không.
- Cảnh giác với cái bẫy tương quan giả của thời đại dữ liệu lớn. Biến càng nhiều thì tương quan ngẫu nhiên càng bùng nổ, nên khi phát hiện tương quan không được kết luận ngay mà phải kiểm chứng cơ chế nhân quả 'tại sao lại như vậy' và khả năng tái lập. Các cơ chế kiềm chế như hiệu chỉnh kiểm định bội, đăng ký trước giả thuyết sẽ ngăn chặn nạo vét dữ liệu.
- Nội tại hóa góc nhìn nhân quả vào ra quyết định và thiết kế mô hình dự báo. Trong các quyết định chính sách và mang tính chỉ định phải trả lời câu hỏi can thiệp (intervention) 'thay đổi cái gì thì kết quả khác đi', cần ước lượng hiệu ứng nhân quả chứ không phải dự báo dựa trên tương quan. Ngoài ra, mô hình chỉ dựa vào tương quan dễ tổn thương trước sự thay đổi phân phối, nên để có mô hình vững chắc, nên nhận diện các biến ổn định về mặt nhân quả.
Tài liệu tham khảo
- Judea Pearl, "The Book of Why: The New Science of Cause and Effect"
- Tyler Vigen, "Spurious Correlations" (tuyển tập các ví dụ tương quan giả)
Tóm tắt một câu: Tương quan là xu hướng đối xứng mà hai biến cùng biến đổi, nhân quả là quan hệ có hướng trong đó nguyên nhân gây ra kết quả, vì vậy "tương quan≠nhân quả"; do biến gây nhiễu, ngẫu nhiên (tương quan giả) và nhân quả ngược, không thể khẳng định nhân quả chỉ bằng tương quan, nên phải kiểm chứng nhân quả riêng bằng thực nghiệm ngẫu nhiên (RCT, A/B testing) hoặc kỹ thuật suy luận nhân quả thì mới có thể ra quyết định đáng tin cậy.