← 목록으로
AI·데이터
#중심극한정리#t검정#z검정#가설검정#통계#132회#125회
최종 업데이트 · 2026-10-01

중심극한정리·t-검정·z-검정

1. 개요

가. 정의

표본에서 얻은 통계량으로 모집단의 특성을 추론하는 통계적 가설검정(Statistical Hypothesis Testing) 의 기반 이론. 중심극한정리(CLT) 가 표본평균의 정규 근사를 보장하고, 그 위에서 z-검정·t-검정이 모평균에 대한 가설을 확률적으로 판정한다.

세 개념은 하나의 논리 사슬로 연결된다. 우리는 모집단 전체를 알 수 없어 표본만 본다 → 표본평균은 뽑을 때마다 흔들리는 확률변수다 → 그 흔들림의 분포를 알아야 추론이 가능하다 → CLT가 그 분포가 정규분포임을 보장한다 → 그 정규성을 이용해 z·t-검정이 "관측된 차이가 우연인지 진짜인지"를 판정한다. 즉 CLT는 추론의 "이론적 허가증", z·t-검정은 그 허가 위에서 작동하는 "판정 도구"다.

이 삼각 구조는 추상적 수학이 아니라 데이터 기반 의사결정의 실질적 엔진이다. 신약이 위약보다 효과가 있는지, A안 화면이 B안보다 전환율이 높은지, 공정이 규격을 벗어났는지, 두 머신러닝 모델의 성능 차이가 의미 있는지를 모두 이 틀로 판정한다. 기술사 관점에서는 "검정 통계량 공식 암기"를 넘어, 가정(정규성·독립성·등분산)의 성립 여부를 점검하고, 유의성과 효과크기를 함께 해석하며, 표본 크기를 설계하는 통계적 사고가 핵심이다.

세 개념을 간단히 자리매김하면 다음과 같다. CLT는 "표본평균이 왜 정규분포를 따르는가"를 설명하는 이론적 기반이고, z-검정은 "모분산을 아는(또는 대표본 비율) 경우"의 판정 도구이며, t-검정은 "모분산을 모르는 소표본"의 판정 도구다. 셋은 분리된 주제가 아니라 하나의 추론 체계를 이루므로, 함께 묶어 이해하고 서술해야 한다.

나. 등장 배경 및 필요성

현실에서 우리는 모집단 전체를 조사할 수 없어 일부 표본만 관측한다. 전수조사는 비용·시간·물리적 제약(파괴검사 등)으로 불가능한 경우가 대부분이기 때문이다. 문제는 표본평균 x̄가 뽑을 때마다 달라지는 확률변수라는 점이며, 이 흔들림(표집오차, Sampling Error)을 정량화하지 못하면 "표본에서 관측된 차이가 진짜 모집단의 차이인지, 단지 우연인지"를 판단할 수 없다.

중심극한정리는 바로 이 표본평균의 흔들림이 정규분포라는 알려진 형태를 따른다는 것을 보장함으로써, 확률적으로 계산 가능한 추론의 문을 연다. "흔들림의 분포를 안다"는 것은 곧 "관측값이 우연히 나올 확률을 계산할 수 있다"는 뜻이고, 이 확률(p-value)이 가설 판정의 근거가 된다. z·t-검정은 그 정규 근사를 실제 가설 판정에 옮기는 구체적 도구다.

이 삼각 구조가 A/B 테스트, 통계적 공정관리(SPC), 임상시험, 모델 성능 비교 등 거의 모든 데이터 기반 의사결정의 밑바탕이 된다. 빅데이터·AI 시대에도 "관측된 차이가 통계적으로 유의한가"를 묻는 가설검정의 중요성은 오히려 커지고 있으며, 잘못된 검정 적용은 거짓 발견·재현 불가능한 결론으로 이어진다.

다. 가설검정의 기본 절차

가설검정은 다음 단계를 밟는다. ① 귀무가설(H₀: 차이 없음)과 대립가설(H₁: 차이 있음)을 세운다. ② 유의수준 α(통상 0.05)를 사전에 정한다. ③ 데이터로 검정통계량(z 또는 t)을 계산한다. ④ 그 값의 p-value를 구해 α와 비교한다. ⑤ p < α이면 H₀를 기각하고 "유의한 차이"로, 아니면 "기각 실패"로 판정한다. 이 절차에서 ①·②를 데이터를 보기 전에 확정하는 것이 신뢰성의 핵심이다. 결과를 본 뒤 가설이나 유의수준을 바꾸면 검정의 통계적 의미가 무너진다.

2. 중심극한정리(CLT)

가. 전체 개념 구조

flowchart TD
  POP["모집단(분포 형태 무관)"] -->|크기 n 표본 반복 추출| SAMP["표본평균 x-bar 계산"]
  SAMP -->|n이 충분히 큼| CLT["표본평균 분포가 정규분포에 근접"]
  CLT -->|모분산 앎| Z["z-검정"]
  CLT -->|모분산 모름| T["t-검정"]
  Z --> DEC["모평균 가설 판정"]
  T --> DEC

위 구조도는 세 개념의 관계를 한눈에 보여준다. 출발점은 어떤 형태든 상관없는 모집단이고, 거기서 크기 n의 표본을 반복 추출해 평균을 구하면, CLT에 의해 그 평균들의 분포가 정규분포로 수렴한다. 이 정규성 위에서 모분산을 아는지 여부에 따라 z-검정과 t-검정으로 갈라지고, 최종적으로 모평균에 대한 가설(같다/다르다)을 판정한다.

일상적 예로 여론조사를 들 수 있다. 전 국민의 지지율(모비율)은 알 수 없지만, 1,000명을 무작위로 뽑아 지지율을 구하면 CLT에 의해 그 표본비율의 분포가 정규분포에 근접한다. 그래서 "지지율 48%, 오차범위 ±3%p(95% 신뢰수준)"처럼 구간을 제시할 수 있다. 여기서 오차범위가 바로 표준오차에 1.96을 곱한 값이며, 표본을 4배로 늘려야 오차범위가 절반이 된다는 √n 법칙이 그대로 적용된다.

바로 이 성질 때문에 CLT는 "통계학에서 가장 중요한 정리"로 불린다. 모집단 분포를 몰라도, 표본만 충분하면 정규분포라는 단일한 수학적 도구로 추론을 통일할 수 있기 때문이다. z·t-검정뿐 아니라 신뢰구간, 회귀분석의 계수 검정, 관리도 등 수많은 기법이 이 하나의 정리 위에 세워져 있다.

나. 정의와 원리

모집단의 분포 형태와 무관하게, 표본 크기 n이 충분히 크면 표본평균 x̄의 분포가 정규분포에 근접한다는 정리.

핵심은 "모집단이 정규분포가 아니어도" 성립한다는 데 있다. 예컨대 주사위 눈금은 1~6이 균등한 균일분포이지만, 주사위를 30번 던져 얻은 평균을 반복해서 구하면 그 평균값들의 분포는 종 모양의 정규분포에 수렴한다. 심지어 한쪽으로 치우친 지수분포·소득분포 같은 비대칭 모집단에서도, 표본평균을 충분히 많이 모으면 그 분포는 정규 형태로 모인다. 여러 독립 요인의 합·평균은 개별 분포의 치우침이 서로 상쇄되면서 정규 형태로 수렴하기 때문이다.

이때 표본평균의 기댓값은 모평균 μ로 그대로 유지되고(불편성), 흩어짐을 나타내는 표준오차(Standard Error)는 σ/√n 으로 줄어든다. 여기서 √n이 분모에 있다는 점이 매우 중요하다. 표본을 4배로 늘려야 오차가 절반으로 줄기 때문에, 정밀도를 두 배 높이려면 비용은 네 배가 든다. 이 체감(diminishing returns) 구조가 표본 크기 설계의 핵심 트레이드오프이며, "무작정 표본을 늘리는" 접근이 비효율적인 이유다.

숫자로 보면 더 분명하다. 모표준편차 σ=10일 때 n=100이면 표준오차는 10/10=1.0이지만, 오차를 절반인 0.5로 줄이려면 n을 400으로 네 배 늘려야 하고, 0.25로 줄이려면 1600이 필요하다. 즉 표본을 아무리 키워도 오차가 0으로 수렴하는 속도는 점점 느려진다. 이 때문에 실무에서는 "필요한 정밀도를 먼저 정하고 그에 맞는 최소 표본"을 역산하는 접근(검정력 분석)이 합리적이다.

"충분히 크다"의 경험적 기준은 흔히 n≥30이지만, 이는 절대 규칙이 아니라 모집단의 치우침(왜도) 정도에 좌우된다. 모집단이 이미 정규에 가까우면 작은 n으로도 근사가 좋고, 심하게 비대칭이거나 극단값이 많으면 n이 수백이어야 안정적이다. 따라서 실무에서는 데이터의 분포 형태를 먼저 시각화(히스토그램·Q-Q plot)해 근사 타당성을 점검하는 것이 바람직하다.

다. 왜 중요한가 — 추론의 토대

CLT가 없다면 우리는 표본평균이 모평균에서 얼마나 벗어날 수 있는지를 확률로 말할 수 없고, 신뢰구간도 가설검정도 성립하지 않는다. 예컨대 "표본평균이 52이니 모평균도 대략 52 근처일 것"이라는 직관을 "95% 신뢰로 모평균은 50.0~54.0 사이"처럼 정량적 구간으로 바꿀 수 있는 것이 바로 CLT 덕분이다. 표준오차 σ/√n에 정규분포의 1.96배를 곱해 구간을 만드는 것이 신뢰구간의 원리이며, 이는 가설검정과 동전의 양면 관계다(구간이 μ₀를 포함하지 않으면 유의하다는 결론과 일치). 이처럼 CLT는 추정과 검정을 하나로 묶는 추론 통계 전체의 토대다.

항목 내용 의미
표본평균 기댓값 모평균 μ와 동일 치우침 없는 추정(불편성)
표본평균 표준오차 σ/√n n이 클수록 오차 감소(√n 비례)
분포 형태 정규분포에 근접 모분포 미상이어도 정규 기반 추론
경험적 조건 통상 n ≥ 30 왜도가 크면 더 큰 n 필요

3. z-검정과 t-검정

가. 선택 기준

flowchart LR
  Q{"모분산 sigma 아는가?"} -->|예| Z["z-검정(표준정규분포)"]
  Q -->|아니오| T2{"표본이 큰가?"}
  T2 -->|작다| T["t-검정(t분포, 자유도 n-1)"]
  T2 -->|크다| Z

두 검정의 갈림길은 모분산 σ²을 아느냐이다. 현실에서 모평균 μ를 모르면서 모분산 σ²만 아는 경우는 드물기 때문에, 실무의 대부분은 표본표준편차 s로 σ를 추정하는 상황이다. 여기서 문제가 생긴다. s 자체가 표본마다 흔들리는 추정값이므로, 평균의 불확실성에 더해 분산 추정의 불확실성이 이중으로 더해진다.

t분포는 바로 이 추가 불확실성을 반영하기 위해 정규분포보다 꼬리를 두껍게 만든 분포다. 꼬리가 두껍다는 것은 극단값이 나올 확률을 더 크게 본다는 뜻이고, 그 결과 같은 유의수준에서 기각에 필요한 임계값이 더 커져 더 보수적인(신중한) 판정이 이뤄진다. 표본이 작을수록(자유도가 작을수록) 꼬리가 더 두꺼워지고, n이 커지면 s가 σ에 가까워지면서 t분포는 점차 정규분포로 수렴한다. 그래서 대표본(n≥30)에서는 t-검정과 z-검정의 결과가 사실상 같아져, 실무에서는 모분산을 모르면 표본 크기와 무관하게 t-검정을 기본으로 쓰기도 한다.

그렇다면 z-검정은 언제 쓰는가. 모분산을 실제로 아는 경우는 드물지만, 비율(proportion) 검정이 대표적인 z-검정 활용처다. 비율 데이터는 성공/실패의 이항분포를 따르고 분산이 p(1-p)로 평균에 의해 결정되므로, 표본이 크면 정규근사(z)로 전환율·불량률 같은 비율 차이를 검정한다. 대규모 A/B 테스트의 전환율 비교가 흔히 z-검정(또는 카이제곱 검정)으로 다뤄지는 이유다. 즉 "평균 비교는 주로 t, 대규모 비율 비교는 주로 z"가 실무의 대략적 구도다.

나. 특성 비교

구분 z-검정 t-검정
사용 분포 표준정규(z) t분포(자유도 n-1)
모분산 알려짐(σ 사용) 미지(표본표준편차 s 사용)
표본 크기 대표본(n≥30) 전제 소표본(n<30)에도 적용
분포 특징 고정된 종 모양 꼬리가 두꺼움 → n↑ 시 정규 수렴
대표 용도 대규모 품질·비율 검정 소표본 평균 비교, A/B 테스트

다. 검정통계량과 계산 예시

검정통계량은 직관적으로 "관측된 차이를 그 차이의 표준오차로 나눈 값", 즉 "신호 대 잡음비"로 이해할 수 있다. z = (x̄-μ₀)/(σ/√n), t = (x̄-μ₀)/(s/√n) 이며, 분자는 관측 평균과 가설 평균의 차이(신호), 분모는 표집오차(잡음)다. 이 값이 클수록 "우연으로 보기 어려운 큰 차이"를 뜻한다.

예를 들어 어떤 공정의 목표 평균이 μ₀=50이고, 표본 64개의 평균이 x̄=52, 표본표준편차 s=8이라 하자. 표준오차는 8/√64 = 8/8 = 1이므로 t = (52-50)/1 = 2.0이 된다. 자유도 63의 t분포에서 이 값의 양측 p-value가 유의수준(예: 0.05)보다 작으면 귀무가설(평균=50)을 기각하고 "평균이 50과 다르다"고 판정한다. 반대로 p-value가 크면 "차이가 우연 범위 안"이라고 보아 기각하지 못한다.

여기서 흔한 오해를 짚을 필요가 있다. 귀무가설을 기각하지 못한 것은 "차이가 없음을 증명한" 것이 아니라 "차이가 있다고 할 증거가 부족한" 것이다. 또한 p-value는 "귀무가설이 참일 확률"이 아니라 "귀무가설이 참이라고 가정할 때 관측된 값 이상의 극단값이 나올 확률"이라는 점도 정확히 이해해야 올바른 해석이 가능하다.

라. 단측/양측 검정과 두 종류의 오류

검정은 대립가설의 방향에 따라 양측검정(two-tailed) 과 단측검정(one-tailed) 으로 나뉜다. "평균이 50과 다른가"처럼 방향을 특정하지 않으면 양측검정으로 분포의 양쪽 꼬리를 모두 본다. "평균이 50보다 큰가"처럼 방향이 정해지면 단측검정으로 한쪽 꼬리만 보며, 같은 유의수준에서 기각이 더 쉬워진다. 다만 방향을 데이터를 본 뒤에 정하는 것은 p-해킹에 해당하므로, 단측검정은 반드시 사전에 근거를 두고 선택해야 한다.

가설검정에는 피할 수 없는 두 종류의 오류가 있다. 1종 오류(α) 는 실제로 차이가 없는데 "있다"고 잘못 기각하는 것(거짓 양성)이고, 2종 오류(β) 는 실제로 차이가 있는데 "없다"고 놓치는 것(거짓 음성)이다. α를 낮추면(더 엄격하게) β가 커지는 상충 관계가 있어, 두 오류의 비용을 비교해 유의수준을 정해야 한다. 예컨대 질병 진단처럼 놓치면 치명적인 경우는 β를 줄이는 쪽으로, 무고한 경보가 비싼 경우는 α를 줄이는 쪽으로 설계한다. 검정력(1-β)은 이 2종 오류를 얼마나 잘 피하는지를 나타낸다.

4. t-검정의 유형

t-검정은 비교 구조에 따라 세 가지로 나뉘며, 상황에 맞는 유형을 고르는 것이 결과의 타당성을 좌우한다. "무엇과 무엇을 비교하는가", "두 집단이 독립인가 짝지어졌는가"를 먼저 정리해야 올바른 유형이 결정된다. 유형 선택은 공식 선택이 아니라 실험·데이터의 구조를 이해하는 문제라는 점이 핵심이다.

일표본(One-sample) t-검정은 한 집단의 평균이 특정 기준값과 같은지를 본다. 예컨대 신제품 배터리의 실측 수명 평균이 공표 스펙인 10시간과 유의하게 다른지를 검정한다. 품질관리에서 "공정이 목표치를 유지하는가"를 판정할 때 쓰인다.

독립표본(Independent two-sample) t-검정은 서로 무관한 두 집단의 평균을 비교하며, A/B 테스트의 표준 도구다. 예컨대 웹페이지 A안과 B안을 각각 다른 방문자 그룹에 노출해 전환율(또는 체류시간) 평균을 비교한다. 이때 두 집단의 분산이 같다고 보기 어려우면, 등분산을 가정하지 않는 Welch's t-검정을 쓰는 것이 더 안전하다.

대응표본(Paired) t-검정은 동일 대상을 처치 전후로 두 번 측정해 그 차이의 평균을 검정한다. 같은 환자의 복약 전후 혈압, 같은 사용자의 UI 개선 전후 작업 시간처럼, 개인차라는 잡음을 제거해 검정력이 높다. 독립표본보다 적은 표본으로도 효과를 잡아낼 수 있어, 전후 비교가 가능한 실험 설계에서 선호된다.

왜 대응표본이 검정력에서 유리한지는 분산 구조로 이해할 수 있다. 사람마다 기본 혈압이 크게 다르면 독립표본에서는 그 큰 개인차가 분모(표준오차)를 키워 차이를 가린다. 반면 대응표본은 "같은 사람의 전후 차이"만 보므로 개인차가 상쇄되어 분모가 작아지고, 같은 효과라도 더 쉽게 유의하게 검출된다. 단, 전후 측정 사이에 다른 변화(학습효과·시간경과)가 끼면 처치 효과와 혼동되므로, 대조군 설계로 이를 통제해야 한다.

유형 용도 예시
일표본 t 한 집단 평균 vs 기준값 스펙 대비 실측 수명
독립표본 t 무관한 두 집단 평균 비교 A/B 테스트 전환율
대응표본 t 동일 대상 전후 비교 처치 전후 혈압 변화

세 유형을 혼동하면 결과가 왜곡된다. 예컨대 같은 사람의 전후 데이터를 독립표본으로 잘못 처리하면 개인차가 잡음으로 남아 검정력이 떨어지고, 반대로 서로 다른 사람의 데이터를 대응표본으로 묶으면 존재하지 않는 짝을 가정하는 오류가 된다. 또한 세 집단 이상을 비교할 때 t-검정을 여러 번 반복하면 다중비교 문제가 생기므로, 이 경우에는 분산분석(ANOVA) 으로 한 번에 비교하고 사후검정으로 어느 쌍이 다른지 본다. 즉 t-검정은 "두 집단(또는 한 집단)의 평균 비교"라는 범위 안에서만 적용하는 것이 원칙이다.

5. 심화 — 실무 함정과 통계 개혁 동향

다중비교(Multiple Comparisons) 문제는 실무에서 가장 흔한 함정이다. 유의수준 5%로 검정을 20번 반복하면, 실제로 아무 차이가 없어도 평균 1번은 우연히 "유의"하게 나온다. 더 일반화하면, 독립적인 검정을 m번 할 때 하나라도 거짓 양성이 날 확률은 1-(1-0.05)^m으로, m=10이면 약 40%에 이른다. A/B 테스트에서 여러 지표를 동시에 보거나 중간 결과를 반복해서 들여다보면(peeking) 거짓 양성이 급증하는 이유다. 이를 막기 위해 Bonferroni 보정(유의수준을 검정 수로 나눔), FDR 통제, 사전에 정한 분석 계획, 순차검정 설계가 필요하다.

제조 현장의 통계적 공정관리(SPC)가 CLT의 대표적 실무 적용이다. 관리도(Control Chart)는 부분군 평균을 반복 측정해 그 분포가 정규라는 CLT 전제 위에서 ±3σ 관리한계선을 긋고, 평균이 이 범위를 벗어나면 공정 이상으로 경보한다. 예컨대 목표 두께 50μm, 공정 표준편차 2μm인 도금 공정에서 부분군 크기 n=25라면 표본평균의 표준오차는 2/√25=0.4μm이므로, 관리한계는 대략 50±1.2μm로 좁게 설정된다. 개별 측정값이 아니라 평균을 관리하므로 CLT 덕분에 더 민감하고 안정적인 이상 탐지가 가능하다.

p-해킹(p-hacking)과 재현성 위기도 최근 데이터 과학계의 핵심 화두다. 유의한 결과가 나올 때까지 변수·부분집합·분석법을 바꿔가며 시도하면 p-value는 신뢰를 잃는다. 이에 미국통계학회(ASA)는 2016년 성명에서 "p<0.05라는 이분법적 임계값에 의존하지 말고, 효과크기·신뢰구간·연구 맥락을 종합 해석하라"고 권고했다. 즉 "유의한가/아닌가"를 넘어 "얼마나 큰 차이인가, 얼마나 불확실한가"를 함께 보고하는 방향으로 통계 실무가 이동하고 있다.

효과크기(Effect Size)와 검정력(Power) 설계가 그 대안의 핵심이다. n이 매우 크면 실무적으로 무의미할 만큼 사소한 차이도 "통계적으로 유의"해진다. 예컨대 수백만 사용자의 A/B 테스트에서는 전환율 0.01%p 차이도 p<0.05가 나오지만, 그 차이가 사업적으로 의미 있는지는 별개 문제다. 따라서 Cohen's d 같은 효과크기와 신뢰구간을 함께 보고해야 "의미 있는 차이"인지 판단할 수 있다. 반대로 사전에 검정력 분석(power analysis) 으로 "원하는 효과를 유의수준 α, 검정력 1-β로 잡아내려면 표본이 몇 개 필요한지"를 설계해야, 표본 부족으로 실제 효과를 놓치는(2종 오류) 일을 막는다. 이는 CLT의 σ/√n 구조와 직결된 실무 응용이다.

AI·데이터 분야 적용과 기출 연계

머신러닝에서도 이 틀은 그대로 쓰인다. 두 모델 A·B의 정확도를 여러 번(교차검증 폴드별)에 걸쳐 측정하고 대응표본 t-검정으로 "성능 차이가 유의한가"를 판정하거나, 온라인 실험 플랫폼이 CLT 기반으로 신뢰구간을 실시간 계산해 실험 종료 시점을 정한다. 다만 샘플이 독립이 아니거나(시계열·반복측정) 정규성이 깨지면 표준 t-검정 대신 교정된 검정·부트스트랩·베이지안 방법을 함께 고려해야 한다. 본 주제는 정보관리기술사에서 통계적 품질관리, 데이터 분석, 실험 설계, 신뢰구간·회귀분석([[correlation-causation]]) 등과 연계되어 단답형·논술형으로 출제되므로, 공식 암기가 아니라 "가정→검정 선택→해석→의사결정"의 사고 흐름으로 정리하는 것이 효과적이다.

6. 고려사항 및 시사점

  • 가정 검증이 선행: t·z-검정은 관측치의 정규성·독립성·(두 집단 비교 시) 등분산을 전제한다. 위반 시 Welch's t(이분산), Mann-Whitney U·Wilcoxon(비정규) 같은 비모수 검정으로 대체해야 결과 왜곡을 막는다. 가정 점검 없이 공식만 적용하는 것이 가장 흔한 오류다.
  • 유의성과 효과크기 병행 보고: p-value는 "차이가 우연인가"만 말할 뿐 "차이가 실무적으로 큰가"는 말하지 못한다. Cohen's d·신뢰구간을 함께 제시하고, 큰 표본에서의 "통계적 유의 ≠ 실질적 중요"를 명확히 구분한다.
  • 표본 크기·검정력의 사전 설계: CLT의 σ/√n 구조상 정밀도는 √n에 비례하므로, 비용 대비 적정 표본을 검정력 분석으로 미리 산정한다. 과소표본은 효과를 놓치고(2종 오류), 과대표본은 비용 낭비와 무의미한 유의성을 낳는다.
  • 다중비교·반복검정 통제: 여러 지표·반복 조회로 인한 거짓 양성을 Bonferroni 등 보정과 사전 분석계획으로 통제하고, A/B 테스트는 조기 중단 규칙을 미리 정한다.
  • 표본의 대표성·무작위성 확보: CLT와 검정은 표본이 모집단을 대표한다는 전제에 선다. 편향된 표집(자기선택·생존편향)은 아무리 n을 키워도 교정되지 않으므로, 무작위 추출과 표본 설계가 통계량 계산보다 선행하는 더 근본적 과제다.
  • p-value의 올바른 해석과 커뮤니케이션: p-value는 "귀무가설하에서 극단값이 나올 확률"일 뿐 "가설이 참일 확률"도, "효과의 크기"도 아니다. 의사결정자에게 보고할 때는 "유의하다/아니다"의 이분법 대신 효과크기·신뢰구간·불확실성을 함께 전달해 과잉·과소 해석을 막아야 한다.
  • 실무 적용과 자동화: A/B 테스트 전환율 비교, 제조 공정의 품질 이탈 감지(SPC), 두 ML 모델의 성능 유의차 검증 등에 직접 쓰이며, 데이터 파이프라인·실험 플랫폼에 검정 로직을 내재화하되 가정 점검과 해석은 사람이 책임져야 한다. 통계 도구의 자동화가 늘수록 "무엇을 검정하는지, 가정이 성립하는지"를 이해하는 역량이 더 중요해진다.

참고자료


한 줄 요약: CLT는 n이 크면 모분포와 무관하게 표본평균이 정규분포(평균 μ, 표준오차 σ/√n)에 근접 함을 보장하고, 모분산을 알면 z-검정, 모르면(소표본) t-검정(t분포, 자유도 n-1) 으로 모평균 가설을 판정하되, 정규성·독립성·등분산 가정 점검과 효과크기·검정력·다중비교 통제를 함께 고려해야 신뢰할 수 있다.