본문으로 건너뛰기

A/B 테스트 유의성 계산기

A/B 테스트 유의성 계산기는 두 버전의 방문자 수와 전환 수를 입력받아 통계적 유의성을 검증한다. 양비율 z-검정을 사용해 p-값, z-점수, 신뢰 구간, 상대 상승률을 계산하며, 마케팅 실험이나 웹사이트 개선 테스트의 결과 해석에 쓰인다.

A/B 테스트 유의성 계산기

각 변형에 대한 방문자 및 전환을 입력하여 차이가 실제인지 단순한 노이즈인지 확인합니다.

제어 (A)
변형 (B)

결과

통계적으로 유의미함

차이는 선택한 신뢰도 수준에서 우연 때문일 가능성이 낮습니다.

P-값
0.0007

Chance this gap is just luck — lower is stronger.

Z-점수
3.381

How far apart the two rates are, in standard errors.

상대 상승
+50.0%
제어 비율
10.00%
변형 비율
15.00%
절대 차이
+5.00 pp
신뢰 구간 (차이) · 95%
2.11% to 7.89%

The likely range for the true difference.

변형별 전환율
변형별 전환율. Grouped bar chart with 1 series: 전환율.0%5%10%15%전환율제어 (A)변형 (B)10%15%
로딩 계산기...
📚

문서화

A/B 테스트 유의성 계산기가 하는 일

A/B 테스트 유의성 계산기는 웹페이지, 이메일, 결제 버튼처럼 어떤 대상의 두 버전 사이의 차이가 실제 효과인지 아니면 단순한 무작위 변동인지 확인합니다. 각 버전의 방문자 수와 전환 수를 입력하면 p-값, z-점수, 신뢰구간을 산출합니다. 전환은 구매, 가입, 클릭처럼 성공으로 간주되는 모든 행동을 뜻합니다.

계산기 사용 방법

계산기에는 네 개의 숫자가 필요합니다.

  • 방문자 수(대조군): 원래 버전인 A를 본 사람의 수입니다.
  • 전환 수(대조군): 그중 전환한 사람의 수입니다.
  • 방문자 수(변형): 새 버전인 B를 본 사람의 수입니다.
  • 전환 수(변형): 그중 전환한 사람의 수입니다.

결과를 판단하는 방식을 바꾸는 설정이 두 가지 더 있습니다.

  • 신뢰수준은 검정의 엄격한 정도를 정합니다. 95%가 일반적인 기본값입니다. 99%처럼 더 높은 수준에서는 결과를 유의하다고 판단하기 전에 더 강한 근거를 요구합니다.
  • 가설은 질문의 방향을 정합니다. 양측 검정은 “B가 어느 방향으로든 A와 다른가?”를 묻습니다. 단측 검정은 “B가 A보다 나은가?”만 묻습니다. 단측 검정은 데이터가 수집되기 전에, 그리고 B의 결과가 더 나쁘더라도 어떤 의사결정도 바뀌지 않을 경우에만 선택해야 합니다.

숫자를 입력하면 결과가 업데이트됩니다. 입력값은 페이지의 웹 주소에 저장되므로 결과를 링크로 북마크하거나 공유할 수 있습니다.

A/B 테스트 공식(두 비율 z 검정)

이 계산기는 두 비율을 비교하는 입문 통계학의 표준 방법인 두 비율 z 검정을 사용합니다.

단계 1. 각 그룹의 전환율.

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

여기서 xx는 전환 수이고 nn은 방문자 수이며, 대조군(1)과 변형군(2)에 각각 적용됩니다.

단계 2. 통합 전환율. 이 단계에서는 검정을 위해 두 그룹이 하나의 실제 기저 전환율을 공유한다고 가정합니다.

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

단계 3. 차이의 표준오차는 통합 전환율을 바탕으로 계산됩니다.

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

단계 4. z점수는 두 전환율의 차이를 표준오차 단위로 나타낸 값입니다.

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

단계 5. p값은 표준정규분포 Φ\Phi에서 구합니다. 양측 검정의 경우: p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right). 단측 검정의 경우: p=1−Φ(z)p = 1 - \Phi(z).

단계 6. 판정. p값이 α\alpha보다 작으면 결과를 통계적으로 유의하다고 봅니다. 여기서 α=1−신뢰수준\alpha = 1 - \text{신뢰수준}입니다. 95% 신뢰수준에서는 α=0.05\alpha = 0.05입니다.

계산기는 차이의 크기인 p2−p1p_2 - p_1에 대한 신뢰구간도 표시합니다. 이 구간에는 두 그룹이 동일한 전환율을 공유한다고 가정하지 않는 별도의 표준오차가 사용됩니다.

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

구간은 (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled}이며, 여기서 zcz_c는 신뢰수준 90%에서 1.6449, 95%에서 1.96, 99%에서 2.5758입니다. 구간에 영이 포함되지 않으면 해당 신뢰수준에서 차이가 유의합니다.

풀이 예시

방문자 수전환 수전환율
대조군(A)1,00010010.00%
변형(B)1,00015015.00%

통합 전환율은 (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125, 즉 12.5%입니다. 통합 표준오차는 약 0.0148입니다. z점수는 (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38입니다.

양측 검정에서는 p값이 약 0.00072입니다. 이는 일반적인 0.05 임계값보다 작으므로 95% 신뢰수준에서 차이는 통계적으로 유의합니다. 두 버전의 실제 성과가 같다면 이처럼 크거나 더 큰 차이가 순전히 우연히 나타날 확률은 매 10,000회 검정 중 약 7회입니다.

절대 차이는 5.00%포인트입니다. B의 전환율이 A의 1.5배이므로 상대적 상승률은 50%입니다. 실제 차이에 대한 95% 신뢰구간은 약 2.11%에서 7.89%까지입니다.

결과를 올바르게 해석하기

통계적으로 유의한 결과라고 해서 반드시 실행할 가치가 있는 것은 아닙니다. 실제로 상승폭이 작다면 이를 출시하는 데 드는 비용을 정당화하지 못할 수 있습니다. 계산이 끝난 뒤에도 비즈니스 판단은 여전히 중요합니다.

매일 p값을 확인하고 0.05를 넘는 순간 검정을 중단하면 거짓 양성의 가능성이 커집니다. 표본 크기나 실행 기간을 미리 정하고 결과를 확인하기 전에 검정을 끝까지 진행하는 편이 낫습니다.

이 검정이 의존하는 정규 근사는 각 그룹에 최소 약 10회의 전환과 10회의 비전환이 있을 때 가장 잘 작동합니다. 수가 더 적으면 결과를 확정적인 답이 아니라 대략적인 신호로 봐야 합니다.

95% 신뢰수준은 B가 실제로 더 나을 확률이 95%라는 뜻이 아닙니다. 같은 검정을 여러 번 반복한다면 이 방법이 잘못하여 유의하다고 판정하는 비율이 최대 5%라는 뜻입니다. 이는 이번 결과가 아니라 방법 자체에 대한 설명입니다.

여러 지표 또는 여러 변형을 동시에 검정하면 적어도 하나의 비교가 순전히 운으로 유의해 보일 가능성이 커집니다. 검정을 시작하기 전에 하나의 지표를 선택하면 이 문제를 피할 수 있습니다.

자주 묻는 질문

A/B 테스트에는 어느 정도의 표본 크기가 필요한가? 의미 있는 상승폭이 실제로 유의한 결과로 나타날 만큼 충분한 방문자가 필요합니다. 대략적인 하한선은 버전당 수백 회의 전환입니다. 기준 전환율과 검출할 가치가 있는 최소 상승폭을 사용하여 전용 표본 크기 계산기로 검정 시작 전에 더 정확한 수치를 구할 수 있습니다.

검정은 단측이어야 하는가, 양측이어야 하는가? B가 A보다 낫거나 나쁜 경우를 모두 포착할 수 있으므로 양측 검정이 더 안전한 기본값입니다. 단측 검정은 개선에 더 민감하지만 결과가 더 나빠진 경우는 포착할 수 없으므로, B의 결과가 더 나빠져도 어떤 의사결정도 바뀌지 않을 때만 사용해야 합니다.

계산기는 왜 신뢰구간을 표시하는가? 신뢰구간은 단순히 유의/비유의라는 표지만 보여 주는 것이 아니라 실제 차이가 있을 법한 범위를 보여 줍니다. 영을 가로지르는 넓은 구간은 대개 검정에 더 많은 데이터가 필요하다는 뜻입니다.

이 계산기는 베이지안 계산기인가? 아닙니다. A/B 테스트에 가장 흔히 가르치고 사용하는 방법인 빈도주의 z 검정을 사용합니다. 베이지안 도구는 대신 B가 A보다 우수할 확률을 보고합니다. 두 방법 모두 타당하지만 답하는 질문이 약간 다릅니다.

계산기에 오류가 표시되면 어떻게 하는가? 전환 수가 음수이거나 방문자 수를 초과하거나, 두 그룹을 합친 전환율이 0% 또는 100%이면 오류가 표시됩니다. 이 경우 z 검정 공식에서 표준오차가 영이 되어 나눗셈을 할 수 없기 때문입니다.

출처