A/B 테스트 유의성 계산기

A/B 테스트 결과가 통계적으로 유의미한지 확인합니다. 방문자 및 전환을 입력하여 p-값, z-점수, 신뢰 구간 및 상대 상승을 얻습니다.

A/B 테스트 계산기

📚

문서화

1분 안에 A/B 테스트 이해하기

버튼, 헤드라인, 또는 체크아웃 흐름을 변경했습니다. 버전 A는 이전 버전, 버전 B는 새로운 버전입니다. B는 보기에는 더 좋아 보이고 - 방문자의 15%가 전환된 반면 A는 10%였습니다. 그런데 이 차이가 단순한 운일 수도 있지 않을까요? 동전을 10번 던져서 앞면이 7번 나올 수 있는 것처럼요?

이 계산기가 정확히 그 질문에 답변합니다. 각 버전을 본 사람의 수와 전환된 사람의 수를 입력하면, 측정한 차이가 실제인지 아니면 무작위 오류인지 확률을 알려줍니다. 그 확률이 충분히 높으면, 승자가 있는 것입니다. 그렇지 않으면, 테스트를 계속 진행합니다.

주의해야 할 한 가지 숫자는 p-값입니다: 두 버전이 실제로 동일했다면 이 정도 크기의 차이를 볼 수 있는 확률입니다. 작은 p-값(예: 0.05 미만)은 "이런 일이 운으로 거의 일어나지 않으므로, 차이는 아마도 실제"라는 의미입니다.

사용 방법

  1. 방문자 — 각 버전을 본 고유 방문자의 수입니다.
  2. 전환 — 그들이 관심 있는 행동을 한 수(구매, 가입, 클릭)입니다.
  3. 신뢰도 수준 — 승자라고 부르기 전에 얼마나 확신하고 싶은지입니다. 95%가 업계 표준입니다.
  4. 가설양측은 "B가 A와 다른가?"를 묻습니다(더 안전함, 기본값); 단측은 "B가 A보다 나은가?"만 묻습니다(더 민감하지만, 테스트를 실행하기 전에 방향을 결정해야 합니다).

결과는 실시간으로 업데이트되고 입력은 페이지 URL에 저장되므로, 결과를 북마크하거나 공유할 수 있습니다. 재설정은 양식을 지우고, 샘플 데이터 로드는 작업된 예를 채웁니다.

작업된 예

방문자전환비율
A (제어)1,00010010.0%
B (변형)1,00015015.0%

이는 5 포인트 절대 상승이고 +50% 상대 상승입니다. 계산기는 약 0.0007의 p-값을 반환합니다 — 0.05 미만 — 따라서 95% 신뢰도에서 결과는 통계적으로 유의미합니다. 대략적으로, 두 버전이 정말로 동일했다면, 천 번의 테스트 중 한 번 미만으로 이 정도 크기의 차이를 볼 수 있을 것입니다.

수학 (양비율 z-검정)

뒷면에서 이는 표준 양비율 z-검정이고, 입문 통계에서 가르치는 동일한 검정이며 주류 A/B 도구에서 사용됩니다.

  1. 각 그룹의 전환율:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    여기서 xx는 전환이고 nn은 방문자입니다.

  2. 합산된 비율, (귀무가설에 대해) 두 그룹이 하나의 참 비율을 공유한다고 가정:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. 차이의 표준 오류:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. z-점수 — 두 비율이 얼마나 많은 표준 오류만큼 떨어져 있는지:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-값은 표준 정규 분포 Φ\Phi에서 나옵니다. 양측: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). 단측: p=1Φ(z)p = 1 - \Phi(z).

  6. 유의미함p<αp < \alpha일 때, 여기서 α=1신뢰도\alpha = 1 - \text{신뢰도} (95%에서 0.05).

계산기는 또한 신뢰 구간을 차이에 대해 보고하고, 비합산된 표준 오류 p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}로 계산됩니다: 참 차이에 대한 합리적인 범위입니다. 그 구간이 0을 제외하면, 결과는 유의미합니다.

0 -1.96 +1.96 no difference

95% 신뢰도에서 ±1.96 표준 오류를 초과하는 z (음영 처리된 꼬리, 면적의 5%)가 유의미한 것으로 계산됩니다.

결과를 정직하게 읽기

  • 통계적 유의성은 비즈니스 유의성이 아닙니다. 0.1% 상승은 통계적으로 실제일 수 있지만 배포할 가치가 없을 수 있습니다.
  • 초기에 살펴보고 멈추지 마십시오. p-값을 매일 확인하고 0.05 아래로 떨어지는 순간 테스트를 중지하면 거짓 양성률이 증가합니다. 표본 크기를 미리 결정하고 테스트가 완료되도록 하십시오.
  • 표본 크기 경험칙을 주시하십시오. 정규 근사는 각 그룹에 최소 ~10 전환 그리고 ~10 비전환이 있을 때 신뢰할 수 있습니다. 작은 숫자로는 결과를 방향 전환만으로 취급합니다.
  • 신뢰도 ≠ B가 나을 확률. 95% 신뢰도 수준은 절차가 장기적으로 최대 5% 잘못되었다는 의미입니다 — 이것은 "B가 이길 확률 95%"이 아니라 빈도주의 진술입니다.
  • 한 번의 테스트, 한 가지 메트릭. 여러 메트릭이나 변형을 한 번에 테스트하면 우연의 기회가 곱해집니다. 이를 수정(예: Bonferroni)하거나 테스트를 결정하는 단일 메트릭을 사전 등록합니다.

직접 계산해 보세요

각 스니펫은 위의 작업된 예에 대해 양측 p-값을 계산합니다.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

자주하는 질문

표본 크기는 얼마나 필요합니까? 의미 있는 상승이 감지될 수 있을 정도로 충분합니다. 최소한, 변형당 최소 몇 백 개의 전환을 목표로 합니다. 기준 비율과 감지할 가치가 있는 가장 작은 상승으로 전용 표본 크기 계산기를 사용합니다.

양측 또는 단측? 개선만 신경써야 한다는 확실한 사전 약속된 이유가 있지 않는 한 양측을 사용합니다. 단측은 민감도를 두 배로 높이지만 B가 더 나쁜 경우에 대응하는 것을 금지합니다.

계산기가 신뢰 구간을 표시하는 이유는 무엇입니까? 예/아니오 판정만이 아니라 참 차이의 합리적인 범위를 보여줍니다. 0을 가로지르는 넓은 구간은 "아직 충분한 데이터가 없음"을 의미합니다.

이것은 베이지안입니까? 아니요 — 이는 가장 널리 가르쳐지고 사용되는 방법인 빈도주의 z-검정입니다. 베이지안 A/B 도구는 p-값 대신 "B가 A를 이길 확률"을 보고합니다. 둘 다 유효하고 약간 다른 질문에 답합니다.

출처

🔗

관련 도구

귀하의 워크플로에 유용할 수 있는 더 많은 도구를 발견하세요.