ข้ามไปยังเนื้อหา

เครื่องคิดเลขความสำคัญทางสถิติของการทดสอบ A/B

ตรวจสอบว่าผลลัพธ์การทดสอบ A/B ของคุณมีนัยสำคัญทางสถิติหรือไม่ ป้อนผู้มาเยี่ยมชมและการแปลงเพื่อรับ p-value, z-score, ช่วงความเชื่อมั่น และการยกระดับสัมพัทธ์

เครื่องคิดเลขความสำคัญทางสถิติของการทดสอบ A/B

ป้อนผู้มาเยี่ยมชมและการแปลงสำหรับแต่ละรูปแบบเพื่อตรวจสอบว่าความแตกต่างเป็นของจริงหรือเพียงสัญญาณรบกวน

ควบคุม (A)
รูปแบบแปรผัน (B)

ผลลัพธ์

มีนัยสำคัญทางสถิติ

ความแตกต่างไม่น่าจะเกิดจากโอกาสในระดับความเชื่อมั่นของคุณ

P-value
0.0007

Chance this gap is just luck — lower is stronger.

Z-score
3.381

How far apart the two rates are, in standard errors.

การยกระดับสัมพัทธ์
+50.0%
อัตราควบคุม
10.00%
อัตราแปรผัน
15.00%
ความแตกต่างแบบสัมบูรณ์
+5.00 pp
ช่วงความเชื่อมั่น (ความแตกต่าง) · 95%
2.11% to 7.89%

The likely range for the true difference.

อัตราการแปลงตามรูปแบบ
อัตราการแปลงตามรูปแบบ. Grouped bar chart with 1 series: อัตราการแปลง.0%5%10%15%อัตราการแปลงควบคุม (A)รูปแบบแปรผัน (B)10%15%
เครื่องคำนวณโหลด...
📚

เอกสารประกอบการใช้งาน

การทดสอบ A/B ในหนึ่งนาที

คุณเปลี่ยนปุ่ม หัวข้อ หรือขั้นตอนการชำระเงิน เวอร์ชัน A คือเวอร์ชันเก่า เวอร์ชัน B คือเวอร์ชันใหม่ B ดูเหมือนจะดีกว่า — มีผู้มาเยี่ยมชม 15% เทียบกับ 10% สำหรับ A แต่ช่องว่างนี้เป็นเพียงเรื่องโชค เช่นเดียวกับการโยนเหรียญสิบครั้งที่ให้หัวเจ็ดครั้ง

เครื่องคิดเลขนี้ตอบคำถามเดียวกัน คุณป้อนจำนวนคนที่เห็นแต่ละเวอร์ชันและจำนวนที่แปลงแล้ว และมันบอกความน่าจะเป็นที่ความแตกต่างที่คุณวัดได้นั้นเป็น ของจริง มากกว่า สัญญาณรบกวนแบบสุ่ม หากความน่าจะเป็นนั้นสูงพอ แสดงว่าคุณมีผู้ชนะ หากไม่เป็นเช่นนั้น คุณจะดำเนินการทดสอบต่อไป

ตัวเลขที่ต้องดูคือ p-value: โอกาสในการเห็นช่องว่างอย่างน้อยขนาดนี้ หากเวอร์ชันทั้งสองเหมือนกันจริง ๆ p-value ที่เล็ก (เช่น ต่ำกว่า 0.05) หมายความว่า "สิ่งนี้จะไม่เกิดขึ้นโดยบังเอิญ ดังนั้นความแตกต่างอาจเป็นของจริง"

วิธีการใช้

  1. ผู้มาเยี่ยมชม — จำนวนคนที่แสดงเวอร์ชันแต่ละรุ่นจำนวนเท่าใด
  2. การแปลง — จำนวนที่พวกเขากระทำสิ่งที่คุณสนใจ (ซื้อ ลงทะเบียน คลิก)
  3. ระดับความเชื่อมั่น — คุณต้องการแน่ใจแค่ไหนก่อนที่จะเรียกผู้ชนะ 95% เป็นมาตรฐานของอุตสาหกรรม
  4. สมมติฐานสองด้าน ถาม "B แตกต่างจาก A หรือไม่" (ปลอดภัยกว่า ค่าเริ่มต้น); ด้านเดียว ถาม เพียง "B ดีกว่า A หรือไม่" (ละเอียดอ่อนมากขึ้น แต่คุณต้องตัดสินใจทิศทางก่อนเรียกใช้การทดสอบ)

ผลลัพธ์อัปเดตแบบสดและอินพุตจะถูกจัดเก็บไว้ใน URL หน้า ดังนั้นคุณสามารถบุ๊คมาร์ก หรือแชร์ผลลัพธ์ได้ รีเซ็ต ล้างแบบฟอร์ม; โหลดข้อมูลตัวอย่าง เติมตัวอย่างที่ได้รับการแก้ไข

ตัวอย่างที่ได้รับการแก้ไข

ผู้มาเยี่ยมชมการแปลงอัตรา
A (ควบคุม)1,00010010.0%
B (รูปแบบแปรผัน)1,00015015.0%

นี่คือการยกระดับแบบสัมบูรณ์ 5 จุดเปอร์เซ็นต์ และยกระดับสัมพัทธ์ +50% เครื่องคิดเลขคืนค่า p-value ประมาณ 0.0007 — ต่ำกว่า 0.05 — ดังนั้นที่ระดับความเชื่อมั่น 95% ผลลัพธ์จึง มีนัยสำคัญทางสถิติ โดยคร่าว ๆ หากเวอร์ชันทั้งสองเหมือนกันจริง ๆ คุณจะเห็นช่องว่างขนาดนี้น้อยกว่าหนึ่งครั้งในการทดสอบหนึ่งพันครั้ง

คณิตศาสตร์ (การทดสอบ z สัดส่วนสอง)

ใต้ฝากี่นี้เป็นการทดสอบ z สัดส่วนสองมาตรฐาน two-proportion z-test ซึ่งเป็นการทดสอบเดียวกับที่สอนในสถิติเบื้องต้นและใช้โดยเครื่องมือ A/B หลัก

  1. อัตราการแปลงของแต่ละกลุ่ม:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    โดยที่ xx คือการแปลงและ nn คือผู้มาเยี่ยมชม

  2. อัตรา รวมกลุ่ม โดยถือว่า (สำหรับสมมติฐานว่าง) ทั้งสองกลุ่มใช้อัตราจริงเดียว:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. ข้อผิดพลาดมาตรฐานของความแตกต่าง:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. z-score — จำนวนของข้อผิดพลาดมาตรฐานที่อัตราทั้งสองแตกต่างกัน:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. p-value มาจากการแจกแจงแบบปกติมาตรฐาน Φ\Phi สองด้าน: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right) ด้านเดียว: p=1Φ(z)p = 1 - \Phi(z)

  6. มีนัยสำคัญ เมื่อ p<αp < \alpha โดยที่ α=1confidence\alpha = 1 - \text{confidence} (ดังนั้น 0.05 ที่ 95%)

เครื่องคิดเลขยังรายงาน ช่วงความเชื่อมั่น สำหรับความแตกต่าง คำนวณด้วยข้อผิดพลาดมาตรฐาน unpooled p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: ช่วงที่เป็นไปได้สำหรับช่องว่างจริง หากช่วงนั้นไม่รวม 0 ผลลัพธ์จึงมีนัยสำคัญ

0 -1.96 +1.96 no difference

ที่ระดับความเชื่อมั่น 95% z ที่เกิน ±1.96 (หางที่แรเงา 5% ของพื้นที่) จะถูกนับว่ามีนัยสำคัญ

อ่านผลลัพธ์อย่างสุจริต

  • ความสำคัญทางสถิติไม่ใช่ความสำคัญทางธุรกิจ การยกระดับ 0.1% อาจเป็นของจริงในทางสถิติแต่ไม่คุ้มกับการส่ง
  • อย่าแอบมองและหยุดเร็ว การตรวจสอบ p-value ทุกวันและหยุดในขณะที่ตกต่ำกว่า 0.05 จะทำให้อัตราผลบวกเท็จของคุณเพิ่มขึ้น ตัดสินใจขนาดตัวอย่างล่วงหน้าและปล่อยให้การทดสอบเสร็จสิ้น
  • ดูกฎ หัวแม่มือของขนาดตัวอย่าง การประมาณแบบปกติน่าเชื่อถือเมื่อแต่ละกลุ่มมีการแปลงอย่างน้อย ~10 และ ~10 ไม่มีการแปลง ด้วยตัวเลขเล็กน้อย ให้ถือว่าผลลัพธ์เป็นเพียงการนำทาง
  • ความเชื่อมั่น ≠ ความน่าจะเป็น B ดีกว่า ระดับความเชื่อมั่น 95% หมายความว่า ขั้นตอน ผิดอย่างมากที่สุด 5% ของเวลาในระยะยาว — มันเป็นคำกล่าวแบบบ่อยครั้ง ไม่ใช่ "95% โอกาส B ชนะ"
  • การทดสอบหนึ่ง เมตริกหนึ่ง การทดสอบเมตริกหรือรูปแบบจำนวนมากพร้อมกันจะเพิ่มโอกาสของเสียงเดียว; แก้ไข (เช่น Bonferroni) หรือลงทะเบียนเมตริกเดียวที่ตัดสินใจการทดสอบ

คำนวณด้วยตัวเอง

แต่ละเฉพาะคำนวณ p-value สองด้านสำหรับตัวอย่างที่ได้รับการแก้ไขข้างต้น

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

คำถามที่พบบ่อย

ฉันต้องใช้ขนาดตัวอย่างเท่าใด พอที่การยกระดับที่มีความหมายจะสามารถตรวจจับได้ ตามกฎพื้นฐาน ให้เป้าหมายอย่างน้อยไม่กี่ร้อยการแปลงต่อรูปแบบ ใช้เครื่องคิดเลขขนาดตัวอย่างเฉพาะด้วยอัตราพื้นฐานและการยกระดับที่เล็กที่สุดควรตรวจจับ

สองด้านหรือด้านเดียว ใช้สองด้านเว้นแต่คุณจะมีเหตุผลที่มั่นคง ก่อนเรียกใช้ เพื่อเฉพาะดูการปรับปรุง ด้านเดียวเพิ่มความละเอียดอ่อนของคุณสองเท่า แต่ห้ามปฏิกิริยา B ที่แย่กว่า

ทำไมเครื่องคิดเลขจึงแสดงช่วงความเชื่อมั่น มันแสดงช่วงที่เป็นไปได้ของความแตกต่างที่แท้จริง ไม่เพียงแค่คำตัดสินใจ ใช่/ไม่ใช่ ช่วงกว้างที่รวม 0 หมายความว่า "ยังไม่มีข้อมูลเพียงพอ"

นี่คือ Bayesian หรือไม่ ไม่ — มันเป็น frequentist z-test วิธีที่สอนและใช้กันอย่างแพร่หลาย เครื่องมือ A/B แบบ Bayesian รายงาน "ความน่าจะเป็น B เอาชนะ A" แทนที่จะเป็น p-value; ทั้งสองไม่มีปัญหา พวกเขาตอบคำถามที่แตกต่างกันเล็กน้อย

แหล่งข้อมูล