Chuyển đến nội dung

Máy tính Kiểm thử A/B có ý nghĩa

Kiểm tra xem kết quả kiểm thử A/B của bạn có ý nghĩa thống kê không. Nhập khách truy cập và chuyển đổi để nhận giá trị P, điểm Z, khoảng tin cậy và nâng cao tương đối.

Máy tính Kiểm thử A/B có ý nghĩa

Nhập số lượng khách truy cập và chuyển đổi cho mỗi biến thể để kiểm tra xem sai khác là thực tế hay chỉ là nhiễu.

Kiểm soát (A)
Biến thể (B)

Kết quả

Có ý nghĩa thống kê

Sai khác không có khả năng là do ngẫu nhiên ở mức tin cậy bạn chọn.

Giá trị P
0.0007

Chance this gap is just luck — lower is stronger.

Điểm Z
3.381

How far apart the two rates are, in standard errors.

Nâng cao tương đối
+50.0%
Tỷ lệ kiểm soát
10.00%
Tỷ lệ biến thể
15.00%
Sai khác tuyệt đối
+5.00 pp
Khoảng tin cậy (sai khác) · 95%
2.11% to 7.89%

The likely range for the true difference.

Tỷ lệ chuyển đổi theo biến thể
Tỷ lệ chuyển đổi theo biến thể. Grouped bar chart with 1 series: Tỷ lệ chuyển đổi.0%5%10%15%Tỷ lệ chuyển đổiKiểm soát (A)Biến thể (B)10%15%
Máy tính tải...
📚

Tài liệu hướng dẫn

Kiểm thử A/B trong một phút

Bạn đã thay đổi nút, tiêu đề hoặc quy trình thanh toán. Phiên bản A là phiên bản cũ, phiên bản B là phiên bản mới. B trông tốt hơn — nó chuyển đổi 15% khách truy cập so với 10% cho A. Nhưng khoảng cách đó có thể chỉ là may mắn, giống như cách tung đồng xu mười lần có thể cho bảy mặt?

Máy tính này trả lời chính xác điều đó. Bạn nhập số lượng người thấy mỗi phiên bản và bao nhiêu người chuyển đổi, và nó cho bạn biết xác suất sai khác mà bạn đo được là thực tế chứ không phải nhiễu ngẫu nhiên. Nếu xác suất đó đủ cao, bạn có một người chiến thắng. Nếu không, bạn tiếp tục chạy kiểm thử.

Con số duy nhất cần xem là giá trị P: khả năng thấy khoảng cách ít nhất lớn như vậy nếu hai phiên bản thực sự giống hệt nhau. Một giá trị P nhỏ (giả sử dưới 0,05) có nghĩa là "điều này sẽ hiếm khi xảy ra do may mắn, vì vậy sai khác có thể là thực tế."

Cách sử dụng nó

  1. Khách truy cập — bao nhiêu người duy nhất được hiển thị mỗi phiên bản.
  2. Chuyển đổi — bao nhiêu trong số họ đã làm việc mà bạn quan tâm (mua, đăng ký, nhấp).
  3. Mức độ tin cậy — bạn muốn chắc chắn đến mức nào trước khi gọi người chiến thắng. 95% là tiêu chuẩn ngành.
  4. Giả thuyếthai phía hỏi "B có khác A không?" (an toàn hơn, mặc định); một phía chỉ hỏi "B có tốt hơn A không?" (nhạy cảm hơn, nhưng bạn phải quyết định hướng trước khi chạy kiểm thử).

Kết quả cập nhật trực tiếp và các đầu vào được lưu trữ trong URL trang, vì vậy bạn có thể đánh dấu hoặc chia sẻ kết quả. Đặt lại xóa biểu mẫu; Tải dữ liệu mẫu điền vào một ví dụ đã làm việc.

Một ví dụ đã làm việc

Khách truy cậpChuyển đổiTỷ lệ
A (kiểm soát)1.00010010,0%
B (biến thể)1.00015015,0%

Đó là nâng cao tuyệt đối 5 điểm phần trăm và nâng cao +50% tương đối. Máy tính trả về giá trị P khoảng 0,0007 — dưới 0,05 — vì vậy ở mức tin cậy 95%, kết quả là có ý nghĩa thống kê. Đại khái, nếu hai phiên bản thực sự giống hệt nhau, bạn sẽ thấy khoảng cách lớn này ít hơn một lần trong một nghìn kiểm thử.

Phép toán (bài kiểm tra z tỷ lệ hai)

Ở phía sau, đây là bài kiểm tra z tỷ lệ hai tiêu chuẩn, cùng một bài kiểm tra được dạy trong thống kê giới thiệu và được sử dụng bởi các công cụ A/B chính.

  1. Tỷ lệ chuyển đổi của mỗi nhóm:

    p1=x1n1,p2=x2n2p_1 = \dfrac{x_1}{n_1}, \quad p_2 = \dfrac{x_2}{n_2}

    trong đó xx là chuyển đổi và nn là khách truy cập.

  2. Kết hợp tỷ lệ, giả sử (đối với giả thuyết null) cả hai nhóm chia sẻ một tỷ lệ thực tế:

    p^=x1+x2n1+n2\hat{p} = \dfrac{x_1 + x_2}{n_1 + n_2}

  3. Sai số tiêu chuẩn của sai khác:

    SE=p^(1p^)(1n1+1n2)SE = \sqrt{\hat{p}\,(1-\hat{p})\left(\dfrac{1}{n_1} + \dfrac{1}{n_2}\right)}

  4. Điểm z — bao nhiêu sai số tiêu chuẩn ngoài hai tỷ lệ:

    z=p2p1SEz = \dfrac{p_2 - p_1}{SE}

  5. Giá trị P đến từ phân phối chuẩn tắc Φ\Phi. Hai phía: p=2(1Φ(z))p = 2\left(1 - \Phi(|z|)\right). Một phía: p=1Φ(z)p = 1 - \Phi(z).

  6. Có ý nghĩa khi p<αp < \alpha, trong đó α=1confidence\alpha = 1 - \text{confidence} (vì vậy 0,05 ở 95%).

Máy tính cũng báo cáo một khoảng tin cậy cho sai khác, được tính toán với sai số tiêu chuẩn không kết hợp p1(1p1)n1+p2(1p2)n2\sqrt{\tfrac{p_1(1-p_1)}{n_1} + \tfrac{p_2(1-p_2)}{n_2}}: phạm vi hợp lý cho khoảng cách thực tế. Nếu khoảng đó không bao gồm 0, kết quả là có ý nghĩa.

0 -1.96 +1.96 no difference

Ở mức tin cậy 95%, z vượt quá ±1,96 (các đuôi bóng, 5% diện tích) được tính là có ý nghĩa.

Đọc kết quả một cách trung thực

  • Ý nghĩa thống kê không phải là ý nghĩa kinh doanh. Nâng cao 0,1% có thể thực tế về mặt thống kê nhưng không đáng để gửi.
  • Đừng nhìn trộm và dừng sớm. Kiểm tra giá trị P hàng ngày và dừng lại khoảnh khắc nó chạm dưới 0,05 làm tăng tỷ lệ dương tính giả của bạn. Quyết định kích thước mẫu trước tiên và để kiểm thử hoàn thành.
  • Xem quy tắc ngón cái kích thước mẫu. Xấp xỉ bình thường là đáng tin cậy khi mỗi nhóm có ít nhất ~ 10 chuyển đổi ~ 10 chuyển đổi không. Với những con số nhỏ, hãy coi kết quả chỉ là hướng dẫn.
  • Tin cậy ≠ xác suất B tốt hơn. Mức tin cậy 95% có nghĩa là thủ tục sai không quá 5% thời gian trong thời gian dài — nó là một tuyên bố thường xuyên, không phải "95% cơ hội B thắng."
  • Một kiểm thử, một số liệu. Kiểm thử nhiều số liệu hoặc biến thể cùng một lúc làm tăng khả năng một sai lầm; sửa lỗi cho nó (ví dụ Bonferroni) hoặc đăng ký trước các số liệu duy nhất quyết định kiểm thử.

Tính toán nó khi bạn

Mỗi đoạn mã tính toán giá trị P hai phía cho ví dụ đã làm việc ở trên.

1=2*(1-NORM.S.DIST(
2   (B2/A2 - B1/A1) /
3   SQRT(((B1+B2)/(A1+A2))*(1-(B1+B2)/(A1+A2))*(1/A1+1/A2)),
4   TRUE))
5' A1,B1 = control visitors, conversions ; A2,B2 = variation visitors, conversions
6

Câu hỏi thường gặp

Tôi cần kích thước mẫu nào? Đủ để một nâng cao có ý nghĩa sẽ có thể phát hiện được. Là sàn, nhắm ít nhất vài trăm chuyển đổi cho mỗi biến thể; sử dụng một máy tính kích thước mẫu chuyên dụng với tỷ lệ cơ sở của bạn và nâng cao nhỏ nhất đáng để phát hiện.

Hai phía hay một phía? Sử dụng hai phía trừ khi bạn có một lý do vững chắc, cam kết trước để chỉ quan tâm đến cải thiện. Một phía tăng gấp đôi độ nhạy cảm của bạn nhưng cấm phản ứng với B là tệ hơn.

Tại sao máy tính hiển thị khoảng tin cậy? Nó hiển thị phạm vi hợp lý của khoảng cách thực tế, không chỉ là một phán quyết có/không. Một khoảng rộng straddling 0 có nghĩa là "không đủ dữ liệu chưa."

Đây có phải là Bayesian không? Không — nó là một bài kiểm tra z thường xuyên, phương pháp được dạy và sử dụng rộng rãi nhất. Các công cụ A/B Bayesian báo cáo "xác suất B đánh bại A" thay vì giá trị P; cả hai đều hợp lệ, họ trả lời các câu hỏi hơi khác nhau.

Nguồn