跳至内容

A/B 测试显著性计算器

A/B测试显著性计算器根据两个版本的访客数和转化数,使用双比例z检验计算统计显著性。输入对照组和实验组各自的访客与转化数据,即可得到p值、z分数、置信区间和相对提升百分比,并判断结果是否达到常见的95%置信水平。工具帮助产品经理和营销人员判断新版落地页、按钮文案或邮件标题是否真正优于旧版本,避免因随机波动而做出错误决策。

A/B 测试显著性计算器

输入每个变异的访客数和转化数,检查差异是真实的还是只是噪声。

对照组 (A)
变异组 (B)

结果

统计显著

在你选择的置信水平下,差异不太可能是由于偶然。

P 值
0.0007

Chance this gap is just luck — lower is stronger.

Z 分数
3.381

How far apart the two rates are, in standard errors.

相对提升
+50.0%
对照转化率
10.00%
变异转化率
15.00%
绝对差异
+5.00 pp
置信区间 (差异) · 95%
2.11% to 7.89%

The likely range for the true difference.

按变异的转化率
按变异的转化率. Grouped bar chart with 1 series: 转化率.0%5%10%15%转化率对照组 (A)变异组 (B)10%15%
加载计算器...
📚

文档

A/B 测试显著性计算器的作用

A/B 测试显著性计算器用于判断两个版本之间的差异——例如网页、电子邮件或结账按钮——是真实效果还是随机偶然。它会获取每个版本的访客数和转化数,并返回 p 值、z 分数和置信区间。转化是指被视为成功的任何操作:购买、注册或点击。

如何使用计算器

计算器需要四个数字。

  • 访客数(对照组):看到版本 A(原始版本)的人数。
  • 转化数(对照组):其中完成转化的人数。
  • 访客数(实验组):看到版本 B(新版本)的人数。
  • 转化数(实验组):其中完成转化的人数。

另外两个设置会改变结果的判定方式。

  • 置信水平决定测试的严格程度。95% 是常见的默认值。更高的水平(如 99%)要求有更强的证据,才能判定结果具有统计显著性。
  • 假设决定问题所考察的方向。双侧检验问的是“B 是否与 A 不同,可能更好也可能更差?”单侧检验只问“B 是否优于 A?”单侧检验应仅在数据收集前选择,并且只有在 B 的结果更差也不会改变任何决策时才适用。

输入数字时,结果会随之更新。输入内容会存储在网页地址中,因此可以将结果保存为书签或作为链接分享。

A/B 测试公式(双比例 z 检验)

计算器使用双比例 z 检验,这是入门统计学中用于比较两个比率的标准方法。

步骤 1。计算每组的转化率。

p1=x1n1,p2=x2n2p_1 = \frac{x_1}{n_1}, \qquad p_2 = \frac{x_2}{n_2}

这里,xx 是转化数,nn 是访客数,分别对应对照组(1)和实验组(2)。

步骤 2。合并转化率。 在这一步中,为了进行检验,假定两组共用一个真实的基础转化率。

p^=x1+x2n1+n2\hat{p} = \frac{x_1 + x_2}{n_1 + n_2}

步骤 3。差异的标准误,根据合并转化率计算。

SE=p^(1−p^)(1n1+1n2)SE = \sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_1} + \frac{1}{n_2}\right)}

步骤 4。Z 分数,即以标准误为单位衡量的两组比率之差。

z=p2−p1SEz = \frac{p_2 - p_1}{SE}

步骤 5。P 值,取自标准正态分布 Φ\Phi。对于双侧检验:p=2(1−Φ(∣z∣))p = 2\left(1 - \Phi(|z|)\right)。对于单侧检验:p=1−Φ(z)p = 1 - \Phi(z)。

步骤 6。判定。 当 p 值小于 α\alpha 时,结果具有统计显著性,其中 α=1−置信水平\alpha = 1 - \text{置信水平}。在 95% 的置信水平下,α=0.05\alpha = 0.05。

计算器还会报告差异大小 p2−p1p_2 - p_1 的置信区间。该区间使用单独的标准误,不假定两组共用同一转化率:

SEunpooled=p1(1−p1)n1+p2(1−p2)n2SE_{unpooled} = \sqrt{\frac{p_1(1-p_1)}{n_1} + \frac{p_2(1-p_2)}{n_2}}

区间为 (p2−p1)±zc×SEunpooled(p_2 - p_1) \pm z_c \times SE_{unpooled},其中 zcz_c 在 90% 置信水平下为 1.6449,在 95% 下为 1.96,在 99% 下为 2.5758。如果区间不包含零,则差异在该置信水平下具有统计显著性。

示例

访客数转化数转化率
对照组(A)1,00010010.00%
实验组(B)1,00015015.00%

合并转化率为 (100+150)/(1000+1000)=0.125(100+150)/(1000+1000) = 0.125,即 12.5%。合并标准误约为 0.0148。Z 分数为 (0.15−0.10)/0.0148≈3.38(0.15 - 0.10) / 0.0148 \approx 3.38。

对于双侧检验,p 值约为 0.00072。这低于通常的 0.05 阈值,因此在 95% 的置信水平下,该差异具有统计显著性。如果两个版本的实际表现相同,如此大或更大的差异仅凭偶然性在每 10,000 次测试中约有 7 次出现。

绝对差异为 5.00 个百分点。相对提升幅度为 50%,因为 B 的转化率是 A 的 1.5 倍。真实差异的 95% 置信区间约为 2.11% 至 7.89%。

正确解读结果

具有统计显著性的结果并不自动意味着值得采取行动。一个幅度很小但真实存在的提升,可能不值得承担上线成本。数学计算完成后,业务判断仍然重要。

每天检查 p 值,并在它刚刚低于 0.05 时停止测试,会提高假阳性的概率。更好的做法是事先确定样本量或测试时长,在测试完成后再解读结果。

该测试所依赖的正态近似在每组至少约有 10 次转化和 10 次未转化时效果最好。数量更少时,应将结果视为粗略信号,而不是确定结论。

95% 的置信水平并不意味着 B 确实优于 A 的概率为 95%。它表示,如果重复进行同样的测试许多次,该方法给出错误显著结果的比例最多为 5%。这是对该方法的描述,而不是对这一次结果的描述。

同时检验许多指标或许多变体,会增加至少有一个比较结果仅凭运气而显示显著的概率。在测试开始前选定一个指标,可以避免这个问题。

常见问题

A/B 测试需要多大的样本量? 需要有足够多的访客,使有意义的提升确实能显示出统计显著性。一个粗略的下限是每个版本有几百次转化。专门的样本量计算器会根据基准转化率和需要检测的最小提升幅度,在测试开始前给出更可靠的数字。

测试应采用单侧检验还是双侧检验? 双侧检验是更安全的默认选择,因为它可以发现 B 比 A 更好或更差。单侧检验对提升更敏感,但无法发现更差的结果,因此只有在 B 变差也不会改变任何决策时才应使用。

计算器为什么要报告置信区间? 置信区间显示真实差异的可能范围,而不只是给出显著或不显著的标签。跨越零的宽区间通常意味着测试需要更多数据。

这是贝叶斯计算器吗? 不是。它使用频率学派的 z 检验,这是 A/B 测试中最常教授和使用的方法。贝叶斯工具则会报告 B 胜过 A 的概率。两种方法都有效,但回答的问题略有不同。

如果计算器显示错误怎么办? 如果转化数为负数、超过访客数,或者两组合计转化率为 0% 或 100%,就会显示错误,因为在这种情况下,z 检验公式无法除以零标准误。

来源