A/B 测试显著性计算器
A/B测试显著性计算器根据两个版本的访客数和转化数,使用双比例z检验计算统计显著性。输入对照组和实验组各自的访客与转化数据,即可得到p值、z分数、置信区间和相对提升百分比,并判断结果是否达到常见的95%置信水平。工具帮助产品经理和营销人员判断新版落地页、按钮文案或邮件标题是否真正优于旧版本,避免因随机波动而做出错误决策。
A/B 测试显著性计算器
输入每个变异的访客数和转化数,检查差异是真实的还是只是噪声。
结果
统计显著
在你选择的置信水平下,差异不太可能是由于偶然。
Chance this gap is just luck — lower is stronger.
How far apart the two rates are, in standard errors.
The likely range for the true difference.
文档
A/B 测试显著性计算器的作用
A/B 测试显著性计算器用于判断两个版本之间的差异——例如网页、电子邮件或结账按钮——是真实效果还是随机偶然。它会获取每个版本的访客数和转化数,并返回 p 值、z 分数和置信区间。转化是指被视为成功的任何操作:购买、注册或点击。
如何使用计算器
计算器需要四个数字。
- 访客数(对照组):看到版本 A(原始版本)的人数。
- 转化数(对照组):其中完成转化的人数。
- 访客数(实验组):看到版本 B(新版本)的人数。
- 转化数(实验组):其中完成转化的人数。
另外两个设置会改变结果的判定方式。
- 置信水平决定测试的严格程度。95% 是常见的默认值。更高的水平(如 99%)要求有更强的证据,才能判定结果具有统计显著性。
- 假设决定问题所考察的方向。双侧检验问的是“B 是否与 A 不同,可能更好也可能更差?”单侧检验只问“B 是否优于 A?”单侧检验应仅在数据收集前选择,并且只有在 B 的结果更差也不会改变任何决策时才适用。
输入数字时,结果会随之更新。输入内容会存储在网页地址中,因此可以将结果保存为书签或作为链接分享。
A/B 测试公式(双比例 z 检验)
计算器使用双比例 z 检验,这是入门统计学中用于比较两个比率的标准方法。
步骤 1。计算每组的转化率。
这里, 是转化数, 是访客数,分别对应对照组(1)和实验组(2)。
步骤 2。合并转化率。 在这一步中,为了进行检验,假定两组共用一个真实的基础转化率。
步骤 3。差异的标准误,根据合并转化率计算。
步骤 4。Z 分数,即以标准误为单位衡量的两组比率之差。
步骤 5。P 值,取自标准正态分布 。对于双侧检验:。对于单侧检验:。
步骤 6。判定。 当 p 值小于 时,结果具有统计显著性,其中 。在 95% 的置信水平下,。
计算器还会报告差异大小 的置信区间。该区间使用单独的标准误,不假定两组共用同一转化率:
区间为 ,其中 在 90% 置信水平下为 1.6449,在 95% 下为 1.96,在 99% 下为 2.5758。如果区间不包含零,则差异在该置信水平下具有统计显著性。
示例
| 访客数 | 转化数 | 转化率 | |
|---|---|---|---|
| 对照组(A) | 1,000 | 100 | 10.00% |
| 实验组(B) | 1,000 | 150 | 15.00% |
合并转化率为 ,即 12.5%。合并标准误约为 0.0148。Z 分数为 。
对于双侧检验,p 值约为 0.00072。这低于通常的 0.05 阈值,因此在 95% 的置信水平下,该差异具有统计显著性。如果两个版本的实际表现相同,如此大或更大的差异仅凭偶然性在每 10,000 次测试中约有 7 次出现。
绝对差异为 5.00 个百分点。相对提升幅度为 50%,因为 B 的转化率是 A 的 1.5 倍。真实差异的 95% 置信区间约为 2.11% 至 7.89%。
正确解读结果
具有统计显著性的结果并不自动意味着值得采取行动。一个幅度很小但真实存在的提升,可能不值得承担上线成本。数学计算完成后,业务判断仍然重要。
每天检查 p 值,并在它刚刚低于 0.05 时停止测试,会提高假阳性的概率。更好的做法是事先确定样本量或测试时长,在测试完成后再解读结果。
该测试所依赖的正态近似在每组至少约有 10 次转化和 10 次未转化时效果最好。数量更少时,应将结果视为粗略信号,而不是确定结论。
95% 的置信水平并不意味着 B 确实优于 A 的概率为 95%。它表示,如果重复进行同样的测试许多次,该方法给出错误显著结果的比例最多为 5%。这是对该方法的描述,而不是对这一次结果的描述。
同时检验许多指标或许多变体,会增加至少有一个比较结果仅凭运气而显示显著的概率。在测试开始前选定一个指标,可以避免这个问题。
常见问题
A/B 测试需要多大的样本量? 需要有足够多的访客,使有意义的提升确实能显示出统计显著性。一个粗略的下限是每个版本有几百次转化。专门的样本量计算器会根据基准转化率和需要检测的最小提升幅度,在测试开始前给出更可靠的数字。
测试应采用单侧检验还是双侧检验? 双侧检验是更安全的默认选择,因为它可以发现 B 比 A 更好或更差。单侧检验对提升更敏感,但无法发现更差的结果,因此只有在 B 变差也不会改变任何决策时才应使用。
计算器为什么要报告置信区间? 置信区间显示真实差异的可能范围,而不只是给出显著或不显著的标签。跨越零的宽区间通常意味着测试需要更多数据。
这是贝叶斯计算器吗? 不是。它使用频率学派的 z 检验,这是 A/B 测试中最常教授和使用的方法。贝叶斯工具则会报告 B 胜过 A 的概率。两种方法都有效,但回答的问题略有不同。
如果计算器显示错误怎么办? 如果转化数为负数、超过访客数,或者两组合计转化率为 0% 或 100%,就会显示错误,因为在这种情况下,z 检验公式无法除以零标准误。