A/B 测试计算器
检查您的测试是否胜出,规划样本量和所需周数,并查看胜出版本能带来多少收入。统计显著性、贝叶斯胜出概率、样本比例检查和收入测试,一站搞定。免费使用,无需注册。
计算方法
A/B 测试的统计显著性如何计算
计算器运行双比例 z 检验:A 和 B 之间的差异,是否大于随机波动通常会产生的差异?
标准误来自两组合并后的转化率。z 值会换算为 p 值:如果 A 和 B 实际上没有差别,观察到如此大差异的概率。p 值低于 0.05 即在 95% 置信水平下显著。差异的置信区间使用未合并的标准误。
5.0% 对比 5.8%
z = 2.50, p = 0.012
每组 10,000 名访客,转化数 500 对比 580。B 提升 16%,在 95% 置信水平下显著。提升幅度很可能在 3.5% 到 28.5% 之间。
检测 10% 的提升
每个版本 31,234 名访客
基于 5% 的转化率、95% 的置信水平和 80% 的统计功效。每周 20,000 名访客时,需运行 4 个完整周。
上线提升 10% 的胜出版本
+100 次转化 = 每月 $8,000
每月 50,000 名访客,转化率 2%,每次转化 $80。即每年 $96,000。
上线测试之前
样本量与最小可检测效应
想检测的提升越小,所需访客就越多。提升幅度减半,样本量大约要变为四倍。
最小可检测效应(MDE)是测试能够可靠发现的最小提升。“规划我的测试”会显示达到您的 MDE 所需的访客数,并在表格中列出运行 1 到 8 周时能检测到的最小提升。如果您期望的提升小于流量所能检测的幅度,请测试更大胆的改动,或选择流量更大的页面。
测试两个以上的版本会分散流量,需要更严格的阈值。计算器对置信水平应用 Bonferroni 校正,使每一次与对照组的比较都保持可靠。
时长
A/B 测试应该运行多久?
直到达到计划的样本量,并且按完整周计算。
覆盖一周中的每一天
买家在周一和周六的行为不同。把时长向上取整到完整周,让每个版本面对相同的访客构成。
事先确定样本量
每天查看结果、并在第一次显著时停止测试,会增加虚假胜出。请提前设定样本量,只读取一次结果。
警惕数据污染
运行时间过长的测试会受到 Cookie 丢失、季节性和其他营销活动的影响。如果需要几个月,请改为测试更大的改动。
另一种视角
贝叶斯胜出概率
除 p 值外,结果还会显示 B 优于 A 的概率,以及如果上线 B 而它实际上更差,您可能损失多少。
计算器为每个版本使用 Beta(1, 1) 先验分布,并精确计算 B 的真实转化率高于 A 的概率。在示例中,B 有 99.4% 的概率更好。许多团队觉得这比 p 值更容易解释,但它回答的是另一个问题,因此每次都应使用相同的阈值。
数据质量
样本比例不匹配
如果按 50/50 分流,但其中一个版本的访客明显更多,说明设置中存在问题,结果不可信。
计算器根据您计划的分流比例,对访客数进行卡方检验。p 值低于 0.01 即提示不匹配。常见原因包括会丢失访客的重定向、机器人流量、只在一个版本上触发的跟踪代码以及缓存。请修复原因并重新开始测试,而不是相信这些数字。
为什么重要
一次胜出的测试价值多少
转化率的提升只有通过您的流量和订单价值才能变成收入。
收入影响还会显示有了胜出版本后每推迟一周的成本;如果输入保守的提升值,还会显示区间下限时的效果。对于每位访客收入或平均订单价值,请使用“平均值”:它运行 Welch t 检验,不假设两个版本的离散程度相同。
电子表格
适用于 Excel 和 Google Sheets 的 A/B 测试公式
A1 = A 的访客数,B1 = A 的转化数,C1 = B 的访客数,D1 = B 的转化数。
B 相对 A 的提升
z 值
双侧 p 值(E1 = z 值)
每个版本的访客数(F1 = 基准转化率,G1 = 期望达到的转化率)
常见问题
A/B 测试常见问题
如何判断我的 A/B 测试是否具有统计显著性?
输入两个版本的访客数和转化数。如果 p 值低于 1 减去置信水平,例如在 95% 时低于 0.05,则差异显著。10,000 名访客中 500 次转化对比 10,000 名中 580 次时,p = 0.012,因此 B 在 95% 置信水平下胜出。
A/B 测试需要多少访客?
这取决于您的转化率和您关心的最小提升。在 5% 的转化率下,以 95% 的置信水平和 80% 的统计功效检测 10% 的相对提升,每个版本大约需要 31,234 名访客。
A/B 测试应该运行多久?
直到每个版本达到计划的样本量,并向上取整到完整周。用所需的总访客数除以每周流量;不要因为结果看起来不错就提前停止。
多高的置信水平比较合适?
95% 是常用的默认值。对撤销成本高的改动使用 99%,对快速、低风险的测试使用 90%。请在开始前确定。
什么是统计功效?
统计功效是指当至少达到 MDE 的提升真实存在时,测试能够检测到它的概率。80% 是标准值;90% 大约需要多三分之一的访客。
贝叶斯还是频率学派:应该用哪种?
两者使用相同的数据。p 值控制您误判胜出版本的频率;贝叶斯胜出概率告诉您 B 更好的可能性有多大。选择一种决策规则并始终如一地使用。
什么是样本比例不匹配?
访客分流与计划的偏差超出随机误差允许的范围,例如设置为 50/50,但在大流量下却是 52/48。这通常意味着跟踪或重定向存在缺陷,应修复后重新运行测试。
可以测试收入而不是转化率吗?
可以。使用“平均值”,输入每个版本每位访客收入的均值和标准差。它运行 Welch t 检验,并给出差异及其置信区间。
参考资料
来源
- 转化测试的样本量:Evan Miller
- 在线实验中样本比例不匹配的诊断,KDD 2019:Fabijan et al., ACM
- Welch t 检验:Wikipedia
更多免费销售工具
把更多访客变成对话,把对话变成交易。
CRMsoftware.pro 用 AI 回复您的访客,捕获每一条潜在客户线索,并显示哪些对话促成了成交。提供免费版,无需信用卡。