CRMsoftware.pro

A/B 测试计算器

检查您的测试是否胜出,规划样本量和所需周数,并查看胜出版本能带来多少收入。统计显著性、贝叶斯胜出概率、样本比例检查和收入测试,一站搞定。免费使用,无需注册。

对照组(A)

变体(B)

%
用于检查样本比例不匹配

您的下一个测试创意

把一个在定价页上回答访客问题的 AI 客服,作为您的下一个测试变体。

CRMsoftware.pro 在您的网站、WhatsApp、Telegram 和邮件中数秒内回答问题,全天候不间断,并把每一次对话转化为可衡量的联系人和交易。

  • AI 客服基于您的网站、文档和政策进行训练
  • 携带完整上下文转交给同事
  • 每次聊天都会成为您销售管道中的一个联系人和一笔交易

提供免费版,无需信用卡。付费版每月 $19 起,按年计费。

计算方法

A/B 测试的统计显著性如何计算

计算器运行双比例 z 检验:A 和 B 之间的差异,是否大于随机波动通常会产生的差异?

z =(B 的转化率 − A 的转化率)÷ 标准误

标准误来自两组合并后的转化率。z 值会换算为 p 值:如果 A 和 B 实际上没有差别,观察到如此大差异的概率。p 值低于 0.05 即在 95% 置信水平下显著。差异的置信区间使用未合并的标准误。

胜出了吗?

5.0% 对比 5.8%

z = 2.50, p = 0.012

每组 10,000 名访客,转化数 500 对比 580。B 提升 16%,在 95% 置信水平下显著。提升幅度很可能在 3.5% 到 28.5% 之间。

规划

检测 10% 的提升

每个版本 31,234 名访客

基于 5% 的转化率、95% 的置信水平和 80% 的统计功效。每周 20,000 名访客时,需运行 4 个完整周。

收入

上线提升 10% 的胜出版本

+100 次转化 = 每月 $8,000

每月 50,000 名访客,转化率 2%,每次转化 $80。即每年 $96,000。

上线测试之前

样本量与最小可检测效应

想检测的提升越小,所需访客就越多。提升幅度减半,样本量大约要变为四倍。

最小可检测效应(MDE)是测试能够可靠发现的最小提升。“规划我的测试”会显示达到您的 MDE 所需的访客数,并在表格中列出运行 1 到 8 周时能检测到的最小提升。如果您期望的提升小于流量所能检测的幅度,请测试更大胆的改动,或选择流量更大的页面。

测试两个以上的版本会分散流量,需要更严格的阈值。计算器对置信水平应用 Bonferroni 校正,使每一次与对照组的比较都保持可靠。

时长

A/B 测试应该运行多久?

直到达到计划的样本量,并且按完整周计算。

完整周

覆盖一周中的每一天

买家在周一和周六的行为不同。把时长向上取整到完整周,让每个版本面对相同的访客构成。

不要偷看

事先确定样本量

每天查看结果、并在第一次显著时停止测试,会增加虚假胜出。请提前设定样本量,只读取一次结果。

不要无限期运行

警惕数据污染

运行时间过长的测试会受到 Cookie 丢失、季节性和其他营销活动的影响。如果需要几个月,请改为测试更大的改动。

另一种视角

贝叶斯胜出概率

除 p 值外,结果还会显示 B 优于 A 的概率,以及如果上线 B 而它实际上更差,您可能损失多少。

计算器为每个版本使用 Beta(1, 1) 先验分布,并精确计算 B 的真实转化率高于 A 的概率。在示例中,B 有 99.4% 的概率更好。许多团队觉得这比 p 值更容易解释,但它回答的是另一个问题,因此每次都应使用相同的阈值。

数据质量

样本比例不匹配

如果按 50/50 分流,但其中一个版本的访客明显更多,说明设置中存在问题,结果不可信。

计算器根据您计划的分流比例,对访客数进行卡方检验。p 值低于 0.01 即提示不匹配。常见原因包括会丢失访客的重定向、机器人流量、只在一个版本上触发的跟踪代码以及缓存。请修复原因并重新开始测试,而不是相信这些数字。

为什么重要

一次胜出的测试价值多少

转化率的提升只有通过您的流量和订单价值才能变成收入。

每月额外收入 = 访客数 × 转化率 × 提升幅度 × 每次转化价值

收入影响还会显示有了胜出版本后每推迟一周的成本;如果输入保守的提升值,还会显示区间下限时的效果。对于每位访客收入或平均订单价值,请使用“平均值”:它运行 Welch t 检验,不假设两个版本的离散程度相同。

电子表格

适用于 Excel 和 Google Sheets 的 A/B 测试公式

A1 = A 的访客数,B1 = A 的转化数,C1 = B 的访客数,D1 = B 的转化数。

B 相对 A 的提升

=(D1/C1)/(B1/A1)-1

z 值

=(D1/C1-B1/A1)/SQRT((B1+D1)/(A1+C1)*(1-(B1+D1)/(A1+C1))*(1/A1+1/C1))

双侧 p 值(E1 = z 值)

=2*(1-NORM.S.DIST(ABS(E1),TRUE))

每个版本的访客数(F1 = 基准转化率,G1 = 期望达到的转化率)

=ROUNDUP((NORM.S.INV(0.975)*SQRT(2*(F1+G1)/2*(1-(F1+G1)/2))+NORM.S.INV(0.8)*SQRT(F1*(1-F1)+G1*(1-G1)))^2/(G1-F1)^2,0)

常见问题

A/B 测试常见问题

如何判断我的 A/B 测试是否具有统计显著性?

输入两个版本的访客数和转化数。如果 p 值低于 1 减去置信水平,例如在 95% 时低于 0.05,则差异显著。10,000 名访客中 500 次转化对比 10,000 名中 580 次时,p = 0.012,因此 B 在 95% 置信水平下胜出。

A/B 测试需要多少访客?

这取决于您的转化率和您关心的最小提升。在 5% 的转化率下,以 95% 的置信水平和 80% 的统计功效检测 10% 的相对提升,每个版本大约需要 31,234 名访客。

A/B 测试应该运行多久?

直到每个版本达到计划的样本量,并向上取整到完整周。用所需的总访客数除以每周流量;不要因为结果看起来不错就提前停止。

多高的置信水平比较合适?

95% 是常用的默认值。对撤销成本高的改动使用 99%,对快速、低风险的测试使用 90%。请在开始前确定。

什么是统计功效?

统计功效是指当至少达到 MDE 的提升真实存在时,测试能够检测到它的概率。80% 是标准值;90% 大约需要多三分之一的访客。

贝叶斯还是频率学派:应该用哪种?

两者使用相同的数据。p 值控制您误判胜出版本的频率;贝叶斯胜出概率告诉您 B 更好的可能性有多大。选择一种决策规则并始终如一地使用。

什么是样本比例不匹配?

访客分流与计划的偏差超出随机误差允许的范围,例如设置为 50/50,但在大流量下却是 52/48。这通常意味着跟踪或重定向存在缺陷,应修复后重新运行测试。

可以测试收入而不是转化率吗?

可以。使用“平均值”,输入每个版本每位访客收入的均值和标准差。它运行 Welch t 检验,并给出差异及其置信区间。

把更多访客变成对话,把对话变成交易。

CRMsoftware.pro 用 AI 回复您的访客,捕获每一条潜在客户线索,并显示哪些对话促成了成交。提供免费版,无需信用卡。

免费开始 →