不要再把第一个重要的日子称为胜利

检查 A/B 测试直至其超过 p < 0.05,可以将名义上 5% 的假阳性率变为近 28%。我使用种子模拟来显示损害有多大,并比较保持早期停止诚实的修复方法。停止称第一个重要的日子为胜利的帖子首先出现在走向数据科学上。

来源:走向数据科学

以相当简单的方式。他们启动测试,每天早上打开仪表板,等待 p 值降至 0.05 以下。当它出现时,结果看起来足够正式,可以发布了。这条线已经被越过了,号码看起来很干净,获胜者似乎已经准备好打电话了。

我不会说这个例程总是粗心地完成。在大多数情况下,团队所做的正是标准教程教他们做的事情:定义假设、选择度量、运行二比例 z 检验或 t 检验,并在 p 低于 0.05 时拒绝零值。一些指南甚至添加了在测试开始之前计算所需样本量的宝贵步骤。

但有一件至关重要的事情经常被忽视。 5% 的假阳性率是针对一个固定样本的一次观察而得出的,一旦在实验结束前一次又一次地检查同一个仪表板,数学就会发生变化。

我运行了一个模拟来使其可见。设置故意很普通:两个版本,A 和 B,都以相同的真实 10% 汇率进行转换;每臂每天 1,000 名访客; 5% 水平的双边测试;和 30 天的流量。 A 和 B 之间没有什么不同。没有发现任何产品改进。测试唯一能发现的就是噪音。

如果测试最后只检查一次,假阳性率就会达到应有的水平:大约 5%。但如果每天检查并在 p 低于 0.05 时立即停止,则假阳性率将达到 27.7%。换句话说,超过四分之一的“胜利”是由停止规则而不是产品创造的胜利。

本文添加的是对通货膨胀的直接测量以及对相同模拟数据的修复的并排基准。我使用种子模拟来测量每日查看下的假阳性率,然后通过每个设计保持的有效性和速度来比较固定样本设计、组序 Pocock 边界和始终有效的 p 值。

参考文献