内容提要
本文介绍了一种新的实验设计方法——“固定功效设计”,该方法允许在没有预设样本量的情况下开始实验,并根据实时数据估算所需样本量。当当前样本量超过估算值时,实验会停止,从而确保统计推断的准确性。这种设计特别适用于用户基础多样且不断变化的环境,如Spotify,能够提高决策的可靠性。
延伸解读
窥视的误区:关键在于窥视什么
传统观点认为,实验过程中任何基于数据的窥视都会导致假阳性率膨胀,因此需要顺序检验等修正方法。但本文指出,并非所有窥视都同样有害。固定功效设计窥视的是样本方差(通过所需样本量间接体现),而非显著性。研究表明,基于方差的停止规则对统计推断的影响远小于基于显著性的停止规则。这意味着,只要窥视的是与精度相关的量,而非直接看结果是否显著,就可以在不修正的情况下使用标准推断。
固定功效设计的统计保证与适用条件
固定功效设计允许在实验过程中根据当前数据估计所需样本量,并在当前样本量超过估计值时停止。论文证明,在此设计下,常用的差值均值估计量是一致的,固定样本置信区间具有渐近名义覆盖率。这意味着在大样本下,无需任何修正即可进行标准推断。但需注意,这些保证是渐近的,小样本下可能需要保守的有限样本版本。此外,该设计假设处理效应在用户群体中同质,若效应异质性较强,估计可能受影响。
与传统设计的对比:优势与代价
与固定样本设计相比,固定功效设计无需预先指定样本量,能根据实时数据调整,提高了样本量估计的准确性。与顺序设计相比,它避免了因提前停止而导致的效应量高估和功效损失,尤其适用于必须运行固定时长(如排除新奇效应或周内效应)的实验。然而,固定功效设计也有代价:在规划阶段无法预知所需样本量,可能给资源分配带来不确定性。如果实验中途发现所需样本量远超预期,可能因资源限制而无法继续。
实践中的考量:何时使用及注意事项
固定功效设计特别适合用户群体多样且不断变化的环境,如Spotify,因为历史数据往往无法准确反映当前用户的方差。在实践中,许多公司实际上已在混合使用:用固定样本方法分析,但根据实时估计的所需样本量决定停止。固定功效设计为这种做法提供了理论依据。但需注意,如果实验必须运行固定时长,顺序检验可能过于保守,而固定功效设计则能保持功效。此外,实时监控所需样本量有助于及早发现规划偏差,但需确保统计推断的正确性。
Q&A
什么是固定功效设计?
固定功效设计是一种实验设计方法,允许在没有预设样本量的情况下开始实验,并根据实时数据估算所需样本量。
固定功效设计如何提高实验的可靠性?
固定功效设计通过实时估算所需样本量,并在当前样本量超过估算值时停止实验,从而确保统计推断的准确性。
固定功效设计与传统设计有何不同?
与传统的固定样本设计和顺序设计相比,固定功效设计提供了更大的灵活性,允许在实验过程中实时调整样本量。
固定功效设计适用于哪些环境?
固定功效设计特别适用于用户基础多样且不断变化的环境,如Spotify。
固定功效设计如何处理样本量的估算?
在固定功效设计中,实验开始时不设定样本量,而是根据当前的实验结果实时估算所需样本量。
使用固定功效设计的实验有什么潜在的挑战?
固定功效设计的挑战在于实验规划阶段无法确定所需样本量,可能导致实验无法按预期进行。