终止条件要在试验开始前写好,而不是等数据好看或难看时再决定。它至少包含三层:什么情况下把试验页的做法推向全站,什么情况下只保留在试验页,什么情况下彻底回滚。只设一条“效果不好就停”等于没设,因为“效果不好”会被不同的人解释成不同含义。
常见的矛盾是:试验页的点击率、停留时间或转化率出现改善,但把同一套改动铺到全站后,整体指标反而回落。这不一定说明改动本身有问题,也不一定说明试验页的数据是假的。更常见的原因是,试验页和全站之间存在结构性差异,而这些差异在试验阶段被忽略了。
两种看似合理的解释需要先分开:
这两种解释对应完全不同的下一步动作。如果是第一种,应该把推广范围收窄到同类页面;如果是第二种,应该先补齐对照再决定是否推广。
能区分这两种解释的证据不是试验页自身的绝对值,而是同期未改动页面的变化幅度。如果试验页提升明显,而同期一批结构相似的未改动页面也出现了相近幅度的提升,那么解释二更可能成立。反之,如果未改动页面基本平稳,只有试验页出现变化,解释一更值得继续验证。
具体动作可以这样做:在试验开始前,从全站中挑出一组与试验页结构相似、但本次不改动的页面作为对照,记录同一时间段内的同类指标。试验结束后,比较试验页与对照页的变化方向和幅度,而不是只看试验页自己涨了多少。
这个动作的结果会直接影响下一步:如果试验页与对照页的差异足够稳定,可以把推广范围限定在同类页面;如果两者差异不明显,说明当前证据不足以支持全站推广,应延长观察或重新设计试验,而不是直接铺开。
终止条件不是一句态度,而是一组可以被第三方复核的规则。建议在试验开始前写清以下内容:
把这些规则提前写下来,最大的作用不是预测结果,而是防止在数据出来之后,因为个人偏好或部门压力而临时修改判断标准。
假设某网站把产品列表页的筛选模块从顶部移到了侧边,试验页在两周内转化率有所上升。此时有两种处理方式:
选择哪种做法,取决于对照页的证据强度。如果同期未改动的同类列表页没有出现相近提升,做法B更稳妥;如果对照页也普遍上升,说明外部因素影响较大,此时无论A还是B都缺少足够依据,应先延长观察窗口。这个例子中的数字和结论都是假设,用于说明判断方法,不代表任何真实站点的结果。
在把试验页做法推向全站之前,除了看指标,还要确认以下条件是否满足:
这些条件不满足时,即使试验页数据好看,也不应急于全站推广。先解决可复制性和口径问题,再重新评估是否具备推广条件。