先看一个可验证的信号:同一时间窗内,各版本的访客来源、入口页面、设备或地域构成是否明显不同。如果分流本应随机,但某版本集中了更多直接访问或移动端用户,那么后续对比很可能已被样本污染。此时最稳妥的最小动作,是把分析对象缩到来源、入口和设备都一致的那部分访客,再比较行为指标;如果缩完后样本过小,就只能把它当作待验证线索,不能据此宣布某个版本更优。
访客被分到不同版本,通常有三种来源:前端脚本随机分配、服务端按规则分配、以及通过不同链接或渠道分别进入。三者对样本污染的含义不同。前端随机分配若在页面加载后才跳转,可能先记录一次原始页面访问,再记录目标版本访问,形成重复计数;服务端分配一般更干净,但若规则里带了用户身份、地区或登录状态,就不是完全随机;按链接分流则天然把渠道差异带进版本差异。
可执行动作是打开分流配置或规则说明,确认三件事:分配发生在哪一层、分配依据是什么、访客首次进入后是否会被重新分配。若发现分配依据包含来源、设备、登录状态或地域,就要把这些维度列为潜在混杂因素。这个动作的结果会直接决定下一步:完全随机且分配稳定,可以进入整体对比;带规则分配,则必须先分层。
不要只比较两个版本的总转化率或总停留时长。把数据按来源渠道、入口页面、设备类型、新老访客四个维度各切一次,观察版本间的构成比例。若某个版本在多个维度上都偏向同一类访客,例如更多来自站内推荐、更多新访客,那么总指标差异至少有一部分来自访客构成,而非版本本身。
一个假设例子:A 版本总转化率 4%,B 版本 2%。分层后发现,B 版本有七成流量来自信息流广告,A 版本只有三成来自同一渠道;而在信息流广告内部,两个版本转化率都接近 2.5%。这说明总差异主要来自渠道构成,不能推出 A 版本设计更好。这里的关键不是数字本身,而是分层前后结论是否反转。
如果缺少完整数据或权限,仍可做最小切片:只取自然搜索来源、同一入口页面、同一设备类型的访客,比较两版本的核心动作完成率。这个动作能排除最明显的构成差异,但样本量会下降。样本下降后置信区间变宽,此时不能因为某一版本数值略高就下结论,只能记录为待继续观察的线索。
样本污染不只来自访客构成差异,也来自同一访客被重复计入两个版本。常见表现是:同一会话内出现两个版本页面浏览、版本标识在会话中途改变、或退出率异常接近零。前端重定向、缓存旧页面、以及用户手动改链接都可能造成这种情况。
可执行动作是抽取一小段会话日志或访问明细,检查同一访客 ID 或同一会话 ID 是否同时命中两个版本。若重复比例明显,先按会话去重,只保留首次分配的版本,再重跑对比。这个动作的结果会影响下一步:去重后差异缩小,说明原先的版本差异被重复计数放大;去重后差异仍在,才值得继续查分流规则。
需要注意,第三方估算流量、搜索引擎报告与站内统计口径不同,不能互相替代来证明分流是否干净。站内统计能看会话和版本标识,第三方估算通常看不到版本分配,搜索引擎报告也不包含版本维度。因此判断样本污染应以站内可核查的会话记录为主,外部数据只能作为背景参考。
完成分层和去重后,通常会得到三种结果。第一种,分层后版本差异消失,说明原差异主要由访客构成或重复计数解释,此时不应再宣称版本效果不同。第二种,分层后差异仍在,但样本量不足以稳定判断,此时应继续收集或延长观察窗,而不是提前定论。第三种,分层后差异仍在且各层方向一致,才可以认为版本差异有较可靠的初步证据,但仍需说明适用条件,例如仅在自然搜索、移动端、新访客中成立。
缺少权限时,无法修改分流逻辑或补装埋点,最小动作就是限定分析范围并记录限制。例如只分析已有会话日志中来源和入口一致的部分,并在结论里写明未覆盖的渠道和设备。这样做的价值不是给出最终答案,而是防止把被污染的样本当成干净实验,避免下一步基于错误前提调整页面或投放。
这套顺序的重点是先排除构成差异和重复计数,再谈版本效果。若最后只剩很小且方向不稳的差异,正确做法是保留原始记录并说明当前证据不足,而不是用单一指标宣布胜出版本。