识别样本污染的核心动作,是把“分到不同版本的访客”从同一份汇总数据里拆开:先确认分流是否真的随机,再分别看各版本的行为指标,最后用原始日志或分流记录交叉验证。如果分流不随机,任何版本对比都不可信,下一步应停止对比、先修分流或改用能标记版本的数据源。
假设一个情境:某站点用诊断工具比较A、B两个页面版本,工具报告B的跳出率明显更低,但站内统计显示B的停留时间更短。这不是工具出错,而是两组访客可能根本不是同一类人。分流若按设备、来源或登录状态切分,A和B的样本构成就不同,汇总指标自然互相矛盾。
区分两种原因的证据不同。若是分流问题,你会看到各版本的来源分布、设备占比或新老访客比例差异明显;若是版本问题,则这些构成应大致接近,差异集中在页面行为上。先查构成,再谈效果,这是识别样本污染的第一步。
诊断工具通常只给出汇总值,要验证随机性得回到更细的数据。可核对的证据包括:
如果某个来源的访客几乎全被分到B,而该来源本身转化就差,那么B的低转化是样本构成造成的,不是版本缺陷。此时应把该来源单独剥离后再比较,或修正分流规则,让各版本在同一来源内随机分配。
一旦确认分流不随机,跳出率、停留时间、转化率这类比率指标都不能直接横向对比,因为分母不同质。相对可用的做法是:
这里要说明一个口径问题:第三方估算流量、搜索引擎报告与站内统计的分母和采样方式都不同,三者数值不一致本身不能证明分流有问题,也不能单靠某一指标还原搜索算法。它们只能作为线索,最终判断要靠分流记录和日志这类可核对的原始证据。
假设某活动页把移动端访客默认导向B版本,而移动端本身停留短。工具显示B停留更短,团队一度认为B设计失败。按设备分层后,移动端内A和B停留接近,桌面端B反而更长。把移动端和桌面端混在一起看,就是典型的样本污染。
对应的动作是:在诊断工具或分流配置里增加设备维度,重新按设备分别评估。结果会改变下一步——如果分层后差异消失,就不该改版,而应修分流;如果分层后差异仍在,才值得针对该层继续测试。这个判断依赖的是分层后的可比样本,不是汇总数字。
可复用的顺序是:先看各版本样本构成是否一致,再查分流记录与日志中的版本标识,然后分层比较,最后才决定是否调整页面。若构成不一致,先修分流;若一致但结果仍反常,再检查指标定义和上报时机是否对齐。请求量或某项统计归零,也可能来自埋点故障、过滤规则或采集延迟,不能单独作为分流正确的证据。
把“样本是否同质”作为每次对比前的固定检查项,比事后解释矛盾结果更省力,也更能让诊断结论站得住。