先给有条件的结论:如果分流规则能保证同一访客始终进入同一版本,且两版同时在线、流量来源一致,那么按版本对比访问量是有效的;一旦分流在会话中途切换、或两版上线时段错开,样本污染就会让差异失去解释力。识别它的关键不是看总量,而是看同一访客在两版之间的行为是否出现无法用版本差异解释的跳跃。
样本污染最常见的形式是分流单位与观察单位不一致。分流按请求或按页面进行,观察却按访客汇总,同一个人就会同时出现在A版和B版的统计里。此时A版的访问量偏高可能只是因为它承接了更多“首次落地”的请求,而不是它更受欢迎。
可用的判断依据是分流标识本身。如果分流标识写在会话级或访客级存储中,并且在整个访问期间不被覆盖,那么版本归属基本可靠。如果标识只存在于单次请求的参数里,刷新、跳转或返回都会重新分配,同一访客的路径就会被切成多段,分别计入不同版本。
实际动作:抽取一批访客标识,检查它们在两版中的出现次数。若同一标识在两版都留下记录,且时间间隔很短,说明分流没有锁定访客。这个结果直接决定下一步——先修分流逻辑,再谈两版访问量的比较,否则后续任何差异分析都是在混合样本上做文章。
面对疑似污染,常见的两种处理是:剔除跨版本访客后比较,或者保留全部数据但按来源和入口分层比较。两者都成立,但成立条件不同。
选择依据是分流标识的可获得性,而不是数据量大小。能拿到访客级标识时,剔除法的证据链更短、更容易复核;拿不到时,分层法只能作为过渡,并且要明确它无法回答“哪个版本对同一访客更好”。
假设两版同时上线,分流按访客锁定,跨版本记录为零,看起来样本干净。但如果B版是在A版运行一段时间后才加入轮换,早期进入A版的访客在后续访问中仍留在A版,而新访客才开始被分到B版。此时两版的访客构成在“首次访问时间”上系统不同:A版包含更多老访客,B版几乎全是新访客。访问量差异反映的是新老访客比例,不是版本效果。
这个反例说明,跨版本记录为零并不等于样本干净。污染也可以表现为分配时间与访客来源结构耦合。可核查的证据是两版访客的首次访问时间分布和来源分布:如果B版的来源高度集中在轮换开始之后才出现的渠道,就需要先对齐观察窗口,只比较两版都完整覆盖的时间段和来源。
站内统计、第三方估算和搜索引擎报告的口径不同,不能互相替代。站内统计能提供访客级路径,第三方估算通常只有聚合量,搜索引擎报告只覆盖来自搜索的部分。诊断样本污染时,优先使用能关联到单个访客的站内数据,再用其他口径做交叉验证,而不是用总量差异反推原因。
完成这四步后,如果跨版记录集中在少数入口页,且这些页面的跳出行为在两版接近,那么污染对总体访问量对比的影响有限,可以继续分析;如果跨版记录分散且伴随明显的路径跳跃,就应先解决分流一致性,再重新收集数据。这个判断决定了是继续用现有数据,还是暂停比较、回到分流配置本身。