先不要把“没有变化”解释成策略无效。更常见的情况是:试验根本没有按你设想的方式上线,或者上线了但只覆盖了一部分页面。判断办法是找一条能独立于结果指标的证据链,确认改动是否真的到达用户和爬虫可见的那一层,再决定是继续观察还是回滚重做。
这两种情况的后续动作完全相反。未实施应当先修复部署,再重新计时;实施了但无效,才需要评估假设本身是否成立。区分依据不是排名或流量有没有动,而是改动是否在真实环境中可被验证。
可以用一个假设例子说明。假设你给某批产品页的标题模板加了品牌后缀,预期点击率上升。两周后点击率持平。此时有两种解释:一是标题确实没有影响;二是模板只应用到了新建页面,存量页面仍走旧模板。要区分它们,需要直接抓取线上页面源码,而不是看后台配置界面。后台显示“已启用”只说明配置存在,不说明输出生效。
结果指标本身不能证明实施与否,因为影响它的因素太多。第三方估算流量、搜索引擎后台报告和站内统计的口径本来就不同,用它们反推“改动是否生效”容易得出错误结论。更可靠的做法是找一层与结果无关、但能被直接观察的证据。
这四类证据里,线上源码和覆盖范围最关键。它们不依赖任何平台报告,也不受统计口径影响。如果源码里根本没有改动,后面所有关于效果的讨论都没有意义。
拿到证据后,按下面两种条件分叉。
条件一:证据显示改动已完整生效。此时“没变化”是一个有效结果,可以进入假设评估。下一步是检查预期是否本身就不合理,比如改动幅度太小、目标页面本身曝光极低、或者改动与用户决策无关。此时继续等待通常不会带来新信息。
条件二:证据显示改动未生效或只部分生效。此时不应评估策略效果,因为样本已经被污染。下一步是修复部署并重新确定观察起点。已经过去的时间不能算作试验周期。
一个实际动作是:从应受影响的页面中随机抽取若干条 URL,逐条请求并检查关键标记是否存在。如果命中率明显低于预期,就说明问题在覆盖范围而非策略本身。这个结果直接决定下一步是回到部署环节,而不是去改内容。
不是所有缺失都意味着出错。以下情况需要单独判断,避免把正常行为当成部署失败。
这些例外的共同点是:改动可能确实存在,只是不在你检查的那一层。判断方法是换一个观察位置,而不是直接判定失败。如果换了位置仍然看不到,才回到部署问题。
诊断的价值在于让下一步有依据。建议在每次试验开始时,先固定一条实施证据和一条结果指标,并记录各自的检查方式。出现与直觉相反的结果时,先跑实施证据,再决定是否讨论效果。这样可以把“没变化”拆成两个可回答的问题:改动到了没有,以及到了之后有没有用。前者是部署问题,后者才是策略问题。