先给结论:升级后评分变化,通常不是“网站突然变差”,而是评分口径本身换了。要解释差异,不能拿旧分数和新分数直接比,而要把两次评分拆成“同一批页面、同一批规则、同一批数据”再对照。如果三项里至少两项变了,分数差异就主要来自工具,而不是站点。
面对“上周 82 分、升级后 61 分”这类现象,团队里常见两种解释。
两种解释都会让分数变低,但后续动作完全相反:前者要修页面,后者要改评估标准。混在一起讨论,就会变成“技术说页面没问题、运营说分数掉了”的僵局。
最有效的做法是做一次固定样本对照。选 10 到 20 个升级前后都没动过的页面,记录三项:旧版分数、新版分数、新版扣分项。然后看扣分项的性质。
这里要提醒一点:抓取量下降、报告条目归零,都不能单独证明“处理正确”或“站点变好”。抓取量下降还可能来自抓取配额调整、robots 变更、服务器波动;条目归零也可能只是新版不再展示该类提示。把它们当作单一证据,容易得出反向结论。
假设某站点有 50 个页面,升级前平均 80 分,升级后平均 65 分。团队先取出 12 个未改动页面,发现其中 9 个的新版扣分项都是“结构化数据不完整”,而旧版报告里没有这一项。再查这 9 个页面的实际代码,结构化数据确实缺失。
这个对照说明两件事:第一,分数下降主要来自新增规则,不是页面在这段时间变差;第二,新增规则指出的问题是真实存在的。于是下一步动作不是“把分数调回去”,而是决定要不要补结构化数据——如果这类页面承担搜索流量,就值得补;如果只是内部页面,可以先把它们从达标统计里排除。这个动作的结果会直接影响下一轮评估:补完后新版分数会回升,但回升幅度取决于权重,不应预设固定数值。
多角色对同一份报告有不同理解时,不要争论“分数准不准”,而是把它拆成可核对项。
完成这四步后,团队通常会得到一个明确结论:差异来自规则、权重还是站点事实。这个结论决定了下一步是修页面、改统计口径,还是暂时接受分数波动并观察。具体工具的规则说明、版本记录和报告字段是否提供,需要以该工具当前实际界面为准,不能凭旧印象推断。
如果对照样本里扣分项没有指向真实页面问题,且新版规则与你的核心目标无关,那么这次分数变化可以只作为记录,不触发返工。反过来,如果新版扣分项集中在你最在意的页面类型上,即使分数只降了几分,也值得优先核对。判断依据始终是“扣分项是否对应真实影响”,而不是分数本身的涨跌幅度。