先给结论:升级后评分变化,通常不是“站点变好或变坏”的直接证据,而是评分口径变了。要解释差异,先把旧分和新分拆成“同一批数据、同一套规则、同一时间窗”三个变量,再判断哪些旧结论仍可用。如果只有分数变了、底层指标没变,优先怀疑规则权重或阈值调整;如果底层指标也变了,才轮到站点本身的变化。
升级后最容易被忽略的是:工具可能同时改了指标定义、采样范围和展示方式。你可以做一个最小对照——把升级前最后一次报告和升级后第一次报告,按同一时间段、同一批页面重新拉一遍。如果新旧报告里“可抓取页面数”“索引状态分布”这类基础计数一致,只有分数不同,那差异基本落在规则侧;如果基础计数本身就变了,说明数据口径或采集范围也动了,分数差异就不能单独归因于规则。
这里有个常见误判:把分数下降当成站点质量下降。实际上,阈值收紧、权重重新分配、甚至某类问题从“提示”升级为“扣分项”,都会让同一站点得分下滑,而站点本身一行代码都没改。反过来,分数上升也可能是旧规则漏判的问题被新规则正确识别后不再计分,而不是你修好了什么。
面对评分差异,实际决策不是“信新分还是信旧分”,而是决定旧有优化动作要不要继续。
这三种取舍不要求同时成立。多数情况下,你会同时保留一部分、改写一部分、退出一部分,关键是每一项都要有对应的证据,而不是按分数涨跌整体切换策略。
要判断差异到底来自哪里,可以按下面顺序收集证据,每一步的结果都会决定下一步该查什么。
假设一个场景:某站点升级前总分 82,升级后 74,但“可抓取页面数”“标题缺失数”等基础计数完全一致。抽查后发现,下降集中在“内容质量”这一类,而该类在新版本里拆成了两个子项。此时合理推断是评分维度变细导致总分被重新分配,而不是内容质量真的变差。下一步动作应是按新子项分别核对,而不是回头去改已经达标的内容。
解释差异的终点不是写一份说明,而是决定接下来做什么。一个可操作的收尾方式是:为每个受影响的规则项标注“保留 / 改写 / 退出”,并写清判断依据来自哪一步证据。如果某规则项无法确认是否仍计分,先按“观察”处理,给它一个明确的复核条件,比如“下次报告若该项仍不出现,则退出”。
另外要接受一个现实:跨版本的分数本身不是可比指标。你可以比较同一版本内不同页面的相对表现,也可以比较同一页面在同一版本内随时间的走向,但把升级前后的总分直接相减,得到的数字既不能证明优化有效,也不能证明站点退步。真正能支撑决策的,是底层指标是否可复现、规则项是否仍可定位,以及旧动作在新口径下是否还有对应的验证方式。