当一批页面只有一部分被搜索引擎发现时,先不要急着改模板或重发站点地图。更稳的做法是把这批页面按一个可解释的差异切成两组:一组是“已发现”,一组是“未发现”,然后只改变一个变量做对照。对照组的意义不是证明谁对谁错,而是帮你判断该保留现有做法、改写单页信号,还是退出这批页面的投入。
“被发现”至少可能指三种不同情况:链接被爬虫请求过、页面被收录进索引、页面能对某个查询产生展现。三者不能混为一谈。缺少日志或索引数据时,你能观察到的最小证据通常是:站内链接是否指向该页、站点地图是否包含该页、页面是否返回正常状态码、页面是否能被直接访问。
如果只能拿到其中一两种证据,就不要把“未出现在结果里”直接解释为“被屏蔽”或“质量差”。robots.txt 的抓取限制不等于可靠的索引移除,站点地图也不保证收录。更合理的做法是把可观察到的差异先记录下来,再决定分组条件。
常见的错误是按“已发现/未发现”直接分组,然后对比两组页面的内容长度、内链数量、发布时间,这样几乎必然得出相关而非因果的结论,因为分组本身就来自结果。正确的顺序是:先选一个与结果无关、或在结果出现前就已存在的差异作为分组变量,再看两组的发现比例是否不同。
可用的分组变量包括:
假设一批 200 个页面中,有 60 个被请求过。你可以按“是否有站内链接指向”切成两组,各 100 个,然后比较两组的被请求比例。这个比较只说明链接差异与发现比例是否同向变化,不能直接推出“加内链就一定被收录”。
保留适用于:未发现页面与已发现页面在分组变量上差异很小,且这批页面本身有稳定需求或业务价值。此时最小动作是保持现有结构,只补一条从已发现页面指向未发现页面的站内链接,然后观察该页是否在后续抓取中被请求。如果请求量上升但索引状态不变,说明抓取不是唯一瓶颈,下一步应转向页面内容或重复信号,而不是继续加链接。
改写适用于:分组变量显示未发现页面集中在某个模板或某类内容上,且这些页面之间高度相似。此时可以只改写其中一组的一小部分页面,保留另一组不动作为对照。改写后如果只有被改写组出现发现比例变化,才值得考虑扩大范围;如果两组同步变化,更可能是抓取预算或站点整体变化所致。
退出适用于:分组变量显示未发现页面没有独立需求、没有站内链接、也没有外部引用,且改写成本高于预期收益。退出的具体动作可以是把这些页面合并到已有页面、设置规范化指向,或从站点地图中移除。但要注意,移除站点地图不等于索引移除;如果页面仍可访问且被链接,它仍可能被发现。
没有日志和索引权限时,仍可执行的最小动作是:选一个分组变量,记录两组的可观察差异,只改一个变量,等待一个抓取周期后再比较。这个周期没有固定天数,取决于站点规模和抓取频率,不能承诺具体见效时间。
不能推出的结论包括:某次抓取量归零就证明页面被正确处理;某组发现比例高就证明该组模板更优;站点地图提交后未发现页面就会立刻被收录。抓取量下降还可能来自服务器响应变慢、站点整体改版、外部链接变化或爬虫调度调整,这些都需要单独排查。
如果必须在不完整数据下做决定,优先选择可逆动作:先补内链、先改写少量页面、先保留原页面。可逆动作的结果无论好坏,都能为下一步提供依据;不可逆的删除或大规模改版,应在对照组显示出稳定差异后再考虑。