先给结论:不要按“已发现”和“未发现”直接分组,而要按一个你能够主动改变、且改变时间点清晰的变量来划分。在缺少完整数据或权限时,最小动作是选一批结构相同、发布时间相近的 URL,只对其中一部分做同一个操作,另一部分保持不动,然后比较两组的发现比例变化。这个动作能帮你缩小原因范围,但不能单独证明某个因素导致了收录差异。
假设你负责一个内容站,某次批量上线了 200 个结构相同的详情页。一段时间后,通过站点查询发现其中约 60 个能被检索到,其余大部分没有出现在结果里。你没有百度搜索资源平台的全部权限,也拿不到完整的抓取日志,只能看到公开检索结果和站内自己记录的页面属性。
这时最容易犯的错误,是把“已发现”的 60 个当成实验组,把“未发现”的 140 个当成对照组,然后去比较两组的标题长度、正文词数、内链数量。这样做的问题在于:分组依据本身就是结果,任何差异都可能是结果造成的,而不是原因。比如未发现的页面可能因为长期不被抓取,内链自然更少。
可行的做法是:从 200 个页面中,先筛出那些在结构、模板、发布时间、入口位置上都接近的页面,再把它们随机或按固定规则分成两组。只对 A 组执行一个动作,B 组不动。动作可以是补充站内入口链接、调整站点地图中的更新时间、或把页面加入一个更容易被爬取的列表页。动作要单一,不要同时改标题、正文和链接。
执行后,隔一段固定时间观察两组的公开检索结果变化。如果 A 组被发现的页面数量相对 B 组有稳定变化,说明这个动作值得继续;如果两组没有可区分的变化,就不能把“未被发现”归因于你操作的那个变量。这里的关键是:对照组不是“没被索引的页面”,而是“和你操作对象条件相近、但没有接受操作的页面”。
没有完整日志时,可以退一步,用公开检索结果和站内记录做最小验证。具体动作如下:
这个动作的结果只能说明“补入口链接”和“当前可见变化”之间是否存在关联。它不能推出百度一定因为入口链接而收录,也不能推出其他未操作页面也会同样变化。若两组都出现变化,更合理的解释可能是这批页面本身进入了新的抓取周期,而不是你的操作起了作用。
能帮助区分的证据,是操作前后两组之间的相对差异,以及差异是否在多个时间点重复出现。比如 A 组在操作后连续两次检查中出现可见页面增加,而 B 组没有同步增加,这比只看一次结果更有参考价值。
不能单独作为结论的证据包括:站点地图提交后部分页面出现;robots.txt 没有屏蔽这些页面;页面使用 HTTPS;某次检索结果数量变化。站点地图不保证收录,robots.txt 的抓取限制也不等于可靠的索引移除,HTTPS 同样不保证排名。检索结果数量归零或减少,也可能是查询方式变化、结果展示调整或页面本身内容变动造成的,不能直接判定为处理正确或错误。
如果 A 组相对 B 组出现了可重复的差异,下一步可以扩大操作范围,但仍要保留未操作的对照页面。如果两组没有差异,下一步不应继续加大同一动作的强度,而应换一个可干预变量重新分组,例如改变页面在站内的入口层级,或调整页面所属的聚合路径。每次只验证一个变量,才能让下一轮判断有依据。
整个过程要接受一个前提:你观察到的只是公开可见结果与站内记录之间的关系,不是完整的抓取和索引过程。对照组的作用是帮你排除“本来就会发生的变化”,而不是替你证明因果关系。把这一点写进记录里,后续决策才不会建立在单次观察上。