当参数可以任意排列、任意重复、任意填值时,URL 空间理论上是无限的,但真正需要被搜索引擎当作独立地址处理的集合必须收窄。常见做法是:只把会改变页面主体内容、且能稳定返回同一结果的参数组合纳入有效地址集合,其余组合统一归到规范地址或被拒绝访问。缺少完整日志和抓取权限时,仍可以先从站内链接、站点地图和页面自身输出的链接入手,做一次可复现的抽样,而不是等数据齐全再动手。
一个典型现象是:站点地图提交的 URL 数量持续增加,抓取日志里也出现大量带参数的访问,但真正能带来访问的落地页数量几乎不变。此时有两种解释。
第一种解释是地址集合本身定义过宽。程序把排序、分页、筛选、会话标识、来源追踪等参数都当成了独立地址,搜索引擎于是把同一批内容拆成许多入口,权重被摊薄,重复内容互相竞争。
第二种解释是有效集合定义正确,但发布方式有问题。参数地址被大量站内链接或站点地图主动暴露,搜索引擎只是被动跟随,并不代表这些地址有独立价值。此时问题出在链接和提交策略,而不是集合定义。
这两种解释对应的动作完全不同,所以要先区分,再决定改哪里。
可以看三类证据。
把这些证据放在一起,就能判断该收窄集合,还是该收窄发布面。注意,抓取量或收录量的变化本身不能单独证明判断正确,它还可能来自抓取预算调整、站点整体改版或外部链接变化。
没有完整日志、没有搜索平台权限时,仍可执行一个最小动作:从站点地图和首页出发,抓取站内链接,筛出带查询参数的地址,按参数名分组,统计每组出现的次数和来源页面。这个动作只依赖公开可访问的页面,不需要后台。
得到分组后,对每组抽一到两个样本手动请求,记录返回的正文主体是否与无参数版本一致。若一致,就把该参数组标记为“可收敛”;若不一致,标记为“需保留”。这一步的结果直接决定下一步:可收敛的参数组进入规范或拒绝规则,需保留的参数组则要检查它是否真的需要独立地址,还是应该改成路径形式。
一个参数组合可以进入有效地址集合,通常需要同时满足:
不满足这些条件的组合,应通过规范标记、参数处理规则或访问控制收敛到一个代表地址。这里要区分:robots.txt 的抓取限制只是阻止抓取,不等于可靠的索引移除;站点地图列出地址也不保证收录。因此收敛动作要落在地址本身和链接发布上,而不是只靠一份限制文件。
假设某托管客户的商品列表页支持排序、每页数量和筛选三个参数。排序参数只改变顺序,每页数量只改变分页切分,筛选参数会改变返回的商品集合。按上面的条件,排序和每页数量应被收敛,筛选参数可以保留但需要限制取值组合。
执行最小动作后,如果发现站内链接只暴露了默认排序,而站点地图却列出了全部排序组合,那么问题更可能在发布面,先清理站点地图和站内链接即可;如果站内链接本身就大量指向不同排序组合,那么问题在集合定义,需要先改链接生成规则,再处理已暴露的地址。两种结果指向不同的下一步,这也是先抽样再动手的原因。
最后要说明适用条件:以上判断依赖页面能公开访问、参数行为可复现。若站点对未登录请求返回不同内容,或参数值由前端动态生成而服务端不感知,抽样结论会失真,此时应先确认服务端实际收到的参数,再定义有效地址集合。