当筛选参数、排序参数、分页参数可以任意组合时,把“所有能拼出来的 URL”都当成待收录地址,会让有效集合迅速膨胀到无法管理。更可操作的定义是:只把能独立满足搜索意图、且可由站内稳定链接到达的参数组合纳入有效集合,其余组合统一归入“可抓取但不必收录”的排除集。这个定义不是一次性规则,而是一套需要持续维护的判定标准。
假设一个商品列表页有颜色、尺码、排序方式、每页数量四类参数。单独测试“颜色=红”“尺码=M”“排序=价格升序”时,每个组合都能返回有差异的内容,看起来都值得收录。但当四类参数交叉后,地址总量按乘法增长,出现了三种典型例外:
这说明“单个样本成立”不能直接外推到全量。样本阶段验证的是“该参数有效”,规模化阶段要回答的是“该组合是否构成独立地址”。
解释一:内容确实不同,只是抓取和展示被稀释。如果每个组合都能返回一批独有商品,只是部分组合商品数量很少,那么有效集合可以按“结果集是否具备独立检索价值”来定义,而不是按“是否返回了页面”来定义。
解释二:内容并未真正不同,只是地址形态不同。如果多个组合最终渲染出同一批商品,差异仅在于参数顺序、默认值回填或排序方式,那么这些地址属于同一逻辑页面的变体,不应各自计入有效集合。
两种解释的分界线是:参数是否改变了页面所承载的信息集合,而不只是改变了信息的排列或入口。
不要只看“页面能否打开”。以下证据组合起来才能区分:
这里有一个需要反复强调的边界:robots.txt 的抓取限制不等于可靠的索引移除。被禁止抓取的地址仍可能因外部链接而被索引,因此不能用抓取屏蔽来定义有效集合。
把有效地址集合的判定拆成三个动作,每个动作的结果决定下一步:
假设某站点有 8 个颜色、5 个尺码、3 种排序、4 种每页数量。全量组合是 480 个。按上述流程,排序和每页数量先被排除,剩 40 个颜色与尺码组合;再按结果集比对合并重复组合,假设最终得到 12 个代表地址。这 12 个就是当前的有效集合。这个数字是假设,用于说明比较方法,不代表任何真实站点的结果。
站点地图可以提交这 12 个代表地址,但站点地图不保证收录。它的作用是帮助发现,而不是索引承诺。若后续新增颜色或尺码,需要重新执行结果集比对,而不是直接把新组合追加进有效集合。
上述流程依赖两个前提:参数确实会改变结果集,且站内存在稳定的链接路径。如果参数组合由用户会话或临时令牌生成,地址本身不可复现,那么它不应进入有效集合的讨论范围。如果站点主要流量来自平台推荐或广告而非搜索,有效集合的优先级也应相应调整。
最后,不同搜索引擎对参数地址的处理方式需要分别核查。同一组参数在一个引擎中被视为重复,在另一个引擎中可能被正常收录。有效集合的定义可以统一,但验证动作必须按引擎分别执行。