核心做法是:先承认参数空间无法穷举,再用“可枚举的稳定路径 + 明确参数白名单 + 规范化规则”定义有效地址集合,把无限组合挡在提交之外。下面用一个假设情境说明取舍和可执行的最小动作。
假设一个电商站点的列表页支持颜色、尺码、排序、分页四类参数,每类取值几十个,任意组合后地址数量在理论上趋于无限。站点没有完整的抓取日志权限,只能看到服务器访问记录的一部分,也无法确认各搜索引擎实际抓了多少。此时如果继续把全部带参地址提交,等于把无法验证的集合交给外部处理。
在这个前提下,需要先定义一个“有效地址集合”,即站点愿意让搜索引擎抓取并可能索引的地址范围。它不追求覆盖所有组合,而是覆盖有独立价值、能被稳定复现的那部分。
有效集合可以拆成两层:路径层和参数层。路径层指不依赖参数就能定位的页面,例如分类页、商品详情页、文章页,这部分可以枚举并纳入站点地图。参数层指筛选、排序、分页等附加条件,这部分不能枚举,只能通过规则约束。
判断某个参数是否进入有效集合,可以看三个条件:
三个条件都满足时,才考虑保留为可抓取地址;只满足其中一个或两个时,通常归入规范化或屏蔽范围。
参数无法穷举,但可以定义白名单。例如只允许 sort 取 price_asc、price_desc 两个值,其余取值一律 301 到默认列表页。颜色、尺码这类多值组合不单独生成可索引地址,而是通过页面内交互加载,不改变主地址。
规范化规则要同时处理三件事:
执行这一步后,可以观察服务器访问记录中带参请求的分布是否收敛。如果收敛,说明规则在减少无效组合;如果没有收敛,说明还有未识别的参数入口,需要回到白名单继续排查。
在缺少完整数据或权限时,仍可执行的最小动作是:整理一份参数清单,标注每个参数的用途、取值是否有限、是否改变主体内容;然后对清单外的参数统一设置规范化或抓取限制。这个动作不依赖后台权限,只依赖对站点结构的梳理。
需要说明的是,robots.txt 的抓取限制不等于可靠的索引移除,已被抓取的地址仍可能留在索引中;站点地图也不保证收录,它只是提交候选地址的一种方式。因此,收敛有效地址集合的目标是减少无效提交和抓取浪费,而不是承诺某个地址一定被处理。
如果后续发现带参请求量下降,不能单独据此证明规则正确,因为流量波动、抓取预算调整、外部链接变化都可能有影响。更稳妥的下一步是抽样检查若干被规范化的地址,确认它们返回的状态和最终展示页面是否符合预期,再决定是否扩大规则范围。