当查询参数可以任意排列、任意组合、任意嵌套时,把所有参数组合都当作独立地址会迅速失控;更实用的定义是:只把“会改变页面核心内容或交易状态、且服务器确实据此返回不同内容”的参数组合算作有效地址集合,其余组合归一到一个代表地址。下面按两种成立条件分别说明选择依据、动作和代价。
如果参数会影响价格、库存、筛选结果、排序结果或分页内容,那么这些参数就属于集合划分的维度。做法是:对同一路径下的参数组合抓取代表性样本,提取正文主体、标题、结构化数据中的关键字段,做归一化后比较。
动作与结果:先跑一轮样本比对,把指纹相同的组合合并。合并后如果站内链接和站点地图都只指向代表地址,后续抓取预算会集中到真正有差异的地址上;代价是部分长尾组合不再被单独收录,需要确认这些组合没有独立搜索需求或外链。
当参数只用于追踪、会话、展示偏好,而服务器返回的正文完全一致时,理论上有效地址只有一个。此时判断依据不是参数本身,而是“是否存在站内可点击入口指向它”。
这里要提醒一点:robots.txt 的抓取限制不等于可靠的索引移除。即使屏蔽了带参路径,已抓取的地址仍可能留在索引里,所以更稳的动作是把规范标签和站内入口统一到代表地址,而不是只依赖抓取限制。站点地图同样不保证收录,它只是声明候选地址,不能用来证明某个组合“已经有效”。
参数组合无限增长,通常不是参数值太多,而是维度相乘。假设一个页面允许“颜色×尺寸×排序×页码”四个维度,每个维度各 5 个取值,理论组合就有 625 个(此处为假设示例,仅用于说明维度相乘的放大效果)。真正改变内容的可能只有“尺寸×页码”,颜色和排序只影响局部展示。
可执行动作:把每个参数维度单独测试一次,观察单独改变它是否引起正文指纹变化。只保留引起变化的维度参与有效集合定义,其余维度在服务端固定为默认值,并在链接生成时不再输出。这样做的结果是有效地址数量从乘积级降到加法级,站点地图和内部链接的规模变得可管理;代价是用户通过外部链接带来的非默认排序、非默认颜色状态会落到默认视图,需要确认这不影响核心转化路径。
分页参数通常保留在有效集合内,因为每页正文不同;但“页码超出实际范围”的地址应返回明确的状态并归入代表地址,而不是生成空内容页。多值参数(同一参数出现多次)需要明确取哪一个值生效,否则同一逻辑地址会产生多个物理地址。
另一个例外是规范化标签本身。如果规范标签指向的地址返回 404 或跳转到另一路径,这个标签就不能作为划分依据。核查方式是:对每个候选代表地址请求一次,确认它返回 200 且正文指纹与预期一致,再决定是否把其他组合归并过来。HTTPS 不保证安全无漏洞或排名,所以它不参与这里的集合定义,只能作为传输层的前提单独核查。
不同搜索引擎对参数处理和规范标签的支持情况须分别核查,不能用一个引擎的表现推断另一个。最终判断标准可以归结为一句:有效地址集合应当是“服务器确实返回不同核心内容、且站内有可达入口”的地址集合,其余组合统一收敛到一个代表地址,并持续用指纹比对验证收敛是否仍然成立。