当批量导入对象从“关键词列表”换成“URL 列表”时,不必推翻原有规范,而是先确认新对象的最小可识别字段,再补上页面级去重与状态字段,最后用一批样本回跑,观察导入结果是否与预期一致。缺少完整权限或历史数据时,这个动作依然可做,但只能判断“当前输入能否被正确解析”,不能据此推断排名或收录会如何变化。
词表和页面列表的差别不只是内容不同,而是唯一标识的层级变了。词表通常以词本身或“词+地区”为一行,页面列表则以 URL 为一行,同一个 URL 可能对应多个词,也可能对应零个词。如果直接把 URL 塞进原来的词字段,工具要么按字符串处理成一个超长关键词,要么整行丢弃,两种结果都会让后续统计失真。
可以先用三行样本做判断:一行是纯词,一行是纯 URL,一行是“URL+词”的组合。把三行分别导入,看工具把它们识别成几个对象、报什么错。如果纯 URL 被当成词,说明当前规范缺少对象类型字段;如果组合行被拆成两行,说明分隔符与新格式冲突。这个判断不需要完整数据,用样本即可完成。
更稳妥的做法是给每行增加一个对象类型字段,再规定该类型下的唯一标识。假设原规范是“关键词,地区,分组”,可以改成“对象类型,唯一标识,地区,分组”,其中对象类型只取两个值,唯一标识在词类型下填词、在页面类型下填完整 URL。这样同一份文件能容纳两种对象,旧行只需补一个类型值。
URL 规范化要写进规范里,否则同一页面会因大小写、末尾斜杠、跟踪参数被算成多个对象。最小规则可以是:统一小写主机名、去掉跟踪参数、保留路径末尾斜杠的原始写法并全表统一。规则不必复杂,但必须全表一致,否则去重结果无法解释。
没有导出权限时,仍可以手工整理一小段页面清单,按新规范填入类型、唯一标识、地区、分组四列,导入后只观察解析结果:行数是否与预期一致、有没有报错、去重后剩下几条。这个动作能回答“规范是否可执行”,不能回答“这些页面在目标词上的表现如何”,因为后者依赖数据源和权限,与输入格式无关。
如果连导入权限也没有,可以把规范写成一份字段说明,连同三行样本交给有权限的人试跑。此时你能推进的只是格式确认,不能替对方判断业务结果。把“格式已确认”和“结果待验证”分开记录,可以避免把一次成功导入误读成整体方案成立。
假设手上有 20 行页面清单,其中 3 行是同一页面的不同参数写法。按新规范导入后,如果去重结果是 18 行,说明 URL 规范化生效;如果仍是 20 行,说明规则没被应用或工具按原字符串处理。这个比较只说明格式处理是否符合预期,不说明这些页面是否该被跟踪。
验证通过后,下一步才扩大到完整清单,并补上状态字段,例如“待处理、已映射、已排除”,让格式问题与业务判断分开。验证不通过时,先回到字段定义,不要急着改数据源,因为多数导入异常出在唯一标识和分隔符,而不是数据本身。
导入后行数变少、字段错位或某列全空,常见原因有三类:分隔符在 URL 中重复出现、唯一标识未去重、类型字段缺失导致整列按默认类型解析。这三类都能用样本复现,不需要完整历史数据。反过来,如果样本全部正常而全量导入失败,才更可能是数据量、编码或权限问题,此时应单独排查,而不是继续改字段规范。
还需注意,导入成功、去重正确、报错为零,都只证明输入被正确解析。它们不能证明页面会被收录,也不能证明某个词的位置会变化,更不能证明工具本身适合长期使用。把结论限定在“输入规范已可执行”,后续再根据实际数据决定是否调整对象范围,是更稳妥的推进方式。