先给结论:不要按“整批交付”抽,而要按“同工艺、同批次、同执行人”分组抽。试做阶段通常由资深人员手工完成,批量阶段往往换成模板化流程或新人执行,质量落差就藏在这条缝里。抽查的目标不是打分,而是找到可复现的退化点,再决定是返工、换人还是重谈交付标准。
批量交付变差,最常见的原因是抽样对象本身不可比。你手里的资料可能是一批页面、一批外链记录或一批内容稿,但它们未必出自同一执行路径。先做一次分组:按执行人、按模板版本、按提交时间窗口各分一层,只有同组内的产出才值得互相比较。
具体动作:打开交付清单,给每条记录补两列——“执行人”和“使用的模板或脚本版本”。如果外包方不提供,就用文件元数据、提交时间戳或内容结构反推。分组完成后,你会看到退化往往集中在某一两组,而不是均匀分布。这一步的结果直接决定下一步:如果退化集中在单组,问题多半是执行人或模板;如果各组都退化,问题更可能在验收标准本身太松。
试做阶段之所以表现好,是因为它同时充当了“样品”和“标准”。抽查时要把当时的产出调出来,逐项对比,而不是凭记忆判断“现在不如以前”。对比维度建议固定为三类:结构完整度(标题层级、内链位置、字段是否齐全)、执行一致性(同一规则是否每次都执行)、可验证信息(数据、来源、时间是否经得起核对)。
假设一个场景:试做阶段交付的十篇内容,每篇都有独立的数据来源和明确的时间标注;批量交付的五十篇里,有三十篇的来源被替换成同一句笼统表述。这不是文笔问题,而是执行规则被简化。发现这种模式后,下一步不是逐篇返工,而是要求外包方说明规则在哪一步被省略,并确认补回规则后能否稳定复现。
成品好看不代表过程可靠。批量交付变差时,过程证据往往先出问题:操作记录缺失、修改日志被覆盖、同一项检查在不同批次里执行次数不一致。抽查时至少要求看两类过程材料——一次完整操作的原始记录,以及该批次内任意两次操作的对比记录。
这个判断会改变你的下一步动作:前者可以继续合作但收紧验收,后者需要考虑暂停批量交付或更换执行团队。
抽查不是为了出一份报告,而是为了在三个选项里做选择:返工、缩小批量、终止合作。判断依据可以简化成两条:退化是否可复现,以及外包方能否说清退化发生的位置。
注意,某一批次的抓取量、收录量或提交量出现下降,不能单独证明是外包方处理错误。这些现象还可能来自站点自身改动、抓取预算变化或内容整体调整。抽查时要把它当作线索而非结论,回到分组和过程证据里找解释。
批量交付的质量落差通常不是突然发生的,而是随批量扩大逐步累积。与其等到明显变差再抽查,不如在每次批量交付中固定抽一个小样本,按同样的分组和对比方法记录。这样你手里会有一条可比较的质量曲线,而不是一次性的印象。当曲线出现连续下滑时,你已经有足够的依据去和外包方谈调整,而不是等到问题无法收拾才被动换人。