如果试做阶段的样本由资深人员手工完成、批量阶段改由流水线或新人执行,那么“抽查”应优先覆盖人员与流程切换点,而不是平均撒网。具体做法是:先按交付批次分层,再对每个批次的头尾各抽一份,最后用同一套可复核的清单比对。只有当试做与批量使用同一批人、同一套素材来源和同一验收口径时,试做表现才可以作为批量的参照;否则试做成绩只能说明方法可行,不能说明批量稳定。
试做阶段表现好、批量交付变差,最常见的原因不是能力下降,而是变量变了。需要先列出可能变化的环节:执行人员是否更换、素材是否从精选改为批量采集、审核是否从逐条改为抽检、交付节奏是否从宽松改为压缩。只有定位到变化点,抽查才有方向。
可以按下面三类证据区分原因:
一个假设例子:某次试做交付10条内容,由一名编辑逐条核对;批量阶段改为每天交付100条,由三人轮班。抽查时如果只随机抽10条,很可能全部落在同一人、同一天,无法暴露轮班带来的差异。改为按人、按天各抽2条,问题分布就会清楚得多。
抽查量不必追求统计显著性,但要覆盖关键变量。可按以下顺序执行:
抽查结果要能影响下一步动作。如果同一执行人的多份样本都出现同类错误,应暂停该执行人的批量任务并重新培训;如果错误集中在某一环节,应修改该环节的检查方式;如果错误分散且无规律,说明标准本身不清晰,应先统一验收口径再继续批量。
有一种反例会让上述抽查方法失效:试做阶段使用的素材是人工精选的高质量样本,而批量阶段的素材来自自动采集或客户直接提供。此时试做表现好只说明“好素材能做好”,不能说明“普通素材也能做好”。批量变差的原因在输入端,不在执行端。继续按人员或流程抽查,只会得到“执行没问题、素材有问题”的结论,但仍无法判断批量交付是否合格。
遇到这种情况,应把抽查对象从成品前移到输入素材:先抽一批原始素材,检查其完整度、相关性和可用比例,再决定是否要求更换素材来源或增加预处理环节。抽查成品只能发现症状,抽查输入才能定位病因。
完成一轮抽查后,用以下标准决定下一步:
抽查的目的不是给整批交付打分,而是找出“试做可行、批量不可行”的具体断点。只有把断点定位到人、环节或素材中的某一项,后续的整改才有明确对象,也才能判断批量交付是否具备继续放大的条件。