判断关键词监控软件是否漏采,核心方法是做一次可复现的抽样比对:从被监控对象上手动取一批已知存在的关键词记录,与软件在同一时间范围内的采集结果逐条对照,统计缺失比例并定位缺失集中在哪个环节。不要只看软件显示的“采集成功”数量,那个数字只说明任务跑完了,不说明数据完整。
遗漏不是指软件没抓到全部内容,而是指在它声称覆盖的范围内,实际存在且应当被抓到的记录没有进入结果集。判断前要先固定三个边界:
第一次接触这个问题时,建议先只选一个来源、一个时间窗口做验证,不要一上来就全量核对。
具体做法是建立一份人工基准清单,再和软件导出结果做差集。步骤可以这样执行:
判断结果时看两类信号:如果缺失项分散、比例很低,可能是采集频率或分页边界问题;如果缺失项集中在某个时间段或某个栏目,更可能是抓取规则、翻页逻辑或来源改版导致。这里要区分“可能原因”和“已定位原因”——差集只能证明漏了什么,不能直接证明为什么漏。
抽样比对告诉你“少了什么”,日志核对帮你判断“在哪一步少的”。需要分清三组容易混淆的口径:
可执行的检查项:把一次采集任务拆成“发起请求数—返回成功数—解析出条目数—去重后入库数”四个数字,逐个对比。哪一步开始明显下降,遗漏就发生在那一环。
假设某来源当天发布了 50 条带目标关键词的记录(此为假设示例,非真实项目数据)。人工清单记下这 50 条的唯一标识,软件导出结果为 46 条,差集是 4 条。回到原页面确认这 4 条确实存在且在监控范围内,说明存在遗漏。
再看这 4 条的分布:如果都出现在列表的第 2 页之后,优先怀疑翻页或分页上限;如果都集中在某个固定时段,优先怀疑采集频率;如果标题格式与其它条目不同,优先怀疑解析规则。这样一次比对就能把“有没有漏”推进到“大概漏在哪”。
判断完成的验收信号是:你能说清缺失比例、缺失集中在哪个环节、以及哪一条证据支持这个结论。如果只是“感觉少了”,说明比对还没做到可复现。
下一步建议固定这份人工基准清单和差集方法,在每次调整采集规则后重跑一次同样的比对。规则改动前后差集缩小,才说明调整有效;差集不变或变大,就要回到日志的四个数字重新定位。