诊断决策 / 失败检测
自动化每天都成功,为什么结果仍然不可信
定时任务绿灯只能证明进程结束。没有独立回读、数量守恒和异常样本,自动化可能稳定地产生错误。
先把本篇问题写成一句话,再确认它影响的是流量、Feed、页面、结账、EDM 还是数据复盘。
围绕任务输入、权限边界、执行日志、回读结果和人工闸门留下证据;稳定原则。
直接判断:任务调度器显示成功,只能证明程序没有以错误状态退出;它不能证明拉到了完整数据、改对了对象,也不能证明目标系统已经生效。
自动化失败有两种。显性失败会报错、超时或中断,通常容易发现;静默失败会正常结束,却返回空数据、旧缓存、部分分页、错误账号、被截断的文件或未被目标系统接受的请求。后者更危险,因为它会持续积累并被当成稳定流程。
先做判断
先问自动化当前证明了什么。若只有“脚本运行完成”和一份生成文件,它最多达到本地产物状态。要声称“数据已同步”或“页面已更新”,还必须有源端数量、变更摘要、目标端回读和异常样本。
监控不应只盯进程健康,也要盯业务不变量。例如商品总数不应无故归零,关键字段缺失率不应突变,同一来源的更新时间不应长期停住。
诊断与决策框架
第一类检查是输入完整性:认证是否仍有效、查询时间窗是否正确、分页是否走完、源数量与历史范围是否合理。空结果必须区分“确实没有数据”和“读取失败”。
第二类是变换守恒:输入多少、过滤多少、为什么跳过、输出多少。每个差额都应有原因码。AI 分类或生成步骤还要记录无法判断与低置信度数量,不能强制所有行看起来都有答案。
第三类是目标回读:写入后重新查询目标系统,比较关键字段、版本和对象数。异步平台要保留 pending、processed、rejected 等状态,不能在提交后立即宣布完成。
第四类是语义抽样:随机样本只能发现普遍问题,高风险样本还要按金额、流量、缺失字段或变更幅度定向抽查。纯数量一致也可能内容全错。
第五类是失败响应:达到阈值时停止后续写入、保留上一份可用产物、生成差异报告并通知 owner。自动化的可靠性来自可失败,而不是永远绿灯。
还要为“正常波动”建立基线区间。没有基线,任何变化都可能被误报;基线也不能永久不变,应在业务结构、数据源或平台逻辑发生明确变化后重新锁定,并保留调整理由。
常见误判
- 用是否抛异常作为唯一健康标准。
- 空数据时覆盖上一份有效文件,让下游误以为业务真的归零。
- 只验证文件存在,不验证记录数、字段和时间范围。
- 自动重试所有错误,结果对错误对象重复写入或放大限流。
验证清单
- 输入、过滤、输出和目标端数量都有守恒记录。
- 空结果、旧缓存、部分分页和身份错误有独立检测。
- AI 无法判断与低置信度项目不会被静默强填。
- 应用后使用目标系统独立回读,而非仅看提交响应。
- 同时进行随机抽样与高风险定向抽样。
- 失败时能停止扩散、保留上次有效状态并给 owner 可操作信息。
适用边界
本文适合定时拉数、Feed 生成、内容同步、页面检查与报告流水线。不同平台的异步处理和速率限制需要按当前 API 文档配置;对生产写入,失败检测不能替代预览、批准与回滚设计。
用 AI 证据链操作系统 定义状态证明,再按 失败检测与复盘剧本 建立日常检查。