OCR 兜底管线怎么跑好:阈值、按页分诊、成本账、抽检与补跑(运维手册)
前言
昨天那篇讲了"让模型看懂 PDF"的全貌:有字的重建表格,没字的请多模态当眼睛。这篇是后半条的运维手册——OCR 兜底实际跑起来,判定阈值怎么拿捏、钱怎么算、质量怎么验、失败了怎么补。五件事,全是上篇没讲的干货。
一、判定阈值:宁低勿高
体检规则(空文本判;中文占比极低加乱码特征判天书)昨天提过,今天讲阈值拿捏。
核心原则:宁低勿高。误杀的代价是正常文档被送 OCR——白花调用费,还可能把对的认成错的。正常中文文档不可能只有几个百分点的汉字,占比掉到那个量级、再配上天书特征才判乱码。阈值是用"漏放的天书"换"不误杀好文档"——漏放的下游有人工抽检兜着,误杀没人兜。
二、按页处理:别把整本丢进去
成本坑第一名:整本 PDF 一刀切全送 OCR。实际一本两百页的扫描合同,常常只有盖章页、签名页是图片型,其余页文字层完好。
正确姿势是按页分诊:逐页体检,只有不过的页才转图送认。两百页可能只需认三五页——钱和时间都省在这个差别上。
三、成本账:先试跑,再放量
多模态认图按调用计费,存量动辄几千上万页:
| 试跑 | 几十页有代表性的(打印体/表格页/盖章页)评质量、算单页成本 |
| 定策略 | 全量兜底 vs 按需兜底(只对被检索需求点到的文档跑) |
| 排优先级 | 高频访问分类 > 近期支撑业务的 > 长尾档案 |
一把梭全量跑,是 OCR 预算超支的标准剧本。
四、质量验收:数字要抽检
- 每批抽检:抽几页人工核对,比例跟文档重要度挂钩;
- 表格页重点抽:正文错一个字影响不大,表格错一个数,查询就错一个答案——数字是 OCR 质量的命门;
- 关键文档全检:要进业务流程的别赌概率;
- 预期管理:手写体别指望太高,打印体才是主场。
五、失败补跑:警告日志就是补跑清单
降级原则(兜底件故障不拖垮主流程)昨天讲过,今天讲善后:被跳过的每一页都在警告日志里,那份日志就是补跑清单——多模态配置好之后按清单补跑,一条不漏。
降级必须留痕:不留痕的跳过等于丢了,留了痕的跳过只是排队。兜底设计的完整性,一半在降级那一刀,一半在事后补跑那一圈。
总结
运维五条:阈值宁低勿高防误杀,按页分诊别整本梭,先试跑再放量排好优先级,数字抽检表格页是命门,警告日志就是补跑清单。
下一篇:有人故意往 AI 的记忆里塞坏东西怎么办?记忆投毒防御。
你的扫描件存量跑过成本测算吗?评论区聊聊。




