内容提要
研究比较11种票据抽取系统,发现微调开源视觉语言模型在合成支票上F1超0.98,无需都用最大模型。选型应依据版式稳定性与错误代价:固定模板可用OCR加规则,版式多变再用VLM,样本多且字段稳定才值得微调。建议用真实文档分层测试,按字段设阈值,低置信度转人工,并保留规则基线和回归集。
延伸解读
合成数据结论的适用边界
论文在750份合成支票上比较11种系统,微调开源VLM的F1超过0.98,但这不代表真实场景同样表现。合成数据无法覆盖真实欺诈、印章遮挡、纸张老化和地域格式差异,版式、语言、扫描噪声和供应商分布也有限。采购或迁移前必须用自有文档做盲测,不能直接套用论文分数。
按字段设阈值比整体F1更关键
F1按字段聚合,整体高分可能掩盖少数关键字段的错误。金额错一位会直接影响付款,备注错标点影响有限。系统应对日期、金额、收款人采用双重校验,低置信度转人工;备注可放宽相似度。只报整体F1会让容易字段掩盖关键错误,上线前应为每个关键字段单独设指标。
最小验证方法:分层与多路线对比
先抽取200至500份真实历史文档,按模板、扫描质量、语言和时间分层,把最新模板和最差扫描件留作测试集,避免近重复样本泄漏。然后让OCR加规则、通用VLM、领域微调模型在同一数据上运行,记录字段级精确率与召回率、每页延迟、每千页成本、人工复核分钟数和失败可解释性,并加入旋转、阴影、低分辨率等噪声样本。
窄任务工程阶段的选型逻辑
文档AI已进入窄任务工程阶段,通用大模型提供强基线,但生产效果取决于字段定义、数据切分、异常路由和返工闭环。固定模板可用OCR加规则,版式多变再用VLM,样本多且字段稳定才值得微调。若文档量小、格式极稳,微调通常不划算;若错误会直接触发付款、诊疗或法律动作,也不适合无人工复核的端到端自动化。
Q&A
票据抽取一定要用最大的视觉语言模型吗?
不一定。研究比较11种系统发现,微调开源视觉语言模型在合成支票上F1超过0.98,且高于所有零样本商业系统。选型应依据版式稳定性和错误代价:固定模板可用OCR加规则,版式多变再用VLM,样本多且字段稳定才值得微调。
什么情况下用OCR加规则比视觉语言模型更合适?
当表单模板固定、字段坐标稳定时,OCR加规则通常更便宜、更容易解释。但遇到新版式、手写内容或模糊扫描时规则容易失效。
微调视觉语言模型适合什么样的票据抽取场景?
适合样本量大、字段长期稳定、错误成本足以覆盖训练与运维成本的场景。论文中3000份样本微调后F1超0.98,说明小而专的数据集可能比直接调用通用模型更有价值。
如何为票据抽取项目设计最小验证方法?
先抽取200至500份真实历史文档,按模板、扫描质量、语言和时间分层,将最新模板和最差扫描件留作测试集。定义严格字段规范(如日期ISO 8601、金额禁止千位分隔歧义)。让OCR加规则、通用VLM、微调模型三条路线在同一数据上运行,记录字段级精确率与召回率、延迟、成本、人工复核分钟数等,并加入旋转、阴影、裁切、低分辨率和新模板等噪声样本。
为什么不能只看整体F1来决定票据抽取系统上线?
因为F1按字段聚合,容易字段会掩盖关键错误。例如金额错一位直接影响付款,备注错标点影响有限。应按字段设阈值:日期、金额、收款人双重校验,低置信度转人工;备注可放宽。
票据抽取系统上线前需要检查哪些事项?
每个关键字段单独设指标;保留传统OCR规则基线;训练集与测试集按模板和时间隔离;为低置信度、格式冲突和新模板设置人工回退;记录模型版本、原图、输出与人工修改,建立回归集;确认敏感票据的存储、跨境、删除和审计要求;每次模板或模型升级后重跑噪声与边界样本。