业务系统导入前,如何先把 PDF 和图片资料整理成可复核 Excel

很多系统导入项目卡住,不是因为 Excel 模板还没发下来,而是原始资料还散落在 PDF、扫描件和图片里:同一个字段有多种写法,找不到来源页,或导入前才发现日期、金额、编号的格式并不一致。

这时先建立一份可复核 Excel,能把“资料整理”和“系统导入”拆成两个可检查的阶段。前者关注字段、来源和状态;后者再处理系统字段映射、接口、权限和业务规则。两件事分开,问题才更容易定位。


1. 不要把导入模板当成原始资料的替代品

业务系统的导入模板通常只关心最终列名和格式,但原始资料还需要保留它来自哪份文件、哪一页、是否已经确认。若一开始就把内容填进最终模板,发现异常时很容易失去回查路径。

更稳妥的做法是先准备一张整理表,把“来源定位”和“复核状态”作为正式字段。之后导入系统时,再从已确认的列中生成或复制所需数据。

列名作用处理原则
来源文件找回 PDF 或图片保留稳定文件名
页面定位找回具体页面写页码或图片序号
业务标识区分一条记录先定义唯一规则
指定字段形成可导入的列按字段字典填写
复核状态管理未确认项不确定就保留待复核

这张整理表不是多做一张表,而是给后续导入留一层可解释的缓冲。有人接手、模板变化或发现数据问题时,都能回到原始资料确认。

2. 先锁定字段字典和格式规则

在处理资料前,和后续使用 Excel 的人先确认字段字典:每列叫什么、从什么位置取值、日期和金额使用什么格式、空值和异常怎么表示。字段字典不必很复杂,但必须足够明确,让不同资料按同一规则整理。

例如,某个日期字段是“文件日期”还是“业务生效日期”,某个编号是页面上最醒目的编号还是系统要求的业务编号,必须事先说清。否则即使每一条都被提取出来,也可能不是后续流程真正需要的数据。

💡Excel 是整理层,不是系统接入承诺
在这一步确认的是字段、来源和人工复核结果;接口映射、业务校验和实际写入仍属于后续系统项目。

3. 让文件批次和表格记录对应起来

准备资料时,先按业务批次、时间范围或资料类型建立文件夹,再给文件采用稳定名称。一个文件可以包含多页,但 Excel 中至少要能记录它的来源文件和页面定位。

当 PDF、图片和扫描资料被整理为清晰的批次后,再按已确认的字段清单处理。文档工作台可导入图片、PDF 或文件夹,按预先定义的字段整理结果;先用小批量资料验证字段规则,再处理全部资料,通常更容易发现问题。

图 1:原始资料先按批次整理,再进入字段提取流程。图片来自文档工作台客户端。

4. 字段结果必须回到原始页面核对

字段提取的价值在于先把需要确认的信息集中出来,而不是省略确认。对于日期、编号、金额和主体名称等字段,应回到原始页面检查位置和上下文,尤其注意相似字符、同页多个候选值和模糊扫描件。

图 2:确认字段时,需要保留原始页面作为复核依据。图片来自文档工作台客户端。

可以把检查结果明确写入表格:已确认、待复核、需补件或不适用。不要为了让导入文件没有空值而猜测填写;空值加状态,比一个无法解释的值更利于后续排查。

5. 导出前检查四件事

完成原件核对后,将字段结果导出为 Excel。交接给系统导入流程前,建议先检查以下四件事:

  1. 每条记录是否都能由 Excel 定位到来源文件和页面。

  2. 必填字段是否按字段字典填写,空值是否有状态说明。

  3. 日期、金额、编号等格式是否在同一批次中一致。

  4. 待复核和需补件记录是否已从可交接数据中单独标出。

图 3:导出 Excel 后,继续检查来源、字段和复核状态再交给下游。图片来自文档工作台客户端。

这些检查通过后,Excel 才适合作为后续字段映射或系统导入的输入。至于具体怎样对接接口、怎样写入系统、怎样处理业务规则,仍需由相应的系统方案和验收流程决定。

6. 用样本先确认资料是否可整理

开始前可以选一小批最典型的 PDF 和图片,测试字段字典是否够用、资料是否清晰、异常能否被定位。通过样本验证后,再扩大处理范围,能避免把不一致的规则带进整批数据。

不想自行配置 OCR 环境,只需要按字段整理出可复核 Excel 的读者,可以使用文档工作台。下载入口:夸克夸克