扫描形成页面影像,OCR 尝试把图像中的文字识别为文本,目录著录则组织描述信息。三者用途不同,选择时应先明确实际查询需求。

扫描解决影像采集,OCR 提供识别文本

档案扫描将纸张上的页面采集为数字影像。OCR 即光学字符识别,可将图像中的文字转换为文本,为全文查询等用途提供数据。扫描图像与识别文本属于不同成果,交付时需要分别约定。

识别效果会受到字迹清晰度、版式、手写内容和图像质量等因素影响。识别出的内容需要按用途核对,不能仅因文本可以复制,就认为与原件完全一致。

目录检索与全文检索各有用途

按档号、题名、责任者或日期查找,主要依赖目录字段及其填写质量。按文件正文中的词语查找,则需要相应的文本数据和软件检索能力。OCR 输出文本并不等于已经具备完整的检索系统。

OCR 也不能直接替代目录著录。例如,页面上可能同时出现多个日期,哪个属于需要填写的档案日期,应按著录规则判断,而非机械取出识别结果中的任意日期。

先用样本验证,再确定处理范围

可选取印刷件、手写件、表格和低清晰度原件作为样本,测试拟使用工具的输出,并检查是否满足查询需要。明确哪些内容需要人工核对、异常如何记录、识别文本如何与影像关联。

如果只需要通过目录定位并阅读原始影像,可先讨论影像与目录的建设范围;如需全文查询,再把识别、校对、数据接入和软件功能分别列入方案。

了解相关服务

档案数字化加工

数据著录与编目

档案软件研发与系统集成