本文介绍了一种通过整合后校正光学字符识别、视觉文档分类、元数据增强以及检索效果评估,将其纳入可审计工作流程的方案,以提升在历史数字档案中的发现效率。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文介绍了一种通过整合后校正光学字符识别、视觉文档分类、元数据增强以及检索效果评估,将其纳入可审计工作流程的方案,以提升在历史数字档案中的发现效率。
历史数字档案的可检索性日益增强,但当光学字符识别错误、视觉上异质的文档类型以及稀疏的元数据被分别处理时,发现效果仍然受限。本研究旨在开发一种可重复的协议,以评估保守的多模态人工智能工作流程是否能够在不取代档案管理员审查的前提下提升档案检索效果。研究构建了一个包含1,600份数字化档案记录的语料库,涵盖八种文档类别,并使用包含420个查询的基准测试,比较了五种检索条件:基础索引、仅光学字符识别校正、仅视觉分类、仅元数据增强以及完整的多模态整合。在记录层面的评估指标包括字符错误率(CER)、词错误率(WER)、命名实体召回率、文档类型分类准确率、预测置信度、元数据完整性以及主题标目匹配度;在查询层面的评估指标包括P@10、R@10、nDCG@10、首次获取相关结果的时间以及成功检索率。光学字符识别校正对手写信件、账簿和登记册的词错误率降低最为显著;视觉微调对地图、海报、报纸和登记册的分类准确率提升最为明显;而元数据增强则在所有历史时期均提高了元数据的完整性。完整的多模态整合条件取得了最高的检索性能(P@10 = 0.624,R@10 = 0.492,nDCG@10 = 0.634),并将首次获取相关结果的平均时间从156.079秒减少至58.485秒。这些结果支持一种模块化、可审计的工作流程,其中文本、图像和描述性信号在明确的阈值下结合,并保留人工审查环节。
数字档案已迅速扩展,现支持历史、文化遗产、公共管理及数字人文领域的研究。然而,访问仍存在不均衡,因为档案记录通常结合了质量下降的光学字符识别结果、视觉上多样化的页面布局、不一致的编目实践,以及历史上变化多端的人名、地名和机构名称。这些局限性不仅影响转录质量,还影响数字化馆藏的检索、筛选及后续再利用1,2,3,4,5,6,7。
现有的文档人工智能及档案检索研究已改进了多个独立组件,例如光学字符识别的后校正、文档图像分类、元数据标准化、主题建模、词嵌入、神经检索以及数据治理实践8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25。然而,许多档案系统仍对这些组件进行单独评估,导致难以判断在真实搜索条件下,整合的工作流程是否能够提升信息发现效果。本研究旨在弥补的方法学空白在于:缺乏一种可复现、可审计的协议,将文本、图像和元数据模块与单一档案工作流程中的检索结果有效关联起来。
核心目标是检验光学字符识别校正、视觉文档分类和规则约束的元数据增强在针对相同检索基准进行评估时,是否能够产生互补性的改进。
我们假设,完整的多模态条件将优于各个单一组分条件,因为档案发现依赖于可读文本、视觉上可解释的文档结构以及可搜索的描述性元数据之间的相互作用。该工作流程的设计较为保守:自动化输出可丰富检索索引,但低置信度的预测结果会被标记以供人工审核,而不会直接作为权威的档案描述使用。
访问受限。请登录或开始试用以查看此内容。
本研究采用数字化的档案记录和模拟检索查询作为分析单位。档案库可能限制对敏感或文化受限记录的访问。在处理或共享任何记录之前,请遵守档案库的访问规则、机构的数据安全程序以及去标识化要求。此数字工作流程未产生任何危险化学品、生物材料、锐器、放射性物质或其他受管控的实验室废弃物。
研究设计与语料库构建
图1展示了完整的研究工作流程,包括语料库构建、参考标注、图像预处理、光学字符识别(OCR)生成与后校正、视觉分类、元数据增强、索引构建、检索效果评估、统计分析以及可重复性打包。
语料库构建于2025年1月15日至4月30日进行,随后于2025年5月1日至10月31日开展系统设计与调试。该语料库包含从代表国家、城市、宗教、博物馆、大学和图书馆系统的八个档案库中选取的1,600份数字化档案记录。抽样框架按档案库和文档类型进行分层,以在手写信件、账簿、地图、报纸、带说明文字的照片、海报、登记簿和打字通信等文档类型中保持档案的异质性。
对于每一条候选记录,筛选日志记录了存储库或收藏标识符、目录编号、文档类别、大致历史时期、主要语言环境、可用的图像格式、图像分辨率、页数以及基本描述性字段。纳入标准需同时满足以下所有条件:具有稳定的目录标识符;至少提供一张TIFF、JPEG或PNG格式的页面图像;源图像分辨率不低于150 dpi;包含可读的文本、表格或文档结构内容;且归属于八个预定义文档类别之一。排除标准包括完全重复的记录、空白的背面页面、图像裁剪导致超过30%的文本区域缺失,以及经人工检查判定为不可读的记录。
检索基准包含在2025年8月5日至8月20日期间生成的420条简短自然语言查询。查询生成遵循可复现的模板:从个人、机构、地点、时间段、职业、事件和主题中采样候选信息需求;每条查询被规范化为2至9个词;并在系统比较前确定目标相关记录。每条查询在五种检索条件下进行评估,共产生2,100个匹配的查询-条件观测结果。
参考标记与质量控制
参考标注由三名标注人员于2025年5月1日至7月15日完成:两名具有描述性编目经验的档案工作人员,以及一名具有历史文献评估经验的数字人文研究人员。标注指南定义了文档类别、语言上下文分类、历史时期分段、元数据完整性字段、命名实体类别,以及选择OCR评估区域的规则。
在进行OCR评估时,标注人员选取了包含标题、姓名、日期、机构术语、页边注释、表格条目以及存在时的噪声版面区域在内的具有代表性的文本区域。当页面包含多个文本区域时,所选区域必须与检索相关,并包含足够数量的字符以计算字符错误率(CER)和词错误率(WER)。两名主要标注人员首先通过讨论解决分歧;未能解决的情况由数字人文研究人员进行裁决。
质量控制采用随机选取的12%记录子集。主要文档类型的标注者间一致性为Cohen's kappa = 0.86,表明一致性良好。裁决日志保留了原始标签和最终标签、分歧类别及解决原因,以便后续用户审查分类定义和边界情况。
图像预处理
所有图像均使用 Python 3.11.8 及 OpenCV 4.9.0、Pillow 10.3.0 和 NumPy 1.26.4 在记录级别进行处理。每个输入页面均被转换为 8 位灰度图像,除非颜色携带语义信息(如地图、海报、邮票或颜色编码的注释)。倾斜角度通过投影轮廓和霍夫直线检测进行估计;仅当绝对倾斜角度超过 1.5 度时进行去倾斜校正,且最大校正角度限制为 8.0 度,以避免图像失真。
对比度增强采用限制对比度自适应直方图均衡化方法,其中 clipLimit = 2.0,tileGridSize = 8 × 8。仅当估计的背景噪声比超过 0.35 时,应用核大小为 3 × 10−23 的中值滤波器。分辨率为 150–299 dpi 的图像被重采样至 300 dpi 以进行光学字符识别;原本已达 300 dpi 或更高的图像则未进行上采样。未使用超分辨率、生成式恢复或内容幻觉技术。
渗墨、边缘变暗、纸张纹理不均、页边邮票、手写笔迹、横线以及表格边界等特征均予以保留,除非其妨碍了OCR区域的选择。该规则在充分标准化图像输入以实现可重复的OCR和分类的同时,保留了档案证据。
OCR 基础生成与后校正
基线光学字符识别(OCR)使用 Tesseract OCR 5.3.0 生成。主要语言包根据目录语言和可见脚本进行选择;当目录语言与页面脚本不匹配时,启用多语言解码。OCR 输出按记录级别进行分组,并与页面标识符、OCR 置信度、可用时的边界框坐标以及校正前的原始文本一并存储。
OCR后处理采用三阶段保守校正流程。首先,字符级归一化用于纠正常见历史识别混淆问题,包括连字、长s/短s替换、标点符号碎片化以及数字与字母的混淆。其次,词元级校正利用编辑距离和基于档案特定词典中的频率排序候选词进行修正,该词典包含人名、地名、机构名、行政术语及历史拼写变体。最后,基于规则的序列校验通过上下文和元数据中的证据,对命名实体和日期进行有效性验证。
仅当后验校正置信度超过0.80时,才接受候选替换;对于命名实体替换,则要求置信度至少达到0.85。低于该阈值的候选项将保留为OCR文本,但会被标记以供审查。字符错误率(CER)通过将莱文斯坦编辑距离除以参考转录文本的字符数来计算。词元错误率(WER)采用相同的公式,但在词元级别进行计算。命名实体召回率通过将正确识别的参考实体数除以所选评估区域内所有参考实体数来计算。
视觉文档分类
视觉分类模块将每条记录分配至八个档案文件类别之一:手写信件、账簿、地图、报纸、带说明文字的照片、海报、登记簿和打印通信。预测的文件类型被用作检索和筛选的信号,而非档案编目的权威替代。
该模型使用 PyTorch 2.2.2 和 torchvision 0.17.2 实现,并采用在 ImageNet 上预训练的 EfficientNet-B3 作为骨干网络。记录级缩略图被调整为 384 × 384 像素。为减少数据泄露,记录按存储库和文档类别划分为训练集、验证集和测试集,比例为 70:15:15,分别对应约 1,120、240 和 240 条记录。
训练采用 AdamW 优化器,初始学习率为 1 × 10-4,权重衰减为 1 × 10−2,批量大小为 16,标签平滑系数为 0.05,并在验证损失连续五个 epoch 未改善时启用早停机制。由于镜像翻转后的归档版面不符合实际,因此禁用水平翻转。数据增强仅限于 -3 度至 +3 度的旋转以及 ±10% 范围内的亮度变化。
以纪元(epoch)为单位的模型诊断结果汇总在20个训练行中,每一行包含训练损失、验证损失、训练准确率、验证准确率、宏平均F1分数、加权F1分数、ROC曲线下面积(ROC-AUC)以及PR曲线下面积(PR-AUC)。
元数据增强工作流程
元数据增强旨在提高可发现性,同时保持档案保守性。除非现有编目信息包含明确矛盾(例如不可能的日期,或通过光学字符识别和视觉证据均确认的文档类型冲突),否则予以保留。候选的增强字段包括规范化标题、文档类型、大致日期、提及的机构、提及的地理信息、提及的个人姓名、主题标目以及关键词。
证据优先级遵循固定顺序:(1)现有目录元数据,(2)校正后的光学字符识别(OCR)输出结果,(3)基于视觉的文档类型预测。主题标目采用受控词汇匹配方法,仅在余弦相似度不低于0.72时,使用基于sentence-transformers 2.7.0模型的最近邻语义扩展。日期标准化要求置信度至少达到0.85,或OCR结果与元数据之间达成一致。所有自动添加的字段均保留其来源、置信度及规则标识符。
元数据完整性定义为已填写的核心描述字段数量除以该记录适用的核心字段数量。主题标目匹配定义为至少存在一个受记录级内容证据支持且被判定与查询类别相关的受控词汇主题标签。
检索系统构建
构建了五个检索索引以分离模块贡献:基线索引;仅光学字符识别校正;仅视觉分类;仅元数据增强;以及完全多模态融合。所有索引均在材料表(版本 8.11.1)所列的搜索引擎软件中于记录级别构建。在评估之前,BM25 参数固定为 k1 = 1.2 和 b = 0.75。
基线索引使用原始元数据和基线OCR文本。OCR条件将基线OCR替换为校正后的OCR。视觉条件添加了文档类型先验信息和类别感知的排序增强。元数据条件增加了丰富的描述性字段。完整的多模态条件结合了校正后的OCR、视觉先验信息和增强的元数据。字段权重在测试前已固定:标准化标题 = 3.0,主题标目 = 2.5,人物和机构提及 = 2.2,地点提及 = 2.0,文档类型 = 1.8,校正后的OCR正文文本 = 1.0,基线OCR正文文本 = 0.8(如适用)。
精确短语匹配对带引号的查询已启用。查询扩展仅在元数据增强和全多模态条件下允许,且仅限于被接受的受控词汇同义词和主题标目变体。搜索日志生成于2025年8月25日至2025年8月28日,运行环境为下述容器化的Linux环境。 材料列表,采用固定种子和冻结索引构型。
查询设计与结局指标
这420个查询代表了常见的档案检索行为,而非仅基于关键词的基准提示。查询主题包括人名、机构、地点、日期和日期范围、职业、事件以及主题性内容。每个查询均以其标准化表述形式存储,并附有目标记录集、查询主题类别及难度评分。
在检索前,根据目标的模糊性、词汇特异性以及表达的预期频率对难度进行评分。综合得分低于0.40的被归类为低难度,0.40–0.69之间的为中等难度,0.70及以上的为高难度。相关性判断在系统比较之前完成,随后对照最终确定的集合进行核对。
检索结果包括前10项精确率(P@10)、前10项召回率(R@10)、前10项归一化折损累计增益(nDCG@10)、首次出现相关结果的时间以及成功检索率。P@10是指在排名前10位的记录中被判定为相关的比例。R@10是指所有已知相关记录中被检索至前10位的比例。nDCG@10在有分级相关性标注时采用分级相关性,否则采用二值相关性。首次出现相关结果的时间是指从提交查询到在排序结果中首次出现相关记录所经历的时间。若在前10位记录中至少出现一条相关结果,则定义为一次成功检索。
统计数据收集
所有分析均使用材料表中列出的软件版本进行。连续性结果若近似对称,则以均值 ± 标准差表示,否则以中位数及四分位间距表示。分类变量结果以计数和百分比进行汇总。
采用Shapiro-Wilk检验和分布图评估配对差异的正态性。当配对差异近似服从正态分布时,使用配对t检验比较OCR及元数据处理前后的结果,否则使用Wilcoxon符号秩检验。通过McNemar检验对配对的正确/错误标签进行分析,以比较微调前后的分类性能。对于匹配的多臂检索结果,采用Friedman检验进行比较,随后进行Holm校正的两两Wilcoxon符号秩检验。
所有统计检验均为双侧检验,当P < 0.05 时认为差异具有统计学意义。置信区间通过2,000次自助重采样法进行估计,随机种子固定为2025。根据结果类型,效应量以均数差、配对优势比或基于秩的效应量表示。
可重复性、适用范围与资源可用性
在检索测试之前,所有管道参数均已固定,未在保留的检索基准上对任何参数进行优化。配置文件、受控词汇表、词典表、查询模板、字段映射、注释指南、统计脚本以及图表生成脚本均保存在材料表所列的版本控制系统中,随机种子为 2025。
为支持独立验证,源数据工作簿包含一个去标识化的包含1600条记录的表格,共涉及17个变量,用于光学字符识别、元数据以及视觉分类分析。衍生出的表1、表2、表3、表4和表5、图表源数据摘要、基准查询定义、相关性判断摘要、检索日志代理数据、训练诊断结果、词典分类、词汇映射规则以及注释指南字段,均以独立可上传的表格或材料文件形式提供(如适用)。由于存储库限制而无法公开共享的材料,则以去标识化的元数据字段和可重复抽样字段的形式表示。
本方案旨在评估面向检索的发现能力,而非历史主张的真实性。该方案不能替代档案管理员的鉴定、来源评估、隐私审查或特定知识库的访问规则。
访问受限。请登录或开始试用以查看此内容。
OCR 校正提高了转录准确性,尤其是在手写和表格记录中
光学字符识别校正使所有八个类别的档案文档转录质量均得到提升(n = 1,600 条记录)。词错误率(WER)平均值从 0.529 ± 0.172 降至 0.384 ± 0.123,平均配对变化为 −0.144(95% CI,−0.149 至 −0.139;Wilcoxon 符号秩检验 P < 0.001)。字符错误率(CER)平均值从 0.377 ± 0.126 降至 0.258 ± 0.086,平均配对变化为 −0.119(95% CI,−0.123 至 −0.116;Wilcoxon 符号秩检验 P < 0.001)。表2 显示,手写信件、账簿和登记簿的基线词错误率最高,表明视觉复杂度最高的记录在初始识别时负担也最重。
校正后,所有文档类别的词错误率(WER)均有所下降。词错误率平均配对减少值最大的三类分别为手写信件(n = 262;−0.200;95%...
访问受限。请登录或开始试用以查看此内容。
本方案表明,在将光学字符识别(OCR)校正、文档视觉理解以及保守的元数据增强作为相互关联的检索组件而非孤立的技术改进进行评估时,历史数字档案中的发现效果提升最为显著。OCR性能提升最大的材料类型为手写文本、表格以及登记类文档,这表明在基础识别效果最弱的文档类别中,进行校正后处理具有重要价值。同时,校正后仍存在的残余错误表明,OCR清理不能被视为最终的定稿转录,而必须保持可审计性。
视觉分类结果也需要谨慎解读。微调改善了地图、海报、报纸和登记簿等视觉特征明显的类别,但对于手写信件和账簿等布局重叠、类别边界在视觉上较难区分的类别,提升效果较小。由于语料库规模相对较小,分类性能应被视为方法可行性的证据,而非证明仅凭1,600条记录即可训练出可用于实际应用的多模态模型。未来的验证工作应将EfficientNet-B3与文档Transformer、视觉Transformer、Swin Transformer、ConvNeXt以及多模态文档基础模型8,11,
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
作者衷心感谢两位经验丰富的档案工作人员和一位专业数字人文研究者在文本标注和质量控制方面提供的宝贵帮助。本研究得到了江苏省档案科技项目计划(项目编号:2024-9)资助,用于构建基于智能语音的口述档案系统;同时获得江苏省中医药科技发展计划(项目编号:MS2025025)资助,开展从档案视角研究中医药学派传承与发展的课题。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Python | Python 软件基金会 | v3.11.8; https://www.python.org/ | 工作流脚本编写、数据处理、光学字符识别后校正及统计支持 |
| R | 统计计算 R 基金会 | v4.3.3; https://www.r-project.org/ | 统计分析与最终图表生成 |
| Tesseract OCR | Tesseract OCR 项目 | v5.3.0; https://github.com/tesseract-ocr/tesseract | 基础光学字符识别生成 |
| Tesseract 语言包 | Tesseract OCR 项目 | 研究专用语言包;https://github.com/tesseract-ocr/tessdata | 主要及混合语言的光学字符识别解码 |
| OpenCV | OpenCV 团队 | v4.9.0; https://opencv.org/ | 去倾斜、噪声估计与图像预处理 |
| Pillow | Python 图像库贡献者 | v10.3.0; https://python-pillow.org/ | 图像输入/输出与格式标准化 |
| NumPy | NumPy 开发人员 | v1.26.4; https://numpy.org/ | 用于图像与度量处理的数组计算 |
| pandas | pandas 开发团队 | v2.2.2; https://pandas.pydata.org/ | 表格数据处理与汇总导出 |
| SciPy | SciPy 开发人员 | v1.13.1; https://scipy.org/ | 统计检验与数值工具 |
| statsmodels | statsmodels 开发人员 | v0.14.2; https://www.statsmodels.org/ | 统计建模与配对比较支持 |
| scikit-learn | scikit-learn 开发人员 | v1.4.2; https://scikit-learn.org/ | 分类度量、ROC/PR 诊断与验证工具 |
| rapidfuzz | Max Bachmann 及贡献者 | v3.9.0; https://github.com/rapidfuzz/RapidFuzz | 用于光学字符识别校正的编辑距离候选排序 |
| spaCy | Explosion AI | v3.7.4; https://spacy.io/ | 基于自定义词典表的命名实体处理 |
| PyTorch | PyTorch 基金会 | v2.2.2; https://pytorch.org/ | 视觉文档分类器训练 |
| torchvision | PyTorch 基金会 | v0.17.2; https://pytorch.org/vision/ | EfficientNet-B3 实现与图像变换 |
| EfficientNet-B3 主干网络 | torchvision / ImageNet 预训练权重 | EfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.html | 视觉文档分类主干网络 |
| sentence-transformers | UKP 实验室 / Hugging Face 生态系统 | v2.7.0; https://www.sbert.net/ | 受控词汇候选的语义扩展 |
| 搜索引擎软件 | Elastic | Elasticsearch v8.11.1; https://www.elastic.co/elasticsearch | BM25 索引、检索与排序 |
| 容器引擎 | Docker 公司 | Docker v26.1.1; https://www.docker.com/ | 容器化检索环境 |
| Linux 操作系统 | Canonical | Ubuntu 22.04 LTS; https://ubuntu.com/ | 检索运行的固定操作系统环境 |
| 版本控制系统 | Git 项目 | Git v2.44.0; https://git-scm.com/ | 配置、词汇表、脚本与图表代码的版本控制 |
| ggplot2 | tidyverse | v3.5.1; https://ggplot2.tidyverse.org/ | 基于 R 的图表渲染 |
| Matplotlib | Matplotlib 开发人员 | v3.8.4; https://matplotlib.org/ | 补充可视化与质量保证图表 |
| 标注指南 | 作者 | 5 个标注部分;8 种文档类别标签;OCR 区域;实体标签;相关性判断;裁决规则 | 文档类别、OCR 区域、实体、相关性判断与裁决的定义 |
| 档案专用 OCR 词典 | 作者 | 6 类词典类别:人名变体、地名、机构名称、日期模式、行政术语、缩写 | 人名、地名、机构、行政术语及拼写变体 |
| 受控词汇映射 | 作者 / 档案馆 | 5 条映射规则,将 OCR 实体、视觉类别、标题关键词、日期覆盖范围和查询主题链接至元数据字段 | 主题标目匹配与语义扩展 |
| 基准查询集 | 作者 | 420 个基准查询;6 个查询主题;3 个难度等级;8 种目标文档类别;4 个历史时期;6 种语言环境 | 跨五个系统分支的匹配检索基准 |
| 相关性判断 | 作者 / 标注人员 | 2,100 个查询-系统行;420 个查询 × 5 个系统分支;相关总数、前 10 名相关数量、分级相关性及成功标志 | 作为 P@10、R@10、nDCG@10 和成功搜索率的真值代理 |
| 训练诊断 | 作者 | 20 个训练周期;训练损失;验证损失;训练准确率;验证准确率;宏平均 F1;加权 F1;ROC-AUC;PR-AUC | 按训练周期的模型诊断摘要 |
| 计算硬件 | 作者 | 8 核 CPU;32 GB 内存;NVIDIA GPU 级训练环境 | JoVE 投稿所需的可重复性资源细节 |
| 数据集文件 | 作者 | data.xlsx;1,600 条记录;17 个变量;DOI 列于论文的数据可用性声明中 | 用于光学字符识别、元数据完整性、可发现性及视觉分类分析的逐条记录源数据 |
访问受限。请登录或开始试用以查看此内容。