本文介绍了一种通过整合后校正光学字符识别、视觉文档分类、元数据增强以及检索效果评估,将其纳入可审计工作流程的方案,以提升在历史数字档案中的发现效率。
研究文章
本文介绍了一种通过整合后校正光学字符识别、视觉文档分类、元数据增强以及检索效果评估,将其纳入可审计工作流程的方案,以提升在历史数字档案中的发现效率。
历史数字档案的可检索性日益增强,但当光学字符识别错误、视觉上异质的文档类型以及稀疏的元数据被分别处理时,发现效果仍然受限。本研究旨在开发一种可重复的协议,以评估保守的多模态人工智能工作流程是否能够在不取代档案管理员审查的前提下提升档案检索效果。研究构建了一个包含1,600份数字化档案记录的语料库,涵盖八种文档类别,并使用包含420个查询的基准测试,比较了五种检索条件:基础索引、仅光学字符识别校正、仅视觉分类、仅元数据增强以及完整的多模态整合。在记录层面的评估指标包括字符错误率(CER)、词错误率(WER)、命名实体召回率、文档类型分类准确率、预测置信度、元数据完整性以及主题标目匹配度;在查询层面的评估指标包括P@10、R@10、nDCG@10、首次获取相关结果的时间以及成功检索率。光学字符识别校正对手写信件、账簿和登记册的词错误率降低最为显著;视觉微调对地图、海报、报纸和登记册的分类准确率提升最为明显;而元数据增强则在所有历史时期均提高了元数据的完整性。完整的多模态整合条件取得了最高的检索性能(P@10 = 0.624,R@10 = 0.492,nDCG@10 = 0.634),并将首次获取相关结果的平均时间从156.079秒减少至58.485秒。这些结果支持一种模块化、可审计的工作流程,其中文本、图像和描述性信号在明确的阈值下结合,并保留人工审查环节。
数字档案已迅速扩展,现支持历史、文化遗产、公共管理及数字人文领域的研究。然而,访问仍存在不均衡,因为档案记录通常结合了质量下降的光学字符识别结果、视觉上多样化的页面布局、不一致的编目实践,以及历史上变化多端的人名、地名和机构名称。这些局限性不仅影响转录质量,还影响数字化馆藏的检索、筛选及后续再利用1,2,3,4,5,6,7。
现有的文档人工智能及档案检索研究已改进了多个独立组件,例如光学字符识别的后校正、文档图像分类、元数据标准化、主题建模、词嵌入、神经检索以及数据治理实践8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25。然而,许多档案系统仍对这些组件进行单独评估,导致难以判断在真实搜索条件下,整合的工作流程是否能够提升信息发现效果。本研究旨在弥补的方法学空白在于:缺乏一种可复现、可审计的协议,将文本、图像和元数据模块与单一档案工作流程中的检索结果有效关联起来。
核心目标是检验光学字符识别校正、视觉文档分类和规则约束的元数据增强在针对相同检索基准进行评估时,是否能够产生互补性的改进。
我们假设,完整的多模态条件将优于各个单一组分条件,因为档案发现依赖于可读文本、视觉上可解释的文档结构以及可搜索的描述性元数据之间的相互作用。该工作流程的设计较为保守:自动化输出可丰富检索索引,但低置信度的预测结果会被标记以供人工审核,而不会直接作为权威的档案描述使用。
本研究采用数字化的档案记录和模拟检索查询作为分析单位。档案库可能限制对敏感或文化受限记录的访问。在处理或共享任何记录之前,请遵守档案库的访问规则、机构的数据安全程序以及去标识化要求。此数字工作流程未产生任何危险化学品、生物材料、锐器、放射性物质或其他受管控的实验室废弃物。
研究设计与语料库构建
图1展示了完整的研究工作流程,包括语料库构建、参考标注、图像预处理、光学字符识别(OCR)生成与后校正、视觉分类、元数据增强、索引构建、检索效果评估、统计分析以及可重复性打包。
语料库构建于2025年1月15日至4月30日进行,随后于2025年5月1日至10月31日开展系统设计与调试。该语料库包含从代表国家、城市、宗教、博物馆、大学和图书馆系统的八个档案库中选取的1,600份数字化档案记录。抽样框架按档案库和文档类型进行分层,以在手写信件、账簿、地图、报纸、带说明文字的照片、海报、登记簿和打字通信等文档类型中保持档案的异质性。
对于每一条候选记录,筛选日志记录了存储库或收藏标识符、目录编号、文档类别、大致历史时期、主要语言环境、可用的图像格式、图像分辨率、页数以及基本描述性字段。纳入标准需同时满足以下所有条件:具有稳定的目录标识符;至少提供一张TIFF、JPEG或PNG格式的页面图像;源图像分辨率不低于150 dpi;包含可读的文本、表格或文档结构内容;且归属于八个预定义文档类别之一。排除标准包括完全重复的记录、空白的背面页面、图像裁剪导致超过30%的文本区域缺失,以及经人工检查判定为不可读的记录。
检索基准包含在2025年8月5日至8月20日期间生成的420条简短自然语言查询。查询生成遵循可复现的模板:从个人、机构、地点、时间段、职业、事件和主题中采样候选信息需求;每条查询被规范化为2至9个词;并在系统比较前确定目标相关记录。每条查询在五种检索条件下进行评估,共产生2,100个匹配的查询-条件观测结果。
参考标记与质量控制
参考标注由三名标注人员于2025年5月1日至7月15日完成:两名具有描述性编目经验的档案工作人员,以及一名具有历史文献评估经验的数字人文研究人员。标注指南定义了文档类别、语言上下文分类、历史时期分段、元数据完整性字段、命名实体类别,以及选择OCR评估区域的规则。
在进行OCR评估时,标注人员选取了包含标题、姓名、日期、机构术语、页边注释、表格条目以及存在时的噪声版面区域在内的具有代表性的文本区域。当页面包含多个文本区域时,所选区域必须与检索相关,并包含足够数量的字符以计算字符错误率(CER)和词错误率(WER)。两名主要标注人员首先通过讨论解决分歧;未能解决的情况由数字人文研究人员进行裁决。
质量控制采用随机选取的12%记录子集。主要文档类型的标注者间一致性为Cohen's kappa = 0.86,表明一致性良好。裁决日志保留了原始标签和最终标签、分歧类别及解决原因,以便后续用户审查分类定义和边界情况。
图像预处理
所有图像均使用 Python 3.11.8 及 OpenCV 4.9.0、Pillow 10.3.0 和 NumPy 1.26.4 在记录级别进行处理。每个输入页面均被转换为 8 位灰度图像,除非颜色携带语义信息(如地图、海报、邮票或颜色编码的注释)。倾斜角度通过投影轮廓和霍夫直线检测进行估计;仅当绝对倾斜角度超过 1.5 度时进行去倾斜校正,且最大校正角度限制为 8.0 度,以避免图像失真。
对比度增强采用限制对比度自适应直方图均衡化方法,其中 clipLimit = 2.0,tileGridSize = 8 × 8。仅当估计的背景噪声比超过 0.35 时,应用核大小为 3 × 10−23 的中值滤波器。分辨率为 150–299 dpi 的图像被重采样至 300 dpi 以进行光学字符识别;原本已达 300 dpi 或更高的图像则未进行上采样。未使用超分辨率、生成式恢复或内容幻觉技术。
渗墨、边缘变暗、纸张纹理不均、页边邮票、手写笔迹、横线以及表格边界等特征均予以保留,除非其妨碍了OCR区域的选择。该规则在充分标准化图像输入以实现可重复的OCR和分类的同时,保留了档案证据。
OCR 基础生成与后校正
基线光学字符识别(OCR)使用 Tesseract OCR 5.3.0 生成。主要语言包根据目录语言和可见脚本进行选择;当目录语言与页面脚本不匹配时,启用多语言解码。OCR 输出按记录级别进行分组,并与页面标识符、OCR 置信度、可用时的边界框坐标以及校正前的原始文本一并存储。
OCR后处理采用三阶段保守校正流程。首先,字符级归一化用于纠正常见历史识别混淆问题,包括连字、长s/短s替换、标点符号碎片化以及数字与字母的混淆。其次,词元级校正利用编辑距离和基于档案特定词典中的频率排序候选词进行修正,该词典包含人名、地名、机构名、行政术语及历史拼写变体。最后,基于规则的序列校验通过上下文和元数据中的证据,对命名实体和日期进行有效性验证。
仅当后验校正置信度超过0.80时,才接受候选替换;对于命名实体替换,则要求置信度至少达到0.85。低于该阈值的候选项将保留为OCR文本,但会被标记以供审查。字符错误率(CER)通过将莱文斯坦编辑距离除以参考转录文本的字符数来计算。词元错误率(WER)采用相同的公式,但在词元级别进行计算。命名实体召回率通过将正确识别的参考实体数除以所选评估区域内所有参考实体数来计算。
视觉文档分类
视觉分类模块将每条记录分配至八个档案文件类别之一:手写信件、账簿、地图、报纸、带说明文字的照片、海报、登记簿和打印通信。预测的文件类型被用作检索和筛选的信号,而非档案编目的权威替代。
该模型使用 PyTorch 2.2.2 和 torchvision 0.17.2 实现,并采用在 ImageNet 上预训练的 EfficientNet-B3 作为骨干网络。记录级缩略图被调整为 384 × 384 像素。为减少数据泄露,记录按存储库和文档类别划分为训练集、验证集和测试集,比例为 70:15:15,分别对应约 1,120、240 和 240 条记录。
训练采用 AdamW 优化器,初始学习率为 1 × 10-4,权重衰减为 1 × 10−2,批量大小为 16,标签平滑系数为 0.05,并在验证损失连续五个 epoch 未改善时启用早停机制。由于镜像翻转后的归档版面不符合实际,因此禁用水平翻转。数据增强仅限于 -3 度至 +3 度的旋转以及 ±10% 范围内的亮度变化。
以纪元(epoch)为单位的模型诊断结果汇总在20个训练行中,每一行包含训练损失、验证损失、训练准确率、验证准确率、宏平均F1分数、加权F1分数、ROC曲线下面积(ROC-AUC)以及PR曲线下面积(PR-AUC)。
元数据增强工作流程
元数据增强旨在提高可发现性,同时保持档案保守性。除非现有编目信息包含明确矛盾(例如不可能的日期,或通过光学字符识别和视觉证据均确认的文档类型冲突),否则予以保留。候选的增强字段包括规范化标题、文档类型、大致日期、提及的机构、提及的地理信息、提及的个人姓名、主题标目以及关键词。
证据优先级遵循固定顺序:(1)现有目录元数据,(2)校正后的光学字符识别(OCR)输出结果,(3)基于视觉的文档类型预测。主题标目采用受控词汇匹配方法,仅在余弦相似度不低于0.72时,使用基于sentence-transformers 2.7.0模型的最近邻语义扩展。日期标准化要求置信度至少达到0.85,或OCR结果与元数据之间达成一致。所有自动添加的字段均保留其来源、置信度及规则标识符。
元数据完整性定义为已填写的核心描述字段数量除以该记录适用的核心字段数量。主题标目匹配定义为至少存在一个受记录级内容证据支持且被判定与查询类别相关的受控词汇主题标签。
检索系统构建
构建了五个检索索引以分离模块贡献:基线索引;仅光学字符识别校正;仅视觉分类;仅元数据增强;以及完全多模态融合。所有索引均在材料表(版本 8.11.1)所列的搜索引擎软件中于记录级别构建。在评估之前,BM25 参数固定为 k1 = 1.2 和 b = 0.75。
基线索引使用原始元数据和基线OCR文本。OCR条件将基线OCR替换为校正后的OCR。视觉条件添加了文档类型先验信息和类别感知的排序增强。元数据条件增加了丰富的描述性字段。完整的多模态条件结合了校正后的OCR、视觉先验信息和增强的元数据。字段权重在测试前已固定:标准化标题 = 3.0,主题标目 = 2.5,人物和机构提及 = 2.2,地点提及 = 2.0,文档类型 = 1.8,校正后的OCR正文文本 = 1.0,基线OCR正文文本 = 0.8(如适用)。
精确短语匹配对带引号的查询已启用。查询扩展仅在元数据增强和全多模态条件下允许,且仅限于被接受的受控词汇同义词和主题标目变体。搜索日志生成于2025年8月25日至2025年8月28日,运行环境为下述容器化的Linux环境。 材料列表,采用固定种子和冻结索引构型。
查询设计与结局指标
这420个查询代表了常见的档案检索行为,而非仅基于关键词的基准提示。查询主题包括人名、机构、地点、日期和日期范围、职业、事件以及主题性内容。每个查询均以其标准化表述形式存储,并附有目标记录集、查询主题类别及难度评分。
在检索前,根据目标的模糊性、词汇特异性以及表达的预期频率对难度进行评分。综合得分低于0.40的被归类为低难度,0.40–0.69之间的为中等难度,0.70及以上的为高难度。相关性判断在系统比较之前完成,随后对照最终确定的集合进行核对。
检索结果包括前10项精确率(P@10)、前10项召回率(R@10)、前10项归一化折损累计增益(nDCG@10)、首次出现相关结果的时间以及成功检索率。P@10是指在排名前10位的记录中被判定为相关的比例。R@10是指所有已知相关记录中被检索至前10位的比例。nDCG@10在有分级相关性标注时采用分级相关性,否则采用二值相关性。首次出现相关结果的时间是指从提交查询到在排序结果中首次出现相关记录所经历的时间。若在前10位记录中至少出现一条相关结果,则定义为一次成功检索。
统计数据收集
所有分析均使用材料表中列出的软件版本进行。连续性结果若近似对称,则以均值 ± 标准差表示,否则以中位数及四分位间距表示。分类变量结果以计数和百分比进行汇总。
采用Shapiro-Wilk检验和分布图评估配对差异的正态性。当配对差异近似服从正态分布时,使用配对t检验比较OCR及元数据处理前后的结果,否则使用Wilcoxon符号秩检验。通过McNemar检验对配对的正确/错误标签进行分析,以比较微调前后的分类性能。对于匹配的多臂检索结果,采用Friedman检验进行比较,随后进行Holm校正的两两Wilcoxon符号秩检验。
所有统计检验均为双侧检验,当P < 0.05 时认为差异具有统计学意义。置信区间通过2,000次自助重采样法进行估计,随机种子固定为2025。根据结果类型,效应量以均数差、配对优势比或基于秩的效应量表示。
可重复性、适用范围与资源可用性
在检索测试之前,所有管道参数均已固定,未在保留的检索基准上对任何参数进行优化。配置文件、受控词汇表、词典表、查询模板、字段映射、注释指南、统计脚本以及图表生成脚本均保存在材料表所列的版本控制系统中,随机种子为 2025。
为支持独立验证,源数据工作簿包含一个去标识化的包含1600条记录的表格,共涉及17个变量,用于光学字符识别、元数据以及视觉分类分析。衍生出的表1、表2、表3、表4和表5、图表源数据摘要、基准查询定义、相关性判断摘要、检索日志代理数据、训练诊断结果、词典分类、词汇映射规则以及注释指南字段,均以独立可上传的表格或材料文件形式提供(如适用)。由于存储库限制而无法公开共享的材料,则以去标识化的元数据字段和可重复抽样字段的形式表示。
本方案旨在评估面向检索的发现能力,而非历史主张的真实性。该方案不能替代档案管理员的鉴定、来源评估、隐私审查或特定知识库的访问规则。
OCR 校正改进了转录效果,尤其是在手写和表格记录中
光学字符识别校正使所有八个档案文档类别(n = 1,600 条记录)的转录质量均得到提升。平均词错误率(WER)从 0.529 ± 0.172 降至 0.384 ± 0.123,平均配对变化量为 −0.144(95% CI,−0.149 至 −0.139;Wilcoxon 符号秩检验 P < 0.001)。平均字符错误率(CER)从 0.377 ± 0.126 降至 0.258 ± 0.086,平均配对变化量为 −0.119(95% CI,−0.123 至 −0.116;Wilcoxon 符号秩检验 P < 0.001)。表2 显示,手写信件、账簿和登记簿的基线 WER 最高,表明视觉复杂性最高的记录在初始识别时负担也最重。
校正后,所有文档类别的词错误率(WER)均有所下降。手写信件(n = 262;−0.200;95% CI,−0.213 至 −0.188)、分类账簿(n = 263;−0.195;95% CI,−0.206 至 −0.183)和登记册(n = 194;−0.173;95% CI,−0.187 至 −0.160)的平均配对 WER 降幅最大。字符错误率(CER)也呈现相同趋势,表明校正后模块主要对难以识别的手写、表格及混合布局的记录带来了改善。
各类文档的命名实体召回率均有提升,如汇总表所示。手写信件(0.302–0.440)、账簿(0.336–0.471)和登记簿(0.369–0.504)的增幅最大。打印体通信文档的命名实体召回率在纠错后达到最高值(0.646),但其绝对增益较小,因为该类文档的基线识别性能原本就较强。图2 总结了记录级别的基线CER-WER关系、笔迹强度与纠错收益之间的关联,以及纠错后记录级别可发现性的变化。
视觉文档分类的整体性能有所提升,但各类别的性能提升程度不均衡
在包含1,600条记录的测试集上,视觉文档分类的整体性能有所提升。Top-1准确率从0.717提高到0.796(绝对变化为0.079;McNemar卡方=27.33;P < 0.001),平均预测置信度从0.736 ± 0.131提升至0.800 ± 0.108(平均配对变化为0.064;95% CI,0.057–0.071;配对t检验 P < 0.001)。如表3所示,在针对特定档案进行微调后,八个类别中有七个类别性能得到提升,其中地图、海报、报纸和登记簿的提升最为显著。
微调后,手写体对应关系的性能未得到显著提升(0.796–0.791),表明其基线视觉特征已较为稳定,且训练过程对该类别的类别区分能力提升有限。
图3 总结了在特定档案数据集上进行微调前后,视觉文档分类的性能;源数据工作簿列出了训练/验证损失和准确率的20个训练周期结果,以及宏F1分数、加权F1分数、ROC-AUC和PR-AUC的诊断汇总。
元数据增强使所有历史时期的数据描述完整性得到提升(n = 1,600 条记录)。平均完整性从 0.657 ± 0.125 提高到 0.907 ± 0.070,配对均值变化为 0.250(95% CI,0.243–0.257;Wilcoxon 符号秩检验 P < 0.001)。如表4所示,在元数据增强前,1850–1879 年期间的基础完整性最低,随后各时期逐步提高。图4总结了元数据完整性的提升情况、按文献类型新增实现的元数据字段,以及各历史时期主题标目匹配率的提升情况。
富集后,每个历史时期的数据完整性均有所提高:1850–1879年(n = 281;平均变化值,0.207;95%置信区间,0.191–0.223)、1880–1909年(n = 474;平均变化值,0.236;95%置信区间,0.223–0.248)、1910–1939年(n = 549;平均变化值,0.277;95%置信区间,0.265–0.288)以及1940–1969年(n = 296;平均变化值,0.263;95%置信区间,0.247–0.279)。各时期已填写字段的平均数量也呈现持续增长趋势。
主题匹配度也得到同步提升。基线匹配率范围为64.3%至69.4%,而富集后的匹配率范围为82.1%至85.4%。最大绝对增幅出现在最早期阶段(Delta = 0.178),表明对于初始描述稀疏的记录,保守性富集具有重要价值。
所有增强系统的检索性能均有所提升,其中在完全多模态融合条件下的提升最为显著
在每种增强条件下,检索效果相较于基线均有提升,但不同系统分支的提升幅度存在差异(n = 420 个匹配的基准查询)。总体检索结果列于表5中。基线性能较低:P@10 = 0.394,R@10 = 0.238,nDCG@10 = 0.392,首次获得相关结果的平均时间为 156.079 秒,成功检索率 = 5.0%(21/420;95% CI,3.3%–7.5%)。图5汇总了五个实验系统分支的检索性能,包括总体检索指标、主题层级的成功率以及查询难度分层结果。
所有三种单组分系统在总体上均优于基线。光学字符识别校正使前10个结果的准确率(P@10)提高到0.484,召回率(R@10)提高到0.346,归一化折损累计增益(nDCG@10)提高到0.475,同时将首次获得相关结果的时间缩短至124.261秒,并将成功检索率提高至30.2%(127/420;95%置信区间,26.0%–34.8%)。视觉分类方法产生的P@10 = 0.490,R@10 = 0.302,nDCG@10 = 0.478,首次获得相关结果的平均时间为131.985秒,成功检索率为22.9%(96/420;95%置信区间,19.1%–27.1%)。元数据增强实现了最强的单组分检索性能,其P@10 = 0.507,R@10 = 0.347,nDCG@10 = 0.513,首次获得相关结果的平均时间为117.474秒,成功检索率达到38.3%(161/420;95%置信区间,33.8%–43.1%)。
完整的多模态系统在所有检索终点上均表现最佳。P@10 从基线的 0.394 提高到 0.624,R@10 从 0.238 提高到 0.492,nDCG@10 从 0.392 提高到 0.634。首次获得相关结果的平均时间从 156.079 秒减少到 58.485 秒,成功搜索率从 5.0% 提高到 95.5%(401/420;95% CI,93.0%–97.1%)。这些数值分别对应 P@10 提高 0.230、R@10 提高 0.254 和 nDCG@10 提高 0.242 的绝对增益。
在完全多模态整合条件下,特定主题的检索效果也得到提升。在人物、机构、地点、职业、事件及主题类别上的成功检索率均有所提高,其中职业类别的实际提升最为显著,其基线成功率为0.0%,在完全多模态条件下提升至90.0%。地名查询的基线表现最强,但仍从多模态整合中获益。
多模态增益在不同文献、时期和语言层次上有所差异
亚组分析显示,多模态增益广泛分布于不同文献类型、历史时期和语言背景中,尽管增益幅度有所差异。这种异质性表明,应针对每个目标文献集进行工作流程的评估,而不应假定其产生一致的增益效果。图6展示了多模态检索增益在目标文献类型、历史时期和语言背景上的异质性。
在文档类型层面,所有目标类别的nDCG@10均有所提升。带有图注的照片、手写信件、地图、账簿和登记簿表现出显著改善,而报纸和打印信件的改进则相对有限。这些模式表明,初始元数据较弱或视觉结构复杂的档案资料,最能从文本、图像与元数据信号的综合运用中受益。
在历史时期层面,1850–1879 年的 R@10 从 0.175 提高到 0.429,1880–1909 年达到 0.506,1910–1939 年为 0.501,1940–1969 年为 0.519,在完全多模态融合条件下取得上述结果。各时期增益的绝对幅度相似,表明数据增强与校正识别同时有助于早期稀疏记录以及后期元数据基础更丰富的记录。
语言上下文结果呈现出相似的模式。在完整的多模态条件下,混合拉丁字母记录的P@10达到0.607,英语为0.628,法语为0.618,德语为0.661,葡萄牙语和西班牙语均为0.639。其中,混合拉丁字母记录的精确度提升最为显著,因其基线精确度最低。
组分水平的模式:互补而非冗余的贡献
综上所述,结果表明该方案的各个组成部分具有互补性而非冗余性。OCR 校正提高了文本的可识别性,视觉分类增加了具有结构感知的文档类型信号,而元数据增强则扩展了可检索的描述性层次。完整的多模态条件产生了最强且最稳定的检索性能提升,支持了本研究的目标,即测试一种可审计的、面向检索的异构数字档案处理流程。
这些发现支持一种多模态人工智能增强档案检索的方案模型,同时保留了知识库治理、数据来源追溯和专家验证的必要性。
数据可用性:
用于主要分析的1600条去识别化数据集可在Zenodo上获取,文件名为data.xlsx(https://doi.org/10.5281/zenodo.20774456)。

图1: 多模态档案发现的可重复工作流程。 (A)基于档案库级记录的语料库构建,包含纳入/排除筛选。(B)参考标注与质量控制,包括文档类型、OCR参考区域、语言背景、历史时期及元数据完整性。(C)图像预处理、OCR生成与后校正、视觉文档分类以及保守的元数据增强。(D)索引构建、五通道检索评估、统计分析与资源封装。缩写:OCR,光学字符识别;CER,字符错误率;WER,词错误率。 请点击此处查看此图的放大版本。

图2:校正后的记录级光学字符识别错误结构及可发现性。(A)1,600份档案记录中基线字符错误率(CER)与基线词错误率(WER)的关系,按代表性文档类型的分类进行着色。(B)书写强度标准化值与校正后WER变化之间的关联;负值表示校正后WER降低。拟合线及灰色区域分别表示线性趋势和95%置信区间。(C)按文档类型划分的记录级可发现性评分在校正前后的变化,展示校正后可搜索证据的变动情况。缩写:CER,字符错误率;WER,词错误率。请点击此处查看该图的放大版本。

图3: 档案特定微调前后的视觉文档分类效果。 (A)基线模型与微调后按文档类型划分的Top-1准确率。(B)基线与调优后条件下,正确与错误预测的置信度分布。(C)汇总调优前后Top-1准确率与平均后验置信度的类别级性能矩阵。模型诊断数据包括20个训练周期的损失/准确率曲线、宏平均F1分数(macro-F1)、加权F1分数(weighted-F1)、ROC曲线下面积(ROC-AUC)以及PR曲线下面积(PR-AUC)。请点击此处查看该图的高清版本。

图 4: 保守性增强后的元数据完整性与主题标目匹配情况。 (A)增强前后记录级别的元数据完整性。(B)按文献类型划分的新增实现元数据字段。(C)不同时期主题标目匹配度的提升情况。完整性计算方式为:已填充的相关核心字段数量除以相关核心字段总数。请点击此处查看此图的放大版本。

图 5: 五种实验系统分支中的检索性能。(A)基线、光学字符识别校正、视觉分类、元数据增强及完整多模态集成的总体P@10、R@10、nDCG@10、首次相关结果时间以及成功搜索率。(B)按查询主题和系统分支划分的成功搜索率气泡图;颜色表示系统分支,气泡大小表示成功百分比。(C)在简单、中等和困难查询难度分层下的P@10、R@10和nDCG@10。(D)另一种按主题级别的成功率视图,展示在不同查询主题和系统分支中成功搜索的分布情况。缩写:P@10,前10项精确率;R@10,前10项召回率;nDCG@10,前10项归一化折损累计增益。请点击此处查看此图的放大版本。

图6:不同档案子组中多模态检索增益的异质性。 (A)按目标文档类型和检索条件划分的nDCG@10。 (B)按历史时期和检索条件划分的R@10。 (C)按目标语言语境和检索条件划分的P@10。 检索条件包括基线、OCR校正、视觉分类、元数据增强、完全多模态整合、OCR+文本、文本+视觉+元数据以及视觉+元数据。 该图表明,多模态增益在文档、时期和语言分层中普遍存在,但并不均匀。 请点击此处查看该图的高清版本。
| 文献类型 | 记录数 n | 中位页数 | 手写记录 | 平均基线 WER | 平均基线 元数据 完整性 | 平均基线 可发现性 |
| (%) | ||||||
| 手写信件 | 262 | 2 | 95 | 0.729 | 0.648 | 68.2 |
| 账簿 | 263 | 7 | 63.5 | 0.679 | 0.674 | 72.2 |
| 地图 | 102 | 1 | 2.9 | 0.457 | 0.552 | 74.1 |
| 报纸 | 261 | 8 | 0.8 | 0.495 | 0.66 | 75.5 |
| 带说明文字的照片 | 179 | 1 | 1.1 | 0.374 | 0.601 | 73.6 |
| 海报 | 87 | 1 | 0 | 0.413 | 0.571 | 74.8 |
| 登记簿 | 194 | 10 | 18 | 0.616 | 0.703 | 71.3 |
| 打字通信 | 252 | 3 | 4 | 0.315 | 0.689 | 76.4 |
表1:按文档类型划分的档案馆藏特征。 该表列出了八类文档中每一类的记录数量、平均页数、包含手写内容的记录占比、平均基线词错误率(WER)、平均基线元数据完整度以及平均基线可发现性评分。
| 文档类型 | 样本量 | CER | CER | WER | WER | 命名实体 召回率 | 命名实体 召回率 | ΔWER |
| (n) | (基线) | (干预后) | (基线) | (干预后) | (基线) | (干预后) | ||
| 手写信件 | 262 | 0.531 | 0.363 | 0.729 | 0.531 | 0.302 | 0.44 | −0.198 |
| 账本 | 263 | 0.49 | 0.326 | 0.679 | 0.485 | 0.336 | 0.471 | −0.194 |
| 地图 | 102 | 0.322 | 0.228 | 0.457 | 0.347 | 0.38 | 0.503 | −0.11 |
| 报纸 | 261 | 0.354 | 0.256 | 0.495 | 0.381 | 0.436 | 0.558 | −0.114 |
| 带说明文字的照片 | 179 | 0.257 | 0.181 | 0.374 | 0.286 | 0.494 | 0.616 | −0.088 |
| 海报 | 87 | 0.287 | 0.199 | 0.413 | 0.316 | 0.448 | 0.57 | −0.097 |
| 登记册 | 194 | 0.442 | 0.293 | 0.616 | 0.439 | 0.369 | 0.504 | −0.177 |
| 打印信函 | 252 | 0.219 | 0.155 | 0.315 | 0.232 | 0.524 | 0.646 | −.083 |
表2: 按文档类型划分的OCR在纠错前后的性能表现。 字错误率(CER)和词错误率(WER)均基于参考转录文本计算得出;命名实体召回率基于人工标注的人名、地名、机构名和日期实体计算得出。Δ WER 为纠错后的 WER 减去基线 WER。
| 文档类型 | n | 准确率, 基线 | 准确率, 干预后 | 置信度, 基线 | 置信度, 干预后 | Δ准确率 |
| 手写信件 | 262 | 0.615 | 0.645 | 0.616 | 0.655 | 0.03 |
| 分类账 | 263 | 0.707 | 0.749 | 0.725 | 0.767 | 0.042 |
| 地图 | 102 | 0.765 | 0.902 | 0.801 | 0.899 | 0.137 |
| 报纸 | 261 | 0.716 | 0.843 | 0.728 | 0.83 | 0.127 |
| 带说明文字的照片 | 179 | 0.815 | 0.869 | 0.824 | 0.89 | 0.054 |
| 海报 | 87 | 0.771 | 0.903 | 0.792 | 0.889 | 0.132 |
| 登记册 | 194 | 0.687 | 0.793 | 0.701 | 0.787 | 0.106 |
| 打字通信 | 252 | 0.796 | 0.791 | 0.804 | 0.82 | -0.005 |
表3: 档案特异性微调前后视觉文档分类性能。 该表格按文档类型报告了样本量、top-1准确率、平均后验置信度以及准确率的变化。诊断数据包含20个epoch级别的行,涵盖宏F1分数、加权F1分数、ROC曲线下面积(ROC-AUC)、PR曲线下面积(PR-AUC)、训练损失、验证损失、训练准确率和验证准确率。
| 完整性 | 完整性 | 已填充字段 | 已填充字段 | 主题标目 匹配度 | 主题标目 匹配度 | Δ 完整性 | Δ 主题标目 匹配度 |
| (基线) | (干预后) | (基线) | (干预后) | (基线) | (干预后) | ||
| 0.534 | 0.868 | 4.274 | 8.584 | 0.643 | 0.821 | 0.334 | 0.178 |
| 0.607 | 0.898 | 4.838 | 8.709 | 0.672 | 0.841 | 0.291 | 0.169 |
| 0.68 | 0.927 | 5.426 | 9.095 | 0.686 | 0.849 | 0.247 | 0.163 |
| 0.686 | 0.922 | 5.48 | 8.953 | 0.694 | 0.854 | 0.236 | 0.16 |
表4: 按历史时期划分的元数据丰富度。 完整性是指一条记录中已填写的核心描述字段所占的比例;已填写的字段以平均数量表示;主题标目匹配表示该记录级别的证据是否支持至少一个受控词汇的主题标签。
| 系统臂 | n 个查询 | P@10 | R@10 | nDCG@10 | 首次相关时间 结果(s) | 成功搜索率 |
| (%) | ||||||
| 基线 | 420 | 0.394 | 0.238 | 0.392 | 156.079 | 5 |
| OCR 校正 | 420 | 0.484 | 0.346 | 0.475 | 124.261 | 30.2 |
| 视觉分类 | 420 | 0.49 | 0.302 | 0.478 | 131.985 | 22.9 |
| 元数据增强 | 420 | 0.507 | 0.347 | 0.513 | 117.474 | 38.3 |
| 全模态 | 420 | 0.624 | 0.492 | 0.634 | 58.485 | 95.5 |
表5: 五个实验系统分支的检索性能。 在匹配查询条件下,基于420个查询的基准测试计算了P@10、R@10、nDCG@10、首次出现相关结果的时间以及成功搜索率。
本方案表明,在将光学字符识别(OCR)校正、文档视觉理解以及保守的元数据增强作为相互关联的检索组件而非孤立的技术改进进行评估时,历史数字档案中的发现效果提升最为显著。OCR性能提升最大的材料类型为手写文本、表格以及登记类文档,这表明在基础识别效果最弱的文档类别中,进行校正后处理具有重要价值。同时,校正后仍存在的残余错误表明,OCR清理不能被视为最终的定稿转录,而必须保持可审计性。
视觉分类结果也需要谨慎解读。微调改善了地图、海报、报纸和登记簿等视觉特征明显的类别,但对于手写信件和账簿等布局重叠、类别边界在视觉上较难区分的类别,提升效果较小。由于语料库规模相对较小,分类性能应被视为方法可行性的证据,而非证明仅凭1,600条记录即可训练出可用于实际应用的多模态模型。未来的验证工作应将EfficientNet-B3与文档Transformer、视觉Transformer、Swin Transformer、ConvNeXt以及多模态文档基础模型8,11,12,13,14,15,16,17,18进行比较。
元数据增强通过将稀疏的描述性记录扩展为可搜索字段,同时保留来源和置信度信息,显著提升了检索效果。这一发现与档案领域对更丰富访问点的需求相一致,但也带来了治理风险。自动增强可能放大光学字符识别(OCR)错误,过度规范化历史上存在歧义的名称,或在受控词表不完整时引入偏见。因此,该工作流程采用置信度阈值、来源记录和审核标记机制,而非完全自动替换编目记录。
检索评估结果提供了互补模块效应的证据,但也存在局限性。当前的比较采用了基线和内部模块消融条件,但未与密集检索、ColBERT 等晚期交互排序器、混合稀疏-密集检索、神经重排序或检索增强生成系统22,23,24进行基准对比。未来的研究应纳入这些方法,以确定所观察到的多模态增益是否仍能与当前的检索架构保持竞争力。
实施过程中还需关注数据泄露、计算资源限制和可扩展性问题。富集过程使用了光学字符识别输出、视觉预测结果以及现有元数据,因此训练集/验证集/测试集的划分和查询评估必须与富集决策相分离。未来的部署应报告每1,000条记录所对应的硬件配置、运行时间、内存占用、索引大小和成本。来自相关计算机视觉领域的图像恢复方法,包括多尺度和基于注意力机制的遮挡去除模型,可能为未来的预处理实验提供启发,但这些方法必须经过谨慎测试,因为档案处理流程绝不能产生虚构内容或篡改证据性信息26,27。
总体而言,该工作流程最好被理解为一种可重复的访问协议,而非档案描述的替代方案。当多模态人工智能的输出受到限制、记录并经过审查时,其可提升检索效果,但在来源评估、访问管理决策以及对历史复杂档案的解读方面,档案管理员仍然不可或缺21,25。
结论:
本研究检验了光学字符识别校正、文档视觉分类以及保守的元数据增强是否可作为历史数字档案中互补的检索组件。该方案在保留明确阈值、源日志记录和人工审核保障的同时,提升了转录准确性、分类效果、元数据完整性以及整体检索性能。因此,该工作流程应被用作可审计的访问支持协议,而非取代档案管理员的判断或仓储管理机制。
作者无任何利益冲突需要披露。
作者衷心感谢两位经验丰富的档案工作人员和一位专业数字人文研究者在文本标注和质量控制方面提供的宝贵帮助。本研究得到了江苏省档案科技项目计划(项目编号:2024-9)资助,用于构建基于智能语音的口述档案系统;同时获得江苏省中医药科技发展计划(项目编号:MS2025025)资助,开展从档案视角研究中医药学派传承与发展的课题。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Python | Python 软件基金会 | v3.11.8; https://www.python.org/ | 工作流脚本编写、数据处理、光学字符识别后校正及统计支持 |
| R | 统计计算 R 基金会 | v4.3.3; https://www.r-project.org/ | 统计分析与最终图表生成 |
| Tesseract OCR | Tesseract OCR 项目 | v5.3.0; https://github.com/tesseract-ocr/tesseract | 基础光学字符识别生成 |
| Tesseract 语言包 | Tesseract OCR 项目 | 研究专用语言包;https://github.com/tesseract-ocr/tessdata | 主要及混合语言的光学字符识别解码 |
| OpenCV | OpenCV 团队 | v4.9.0; https://opencv.org/ | 去倾斜、噪声估计与图像预处理 |
| Pillow | Python 图像库贡献者 | v10.3.0; https://python-pillow.org/ | 图像输入/输出与格式标准化 |
| NumPy | NumPy 开发人员 | v1.26.4; https://numpy.org/ | 用于图像与度量处理的数组计算 |
| pandas | pandas 开发团队 | v2.2.2; https://pandas.pydata.org/ | 表格数据处理与汇总导出 |
| SciPy | SciPy 开发人员 | v1.13.1; https://scipy.org/ | 统计检验与数值工具 |
| statsmodels | statsmodels 开发人员 | v0.14.2; https://www.statsmodels.org/ | 统计建模与配对比较支持 |
| scikit-learn | scikit-learn 开发人员 | v1.4.2; https://scikit-learn.org/ | 分类度量、ROC/PR 诊断与验证工具 |
| rapidfuzz | Max Bachmann 及贡献者 | v3.9.0; https://github.com/rapidfuzz/RapidFuzz | 用于光学字符识别校正的编辑距离候选排序 |
| spaCy | Explosion AI | v3.7.4; https://spacy.io/ | 基于自定义词典表的命名实体处理 |
| PyTorch | PyTorch 基金会 | v2.2.2; https://pytorch.org/ | 视觉文档分类器训练 |
| torchvision | PyTorch 基金会 | v0.17.2; https://pytorch.org/vision/ | EfficientNet-B3 实现与图像变换 |
| EfficientNet-B3 主干网络 | torchvision / ImageNet 预训练权重 | EfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.html | 视觉文档分类主干网络 |
| sentence-transformers | UKP 实验室 / Hugging Face 生态系统 | v2.7.0; https://www.sbert.net/ | 受控词汇候选的语义扩展 |
| 搜索引擎软件 | Elastic | Elasticsearch v8.11.1; https://www.elastic.co/elasticsearch | BM25 索引、检索与排序 |
| 容器引擎 | Docker 公司 | Docker v26.1.1; https://www.docker.com/ | 容器化检索环境 |
| Linux 操作系统 | Canonical | Ubuntu 22.04 LTS; https://ubuntu.com/ | 检索运行的固定操作系统环境 |
| 版本控制系统 | Git 项目 | Git v2.44.0; https://git-scm.com/ | 配置、词汇表、脚本与图表代码的版本控制 |
| ggplot2 | tidyverse | v3.5.1; https://ggplot2.tidyverse.org/ | 基于 R 的图表渲染 |
| Matplotlib | Matplotlib 开发人员 | v3.8.4; https://matplotlib.org/ | 补充可视化与质量保证图表 |
| 标注指南 | 作者 | 5 个标注部分;8 种文档类别标签;OCR 区域;实体标签;相关性判断;裁决规则 | 文档类别、OCR 区域、实体、相关性判断与裁决的定义 |
| 档案专用 OCR 词典 | 作者 | 6 类词典类别:人名变体、地名、机构名称、日期模式、行政术语、缩写 | 人名、地名、机构、行政术语及拼写变体 |
| 受控词汇映射 | 作者 / 档案馆 | 5 条映射规则,将 OCR 实体、视觉类别、标题关键词、日期覆盖范围和查询主题链接至元数据字段 | 主题标目匹配与语义扩展 |
| 基准查询集 | 作者 | 420 个基准查询;6 个查询主题;3 个难度等级;8 种目标文档类别;4 个历史时期;6 种语言环境 | 跨五个系统分支的匹配检索基准 |
| 相关性判断 | 作者 / 标注人员 | 2,100 个查询-系统行;420 个查询 × 5 个系统分支;相关总数、前 10 名相关数量、分级相关性及成功标志 | 作为 P@10、R@10、nDCG@10 和成功搜索率的真值代理 |
| 训练诊断 | 作者 | 20 个训练周期;训练损失;验证损失;训练准确率;验证准确率;宏平均 F1;加权 F1;ROC-AUC;PR-AUC | 按训练周期的模型诊断摘要 |
| 计算硬件 | 作者 | 8 核 CPU;32 GB 内存;NVIDIA GPU 级训练环境 | JoVE 投稿所需的可重复性资源细节 |
| 数据集文件 | 作者 | data.xlsx;1,600 条记录;17 个变量;DOI 列于论文的数据可用性声明中 | 用于光学字符识别、元数据完整性、可发现性及视觉分类分析的逐条记录源数据 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可