$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La corrección OCR mejoró la transcripción, especialmente en registros manuscritos y tabulares
La corrección por reconocimiento óptico de caracteres mejoró la calidad de la transcripción en las ocho clases de documentos archivísticos (n = 1.600 registros). El WER medio disminuyó de 0,529 ± 0,172 a 0,384 ± 0,123, con un cambio medio por pares de −0,144 (IC 95%, −0,149 a −0,139; Wilcoxon con rango firmado P < 0,001). La CER media disminuyó de 0,377 ± 0,126 a 0,258 ± 0,086, con un cambio medio pareado de −0,119 (IC 95%, −0,123 a −0,116; Wilcoxon firmado - rango P < 0,001). La Tabla 2 muestra que el WER base era más alto para cartas manuscritas, libros mayores y libros de registro, lo que indica que los registros visualmente más complejos también tenían la mayor carga inicial de reconocimiento.
Tras la corrección, la WER disminuyó en todas las clases de documentos. Las mayores reducciones medias de WER emparejados se produjeron en cartas manuscritas (n = 262; −0,200; IC 95%, −0,213 a −0,188), libros mayores (n = 263; −0,195; IC 95%, −0,206 a −0,183) y libros de registro (n = 194; −0,173; IC 95%, −0,187 a −0,160). La CER siguió el mismo patrón, apoyando la interpretación de que el módulo post-corrección beneficiaba principalmente a registros difíciles manuscritos, tabulares y de diseño mixto.
La recuperación de entidades nombradas también mejoró en todos los tipos de documentos, como se muestra en la tabla resumen. Los mayores aumentos se produjeron en cartas manuscritas (0,302–0,440), libros mayores (0,336–0,471) y libros de registro (0,369–0,504). La correspondencia mecanografiada alcanzó el mayor recuerdo de entidades nombradas tras la corrección (0,646), pero su ganancia absoluta fue menor porque el reconocimiento de la línea base ya era más fuerte para esta clase. La Figura 2 resume la relación CER-WER a nivel de registro basal, la asociación entre la intensidad de escritura y el beneficio de corrección, y el cambio posterior a la corrección en la descubribilidad a nivel de registro.
La clasificación visual de documentos mejoró en general, pero las mejoras de rendimiento fueron desiguales entre clases
La clasificación visual de documentos mejoró en general en todo el conjunto de 1.600 registros. La precisión del top-1 aumentó de 0,717 a 0,796 (cambio absoluto, 0,079; McNemar chi al cuadrado = 27,33; P < 0,001), y la confianza media en la predicción aumentó de 0,736 ± 0,131 a 0,800 ± 0,108 (cambio medio por pares, 0,064; IC 95%, 0,057–0,071; test t pareado P < 0,001). Como se muestra en la Tabla 3, siete de las ocho clases mejoraron tras ajustes específicos del archivo, con las mayores mejoras para mapas, carteles, periódicos y libros de registro.
La correspondencia mecanografiada no mejoró sustancialmente tras el ajuste fino (0,796–0,791), lo que sugiere que sus características visuales básicas ya eran estables y que el procedimiento de entrenamiento añadía poca separación adicional de clases para esta categoría.
La Figura 3 resume el rendimiento visual de la clasificación de documentos antes y después del ajuste fino específico del archivo; el cuaderno de datos fuente enumera 20 épocas de pérdida y precisión de tren/validación, junto con resúmenes diagnósticos macro-F1, ponderado-F1, ROC-AUC y PR-AUC.
El enriquecimiento de metadatos mejoró la completitud descriptiva en todos los periodos históricos (n = 1.600 registros). La completitud media aumentó de 0,657 ± 0,125 a 0,907 ± 0,070, con un cambio medio por parejas de 0,250 (IC 95%, 0,243–0,257; Wilcoxon con rango firmado P < 0,001). Como se muestra en la Tabla 4, la completitud de la línea base fue más baja entre 1850 y 1879 y aumentó en periodos posteriores antes del enriquecimiento. La Figura 4 resume la mejora en la completitud de los metadatos, los campos de metadatos recién realizados por tipo de documento y las mejoras en la coincidencia de encabezados de materia a lo largo de los periodos históricos.
Tras el enriquecimiento, la completitud aumentó en todos los periodos históricos: 1850–1879 (n = 281; cambio media, 0,207; IC 95%, 0,191–0,223), 1880–1909 (n = 474; cambio medio, 0,236; IC 95%, 0,223–0,248), 1910–1939 (n = 549; cambio media, 0,277; IC 95%, 0,265–0,288) y 1940–1969 (n = 296; cambio media, 0,263; IC 95%, 0,247–0,279). El número medio de campos poblados también aumentó de forma constante a lo largo de los periodos.
La coincidencia por títulos de asignatura mejoró en paralelo. Las tasas de emparejamiento base oscilaron entre el 64,3% y el 69,4%, mientras que las tasas de emparejamiento postenriquecimiento oscilaron entre el 82,1% y el 85,4%. La mayor ganancia absoluta se produjo en el periodo más temprano (Delta = 0,178), lo que respalda el valor del enriquecimiento conservador para registros con descripciones iniciales escasas.
El rendimiento de recuperación mejoró en todos los sistemas mejorados, con las mayores mejoras bajo la integración multimodal completa
La efectividad de la extracción mejoró bajo cada condición de mejora en relación con la línea base, pero la magnitud de la mejora varió según el brazo del sistema (n = 420 consultas de referencia emparejadas). Los resultados generales de la recuperación se listan en la Tabla 5. El rendimiento inicial fue bajo: P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, tiempo medio hasta el primer resultado relevante = 156,079 s, y tasa de búsqueda exitosa = 5,0% (21/420; IC 95%, 3,3%–7,5%). La Figura 5 resume el rendimiento de recuperación en los cinco brazos del sistema experimental, incluyendo métricas generales de recuperación, tasas de éxito a nivel de tema y estratos de consulta y dificultad.
Los tres sistemas monocomponentes superaron la línea base en conjunto. La corrección por reconocimiento óptico de caracteres aumentó P@10 a 0,484, R@10 a 0,346 y nDCG@10 a 0,475, mientras que redujo el tiempo hasta el primer resultado relevante a 124,261 s y aumentó la tasa de búsqueda exitosa al 30,2% (127/420; IC 95%, 26,0%–34,8%). La clasificación visual produjo P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, tiempo medio hasta el primer resultado relevante = 131,985 s, y tasa de búsqueda exitosa = 22,9% (96/420; IC 95%, 19,1%–27,1%). El enriquecimiento de metadatos logró el mejor rendimiento de recuperación en un solo componente, con P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, tiempo medio hasta el primer resultado relevante = 117,474 s, y una tasa de búsqueda exitosa del 38,3% (161/420; IC 95%, 33,8%–43,1%).
El sistema multimodal completo funcionó mejor en todos los puntos finales de recuperación. P@10 aumentó de 0,394 en la línea inicial a 0,624, R@10 de 0,238 a 0,492 y nDCG@10 de 0,392 a 0,634. El tiempo medio hasta el primer resultado relevante disminuyó de 156,079 s a 58,485 s, y la tasa de búsqueda exitosa aumentó del 5,0% al 95,5% (401/420; IC 95%, 93,0%–97,1%). Estos valores corresponden a ganancias absolutas de 0,230 para P@10, 0,254 para R@10 y 0,242 para nDCG@10.
La recuperación específica por tema también mejoró con la integración multimodal completa. Las tasas de búsqueda exitosa aumentaron entre personas, instituciones, lugares, ocupaciones, eventos y temas temáticos, siendo la categoría ocupacional la que mostró la mayor mejora práctica, ya que su tasa base de éxito fue del 0,0% y subió al 90,0% bajo la condición multimodal completa. Las consultas por nombres de lugar tenían el rendimiento base más fuerte, pero aún así se beneficiaban de la integración multimodal.
Las ganancias multimodales variaron según los estratos de documentos, épocas y lenguas
Los análisis de subgrupos mostraron que las ganancias multimodales se distribuyeron ampliamente entre tipos de documentos, periodos históricos y contextos lingüísticos, aunque la magnitud de la mejora varió. Esta heterogeneidad indica que el flujo de trabajo debe evaluarse dentro de cada colección objetivo en lugar de asumir que produce ganancias uniformes. La Figura 6 muestra la heterogeneidad de las ganancias de recuperación multimodal según el tipo de documento objetivo, el periodo histórico y el contexto lingüístico.
A nivel de tipo documento, nDCG@10 mejorado en todas las clases objetivo. Las fotografías con pies de foto, cartas manuscritas, mapas, libros de contabilidad y libros de registro mostraron fuertes avances, mientras que los periódicos y la correspondencia mecanografiada mejoraron de forma más modesta. Estos patrones sugieren que los registros con metadatos iniciales débiles o estructura visual compleja se benefician más de la combinación de señales de texto, imagen y metadatos.
A nivel histórico, R@10 aumentó de 0,175 a 0,429 para 1850–1879 y alcanzó 0,506 para 1880–1909, 0,501 para 1910–1939 y 0,519 para 1940–1969 bajo la integración multimodal completa. Las ganancias fueron similares en escala absoluta entre periodos, lo que sugiere que el enriquecimiento y el reconocimiento corregido ayudaron tanto a los primeros registros dispersos como a los registros posteriores con metadatos base más ricos.
Los resultados del contexto del lenguaje mostraron un patrón similar. P@10 bajo la condición multimodal completa alcanzó 0,607 para discos mixtos en escritura latina, 0,628 para inglés, 0,618 para francés, 0,661 para alemán y 0,639 para portugués y español. La mayor ganancia de precisión se produjo en registros mixtos de escritura latina, que tenían la precisión base más débil.
Patrones a nivel de componente: contribuciones complementarias en lugar de redundantes
En conjunto, los resultados muestran que los componentes del protocolo son complementarios y no redundantes. La corrección OCR mejoró la reconocibilidad del texto, la clasificación visual añadió señales de tipo documento conscientes de la estructura y el enriquecimiento de metadatos amplió la capa descriptiva buscable. La condición multimodal completa produjo las ganancias de recuperación más fuertes y consistentes, apoyando el objetivo del estudio de probar un flujo de trabajo auditable orientado a la recuperación para archivos digitales heterogéneos.
Estos hallazgos apoyan un modelo de protocolo en el que la inteligencia artificial multimodal mejora la búsqueda archivística mientras preserva la necesidad de gobernanza de repositorios, procedencia de datos y validación experta.
DISPONIBILIDAD DE DATOS:
El conjunto de datos de 1.600 registros desidentificados utilizado para los análisis principales está disponible en Zenodo como data.xlsx (https://doi.org/10.5281/zenodo.20774456).

Figura 1: Flujo de trabajo reproducible para descubrimiento archivístico multimodal. (A) Construcción de corpus a partir de registros archivísticos a nivel de repositorio con cribado de inclusión/exclusión (inclusion/exclusion). (B) Etiquetado de referencias y control de calidad, incluyendo tipo de documento, regiones de referencia OCR, contexto lingüístico, periodo histórico y completitud de los metadatos. (C) Preprocesamiento de imágenes, generación y postcorrección de OCR, clasificación visual de documentos y enriquecimiento conservador de metadatos. (D) Construcción de índices, evaluación de recuperación de cinco brazos, análisis estadístico y empaquetado de recursos. Abreviaturas: OCR, reconocimiento óptico de caracteres; CER, tasa de error de carácter; WER, tasa de error de palabras. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 2: Estructura de errores de reconocimiento óptico de caracteres a nivel de registro y descubribilidad tras la postcorrección. (A) Referencia base de la CER frente a la referencia de la línea de referencia en 1.600 registros de archivo, coloreados por tipo de documento para las clases representativas. (B) Asociación entre la intensidad escalada de la escritura a mano y el cambio en la WER tras la corrección; valores negativos indican un WER más bajo tras la corrección. La línea ajustada y la banda gris muestran la tendencia lineal y el intervalo de confianza del 95%. (C) Puntuación de descubribilidad a nivel de registro antes y después de la corrección por tipo de documento, ilustrando los cambios posteriores a la corrección en la evidencia buscable. Abreviaturas: CER, tasa de error de caracteres; WER, tasa de error de palabras. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 3: Clasificación visual de documentos antes y después del ajuste fino específico del archivo. (A) Precisión Top 1 por tipo de documento en la línea base y después del ajuste fino. (B) Distribuciones de confianza para predicciones correctas e incorrectas bajo condiciones de línea base y post-ajuste. (C) Matriz de rendimiento a nivel de clase que resume la precisión del top 1 y la confianza media posterior antes y después de la afinación. Los datos diagnósticos del modelo incluyen 20 épocas de curvas de pérdida/precisión, macro-F1, ponderado-F1, ROC-AUC y PR-AUC. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 4: Completitud de los metadatos y coincidencia de encabezado tras el enriquecimiento conservador. (A) Completitud de los metadatos a nivel de registro antes y después del enriquecimiento. (B) Campos de metadatos recién realizados por tipo de documento. (C) Ganancia en la partida por cabeza de tema a lo largo de los periodos históricos. La completitud se calculó dividido como el número de campos núcleo aplicables poblados por el número total de campos núcleo aplicables. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 5: Rendimiento de recuperación en los cinco brazos del sistema experimental. (A) P@10, R@10, nDCG@10 global, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa para la línea base, corrección por reconocimiento óptico de caracteres, clasificación visual, enriquecimiento de metadatos e integración multimodal completa. (B) Gráfico de burbujas de la tasa de búsqueda exitosa por tema de consulta y brazo del sistema; El color indica el brazo del sistema, y el tamaño de la burbuja indica el porcentaje de éxito. (C) P@10, R@10 y nDCG@10 en los estratos de dificultad fácil, moderada y difícil de consulta. (D) Vista alternativa de tasa de éxito a nivel de tema que muestra la distribución de búsquedas exitosas entre temas de consulta y brazos del sistema. Abreviaturas: P@10, precisión en 10; R@10, llamada a las 10; nDCG@10, ganancia acumulada descontada normalizada en 10. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Figura 6: Heterogeneidad de las ganancias de recuperación multimodal entre subgrupos archivísticos. (A) nDCG@10 por tipo de documento objetivo y condición de recuperación. (B) R@10 por periodo histórico y condición de recuperación. (C) P@10 según el contexto del idioma objetivo y la condición de recuperación. Las condiciones son: Línea Base, corrección OCR, clasificación visual, enriquecimiento de metadatos, integración multimodal completa, OCR+Texto, Texto+Visual+Metadatos y Visual+Metadatos. La figura destaca que las ganancias multimodales son generalizadas pero no uniformes en los estratos de documentos, periodos y lenguajes. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
| Tipo de documento | N récords | Páginas medianas | Registros manuscritos | Línea base media WER | Línea base media Metadatos Completitud | Línea base media Descubribilidad |
| | | (%) | | | |
| Carta manuscrita | 262 | 2 | 95 | 0.729 | 0.648 | 68.2 |
| Libro mayor | 263 | 7 | 63.5 | 0.679 | 0.674 | 72.2 |
| Mapa | 102 | 1 | 2.9 | 0.457 | 0.552 | 74.1 |
| Periódico | 261 | 8 | 0.8 | 0.495 | 0.66 | 75.5 |
| Fotografía con pie de foto | 179 | 1 | 1.1 | 0.374 | 0.601 | 73.6 |
| Cartel | 87 | 1 | 0 | 0.413 | 0.571 | 74.8 |
| Libro de registro | 194 | 10 | 18 | 0.616 | 0.703 | 71.3 |
| Correspondencia mecanografiada | 252 | 3 | 4 | 0.315 | 0.689 | 76.4 |
Tabla 1: Características de la colección archivística por tipo de documento. La tabla informa sobre el número de registros, el número medio de páginas, el porcentaje de registros que contienen escritura manuscrita, la media de la línea base de los WER, la integridad media de los metadatos de la línea base y la puntuación media de descubribilidad de la línea base para cada una de las ocho clases de documentos.
| Tipo de documento | Tamaño de la muestra | CER | CER | WER | WER | Entidad nombrada Revocación | Entidad nombrada Revocación | ΔWER |
| (n) | (Línea base) | (Publicación) | (Línea base) | (Publicación) | (Línea base) | (Publicación) | |
| Carta manuscrita | 262 | 0.531 | 0.363 | 0.729 | 0.531 | 0.302 | 0.44 | −0,198 |
| Libro mayor | 263 | 0.49 | 0.326 | 0.679 | 0.485 | 0.336 | 0.471 | −0,194 |
| Mapa | 102 | 0.322 | 0.228 | 0.457 | 0.347 | 0.38 | 0.503 | −0.11 |
| Periódico | 261 | 0.354 | 0.256 | 0.495 | 0.381 | 0.436 | 0.558 | −0,114 |
| Fotografía con pie de foto | 179 | 0.257 | 0.181 | 0.374 | 0.286 | 0.494 | 0.616 | −0,088 |
| Cartel | 87 | 0.287 | 0.199 | 0.413 | 0.316 | 0.448 | 0.57 | −0,097 |
| Libro de registro | 194 | 0.442 | 0.293 | 0.616 | 0.439 | 0.369 | 0.504 | −0,177 |
| Correspondencia mecanografiada | 252 | 0.219 | 0.155 | 0.315 | 0.232 | 0.524 | 0.646 | −.083 |
Tabla 2: Rendimiento del OCR antes y después de la corrección posterior por tipo de documento. CER y WER se calcularon contra transcripciones de referencia; La retirada de entidades nombradas se calculaba contra entidades de persona, lugar, institución y fecha etiquetadas manualmente. Delta WER es WER post-corrección menos WER basal.
| Tipo de documento | n | Precisión, Línea base | Precisión, Publicación | Confianza, Línea base | Confianza, Publicación | ΔAccuracy |
| Carta manuscrita | 262 | 0.615 | 0.645 | 0.616 | 0.655 | 0.03 |
| Libro mayor | 263 | 0.707 | 0.749 | 0.725 | 0.767 | 0.042 |
| Mapa | 102 | 0.765 | 0.902 | 0.801 | 0.899 | 0.137 |
| Periódico | 261 | 0.716 | 0.843 | 0.728 | 0.83 | 0.127 |
| Fotografía con pie de foto | 179 | 0.815 | 0.869 | 0.824 | 0.89 | 0.054 |
| Cartel | 87 | 0.771 | 0.903 | 0.792 | 0.889 | 0.132 |
| Libro de registro | 194 | 0.687 | 0.793 | 0.701 | 0.787 | 0.106 |
| Correspondencia mecanografiada | 252 | 0.796 | 0.791 | 0.804 | 0.82 | -0.005 |
Tabla 3: Rendimiento de la clasificación visual de documentos antes y después del ajuste fino específico del archivo. La tabla informa sobre el tamaño de la muestra, la precisión del top 1, la confianza media posterior y el cambio en la precisión según el tipo de documento. Los datos diagnósticos incluyen 20 filas a nivel de época con macro-F1, F1 ponderado, ROC-AUC, PR-AUC, pérdida de entrenamiento, pérdida de validación, precisión de entrenamiento y precisión de validación.
| Completitud | Completitud | Campos poblados | Campos poblados | Título del tema Partido | Título del tema Partido | Δ Completitud | Δ Encabezado de materia Partido |
| (Línea base) | (Publicación) | (Línea base) | (Publicación) | (Línea base) | (Publicación) | | |
| 0.534 | 0.868 | 4.274 | 8.584 | 0.643 | 0.821 | 0.334 | 0.178 |
| 0.607 | 0.898 | 4.838 | 8.709 | 0.672 | 0.841 | 0.291 | 0.169 |
| 0.68 | 0.927 | 5.426 | 9.095 | 0.686 | 0.849 | 0.247 | 0.163 |
| 0.686 | 0.922 | 5.48 | 8.953 | 0.694 | 0.854 | 0.236 | 0.16 |
Tabla 4: Enriquecimiento de metadatos por periodo histórico. La completitud es la proporción de campos descriptivos centrales aplicables que se rellenan para un registro; los campos poblados se reportan como conteos medios; La coincidencia por encabezado de tema indica si la evidencia a nivel de registro apoyó al menos una etiqueta de sujeto con vocabulario controlado.
| Brazo del sistema | n consultas | P@10 | R@10 | nDCG@10 | Hora de empezar lo relevante resultado(s) | Tasa de búsqueda exitosa |
| | | | | | (%) |
| Línea base | 420 | 0.394 | 0.238 | 0.392 | 156.079 | 5 |
| Corrección OCR | 420 | 0.484 | 0.346 | 0.475 | 124.261 | 30.2 |
| Clasificación visual | 420 | 0.49 | 0.302 | 0.478 | 131.985 | 22.9 |
| Enriquecimiento de metadatos | 420 | 0.507 | 0.347 | 0.513 | 117.474 | 38.3 |
| Multimodal completo | 420 | 0.624 | 0.492 | 0.634 | 58.485 | 95.5 |
Tabla 5: Rendimiento de recuperación para los cinco brazos del sistema experimental. Se calcularon P@10, R@10, nDCG@10, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa en el benchmark de 420 consultas bajo condiciones de consulta emparejada.