Artículo de investigación

Flujo de trabajo de inteligencia artificial multimodal reproducible para el descubrimiento de archivos digitales históricos

DOI:

10.3791/71698

7 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aquí presentamos un protocolo para mejorar el descubrimiento en archivos digitales históricos integrando el reconocimiento óptico de caracteres post-corrección, la clasificación visual de documentos, el enriquecimiento de metadatos y la evaluación de recuperación en un flujo de trabajo auditable.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los archivos digitales históricos son cada vez más consultables, pero el descubrimiento sigue siendo limitado cuando los errores de reconocimiento óptico de caracteres, los tipos de documentos visualmente heterogéneos y los metadatos escasos se manejan por separado. Este estudio tenía como objetivo desarrollar un protocolo reproducible para evaluar si un flujo de trabajo conservador de inteligencia artificial multimodal puede mejorar la recuperación archivística sin sustituir la revisión archivística. Se ensambló un corpus de 1.600 registros archivísticos digitalizados de ocho clases de documentos, y se utilizó un benchmark de 420 consultas para comparar cinco condiciones de recuperación: indexación base, corrección por reconocimiento óptico de caracteres únicamente, clasificación visual única, enriquecimiento de metadatos solo e integración multimodal completa. Los resultados a nivel de registro incluyeron tasa de error de caracteres (CER), tasa de error de palabra (WER), recuperación de entidades nombradas, precisión en la clasificación por tipo de documento, confianza en la predicción, completitud de metadatos y coincidencia por encabezado de tema. Los resultados a nivel de consulta incluyeron P@10, R@10, nDCG@10, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa. La corrección por reconocimiento óptico de caracteres redujo la WER más fuertemente para cartas manuscritas, libros de contabilidad y libros de registro; el ajuste visual mejoró la precisión de la clasificación principalmente para mapas, carteles, periódicos y libros de registro; y el enriquecimiento de metadatos aumentó la completitud a lo largo de todos los periodos históricos. La condición multimodal completa logró el mayor rendimiento de recuperación (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) y redujo el tiempo medio hasta el primer resultado relevante de 156,079 s a 58,485 s. Estos resultados apoyan un flujo de trabajo modular y auditable en el que texto, imagen y señales descriptivas se combinan bajo umbrales explícitos y revisión humana.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los archivos digitales se han expandido rápidamente y ahora apoyan la investigación en historia, patrimonio cultural, administración pública y humanidades digitales. Sin embargo, el acceso sigue siendo desigual porque los registros de archivo suelen combinar una salida degradada de reconocimiento óptico de caracteres, diseños de página visualmente diversos, prácticas de catalogación inconsistentes y nombres, lugares e instituciones históricamente variables. Estas limitaciones afectan no solo a la calidad de la transcripción, sino también a la recuperación, filtrado y reutilización posterior de coleccionesdigitalizadas 1,2,3,4,5,6,7.

Los estudios existentes de inteligencia artificial documental y recuperación de archivos han mejorado componentes individuales como el reconocimiento óptico de caracteres postcorrección, la clasificación de imágenes de documentos, la normalización de metadatos, el modelado temático, las incrustaciones de palabras, la recuperación neuronal y la práctica de gobernanzade datos 8,9,10,11,12,13,14,15. 16,17,18,19,20,21,22,23,24,25. Sin embargo, muchos sistemas de archivo siguen evaluando estos componentes por separado, lo que dificulta determinar si un flujo de trabajo combinado mejora el descubrimiento bajo condiciones de búsqueda realistas. La brecha metodológica abordada aquí es la ausencia de un protocolo reproducible y auditable que conecte módulos de texto, imagen y metadatos con los resultados de recuperación en un único flujo de trabajo archivístico.

El objetivo central era comprobar si la corrección por reconocimiento óptico de caracteres, la clasificación visual de documentos y el enriquecimiento de metadatos con límites de reglas producen mejoras complementarias cuando se evalúan frente al mismo benchmark de recuperación.

Planteamos la hipótesis de que la condición multimodal completa superaría a cada condición de un solo componente porque el descubrimiento archivístico depende de la interacción entre texto legible, estructura de documento visualmente interpretable y metadatos descriptivos buscables. El flujo de trabajo estaba diseñado de forma conservadora: los resultados automatizados podían enriquecer índices de recuperación, pero las predicciones de baja confianza se señalaban para revisión en lugar de usarse como descripción archivística autorizada.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio utilizó registros archivísticos digitalizados y consultas simuladas de recuperación como unidades de análisis. Los repositorios archivísticos pueden restringir el acceso a registros sensibles o culturalmente restringidos. Sigue las normas de acceso al repositorio, los procedimientos institucionales de seguridad de datos y los requisitos de desidentificación antes de procesar o compartir cualquier registro. No se generó ningún residuo de laboratorio peligroso de productos químicos, biológicos, punzantes, radiactivos u otros residuos regulados por este flujo de trabajo.

Diseño del estudio y construcción de corpus

La Figura 1 presenta el flujo de trabajo completo del estudio, incluyendo construcción de corpus, etiquetado de referencias, preprocesamiento de imágenes, generación y postcorrección de OCR, clasificación visual, enriquecimiento de metadatos, construcción de índices, evaluación de recuperación, análisis estadístico y empaquetado de reproducibilidad.

La construcción del corpus se llevó a cabo del 15 de enero al 30 de abril de 2025, seguida del diseño y depuración del sistema del 1 de mayo al 31 de octubre de 2025. El corpus contenía 1.600 archivos digitalizados seleccionados de ocho depósitos que representaban sistemas estatales, municipales, religiosos, museísticos, universitarios y bibliotecarios. El marco de muestreo se estratificaba por clase de repositorio y documento para preservar la heterogeneidad archivística entre cartas manuscritas, libros de contabilidad, mapas, periódicos, fotografías con pies de foto, carteles, libros de registro y correspondencia mecanografiada.

Para cada registro candidato, el registro de selección registraba el identificador del repositorio o colección, identificador del catálogo, clase del documento, periodo histórico aproximado, contexto del idioma dominante, formato de imagen disponible, resolución de imagen, número de páginas y campos descriptivos de referencia. La inclusión requería todo lo siguiente: un identificador estable de catálogo; al menos una imagen de página TIFF, JPEG o PNG; resolución de imagen fuente de al menos 150 dpi; contenido textual, tabular o estructural-documental legible; y asignación a una de las ocho clases de documentos predefinidas. Los criterios de exclusión eran duplicados exactos, páginas en blanco en reverso, imágenes recortadas hasta el punto de que faltaba más del 30% del área con texto y registros considerados ilegibles tras inspección manual.

El benchmark de recuperación contenía 420 consultas cortas en lenguaje natural generadas entre el 5 y el 20 de agosto de 2025. La generación de consultas siguió una plantilla reproducible: las necesidades de información de los candidatos se muestrearon de personas, instituciones, lugares, fechas, ocupaciones, eventos y temas temáticos; cada consulta se normalizaba a 2–9 palabras; y los registros relevantes para el objetivo se identificaron antes de la comparación del sistema. Cada consulta fue evaluada bajo cinco condiciones de recuperación, produciendo 2.100 observaciones de consulta coincidiendo.

Etiquetado de referencia y control de calidad

El etiquetado de referencias se realizó del 1 de mayo al 15 de julio de 2025 por tres anotadores: dos miembros del personal de archivos con experiencia en catalogación descriptiva y un investigador en humanidades digitales con experiencia en evaluación de documentos históricos. La guía de anotaciones definía clases de documento, categorías de contexto de idioma, bins de periodo histórico, campos de metadatos-completitud, categorías de entidades nombradas y reglas para seleccionar regiones de evaluación OCR.

Para la evaluación de OCR, los anotadores seleccionaron regiones representativas con texto que incluían encabezados, nombres, fechas, términos institucionales, notas marginales, entradas tabulares y, cuando estaban presentes, áreas de distribución ruidosas. Cuando una página contenía múltiples regiones de texto, la región seleccionada debía ser relevante para la recuperación y debía incluir suficientes caracteres para el cálculo de CER y WER. Los desacuerdos se resolvían primero mediante la discusión entre los dos anotadores principales; Los casos no resueltos fueron resueltos por el investigador en humanidades digitales.

El control de calidad utilizó un subconjunto aleatorio del 12% de registros. El acuerdo entre anotadores para el tipo principal de documento era el kappa de Cohen = 0,86, lo que apoya un acuerdo sustancial. El registro de adjudicación mantuvo las etiquetas original y final, la categoría de desacuerdo y el motivo de la resolución para que los futuros usuarios pudieran auditar definiciones de clase y casos límite.

Preprocesamiento de imagen

Todas las imágenes se procesaban a nivel de registro usando Python 3.11.8 con OpenCV 4.9.0, Pillow 10.3.0 y NumPy 1.26.4. Cada página de entrada se convertía a escala de grises de 8 bits a menos que el color contuviera información semántica, como mapas, carteles, sellos o anotaciones codificadas por colores. La descompresión se estimó utilizando perfiles de proyección y detección de líneas de Hough; El deskewing se aplicaba solo cuando el ángulo absoluto de sesgo superaba los 1,5 grados y estaba limitado a 8,0 grados para evitar distorsiones.

El realce de contraste utilizó ecualización adaptativa de histograma limitada por contraste con clipLimit = 2.0 y tileGridSize = 8 × 8. Un filtro mediano con un núcleo de 3 × 10−23 se aplicó solo cuando la relación estimada de ruido de fondo superaba 0,35. Las imágenes capturadas a 150–299 dpi se remuestreaban a 300 dpi para reconocimiento óptico de caracteres; Las imágenes que ya estaban a 300 dpi o más no se escalaron mejor. No se usó superresolución, restauración generativa ni alucinación de contenido.

Se mantuvieron el filtro, el oscurecimiento de los bordes, la textura desigual del papel, los sellos marginales, la caligrafía, las líneas rayadas y los límites de la mesa a menos que impidieran la selección de regiones OCR. Esta regla preservaba la evidencia archivística mientras estandarizaba suficientemente las entradas de imagen para la OCR y la clasificación reproducibles.

Generación de bases OCR y post-corrección

El OCR de referencia se generó con el OCR de Tesseract 5.3.0. El paquete de idiomas principal se seleccionaba entre el idioma del catálogo y la escritura visible; La decodificación multilingüe se habilitaba cuando el idioma del catálogo y el script de página no coincidían. Las salidas OCR se agrupaban a nivel de registro y se almacenaban con identificadores de página, confianza OCR, coordenadas de la caja delimitadora cuando estaban disponibles y texto en bruto antes de la corrección.

La corrección post-OCR utilizó un procedimiento conservador de tres etapas. Primero, la normalización a nivel de carácter corrigió frecuentes confusiones históricas de reconocimiento, incluyendo ligaduras, sustituciones de s/s largo, puntuación fragmentada y sustituciones dígito-letra. En segundo lugar, la corrección a nivel de token utilizó candidatos por distancia de edición y frecuencia clasificada a partir de un léxico específico del archivo de nombres personales, nombres de lugares, instituciones, términos administrativos y variantes históricas ortográficas. Tercero, las comprobaciones de secuencia basadas en reglas validaron entidades y fechas nombradas frente a la evidencia del contexto y los metadatos.

Los reemplazos de candidatos solo se aceptaban cuando la confianza en la corrección posterior superaba 0,80; Los reemplazos de entidades nombradas requerían una confianza de al menos 0,85. Los candidatos por debajo del umbral se mantuvieron como texto OCR pero fueron señalados para su revisión. La CER se calculó como la distancia de edición de Levenshtein dividida por el número de caracteres en la transcripción de referencia. WER utilizaba la misma fórmula a nivel de token. El recuerdo de entidades nombradas se calculó como entidades de referencia correctamente reconocidas divididas por todas las entidades de referencia en la región de evaluación seleccionada.

Clasificación visual de documentos

El módulo de clasificación visual asignaba cada registro a una de ocho clases de documentos archivísticos: carta manuscrita, libro de contabilidad, mapa, periódico, fotografía con pie de foto, cartel, libro de registro y correspondencia mecanografiada. El tipo de documento previsto se utilizaba como señal de recuperación y filtrado, no como sustituto autorizado del catalogo archivístico.

El modelo se implementó en PyTorch 2.2.2 y torchvision 0.17.2 utilizando una red troncal EfficientNet-B3 preentrenada por ImageNet. Las miniaturas a nivel de registro se redimensionaron a 384 x 384 píxeles. Para reducir las fugas, los registros se dividían por clase de repositorio y documento en conjuntos de entrenamiento, validación y prueba en una proporción de 70:15:15, correspondiente a aproximadamente 1.120, 240 y 240 registros.

El entrenamiento utilizó AdamW con tasa inicial de aprendizaje = 1 × 10-4, decaimiento de peso = 1 × 10−2, tamaño del lote = 16, suavizado de etiquetas = 0,05 y detención temprana cuando la pérdida de validación no mejoraba durante cinco épocas consecutivas. El flipping horizontal se deshabilitó porque los diseños de archivo en espejo no son realistas. La aumentación se limitó a una rotación de -3 grados a +3 grados y una variación de brillo dentro del ±10%.

Los diagnósticos de modelos a nivel de época se resumen en 20 filas de entrenamiento, cada una con pérdida de entrenamiento, pérdida de validación, precisión de entrenamiento, precisión de validación, macro-F1, F1 ponderado, ROC-AUC y PR-AUC.

Flujo de trabajo de enriquecimiento de metadatos

El enriquecimiento de metadatos fue diseñado para mejorar la descubribilidad preservando al mismo tiempo el conservadurismo archivístico. Los valores existentes del catálogo se conservaban salvo que contuvieran una contradicción explícita, como una fecha imposible o un conflicto tipo documento confirmado tanto por OCR como por evidencia visual. Los campos de enriquecimiento de candidatos incluían título normalizado, tipo de documento, fecha aproximada, menciones a instituciones, menciones geográficas, menciones de nombres personales, encabezados temáticos y palabras clave.

La prioridad de la evidencia seguía un orden fijo: (1) metadatos existentes del catálogo, (2) salida corregida del OCR y (3) predicción visual del tipo de documento. Se utilizó la coincidencia controlada de vocabulario para los encabezados de los temas, y la expansión semántica del vecino más cercano con transformadores de oraciones 2.7.0 se utilizó solo cuando la similitud del coseno era al menos 0,72. La normalización de fecha requería una confianza de al menos 0,85 o concordancia entre OCR y metadatos. Cada campo añadido automáticamente conservaba su origen, confianza e identificador de regla.

La completitud de metadatos se definió como el número de campos descriptivos centrales poblados dividido por el número de campos centrales aplicables para ese registro. La coincidencia por encabezado de tema se definió como la presencia de al menos una etiqueta de sujeto de vocabulario controlado apoyada por evidencia de contenido a nivel de registro y considerada relevante para la categoría de consulta.

Construcción del sistema de recuperación

Se construyeron cinco índices de recuperación para aislar las contribuciones de los módulos: indexación de línea base; solo corrección por reconocimiento óptico de caracteres; solo clasificación visual; solo enriquecimiento de metadatos; y la integración multimodal completa. Todos los índices se construyeron en el software de motores de búsqueda listado en la Tabla de Materiales (versión 8.11.1) a nivel de registro. Los parámetros de BM25 se fijaron en k1 = 1,2 y b = 0,75 antes de la evaluación.

El índice base utilizaba metadatos originales y texto OCR de referencia. La condición de TOC sustituyó al OCR basal por un OCR corregido. La condición visual añadió previos tipo documento y aumentos de clasificación según la clase. La condición de metadatos añadió campos descriptivos enriquecidos. La condición multimodal completa combinó OCR corregido, priors visuales y metadatos enriquecidos. Los pesos de campo se fijaron antes de la prueba: título normalizado = 3,0, encabezados de materia = 2,5, menciones de personas e instituciones = 2,2, menciones de lugar = 2,0, tipo de documento = 1,8, texto del cuerpo del OCR corregido = 1,0 y texto del cuerpo del OCR de referencia = 0,8, cuando corresponda.

Se habilitó la coincidencia exacta de frases para consultas citadas. La expansión de consultas solo se permitía en condiciones de enriquecimiento de metadatos y multimodal completo, y se limitaba a sinónimos aceptados de vocabulario controlado y variantes de encabezado temático. Los registros de búsqueda se generaron del 25 al 28 de agosto de 2025 en el entorno Linux contenedor listado en la Tabla de Materiales, con semillas fijas y configuraciones de índice congeladas.

Diseño de consultas y medidas de resultados

Las 420 consultas representaban comportamientos comunes de búsqueda archivística en lugar de indicaciones de benchmark solo con palabras clave. Los temas incluían nombres personales, instituciones, lugares, fechas y intervalos de fechas, ocupaciones, eventos y temas temáticos. Cada consulta se almacenaba con su redacción normalizada, conjunto de registros objetivo, categoría de tema de consulta y puntuación de dificultad.

La dificultad se evaluó antes de la extracción utilizando ambigüedad del objetivo, especificidad léxica y frecuencia esperada de expresión. Las puntuaciones compuestas por debajo de 0,40 se clasificaron como de dificultad baja, de 0,40 a 0,69 como dificultad moderada y de 0,70 o superior como dificultad alta. Los juicios de relevancia se completaban antes de la comparación del sistema y luego se comparaban con la colección finalizada.

Los resultados de la recuperación incluyeron P@10, R@10, nDCG@10, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa. P@10 fue la proporción de los 10 mejores discos considerados relevantes. R@10 fue la proporción de todos los registros relevantes conocidos recuperados en el top 10. nDCG@10 usaba relevancia graduada cuando estaba disponible y relevancia binaria en otros casos. El tiempo hasta el primer resultado relevante se midió desde la presentación de la consulta hasta que apareció el primer registro relevante en la salida clasificada. Una búsqueda exitosa se definió como al menos un resultado relevante entre los 10 primeros registros.

Colección de estadísticas

Todos los análisis se realizaron utilizando las versiones de software que aparecen en la Tabla de Materiales. Los resultados continuos se resumieron como media ± DE cuando se consideraban aproximadamente simétricos y como mediana con rango intercuartílico en caso contrario. Los resultados categóricos se resumieron en conteos y porcentajes.

La normalidad de las diferencias emparejadas se evaluó mediante la prueba de Shapiro-Wilk y los gráficos de distribución. La OCR y los resultados previos/posteriores a los metadatos se compararon con las pruebas T pareadas cuando las diferencias pareadas eran aproximadamente normales y con las pruebas de rango por signos de Wilcoxon en otros casos. El rendimiento de clasificación antes y después del ajuste fino se comparó utilizando la prueba de McNemar sobre etiquetas correctas/incorrectas emparejadas. Los resultados de recuperación con múltiples brazos emparejados se compararon con la prueba de Friedman, seguida de pruebas de Wilcoxon con rango por signos ajustadas por Holm.

Todas las pruebas estadísticas fueron bicolas, y P < 0,05 se consideró estadísticamente significativa. Se estimaron intervalos de confianza utilizando 2.000 remuestreos bootstrap, con la semilla aleatoria fijada en 2025. Los efectos se informaron como diferencias medias, razones de probabilidad emparejadas o tamaños de efecto basados en rangos según el tipo de resultado.

Reproducibilidad, alcance y disponibilidad de recursos

Todos los parámetros de la tubería se fijaron antes de las pruebas de recuperación. Ningún parámetro estaba optimizado en el benchmark de recuperación extendido. Los archivos de configuración, vocabularios controlados, tablas léxicas, plantillas de consultas, mapeos de campos, directrices de anotación, scripts estadísticos y scripts de generación de figuras se mantuvieron en el sistema de control de versiones listado en la Tabla de Materiales con semilla aleatoria 2025.

Para apoyar la validación independiente, el cuaderno de datos fuente incluye una tabla desidentificada de 1.600 registros con 17 variables utilizadas para reconocimiento óptico de caracteres, metadatos y análisis de clasificación visual. Se proporcionan Tablas 1, Tablas 2, Tablas 3, Tablas 4 y Tablas 5, resúmenes de figuras y fuentes, definiciones de consultas de referencia, resúmenes de relevancia y juicio, sustitutos de registros de recuperación, diagnósticos de entrenamiento, categorías léxicas, reglas de mapeo de vocabulario y campos de guía de anotación como tablas o archivos de materiales cargables separados cuando corresponda. Los materiales que no pueden compartirse públicamente debido a las restricciones del repositorio se representan mediante campos de metadatos desidentificados y campos de muestreo reproducibles.

Este protocolo evalúa el descubrimiento orientado a la recuperación más que la veracidad de las afirmaciones históricas. No sustituye la tasación del archivero, la evaluación de procedencia, la revisión de privacidad ni las normas de acceso específicas del repositorio.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La corrección OCR mejoró la transcripción, especialmente en registros manuscritos y tabulares

La corrección por reconocimiento óptico de caracteres mejoró la calidad de la transcripción en las ocho clases de documentos archivísticos (n = 1.600 registros). El WER medio disminuyó de 0,529 ± 0,172 a 0,384 ± 0,123, con un cambio medio por pares de −0,144 (IC 95%, −0,149 a −0,139; Wilcoxon con rango firmado P < 0,001). La CER media disminuyó de 0,377 ± 0,126 a 0,258 ± 0,086, con un cambio medio pareado de −0,119 (IC 95%, −0,123 a −0,116; Wilcoxon firmado - rango P < 0,001). La Tabla 2 muestra que el WER base era más alto para cartas manuscritas, libros mayores y libros de registro, lo que indica que los registros visualmente más complejos también tenían la mayor carga inicial de reconocimiento.

Tras la corrección, la WER disminuyó en todas las clases de documentos. Las mayores reducciones medias de WER emparejados se produjeron en cartas manuscritas (n = 262; −0,200; IC 95%, −0,213 a −0,188), libros mayores (n = 263; −0,195; IC 95%, −0,206 a −0,183) y libros de registro (n = 194; −0,173; IC 95%, −0,187 a −0,160). La CER siguió el mismo patrón, apoyando la interpretación de que el módulo post-corrección beneficiaba principalmente a registros difíciles manuscritos, tabulares y de diseño mixto.

La recuperación de entidades nombradas también mejoró en todos los tipos de documentos, como se muestra en la tabla resumen. Los mayores aumentos se produjeron en cartas manuscritas (0,302–0,440), libros mayores (0,336–0,471) y libros de registro (0,369–0,504). La correspondencia mecanografiada alcanzó el mayor recuerdo de entidades nombradas tras la corrección (0,646), pero su ganancia absoluta fue menor porque el reconocimiento de la línea base ya era más fuerte para esta clase. La Figura 2 resume la relación CER-WER a nivel de registro basal, la asociación entre la intensidad de escritura y el beneficio de corrección, y el cambio posterior a la corrección en la descubribilidad a nivel de registro.

La clasificación visual de documentos mejoró en general, pero las mejoras de rendimiento fueron desiguales entre clases

La clasificación visual de documentos mejoró en general en todo el conjunto de 1.600 registros. La precisión del top-1 aumentó de 0,717 a 0,796 (cambio absoluto, 0,079; McNemar chi al cuadrado = 27,33; P < 0,001), y la confianza media en la predicción aumentó de 0,736 ± 0,131 a 0,800 ± 0,108 (cambio medio por pares, 0,064; IC 95%, 0,057–0,071; test t pareado P < 0,001). Como se muestra en la Tabla 3, siete de las ocho clases mejoraron tras ajustes específicos del archivo, con las mayores mejoras para mapas, carteles, periódicos y libros de registro.

La correspondencia mecanografiada no mejoró sustancialmente tras el ajuste fino (0,796–0,791), lo que sugiere que sus características visuales básicas ya eran estables y que el procedimiento de entrenamiento añadía poca separación adicional de clases para esta categoría.

La Figura 3 resume el rendimiento visual de la clasificación de documentos antes y después del ajuste fino específico del archivo; el cuaderno de datos fuente enumera 20 épocas de pérdida y precisión de tren/validación, junto con resúmenes diagnósticos macro-F1, ponderado-F1, ROC-AUC y PR-AUC.

El enriquecimiento de metadatos mejoró la completitud descriptiva en todos los periodos históricos (n = 1.600 registros). La completitud media aumentó de 0,657 ± 0,125 a 0,907 ± 0,070, con un cambio medio por parejas de 0,250 (IC 95%, 0,243–0,257; Wilcoxon con rango firmado P < 0,001). Como se muestra en la Tabla 4, la completitud de la línea base fue más baja entre 1850 y 1879 y aumentó en periodos posteriores antes del enriquecimiento. La Figura 4 resume la mejora en la completitud de los metadatos, los campos de metadatos recién realizados por tipo de documento y las mejoras en la coincidencia de encabezados de materia a lo largo de los periodos históricos.

Tras el enriquecimiento, la completitud aumentó en todos los periodos históricos: 1850–1879 (n = 281; cambio media, 0,207; IC 95%, 0,191–0,223), 1880–1909 (n = 474; cambio medio, 0,236; IC 95%, 0,223–0,248), 1910–1939 (n = 549; cambio media, 0,277; IC 95%, 0,265–0,288) y 1940–1969 (n = 296; cambio media, 0,263; IC 95%, 0,247–0,279). El número medio de campos poblados también aumentó de forma constante a lo largo de los periodos.

La coincidencia por títulos de asignatura mejoró en paralelo. Las tasas de emparejamiento base oscilaron entre el 64,3% y el 69,4%, mientras que las tasas de emparejamiento postenriquecimiento oscilaron entre el 82,1% y el 85,4%. La mayor ganancia absoluta se produjo en el periodo más temprano (Delta = 0,178), lo que respalda el valor del enriquecimiento conservador para registros con descripciones iniciales escasas.

El rendimiento de recuperación mejoró en todos los sistemas mejorados, con las mayores mejoras bajo la integración multimodal completa

La efectividad de la extracción mejoró bajo cada condición de mejora en relación con la línea base, pero la magnitud de la mejora varió según el brazo del sistema (n = 420 consultas de referencia emparejadas). Los resultados generales de la recuperación se listan en la Tabla 5. El rendimiento inicial fue bajo: P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, tiempo medio hasta el primer resultado relevante = 156,079 s, y tasa de búsqueda exitosa = 5,0% (21/420; IC 95%, 3,3%–7,5%). La Figura 5 resume el rendimiento de recuperación en los cinco brazos del sistema experimental, incluyendo métricas generales de recuperación, tasas de éxito a nivel de tema y estratos de consulta y dificultad.

Los tres sistemas monocomponentes superaron la línea base en conjunto. La corrección por reconocimiento óptico de caracteres aumentó P@10 a 0,484, R@10 a 0,346 y nDCG@10 a 0,475, mientras que redujo el tiempo hasta el primer resultado relevante a 124,261 s y aumentó la tasa de búsqueda exitosa al 30,2% (127/420; IC 95%, 26,0%–34,8%). La clasificación visual produjo P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, tiempo medio hasta el primer resultado relevante = 131,985 s, y tasa de búsqueda exitosa = 22,9% (96/420; IC 95%, 19,1%–27,1%). El enriquecimiento de metadatos logró el mejor rendimiento de recuperación en un solo componente, con P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, tiempo medio hasta el primer resultado relevante = 117,474 s, y una tasa de búsqueda exitosa del 38,3% (161/420; IC 95%, 33,8%–43,1%).

El sistema multimodal completo funcionó mejor en todos los puntos finales de recuperación. P@10 aumentó de 0,394 en la línea inicial a 0,624, R@10 de 0,238 a 0,492 y nDCG@10 de 0,392 a 0,634. El tiempo medio hasta el primer resultado relevante disminuyó de 156,079 s a 58,485 s, y la tasa de búsqueda exitosa aumentó del 5,0% al 95,5% (401/420; IC 95%, 93,0%–97,1%). Estos valores corresponden a ganancias absolutas de 0,230 para P@10, 0,254 para R@10 y 0,242 para nDCG@10.

La recuperación específica por tema también mejoró con la integración multimodal completa. Las tasas de búsqueda exitosa aumentaron entre personas, instituciones, lugares, ocupaciones, eventos y temas temáticos, siendo la categoría ocupacional la que mostró la mayor mejora práctica, ya que su tasa base de éxito fue del 0,0% y subió al 90,0% bajo la condición multimodal completa. Las consultas por nombres de lugar tenían el rendimiento base más fuerte, pero aún así se beneficiaban de la integración multimodal.

Las ganancias multimodales variaron según los estratos de documentos, épocas y lenguas

Los análisis de subgrupos mostraron que las ganancias multimodales se distribuyeron ampliamente entre tipos de documentos, periodos históricos y contextos lingüísticos, aunque la magnitud de la mejora varió. Esta heterogeneidad indica que el flujo de trabajo debe evaluarse dentro de cada colección objetivo en lugar de asumir que produce ganancias uniformes. La Figura 6 muestra la heterogeneidad de las ganancias de recuperación multimodal según el tipo de documento objetivo, el periodo histórico y el contexto lingüístico.

A nivel de tipo documento, nDCG@10 mejorado en todas las clases objetivo. Las fotografías con pies de foto, cartas manuscritas, mapas, libros de contabilidad y libros de registro mostraron fuertes avances, mientras que los periódicos y la correspondencia mecanografiada mejoraron de forma más modesta. Estos patrones sugieren que los registros con metadatos iniciales débiles o estructura visual compleja se benefician más de la combinación de señales de texto, imagen y metadatos.

A nivel histórico, R@10 aumentó de 0,175 a 0,429 para 1850–1879 y alcanzó 0,506 para 1880–1909, 0,501 para 1910–1939 y 0,519 para 1940–1969 bajo la integración multimodal completa. Las ganancias fueron similares en escala absoluta entre periodos, lo que sugiere que el enriquecimiento y el reconocimiento corregido ayudaron tanto a los primeros registros dispersos como a los registros posteriores con metadatos base más ricos.

Los resultados del contexto del lenguaje mostraron un patrón similar. P@10 bajo la condición multimodal completa alcanzó 0,607 para discos mixtos en escritura latina, 0,628 para inglés, 0,618 para francés, 0,661 para alemán y 0,639 para portugués y español. La mayor ganancia de precisión se produjo en registros mixtos de escritura latina, que tenían la precisión base más débil.

Patrones a nivel de componente: contribuciones complementarias en lugar de redundantes

En conjunto, los resultados muestran que los componentes del protocolo son complementarios y no redundantes. La corrección OCR mejoró la reconocibilidad del texto, la clasificación visual añadió señales de tipo documento conscientes de la estructura y el enriquecimiento de metadatos amplió la capa descriptiva buscable. La condición multimodal completa produjo las ganancias de recuperación más fuertes y consistentes, apoyando el objetivo del estudio de probar un flujo de trabajo auditable orientado a la recuperación para archivos digitales heterogéneos.

Estos hallazgos apoyan un modelo de protocolo en el que la inteligencia artificial multimodal mejora la búsqueda archivística mientras preserva la necesidad de gobernanza de repositorios, procedencia de datos y validación experta.

DISPONIBILIDAD DE DATOS:

El conjunto de datos de 1.600 registros desidentificados utilizado para los análisis principales está disponible en Zenodo como data.xlsx (https://doi.org/10.5281/zenodo.20774456).

figure-results-1
Figura 1: Flujo de trabajo reproducible para descubrimiento archivístico multimodal. (A) Construcción de corpus a partir de registros archivísticos a nivel de repositorio con cribado de inclusión/exclusión (inclusion/exclusion). (B) Etiquetado de referencias y control de calidad, incluyendo tipo de documento, regiones de referencia OCR, contexto lingüístico, periodo histórico y completitud de los metadatos. (C) Preprocesamiento de imágenes, generación y postcorrección de OCR, clasificación visual de documentos y enriquecimiento conservador de metadatos. (D) Construcción de índices, evaluación de recuperación de cinco brazos, análisis estadístico y empaquetado de recursos. Abreviaturas: OCR, reconocimiento óptico de caracteres; CER, tasa de error de carácter; WER, tasa de error de palabras. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-2
Figura 2: Estructura de errores de reconocimiento óptico de caracteres a nivel de registro y descubribilidad tras la postcorrección. (A) Referencia base de la CER frente a la referencia de la línea de referencia en 1.600 registros de archivo, coloreados por tipo de documento para las clases representativas. (B) Asociación entre la intensidad escalada de la escritura a mano y el cambio en la WER tras la corrección; valores negativos indican un WER más bajo tras la corrección. La línea ajustada y la banda gris muestran la tendencia lineal y el intervalo de confianza del 95%. (C) Puntuación de descubribilidad a nivel de registro antes y después de la corrección por tipo de documento, ilustrando los cambios posteriores a la corrección en la evidencia buscable. Abreviaturas: CER, tasa de error de caracteres; WER, tasa de error de palabras. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-3
Figura 3: Clasificación visual de documentos antes y después del ajuste fino específico del archivo. (A) Precisión Top 1 por tipo de documento en la línea base y después del ajuste fino. (B) Distribuciones de confianza para predicciones correctas e incorrectas bajo condiciones de línea base y post-ajuste. (C) Matriz de rendimiento a nivel de clase que resume la precisión del top 1 y la confianza media posterior antes y después de la afinación. Los datos diagnósticos del modelo incluyen 20 épocas de curvas de pérdida/precisión, macro-F1, ponderado-F1, ROC-AUC y PR-AUC. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-4
Figura 4: Completitud de los metadatos y coincidencia de encabezado tras el enriquecimiento conservador. (A) Completitud de los metadatos a nivel de registro antes y después del enriquecimiento. (B) Campos de metadatos recién realizados por tipo de documento. (C) Ganancia en la partida por cabeza de tema a lo largo de los periodos históricos. La completitud se calculó dividido como el número de campos núcleo aplicables poblados por el número total de campos núcleo aplicables. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-5
Figura 5: Rendimiento de recuperación en los cinco brazos del sistema experimental. (A) P@10, R@10, nDCG@10 global, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa para la línea base, corrección por reconocimiento óptico de caracteres, clasificación visual, enriquecimiento de metadatos e integración multimodal completa. (B) Gráfico de burbujas de la tasa de búsqueda exitosa por tema de consulta y brazo del sistema; El color indica el brazo del sistema, y el tamaño de la burbuja indica el porcentaje de éxito. (C) P@10, R@10 y nDCG@10 en los estratos de dificultad fácil, moderada y difícil de consulta. (D) Vista alternativa de tasa de éxito a nivel de tema que muestra la distribución de búsquedas exitosas entre temas de consulta y brazos del sistema. Abreviaturas: P@10, precisión en 10; R@10, llamada a las 10; nDCG@10, ganancia acumulada descontada normalizada en 10. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

figure-results-6
Figura 6: Heterogeneidad de las ganancias de recuperación multimodal entre subgrupos archivísticos. (A) nDCG@10 por tipo de documento objetivo y condición de recuperación. (B) R@10 por periodo histórico y condición de recuperación. (C) P@10 según el contexto del idioma objetivo y la condición de recuperación. Las condiciones son: Línea Base, corrección OCR, clasificación visual, enriquecimiento de metadatos, integración multimodal completa, OCR+Texto, Texto+Visual+Metadatos y Visual+Metadatos. La figura destaca que las ganancias multimodales son generalizadas pero no uniformes en los estratos de documentos, periodos y lenguajes. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Tipo de documentoN récordsPáginas medianasRegistros manuscritosLínea base media
WER
Línea base media
Metadatos
Completitud
Línea base media
Descubribilidad
(%)
Carta manuscrita2622950.7290.64868.2
Libro mayor263763.50.6790.67472.2
Mapa10212.90.4570.55274.1
Periódico26180.80.4950.6675.5
Fotografía con pie de foto17911.10.3740.60173.6
Cartel87100.4130.57174.8
Libro de registro19410180.6160.70371.3
Correspondencia mecanografiada252340.3150.68976.4

Tabla 1: Características de la colección archivística por tipo de documento. La tabla informa sobre el número de registros, el número medio de páginas, el porcentaje de registros que contienen escritura manuscrita, la media de la línea base de los WER, la integridad media de los metadatos de la línea base y la puntuación media de descubribilidad de la línea base para cada una de las ocho clases de documentos.

Tipo de documentoTamaño de la muestraCERCERWERWEREntidad nombrada
Revocación
Entidad nombrada
Revocación
ΔWER
(n)(Línea base)(Publicación)(Línea base)(Publicación)(Línea base)(Publicación)
Carta manuscrita2620.5310.3630.7290.5310.3020.44−0,198
Libro mayor2630.490.3260.6790.4850.3360.471−0,194
Mapa1020.3220.2280.4570.3470.380.503−0.11
Periódico2610.3540.2560.4950.3810.4360.558−0,114
Fotografía con pie de foto1790.2570.1810.3740.2860.4940.616−0,088
Cartel870.2870.1990.4130.3160.4480.57−0,097
Libro de registro1940.4420.2930.6160.4390.3690.504−0,177
Correspondencia mecanografiada2520.2190.1550.3150.2320.5240.646−.083

Tabla 2: Rendimiento del OCR antes y después de la corrección posterior por tipo de documento. CER y WER se calcularon contra transcripciones de referencia; La retirada de entidades nombradas se calculaba contra entidades de persona, lugar, institución y fecha etiquetadas manualmente. Delta WER es WER post-corrección menos WER basal.

Tipo de documentonPrecisión,
Línea base
Precisión,
Publicación
Confianza,
Línea base
Confianza,
Publicación
ΔAccuracy
Carta manuscrita2620.6150.6450.6160.6550.03
Libro mayor2630.7070.7490.7250.7670.042
Mapa1020.7650.9020.8010.8990.137
Periódico2610.7160.8430.7280.830.127
Fotografía con pie de foto1790.8150.8690.8240.890.054
Cartel870.7710.9030.7920.8890.132
Libro de registro1940.6870.7930.7010.7870.106
Correspondencia mecanografiada2520.7960.7910.8040.82-0.005

Tabla 3: Rendimiento de la clasificación visual de documentos antes y después del ajuste fino específico del archivo. La tabla informa sobre el tamaño de la muestra, la precisión del top 1, la confianza media posterior y el cambio en la precisión según el tipo de documento. Los datos diagnósticos incluyen 20 filas a nivel de época con macro-F1, F1 ponderado, ROC-AUC, PR-AUC, pérdida de entrenamiento, pérdida de validación, precisión de entrenamiento y precisión de validación.

CompletitudCompletitudCampos pobladosCampos pobladosTítulo del tema
Partido
Título del tema
Partido
Δ CompletitudΔ Encabezado de materia
Partido
(Línea base)(Publicación)(Línea base)(Publicación)(Línea base)(Publicación)
0.5340.8684.2748.5840.6430.8210.3340.178
0.6070.8984.8388.7090.6720.8410.2910.169
0.680.9275.4269.0950.6860.8490.2470.163
0.6860.9225.488.9530.6940.8540.2360.16

Tabla 4: Enriquecimiento de metadatos por periodo histórico. La completitud es la proporción de campos descriptivos centrales aplicables que se rellenan para un registro; los campos poblados se reportan como conteos medios; La coincidencia por encabezado de tema indica si la evidencia a nivel de registro apoyó al menos una etiqueta de sujeto con vocabulario controlado.

Brazo del sisteman consultasP@10R@10nDCG@10Hora de empezar lo relevante
resultado(s)
Tasa de búsqueda exitosa
(%)
Línea base4200.3940.2380.392156.0795
Corrección OCR4200.4840.3460.475124.26130.2
Clasificación visual4200.490.3020.478131.98522.9
Enriquecimiento de metadatos4200.5070.3470.513117.47438.3
Multimodal completo4200.6240.4920.63458.48595.5

Tabla 5: Rendimiento de recuperación para los cinco brazos del sistema experimental. Se calcularon P@10, R@10, nDCG@10, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa en el benchmark de 420 consultas bajo condiciones de consulta emparejada.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo demuestra que el descubrimiento en archivos digitales históricos mejoró principalmente cuando la corrección OCR, la comprensión visual de documentos y el enriquecimiento conservador de metadatos se evaluaron como componentes de recuperación conectados en lugar de como actualizaciones técnicas aisladas. Los mayores avances en OCR se produjeron en materiales manuscritos, tabulares y de registro, lo que respalda el valor de la corrección posterior para las clases de documentos donde el reconocimiento de línea base es más débil. Al mismo tiempo, el error residual tras la corrección muestra que la limpieza de OCR no puede tratarse como transcripción definitiva y debe seguir siendo auditable.

Los resultados de la clasificación visual también requieren una interpretación cuidadosa. El ajuste fino mejoró clases visualmente distintivas como mapas, carteles, periódicos y libros de registro, pero los avances fueron menores para cartas manuscritas y libros mayores, donde los diseños se solapan y los límites de las clases son menos separables visualmente. El tamaño relativamente pequeño del corpus significa que el rendimiento en la clasificación debe interpretarse como evidencia de protocolo en lugar de prueba de que un modelo multimodal de producción puede entrenarse solo a partir de 1.600 registros. La validación futura debería comparar EfficientNet-B3 con transformadores de documentos, transformadores de visión, transformadores Swin, ConvNeXt y modelos multimodales de fundacióndocumental 8,11,12,13,14,15,16,17,18.

El enriquecimiento de metadatos contribuyó significativamente a la recuperación al expandir los registros descriptivos dispersos a campos buscables, manteniendo la información de fuente y confianza. Este hallazgo es coherente con la necesidad archivística de puntos de acceso más ricos, pero también genera riesgos de gobernanza. El enriquecimiento automatizado puede amplificar errores de OCR, normalizar nombres históricamente ambiguos de forma demasiado agresiva o introducir sesgos si los vocabularios controlados son incompletos. Por esa razón, el flujo de trabajo utiliza umbrales de confianza, registro de código fuente y banderas de revisión en lugar de reemplazar completamente los registros de catálogo.

La evaluación de recuperación proporciona evidencia de efectos complementarios en los módulos, pero tiene limitaciones. La presente comparación utilizó condiciones de ablación de módulo base e internas; no se comparó con recuperación densa, clasificadores de interacción tardía como ColBERT, recuperación híbrida dispersa-densa, reclasificación neuronal o sistemas de generación aumentada porrecuperación 22,23,24. Estos enfoques deberían añadirse en futuros trabajos para determinar si las ganancias multimodales observadas siguen siendo competitivas frente a las arquitecturas de recuperación actuales.

La implementación también requiere atención a la fuga de datos, las limitaciones computacionales y la escalabilidad. El enriquecimiento utilizaba salidas de reconocimiento óptico de caracteres, predicciones visuales y metadatos existentes, por lo que la división de entrenamiento/validación/prueba y evaluación de consultas deben mantenerse separadas de las decisiones de enriquecimiento. Los despliegues futuros deben informar hardware, tiempo de ejecución, uso de memoria, tamaño índice y coste por cada 1.000 registros. Los enfoques de restauración de imágenes a partir de trabajos adyacentes de visión por ordenador, incluyendo modelos de eliminación de oclusión a múltiples escalas y basados en atención, pueden inspirar futuros experimentos de preprocesamiento, pero deben probarse cuidadosamente porque los flujos de trabajo archivísticos no deben alucinar ni alterar el contenidoprobatorio 26,27.

En general, el flujo de trabajo se entiende mejor como un protocolo de acceso reproducible en lugar de un sustituto de la descripción archivística. La inteligencia artificial multimodal puede mejorar el descubrimiento cuando sus resultados están restringidos, registrados y revisados, pero los archiveros siguen siendo esenciales para la evaluación de procedencia, decisiones de acceso y gobernanza e interpretación de registros históricamentecomplejos 21,25.

CONCLUSIONES:
Este estudio comprobó si la corrección por reconocimiento óptico de caracteres, la clasificación visual de documentos y el enriquecimiento conservador de metadatos pueden servir como componentes complementarios de recuperación en archivos digitales históricos. El protocolo mejoró la transcripción, clasificación, integridad de los metadatos y rendimiento agregado de recuperación, manteniendo umbrales explícitos, registro de fuentes y salvaguardas de revisión humana. Por tanto, el flujo de trabajo debe utilizarse como un protocolo auditable de soporte de acceso, no como sustituto del juicio archivero o la gobernanza del repositorio.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen nada que revelar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen sinceramente a los dos experimentados miembros del personal archivístico y al investigador profesional en humanidades digitales por su valiosa ayuda con la anotación de texto y el control de calidad. Esta investigación fue financiada por el Plan de Proyecto de Ciencia y Tecnología de los Archivos Provinciales de Jiangsu (Subvención nº 2024-9) para la construcción de un sistema inteligente de archivos orales basados en el habla, y el Plan Provincial de Desarrollo Científico y Tecnológico de Jiangsu para la Medicina Tradicional China (Subvención No. MS2025025) para estudiar la herencia y el desarrollo de las escuelas de MTC desde una perspectiva archivística.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow scripting, data processing, optical character recognition post-correction, and statistical support
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Análisis estadístico y generación de figuras finales
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractGeneración de reconocimiento óptico de caracteres base
Tesseract language packsTesseract OCR ProjectPaquetes de idioma específicos del estudio; https://github.com/tesseract-ocr/tessdataDecodificación de reconocimiento óptico de caracteres principal y mixto
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Desviación, estimación de ruido y preprocesamiento de imágenes
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Entrada/salida de imágenes y normalización de formato
NumPyNumPy developersv1.26.4; https://numpy.org/Cálculo de matrices para procesamiento de imágenes y métricas
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Manejo de datos tabulares y exportaciones de resumen
SciPySciPy developersv1.13.1; https://scipy.org/Pruebas estadísticas y utilidades numéricas
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Modelado estadístico y soporte de comparación emparejada
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Métricas de clasificación, diagnósticos ROC/PR y utilidades de validación
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzClasificación de candidatos por distancia de edición para corrección de reconocimiento óptico de caracteres
spaCyExplosion AIv3.7.4; https://spacy.io/Procesamiento de entidades nombradas con tablas de lexicón personalizadas
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Entrenamiento de clasificador de documentos visuales
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/Implementación EfficientNet-B3 y transformaciones de imágenes
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlBackbone de clasificación de documentos visuales
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Expansión semántica para candidatos de vocabulario controlado
Search-engine softwareElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchIndexación, recuperación y clasificación BM25
Container engineDocker Inc.Docker v26.1.1; https://www.docker.com/Entorno de recuperación en contenedores
Linux operating systemCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Entorno operativo fijo para ejecuciones de recuperación
Version-control systemGit projectGit v2.44.0; https://git-scm.com/Control de versiones para configuración, vocabularios, scripts y código de figuras
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/Renderizado de figuras basado en R
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Visualización complementaria y gráficos de garantía de calidad
Annotation guidelineAuthors5 secciones de anotación; 8 etiquetas de clase de documento; regiones OCR; etiquetas de entidad; juicios de relevancia; reglas de adjudicaciónDefiniciones para clases de documentos, regiones OCR, entidades, juicios de relevancia y adjudicación
Archive-specific OCR lexiconAuthors6 categorías de lexicón: variantes de personas, nombres de lugares, nombres de instituciones, patrones de fechas, términos administrativos, abreviaturasNombres, lugares, instituciones, términos administrativos y variantes ortográficas
Controlled vocabulary mappingAuthors / archival repositories5 reglas de mapeo que vinculan entidades OCR, clase visual, palabras clave del título, cobertura de fechas y tema de consulta a campos de metadatosCoincidencia de encabezados de temas y expansión semántica
Benchmark query setAuthors420 consultas de punto de referencia; 6 temas de consulta; 3 niveles de dificultad; 8 clases de documentos objetivo; 4 períodos históricos; 6 contextos lingüísticosPunto de referencia de recuperación coincidente en cinco brazos del sistema
Relevance judgmentsAuthors / annotators2,100 filas de consulta-sistema; 420 consultas x 5 brazos del sistema; totales relevantes, conteos relevantes en top-10, relevancia graduada y banderas de éxitoSuplente de verdad para P@10, R@10, nDCG@10 y tasa de búsqueda exitosa
Training diagnosticsAuthors20 épocas; pérdida de entrenamiento; pérdida de validación; precisión de entrenamiento; precisión de validación; macro-F1; F1 ponderado; ROC-AUC; PR-AUCResúmenes de diagnóstico del modelo a nivel de época
Computational hardwareAuthors8 núcleos de CPU; 32 GB de RAM; entorno de entrenamiento de clase GPU de NVIDIADetalle de recursos de reproducibilidad para la presentación de JoVE
Dataset fileAuthorsdata.xlsx; 1,600 registros; 17 variables; DOI listado en el manuscrito Disponibilidad de datosDatos de origen a nivel de registro para análisis de reconocimiento óptico de caracteres, integridad de metadatos, capacidad de descubrimiento y clasificación visual

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Ingenier aN mero 234N mero 234Valor Vac oN meroArchivos DigitalesIA Multimodalcorrecci n de OCREnriquecimiento de MetadatosClasificaci n Visual y consulta de registros hist ricos

Artículos relacionados