Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Flujo de trabajo de inteligencia artificial multimodal reproducible para el descubrimiento de archivos digitales históricos

71 visualizaciones

DOI:

10.3791/71698

7 de agosto de 2026

En este artículo

Resumen

Aquí presentamos un protocolo para mejorar el descubrimiento en archivos digitales históricos integrando el reconocimiento óptico de caracteres post-corrección, la clasificación visual de documentos, el enriquecimiento de metadatos y la evaluación de recuperación en un flujo de trabajo auditable.

Resumen

Los archivos digitales históricos son cada vez más consultables, pero el descubrimiento sigue siendo limitado cuando los errores de reconocimiento óptico de caracteres, los tipos de documentos visualmente heterogéneos y los metadatos escasos se manejan por separado. Este estudio tenía como objetivo desarrollar un protocolo reproducible para evaluar si un flujo de trabajo conservador de inteligencia artificial multimodal puede mejorar la recuperación archivística sin sustituir la revisión archivística. Se ensambló un corpus de 1.600 registros archivísticos digitalizados de ocho clases de documentos, y se utilizó un benchmark de 420 consultas para comparar cinco condiciones de recuperación: indexación base, corrección por reconocimiento óptico de caracteres únicamente, clasificación visual única, enriquecimiento de metadatos solo e integración multimodal completa. Los resultados a nivel de registro incluyeron tasa de error de caracteres (CER), tasa de error de palabra (WER), recuperación de entidades nombradas, precisión en la clasificación por tipo de documento, confianza en la predicción, completitud de metadatos y coincidencia por encabezado de tema. Los resultados a nivel de consulta incluyeron P@10, R@10, nDCG@10, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa. La corrección por reconocimiento óptico de caracteres redujo la WER más fuertemente para cartas manuscritas, libros de contabilidad y libros de registro; el ajuste visual mejoró la precisión de la clasificación principalmente para mapas, carteles, periódicos y libros de registro; y el enriquecimiento de metadatos aumentó la completitud a lo largo de todos los periodos históricos. La condición multimodal completa logró el mayor rendimiento de recuperación (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) y redujo el tiempo medio hasta el primer resultado relevante de 156,079 s a 58,485 s. Estos resultados apoyan un flujo de trabajo modular y auditable en el que texto, imagen y señales descriptivas se combinan bajo umbrales explícitos y revisión humana.

Introducción

Los archivos digitales se han expandido rápidamente y ahora apoyan la investigación en historia, patrimonio cultural, administración pública y humanidades digitales. Sin embargo, el acceso sigue siendo desigual porque los registros de archivo suelen combinar una salida degradada de reconocimiento óptico de caracteres, diseños de página visualmente diversos, prácticas de catalogación inconsistentes y nombres, lugares e instituciones históricamente variables. Estas limitaciones afectan no solo a la calidad de la transcripción, sino también a la recuperación, filtrado y reutilización posterior de coleccionesdigitalizadas 1,2,3,4,5,6,7.

Los estudios existentes de inteligencia artificial documental y recuperación de archivos han mejorado componentes individuales como el reconocimiento óptico de caracteres postcorrección, la clasificación de imágenes de documentos, la normalización de metadatos, el modelado temático, las incrustaciones de palabras, la recuperación neuronal y la práctica de gobernanzade datos 8,9,10,11,12,13,14,15. 16,17,18,19,20,21,22,23,24,25. Sin embargo, muchos sistemas de archivo siguen evaluando estos componentes por separado, lo que dificulta determinar si un flujo de trabajo combinado mejora el descubrimiento bajo condiciones de búsqueda realistas. La brecha metodológica abordada aquí es la ausencia de un protocolo reproducible y auditable que conecte módulos de texto, imagen y metadatos con los resultados de recuperación en un único flujo de trabajo archivístico.

El objetivo central era comprobar si la corrección por reconocimiento óptico de caracteres, la clasificación visual de documentos y el enriquecimiento de metadatos con límites de reglas producen mejoras complementarias cuando se evalúan frente al mismo benchmark de recuperación.

Planteamos la hipótesis de que la condición multimodal completa superaría a cada condición de un solo componente porque el descubrimiento archivístico depende de la interacción entre texto legible, estructura de documento visualmente interpretable y metadatos descriptivos buscables. El flujo de trabajo estaba diseñado de forma conservadora: los resultados automatizados podían enriquecer índices de recuperación, pero las predicciones de baja confianza se señalaban para revisión en lugar de usarse como descripción archivística autorizada.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Este estudio utilizó registros archivísticos digitalizados y consultas simuladas de recuperación como unidades de análisis. Los repositorios archivísticos pueden restringir el acceso a registros sensibles o culturalmente restringidos. Sigue las normas de acceso al repositorio, los procedimientos institucionales de seguridad de datos y los requisitos de desidentificación antes de procesar o compartir cualquier registro. No se generó ningún residuo de laboratorio peligroso de productos químicos, biológicos, punzantes, radiactivos u otros residuos regulados por este flujo de trabajo.

Diseño del estudio y construcción de corpus

La Figura 1 presenta el flujo de trabajo completo del estudio, incluyendo construcción de corpus, etiquetado de referencias, preprocesamiento de imágenes, generación y postcorrección de OCR, clasificación visual, enriquecimiento de metadatos, construcción de índices, evaluación de recuperación, análisis estadístico y empaquetado de reproducibilidad.

La construcción del corpus se llevó a cabo del 15 de enero al 30 de abril de 2025, seguida del diseño y depuración del sistema del 1 de mayo al 31 de octubre de 2025. El corpus contenía 1.600 archivos digitalizados seleccionados de ocho depósitos que representaban sistemas estatales, municipales, religiosos, museísticos, universitarios y bibliotecarios. El marco de muestreo se estratificaba por clase de repositorio y documento para preservar la heterogeneidad archivística entre cartas manuscritas, libros de contabilidad, mapas, periódicos, fotografías con pies de foto, carteles, libros de registro y correspondencia mecanografiada.

Para cada registro candidato, el registro de selección registraba el identificador del repositorio o colección, identificador del catálogo, clase del documento, periodo histórico aproximado, contexto del idioma dominante, formato de imagen disponible, resolución de imagen, número de páginas y campos descriptivos de referencia. La inclusión requería todo lo siguiente: un identificador estable de catálogo; al menos una imagen de página TIFF, JPEG o PNG; resolución de imagen fuente de al menos 150 dpi; contenido textual, tabular o estructural-documental legible; y asignación a una de las ocho clases de documentos predefinidas. Los criterios de exclusión eran duplicados exactos, páginas en blanco en reverso, imágenes recortadas hasta el punto de que faltaba más del 30% del área con texto y registros considerados ilegibles tras inspección manual.

El benchmark de recuperación contenía 420 consultas cortas en lenguaje natural generadas entre el 5 y el 20 de agosto de 2025. La generación de consultas siguió una plantilla reproducible: las necesidades de información de los candidatos se muestrearon de personas, instituciones, lugares, fechas, ocupaciones, eventos y temas temáticos; cada consulta se normalizaba a 2–9 palabras; y los registros relevantes para el objetivo se identificaron antes de la comparación del sistema. Cada consulta fue evaluada bajo cinco condiciones de recuperación, produciendo 2.100 observaciones de consulta coincidiendo.

Etiquetado de referencia y control de calidad

El etiquetado de referencias se realizó del 1 de mayo al 15 de julio de 2025 por tres anotadores: dos miembros del personal de archivos con experiencia en catalogación descriptiva y un investigador en humanidades digitales con experiencia en evaluación de documentos históricos. La guía de anotaciones definía clases de documento, categorías de contexto de idioma, bins de periodo histórico, campos de metadatos-completitud, categorías de entidades nombradas y reglas para seleccionar regiones de evaluación OCR.

Para la evaluación de OCR, los anotadores seleccionaron regiones representativas con texto que incluían encabezados, nombres, fechas, términos institucionales, notas marginales, entradas tabulares y, cuando estaban presentes, áreas de distribución ruidosas. Cuando una página contenía múltiples regiones de texto, la región seleccionada debía ser relevante para la recuperación y debía incluir suficientes caracteres para el cálculo de CER y WER. Los desacuerdos se resolvían primero mediante la discusión entre los dos anotadores principales; Los casos no resueltos fueron resueltos por el investigador en humanidades digitales.

El control de calidad utilizó un subconjunto aleatorio del 12% de registros. El acuerdo entre anotadores para el tipo principal de documento era el kappa de Cohen = 0,86, lo que apoya un acuerdo sustancial. El registro de adjudicación mantuvo las etiquetas original y final, la categoría de desacuerdo y el motivo de la resolución para que los futuros usuarios pudieran auditar definiciones de clase y casos límite.

Preprocesamiento de imagen

Todas las imágenes se procesaban a nivel de registro usando Python 3.11.8 con OpenCV 4.9.0, Pillow 10.3.0 y NumPy 1.26.4. Cada página de entrada se convertía a escala de grises de 8 bits a menos que el color contuviera información semántica, como mapas, carteles, sellos o anotaciones codificadas por colores. La descompresión se estimó utilizando perfiles de proyección y detección de líneas de Hough; El deskewing se aplicaba solo cuando el ángulo absoluto de sesgo superaba los 1,5 grados y estaba limitado a 8,0 grados para evitar distorsiones.

El realce de contraste utilizó ecualización adaptativa de histograma limitada por contraste con clipLimit = 2.0 y tileGridSize = 8 × 8. Un filtro mediano con un núcleo de 3 × 10−23 se aplicó solo cuando la relación estimada de ruido de fondo superaba 0,35. Las imágenes capturadas a 150–299 dpi se remuestreaban a 300 dpi para reconocimiento óptico de caracteres; Las imágenes que ya estaban a 300 dpi o más no se escalaron mejor. No se usó superresolución, restauración generativa ni alucinación de contenido.

Se mantuvieron el filtro, el oscurecimiento de los bordes, la textura desigual del papel, los sellos marginales, la caligrafía, las líneas rayadas y los límites de la mesa a menos que impidieran la selección de regiones OCR. Esta regla preservaba la evidencia archivística mientras estandarizaba suficientemente las entradas de imagen para la OCR y la clasificación reproducibles.

Generación de bases OCR y post-corrección

El OCR de referencia se generó con el OCR de Tesseract 5.3.0. El paquete de idiomas principal se seleccionaba entre el idioma del catálogo y la escritura visible; La decodificación multilingüe se habilitaba cuando el idioma del catálogo y el script de página no coincidían. Las salidas OCR se agrupaban a nivel de registro y se almacenaban con identificadores de página, confianza OCR, coordenadas de la caja delimitadora cuando estaban disponibles y texto en bruto antes de la corrección.

La corrección post-OCR utilizó un procedimiento conservador de tres etapas. Primero, la normalización a nivel de carácter corrigió frecuentes confusiones históricas de reconocimiento, incluyendo ligaduras, sustituciones de s/s largo, puntuación fragmentada y sustituciones dígito-letra. En segundo lugar, la corrección a nivel de token utilizó candidatos por distancia de edición y frecuencia clasificada a partir de un léxico específico del archivo de nombres personales, nombres de lugares, instituciones, términos administrativos y variantes históricas ortográficas. Tercero, las comprobaciones de secuencia basadas en reglas validaron entidades y fechas nombradas frente a la evidencia del contexto y los metadatos.

Los reemplazos de candidatos solo se aceptaban cuando la confianza en la corrección posterior superaba 0,80; Los reemplazos de entidades nombradas requerían una confianza de al menos 0,85. Los candidatos por debajo del umbral se mantuvieron como texto OCR pero fueron señalados para su revisión. La CER se calculó como la distancia de edición de Levenshtein dividida por el número de caracteres en la transcripción de referencia. WER utilizaba la misma fórmula a nivel de token. El recuerdo de entidades nombradas se calculó como entidades de referencia correctamente reconocidas divididas por todas las entidades de referencia en la región de evaluación seleccionada.

Clasificación visual de documentos

El módulo de clasificación visual asignaba cada registro a una de ocho clases de documentos archivísticos: carta manuscrita, libro de contabilidad, mapa, periódico, fotografía con pie de foto, cartel, libro de registro y correspondencia mecanografiada. El tipo de documento previsto se utilizaba como señal de recuperación y filtrado, no como sustituto autorizado del catalogo archivístico.

El modelo se implementó en PyTorch 2.2.2 y torchvision 0.17.2 utilizando una red troncal EfficientNet-B3 preentrenada por ImageNet. Las miniaturas a nivel de registro se redimensionaron a 384 x 384 píxeles. Para reducir las fugas, los registros se dividían por clase de repositorio y documento en conjuntos de entrenamiento, validación y prueba en una proporción de 70:15:15, correspondiente a aproximadamente 1.120, 240 y 240 registros.

El entrenamiento utilizó AdamW con tasa inicial de aprendizaje = 1 × 10-4, decaimiento de peso = 1 × 10−2, tamaño del lote = 16, suavizado de etiquetas = 0,05 y detención temprana cuando la pérdida de validación no mejoraba durante cinco épocas consecutivas. El flipping horizontal se deshabilitó porque los diseños de archivo en espejo no son realistas. La aumentación se limitó a una rotación de -3 grados a +3 grados y una variación de brillo dentro del ±10%.

Los diagnósticos de modelos a nivel de época se resumen en 20 filas de entrenamiento, cada una con pérdida de entrenamiento, pérdida de validación, precisión de entrenamiento, precisión de validación, macro-F1, F1 ponderado, ROC-AUC y PR-AUC.

Flujo de trabajo de enriquecimiento de metadatos

El enriquecimiento de metadatos fue diseñado para mejorar la descubribilidad preservando al mismo tiempo el conservadurismo archivístico. Los valores existentes del catálogo se conservaban salvo que contuvieran una contradicción explícita, como una fecha imposible o un conflicto tipo documento confirmado tanto por OCR como por evidencia visual. Los campos de enriquecimiento de candidatos incluían título normalizado, tipo de documento, fecha aproximada, menciones a instituciones, menciones geográficas, menciones de nombres personales, encabezados temáticos y palabras clave.

La prioridad de la evidencia seguía un orden fijo: (1) metadatos existentes del catálogo, (2) salida corregida del OCR y (3) predicción visual del tipo de documento. Se utilizó la coincidencia controlada de vocabulario para los encabezados de los temas, y la expansión semántica del vecino más cercano con transformadores de oraciones 2.7.0 se utilizó solo cuando la similitud del coseno era al menos 0,72. La normalización de fecha requería una confianza de al menos 0,85 o concordancia entre OCR y metadatos. Cada campo añadido automáticamente conservaba su origen, confianza e identificador de regla.

La completitud de metadatos se definió como el número de campos descriptivos centrales poblados dividido por el número de campos centrales aplicables para ese registro. La coincidencia por encabezado de tema se definió como la presencia de al menos una etiqueta de sujeto de vocabulario controlado apoyada por evidencia de contenido a nivel de registro y considerada relevante para la categoría de consulta.

Construcción del sistema de recuperación

Se construyeron cinco índices de recuperación para aislar las contribuciones de los módulos: indexación de línea base; solo corrección por reconocimiento óptico de caracteres; solo clasificación visual; solo enriquecimiento de metadatos; y la integración multimodal completa. Todos los índices se construyeron en el software de motores de búsqueda listado en la Tabla de Materiales (versión 8.11.1) a nivel de registro. Los parámetros de BM25 se fijaron en k1 = 1,2 y b = 0,75 antes de la evaluación.

El índice base utilizaba metadatos originales y texto OCR de referencia. La condición de TOC sustituyó al OCR basal por un OCR corregido. La condición visual añadió previos tipo documento y aumentos de clasificación según la clase. La condición de metadatos añadió campos descriptivos enriquecidos. La condición multimodal completa combinó OCR corregido, priors visuales y metadatos enriquecidos. Los pesos de campo se fijaron antes de la prueba: título normalizado = 3,0, encabezados de materia = 2,5, menciones de personas e instituciones = 2,2, menciones de lugar = 2,0, tipo de documento = 1,8, texto del cuerpo del OCR corregido = 1,0 y texto del cuerpo del OCR de referencia = 0,8, cuando corresponda.

Se habilitó la coincidencia exacta de frases para consultas citadas. La expansión de consultas solo se permitía en condiciones de enriquecimiento de metadatos y multimodal completo, y se limitaba a sinónimos aceptados de vocabulario controlado y variantes de encabezado temático. Los registros de búsqueda se generaron del 25 al 28 de agosto de 2025 en el entorno Linux contenedor listado en la Tabla de Materiales, con semillas fijas y configuraciones de índice congeladas.

Diseño de consultas y medidas de resultados

Las 420 consultas representaban comportamientos comunes de búsqueda archivística en lugar de indicaciones de benchmark solo con palabras clave. Los temas incluían nombres personales, instituciones, lugares, fechas y intervalos de fechas, ocupaciones, eventos y temas temáticos. Cada consulta se almacenaba con su redacción normalizada, conjunto de registros objetivo, categoría de tema de consulta y puntuación de dificultad.

La dificultad se evaluó antes de la extracción utilizando ambigüedad del objetivo, especificidad léxica y frecuencia esperada de expresión. Las puntuaciones compuestas por debajo de 0,40 se clasificaron como de dificultad baja, de 0,40 a 0,69 como dificultad moderada y de 0,70 o superior como dificultad alta. Los juicios de relevancia se completaban antes de la comparación del sistema y luego se comparaban con la colección finalizada.

Los resultados de la recuperación incluyeron P@10, R@10, nDCG@10, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa. P@10 fue la proporción de los 10 mejores discos considerados relevantes. R@10 fue la proporción de todos los registros relevantes conocidos recuperados en el top 10. nDCG@10 usaba relevancia graduada cuando estaba disponible y relevancia binaria en otros casos. El tiempo hasta el primer resultado relevante se midió desde la presentación de la consulta hasta que apareció el primer registro relevante en la salida clasificada. Una búsqueda exitosa se definió como al menos un resultado relevante entre los 10 primeros registros.

Colección de estadísticas

Todos los análisis se realizaron utilizando las versiones de software que aparecen en la Tabla de Materiales. Los resultados continuos se resumieron como media ± DE cuando se consideraban aproximadamente simétricos y como mediana con rango intercuartílico en caso contrario. Los resultados categóricos se resumieron en conteos y porcentajes.

La normalidad de las diferencias emparejadas se evaluó mediante la prueba de Shapiro-Wilk y los gráficos de distribución. La OCR y los resultados previos/posteriores a los metadatos se compararon con las pruebas T pareadas cuando las diferencias pareadas eran aproximadamente normales y con las pruebas de rango por signos de Wilcoxon en otros casos. El rendimiento de clasificación antes y después del ajuste fino se comparó utilizando la prueba de McNemar sobre etiquetas correctas/incorrectas emparejadas. Los resultados de recuperación con múltiples brazos emparejados se compararon con la prueba de Friedman, seguida de pruebas de Wilcoxon con rango por signos ajustadas por Holm.

Todas las pruebas estadísticas fueron bicolas, y P < 0,05 se consideró estadísticamente significativa. Se estimaron intervalos de confianza utilizando 2.000 remuestreos bootstrap, con la semilla aleatoria fijada en 2025. Los efectos se informaron como diferencias medias, razones de probabilidad emparejadas o tamaños de efecto basados en rangos según el tipo de resultado.

Reproducibilidad, alcance y disponibilidad de recursos

Todos los parámetros de la tubería se fijaron antes de las pruebas de recuperación. Ningún parámetro estaba optimizado en el benchmark de recuperación extendido. Los archivos de configuración, vocabularios controlados, tablas léxicas, plantillas de consultas, mapeos de campos, directrices de anotación, scripts estadísticos y scripts de generación de figuras se mantuvieron en el sistema de control de versiones listado en la Tabla de Materiales con semilla aleatoria 2025.

Para apoyar la validación independiente, el cuaderno de datos fuente incluye una tabla desidentificada de 1.600 registros con 17 variables utilizadas para reconocimiento óptico de caracteres, metadatos y análisis de clasificación visual. Se proporcionan Tablas 1, Tablas 2, Tablas 3, Tablas 4 y Tablas 5, resúmenes de figuras y fuentes, definiciones de consultas de referencia, resúmenes de relevancia y juicio, sustitutos de registros de recuperación, diagnósticos de entrenamiento, categorías léxicas, reglas de mapeo de vocabulario y campos de guía de anotación como tablas o archivos de materiales cargables separados cuando corresponda. Los materiales que no pueden compartirse públicamente debido a las restricciones del repositorio se representan mediante campos de metadatos desidentificados y campos de muestreo reproducibles.

Este protocolo evalúa el descubrimiento orientado a la recuperación más que la veracidad de las afirmaciones históricas. No sustituye la tasación del archivero, la evaluación de procedencia, la revisión de privacidad ni las normas de acceso específicas del repositorio.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

La corrección OCR mejoró la transcripción, especialmente en registros manuscritos y tabulares

La corrección por reconocimiento óptico de caracteres mejoró la calidad de la transcripción en las ocho clases de documentos archivísticos (n = 1.600 registros). El WER medio disminuyó de 0,529 ± 0,172 a 0,384 ± 0,123, con un cambio medio por pares de −0,144 (IC 95%, −0,149 a −0,139; Wilcoxon con rango firmado P < 0,001). La CER media disminu...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este protocolo demuestra que el descubrimiento en archivos digitales históricos mejoró principalmente cuando la corrección OCR, la comprensión visual de documentos y el enriquecimiento conservador de metadatos se evaluaron como componentes de recuperación conectados en lugar de como actualizaciones técnicas aisladas. Los mayores avances en OCR se produjeron en materiales manuscritos, tabulares y de registro, lo que respalda el valor de la corrección posterior para las clases de documento...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no tienen nada que revelar.

Agradecimientos

Los autores agradecen sinceramente a los dos experimentados miembros del personal archivístico y al investigador profesional en humanidades digitales por su valiosa ayuda con la anotación de texto y el control de calidad. Esta investigación fue financiada por el Plan de Proyecto de Ciencia y Tecnología de los Archivos Provinciales de Jiangsu (Subvención nº 2024-9) para la construcción de un sistema inteligente de archivos orales basados en el habla, y el Plan Provincial de Desarrollo Científico y Tecnológico de Jiangsu para la Medicina Tradicional China (Subvención No. MS2025025) para estudiar la herencia y el desarrollo de las escuelas de MTC desde una perspectiva archivística.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow scripting, data processing, optical character recognition post-correction, and statistical support
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Análisis estadístico y generación de figuras finales
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractGeneración de reconocimiento óptico de caracteres base
Tesseract language packsTesseract OCR ProjectPaquetes de idioma específicos del estudio; https://github.com/tesseract-ocr/tessdataDecodificación de reconocimiento óptico de caracteres principal y mixto
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Desviación, estimación de ruido y preprocesamiento de imágenes
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Entrada/salida de imágenes y normalización de formato
NumPyNumPy developersv1.26.4; https://numpy.org/Cálculo de matrices para procesamiento de imágenes y métricas
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Manejo de datos tabulares y exportaciones de resumen
SciPySciPy developersv1.13.1; https://scipy.org/Pruebas estadísticas y utilidades numéricas
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Modelado estadístico y soporte de comparación emparejada
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Métricas de clasificación, diagnósticos ROC/PR y utilidades de validación
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzClasificación de candidatos por distancia de edición para corrección de reconocimiento óptico de caracteres
spaCyExplosion AIv3.7.4; https://spacy.io/Procesamiento de entidades nombradas con tablas de lexicón personalizadas
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Entrenamiento de clasificador de documentos visuales
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/Implementación EfficientNet-B3 y transformaciones de imágenes
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlBackbone de clasificación de documentos visuales
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Expansión semántica para candidatos de vocabulario controlado
Search-engine softwareElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchIndexación, recuperación y clasificación BM25
Container engineDocker Inc.Docker v26.1.1; https://www.docker.com/Entorno de recuperación en contenedores
Linux operating systemCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Entorno operativo fijo para ejecuciones de recuperación
Version-control systemGit projectGit v2.44.0; https://git-scm.com/Control de versiones para configuración, vocabularios, scripts y código de figuras
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/Renderizado de figuras basado en R
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Visualización complementaria y gráficos de garantía de calidad
Annotation guidelineAuthors5 secciones de anotación; 8 etiquetas de clase de documento; regiones OCR; etiquetas de entidad; juicios de relevancia; reglas de adjudicaciónDefiniciones para clases de documentos, regiones OCR, entidades, juicios de relevancia y adjudicación
Archive-specific OCR lexiconAuthors6 categorías de lexicón: variantes de personas, nombres de lugares, nombres de instituciones, patrones de fechas, términos administrativos, abreviaturasNombres, lugares, instituciones, términos administrativos y variantes ortográficas
Controlled vocabulary mappingAuthors / archival repositories5 reglas de mapeo que vinculan entidades OCR, clase visual, palabras clave del título, cobertura de fechas y tema de consulta a campos de metadatosCoincidencia de encabezados de temas y expansión semántica
Benchmark query setAuthors420 consultas de punto de referencia; 6 temas de consulta; 3 niveles de dificultad; 8 clases de documentos objetivo; 4 períodos históricos; 6 contextos lingüísticosPunto de referencia de recuperación coincidente en cinco brazos del sistema
Relevance judgmentsAuthors / annotators2,100 filas de consulta-sistema; 420 consultas x 5 brazos del sistema; totales relevantes, conteos relevantes en top-10, relevancia graduada y banderas de éxitoSuplente de verdad para P@10, R@10, nDCG@10 y tasa de búsqueda exitosa
Training diagnosticsAuthors20 épocas; pérdida de entrenamiento; pérdida de validación; precisión de entrenamiento; precisión de validación; macro-F1; F1 ponderado; ROC-AUC; PR-AUCResúmenes de diagnóstico del modelo a nivel de época
Computational hardwareAuthors8 núcleos de CPU; 32 GB de RAM; entorno de entrenamiento de clase GPU de NVIDIADetalle de recursos de reproducibilidad para la presentación de JoVE
Dataset fileAuthorsdata.xlsx; 1,600 registros; 17 variables; DOI listado en el manuscrito Disponibilidad de datosDatos de origen a nivel de registro para análisis de reconocimiento óptico de caracteres, integridad de metadatos, capacidad de descubrimiento y clasificación visual

Referencias

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Ingenier aN mero 234N mero 234Valor Vac oN meroArchivos DigitalesIA Multimodalcorrecci n de OCREnriquecimiento de MetadatosClasificaci n Visual y consulta de registros hist ricos