Este estudio utilizó registros archivísticos digitalizados y consultas simuladas de recuperación como unidades de análisis. Los repositorios archivísticos pueden restringir el acceso a registros sensibles o culturalmente restringidos. Sigue las normas de acceso al repositorio, los procedimientos institucionales de seguridad de datos y los requisitos de desidentificación antes de procesar o compartir cualquier registro. No se generó ningún residuo de laboratorio peligroso de productos químicos, biológicos, punzantes, radiactivos u otros residuos regulados por este flujo de trabajo.
Diseño del estudio y construcción de corpus
La Figura 1 presenta el flujo de trabajo completo del estudio, incluyendo construcción de corpus, etiquetado de referencias, preprocesamiento de imágenes, generación y postcorrección de OCR, clasificación visual, enriquecimiento de metadatos, construcción de índices, evaluación de recuperación, análisis estadístico y empaquetado de reproducibilidad.
La construcción del corpus se llevó a cabo del 15 de enero al 30 de abril de 2025, seguida del diseño y depuración del sistema del 1 de mayo al 31 de octubre de 2025. El corpus contenía 1.600 archivos digitalizados seleccionados de ocho depósitos que representaban sistemas estatales, municipales, religiosos, museísticos, universitarios y bibliotecarios. El marco de muestreo se estratificaba por clase de repositorio y documento para preservar la heterogeneidad archivística entre cartas manuscritas, libros de contabilidad, mapas, periódicos, fotografías con pies de foto, carteles, libros de registro y correspondencia mecanografiada.
Para cada registro candidato, el registro de selección registraba el identificador del repositorio o colección, identificador del catálogo, clase del documento, periodo histórico aproximado, contexto del idioma dominante, formato de imagen disponible, resolución de imagen, número de páginas y campos descriptivos de referencia. La inclusión requería todo lo siguiente: un identificador estable de catálogo; al menos una imagen de página TIFF, JPEG o PNG; resolución de imagen fuente de al menos 150 dpi; contenido textual, tabular o estructural-documental legible; y asignación a una de las ocho clases de documentos predefinidas. Los criterios de exclusión eran duplicados exactos, páginas en blanco en reverso, imágenes recortadas hasta el punto de que faltaba más del 30% del área con texto y registros considerados ilegibles tras inspección manual.
El benchmark de recuperación contenía 420 consultas cortas en lenguaje natural generadas entre el 5 y el 20 de agosto de 2025. La generación de consultas siguió una plantilla reproducible: las necesidades de información de los candidatos se muestrearon de personas, instituciones, lugares, fechas, ocupaciones, eventos y temas temáticos; cada consulta se normalizaba a 2–9 palabras; y los registros relevantes para el objetivo se identificaron antes de la comparación del sistema. Cada consulta fue evaluada bajo cinco condiciones de recuperación, produciendo 2.100 observaciones de consulta coincidiendo.
Etiquetado de referencia y control de calidad
El etiquetado de referencias se realizó del 1 de mayo al 15 de julio de 2025 por tres anotadores: dos miembros del personal de archivos con experiencia en catalogación descriptiva y un investigador en humanidades digitales con experiencia en evaluación de documentos históricos. La guía de anotaciones definía clases de documento, categorías de contexto de idioma, bins de periodo histórico, campos de metadatos-completitud, categorías de entidades nombradas y reglas para seleccionar regiones de evaluación OCR.
Para la evaluación de OCR, los anotadores seleccionaron regiones representativas con texto que incluían encabezados, nombres, fechas, términos institucionales, notas marginales, entradas tabulares y, cuando estaban presentes, áreas de distribución ruidosas. Cuando una página contenía múltiples regiones de texto, la región seleccionada debía ser relevante para la recuperación y debía incluir suficientes caracteres para el cálculo de CER y WER. Los desacuerdos se resolvían primero mediante la discusión entre los dos anotadores principales; Los casos no resueltos fueron resueltos por el investigador en humanidades digitales.
El control de calidad utilizó un subconjunto aleatorio del 12% de registros. El acuerdo entre anotadores para el tipo principal de documento era el kappa de Cohen = 0,86, lo que apoya un acuerdo sustancial. El registro de adjudicación mantuvo las etiquetas original y final, la categoría de desacuerdo y el motivo de la resolución para que los futuros usuarios pudieran auditar definiciones de clase y casos límite.
Preprocesamiento de imagen
Todas las imágenes se procesaban a nivel de registro usando Python 3.11.8 con OpenCV 4.9.0, Pillow 10.3.0 y NumPy 1.26.4. Cada página de entrada se convertía a escala de grises de 8 bits a menos que el color contuviera información semántica, como mapas, carteles, sellos o anotaciones codificadas por colores. La descompresión se estimó utilizando perfiles de proyección y detección de líneas de Hough; El deskewing se aplicaba solo cuando el ángulo absoluto de sesgo superaba los 1,5 grados y estaba limitado a 8,0 grados para evitar distorsiones.
El realce de contraste utilizó ecualización adaptativa de histograma limitada por contraste con clipLimit = 2.0 y tileGridSize = 8 × 8. Un filtro mediano con un núcleo de 3 × 10−23 se aplicó solo cuando la relación estimada de ruido de fondo superaba 0,35. Las imágenes capturadas a 150–299 dpi se remuestreaban a 300 dpi para reconocimiento óptico de caracteres; Las imágenes que ya estaban a 300 dpi o más no se escalaron mejor. No se usó superresolución, restauración generativa ni alucinación de contenido.
Se mantuvieron el filtro, el oscurecimiento de los bordes, la textura desigual del papel, los sellos marginales, la caligrafía, las líneas rayadas y los límites de la mesa a menos que impidieran la selección de regiones OCR. Esta regla preservaba la evidencia archivística mientras estandarizaba suficientemente las entradas de imagen para la OCR y la clasificación reproducibles.
Generación de bases OCR y post-corrección
El OCR de referencia se generó con el OCR de Tesseract 5.3.0. El paquete de idiomas principal se seleccionaba entre el idioma del catálogo y la escritura visible; La decodificación multilingüe se habilitaba cuando el idioma del catálogo y el script de página no coincidían. Las salidas OCR se agrupaban a nivel de registro y se almacenaban con identificadores de página, confianza OCR, coordenadas de la caja delimitadora cuando estaban disponibles y texto en bruto antes de la corrección.
La corrección post-OCR utilizó un procedimiento conservador de tres etapas. Primero, la normalización a nivel de carácter corrigió frecuentes confusiones históricas de reconocimiento, incluyendo ligaduras, sustituciones de s/s largo, puntuación fragmentada y sustituciones dígito-letra. En segundo lugar, la corrección a nivel de token utilizó candidatos por distancia de edición y frecuencia clasificada a partir de un léxico específico del archivo de nombres personales, nombres de lugares, instituciones, términos administrativos y variantes históricas ortográficas. Tercero, las comprobaciones de secuencia basadas en reglas validaron entidades y fechas nombradas frente a la evidencia del contexto y los metadatos.
Los reemplazos de candidatos solo se aceptaban cuando la confianza en la corrección posterior superaba 0,80; Los reemplazos de entidades nombradas requerían una confianza de al menos 0,85. Los candidatos por debajo del umbral se mantuvieron como texto OCR pero fueron señalados para su revisión. La CER se calculó como la distancia de edición de Levenshtein dividida por el número de caracteres en la transcripción de referencia. WER utilizaba la misma fórmula a nivel de token. El recuerdo de entidades nombradas se calculó como entidades de referencia correctamente reconocidas divididas por todas las entidades de referencia en la región de evaluación seleccionada.
Clasificación visual de documentos
El módulo de clasificación visual asignaba cada registro a una de ocho clases de documentos archivísticos: carta manuscrita, libro de contabilidad, mapa, periódico, fotografía con pie de foto, cartel, libro de registro y correspondencia mecanografiada. El tipo de documento previsto se utilizaba como señal de recuperación y filtrado, no como sustituto autorizado del catalogo archivístico.
El modelo se implementó en PyTorch 2.2.2 y torchvision 0.17.2 utilizando una red troncal EfficientNet-B3 preentrenada por ImageNet. Las miniaturas a nivel de registro se redimensionaron a 384 x 384 píxeles. Para reducir las fugas, los registros se dividían por clase de repositorio y documento en conjuntos de entrenamiento, validación y prueba en una proporción de 70:15:15, correspondiente a aproximadamente 1.120, 240 y 240 registros.
El entrenamiento utilizó AdamW con tasa inicial de aprendizaje = 1 × 10-4, decaimiento de peso = 1 × 10−2, tamaño del lote = 16, suavizado de etiquetas = 0,05 y detención temprana cuando la pérdida de validación no mejoraba durante cinco épocas consecutivas. El flipping horizontal se deshabilitó porque los diseños de archivo en espejo no son realistas. La aumentación se limitó a una rotación de -3 grados a +3 grados y una variación de brillo dentro del ±10%.
Los diagnósticos de modelos a nivel de época se resumen en 20 filas de entrenamiento, cada una con pérdida de entrenamiento, pérdida de validación, precisión de entrenamiento, precisión de validación, macro-F1, F1 ponderado, ROC-AUC y PR-AUC.
Flujo de trabajo de enriquecimiento de metadatos
El enriquecimiento de metadatos fue diseñado para mejorar la descubribilidad preservando al mismo tiempo el conservadurismo archivístico. Los valores existentes del catálogo se conservaban salvo que contuvieran una contradicción explícita, como una fecha imposible o un conflicto tipo documento confirmado tanto por OCR como por evidencia visual. Los campos de enriquecimiento de candidatos incluían título normalizado, tipo de documento, fecha aproximada, menciones a instituciones, menciones geográficas, menciones de nombres personales, encabezados temáticos y palabras clave.
La prioridad de la evidencia seguía un orden fijo: (1) metadatos existentes del catálogo, (2) salida corregida del OCR y (3) predicción visual del tipo de documento. Se utilizó la coincidencia controlada de vocabulario para los encabezados de los temas, y la expansión semántica del vecino más cercano con transformadores de oraciones 2.7.0 se utilizó solo cuando la similitud del coseno era al menos 0,72. La normalización de fecha requería una confianza de al menos 0,85 o concordancia entre OCR y metadatos. Cada campo añadido automáticamente conservaba su origen, confianza e identificador de regla.
La completitud de metadatos se definió como el número de campos descriptivos centrales poblados dividido por el número de campos centrales aplicables para ese registro. La coincidencia por encabezado de tema se definió como la presencia de al menos una etiqueta de sujeto de vocabulario controlado apoyada por evidencia de contenido a nivel de registro y considerada relevante para la categoría de consulta.
Construcción del sistema de recuperación
Se construyeron cinco índices de recuperación para aislar las contribuciones de los módulos: indexación de línea base; solo corrección por reconocimiento óptico de caracteres; solo clasificación visual; solo enriquecimiento de metadatos; y la integración multimodal completa. Todos los índices se construyeron en el software de motores de búsqueda listado en la Tabla de Materiales (versión 8.11.1) a nivel de registro. Los parámetros de BM25 se fijaron en k1 = 1,2 y b = 0,75 antes de la evaluación.
El índice base utilizaba metadatos originales y texto OCR de referencia. La condición de TOC sustituyó al OCR basal por un OCR corregido. La condición visual añadió previos tipo documento y aumentos de clasificación según la clase. La condición de metadatos añadió campos descriptivos enriquecidos. La condición multimodal completa combinó OCR corregido, priors visuales y metadatos enriquecidos. Los pesos de campo se fijaron antes de la prueba: título normalizado = 3,0, encabezados de materia = 2,5, menciones de personas e instituciones = 2,2, menciones de lugar = 2,0, tipo de documento = 1,8, texto del cuerpo del OCR corregido = 1,0 y texto del cuerpo del OCR de referencia = 0,8, cuando corresponda.
Se habilitó la coincidencia exacta de frases para consultas citadas. La expansión de consultas solo se permitía en condiciones de enriquecimiento de metadatos y multimodal completo, y se limitaba a sinónimos aceptados de vocabulario controlado y variantes de encabezado temático. Los registros de búsqueda se generaron del 25 al 28 de agosto de 2025 en el entorno Linux contenedor listado en la Tabla de Materiales, con semillas fijas y configuraciones de índice congeladas.
Diseño de consultas y medidas de resultados
Las 420 consultas representaban comportamientos comunes de búsqueda archivística en lugar de indicaciones de benchmark solo con palabras clave. Los temas incluían nombres personales, instituciones, lugares, fechas y intervalos de fechas, ocupaciones, eventos y temas temáticos. Cada consulta se almacenaba con su redacción normalizada, conjunto de registros objetivo, categoría de tema de consulta y puntuación de dificultad.
La dificultad se evaluó antes de la extracción utilizando ambigüedad del objetivo, especificidad léxica y frecuencia esperada de expresión. Las puntuaciones compuestas por debajo de 0,40 se clasificaron como de dificultad baja, de 0,40 a 0,69 como dificultad moderada y de 0,70 o superior como dificultad alta. Los juicios de relevancia se completaban antes de la comparación del sistema y luego se comparaban con la colección finalizada.
Los resultados de la recuperación incluyeron P@10, R@10, nDCG@10, tiempo hasta el primer resultado relevante y tasa de búsqueda exitosa. P@10 fue la proporción de los 10 mejores discos considerados relevantes. R@10 fue la proporción de todos los registros relevantes conocidos recuperados en el top 10. nDCG@10 usaba relevancia graduada cuando estaba disponible y relevancia binaria en otros casos. El tiempo hasta el primer resultado relevante se midió desde la presentación de la consulta hasta que apareció el primer registro relevante en la salida clasificada. Una búsqueda exitosa se definió como al menos un resultado relevante entre los 10 primeros registros.
Colección de estadísticas
Todos los análisis se realizaron utilizando las versiones de software que aparecen en la Tabla de Materiales. Los resultados continuos se resumieron como media ± DE cuando se consideraban aproximadamente simétricos y como mediana con rango intercuartílico en caso contrario. Los resultados categóricos se resumieron en conteos y porcentajes.
La normalidad de las diferencias emparejadas se evaluó mediante la prueba de Shapiro-Wilk y los gráficos de distribución. La OCR y los resultados previos/posteriores a los metadatos se compararon con las pruebas T pareadas cuando las diferencias pareadas eran aproximadamente normales y con las pruebas de rango por signos de Wilcoxon en otros casos. El rendimiento de clasificación antes y después del ajuste fino se comparó utilizando la prueba de McNemar sobre etiquetas correctas/incorrectas emparejadas. Los resultados de recuperación con múltiples brazos emparejados se compararon con la prueba de Friedman, seguida de pruebas de Wilcoxon con rango por signos ajustadas por Holm.
Todas las pruebas estadísticas fueron bicolas, y P < 0,05 se consideró estadísticamente significativa. Se estimaron intervalos de confianza utilizando 2.000 remuestreos bootstrap, con la semilla aleatoria fijada en 2025. Los efectos se informaron como diferencias medias, razones de probabilidad emparejadas o tamaños de efecto basados en rangos según el tipo de resultado.
Reproducibilidad, alcance y disponibilidad de recursos
Todos los parámetros de la tubería se fijaron antes de las pruebas de recuperación. Ningún parámetro estaba optimizado en el benchmark de recuperación extendido. Los archivos de configuración, vocabularios controlados, tablas léxicas, plantillas de consultas, mapeos de campos, directrices de anotación, scripts estadísticos y scripts de generación de figuras se mantuvieron en el sistema de control de versiones listado en la Tabla de Materiales con semilla aleatoria 2025.
Para apoyar la validación independiente, el cuaderno de datos fuente incluye una tabla desidentificada de 1.600 registros con 17 variables utilizadas para reconocimiento óptico de caracteres, metadatos y análisis de clasificación visual. Se proporcionan Tablas 1, Tablas 2, Tablas 3, Tablas 4 y Tablas 5, resúmenes de figuras y fuentes, definiciones de consultas de referencia, resúmenes de relevancia y juicio, sustitutos de registros de recuperación, diagnósticos de entrenamiento, categorías léxicas, reglas de mapeo de vocabulario y campos de guía de anotación como tablas o archivos de materiales cargables separados cuando corresponda. Los materiales que no pueden compartirse públicamente debido a las restricciones del repositorio se representan mediante campos de metadatos desidentificados y campos de muestreo reproducibles.
Este protocolo evalúa el descubrimiento orientado a la recuperación más que la veracidad de las afirmaciones históricas. No sustituye la tasación del archivero, la evaluación de procedencia, la revisión de privacidad ni las normas de acceso específicas del repositorio.