Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Flux de travail d’intelligence artificielle multimodale reproductible pour la découverte d’archives numériques historiques

71 vues

DOI :

10.3791/71698

7 août 2026

Dans cet article

Résumé

Ici, nous présentons un protocole pour améliorer la découverte dans les archives numériques historiques en intégrant la reconnaissance optique de caractères post-correction, la classification visuelle des documents, l’enrichissement des métadonnées et l’évaluation de la récupération dans un flux de travail auditable.

Résumé

Les archives numériques historiques sont de plus en plus consultables, mais la découverte reste limitée lorsque les erreurs de reconnaissance optique de caractères, les types de documents visuellement hétérogènes et les métadonnées clairsemées sont traitées séparément. Cette étude visait à développer un protocole reproductible pour évaluer si un flux de travail conservateur d’intelligence artificielle multimodale peut améliorer la récupération archivistique sans remplacer la revue par l’archiviste. Un corpus de 1 600 archives numérisées issues de huit classes de documents a été assemblé, et un benchmark de 420 requêtes a été utilisé pour comparer cinq conditions de récupération : indexation de base, correction par reconnaissance optique de caractères seule, classification visuelle seule, enrichissement des métadonnées seul et intégration multimodale complète. Les résultats au niveau des enregistrements comprenaient le taux d’erreur de caractère (CER), le taux d’erreur de mot (WER), le rappel d’entités nommées, la précision de classification par type de document, la confiance dans la prédiction, la complétude des métadonnées et la correspondance par titre de sujet. Les résultats au niveau de la requête comprenaient P@10, R@10, nDCG@10, le temps jusqu’au premier résultat pertinent et le taux de réussite de recherche. La correction par reconnaissance optique de caractères a fortement réduit la WER pour les lettres manuscrites, les registres et les registres ; l’ajustement visuel a amélioré la précision de la classification, surtout pour les cartes, affiches, journaux et registres ; et l’enrichissement des métadonnées a accru la complétude à travers toutes les périodes historiques. La condition multimodale complète a atteint la performance de récupération la plus élevée (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) et a réduit le temps moyen jusqu’au premier résultat pertinent de 156,079 s à 58,485 s. Ces résultats permettent un flux de travail modulaire et auditable dans lequel texte, image et signaux descriptifs sont combinés sous des seuils explicites et une revue humaine.

Introduction

Les archives numériques se sont rapidement développées et soutiennent désormais la recherche en histoire, patrimoine culturel, administration publique et humanités numériques. Cependant, l’accès reste inégal car les archives combinent souvent une sortie de reconnaissance optique de caractères dégradée, des mises en page visuellement diverses, des pratiques de catalogage incohérentes et des noms, lieux et institutions historiquement variables. Ces limitations affectent non seulement la qualité de la transcription, mais aussi la récupération, le filtrage et la réutilisation en aval des collectionsnumérisées 1,2,3,4,5,6,7.

Les études existantes sur l’intelligence artificielle documentaire et la récupération d’archives ont amélioré des composants individuels tels que la reconnaissance optique des caractères post-correction, la classification des images de documents, la normalisation des métadonnées, la modélisation thématique, les embeddings de mots, la récupération neuronale et la pratique de gouvernancedes données 8,9,10,11,12,13,14,15.16, 17, 18, 19, 20, 21, 22, 23, 24, 25. Pourtant, de nombreux systèmes d’archivage évaluent encore ces composants séparément, ce qui rend difficile de déterminer si un flux de travail combiné améliore la découverte dans des conditions de recherche réalistes. La lacune méthodologique abordée ici est l’absence d’un protocole reproductible et auditable qui relie les modules texte, image et métadonnées aux résultats de récupération dans un seul flux de travail d’archivage.

L’objectif central était de tester si la correction par reconnaissance optique des caractères, la classification visuelle des documents et l’enrichissement des métadonnées contraints par des règles produisaient des améliorations complémentaires lorsqu’elles sont évaluées par rapport au même benchmark de récupération.

Nous avons émis l’hypothèse que la condition multimodale complète surpasserait chaque condition à composant unique, car la découverte archivistique dépend de l’interaction entre un texte lisible, une structure de document visuellement interprétable et des métadonnées descriptives recherchées. Le flux de travail était conçu de manière conservatrice : les sorties automatisées pouvaient enrichir les indices de récupération, mais les prédictions à faible confiance étaient signalées pour examen plutôt que d’être utilisées comme description archivistique autoritaire.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Cette étude a utilisé des archives numérisées et des requêtes de récupération simulées comme unités d’analyse. Les dépôts d’archives peuvent restreindre l’accès à des documents sensibles ou culturellement restreints. Suivez les règles d’accès au dépôt, les procédures institutionnelles de sécurité des données et les exigences de désidentification avant de traiter ou partager des enregistrements. Aucun produit chimique, biologique, tranchant, radioactif ou autre déchet de laboratoire réglementé n’a été généré par ce flux de travail numérique.

Conception de l’étude et construction du corpus

La figure 1 présente le flux de travail complet de l’étude, incluant la construction des corpus, l’étiquetage de référence, le prétraitement d’image, la génération et la post-correction OCR, la classification visuelle, l’enrichissement des métadonnées, la construction d’index, l’évaluation de la récupération, l’analyse statistique et l’emballage de la reproductibilité.

La construction du corpus a été réalisée du 15 janvier au 30 avril 2025, suivie de la conception et du débogage du système du 1er mai au 31 octobre 2025. Le corpus contenait 1 600 archives numérisées sélectionnées parmi huit dépôts représentant les systèmes d’État, de ville, religieux, muséaux, universitaires et bibliothèques. Le cadre d’échantillonnage était stratifié par dépôt et classe de document afin de préserver l’hétérogénéité archivistique entre lettres manuscrites, registres, cartes, journaux, photographies avec légendes, affiches, registres et correspondance dactylographiée.

Pour chaque dossier candidat, le journal de sélection enregistrait l’identifiant du dépôt ou de la collection, l’identifiant du catalogue, la classe de document, la période historique approximative, le contexte de la langue dominante, le format d’image disponible, la résolution de l’image, le nombre de pages et les champs descriptifs de référence. L’inclusion nécessitait tout ce qui suit : un identifiant de catalogue stable ; au moins une image de page TIFF, JPEG ou PNG ; résolution d’image source d’au moins 150 dpi ; contenu textuel, tabulaire ou structurel documentaire lisible ; et l’affectation à l’une des huit classes de documents prédéfinies. Les critères d’exclusion étaient des doublons exacts, des pages blanches au verso, des images recadrées au point que plus de 30 % de la zone contenant le texte manquait, et des archives jugées illisibles après inspection manuelle.

Le benchmark de récupération contenait 420 requêtes courtes en langage naturel générées entre le 5 et le 20 août 2025. La génération de requêtes suivait un modèle reproductible : les besoins d’information des candidats étaient échantillonnés auprès des personnes, institutions, lieux, périodes de date, professions, événements et thèmes thématiques ; chaque requête était normalisée à 2 à 9 mots ; et les enregistrements pertinents à la cible ont été identifiés avant la comparaison du système. Chaque requête a été évaluée sous cinq conditions de récupération, produisant 2 100 observations correspondantes requête-condition.

Étiquetage de référence et contrôle qualité

L’étiquetage des références a été effectué du 1er mai au 15 juillet 2025 par trois annotateurs : deux membres du personnel d’archives expérimentés en catalogage descriptif et un chercheur en humanités numériques expérimenté en évaluation de documents historiques. Le guide d’annotation définissait les classes de documents, les catégories contextuels linguistiques, les bins à périodes historiques, les champs de complétude des métadonnées, les catégories d’entités nommées et les règles pour sélectionner les régions d’évaluation OCR.

Pour l’évaluation OCR, les annotateurs ont sélectionné des régions représentatives contenant du texte comprenant des titres, des noms, des dates, des termes institutionnels, des notes marginales, des entrées tabulaires et, lorsque présentes, des zones de mise en page bruyantes. Lorsqu’une page contenait plusieurs régions de texte, la région sélectionnée devait être pertinente pour la récupération et inclure suffisamment de caractères pour le calcul CER et WER. Les désaccords ont d’abord été résolus par des discussions entre les deux annotateurs principaux ; Les affaires non résolues ont été jugées par le chercheur en humanités numériques.

Le contrôle qualité utilisait un sous-ensemble aléatoire de 12 % de registres. L’accord inter-annotateurs pour le type principal de document était le kappa de Cohen = 0,86, soutenant un accord substantiel. Le journal d’adjudication conservait les labels originaux et finaux, la catégorie de désaccord, ainsi que la raison de la résolution afin que les futurs utilisateurs puissent auditer les définitions de classes et les cas limites.

Prétraitement d’image

Toutes les images étaient traitées au niveau des enregistrements en utilisant Python 3.11.8 avec OpenCV 4.9.0, Pillow 10.3.0 et NumPy 1.26.4. Chaque page d’entrée était convertie en niveaux de gris 8 bits, sauf si la couleur comportait des informations sémantiques, telles que des cartes, des affiches, des timbres ou des annotations codées par couleur. L’écart était estimé à l’aide de profils de projection et de détection de raies de Hough ; Le dégât de déformation n’était appliqué que lorsque l’angle absolu de déviation dépassait 1,5 degré et était plafonné à 8,0 degrés pour éviter la distorsion.

L’amélioration du contraste utilisait une égalisation adaptative d’histogramme limitée par contraste avec clipLimit = 2.0 et tileGridSize = 8 × 8. Un filtre médian avec un grain de 3 × 10−23 n’était appliqué que lorsque le rapport bruit de fond estimé dépassait 0,35. Les images capturées à 150–299 dpi ont été rééchantillonnées à 300 dpi pour la reconnaissance optique des caractères ; Les images déjà à 300 dpi ou plus n’ont pas été mises à l’échelle. Aucune super-résolution, restauration générative ou hallucination de contenu n’a été utilisée.

Le bleed-through, l’assombrissement des bords, la texture inégale du papier, les tampons marginaux, l’écriture manuscrite, les lignes rayées et les limites de table étaient conservés sauf s’ils empêchaient la sélection des régions OCR. Cette règle préservait les preuves d’archives tout en standardisant suffisamment les entrées d’images pour permettre la reconnaissance et la classification reproductibles.

Génération de base OCR et post-correction

L’OCR de base était généré avec l’OCR Tesseract 5.3.0. Le pack de langues primaire était sélectionné à partir de la langue du catalogue et de l’écriture visible ; Le décodage multilingue était activé lorsque la langue du catalogue et le script de page ne correspondaient pas. Les sorties OCR étaient regroupées au niveau de l’enregistrement et stockées avec les identifiants de page, la confiance OCR, les coordonnées de la boîte englobante lorsque disponibles, et le texte brut avant correction.

La correction post-OCR a utilisé une procédure conservatrice en trois étapes. Premièrement, la normalisation au niveau des caractères a corrigé les confusions historiques fréquentes de reconnaissance, notamment les ligatures, les substitutions long-s/short-s, la ponctuation fragmentée et les substitutions chiffre-lettres. Deuxièmement, la correction au niveau des jetons utilisait des candidats classés par distance d’édition et fréquence à partir d’un lexique spécifique à l’archive comprenant des noms personnels, noms de lieux, institutions, termes administratifs et variantes orthographiques historiques. Troisièmement, les vérifications de séquence basées sur des règles validaient les entités nommées et les dates par rapport aux preuves issues du contexte et des métadonnées.

Les remplacements candidats n’étaient acceptés que lorsque la confiance en la correction postérieure dépassait 0,80 ; Les remplacements d’entités nommées nécessitaient une confiance d’au moins 0,85. Les candidats en dessous du seuil ont été conservés comme texte OCR mais signalés pour examen. La CER a été calculée comme la distance d’édition de Levenshtein divisée par le nombre de caractères dans la transcription de référence. WER utilisait la même formule au niveau des jetons. Le rappel des entités nommées a été calculé comme des entités de référence correctement reconnues divisées par toutes les entités de référence dans la région d’évaluation sélectionnée.

Classification visuelle des documents

Le module de classification visuelle assignait chaque enregistrement à l’une des huit classes de documents d’archives : lettre manuscrite, registre, carte, journal, photographie avec légende, affiche, registre et correspondance dactylographiée. Le type de document prédit était utilisé comme signal de récupération et de filtrage, et non comme un remplacement autoritaire du catalogage archivistique.

Le modèle a été implémenté dans PyTorch 2.2.2 et Torchvision 0.17.2 en utilisant un réseau dorsale EfficientNet-B3 pré-entraîné par ImageNet. Les vignettes au niveau de l’enregistrement ont été redimensionnées à 384 x 384 pixels. Pour réduire les fuites, les enregistrements ont été divisés par dépôt et classe de document en ensembles d’entraînement, de validation et de test avec un ratio de 70:15:15, correspondant à environ 1 120, 240 et 240 enregistrements.

L’entraînement a utilisé AdamW avec un taux d’apprentissage initial = 1 × 10-4, une décroissance du poids = 1 × 10−2, une taille du lot = 16, un lissage d’étiquette = 0,05, et un arrêt précoce lorsque la perte de validation ne s’améliorait pas pendant cinq époques consécutives. Le basculement horizontal a été désactivé car les mises en page d’archives miroir ne sont pas réalistes. L’augmentation était limitée à une rotation de -3 degrés à +3 degrés et une variation de luminosité de ±10 %.

Les diagnostics du modèle au niveau d’époque sont résumés en 20 lignes d’entraînement, chacune contenant la perte d’entraînement, la perte de validation, la précision de l’entraînement, la précision de validation, le macro-F1, le F1 pondéré, le ROC-AUC et le PR-AUC.

Flux de travail d’enrichissement des métadonnées

L’enrichissement des métadonnées visait à améliorer la découverte tout en préservant le conservatisme archivistique. Les valeurs existantes du catalogue étaient conservées sauf si elles contenaient une contradiction explicite, comme une date impossible ou un conflit de type document confirmé à la fois par l’OCR et des preuves visuelles. Les champs d’enrichissement des candidats comprenaient le titre normalisé, le type de document, la date approximative, les mentions d’institutions, les mentions géographiques, les mentions de noms personnels, les titres de matières et les mots-clés.

La priorité des preuves suivait un ordre fixe : (1) métadonnées existantes du catalogue, (2) la correction de la sortie OCR, et (3) la prédiction visuelle du type de document. Un appariement contrôlé de vocabulaire était utilisé pour les titres de sujets, et l’expansion sémantique du plus proche voisin avec les transformateurs de phrases 2.7.0 n’était utilisée que lorsque la similarité cosinus était d’au moins 0,72. La normalisation de la date nécessitait une confiance d’au moins 0,85 ou une concordance entre l’OCR et les métadonnées. Chaque champ ajouté automatiquement conservait sa source, sa confiance et son identifiant de règle.

La complétude des métadonnées était définie comme le nombre de champs descriptifs de noyau peuplés divisé par le nombre de champs de référence applicables pour cet enregistrement. La correspondance par titre de sujet a été définie comme la présence d’au moins une étiquette sujette à vocabulaire contrôlé, soutenue par des preuves de contenu au niveau des enregistrements et jugée pertinente pour la catégorie de requête.

Construction du système de récupération

Cinq indices de récupération ont été construits pour isoler les contributions des modules : indexation de base ; correction de reconnaissance optique de caractères uniquement ; classification visuelle uniquement ; enrichissement des métadonnées uniquement ; et une intégration multimodale complète. Tous les indices ont été construits dans le logiciel moteur de recherche indiqué dans le tableau des matériaux (version 8.11.1) au niveau des enregistrements. Les paramètres de BM25 étaient fixés à k1 = 1,2 et b = 0,75 avant évaluation.

L’index de référence utilisait les métadonnées originales et le texte OCR de base. La condition OCR a remplacé la OCR de base par la correction OCR. L’état visuel a ajouté des priors de type document et des améliorations de classement en fonction des classes. La condition des métadonnées ajoutait des champs descriptifs enrichis. La condition multimodale complète combinait la correction de la ROC, les priors visuels et des métadonnées enrichies. Les poids des champs étaient fixés avant le test : titre normalisé = 3,0, titres sujets = 2,5, mentions de personnes et d’institutions = 2,2, mentions de lieux = 2,0, type de document = 1,8, texte du corps OCR corrigé = 1,0, et texte du corps OCR de base = 0,8, le cas échéant.

La correspondance exacte des phrases était activée pour les requêtes citées. L’expansion des requêtes n’était autorisée que dans les conditions d’enrichissement des métadonnées et de multimodalité complète, et était limitée aux synonymes acceptés de vocabulaire contrôlé et aux variantes de titres thématiques. Les journaux de recherche ont été générés du 25 au 28 août 2025 dans l’environnement Linux conteneurisé listé dans le Table of Materials, avec des graines fixes et des configurations d’index figées.

Conception de requêtes et mesures de résultats

Les 420 requêtes représentaient des comportements courants de recherche archivée plutôt que des requêtes de benchmark basées uniquement sur des mots-clés. Les sujets abordés comprenaient les noms personnels, les institutions, les lieux, les dates et plages de dates, les professions, les événements et les sujets thématiques. Chaque requête était stockée avec sa formulation normalisée, son ensemble d’enregistrements cibles, sa catégorie sujet-requête et son score de difficulté.

La difficulté a été notée avant la récupération en utilisant l’ambiguïté de la cible, la spécificité lexicale et la fréquence d’expression attendue. Les scores composites inférieurs à 0,40 étaient classés comme de faible difficulté, de 0,40 à 0,69 comme de difficulté modérée, et de 0,70 ou plus comme de difficulté élevée. Les jugements de pertinence étaient réalisés avant la comparaison du système puis vérifiés par rapport à la collection finalisée.

Les résultats de la récupération comprenaient P@10, R@10, nDCG@10, le temps jusqu’au premier résultat pertinent et le taux de recherche réussie. P@10 était la proportion des dix meilleurs disques jugés pertinents. R@10 était la proportion de tous les documents connus et pertinents récupérés dans le top 10. nDCG@10 utilise la pertinence graduée lorsque c’est possible et la pertinence binaire autrement. Le temps jusqu’au premier résultat pertinent a été mesuré depuis la soumission de la requête jusqu’à l’apparition du premier enregistrement pertinent dans la sortie classée. Une recherche réussie était définie comme au moins un résultat pertinent parmi les 10 premiers enregistrements.

Collecte de statistiques

Toutes les analyses ont été réalisées à l’aide des versions logicielles listées dans le tableau des matériaux. Les résultats continus ont été résumés en moyenne ± écartage lorsqu’ils étaient approximativement symétriques et en médiane avec une plage interquartile autrement. Les résultats catégoriels ont été résumés en comptages et pourcentages.

La normalité des différences par paires a été évaluée par le test de Shapiro-Wilk et les graphiques de distribution. L’OCR et les résultats pré/post-données ont été comparés aux tests T appariés lorsque les différences par paires étaient approximativement normales et les tests Wilcoxon signaient le rang autrement. La performance de classification avant et après l’ajustement fin a été comparée à l’aide du test de McNemar sur des étiquettes correctes/incorrectes appariées. Les résultats de récupération multi-bras appariés ont été comparés au test de Friedman, suivis par des tests de Wilcoxon par signes ajustés par Holm.

Tous les tests statistiques étaient à deux queues, et P < 0,05 était considéré comme statistiquement significatif. Les intervalles de confiance ont été estimés à l’aide de 2 000 rééchantillonnages bootstrap, la graine aléatoire étant fixée à 2025. Les effets ont été rapportés sous forme de différences moyennes, de rapports de cotes appariés ou de tailles d’effet basées sur le rang selon le type de critère de jugement.

Reproductibilité, portée et disponibilité des ressources

Tous les paramètres du pipeline étaient fixés avant les tests de récupération. Aucun paramètre n’a été optimisé sur le benchmark de récupération en attente. Les fichiers de configuration, vocabulaires contrôlés, tables lexiques, modèles de requêtes, mappages de champs, directives d’annotage, scripts statistiques et scripts de génération de figures étaient maintenus dans le système de contrôle de versions listé dans le Table of Materials avec seed aléatoire 2025.

Pour soutenir une validation indépendante, le cahier de données sources inclut une table de 1 600 enregistrements dé-identifiés avec 17 variables utilisées pour la reconnaissance optique des caractères, les métadonnées et les analyses de classification visuelle. Les tableaux dérivés 1, 2, 3, 4 et 5, résumés figures-sources, définitions de requêtes de benchmark, résumés de jugement de pertinence, substituts de journaux de récupération, diagnostics d’entraînement, catégories lexiciques, règles de cartographie de vocabulaire et champs de directives d’annotation sont fournis sous forme de tables ou fichiers de matériaux téléchargeables séparés lorsque cela est applicable. Les matériaux qui ne peuvent pas être partagés publiquement en raison des restrictions du dépôt sont représentés par des champs de métadonnées non identifiés et des champs d’échantillonnage reproductibles.

Ce protocole évalue la découverte orientée vers la récupération plutôt que la véracité des affirmations historiques. Elle ne remplace pas l’évaluation par l’archiviste, l’évaluation de provenance, la revue de la vie privée ou les règles d’accès spécifiques au dépôt.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

La correction OCR a amélioré la transcription, notamment dans les enregistrements manuscrits et tabulaires

La correction par reconnaissance optique de caractères a amélioré la qualité de la transcription dans les huit classes de documents d’archivage (n = 1 600 enregistrements). Le WER moyen est passé de 0,529 ± 0,172 à 0,384 ± 0,123, avec une variation moyenne par paires de −0,144 (IC à 95 %, −0,149 à −0,139 ; Wilcoxon signé - rang P...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Ce protocole démontre que la découverte dans les archives numériques historiques s’est le plus améliorée lorsque la correction OCR, la compréhension visuelle des documents et l’enrichissement conservateur des métadonnées étaient évalués comme des composants de récupération connectés plutôt que comme des mises à jour techniques isolées. Les plus grands gains d’OCR ont eu lieu dans les documents manuscrits, tabulaires et de registre, ce qui soutient la valeur de la post-correction pour les...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont rien à divulguer.

Remerciements

Les auteurs remercient sincèrement les deux membres expérimentés du personnel d’archives ainsi que le chercheur professionnel en humanités numériques pour leur précieuse aide en annotation textuelle et contrôle qualité. Cette recherche a été financée par le Plan de Projet Science et Technologie des Archives provinciales du Jiangsu (Grant n° 2024-9) pour la construction d’un système d’archives orales intelligentes basé sur la parole, ainsi que par le Plan provincial de développement des sciences et technologies du Jiangsu pour la médecine traditionnelle chinoise (Grant No. MS2025025) pour étudier l’héritage et le développement des écoles de MTC sous un angle archivistique.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
PythonPython Software Foundationv3.11.8; https://www.python.org/Scripting de flux de travail, traitement des données, post-correction de reconnaissance optique de caractères et support statistique
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Analyse statistique et génération de figures finales
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractGénération de base de reconnaissance optique de caractères
Packs de langue TesseractTesseract OCR ProjectPacks de langue spécifiques à l'étude; https://github.com/tesseract-ocr/tessdataDécodage de reconnaissance optique de caractères primaire et multilingue
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Décroissance, estimation du bruit et prétraitement d'images
PillowContributeurs de la Python Imaging Libraryv10.3.0; https://python-pillow.org/Entrée/sortie d'images et normalisation de format
NumPyDéveloppeurs NumPyv1.26.4; https://numpy.org/Calcul matriciel pour le traitement d'images et de métriques
pandasÉquipe de développement pandasv2.2.2; https://pandas.pydata.org/Gestion des données tabulaires et exportations récapitulatives
SciPyDéveloppeurs SciPyv1.13.1; https://scipy.org/Tests statistiques et utilitaires numériques
statsmodelsDéveloppeurs statsmodelsv0.14.2; https://www.statsmodels.org/Modélisation statistique et support de comparaison couplée
scikit-learnDéveloppeurs scikit-learnv1.4.2; https://scikit-learn.org/Métriques de classification, diagnostics ROC/PR et utilitaires de validation
rapidfuzzMax Bachmann et contributeursv3.9.0; https://github.com/rapidfuzz/RapidFuzzClassement des candidats par distance d'édition pour la correction de reconnaissance optique de caractères
spaCyExplosion AIv3.7.4; https://spacy.io/Traitement des entités nommées avec des tables de lexique personnalisées
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Formation de classificateur de documents visuels
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/Implémentation EfficientNet-B3 et transformations d'images
EfficientNet-B3 backbonePoids préentraînés torchvision / ImageNetEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlBackbone de classification de documents visuels
sentence-transformersUKP Lab / écosystème Hugging Facev2.7.0; https://www.sbert.net/Expansion sémantique pour les candidats de vocabulaire contrôlé
Logiciel de moteur de rechercheElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchIndexation, récupération et classement BM25
Moteur de conteneurDocker Inc.Docker v26.1.1; https://www.docker.com/Environnement de récupération conteneurisé
Système d'exploitation LinuxCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Environnement d'exploitation fixe pour les exécutions de récupération
Système de contrôle de versionProjet GitGit v2.44.0; https://git-scm.com/Contrôle de version pour la configuration, les vocabulaires, les scripts et le code des figures
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/Rendu de figures basé sur R
MatplotlibDéveloppeurs Matplotlibv3.8.4; https://matplotlib.org/Visualisations complémentaires et graphiques d'assurance qualité
Lignes directrices d'annotationAuteurs5 sections d'annotation; 8 étiquettes de classe de document; régions OCR; étiquettes d'entité; jugements de pertinence; règles d'adjudicationDéfinitions pour les classes de documents, les régions OCR, les entités, les jugements de pertinence et l'adjudication
Lexique OCR spécifique à l'archiveAuteurs6 catégories de lexique : variantes de personnes, noms de lieux, noms d'institutions, modèles de dates, termes administratifs, abréviationsNoms, lieux, institutions, termes administratifs et variantes orthographiques
Mappage de vocabulaire contrôléAuteurs / dépôts d'archives5 règles de mappage reliant les entités OCR, la classe visuelle, les mots-clés du titre, la couverture temporelle et le sujet de la requête aux champs de métadonnéesCorrespondance des vedettes-matières et expansion sémantique
Ensemble de requêtes de référenceAuteurs420 requêtes de référence; 6 sujets de requête; 3 niveaux de difficulté; 8 classes de documents cibles; 4 périodes historiques; 6 contextes linguistiquesBanc d'essai de récupération correspondant pour cinq branches du système
Jugements de pertinenceAuteurs / annoteur·rice·s2 100 lignes requête-système; 420 requêtes x 5 branches du système; totaux pertinents, comptes pertinents-dans-le-top-10, pertinence notée et indicateurs de succèsVérité de référence pour P@10, R@10, nDCG@10 et taux de recherche réussie
Diagnostics d'entraînementAuteurs20 époques; perte d'entraînement; perte de validation; précision d'entraînement; précision de validation; macro-F1; F1 pondérée; ROC-AUC; PR-AUCRésumés de diagnostic du modèle au niveau de l'époque
Matériel informatiqueAuteurs8 cœurs de CPU; 32 Go de RAM; environnement de formation de classe GPU NVIDIADétails des ressources de reproductibilité pour la soumission à JoVE
Fichier de donnéesAuteursdata.xlsx; 1 600 enregistrements; 17 variables; DOI listé dans la disponibilité des données du manuscritDonnées sources au niveau des enregistrements pour la reconnaissance optique de caractères, l'exhaustivité des métadonnées, la découvrabilité et les analyses de classification visuelle

Références

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Ing nierieNum ro 234Num ro 234Valeur videNum roArchives num riquesIA multimodalecorrection OCRenrichissement des m tadonn esclassification visuelle et requ te d archives historiques