Article de recherche

Flux de travail d’intelligence artificielle multimodale reproductible pour la découverte d’archives numériques historiques

DOI :

10.3791/71698

7 août 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ici, nous présentons un protocole pour améliorer la découverte dans les archives numériques historiques en intégrant la reconnaissance optique de caractères post-correction, la classification visuelle des documents, l’enrichissement des métadonnées et l’évaluation de la récupération dans un flux de travail auditable.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les archives numériques historiques sont de plus en plus consultables, mais la découverte reste limitée lorsque les erreurs de reconnaissance optique de caractères, les types de documents visuellement hétérogènes et les métadonnées clairsemées sont traitées séparément. Cette étude visait à développer un protocole reproductible pour évaluer si un flux de travail conservateur d’intelligence artificielle multimodale peut améliorer la récupération archivistique sans remplacer la revue par l’archiviste. Un corpus de 1 600 archives numérisées issues de huit classes de documents a été assemblé, et un benchmark de 420 requêtes a été utilisé pour comparer cinq conditions de récupération : indexation de base, correction par reconnaissance optique de caractères seule, classification visuelle seule, enrichissement des métadonnées seul et intégration multimodale complète. Les résultats au niveau des enregistrements comprenaient le taux d’erreur de caractère (CER), le taux d’erreur de mot (WER), le rappel d’entités nommées, la précision de classification par type de document, la confiance dans la prédiction, la complétude des métadonnées et la correspondance par titre de sujet. Les résultats au niveau de la requête comprenaient P@10, R@10, nDCG@10, le temps jusqu’au premier résultat pertinent et le taux de réussite de recherche. La correction par reconnaissance optique de caractères a fortement réduit la WER pour les lettres manuscrites, les registres et les registres ; l’ajustement visuel a amélioré la précision de la classification, surtout pour les cartes, affiches, journaux et registres ; et l’enrichissement des métadonnées a accru la complétude à travers toutes les périodes historiques. La condition multimodale complète a atteint la performance de récupération la plus élevée (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) et a réduit le temps moyen jusqu’au premier résultat pertinent de 156,079 s à 58,485 s. Ces résultats permettent un flux de travail modulaire et auditable dans lequel texte, image et signaux descriptifs sont combinés sous des seuils explicites et une revue humaine.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les archives numériques se sont rapidement développées et soutiennent désormais la recherche en histoire, patrimoine culturel, administration publique et humanités numériques. Cependant, l’accès reste inégal car les archives combinent souvent une sortie de reconnaissance optique de caractères dégradée, des mises en page visuellement diverses, des pratiques de catalogage incohérentes et des noms, lieux et institutions historiquement variables. Ces limitations affectent non seulement la qualité de la transcription, mais aussi la récupération, le filtrage et la réutilisation en aval des collectionsnumérisées 1,2,3,4,5,6,7.

Les études existantes sur l’intelligence artificielle documentaire et la récupération d’archives ont amélioré des composants individuels tels que la reconnaissance optique des caractères post-correction, la classification des images de documents, la normalisation des métadonnées, la modélisation thématique, les embeddings de mots, la récupération neuronale et la pratique de gouvernancedes données 8,9,10,11,12,13,14,15.16, 17, 18, 19, 20, 21, 22, 23, 24, 25. Pourtant, de nombreux systèmes d’archivage évaluent encore ces composants séparément, ce qui rend difficile de déterminer si un flux de travail combiné améliore la découverte dans des conditions de recherche réalistes. La lacune méthodologique abordée ici est l’absence d’un protocole reproductible et auditable qui relie les modules texte, image et métadonnées aux résultats de récupération dans un seul flux de travail d’archivage.

L’objectif central était de tester si la correction par reconnaissance optique des caractères, la classification visuelle des documents et l’enrichissement des métadonnées contraints par des règles produisaient des améliorations complémentaires lorsqu’elles sont évaluées par rapport au même benchmark de récupération.

Nous avons émis l’hypothèse que la condition multimodale complète surpasserait chaque condition à composant unique, car la découverte archivistique dépend de l’interaction entre un texte lisible, une structure de document visuellement interprétable et des métadonnées descriptives recherchées. Le flux de travail était conçu de manière conservatrice : les sorties automatisées pouvaient enrichir les indices de récupération, mais les prédictions à faible confiance étaient signalées pour examen plutôt que d’être utilisées comme description archivistique autoritaire.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a utilisé des archives numérisées et des requêtes de récupération simulées comme unités d’analyse. Les dépôts d’archives peuvent restreindre l’accès à des documents sensibles ou culturellement restreints. Suivez les règles d’accès au dépôt, les procédures institutionnelles de sécurité des données et les exigences de désidentification avant de traiter ou partager des enregistrements. Aucun produit chimique, biologique, tranchant, radioactif ou autre déchet de laboratoire réglementé n’a été généré par ce flux de travail numérique.

Conception de l’étude et construction du corpus

La figure 1 présente le flux de travail complet de l’étude, incluant la construction des corpus, l’étiquetage de référence, le prétraitement d’image, la génération et la post-correction OCR, la classification visuelle, l’enrichissement des métadonnées, la construction d’index, l’évaluation de la récupération, l’analyse statistique et l’emballage de la reproductibilité.

La construction du corpus a été réalisée du 15 janvier au 30 avril 2025, suivie de la conception et du débogage du système du 1er mai au 31 octobre 2025. Le corpus contenait 1 600 archives numérisées sélectionnées parmi huit dépôts représentant les systèmes d’État, de ville, religieux, muséaux, universitaires et bibliothèques. Le cadre d’échantillonnage était stratifié par dépôt et classe de document afin de préserver l’hétérogénéité archivistique entre lettres manuscrites, registres, cartes, journaux, photographies avec légendes, affiches, registres et correspondance dactylographiée.

Pour chaque dossier candidat, le journal de sélection enregistrait l’identifiant du dépôt ou de la collection, l’identifiant du catalogue, la classe de document, la période historique approximative, le contexte de la langue dominante, le format d’image disponible, la résolution de l’image, le nombre de pages et les champs descriptifs de référence. L’inclusion nécessitait tout ce qui suit : un identifiant de catalogue stable ; au moins une image de page TIFF, JPEG ou PNG ; résolution d’image source d’au moins 150 dpi ; contenu textuel, tabulaire ou structurel documentaire lisible ; et l’affectation à l’une des huit classes de documents prédéfinies. Les critères d’exclusion étaient des doublons exacts, des pages blanches au verso, des images recadrées au point que plus de 30 % de la zone contenant le texte manquait, et des archives jugées illisibles après inspection manuelle.

Le benchmark de récupération contenait 420 requêtes courtes en langage naturel générées entre le 5 et le 20 août 2025. La génération de requêtes suivait un modèle reproductible : les besoins d’information des candidats étaient échantillonnés auprès des personnes, institutions, lieux, périodes de date, professions, événements et thèmes thématiques ; chaque requête était normalisée à 2 à 9 mots ; et les enregistrements pertinents à la cible ont été identifiés avant la comparaison du système. Chaque requête a été évaluée sous cinq conditions de récupération, produisant 2 100 observations correspondantes requête-condition.

Étiquetage de référence et contrôle qualité

L’étiquetage des références a été effectué du 1er mai au 15 juillet 2025 par trois annotateurs : deux membres du personnel d’archives expérimentés en catalogage descriptif et un chercheur en humanités numériques expérimenté en évaluation de documents historiques. Le guide d’annotation définissait les classes de documents, les catégories contextuels linguistiques, les bins à périodes historiques, les champs de complétude des métadonnées, les catégories d’entités nommées et les règles pour sélectionner les régions d’évaluation OCR.

Pour l’évaluation OCR, les annotateurs ont sélectionné des régions représentatives contenant du texte comprenant des titres, des noms, des dates, des termes institutionnels, des notes marginales, des entrées tabulaires et, lorsque présentes, des zones de mise en page bruyantes. Lorsqu’une page contenait plusieurs régions de texte, la région sélectionnée devait être pertinente pour la récupération et inclure suffisamment de caractères pour le calcul CER et WER. Les désaccords ont d’abord été résolus par des discussions entre les deux annotateurs principaux ; Les affaires non résolues ont été jugées par le chercheur en humanités numériques.

Le contrôle qualité utilisait un sous-ensemble aléatoire de 12 % de registres. L’accord inter-annotateurs pour le type principal de document était le kappa de Cohen = 0,86, soutenant un accord substantiel. Le journal d’adjudication conservait les labels originaux et finaux, la catégorie de désaccord, ainsi que la raison de la résolution afin que les futurs utilisateurs puissent auditer les définitions de classes et les cas limites.

Prétraitement d’image

Toutes les images étaient traitées au niveau des enregistrements en utilisant Python 3.11.8 avec OpenCV 4.9.0, Pillow 10.3.0 et NumPy 1.26.4. Chaque page d’entrée était convertie en niveaux de gris 8 bits, sauf si la couleur comportait des informations sémantiques, telles que des cartes, des affiches, des timbres ou des annotations codées par couleur. L’écart était estimé à l’aide de profils de projection et de détection de raies de Hough ; Le dégât de déformation n’était appliqué que lorsque l’angle absolu de déviation dépassait 1,5 degré et était plafonné à 8,0 degrés pour éviter la distorsion.

L’amélioration du contraste utilisait une égalisation adaptative d’histogramme limitée par contraste avec clipLimit = 2.0 et tileGridSize = 8 × 8. Un filtre médian avec un grain de 3 × 10−23 n’était appliqué que lorsque le rapport bruit de fond estimé dépassait 0,35. Les images capturées à 150–299 dpi ont été rééchantillonnées à 300 dpi pour la reconnaissance optique des caractères ; Les images déjà à 300 dpi ou plus n’ont pas été mises à l’échelle. Aucune super-résolution, restauration générative ou hallucination de contenu n’a été utilisée.

Le bleed-through, l’assombrissement des bords, la texture inégale du papier, les tampons marginaux, l’écriture manuscrite, les lignes rayées et les limites de table étaient conservés sauf s’ils empêchaient la sélection des régions OCR. Cette règle préservait les preuves d’archives tout en standardisant suffisamment les entrées d’images pour permettre la reconnaissance et la classification reproductibles.

Génération de base OCR et post-correction

L’OCR de base était généré avec l’OCR Tesseract 5.3.0. Le pack de langues primaire était sélectionné à partir de la langue du catalogue et de l’écriture visible ; Le décodage multilingue était activé lorsque la langue du catalogue et le script de page ne correspondaient pas. Les sorties OCR étaient regroupées au niveau de l’enregistrement et stockées avec les identifiants de page, la confiance OCR, les coordonnées de la boîte englobante lorsque disponibles, et le texte brut avant correction.

La correction post-OCR a utilisé une procédure conservatrice en trois étapes. Premièrement, la normalisation au niveau des caractères a corrigé les confusions historiques fréquentes de reconnaissance, notamment les ligatures, les substitutions long-s/short-s, la ponctuation fragmentée et les substitutions chiffre-lettres. Deuxièmement, la correction au niveau des jetons utilisait des candidats classés par distance d’édition et fréquence à partir d’un lexique spécifique à l’archive comprenant des noms personnels, noms de lieux, institutions, termes administratifs et variantes orthographiques historiques. Troisièmement, les vérifications de séquence basées sur des règles validaient les entités nommées et les dates par rapport aux preuves issues du contexte et des métadonnées.

Les remplacements candidats n’étaient acceptés que lorsque la confiance en la correction postérieure dépassait 0,80 ; Les remplacements d’entités nommées nécessitaient une confiance d’au moins 0,85. Les candidats en dessous du seuil ont été conservés comme texte OCR mais signalés pour examen. La CER a été calculée comme la distance d’édition de Levenshtein divisée par le nombre de caractères dans la transcription de référence. WER utilisait la même formule au niveau des jetons. Le rappel des entités nommées a été calculé comme des entités de référence correctement reconnues divisées par toutes les entités de référence dans la région d’évaluation sélectionnée.

Classification visuelle des documents

Le module de classification visuelle assignait chaque enregistrement à l’une des huit classes de documents d’archives : lettre manuscrite, registre, carte, journal, photographie avec légende, affiche, registre et correspondance dactylographiée. Le type de document prédit était utilisé comme signal de récupération et de filtrage, et non comme un remplacement autoritaire du catalogage archivistique.

Le modèle a été implémenté dans PyTorch 2.2.2 et Torchvision 0.17.2 en utilisant un réseau dorsale EfficientNet-B3 pré-entraîné par ImageNet. Les vignettes au niveau de l’enregistrement ont été redimensionnées à 384 x 384 pixels. Pour réduire les fuites, les enregistrements ont été divisés par dépôt et classe de document en ensembles d’entraînement, de validation et de test avec un ratio de 70:15:15, correspondant à environ 1 120, 240 et 240 enregistrements.

L’entraînement a utilisé AdamW avec un taux d’apprentissage initial = 1 × 10-4, une décroissance du poids = 1 × 10−2, une taille du lot = 16, un lissage d’étiquette = 0,05, et un arrêt précoce lorsque la perte de validation ne s’améliorait pas pendant cinq époques consécutives. Le basculement horizontal a été désactivé car les mises en page d’archives miroir ne sont pas réalistes. L’augmentation était limitée à une rotation de -3 degrés à +3 degrés et une variation de luminosité de ±10 %.

Les diagnostics du modèle au niveau d’époque sont résumés en 20 lignes d’entraînement, chacune contenant la perte d’entraînement, la perte de validation, la précision de l’entraînement, la précision de validation, le macro-F1, le F1 pondéré, le ROC-AUC et le PR-AUC.

Flux de travail d’enrichissement des métadonnées

L’enrichissement des métadonnées visait à améliorer la découverte tout en préservant le conservatisme archivistique. Les valeurs existantes du catalogue étaient conservées sauf si elles contenaient une contradiction explicite, comme une date impossible ou un conflit de type document confirmé à la fois par l’OCR et des preuves visuelles. Les champs d’enrichissement des candidats comprenaient le titre normalisé, le type de document, la date approximative, les mentions d’institutions, les mentions géographiques, les mentions de noms personnels, les titres de matières et les mots-clés.

La priorité des preuves suivait un ordre fixe : (1) métadonnées existantes du catalogue, (2) la correction de la sortie OCR, et (3) la prédiction visuelle du type de document. Un appariement contrôlé de vocabulaire était utilisé pour les titres de sujets, et l’expansion sémantique du plus proche voisin avec les transformateurs de phrases 2.7.0 n’était utilisée que lorsque la similarité cosinus était d’au moins 0,72. La normalisation de la date nécessitait une confiance d’au moins 0,85 ou une concordance entre l’OCR et les métadonnées. Chaque champ ajouté automatiquement conservait sa source, sa confiance et son identifiant de règle.

La complétude des métadonnées était définie comme le nombre de champs descriptifs de noyau peuplés divisé par le nombre de champs de référence applicables pour cet enregistrement. La correspondance par titre de sujet a été définie comme la présence d’au moins une étiquette sujette à vocabulaire contrôlé, soutenue par des preuves de contenu au niveau des enregistrements et jugée pertinente pour la catégorie de requête.

Construction du système de récupération

Cinq indices de récupération ont été construits pour isoler les contributions des modules : indexation de base ; correction de reconnaissance optique de caractères uniquement ; classification visuelle uniquement ; enrichissement des métadonnées uniquement ; et une intégration multimodale complète. Tous les indices ont été construits dans le logiciel moteur de recherche indiqué dans le tableau des matériaux (version 8.11.1) au niveau des enregistrements. Les paramètres de BM25 étaient fixés à k1 = 1,2 et b = 0,75 avant évaluation.

L’index de référence utilisait les métadonnées originales et le texte OCR de base. La condition OCR a remplacé la OCR de base par la correction OCR. L’état visuel a ajouté des priors de type document et des améliorations de classement en fonction des classes. La condition des métadonnées ajoutait des champs descriptifs enrichis. La condition multimodale complète combinait la correction de la ROC, les priors visuels et des métadonnées enrichies. Les poids des champs étaient fixés avant le test : titre normalisé = 3,0, titres sujets = 2,5, mentions de personnes et d’institutions = 2,2, mentions de lieux = 2,0, type de document = 1,8, texte du corps OCR corrigé = 1,0, et texte du corps OCR de base = 0,8, le cas échéant.

La correspondance exacte des phrases était activée pour les requêtes citées. L’expansion des requêtes n’était autorisée que dans les conditions d’enrichissement des métadonnées et de multimodalité complète, et était limitée aux synonymes acceptés de vocabulaire contrôlé et aux variantes de titres thématiques. Les journaux de recherche ont été générés du 25 au 28 août 2025 dans l’environnement Linux conteneurisé listé dans le Table of Materials, avec des graines fixes et des configurations d’index figées.

Conception de requêtes et mesures de résultats

Les 420 requêtes représentaient des comportements courants de recherche archivée plutôt que des requêtes de benchmark basées uniquement sur des mots-clés. Les sujets abordés comprenaient les noms personnels, les institutions, les lieux, les dates et plages de dates, les professions, les événements et les sujets thématiques. Chaque requête était stockée avec sa formulation normalisée, son ensemble d’enregistrements cibles, sa catégorie sujet-requête et son score de difficulté.

La difficulté a été notée avant la récupération en utilisant l’ambiguïté de la cible, la spécificité lexicale et la fréquence d’expression attendue. Les scores composites inférieurs à 0,40 étaient classés comme de faible difficulté, de 0,40 à 0,69 comme de difficulté modérée, et de 0,70 ou plus comme de difficulté élevée. Les jugements de pertinence étaient réalisés avant la comparaison du système puis vérifiés par rapport à la collection finalisée.

Les résultats de la récupération comprenaient P@10, R@10, nDCG@10, le temps jusqu’au premier résultat pertinent et le taux de recherche réussie. P@10 était la proportion des dix meilleurs disques jugés pertinents. R@10 était la proportion de tous les documents connus et pertinents récupérés dans le top 10. nDCG@10 utilise la pertinence graduée lorsque c’est possible et la pertinence binaire autrement. Le temps jusqu’au premier résultat pertinent a été mesuré depuis la soumission de la requête jusqu’à l’apparition du premier enregistrement pertinent dans la sortie classée. Une recherche réussie était définie comme au moins un résultat pertinent parmi les 10 premiers enregistrements.

Collecte de statistiques

Toutes les analyses ont été réalisées à l’aide des versions logicielles listées dans le tableau des matériaux. Les résultats continus ont été résumés en moyenne ± écartage lorsqu’ils étaient approximativement symétriques et en médiane avec une plage interquartile autrement. Les résultats catégoriels ont été résumés en comptages et pourcentages.

La normalité des différences par paires a été évaluée par le test de Shapiro-Wilk et les graphiques de distribution. L’OCR et les résultats pré/post-données ont été comparés aux tests T appariés lorsque les différences par paires étaient approximativement normales et les tests Wilcoxon signaient le rang autrement. La performance de classification avant et après l’ajustement fin a été comparée à l’aide du test de McNemar sur des étiquettes correctes/incorrectes appariées. Les résultats de récupération multi-bras appariés ont été comparés au test de Friedman, suivis par des tests de Wilcoxon par signes ajustés par Holm.

Tous les tests statistiques étaient à deux queues, et P < 0,05 était considéré comme statistiquement significatif. Les intervalles de confiance ont été estimés à l’aide de 2 000 rééchantillonnages bootstrap, la graine aléatoire étant fixée à 2025. Les effets ont été rapportés sous forme de différences moyennes, de rapports de cotes appariés ou de tailles d’effet basées sur le rang selon le type de critère de jugement.

Reproductibilité, portée et disponibilité des ressources

Tous les paramètres du pipeline étaient fixés avant les tests de récupération. Aucun paramètre n’a été optimisé sur le benchmark de récupération en attente. Les fichiers de configuration, vocabulaires contrôlés, tables lexiques, modèles de requêtes, mappages de champs, directives d’annotage, scripts statistiques et scripts de génération de figures étaient maintenus dans le système de contrôle de versions listé dans le Table of Materials avec seed aléatoire 2025.

Pour soutenir une validation indépendante, le cahier de données sources inclut une table de 1 600 enregistrements dé-identifiés avec 17 variables utilisées pour la reconnaissance optique des caractères, les métadonnées et les analyses de classification visuelle. Les tableaux dérivés 1, 2, 3, 4 et 5, résumés figures-sources, définitions de requêtes de benchmark, résumés de jugement de pertinence, substituts de journaux de récupération, diagnostics d’entraînement, catégories lexiciques, règles de cartographie de vocabulaire et champs de directives d’annotation sont fournis sous forme de tables ou fichiers de matériaux téléchargeables séparés lorsque cela est applicable. Les matériaux qui ne peuvent pas être partagés publiquement en raison des restrictions du dépôt sont représentés par des champs de métadonnées non identifiés et des champs d’échantillonnage reproductibles.

Ce protocole évalue la découverte orientée vers la récupération plutôt que la véracité des affirmations historiques. Elle ne remplace pas l’évaluation par l’archiviste, l’évaluation de provenance, la revue de la vie privée ou les règles d’accès spécifiques au dépôt.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La correction OCR a amélioré la transcription, notamment dans les enregistrements manuscrits et tabulaires

La correction par reconnaissance optique de caractères a amélioré la qualité de la transcription dans les huit classes de documents d’archivage (n = 1 600 enregistrements). Le WER moyen est passé de 0,529 ± 0,172 à 0,384 ± 0,123, avec une variation moyenne par paires de −0,144 (IC à 95 %, −0,149 à −0,139 ; Wilcoxon signé - rang P < 0,001). La CER moyenne est passée de 0,377 ± 0,126 à 0,258 ± 0,086, avec une variation moyenne par couples de −0,119 (IC à 95 %, −0,123 à −0,116 ; Wilcoxon signé - rang P < 0,001). Le tableau 2 montre que le WER de référence était le plus élevé pour les lettres manuscrites, les registres et les registres de registre, indiquant que les enregistrements les plus complexes visuellement avaient aussi la plus grande charge initiale de reconnaissance.

Après correction, le WER a diminué dans toutes les classes de documents. Les plus grandes réductions moyennes de WER appariés ont été obtenues dans les lettres manuscrites (n = 262 ; −0,200 ; IC à 95 %, −0,213 à −0,188), les registres (n = 263 ; −0,195 ; IC à 95 %, −0,206 à −0,183) et les livres de registre (n = 194 ; −0,173 ; IC à 95 %, −0,187 à −0,160). Le CER a suivi le même schéma, soutenant l’interprétation selon laquelle le module post-correction bénéficiait principalement aux enregistrements difficiles manuscrits, tabulaires et à mise en page mixte.

Le rappel des entités nommées s’est également amélioré pour tous les types de documents, comme le montre le tableau résumé. Les plus fortes augmentations ont eu lieu dans les lettres manuscrites (0,302–0,440), les registres (0,336–0,471) et les registres (0,369–0,504). La correspondance tapée a atteint le record le plus élevé après correction des entités nommées (0,646), mais son gain absolu était plus faible car la reconnaissance de base était déjà plus forte pour cette catégorie. La figure 2 résume la relation de référence CER-WER au niveau des enregistrements, l’association entre l’intensité de l’écriture manuscrite et le bénéfice de la correction, ainsi que le décalage post-correction de la découvrabilité au niveau des enregistrements.

La classification visuelle des documents s’est globalement améliorée, mais les gains de performance sont restés inégaux entre les classes

La classification visuelle des documents s’est améliorée globalement sur l’ensemble de 1 600 enregistrements de tests. La précision du top-1 est passée de 0,717 à 0,796 (variation absolue, 0,079 ; McNemar chi carré = 27,33 ; P < 0,001), et la confiance moyenne dans la prédiction est passée de 0,736 ± 0,131 à 0,800 ± 0,108 (variation moyenne par paires, 0,064 ; IC à 95 %, 0,057–0,071 ; test t par paires P < 0,001). Comme le montre le tableau 3, sept des huit cours se sont améliorés après des ajustements spécifiques aux archives, avec les plus grands progrès pour les cartes, les affiches, les journaux et les registres.

La correspondance tapée ne s’est pas améliorée de manière significative après ajustement fin (0,796–0,791), ce qui suggère que ses caractéristiques visuelles de base étaient déjà stables et que la procédure d’entraînement n’ajoutait guère de séparation supplémentaire des classes pour cette catégorie.

La figure 3 résume la performance de classification visuelle des documents avant et après un ajustement fin spécifique à l’archive ; le cahier de données sources liste 20 époques de perte et de précision train/validation, ainsi que des résumés diagnostiques macro-F1, pondéré F1, ROC-AUC et PR-AUC.

L’enrichissement des métadonnées a amélioré la complétude descriptive à travers toutes les périodes historiques (n = 1 600 enregistrements). La complétude moyenne est passée de 0,657 ± 0,125 à 0,907 ± 0,070, avec une variation moyenne par paires de 0,250 (IC à 95 %, 0,243–0,257 ; Wilcoxon signé - rang P < 0,001). Comme le montre le tableau 4, la complétude de base était la plus faible pour 1850–1879 et a augmenté sur les périodes ultérieures avant l’enrichissement. La figure 4 résume l’amélioration de l’exhaustivité des métadonnées, les nouveaux champs de métadonnées réalisés par type de document, ainsi que les gains de correspondance par titres de sujet à travers les périodes historiques.

Après enrichissement, la complétude a augmenté à chaque période historique : 1850–1879 (n = 281 ; variation moyenne, 0,207 ; IC à 95 %, 0,191–0,223), 1880–1909 (n = 474 ; variation moyenne, 0,236 ; IC à 95 %, 0,223–0,248), 1910–1939 (n = 549 ; variation moyenne, 0,277 ; IC à 95 %, 0,265–0,288), et 1940–1969 (n = 296 ; variation moyenne, 0,263 ; IC à 95 %, 0,247–0,279). Les décomptes moyens des champs peuplés ont également augmenté de manière constante sur une période à l’autre.

La correspondance des sujets s’est améliorée en parallèle. Les taux de correspondance de base variaient de 64,3 % à 69,4 %, tandis que les taux post-enrichissement variaient de 82,1 % à 85,4 %. Le plus grand gain absolu a eu lieu lors de la période la plus ancienne (Delta = 0,178), ce qui soutient la valeur de l’enrichissement conservateur pour des registres à description initiale clairsemée.

Les performances de récupération se sont améliorées dans tous les systèmes améliorés, avec les gains les plus importants grâce à une intégration multimodale complète

L’efficacité de la prélèvement s’est améliorée sous chaque condition d’amélioration par rapport à la référence, mais l’ampleur de l’amélioration variait selon le bras du système (n = 420 requêtes de référence appariées). Les résultats globaux de la récupération sont listés dans le tableau 5. Les performances de base étaient faibles : P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, temps moyen jusqu’au premier résultat pertinent = 156,079 s, et taux de recherche réussie = 5,0 % (21/420 ; IC 95 %, 3,3 % à 7,5 %). La figure 5 résume la performance de récupération à travers les cinq branches du système expérimental, incluant les métriques globales de récupération, les taux de réussite au niveau du sujet et les strates de difficulté de requête.

Les trois systèmes monocomposantes ont tous surpassé la référence de référence dans l’ensemble. La correction par reconnaissance optique de caractères a augmenté P@10 à 0,484, R@10 à 0,346 et nDCG@10 à 0,475, tout en réduisant le temps jusqu’au premier résultat pertinent à 124,261 s et en augmentant le taux de recherche réussie à 30,2 % (127/420 ; IC 95 %, 26,0 %–34,8 %). La classification visuelle a produit P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, le temps moyen jusqu’au premier résultat pertinent = 131,985 s, et un taux de recherche réussie = 22,9 % (96/420 ; IC à 95 %, 19,1 % à 27,1 %). L’enrichissement des métadonnées a obtenu la meilleure performance de récupération sur composant unique, avec P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, un temps moyen jusqu’au premier résultat pertinent = 117,474 s, et un taux de recherche réussi de 38,3 % (161/420 ; IC à 95 %, 33,8 % à 43,1 %).

Le système multimodal complet a mieux performé sur tous les points de récupération. P@10 est passée de 0,394 au départ à 0,624, R@10 de 0,238 à 0,492, et nDCG@10 de 0,392 à 0,634. Le temps moyen jusqu’au premier résultat pertinent est passé de 156,079 s à 58,485 s, et le taux de recherche réussie est passé de 5,0 % à 95,5 % (401/420 ; IC 95 %, 93,0 %–97,1 %). Ces valeurs correspondent à des gains absolus de 0,230 pour P@10, 0,254 pour R@10 et 0,242 pour nDCG@10.

La récupération spécifique au sujet s’est également améliorée grâce à une intégration multimodale complète. Les taux de réussite des recherches ont augmenté chez les personnes, institutions, lieux, professions, événements et thèmes thématiques, la catégorie professionnelle affichant le plus grand gain pratique, son taux de réussite de base étant de 0,0 % et est passé à 90,0 % sous la condition multimodale complète. Les requêtes par nom de lieu avaient les performances de base les plus solides mais bénéficiaient néanmoins d’une intégration multimodale.

Les gains multimodaux variaient selon les strates documentaires, de période et linguistiques

Les analyses de sous-groupes ont montré que les gains multimodaux étaient largement répartis entre types de documents, périodes historiques et contextes linguistiques, bien que l’ampleur de l’amélioration variait. Cette hétérogénéité indique que le flux de travail doit être évalué au sein de chaque collection cible plutôt que supposé produire des gains uniformes. La figure 6 montre l’hétérogénéité des gains de récupération multimodale selon le type de document cible, la période historique et le contexte linguistique.

Au niveau du type document, nDCG@10 amélioré dans toutes les classes ciblées. Les photographies avec légendes, lettres manuscrites, cartes, registres et registres ont montré de fortes gaines, tandis que les journaux et la correspondance dactylographiée se sont améliorés plus modestement. Ces schémas suggèrent que les enregistrements avec des métadonnées initiales faibles ou une structure visuelle complexe bénéficient le plus de la combinaison des signaux de texte, d’image et de métadonnées.

Au niveau de la période historique, R@10 est passée de 0,175 à 0,429 pour 1850–1879 et a atteint 0,506 pour 1880–1909, 0,501 pour 1910–1939, et 0,519 pour 1940–1969 sous intégration multimodale complète. Les gains étaient similaires à l’échelle absolue sur plusieurs périodes, suggérant que l’enrichissement et la reconnaissance corrigée ont aidé à la fois les premiers enregistrements clairsemés et les enregistrements ultérieurs avec des métadonnées de base plus riches.

Les résultats du contexte linguistique ont montré un schéma similaire. P@10 sous la condition multimodale complète a atteint 0,607 pour les disques en écriture latine mixte, 0,628 pour l’anglais, 0,618 pour le français, 0,661 pour l’allemand, et 0,639 pour le portugais et l’espagnol. Le plus grand gain de précision a été obtenu pour les enregistrements mixtes en alphabet latin, qui avaient la précision de base la plus faible.

Motifs au niveau des composants : contributions complémentaires plutôt que redondantes

Ensemble, les résultats montrent que les composants du protocole sont complémentaires plutôt que redondants. La correction OCR a amélioré la reconnaissance du texte, la classification visuelle a ajouté des signaux de type document sensibles à la structure, et l’enrichissement des métadonnées a élargi la couche descriptive consultable. La condition multimodale complète a produit les gains de récupération les plus forts et les plus constants, soutenant l’objectif de l’étude de tester un flux de travail auditable et orienté recherche pour des archives numériques hétérogènes.

Ces résultats soutiennent un modèle protocolaire dans lequel l’intelligence artificielle multimodale complète la recherche archivistique tout en préservant le besoin de gouvernance des dépôts, de provenance des données et de validation par les experts.

DISPONIBILITÉ DES DONNÉES :

Le jeu de données dé-identifié de 1 600 enregistrements utilisé pour les analyses principales est disponible sur Zenodo sous le data.xlsx (https://doi.org/10.5281/zenodo.20774456).

figure-results-1
Figure 1 : Flux de travail reproductible pour la découverte d’archives multimodales. (A) Construction de corpus à partir d’archives au niveau du dépôt avec filtrage d’inclusion/exclusion. (B) Étiquetage des références et contrôle qualité, incluant le type de document, les régions de référence OCR, le contexte linguistique, la période historique et la complétude des métadonnées. (C) Prétraitement d’image, génération et post-correction OCR, classification visuelle des documents et enrichissement conservateur des métadonnées. (D) Construction d’indices, évaluation de la récupération à cinq bras, analyse statistique et emballage des ressources. Abréviations : OCR, reconnaissance optique des caractères ; CER, taux d’erreur de caractère ; WER, taux d’erreur de mot. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-2
Figure 2 : Structure d’erreur et découverte de caractères optiques au niveau des enregistrements après post-correction. (A) Base CER versus WER de base sur 1 600 archives, colorié par type de document pour les classes représentatives. (B) Association entre l’intensité de l’écriture manuscrite à l’échelle et le changement du WER après correction ; des valeurs négatives indiquent un WER plus faible après correction. La ligne ajustée et la bande grise montrent la tendance linéaire et l’intervalle de confiance à 95 %. (C) Score de découverte au niveau des enregistrements avant et après correction par type de document, illustrant les changements post-correction dans les preuves consultables. Abréviations : CER, taux d’erreur de caractère ; WER, taux d’erreur de mot. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-3
Figure 3 : Classification visuelle des documents avant et après l’ajustement fin spécifique à l’archive. (A) Précision top 1 par type de document à la base et après l’ajustement fin. (B) Distributions de confiance pour les prédictions correctes et incorrectes sous des conditions de base et après l’ajustement. (C) Matrice de performance au niveau de la classe résumant la précision du top 1 et la confiance moyenne postérieure avant et après l’accordage. Les données diagnostiques du modèle incluent 20 époques de courbes pertes/précision, macro-F1, F1 pondéré, ROC-AUC et PR-AUC. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-4
Figure 4 : complétude des métadonnées et correspondance des en-têtes de sujet après enrichissement conservateur. (A) complétude des métadonnées au niveau des enregistrements avant et après enrichissement. (B) Champs de métadonnées nouvellement réalisés par type de document. (C) Gain dans la correspondance par titre de sujet à travers les périodes historiques. La complétude était calculée comme le nombre de champs de carottage applicable peuplés divisé par le nombre total de champs de carottage applicables. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-5
Figure 5 : Performance de récupération dans les cinq branches du système expérimental. (A) P@10, R@10, nDCG@10, temps jusqu’au premier résultat pertinent, et taux de recherche réussie pour la correction de la reconnaissance optique des caractères de référence, la classification visuelle, l’enrichissement des métadonnées et l’intégration multimodale complète. (B) Graphique bulles du taux de réussite de recherche par sujet de requête et bras système ; La couleur indique le bras système, et la taille de la bulle indique le pourcentage de réussite. (C) P@10, R@10 et nDCG@10 à travers les couches de difficulté facile, modérée et difficile. (D) Vue alternative au niveau du taux de réussite au niveau du sujet montrant la répartition des recherches réussies entre les sujets de requête et les branches système. Abréviations : P@10, précision à 10 ; R@10, rappel à 10 ; nDCG@10, gain cumulatif actualisé normalisé à 10. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

figure-results-6
Figure 6 : Hétérodégénéité des gains de récupération multimodale à travers les sous-groupes archivistiques. (A) nDCG@10 par type de document cible et condition de récupération. (B) R@10 par période historique et état de récupération. (C) P@10 selon le contexte de la langue cible et la condition de récupération. Les conditions sont Baseline, correction OCR, classification visuelle, enrichissement des métadonnées, intégration multimodale complète, OCR + Texte, Texte + Visuel + Métadonnées et Visuel + Métadonnées. La figure souligne que les gains multimodaux sont largement étendus mais pas uniformes à travers les strates du document, de l’époque et de la langue. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Type de documentN recordsPages médianesArchives manuscritesRéférence moyenne
WER
Référence moyenne
Métadonnées
complétude
Référence moyenne
Découvrabilité
(%)
Lettre manuscrite2622950.7290.64868.2
Registre263763.50.6790.67472.2
Carte10212.90.4570.55274.1
Journal26180.80.4950.6675.5
Photographie avec légende17911.10.3740.60173.6
Affiche87100.4130.57174.8
Registre19410180.6160.70371.3
Correspondance dactylographiée252340.3150.68976.4

Tableau 1 : Caractéristiques de la collection d’archives par type de document. Le tableau indique le nombre d’enregistrements, le nombre médian de pages, le pourcentage d’enregistrements contenant de l’écriture manuscrite, la moyenne de la ligne de base WER, la complétude moyenne des métadonnées de base et le score moyen de découverte de base pour chacune des huit classes de documents.

Document TypeTaille de l’échantillonCERCERWERWEREntité nommée
Rappel
Entité nommée
Rappel
ΔWER
(n)(Base)(Post)(Base)(Post)(Base)(Post)
Lettre manuscrite2620.5310.3630.7290.5310.3020.44−0,198
Registre2630.490.3260.6790.4850.3360.471−0,194
Carte1020.3220.2280.4570.3470.380.503−0.11
Journal2610.3540.2560.4950.3810.4360.558−0,114
Photographie avec légende1790.2570.1810.3740.2860.4940.616−0,088
Affiche870.2870.1990.4130.3160.4480.57−0,097
Registre1940.4420.2930.6160.4390.3690.504−0,177
Correspondance dactylographiée2520.2190.1550.3150.2320.5240.646−.083

Tableau 2 : Performance de l’OCR avant et après la correction par type de document. CER et WER ont été calculés selon des transcriptions de référence ; Le rappel des entités nommées était calculé à partir d’entités de personnes, lieus, institutions et dates nommés manuellement. Le WER Delta correspond au WER post-correction moins le WER de base.

Type de documentnPrécision,
Référence
Précision,
Après-coup
Confiance,
Référence
Confiance,
Après-coup
ΔAccuracy
Lettre manuscrite2620.6150.6450.6160.6550.03
Registre2630.7070.7490.7250.7670.042
Carte1020.7650.9020.8010.8990.137
Journal2610.7160.8430.7280.830.127
Photographie avec légende1790.8150.8690.8240.890.054
Affiche870.7710.9030.7920.8890.132
Registre1940.6870.7930.7010.7870.106
Correspondance dactylographiée2520.7960.7910.8040.82-0.005

Tableau 3 : Performance de classification visuelle des documents avant et après un ajustement fin spécifique à l’archive. Le tableau indique la taille de l’échantillon, la précision du top 1, la confiance moyenne a posteriori et le changement de précision selon le type de document. Les données diagnostiques comprennent 20 lignes de niveau époque avec macro-F1, F1 pondéré, ROC-AUC, PR-AUC, perte d’entraînement, perte de validation, précision de l’entraînement et précision de validation.

ComplétudeComplétudeChamps habitésChamps habitésTitre du sujet
Match
Titre du sujet
Match
Δ complétudeΔ Titre de sujet
Match
(Base)(Post)(Base)(Post)(Base)(Post)
0.5340.8684.2748.5840.6430.8210.3340.178
0.6070.8984.8388.7090.6720.8410.2910.169
0.680.9275.4269.0950.6860.8490.2470.163
0.6860.9225.488.9530.6940.8540.2360.16

Tableau 4 : Enrichissement des métadonnées par période historique. La complétude est la proportion de champs descriptifs de base applicables remplis pour un enregistrement ; les champs peuplés sont rapportés en moyennes ; La correspondance par titre de sujet indique si les preuves au niveau des enregistrements soutenaient au moins une étiquette sujette à vocabulaire contrôlé.

Brace systèmen requêtesP@10R@10nDCG@10Il est temps de passer à la première étape pertinente
Résultat(s)
Taux de recherche réussi
(%)
Référence4200.3940.2380.392156.0795
Correction OCR4200.4840.3460.475124.26130.2
Classification visuelle4200.490.3020.478131.98522.9
Enrichissement des métadonnées4200.5070.3470.513117.47438.3
Multimodal complet4200.6240.4920.63458.48595.5

Tableau 5 : Performance de récupération pour les cinq bras du système expérimental. P@10, R@10, nDCG@10, le temps jusqu’au premier résultat pertinent et le taux de recherche réussi ont été calculés sur le benchmark de 420 requêtes sous conditions de requête correspondante.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole démontre que la découverte dans les archives numériques historiques s’est le plus améliorée lorsque la correction OCR, la compréhension visuelle des documents et l’enrichissement conservateur des métadonnées étaient évalués comme des composants de récupération connectés plutôt que comme des mises à jour techniques isolées. Les plus grands gains d’OCR ont eu lieu dans les documents manuscrits, tabulaires et de registre, ce qui soutient la valeur de la post-correction pour les classes de documents où la reconnaissance de base est la plus faible. Parallèlement, l’erreur résiduelle après correction montre que le nettoyage de l’OCR ne peut pas être considéré comme une transcription définitive et doit rester auditable.

Les résultats de la classification visuelle nécessitent également une interprétation prudente. L’ajustement fin a amélioré les classes visuellement distinctives telles que les cartes, les affiches, les journaux et les registres de registre, mais les progrès étaient moindres pour les lettres manuscrites et les registres, où les mises en page se chevauchent et où les limites des classes sont moins séparables visuellement. La taille relativement petite du corpus signifie que la performance de classification doit être interprétée comme une preuve de protocole plutôt que comme une preuve qu’un modèle multimodal de production peut être entraîné à partir de 1 600 enregistrements seulement. La validation future devrait comparer EfficientNet-B3 avec les transformateurs de documents, les transformateurs de vision, les transformateurs Swin, ConvNeXt et les modèles multimodaux de fondationde documents 8, 11, 12, 13, 14, 15, 16, 17, 18.

L’enrichissement des métadonnées a contribué de manière significative à la récupération en étendant les documents descriptifs clairsemés en champs consultables tout en conservant les informations de source et de confiance. Cette constatation est cohérente avec le besoin archivistique de points d’accès plus riches, mais elle soulève aussi des risques de gouvernance. L’enrichissement automatisé peut amplifier les erreurs OCR, normaliser de manière trop agressive des noms historiquement ambigus, ou introduire un biais si les vocabulaires contrôlés sont incomplets. Pour cette raison, le flux de travail utilise des seuils de confiance, une journalisation des sources et des indicateurs de revue plutôt que le remplacement entièrement automatisé des enregistrements de catalogue.

L’évaluation de la récupération fournit des preuves d’effets complémentaires sur les modules, mais présente des limites. La comparaison actuelle utilisait des conditions de référence et d’ablation interne par module ; il ne s’est pas comparé à la récupération dense, aux classeurs d’interaction tardive tels que ColBERT, à la récupération hybride à densité parcime, au reclassement neuronal ou aux systèmes de génération augmentée parla récupération 22,23,24. Ces approches devraient être ajoutées dans de futurs travaux afin de déterminer si les gains multimodaux observés restent compétitifs face aux architectures de récupération actuelles.

La mise en œuvre nécessite également une attention particulière aux fuites de données, aux contraintes de calcul et à la scalabilité. L’enrichissement utilisait des sorties de reconnaissance optique de caractères, des prédictions visuelles et des métadonnées existantes, donc la séparation train/validation/test et l’évaluation des requêtes doivent être séparées des décisions d’enrichissement. Les futurs déploiements devraient indiquer le matériel, l’exécution, l’utilisation de la mémoire, la taille de l’index et le coût pour 1 000 enregistrements. Les approches de restauration d’imagerie issues de travaux de vision par ordinateur adjacents, y compris des modèles d’élimination d’occlusion à plusieurs échelles et basés sur l’attention, pourraient inspirer de futures expériences de prétraitement, mais elles doivent être testées avec soin car les flux de travail d’archivage ne doivent pas halluciner ni modifier le contenuprobant 26,27.

Dans l’ensemble, le flux de travail est mieux compris comme un protocole d’accès reproductible plutôt que comme un simple substitut à la description archivistique. L’intelligence artificielle multimodale peut améliorer la découverte lorsque ses résultats sont contraignus, enregistrés et examinés, mais les archivistes restent essentiels pour l’évaluation de la provenance, les décisions d’accès et de gouvernance et l’interprétation de documents historiquementcomplexes 21,25.

CONCLUSIONS :
Cette étude a testé si la correction par reconnaissance optique de caractères, la classification visuelle des documents et l’enrichissement conservateur des métadonnées pouvaient servir de composants complémentaires de récupération dans les archives numériques historiques. Le protocole a amélioré la transcription, la classification, la complétude des métadonnées et la performance de la récupération globale tout en conservant des seuils explicites, la journalisation des sources et les garanties de revue humaine. Le flux de travail doit donc être utilisé comme un protocole auditable de support d’accès, et non comme un remplacement du jugement de l’archiviste ou de la gouvernance du dépôt.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont rien à divulguer.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs remercient sincèrement les deux membres expérimentés du personnel d’archives ainsi que le chercheur professionnel en humanités numériques pour leur précieuse aide en annotation textuelle et contrôle qualité. Cette recherche a été financée par le Plan de Projet Science et Technologie des Archives provinciales du Jiangsu (Grant n° 2024-9) pour la construction d’un système d’archives orales intelligentes basé sur la parole, ainsi que par le Plan provincial de développement des sciences et technologies du Jiangsu pour la médecine traditionnelle chinoise (Grant No. MS2025025) pour étudier l’héritage et le développement des écoles de MTC sous un angle archivistique.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
PythonPython Software Foundationv3.11.8; https://www.python.org/Scripting de flux de travail, traitement des données, post-correction de reconnaissance optique de caractères et support statistique
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Analyse statistique et génération de figures finales
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractGénération de base de reconnaissance optique de caractères
Packs de langue TesseractTesseract OCR ProjectPacks de langue spécifiques à l'étude; https://github.com/tesseract-ocr/tessdataDécodage de reconnaissance optique de caractères primaire et multilingue
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Décroissance, estimation du bruit et prétraitement d'images
PillowContributeurs de la Python Imaging Libraryv10.3.0; https://python-pillow.org/Entrée/sortie d'images et normalisation de format
NumPyDéveloppeurs NumPyv1.26.4; https://numpy.org/Calcul matriciel pour le traitement d'images et de métriques
pandasÉquipe de développement pandasv2.2.2; https://pandas.pydata.org/Gestion des données tabulaires et exportations récapitulatives
SciPyDéveloppeurs SciPyv1.13.1; https://scipy.org/Tests statistiques et utilitaires numériques
statsmodelsDéveloppeurs statsmodelsv0.14.2; https://www.statsmodels.org/Modélisation statistique et support de comparaison couplée
scikit-learnDéveloppeurs scikit-learnv1.4.2; https://scikit-learn.org/Métriques de classification, diagnostics ROC/PR et utilitaires de validation
rapidfuzzMax Bachmann et contributeursv3.9.0; https://github.com/rapidfuzz/RapidFuzzClassement des candidats par distance d'édition pour la correction de reconnaissance optique de caractères
spaCyExplosion AIv3.7.4; https://spacy.io/Traitement des entités nommées avec des tables de lexique personnalisées
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Formation de classificateur de documents visuels
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/Implémentation EfficientNet-B3 et transformations d'images
EfficientNet-B3 backbonePoids préentraînés torchvision / ImageNetEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlBackbone de classification de documents visuels
sentence-transformersUKP Lab / écosystème Hugging Facev2.7.0; https://www.sbert.net/Expansion sémantique pour les candidats de vocabulaire contrôlé
Logiciel de moteur de rechercheElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchIndexation, récupération et classement BM25
Moteur de conteneurDocker Inc.Docker v26.1.1; https://www.docker.com/Environnement de récupération conteneurisé
Système d'exploitation LinuxCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Environnement d'exploitation fixe pour les exécutions de récupération
Système de contrôle de versionProjet GitGit v2.44.0; https://git-scm.com/Contrôle de version pour la configuration, les vocabulaires, les scripts et le code des figures
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/Rendu de figures basé sur R
MatplotlibDéveloppeurs Matplotlibv3.8.4; https://matplotlib.org/Visualisations complémentaires et graphiques d'assurance qualité
Lignes directrices d'annotationAuteurs5 sections d'annotation; 8 étiquettes de classe de document; régions OCR; étiquettes d'entité; jugements de pertinence; règles d'adjudicationDéfinitions pour les classes de documents, les régions OCR, les entités, les jugements de pertinence et l'adjudication
Lexique OCR spécifique à l'archiveAuteurs6 catégories de lexique : variantes de personnes, noms de lieux, noms d'institutions, modèles de dates, termes administratifs, abréviationsNoms, lieux, institutions, termes administratifs et variantes orthographiques
Mappage de vocabulaire contrôléAuteurs / dépôts d'archives5 règles de mappage reliant les entités OCR, la classe visuelle, les mots-clés du titre, la couverture temporelle et le sujet de la requête aux champs de métadonnéesCorrespondance des vedettes-matières et expansion sémantique
Ensemble de requêtes de référenceAuteurs420 requêtes de référence; 6 sujets de requête; 3 niveaux de difficulté; 8 classes de documents cibles; 4 périodes historiques; 6 contextes linguistiquesBanc d'essai de récupération correspondant pour cinq branches du système
Jugements de pertinenceAuteurs / annoteur·rice·s2 100 lignes requête-système; 420 requêtes x 5 branches du système; totaux pertinents, comptes pertinents-dans-le-top-10, pertinence notée et indicateurs de succèsVérité de référence pour P@10, R@10, nDCG@10 et taux de recherche réussie
Diagnostics d'entraînementAuteurs20 époques; perte d'entraînement; perte de validation; précision d'entraînement; précision de validation; macro-F1; F1 pondérée; ROC-AUC; PR-AUCRésumés de diagnostic du modèle au niveau de l'époque
Matériel informatiqueAuteurs8 cœurs de CPU; 32 Go de RAM; environnement de formation de classe GPU NVIDIADétails des ressources de reproductibilité pour la soumission à JoVE
Fichier de donnéesAuteursdata.xlsx; 1 600 enregistrements; 17 variables; DOI listé dans la disponibilité des données du manuscritDonnées sources au niveau des enregistrements pour la reconnaissance optique de caractères, l'exhaustivité des métadonnées, la découvrabilité et les analyses de classification visuelle

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Ing nierieNum ro 234Num ro 234Valeur videNum roArchives num riquesIA multimodalecorrection OCRenrichissement des m tadonn esclassification visuelle et requ te d archives historiques

Articles connexes