$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La correction OCR a amélioré la transcription, notamment dans les enregistrements manuscrits et tabulaires
La correction par reconnaissance optique de caractères a amélioré la qualité de la transcription dans les huit classes de documents d’archivage (n = 1 600 enregistrements). Le WER moyen est passé de 0,529 ± 0,172 à 0,384 ± 0,123, avec une variation moyenne par paires de −0,144 (IC à 95 %, −0,149 à −0,139 ; Wilcoxon signé - rang P < 0,001). La CER moyenne est passée de 0,377 ± 0,126 à 0,258 ± 0,086, avec une variation moyenne par couples de −0,119 (IC à 95 %, −0,123 à −0,116 ; Wilcoxon signé - rang P < 0,001). Le tableau 2 montre que le WER de référence était le plus élevé pour les lettres manuscrites, les registres et les registres de registre, indiquant que les enregistrements les plus complexes visuellement avaient aussi la plus grande charge initiale de reconnaissance.
Après correction, le WER a diminué dans toutes les classes de documents. Les plus grandes réductions moyennes de WER appariés ont été obtenues dans les lettres manuscrites (n = 262 ; −0,200 ; IC à 95 %, −0,213 à −0,188), les registres (n = 263 ; −0,195 ; IC à 95 %, −0,206 à −0,183) et les livres de registre (n = 194 ; −0,173 ; IC à 95 %, −0,187 à −0,160). Le CER a suivi le même schéma, soutenant l’interprétation selon laquelle le module post-correction bénéficiait principalement aux enregistrements difficiles manuscrits, tabulaires et à mise en page mixte.
Le rappel des entités nommées s’est également amélioré pour tous les types de documents, comme le montre le tableau résumé. Les plus fortes augmentations ont eu lieu dans les lettres manuscrites (0,302–0,440), les registres (0,336–0,471) et les registres (0,369–0,504). La correspondance tapée a atteint le record le plus élevé après correction des entités nommées (0,646), mais son gain absolu était plus faible car la reconnaissance de base était déjà plus forte pour cette catégorie. La figure 2 résume la relation de référence CER-WER au niveau des enregistrements, l’association entre l’intensité de l’écriture manuscrite et le bénéfice de la correction, ainsi que le décalage post-correction de la découvrabilité au niveau des enregistrements.
La classification visuelle des documents s’est globalement améliorée, mais les gains de performance sont restés inégaux entre les classes
La classification visuelle des documents s’est améliorée globalement sur l’ensemble de 1 600 enregistrements de tests. La précision du top-1 est passée de 0,717 à 0,796 (variation absolue, 0,079 ; McNemar chi carré = 27,33 ; P < 0,001), et la confiance moyenne dans la prédiction est passée de 0,736 ± 0,131 à 0,800 ± 0,108 (variation moyenne par paires, 0,064 ; IC à 95 %, 0,057–0,071 ; test t par paires P < 0,001). Comme le montre le tableau 3, sept des huit cours se sont améliorés après des ajustements spécifiques aux archives, avec les plus grands progrès pour les cartes, les affiches, les journaux et les registres.
La correspondance tapée ne s’est pas améliorée de manière significative après ajustement fin (0,796–0,791), ce qui suggère que ses caractéristiques visuelles de base étaient déjà stables et que la procédure d’entraînement n’ajoutait guère de séparation supplémentaire des classes pour cette catégorie.
La figure 3 résume la performance de classification visuelle des documents avant et après un ajustement fin spécifique à l’archive ; le cahier de données sources liste 20 époques de perte et de précision train/validation, ainsi que des résumés diagnostiques macro-F1, pondéré F1, ROC-AUC et PR-AUC.
L’enrichissement des métadonnées a amélioré la complétude descriptive à travers toutes les périodes historiques (n = 1 600 enregistrements). La complétude moyenne est passée de 0,657 ± 0,125 à 0,907 ± 0,070, avec une variation moyenne par paires de 0,250 (IC à 95 %, 0,243–0,257 ; Wilcoxon signé - rang P < 0,001). Comme le montre le tableau 4, la complétude de base était la plus faible pour 1850–1879 et a augmenté sur les périodes ultérieures avant l’enrichissement. La figure 4 résume l’amélioration de l’exhaustivité des métadonnées, les nouveaux champs de métadonnées réalisés par type de document, ainsi que les gains de correspondance par titres de sujet à travers les périodes historiques.
Après enrichissement, la complétude a augmenté à chaque période historique : 1850–1879 (n = 281 ; variation moyenne, 0,207 ; IC à 95 %, 0,191–0,223), 1880–1909 (n = 474 ; variation moyenne, 0,236 ; IC à 95 %, 0,223–0,248), 1910–1939 (n = 549 ; variation moyenne, 0,277 ; IC à 95 %, 0,265–0,288), et 1940–1969 (n = 296 ; variation moyenne, 0,263 ; IC à 95 %, 0,247–0,279). Les décomptes moyens des champs peuplés ont également augmenté de manière constante sur une période à l’autre.
La correspondance des sujets s’est améliorée en parallèle. Les taux de correspondance de base variaient de 64,3 % à 69,4 %, tandis que les taux post-enrichissement variaient de 82,1 % à 85,4 %. Le plus grand gain absolu a eu lieu lors de la période la plus ancienne (Delta = 0,178), ce qui soutient la valeur de l’enrichissement conservateur pour des registres à description initiale clairsemée.
Les performances de récupération se sont améliorées dans tous les systèmes améliorés, avec les gains les plus importants grâce à une intégration multimodale complète
L’efficacité de la prélèvement s’est améliorée sous chaque condition d’amélioration par rapport à la référence, mais l’ampleur de l’amélioration variait selon le bras du système (n = 420 requêtes de référence appariées). Les résultats globaux de la récupération sont listés dans le tableau 5. Les performances de base étaient faibles : P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, temps moyen jusqu’au premier résultat pertinent = 156,079 s, et taux de recherche réussie = 5,0 % (21/420 ; IC 95 %, 3,3 % à 7,5 %). La figure 5 résume la performance de récupération à travers les cinq branches du système expérimental, incluant les métriques globales de récupération, les taux de réussite au niveau du sujet et les strates de difficulté de requête.
Les trois systèmes monocomposantes ont tous surpassé la référence de référence dans l’ensemble. La correction par reconnaissance optique de caractères a augmenté P@10 à 0,484, R@10 à 0,346 et nDCG@10 à 0,475, tout en réduisant le temps jusqu’au premier résultat pertinent à 124,261 s et en augmentant le taux de recherche réussie à 30,2 % (127/420 ; IC 95 %, 26,0 %–34,8 %). La classification visuelle a produit P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, le temps moyen jusqu’au premier résultat pertinent = 131,985 s, et un taux de recherche réussie = 22,9 % (96/420 ; IC à 95 %, 19,1 % à 27,1 %). L’enrichissement des métadonnées a obtenu la meilleure performance de récupération sur composant unique, avec P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, un temps moyen jusqu’au premier résultat pertinent = 117,474 s, et un taux de recherche réussi de 38,3 % (161/420 ; IC à 95 %, 33,8 % à 43,1 %).
Le système multimodal complet a mieux performé sur tous les points de récupération. P@10 est passée de 0,394 au départ à 0,624, R@10 de 0,238 à 0,492, et nDCG@10 de 0,392 à 0,634. Le temps moyen jusqu’au premier résultat pertinent est passé de 156,079 s à 58,485 s, et le taux de recherche réussie est passé de 5,0 % à 95,5 % (401/420 ; IC 95 %, 93,0 %–97,1 %). Ces valeurs correspondent à des gains absolus de 0,230 pour P@10, 0,254 pour R@10 et 0,242 pour nDCG@10.
La récupération spécifique au sujet s’est également améliorée grâce à une intégration multimodale complète. Les taux de réussite des recherches ont augmenté chez les personnes, institutions, lieux, professions, événements et thèmes thématiques, la catégorie professionnelle affichant le plus grand gain pratique, son taux de réussite de base étant de 0,0 % et est passé à 90,0 % sous la condition multimodale complète. Les requêtes par nom de lieu avaient les performances de base les plus solides mais bénéficiaient néanmoins d’une intégration multimodale.
Les gains multimodaux variaient selon les strates documentaires, de période et linguistiques
Les analyses de sous-groupes ont montré que les gains multimodaux étaient largement répartis entre types de documents, périodes historiques et contextes linguistiques, bien que l’ampleur de l’amélioration variait. Cette hétérogénéité indique que le flux de travail doit être évalué au sein de chaque collection cible plutôt que supposé produire des gains uniformes. La figure 6 montre l’hétérogénéité des gains de récupération multimodale selon le type de document cible, la période historique et le contexte linguistique.
Au niveau du type document, nDCG@10 amélioré dans toutes les classes ciblées. Les photographies avec légendes, lettres manuscrites, cartes, registres et registres ont montré de fortes gaines, tandis que les journaux et la correspondance dactylographiée se sont améliorés plus modestement. Ces schémas suggèrent que les enregistrements avec des métadonnées initiales faibles ou une structure visuelle complexe bénéficient le plus de la combinaison des signaux de texte, d’image et de métadonnées.
Au niveau de la période historique, R@10 est passée de 0,175 à 0,429 pour 1850–1879 et a atteint 0,506 pour 1880–1909, 0,501 pour 1910–1939, et 0,519 pour 1940–1969 sous intégration multimodale complète. Les gains étaient similaires à l’échelle absolue sur plusieurs périodes, suggérant que l’enrichissement et la reconnaissance corrigée ont aidé à la fois les premiers enregistrements clairsemés et les enregistrements ultérieurs avec des métadonnées de base plus riches.
Les résultats du contexte linguistique ont montré un schéma similaire. P@10 sous la condition multimodale complète a atteint 0,607 pour les disques en écriture latine mixte, 0,628 pour l’anglais, 0,618 pour le français, 0,661 pour l’allemand, et 0,639 pour le portugais et l’espagnol. Le plus grand gain de précision a été obtenu pour les enregistrements mixtes en alphabet latin, qui avaient la précision de base la plus faible.
Motifs au niveau des composants : contributions complémentaires plutôt que redondantes
Ensemble, les résultats montrent que les composants du protocole sont complémentaires plutôt que redondants. La correction OCR a amélioré la reconnaissance du texte, la classification visuelle a ajouté des signaux de type document sensibles à la structure, et l’enrichissement des métadonnées a élargi la couche descriptive consultable. La condition multimodale complète a produit les gains de récupération les plus forts et les plus constants, soutenant l’objectif de l’étude de tester un flux de travail auditable et orienté recherche pour des archives numériques hétérogènes.
Ces résultats soutiennent un modèle protocolaire dans lequel l’intelligence artificielle multimodale complète la recherche archivistique tout en préservant le besoin de gouvernance des dépôts, de provenance des données et de validation par les experts.
DISPONIBILITÉ DES DONNÉES :
Le jeu de données dé-identifié de 1 600 enregistrements utilisé pour les analyses principales est disponible sur Zenodo sous le data.xlsx (https://doi.org/10.5281/zenodo.20774456).

Figure 1 : Flux de travail reproductible pour la découverte d’archives multimodales. (A) Construction de corpus à partir d’archives au niveau du dépôt avec filtrage d’inclusion/exclusion. (B) Étiquetage des références et contrôle qualité, incluant le type de document, les régions de référence OCR, le contexte linguistique, la période historique et la complétude des métadonnées. (C) Prétraitement d’image, génération et post-correction OCR, classification visuelle des documents et enrichissement conservateur des métadonnées. (D) Construction d’indices, évaluation de la récupération à cinq bras, analyse statistique et emballage des ressources. Abréviations : OCR, reconnaissance optique des caractères ; CER, taux d’erreur de caractère ; WER, taux d’erreur de mot. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 2 : Structure d’erreur et découverte de caractères optiques au niveau des enregistrements après post-correction. (A) Base CER versus WER de base sur 1 600 archives, colorié par type de document pour les classes représentatives. (B) Association entre l’intensité de l’écriture manuscrite à l’échelle et le changement du WER après correction ; des valeurs négatives indiquent un WER plus faible après correction. La ligne ajustée et la bande grise montrent la tendance linéaire et l’intervalle de confiance à 95 %. (C) Score de découverte au niveau des enregistrements avant et après correction par type de document, illustrant les changements post-correction dans les preuves consultables. Abréviations : CER, taux d’erreur de caractère ; WER, taux d’erreur de mot. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 3 : Classification visuelle des documents avant et après l’ajustement fin spécifique à l’archive. (A) Précision top 1 par type de document à la base et après l’ajustement fin. (B) Distributions de confiance pour les prédictions correctes et incorrectes sous des conditions de base et après l’ajustement. (C) Matrice de performance au niveau de la classe résumant la précision du top 1 et la confiance moyenne postérieure avant et après l’accordage. Les données diagnostiques du modèle incluent 20 époques de courbes pertes/précision, macro-F1, F1 pondéré, ROC-AUC et PR-AUC. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 4 : complétude des métadonnées et correspondance des en-têtes de sujet après enrichissement conservateur. (A) complétude des métadonnées au niveau des enregistrements avant et après enrichissement. (B) Champs de métadonnées nouvellement réalisés par type de document. (C) Gain dans la correspondance par titre de sujet à travers les périodes historiques. La complétude était calculée comme le nombre de champs de carottage applicable peuplés divisé par le nombre total de champs de carottage applicables. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 5 : Performance de récupération dans les cinq branches du système expérimental. (A) P@10, R@10, nDCG@10, temps jusqu’au premier résultat pertinent, et taux de recherche réussie pour la correction de la reconnaissance optique des caractères de référence, la classification visuelle, l’enrichissement des métadonnées et l’intégration multimodale complète. (B) Graphique bulles du taux de réussite de recherche par sujet de requête et bras système ; La couleur indique le bras système, et la taille de la bulle indique le pourcentage de réussite. (C) P@10, R@10 et nDCG@10 à travers les couches de difficulté facile, modérée et difficile. (D) Vue alternative au niveau du taux de réussite au niveau du sujet montrant la répartition des recherches réussies entre les sujets de requête et les branches système. Abréviations : P@10, précision à 10 ; R@10, rappel à 10 ; nDCG@10, gain cumulatif actualisé normalisé à 10. Veuillez cliquer ici pour voir une version agrandie de cette figurine.

Figure 6 : Hétérodégénéité des gains de récupération multimodale à travers les sous-groupes archivistiques. (A) nDCG@10 par type de document cible et condition de récupération. (B) R@10 par période historique et état de récupération. (C) P@10 selon le contexte de la langue cible et la condition de récupération. Les conditions sont Baseline, correction OCR, classification visuelle, enrichissement des métadonnées, intégration multimodale complète, OCR + Texte, Texte + Visuel + Métadonnées et Visuel + Métadonnées. La figure souligne que les gains multimodaux sont largement étendus mais pas uniformes à travers les strates du document, de l’époque et de la langue. Veuillez cliquer ici pour voir une version agrandie de cette figurine.
| Type de document | N records | Pages médianes | Archives manuscrites | Référence moyenne WER | Référence moyenne Métadonnées complétude | Référence moyenne Découvrabilité |
| | | (%) | | | |
| Lettre manuscrite | 262 | 2 | 95 | 0.729 | 0.648 | 68.2 |
| Registre | 263 | 7 | 63.5 | 0.679 | 0.674 | 72.2 |
| Carte | 102 | 1 | 2.9 | 0.457 | 0.552 | 74.1 |
| Journal | 261 | 8 | 0.8 | 0.495 | 0.66 | 75.5 |
| Photographie avec légende | 179 | 1 | 1.1 | 0.374 | 0.601 | 73.6 |
| Affiche | 87 | 1 | 0 | 0.413 | 0.571 | 74.8 |
| Registre | 194 | 10 | 18 | 0.616 | 0.703 | 71.3 |
| Correspondance dactylographiée | 252 | 3 | 4 | 0.315 | 0.689 | 76.4 |
Tableau 1 : Caractéristiques de la collection d’archives par type de document. Le tableau indique le nombre d’enregistrements, le nombre médian de pages, le pourcentage d’enregistrements contenant de l’écriture manuscrite, la moyenne de la ligne de base WER, la complétude moyenne des métadonnées de base et le score moyen de découverte de base pour chacune des huit classes de documents.
| Document Type | Taille de l’échantillon | CER | CER | WER | WER | Entité nommée Rappel | Entité nommée Rappel | ΔWER |
| (n) | (Base) | (Post) | (Base) | (Post) | (Base) | (Post) | |
| Lettre manuscrite | 262 | 0.531 | 0.363 | 0.729 | 0.531 | 0.302 | 0.44 | −0,198 |
| Registre | 263 | 0.49 | 0.326 | 0.679 | 0.485 | 0.336 | 0.471 | −0,194 |
| Carte | 102 | 0.322 | 0.228 | 0.457 | 0.347 | 0.38 | 0.503 | −0.11 |
| Journal | 261 | 0.354 | 0.256 | 0.495 | 0.381 | 0.436 | 0.558 | −0,114 |
| Photographie avec légende | 179 | 0.257 | 0.181 | 0.374 | 0.286 | 0.494 | 0.616 | −0,088 |
| Affiche | 87 | 0.287 | 0.199 | 0.413 | 0.316 | 0.448 | 0.57 | −0,097 |
| Registre | 194 | 0.442 | 0.293 | 0.616 | 0.439 | 0.369 | 0.504 | −0,177 |
| Correspondance dactylographiée | 252 | 0.219 | 0.155 | 0.315 | 0.232 | 0.524 | 0.646 | −.083 |
Tableau 2 : Performance de l’OCR avant et après la correction par type de document. CER et WER ont été calculés selon des transcriptions de référence ; Le rappel des entités nommées était calculé à partir d’entités de personnes, lieus, institutions et dates nommés manuellement. Le WER Delta correspond au WER post-correction moins le WER de base.
| Type de document | n | Précision, Référence | Précision, Après-coup | Confiance, Référence | Confiance, Après-coup | ΔAccuracy |
| Lettre manuscrite | 262 | 0.615 | 0.645 | 0.616 | 0.655 | 0.03 |
| Registre | 263 | 0.707 | 0.749 | 0.725 | 0.767 | 0.042 |
| Carte | 102 | 0.765 | 0.902 | 0.801 | 0.899 | 0.137 |
| Journal | 261 | 0.716 | 0.843 | 0.728 | 0.83 | 0.127 |
| Photographie avec légende | 179 | 0.815 | 0.869 | 0.824 | 0.89 | 0.054 |
| Affiche | 87 | 0.771 | 0.903 | 0.792 | 0.889 | 0.132 |
| Registre | 194 | 0.687 | 0.793 | 0.701 | 0.787 | 0.106 |
| Correspondance dactylographiée | 252 | 0.796 | 0.791 | 0.804 | 0.82 | -0.005 |
Tableau 3 : Performance de classification visuelle des documents avant et après un ajustement fin spécifique à l’archive. Le tableau indique la taille de l’échantillon, la précision du top 1, la confiance moyenne a posteriori et le changement de précision selon le type de document. Les données diagnostiques comprennent 20 lignes de niveau époque avec macro-F1, F1 pondéré, ROC-AUC, PR-AUC, perte d’entraînement, perte de validation, précision de l’entraînement et précision de validation.
| Complétude | Complétude | Champs habités | Champs habités | Titre du sujet Match | Titre du sujet Match | Δ complétude | Δ Titre de sujet Match |
| (Base) | (Post) | (Base) | (Post) | (Base) | (Post) | | |
| 0.534 | 0.868 | 4.274 | 8.584 | 0.643 | 0.821 | 0.334 | 0.178 |
| 0.607 | 0.898 | 4.838 | 8.709 | 0.672 | 0.841 | 0.291 | 0.169 |
| 0.68 | 0.927 | 5.426 | 9.095 | 0.686 | 0.849 | 0.247 | 0.163 |
| 0.686 | 0.922 | 5.48 | 8.953 | 0.694 | 0.854 | 0.236 | 0.16 |
Tableau 4 : Enrichissement des métadonnées par période historique. La complétude est la proportion de champs descriptifs de base applicables remplis pour un enregistrement ; les champs peuplés sont rapportés en moyennes ; La correspondance par titre de sujet indique si les preuves au niveau des enregistrements soutenaient au moins une étiquette sujette à vocabulaire contrôlé.
| Brace système | n requêtes | P@10 | R@10 | nDCG@10 | Il est temps de passer à la première étape pertinente Résultat(s) | Taux de recherche réussi |
| | | | | | (%) |
| Référence | 420 | 0.394 | 0.238 | 0.392 | 156.079 | 5 |
| Correction OCR | 420 | 0.484 | 0.346 | 0.475 | 124.261 | 30.2 |
| Classification visuelle | 420 | 0.49 | 0.302 | 0.478 | 131.985 | 22.9 |
| Enrichissement des métadonnées | 420 | 0.507 | 0.347 | 0.513 | 117.474 | 38.3 |
| Multimodal complet | 420 | 0.624 | 0.492 | 0.634 | 58.485 | 95.5 |
Tableau 5 : Performance de récupération pour les cinq bras du système expérimental. P@10, R@10, nDCG@10, le temps jusqu’au premier résultat pertinent et le taux de recherche réussi ont été calculés sur le benchmark de 420 requêtes sous conditions de requête correspondante.