Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł badawczy

Możliwy do powtórzenia multimodalny przepływ pracy sztucznej inteligencji do odkrywania historycznych cyfrowych archiwów

71 wyświetleń

DOI:

10.3791/71698

7 sierpnia 2026

W tym artykule

Podsumowanie

Przedstawiamy tu protokół mający na celu poprawę odkrywania w historycznych archiwach cyfrowych poprzez integrację korekcji optycznego rozpoznawania znaków, klasyfikacji wizualnej dokumentów, wzbogacania metadan i ewaluacji odzyskiwania w nadzorowanym przepływie pracy.

Streszczenie

Historyczne archiwa cyfrowe są coraz bardziej dostępne w wyszukiwarkach, ale odkrywanie pozostaje ograniczone, gdy błędy optycznego rozpoznawania znaków, wizualnie nierównorodne typy dokumentów i rzadkie metadane są obsługiwane osobno. Badanie to miało na celu opracowanie powtarzalnego protokołu, aby ocenić, czy konserwatywny multimodalny przepływ pracy sztucznej inteligencji może poprawić odzyskiwanie archiwalne bez zastępowania przeglądu przez archiwisty. Zebrano korpus 1600 scyfryfikowanych zapisów archiwalnych z ośmiu klas dokumentów i zastosowano 420-zapytaniowy benchmark, aby porównać pięć warunków odzyskiwania: indeksowanie bazowe, samodzielne korekty optycznego rozpoznawania znaków, samodzielna klasyfikacja wizualna, samodzielne wzbogacanie metadan i pełna multimodalna integracja. Wyniki na poziomie zapisu obejmowały wskaźnik błędów znaków (CER), wskaźnik błędów słów (WER), odzyskiwanie nazw własnych, dokładność klasyfikacji typów dokumentów, pewność predykcji, kompletność metadan i dopasowanie nagłówków tematycznych. Wyniki na poziomie zapytania obejmowały P@10, R@10, nDCG@10, czas do pierwszego odpowiedniego wyniku i wskaźnik udanych wyszukiwań. Korekta optycznego rozpoznawania znaków najmocniej zmniejszała WER dla ręcznie pisanych listów, ksieg rachunkowych i ksiąg rejestrowych; wizualne dostrajanie poprawiało dokładność klasyfikacji najbardziej dla map, plakatów, gazet i ksiąg rejestrowych; a wzbogacanie metadan zwiększało kompletność w całych okresach historycznych. Pełny multimodalny warunek osiągnął najwyższą wydajność odzyskiwania (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) i zmniejszył średni czas do pierwszego odpowiedniego wyniku z 156,079 s do 58,485 s. Te wyniki wspierają modularny, poddany rewidencji przepływ pracy, w którym tekst, obraz i sygnały opisowe są łączone według wyraźnych progów i poddają się przeglądowi przez człowieka.

Wprowadzenie

Archiwa cyfrowe rozwijają się szybko i obecnie wspierają badania w dziedzinie historii, dziedzictwa kulturowego, administracji publicznej i cyfrowych nauk humanistycznych. Jednak dostęp jest nadal nierówny, ponieważ archiwa zawierają często pogorszone wyniki optycznego rozpoznawania znaków, wizualnie zróżnicowane układy stron, niekonsekwentne praktyki katalogowania oraz historycznie zmienne nazwy, miejsca i instytucje. Ograniczenia te wpływają nie tylko na jakość transkrypcji, ale także na odzyskiwanie, filtrowanie i dalsze wykorzystanie scyfryzowanych kolekcji1,2,3,4,5,6,7.

Istniejące badania nad sztuczną inteligencją w dokumentach oraz archiwum i odzyskiwaniem poprawiły poszczególne komponenty, takie jak poprawka optycznego rozpoznawania znaków, klasyfikowanie obrazów dokumentów, normalizacja metadan, modelowanie tematów, osadzenia słów, odzyskiwanie neuronowe i praktyki zarządzania danymi8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25. Jednak wiele systemów archiwalnych nadal ocenia te komponenty oddzielnie, co utrudnia określenie, czy połączony przepływ pracy poprawia odkrywanie w realnych warunkach wyszukiwania. Lukę metodologiczną, na którą zwraca się tutaj uwagę, jest brak reproduktybilnego, podlegającego audytowi protokołu, który łączy moduły tekstowe, obrazowe i metadanych z wynikami odzyskiwania w jednym przepływie pracy archiwalnym.

Głównym celem było przetestowanie, czy korekcja optycznego rozpoznawania znaków, klasyfikacja wizualna dokumentów i wzbogacanie metadan ograniczonych regułami dają uzupełniające poprawki, gdy są oceniane na podstawie tego samego kryterium odzyskiwania.

Przypuszczaliśmy, że pełny warunek multimodalny przewyższy każdy warunek pojedynczego komponentu, ponieważ odkrywanie archiwalne zależy od interakcji czytelnego tekstu, wizualnie interpretowalnej struktury dokumentu i przeszukiwalnych metadan opisowych. Przepływ pracy został zaprojektowany konserwatywnie: zautomatyzowane wyniki mogły wzbogacać indeksy odzyskiwania, ale prognozy o niskiej pewności były oznaczane do przeglądu, a nie używane jako autorytatywny opis archiwalny.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

To badania wykorzystały scyfryzowane zapisy archiwalne i symulowane zapytania do odzyskiwania informacji jako jednostki analizy. Archiwum może ograniczać dostęp do wrażliwych lub chronionych kulturowo zapisów. Przed przetworzeniem lub udostępnieniem jakichkolwiek zapisów należy przestrzegać zasad dostępu do repozytoriów, instytucjonalnych procedur dotyczących bezpieczeństwa danych oraz wymagań dotyczących anonimizacji. Podczas tego cyfrowego przepływu pracy nie powstały żadne niebezpieczne odpady chemiczne, biologiczne, ostre, radioaktywne ani inne regulowane odpady laboratoryjne.

Projekt badania i budowa korpusu

Rysunek 1 przedstawia kompletny przepływ pracy badania, w tym budowę korpusu, etykietowanie referencyjne, przetwarzanie obrazów, generowanie OCR i poprawę po korekcji, klasyfikację wizualną, wzbogacanie metadan, budowę indeksu, ewaluację odzyskiwania, analizę statystyczną i pakiet do reprodukcji.

Budowa korpusu przebiegała od 15 stycznia do 30 kwietnia 2025 roku, po czym nastąpiło projektowanie i debugowanie systemu od 1 maja do 31 października 2025 roku. Korpus zawierał 1600 scyfryzowanych zapisów archiwalnych wybranych z ośmiu repozytoriów reprezentujących systemy państwowe, miejskie, religijne, muzealne, uniwersyteckie i biblioteczne. Ramka prób była zróżnicowana według repozytoriów i klas dokumentów, aby zachować różnorodność archiwalną wśród ręcznie pisanych listów, ksiąg rachunkowych, map, gazet, fotografii z podpisami, plakatów, ksiąg rejestrowych i korespondencji pisowni maszynowej.

Dla każdego kandydackiego zapisu log selekcji zawierał identyfikator repozytorium lub kolekcji, identyfikator katalogowy, klasę dokumentu, przybliżony okres historyczny, dominujący kontekst językowy, dostępny format obrazu, rozdzielczość obrazu, liczbę stron oraz podstawowe pola opisowe. Każdy zapis musiał spełniać następujące wymogi: stabilny identyfikator katalogowy; co najmniej jedno zdjęcie strony w formacie TIFF, JPEG lub PNG; rozdzielczość obrazu źródłowego co najmniej 150 dpi; czytelną treść tekstową, tabelaryczną lub strukturalną; oraz przypisanie do jednej z ośmiu wstępnie zdefiniowanych klas dokumentów. Kryteria wykluczenia to dokładne duplikaty, puste strony odwrotne, obrazy przycięte do punktu, w którym brakowało ponad 30% obszaru zawierającego tekst oraz zapisy uznane za nieczytelne po inspekcji manualnej.

Benchmark odzyskiwania zawierał 420 krótkich zapytań w języku naturalnym wygenerowanych między 5 a 20 sierpnia 2025 roku. Generowanie zapytań odbywało się według wykonalnego szablonu: potencjalne potrzeby informacyjne były pobrane od ludzi, instytucji, miejsc, przedziałów czasowych, zawodów, wydarzeń i tematów; każde zapytanie zostało znormalizowane do 2–9 słów; a docelowe odpowiednie zapisy zostały zidentyfikowane przed porównaniem systemów. Każde zapytanie było oceniane w pięciu warunkach odzyskiwania, co dało 2100 dopasowanych obserwacji zapytań i warunków.

Etykietowanie referencyjne i kontrola jakości

Etykietowanie referencyjne było wykonywane od 1 maja do 15 lipca 2025 roku przez trzech anotatorów: dwóch pracowników archiwalnych doświadczonych w katalogowaniu opisowym oraz jednego badacza z zakresu humanistyki cyfrowej doświadczonego w ocenie historycznych dokumentów. Przewodnik do anotykowania definiował klasy dokumentów, kategorie kontekstu językowego, kategorie okresów historycznych, pola kompletności metadan, kategorie nazw własnych oraz zasady wyboru regionów oceny OCR.

Do oceny OCR anotatorzy wybierali reprezentatywne regiony zawierające tekst, które obejmowały nagłówki, nazwiska, daty, terminy instytucjonalne, notatki marginalne, wpisy tabelaryczne i, jeśli były obecne, obszary układu o niskim poziomie hałasu. Gdy strona zawierała wiele regionów tekstowych, wybrany region musiał być istotny dla odzyskiwania i musiał zawierać wystarczającą liczbę znaków do obliczenia CER i WER. Spory były początkowo rozwiązywane poprzez dyskusję między dwoma głównymi anotatorami; nierozwiązane przypadki były rozstrzygane przez badacza z zakresu humanistyki cyfrowej.

Kontrola jakości wykorzystywała losową 12% podzbiór zapisów. Zgodność między anotatorami dla głównego typu dokumentu wynosiła kappa Cohena = 0,86, co sugeruje znaczną zgodność. W dziennik rozstrzygania zachowało się oryginalne i ostateczne etykiety, kategorię sporu oraz powód rozwiązania, aby przyszli użytkownicy mogli przeprowadzić audyt definicji klas i przypadków brzegowych.

Przetwarzanie obrazów

Wszystkie obrazy były przetwarzane na poziomie zapisu przy użyciu Pythona 3.11.8 z OpenCV 4.9.0, Pillow 10.3.0 i NumPy 1.26.4. Każda strona wejściowa była konwertowana na 8-bitowy szary poziom, chyba że kolor zawierał informacje semantyczne, takie jak mapy, plakaty, znaczki lub anotacje kolorowe. Nachylenie było oszacowane za pomocą profili projekcji i wykrywania linii Hougha; deskewing był stosowany tylko wtedy, gdy bezwzględny k

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Korekta OCR poprawiła transkrypcję, zwłaszcza w zapisach odręcznych i tabelarycznych

Korekta optycznego rozpoznawania znaków poprawiła jakość transkrypcji we wszystkich ośmiu klasach dokumentów archiwalnych (n = 1 60 rekordów). Średni WER spadł z 0,529 ± 0,172 do 0,384 ± 0,123, przy średniej zmianie parzystej wynoszącej −0,14 (95% CI, −0,149 do −0,139; test Wilcoxona dla rang podpisanych P < 0,01). Średni CER spadł z 0,37 ± 0,126 do 0,258 ± 0,086, przy średniej zmi...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

To protokollo pokazuje, że odkrywanie w historycznych archiwach cyfrowych najbardziej poprawiło się, gdy poprawka OCR, wizualne zrozumienie dokumentów i konserwatywne wzbogacanie metadanych były oceniane jako połączone komponenty odzyskiwania, a nie jako izolowane techniczne ulepszenia. Największe zdobycze OCR miały miejsce w materiałach rękopiśmiennych, tabelarycznych i rejestrowych, co potwierdza wartość korekty po analizie dla klas dokumentów, w których rozpoznawanie bazowe jest najsłabsze. Jednocześnie pozostałe błęd...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy nie mają nic do ujawnienia.

Podziękowania

Autorzy szczerze dziękują dwóm doświadczonym pracownikom archiwalnym oraz profesjonalnemu badaczowi z zakresu humanistyki cyfrowej za ich cenny wkład w komentowanie tekstu i kontrolę jakości. Badania te były wspierane finansowo przez Plan Projektów Naukowych i Technologicznych Archiwów Prowincji Jiangsu (Grant nr 2024-9) na budowę inteligentnego systemu archiwum opartego na mowie, oraz Plan Rozwoju Nauki i Technologii Prowincji Jiangsu dla Tradycyjnej Medycyny Chińskiej (Grant nr MS2025025) na badanie dziedzictwa i rozwoju szkół TCM z perspektywy archiwalnej.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow scripting, data processing, optical character recognition post-correction, and statistical support
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Statistical analysis and final figure generation
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractBaseline optical character recognition generation
Tesseract language packsTesseract OCR ProjectStudy-specific language packs; https://github.com/tesseract-ocr/tessdataPrimary and mixed-language optical character recognition decoding
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Deskewing, noise estimation, and image preprocessing
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Image input/output and format normalization
NumPyNumPy developersv1.26.4; https://numpy.org/Array computation for image and metric processing
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Tabular data handling and summary exports
SciPySciPy developersv1.13.1; https://scipy.org/Statistical tests and numerical utilities
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Statistical modeling and paired-comparison support
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Classification metrics, ROC/PR diagnostics, and validation utilities
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzEdit-distance candidate ranking for optical character recognition correction
spaCyExplosion AIv3.7.4; https://spacy.io/Named-entity processing with custom lexicon tables
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Visual document classifier training
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3 implementation and image transforms
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlVisual document classification backbone
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Semantic expansion for controlled-vocabulary candidates
Search-engine softwareElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25 indexing, retrieval, and ranking
Container engineDocker Inc.Docker v26.1.1; https://www.docker.com/Containerized retrieval environment
Linux operating systemCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Fixed operating environment for retrieval runs
Version-control systemGit projectGit v2.44.0; https://git-scm.com/Version control for configuration, vocabularies, scripts, and figure code
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/R-based figure rendering
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Supplementary visualization and quality-assurance plots
Annotation guidelineAuthors5 annotation sections; 8 document-class labels; OCR regions; entity labels; relevance judgments; adjudication rulesDefinitions for document classes, OCR regions, entities, relevance judgments, and adjudication
Archive-specific OCR lexiconAuthors6 lexicon categories: person variants, place names, institution names, date patterns, administrative terms, abbreviationsNames, places, institutions, administrative terms, and spelling variants
Controlled vocabulary mappingAuthors / archival repositories5 mapping rules linking OCR entities, visual class, title keywords, date coverage, and query topic to metadata fieldsSubject-heading matching and semantic expansion
Benchmark query setAuthors420 benchmark queries; 6 query topics; 3 difficulty levels; 8 target document classes; 4 historical periods; 6 language contextsMatched retrieval benchmark across five system arms
Relevance judgmentsAuthors / annotators2,100 query-system rows; 420 queries x 5 system arms; relevant totals, relevant-in-top-10 counts, graded relevance, and success flagsGround-truth surrogate for P@10, R@10, nDCG@10, and successful-search rate
Training diagnosticsAuthors20 epochs; training loss; validation loss; training accuracy; validation accuracy; macro-F1; weighted-F1; ROC-AUC; PR-AUCEpoch-level model diagnostic summaries
Computational hardwareAuthors8 CPU cores; 32 GB RAM; NVIDIA GPU-class training environmentReproducibility resource detail for JoVE submission
Dataset fileAuthorsdata.xlsx; 1,600 records; 17 variables; DOI listed in manuscript Data AvailabilityRecord-level source data for optical character recognition, metadata completeness, discoverability, and visual classification analyses

Bibliografia

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Tagi

In ynieriaWydanie 234Wydanie 234Warto pustaWydanieArchiwa cyfroweMultimodalna sztuczna inteligencjaKorekta OCRWzbogacanie metadanychKlasyfikacja wizualna i zapytania do zapis w historycznych