Artykuł badawczy

Możliwy do powtórzenia multimodalny przepływ pracy sztucznej inteligencji do odkrywania historycznych cyfrowych archiwów

DOI:

10.3791/71698

7 sierpnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Przedstawiamy tu protokół mający na celu poprawę odkrywania w historycznych archiwach cyfrowych poprzez integrację korekcji optycznego rozpoznawania znaków, klasyfikacji wizualnej dokumentów, wzbogacania metadan i ewaluacji odzyskiwania w nadzorowanym przepływie pracy.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Historyczne archiwa cyfrowe są coraz bardziej dostępne w wyszukiwarkach, ale odkrywanie pozostaje ograniczone, gdy błędy optycznego rozpoznawania znaków, wizualnie nierównorodne typy dokumentów i rzadkie metadane są obsługiwane osobno. Badanie to miało na celu opracowanie powtarzalnego protokołu, aby ocenić, czy konserwatywny multimodalny przepływ pracy sztucznej inteligencji może poprawić odzyskiwanie archiwalne bez zastępowania przeglądu przez archiwisty. Zebrano korpus 1600 scyfryfikowanych zapisów archiwalnych z ośmiu klas dokumentów i zastosowano 420-zapytaniowy benchmark, aby porównać pięć warunków odzyskiwania: indeksowanie bazowe, samodzielne korekty optycznego rozpoznawania znaków, samodzielna klasyfikacja wizualna, samodzielne wzbogacanie metadan i pełna multimodalna integracja. Wyniki na poziomie zapisu obejmowały wskaźnik błędów znaków (CER), wskaźnik błędów słów (WER), odzyskiwanie nazw własnych, dokładność klasyfikacji typów dokumentów, pewność predykcji, kompletność metadan i dopasowanie nagłówków tematycznych. Wyniki na poziomie zapytania obejmowały P@10, R@10, nDCG@10, czas do pierwszego odpowiedniego wyniku i wskaźnik udanych wyszukiwań. Korekta optycznego rozpoznawania znaków najmocniej zmniejszała WER dla ręcznie pisanych listów, ksieg rachunkowych i ksiąg rejestrowych; wizualne dostrajanie poprawiało dokładność klasyfikacji najbardziej dla map, plakatów, gazet i ksiąg rejestrowych; a wzbogacanie metadan zwiększało kompletność w całych okresach historycznych. Pełny multimodalny warunek osiągnął najwyższą wydajność odzyskiwania (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) i zmniejszył średni czas do pierwszego odpowiedniego wyniku z 156,079 s do 58,485 s. Te wyniki wspierają modularny, poddany rewidencji przepływ pracy, w którym tekst, obraz i sygnały opisowe są łączone według wyraźnych progów i poddają się przeglądowi przez człowieka.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Archiwa cyfrowe rozwijają się szybko i obecnie wspierają badania w dziedzinie historii, dziedzictwa kulturowego, administracji publicznej i cyfrowych nauk humanistycznych. Jednak dostęp jest nadal nierówny, ponieważ archiwa zawierają często pogorszone wyniki optycznego rozpoznawania znaków, wizualnie zróżnicowane układy stron, niekonsekwentne praktyki katalogowania oraz historycznie zmienne nazwy, miejsca i instytucje. Ograniczenia te wpływają nie tylko na jakość transkrypcji, ale także na odzyskiwanie, filtrowanie i dalsze wykorzystanie scyfryzowanych kolekcji1,2,3,4,5,6,7.

Istniejące badania nad sztuczną inteligencją w dokumentach oraz archiwum i odzyskiwaniem poprawiły poszczególne komponenty, takie jak poprawka optycznego rozpoznawania znaków, klasyfikowanie obrazów dokumentów, normalizacja metadan, modelowanie tematów, osadzenia słów, odzyskiwanie neuronowe i praktyki zarządzania danymi8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25. Jednak wiele systemów archiwalnych nadal ocenia te komponenty oddzielnie, co utrudnia określenie, czy połączony przepływ pracy poprawia odkrywanie w realnych warunkach wyszukiwania. Lukę metodologiczną, na którą zwraca się tutaj uwagę, jest brak reproduktybilnego, podlegającego audytowi protokołu, który łączy moduły tekstowe, obrazowe i metadanych z wynikami odzyskiwania w jednym przepływie pracy archiwalnym.

Głównym celem było przetestowanie, czy korekcja optycznego rozpoznawania znaków, klasyfikacja wizualna dokumentów i wzbogacanie metadan ograniczonych regułami dają uzupełniające poprawki, gdy są oceniane na podstawie tego samego kryterium odzyskiwania.

Przypuszczaliśmy, że pełny warunek multimodalny przewyższy każdy warunek pojedynczego komponentu, ponieważ odkrywanie archiwalne zależy od interakcji czytelnego tekstu, wizualnie interpretowalnej struktury dokumentu i przeszukiwalnych metadan opisowych. Przepływ pracy został zaprojektowany konserwatywnie: zautomatyzowane wyniki mogły wzbogacać indeksy odzyskiwania, ale prognozy o niskiej pewności były oznaczane do przeglądu, a nie używane jako autorytatywny opis archiwalny.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badania wykorzystały scyfryzowane zapisy archiwalne i symulowane zapytania do odzyskiwania informacji jako jednostki analizy. Archiwum może ograniczać dostęp do wrażliwych lub chronionych kulturowo zapisów. Przed przetworzeniem lub udostępnieniem jakichkolwiek zapisów należy przestrzegać zasad dostępu do repozytoriów, instytucjonalnych procedur dotyczących bezpieczeństwa danych oraz wymagań dotyczących anonimizacji. Podczas tego cyfrowego przepływu pracy nie powstały żadne niebezpieczne odpady chemiczne, biologiczne, ostre, radioaktywne ani inne regulowane odpady laboratoryjne.

Projekt badania i budowa korpusu

Rysunek 1 przedstawia kompletny przepływ pracy badania, w tym budowę korpusu, etykietowanie referencyjne, przetwarzanie obrazów, generowanie OCR i poprawę po korekcji, klasyfikację wizualną, wzbogacanie metadan, budowę indeksu, ewaluację odzyskiwania, analizę statystyczną i pakiet do reprodukcji.

Budowa korpusu przebiegała od 15 stycznia do 30 kwietnia 2025 roku, po czym nastąpiło projektowanie i debugowanie systemu od 1 maja do 31 października 2025 roku. Korpus zawierał 1600 scyfryzowanych zapisów archiwalnych wybranych z ośmiu repozytoriów reprezentujących systemy państwowe, miejskie, religijne, muzealne, uniwersyteckie i biblioteczne. Ramka prób była zróżnicowana według repozytoriów i klas dokumentów, aby zachować różnorodność archiwalną wśród ręcznie pisanych listów, ksiąg rachunkowych, map, gazet, fotografii z podpisami, plakatów, ksiąg rejestrowych i korespondencji pisowni maszynowej.

Dla każdego kandydackiego zapisu log selekcji zawierał identyfikator repozytorium lub kolekcji, identyfikator katalogowy, klasę dokumentu, przybliżony okres historyczny, dominujący kontekst językowy, dostępny format obrazu, rozdzielczość obrazu, liczbę stron oraz podstawowe pola opisowe. Każdy zapis musiał spełniać następujące wymogi: stabilny identyfikator katalogowy; co najmniej jedno zdjęcie strony w formacie TIFF, JPEG lub PNG; rozdzielczość obrazu źródłowego co najmniej 150 dpi; czytelną treść tekstową, tabelaryczną lub strukturalną; oraz przypisanie do jednej z ośmiu wstępnie zdefiniowanych klas dokumentów. Kryteria wykluczenia to dokładne duplikaty, puste strony odwrotne, obrazy przycięte do punktu, w którym brakowało ponad 30% obszaru zawierającego tekst oraz zapisy uznane za nieczytelne po inspekcji manualnej.

Benchmark odzyskiwania zawierał 420 krótkich zapytań w języku naturalnym wygenerowanych między 5 a 20 sierpnia 2025 roku. Generowanie zapytań odbywało się według wykonalnego szablonu: potencjalne potrzeby informacyjne były pobrane od ludzi, instytucji, miejsc, przedziałów czasowych, zawodów, wydarzeń i tematów; każde zapytanie zostało znormalizowane do 2–9 słów; a docelowe odpowiednie zapisy zostały zidentyfikowane przed porównaniem systemów. Każde zapytanie było oceniane w pięciu warunkach odzyskiwania, co dało 2100 dopasowanych obserwacji zapytań i warunków.

Etykietowanie referencyjne i kontrola jakości

Etykietowanie referencyjne było wykonywane od 1 maja do 15 lipca 2025 roku przez trzech anotatorów: dwóch pracowników archiwalnych doświadczonych w katalogowaniu opisowym oraz jednego badacza z zakresu humanistyki cyfrowej doświadczonego w ocenie historycznych dokumentów. Przewodnik do anotykowania definiował klasy dokumentów, kategorie kontekstu językowego, kategorie okresów historycznych, pola kompletności metadan, kategorie nazw własnych oraz zasady wyboru regionów oceny OCR.

Do oceny OCR anotatorzy wybierali reprezentatywne regiony zawierające tekst, które obejmowały nagłówki, nazwiska, daty, terminy instytucjonalne, notatki marginalne, wpisy tabelaryczne i, jeśli były obecne, obszary układu o niskim poziomie hałasu. Gdy strona zawierała wiele regionów tekstowych, wybrany region musiał być istotny dla odzyskiwania i musiał zawierać wystarczającą liczbę znaków do obliczenia CER i WER. Spory były początkowo rozwiązywane poprzez dyskusję między dwoma głównymi anotatorami; nierozwiązane przypadki były rozstrzygane przez badacza z zakresu humanistyki cyfrowej.

Kontrola jakości wykorzystywała losową 12% podzbiór zapisów. Zgodność między anotatorami dla głównego typu dokumentu wynosiła kappa Cohena = 0,86, co sugeruje znaczną zgodność. W dziennik rozstrzygania zachowało się oryginalne i ostateczne etykiety, kategorię sporu oraz powód rozwiązania, aby przyszli użytkownicy mogli przeprowadzić audyt definicji klas i przypadków brzegowych.

Przetwarzanie obrazów

Wszystkie obrazy były przetwarzane na poziomie zapisu przy użyciu Pythona 3.11.8 z OpenCV 4.9.0, Pillow 10.3.0 i NumPy 1.26.4. Każda strona wejściowa była konwertowana na 8-bitowy szary poziom, chyba że kolor zawierał informacje semantyczne, takie jak mapy, plakaty, znaczki lub anotacje kolorowe. Nachylenie było oszacowane za pomocą profili projekcji i wykrywania linii Hougha; deskewing był stosowany tylko wtedy, gdy bezwzględny k

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Korekta OCR poprawiła transkrypcję, szczególnie w zapisach odręcznych i tabelarycznych

Korekta optycznego rozpoznawania znaków poprawiła jakość transkrypcji we wszystkich ośmiu klasach dokumentów archiwalnych (n = 1,600 rekordów). Średni WER spadł z 0,529 ± 0,172 do 0,384 ± 0,123, przy średniej zmianie parzystej wynoszącej −0,144 (95% CI, −0,149 do −0,139; test znaków rang Wilcoxona P < 0,001). Średni CER spadł z 0,377 ± 0,126 do 0,258 ± 0,086, przy średniej zmianie parzystej wynoszącej −0,119 (95% CI, −0,123 do −0,116; test znaków rang Wilcoxona P < 0,001). Tabela 2 pokazuje, że bazowy WER był najwyższy dla listów pisanych ręcznie, ksiąg rachunkowych i ksiąg rejestrowych, co wskazuje na to, że rekordy najbardziej złożone wizualnie obarczone były największymi początkowymi trudnościami w rozpoznawaniu.

Po korekcie wartość WER spadła we wszystkich klasach dokumentów. Największe średnie pary redukcje WER odnotowano w listach pisanych ręcznie (n = 262; −0,200; 95% CI, −0,213 do −0,188), księgach rachunkowych (n = 263; −0,195; 95% CI, −0,206 do −0,183) oraz księgach rejestrowych (n = 194; −0,173; 95% CI, −0,187 do −0,160). CER wykazywała ten sam wzorzec, co potwierdza interpretację, że moduł pokorekcyjny przyniósł korzyści przede wszystkim w przypadku trudnych zapisów odręcznych, tabelarycznych i o mieszanym układzie.

Przywołanie nazwanych encji również uległo poprawie we wszystkich typach dokumentów, co przedstawiono w tabeli podsumowującej. Największe wzrosty odnotowano w przypadku listów pisanych odręcznie (0,302–0,440), ksiąg rachunkowych (0,336–0,471) oraz ksiąg rejestrowych (0,369–0,504). Korespondencja maszynowa osiągnęła najwyższe przywołanie nazwanych encji po korekcie (0,646), jednak zysk bezwzględny był mniejszy, ponieważ bazowe rozpoznawanie dla tej klasy było już na wyższym poziomie. Rysunek 2 podsumowuje zależność między bazowym CER a WER na poziomie rekordów, związek między intensywnością pisma odręcznego a korzyścią z korekty oraz zmianę w wykrywalności na poziomie rekordów po korekcie.

Klasyfikacja dokumentów wizualnych uległa ogólnej poprawie, jednak wzrost wydajności był nierównomierny w poszczególnych klasach

Wizualna klasyfikacja dokumentów uległa ogólnej poprawie w zestawie testowym obejmującym 1 600 rekordów. Dokładność Top-1 wzrosła z 0,717 do 0,796 (zmiana bezwzględna: 0,079; test chi-kwadrat McNemara = 27,33; P < 0,001), a średnia pewność predykcji wzrosła z 0,736 ± 0,131 do 0,800 ± 0,108 (średnia zmiana sparowana: 0,064; 95% CI: 0,057–0,071; sparowany test t P < 0,001). Jak pokazano w Tabeli 3, siedem z ośmiu klas uległo poprawie po dostrojeniu specyficznym dla archiwum, przy czym największe zyski odnotowano dla map, plakatów, gazet i ksiąg rejestrowych.

Pisemna korespondencja nie uległa znaczącej poprawie po dostrojeniu (0.796–0.791), co sugeruje, że jej bazowe cechy wizualne były już stabilne, a procedura treningowa nie dodała istotnej separacji klas dla tej kategorii.

Rysunek 3 podsumowuje wydajność klasyfikacji dokumentów wizualnych przed i po dostrojeniu specyficznym dla archiwum; źródłowy arkusz danych zawiera wartości straty i dokładności dla zbioru treningowego i walidacyjnego z 20 epok, a także podsumowania diagnostyczne dla wskaźników macro-F1, weighted-F1, ROC-AUC oraz PR-AUC.

Wzbogacenie metadanych poprawiło kompletność opisową we wszystkich okresach historycznych (n = 1 600 rekordów). Średnia kompletność wzrosła z 0,657 ± 0,125 do 0,907 ± 0,070, przy średniej zmianie parzystej wynoszącej 0,250 (95% CI, 0,243–0,257; test znaków Wilcoxona P < 0,001). Jak pokazano w Tabeli 4, bazowa kompletność była najniższa dla lat 1850–1879 i rosła w późniejszych okresach przed wzbogaceniem. Rysunek 4 podsumowuje poprawę kompletności metadanych, nowo utworzone pola metadanych w zależności od typu dokumentu oraz wzrost dopasowań nagłówków przedmiotowych w poszczególnych okresach historycznych.

Po wzbogaceniu kompletność wzrosła w każdym okresie historycznym: 1850–1879 (n = 281; średnia zmiana, 0,207; 95% CI, 0,191–0,223), 1880–1909 (n = 474; średnia zmiana, 0,236; 95% CI, 0,223–0,248), 1910–1939 (n = 549; średnia zmiana, 0,277; 95% CI, 0,265–0,288) oraz 1940–1969 (n = 296; średnia zmiana, 0,263; 95% CI, 0,247–0,279). Średnia liczba wypełnionych pól również konsekwentnie wzrosła we wszystkich okresach.

Dopasowanie tematów do nagłówków uległo równoległej poprawie. Bazowe wskaźniki dopasowania wynosiły od 64,3% do 69,4%, natomiast wskaźniki dopasowania po wzbogaceniu mieściły się w zakresie od 82,1% do 85,4%. Największy bezwzględny wzrost odnotowano w najwcześniejszym okresie (Delta = 0,178), co potwierdza wartość konserwatywnego wzbogacania dla rekordów z rzadkim opisem początkowym.

Wydajność wyszukiwania poprawiła się we wszystkich ulepszonych systemach, przy czym największe zyski odnotowano przy pełnej integracji multimodalnej

Efektywność wyszukiwania uległa poprawie w każdym z warunków ulepszenia w stosunku do wartości bazowej, jednak skala poprawy różniła się w zależności od wariantu systemu (n = 420 dopasowanych zapytań referencyjnych). Ogólne wyniki wyszukiwania przedstawiono w Tabeli 5. Wydajność bazowa była niska: P@10 = 0.394, R@10 = 0.238, nDCG@10 = 0.392, średni czas do uzyskania pierwszego istotnego wyniku = 156.079 s, a odsetek udanych wyszukiwań = 5,0% (21/420; 95% CI, 3,3%–7,5%). Rysunek 5 podsumowuje wydajność wyszukiwania w pięciu eksperymentalnych wariantach systemu, w tym ogólne metryki wyszukiwania, wskaźniki sukcesu na poziomie tematycznym oraz warstwy trudności zapytań.

Wszystkie trzy systemy jednoskładnikowe w ujęciu zbiorczym wykazały lepsze wyniki niż system bazowy. Korekta za pomocą optycznego rozpoznawania znaków zwiększyła P@10 do 0,484, R@10 do 0,346 oraz nDCG@10 do 0,475, jednocześnie skracając czas do uzyskania pierwszego istotnego wyniku do 124,261 s i zwiększając wskaźnik udanych wyszukiwań do 30,2% (127/420; 95% CI, 26,0%–34,8%). Klasyfikacja wizualna pozwoliła uzyskać P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, średni czas do uzyskania pierwszego istotnego wyniku = 131,985 s oraz wskaźnik udanych wyszukiwań = 22,9% (96/420; 95% CI, 19,1%–27,1%). Wzbogacenie metadanych zapewniło najwyższą skuteczność wyszukiwania wśród systemów jednoskładnikowych, z P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, średnim czasem do uzyskania pierwszego istotnego wyniku = 117,474 s oraz wskaźnikiem udanych wyszukiwań na poziomie 38,3% (161/420; 95% CI, 33,8%–43,1%).

Pełny system multimodalny wykazał najlepsze wyniki we wszystkich punktach końcowych wyszukiwania. Wartość P@10 wzrosła z 0,394 w punkcie odniesienia do 0,624, R@10 z 0,238 do 0,492, a nDCG@10 z 0,392 do 0,634. Średni czas do uzyskania pierwszego istotnego wyniku zmniejszył się ze 156,079 s do 58,485 s, a wskaźnik udanych wyszukiwań wzrósł z 5,0% do 95,5% (401/420; 95% CI, 93,0%–97,1%). Wartości te odpowiadają bezwzględnym przyrostom wynoszącym 0,230 dla P@10, 0,254 dla R@10 oraz 0,242 dla nDCG@10.

Wyszukiwanie specyficzne dla tematu również uległo poprawie w warunkach pełnej integracji multimodalnej. Wskaźniki sukcesu wyszukiwania wzrosły w kategoriach osób, instytucji, miejsc, zawodów, zdarzeń i tematów przedmiotowych, przy czym największy praktyczny wzrost odnotowano w kategorii zawodów, gdzie bazowy wskaźnik sukcesu wynosił 0,0% i wzrósł do 90,0% w warunkach pełnej multimodalności. Zapytania o nazwy miejsc wykazały najwyższą skuteczność bazową, ale również zyskały dzięki integracji multimodalnej.

Zyski multimodalne różniły się w zależności od warstw dokumentów, okresów i języków

Analizy podgrup wykazały, że zyski z multimodalności były szeroko rozproszone w różnych typach dokumentów, okresach historycznych i kontekstach językowych, choć skala poprawy była zróżnicowana. Ta heterogeniczność wskazuje, że przepływ pracy powinien być oceniany w ramach każdej docelowej kolekcji, zamiast zakładać generowanie jednolitych korzyści. Rycina 6 przedstawia heterogeniczność zysków z wyszukiwania multimodalnego w zależności od docelowego typu dokumentu, okresu historycznego i kontekstu językowego.

Na poziomie typu dokumentu wskaźnik nDCG@10 uległ poprawie we wszystkich klasach docelowych. Wyraźne wzrosty odnotowano w przypadku fotografii z podpisami, listów pisanych odręcznie, map, ksiąg rachunkowych i ksiąg rejestrowych, natomiast w przypadku gazet i korespondencji maszynopisanej poprawa była bardziej umiarkowana. Wzorce te sugerują, że dokumenty z niskiej jakości początkowymi metadanymi lub złożoną strukturą wizualną odnoszą największe korzyści z połączenia sygnałów tekstowych, obrazowych i metadanych.

Na poziomie okresów historycznych, R@10 wzrosło z 0,175 do 0,429 dla lat 1850–1879 i osiągnęło wartość 0,506 dla lat 1880–1909, 0,501 dla 1910–1939 oraz 0,519 dla 1940–1969 przy pełnej integracji multimodalnej. Przyrosty były podobne w skali absolutnej we wszystkich okresach, co sugeruje, że wzbogacenie i skorygowana rozpoznawalność pomogły zarówno w przypadku wczesnych, rzadkich zapisów, jak i późniejszych rekordów z bogatszymi metadanymi bazowymi.

Wyniki w kontekście językowym wykazały podobny schemat. Wskaźnik P@10 w pełnym warunku multimodalnym osiągnął wartość 0,607 dla rekordów z mieszanym pismem łacińskim, 0,628 dla języka angielskiego, 0,618 dla francuskiego, 0,661 dla niemieckiego oraz 0,639 dla portugalskiego i hiszpańskiego. Największy wzrost precyzji odnotowano w przypadku rekordów z mieszanym pismem łacińskim, które charakteryzowały się najniższą precyzją bazową.

Wzorce na poziomie komponentów: wkłady komplementarne, a nie redundantne

Wszystkie te wyniki wykazują, że elementy protokołu są komplementarne, a nie redundantne. Korekcja OCR poprawiła rozpoznawalność tekstu, klasyfikacja wizualna dodała sygnały dotyczące typu dokumentu uwzględniające strukturę, a wzbogacenie metadanych rozszerzyło warstwę opisową podlegającą wyszukiwaniu. Pełny warunek multimodalny przyniósł najsilniejsze i najbardziej spójne zyski w zakresie wyszukiwania, co wspiera cel badania polegający na przetestowaniu audytowalnego, zorientowanego na wyszukiwanie przepływu pracy dla heterogenicznych archiwów cyfrowych.

Wyniki te wspierają model protokołu, w którym multimodalna sztuczna inteligencja wspomaga przeszukiwanie archiwów, zachowując jednocześnie potrzebę nadzoru nad repozytoriami, pochodzenia danych oraz weryfikacji eksperckiej.

Dostępność danych:

Zanonimizowany zestaw danych obejmujący 1 600 rekordów, wykorzystany w głównych analizach, jest dostępny w serwisie Zenodo jako plik data.xlsx (https://doi.org/10.5281/zenodo.20774456).

figure-results-1
Rysunek 1: Powtarzalny schemat pracy dla multimodalnego wyszukiwania w archiwach. (A) Konstrukcja korpusu z archiwalnych zapisów na poziomie repozytorium z przesiewową weryfikacją kryteriów włączenia/wyłączenia. (B) Etykietowanie referencyjne i kontrola jakości, obejmująca typ dokumentu, referencyjne obszary OCR, kontekst językowy, okres historyczny oraz kompletność metadanych. (C) Preprocessing obrazów, generowanie i postkorekcja OCR, wizualna klasyfikacja dokumentów oraz konserwatywne wzbogacanie metadanych. (D) Konstrukcja indeksu, pięcioetapowa ewaluacja wyszukiwania, analiza statystyczna i pakowanie zasobów. Skróty: OCR, optyczne rozpoznawanie znaków; CER, współczynnik błędów znaków; WER, współczynnik błędów słów. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

figure-results-2
Rycina 2: Struktura błędów optycznego rozpoznawania znaków na poziomie rekordu oraz wykrywalność po korekcie. (A) Bazowy CER w stosunku do bazowego WER w 1600 rekordach archiwalnych, z kolorami przypisanymi do typów dokumentów dla reprezentatywnych klas. (B) Zależność między skalowaną intensywnością pisma ręcznego a zmianą WER po korekcie; wartości ujemne wskazują na niższy WER po korekcie. Linia dopasowana i szary pas reprezentują trend liniowy oraz 95% przedział ufności. (C) Wynik wykrywalności na poziomie rekordu przed i po korekcie w podziale na typy dokumentów, ilustrujący przesunięcia w dowodach możliwych do wyszukania po korekcie. Skróty: CER, wskaźnik błędów znaków; WER, wskaźnik błędów słów. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

figure-results-3
Rycina 3: Wizualna klasyfikacja dokumentów przed i po dostrojeniu specyficznym dla archiwum. (A) Dokładność Top-1 w zależności od typu dokumentu w punkcie wyjścia oraz po dostrojeniu. (B) Rozkłady pewności dla poprawnych i błędnych predykcji w warunkach wyjściowych i po dostrojeniu. (C) Macierz wydajności na poziomie klas podsumowująca dokładność Top-1 oraz średnią pewność a posteriori przed i po dostrojeniu. Dane diagnostyczne modelu obejmują krzywe straty/dokładności z 20 epok, macro-F1, weighted-F1, ROC-AUC oraz PR-AUC. Prosimy kliknąć tutaj, aby wyświetlić większą wersję tej ryciny.

figure-results-4
Rysunek 4: Kompletność metadanych i zgodność haseł przedmiotowych po konserwatywnym wzbogaceniu. (A) Kompletność metadanych na poziomie rekordów przed i po wzbogaceniu. (B) Nowo uzupełnione pola metadanych w zależności od typu dokumentu. (C) Wzrost zgodności haseł przedmiotowych w różnych okresach historycznych. Kompletność obliczano jako liczbę wypełnionych właściwych pól podstawowych podzieloną przez całkowitą liczbę właściwych pól podstawowych. Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tego rysunku.

figure-results-5
Rysunek 5: Wydajność wyszukiwania w pięciu wariantach systemu eksperymentalnego. (A) Ogólne wartości P@10, R@10, nDCG@10, czas do uzyskania pierwszego istotnego wyniku oraz wskaźnik sukcesu wyszukiwania dla wariantu bazowego, korekcji optycznego rozpoznawania znaków, klasyfikacji wizualnej, wzbogacania metadanych oraz pełnej integracji multimodalnej. (B) Wykres bąbelkowy wskaźnika sukcesu wyszukiwania w zależności od tematu zapytania i wariantu systemu; kolor oznacza wariant systemu, a rozmiar bąbla oznacza procent sukcesu. (C) P@10, R@10 oraz nDCG@10 w podziale na łatwe, średnie i trudne poziomy trudności zapytań. (D) Alternatywny widok wskaźnika sukcesu na poziomie tematycznym, pokazujący rozkład udanych wyszukiwań w zależności od tematów zapytań i wariantów systemu. Skróty: P@10, precyzja dla 10 wyników (precision at 10); R@10, pełność dla 10 wyników (recall at 10); nDCG@10, znormalizowany skumulowany zysk z dyskontowaniem dla 10 wyników (normalized discounted cumulative gain at 10). Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

figure-results-6
Rycina 6: Heterogeniczność zysków z wyszukiwania multimodalnego w różnych podgrupach archiwalnych. (A) nDCG@10 w zależności od typu dokumentu docelowego i warunków wyszukiwania. (B) R@10 w zależności od okresu historycznego i warunków wyszukiwania. (C) P@10 w zależności od kontekstu językowego dokumentu docelowego i warunków wyszukiwania. Warunki to: Baseline, korekcja OCR, klasyfikacja wizualna, wzbogacenie metadanych, pełna integracja multimodalna, OCR+Text, Text+Visual+Metadata oraz Visual+Metadata. Rycina podkreśla, że zyski z podejścia multimodalnego są powszechne, ale niejednorodne w zależności od warstw dokumentów, okresów i języków. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Typ dokumentuliczba rekordówMediana stronRekordy pisane odręcznieŚredni bazowy
WER
Średnia bazowa
kompletność
metadanych
Średnia bazowa
odnajdywalność
(%)
List odręczny2622950.7290.64868.2
Księga rachunkowa263763.50.6790.67472.2
Mapa10212.90.4570.55274.1
Gazeta26180.80.4950.6675.5
Fotografia z podpisem17911.10.3740.60173.6
Plakat87100.4130.57174.8
Księga rejestrowa19410180.6160.70371.3
Korespondencja maszynowa252340.3150.68976.4

Tabela 1: Charakterystyka kolekcji archiwalnej według typu dokumentu. Tabela przedstawia liczbę rekordów, medianę liczby stron, procent rekordów zawierających pismo odręczne, średnią bazową wartość WER, średnią bazową kompletność metadanych oraz średnią bazową ocenę odkrywalności dla każdej z ośmiu klas dokumentów.

Typ dokumentuWielkość próby CER CER WER WER Czułość
rozpoznawania nazw własnych
Czułość
rozpoznawania nazw własnych
ΔWER
(n)(Baseline)(Post)(Baseline)(Post)(Baseline)(Post)
List ręcznie pisany2620.5310.3630.7290.5310.3020.44−0.198
Księga rachunkowa2630.490.3260.6790.4850.3360.471−0.194
Mapa1020.3220.2280.4570.3470.380.503−0.11
Gazeta2610.3540.2560.4950.3810.4360.558−0.114
Fotografia z podpisem1790.2570.1810.3740.2860.4940.616−0.088
Plakat870.2870.1990.4130.3160.4480.57−0.097
Księga rejestrowa1940.4420.2930.6160.4390.3690.504−0.177
Korespondencja maszynowa2520.2190.1550.3150.2320.5240.646−.083

Tabela 2: Wydajność OCR przed i po postkorekcie w zależności od typu dokumentu. CER i WER obliczono w odniesieniu do transkrypcji referencyjnych; pełność (recall) dla nazw własnych obliczono w odniesieniu do ręcznie oznakowanych encji osób, miejsc, instytucji i dat. Delta WER to WER po korekcie minus WER bazowy.

Typ dokumentunDokładność,
baseline
Dokładność,
po interwencji
Poziom ufności,
baseline
Poziom ufności,
po interwencji
ΔDokładność
List ręcznie pisany2620.6150.6450.6160.6550.03
Księga główna2630.7070.7490.7250.7670.042
Mapa1020.7650.9020.8010.8990.137
Gazeta2610.7160.8430.7280.830.127
Fotografia z podpisem1790.8150.8690.8240.890.054
Plakat870.7710.9030.7920.8890.132
Księga rejestrowa1940.6870.7930.7010.7870.106
Korespondencja maszynowa2520.7960.7910.8040.82-0.005

Tabela 3: Wydajność wizualnej klasyfikacji dokumentów przed i po dostrojeniu specyficznym dla archiwum. Tabela przedstawia wielkość próby, dokładność top-1, średnią pewność a posteriori oraz zmianę dokładności w zależności od typu dokumentu. Dane diagnostyczne obejmują 20 wierszy na poziomie epok z wartościami macro-F1, weighted-F1, ROC-AUC, PR-AUC, stratą treningową, stratą walidacyjną, dokładnością treningową i dokładnością walidacyjną.

Kompletność Kompletność Wypełnione pola Wypełnione pola Zgodność z
hasłem przedmiotowym
Zgodność z
hasłem przedmiotowym
Δ KompletnośćΔ Zgodność z
hasłem przedmiotowym
(Wyjściowo)(Po interwencji)(Wyjściowo)(Po interwencji)(Wyjściowo)(Po interwencji)
0.5340.8684.2748.5840.6430.8210.3340.178
0.6070.8984.8388.7090.6720.8410.2910.169
0.680.9275.4269.0950.6860.8490.2470.163
0.6860.9225.488.9530.6940.8540.2360.16

Tabela 4: Wzbogacenie metadanych według okresu historycznego. Kompletność to proporcja wypełnionych właściwych podstawowych pól opisowych dla danego rekordu; wypełnione pola podano jako średnie liczby; dopasowanie nagłówka tematycznego wskazuje, czy dowody na poziomie rekordu potwierdzały co najmniej jedną etykietę tematu ze słownika kontrolowanego.

Moduł systemuliczba zapytań nP@10R@10nDCG@10Czas do pierwszego istotnego
wyniku (s)
Wskaźnik udanych wyszukiwań
(%)
Baseline4200.3940.2380.392156.0795
Korekcja OCR4200.4840.3460.475124.26130.2
Klasyfikacja wizualna4200.490.3020.478131.98522.9
Wzbogacanie metadanych4200.5070.3470.513117.47438.3
Pełny multimodalny4200.6240.4920.63458.48595.5

Tabela 5: Wydajność wyszukiwania dla pięciu ramion systemu eksperymentalnego. Wskaźniki P@10, R@10, nDCG@10, czas do pierwszego istotnego wyniku oraz wskaźnik sukcesu wyszukiwania zostały obliczone dla zestawu 420 zapytań referencyjnych w warunkach zapytań dopasowanych.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To protokollo pokazuje, że odkrywanie w historycznych archiwach cyfrowych najbardziej poprawiło się, gdy poprawka OCR, wizualne zrozumienie dokumentów i konserwatywne wzbogacanie metadanych były oceniane jako połączone komponenty odzyskiwania, a nie jako izolowane techniczne ulepszenia. Największe zdobycze OCR miały miejsce w materiałach rękopiśmiennych, tabelarycznych i rejestrowych, co potwierdza wartość korekty po analizie dla klas dokumentów, w których rozpoznawanie bazowe jest najsłabsze. Jednocześnie pozostałe błędy po korekcji pokazują, że oczyszczanie OCR nie może być traktowane jako ostateczna transkrypcja i musi pozostać podlegające weryfikacji.

Wyniki klasyfikacji wizualnej również wymagają ostrożnej interpretacji. Dostrajanie poprawiło wizualnie wyróżniające się klasy, takie jak mapy, plakaty, gazety i księgi rejestrowe, ale zdobycze były mniejsze w przypadku rękopiśmiennych listów i ksiąg rachunkowych, gdzie układy się nakładają, a granice klas są mniej wizualnie rozdzielne. Stosunkowo niewielki rozmiar korpusu oznacza, że wydajność klasyfikacji powinna być interpretowana jako dowód protokołu, a nie jako dowód, że model multimodalny produkcyjny może być trenowany na podstawie 1600 zapisów samodzielnie. Przyszłe walidacje powinny porównywać EfficientNet-B3 z transformatorami dokumentów, Vision Transformers, Swin Transformers, ConvNeXt i multimodalnymi modelami fundacyjnymi dokumentów8,11,12,13,14,15,16,17,18.

Wzbogacanie metadanych znacząco przyczyniło się do odzyskiwania poprzez rozszerzenie rozproszonych opisowych zapisów w przeszukiwalne pola, zachowując informacje źródłowe i dotyczące pewności. To odkrycie jest zgodne z potrzebą archiwalną bardziej bogatych punktów dostępu, ale również podnosi ryzyko dotyczące zarządzania. Zautomatyzowane wzbogacanie może wzmacniać błędy OCR, zbyt agresywnie normalizować historycznie niejednoznaczne nazwy lub wprowadzać uprzedzenia, jeśli kontrolowane słownictwo jest niekompletne. Z tego powodu, przepływ pracy używa progów pewności, rejestracji źródeł i flag przeglądu zamiast całkowicie zautomatyzowanej wymiany zapisów katalogowych.

Ocena odzyskiwania dostarcza dowodów efektów uzupełniających modułów, ale ma ograniczenia. Obecne porównanie używało warunków bazowych i wewnętrznych ablacji modułów; nie porównano z gęstym odzyskiwaniem, późnymi rankerami interakcji, takimi jak ColBERT, hybrydowym odzyskiwaniem rozproszonym-gęstym, neuronowym ponownym rangowaniem lub systemami generowania wzmacnianych odzyskiwaniem22,23,24. Te podejścia powinny być dodane w przyszłej pracy, aby ustalić, czy obserwowane zdobycze multimodalne pozostają konkurencyjne w stosunku do obecnych architektur odzyskiwania.

Implementacja również wymaga uwagi na wycieki danych, ograniczenia obliczeniowe i skalowalność. Wzbogacanie używało wyjść optycznego rozpoznawania znaków, wizualnych przewidywań i istniejących metadanych, więc podział na trening/walidację/testowanie i ocena zapytań musi być oddzielona od decyzji dotyczących wzbogacania. Przyszłe wdrożenia powinny raportować sprzęt, czas wykonania, użycie pamięci, rozmiar indeksu i koszt na 1000 zapisów. Podejścia do przywracania obrazów z sąsiedniej pracy wizji komputerowej, w tym modele usuwania okluzji oparte na uważności wieloskalowej, mogą zainspirować przyszłe eksperymenty przetwarzania wstępnego, ale powinny być starannie testowane, ponieważ przepływy pracy archiwalne nie mogą halucynować ani zmieniać dowodów treści26,27.

Ogólnie, przepływ pracy najlepiej rozumieć jako protokół dostępu, który można powtórzyć, a nie jako zamiennik dla opisu archiwalnego. Multimodalna sztuczna inteligencja może poprawić odkrywanie, gdy jej wyjścia są ograniczone, rejestrowane i przeglądane, ale archiwisty są nadal niezbędni dla oceny proweniencji, decyzji dotyczących zarządzania dostępem i interpretacji historycznie złożonych zapisów21,25.

KONKLUZYJE:
Niniejsze badanie przetestowało, czy korekta optycznego rozpoznawania znaków, klasyfikacja wizualna dokumentów i konserwatywne wzbogacanie metadanych mogą służyć jako uzupełniające komponenty odzyskiwania w historycznych archiwach cyfrowych. Protokół poprawił transkrypcję, klasyfikację, kompletność metadanych i łączną wydajność odzyskiwania, zachowując jednocześnie wyraźne progi, rejestrację źródeł i zabezpieczenia przeglądu przez ludzi. Przepływ pracy powinien zatem być stosowany jako audytowalny protokół wsparcia dostępu, a nie jako zamiennik dla osądów archiwisty lub zarządzania repozytorium.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają nic do ujawnienia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy szczerze dziękują dwóm doświadczonym pracownikom archiwalnym oraz profesjonalnemu badaczowi z zakresu humanistyki cyfrowej za ich cenny wkład w komentowanie tekstu i kontrolę jakości. Badania te były wspierane finansowo przez Plan Projektów Naukowych i Technologicznych Archiwów Prowincji Jiangsu (Grant nr 2024-9) na budowę inteligentnego systemu archiwum opartego na mowie, oraz Plan Rozwoju Nauki i Technologii Prowincji Jiangsu dla Tradycyjnej Medycyny Chińskiej (Grant nr MS2025025) na badanie dziedzictwa i rozwoju szkół TCM z perspektywy archiwalnej.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow scripting, data processing, optical character recognition post-correction, and statistical support
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Statistical analysis and final figure generation
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractBaseline optical character recognition generation
Tesseract language packsTesseract OCR ProjectStudy-specific language packs; https://github.com/tesseract-ocr/tessdataPrimary and mixed-language optical character recognition decoding
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Deskewing, noise estimation, and image preprocessing
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Image input/output and format normalization
NumPyNumPy developersv1.26.4; https://numpy.org/Array computation for image and metric processing
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Tabular data handling and summary exports
SciPySciPy developersv1.13.1; https://scipy.org/Statistical tests and numerical utilities
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Statistical modeling and paired-comparison support
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Classification metrics, ROC/PR diagnostics, and validation utilities
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzEdit-distance candidate ranking for optical character recognition correction
spaCyExplosion AIv3.7.4; https://spacy.io/Named-entity processing with custom lexicon tables
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Visual document classifier training
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3 implementation and image transforms
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlVisual document classification backbone
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Semantic expansion for controlled-vocabulary candidates
Search-engine softwareElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25 indexing, retrieval, and ranking
Container engineDocker Inc.Docker v26.1.1; https://www.docker.com/Containerized retrieval environment
Linux operating systemCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Fixed operating environment for retrieval runs
Version-control systemGit projectGit v2.44.0; https://git-scm.com/Version control for configuration, vocabularies, scripts, and figure code
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/R-based figure rendering
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Supplementary visualization and quality-assurance plots
Annotation guidelineAuthors5 annotation sections; 8 document-class labels; OCR regions; entity labels; relevance judgments; adjudication rulesDefinitions for document classes, OCR regions, entities, relevance judgments, and adjudication
Archive-specific OCR lexiconAuthors6 lexicon categories: person variants, place names, institution names, date patterns, administrative terms, abbreviationsNames, places, institutions, administrative terms, and spelling variants
Controlled vocabulary mappingAuthors / archival repositories5 mapping rules linking OCR entities, visual class, title keywords, date coverage, and query topic to metadata fieldsSubject-heading matching and semantic expansion
Benchmark query setAuthors420 benchmark queries; 6 query topics; 3 difficulty levels; 8 target document classes; 4 historical periods; 6 language contextsMatched retrieval benchmark across five system arms
Relevance judgmentsAuthors / annotators2,100 query-system rows; 420 queries x 5 system arms; relevant totals, relevant-in-top-10 counts, graded relevance, and success flagsGround-truth surrogate for P@10, R@10, nDCG@10, and successful-search rate
Training diagnosticsAuthors20 epochs; training loss; validation loss; training accuracy; validation accuracy; macro-F1; weighted-F1; ROC-AUC; PR-AUCEpoch-level model diagnostic summaries
Computational hardwareAuthors8 CPU cores; 32 GB RAM; NVIDIA GPU-class training environmentReproducibility resource detail for JoVE submission
Dataset fileAuthorsdata.xlsx; 1,600 records; 17 variables; DOI listed in manuscript Data AvailabilityRecord-level source data for optical character recognition, metadata completeness, discoverability, and visual classification analyses

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

In ynieriaWydanie 234Wydanie 234Warto pustaWydanieArchiwa cyfroweMultimodalna sztuczna inteligencjaKorekta OCRWzbogacanie metadanychKlasyfikacja wizualna i zapytania do zapis w historycznych

Powiązane artykuły