Onderzoeksartikel

Reproducerbare multimodale kunstmatige intelligentie-workflow voor het ontdekken van historisch digitaal archief

DOI:

10.3791/71698

7 augustus 2026

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Hier presenteren we een protocol om ontdekking in historische digitale archieven te verbeteren door post-correctie optische tekenherkenning, visuele documentclassificatie, metadataverrijking en opzoekevaluatie te integreren in een auditeerbare workflow.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Historische digitale archieven zijn steeds meer doorzoekbaar, maar ontdekking blijft beperkt wanneer optische tekenherkenningsfouten, visueel heterogene documenttypen en schaarse metadata apart worden behandeld. Deze studie had als doel een reproduceerbaar protocol te ontwikkelen om te evalueren of een conservatieve multimodale workflow van kunstmatige intelligentie de archivering kan verbeteren zonder de archivarisbeoordeling te vervangen. Een corpus van 1.600 gedigitaliseerde archiefrecords uit acht documentklassen werd samengesteld, en een benchmark van 420 vragen werd gebruikt om vijf opzoekvoorwaarden te vergelijken: baseline-indexering, correctie alleen optische tekenherkenning, visuele classificatie alleen, metadataverrijking alleen en volledige multimodale integratie. Uitkomsten op recordniveau omvatten het foutpercentage van het teken (CER), het aantal woordfouten (WER), het terughalen van de naamgezel entiteit, nauwkeurigheid van documenttypeclassificatie, voorspellingsvertrouwen, volledigheid van metadata en overeenstemming met onderwerpheads. Resultaten op zoekniveau omvatten P@10, R@10, nDCG@10, tijd tot eerste relevante resultaat en succesvolle zoekpercentage. Optische tekenherkenningscorrectie verminderde WER het sterkst voor handgeschreven brieven, grootboeken en registerboeken; visuele fijnafstelling verbeterde de classificatienauwkeurigheid vooral voor kaarten, posters, kranten en registerboeken; en metadata-verrijking verhoogde de volledigheid over alle historische periodes. De volledige multimodale voorwaarde behaalde de hoogste ophaalprestatie (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) en verkortte de gemiddelde tijd tot het eerste relevante resultaat van 156,079 s naar 58,485 s. Deze resultaten ondersteunen een modulaire, controleerbare workflow waarin tekst, afbeelding en beschrijvende signalen worden gecombineerd onder expliciete drempels en menselijke beoordeling.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Digitale archieven zijn snel uitgebreid en ondersteunen nu onderzoek op het gebied van geschiedenis, cultureel erfgoed, openbaar bestuur en de digitale geesteswetenschappen. De toegang blijft echter ongelijk omdat archiefrecords vaak een slechte optische tekenherkenningsuitvoer, visueel diverse paginalay-outs, inconsistente catalogiseringspraktijken en historisch variabele namen, plaatsen en instellingen combineren. Deze beperkingen beïnvloeden niet alleen de transcriptiekwaliteit, maar ook het ophalen, filteren en downstream hergebruik van gedigitaliseerde collecties 1,2,3,4,5,6,7.

Bestaande documentkunstmatige intelligentie en archiefophaalstudies hebben individuele componenten verbeterd, zoals optische tekenherkenning na correctie, document-beeldclassificatie, metadata-normalisatie, onderwerpmodellering, woordembeddings, neurale opvraging en data-governance praktijk 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. Toch evalueren veel archiefsystemen deze componenten nog steeds apart, waardoor het moeilijk is te bepalen of een gecombineerde workflow de ontdekking verbetert onder realistische zoekomstandigheden. De methodologische kloof die hier wordt aangepakt, is het ontbreken van een reproduceerbaar, controleerbaar protocol dat tekst-, afbeeldings- en metadatamodules verbindt met ophaalresultaten in één enkele archiefworkflow.

Het centrale doel was te testen of correctie van optische tekenherkenning, visuele documentclassificatie en regelgebonden metadataverrijking complementaire verbeteringen opleveren wanneer ze worden geëvalueerd tegen dezelfde ophaalbenchmark.

We veronderstelden dat de volledige multimodale voorwaarde elke enkelcomponentconditie zou overtreffen, omdat archiefontdekking afhankelijk is van de interactie tussen leesbare tekst, visueel interpreteerbare documentstructuur en doorzoekbare beschrijvende metadata. De workflow was conservatief ontworpen: geautomatiseerde uitvoer konden de ophaalindices verrijken, maar voorspellingen met weinig vertrouwen werden gemarkeerd voor beoordeling in plaats van als gezaghebbende archiefbeschrijving te gebruiken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie gebruikte gedigitaliseerde archiefrecords en gesimuleerde opzoekopdrachten als analyse-eenheden. Archiefbewaarders kunnen de toegang tot gevoelige of cultureel beperkte documenten beperken. Volg de toegangsregels voor de repository, institutionele gegevensbeveiligingsprocedures en de-identificatievereisten voordat je documenten verwerkt of deelt. Er werd geen gevaarlijk chemisch, biologisch, scherp, radioactief of ander gereguleerd laboratoriumafval geproduceerd door deze digitale workflow.

Studieontwerp en corpusconstructie

Figuur 1 toont de volledige studieworkflow, inclusief corpusconstructie, referentielabeling, beeldvoorbewerking, OCR-generatie en postcorrectie, visuele classificatie, metadataverrijking, indexconstructie, opzoekevaluatie, statistische analyse en reproduceerbaarheidsverpakking.

De bouw van Corpus vond plaats van 15 januari tot 30 april 2025, gevolgd door systeemontwerp en debugging van 1 mei tot 31 oktober 2025. Het corpus bevatte 1.600 gedigitaliseerde archiefarchieven, geselecteerd uit acht depots die staats-, stads-, religieuze-, museum-, universiteits- en bibliotheeksystemen vertegenwoordigen. Het steekproefkader werd gestratificeerd op repository en documentklasse om archiefheerogeniteit te behouden over handgeschreven brieven, grootboeken, kaarten, kranten, foto's met bijschriften, posters, registerboeken en getypte correspondentie.

Voor elk kandidaatrecord registreerde het selectielog de repository- of collectie-identificatie, catalogusidentificatie, documentklasse, geschatte historische periode, dominante taalcontext, beschikbare afbeeldingsformaat, beeldresolutie, paginatelling en baseline beschrijvende velden. Opname vereiste het volgende: een stabiele catalogusidentificatie; minstens één TIFF-, JPEG- of PNG-paginaafbeelding; bronbeeldresolutie van minstens 150 DPI; leesbare tekstuele, tabel- of documentstructurele inhoud; en toewijzing aan een van de acht vooraf gedefinieerde documentklassen. Uitsluitingscriteria waren exacte duplicaten, blanco achterpagina's, afbeeldingen zo bijgesneden dat meer dan 30% van het tekstdragende gebied ontbrak, en dossiers die na handmatige inspectie onleesbaar werden beoordeeld.

De retrieval-benchmark bevatte 420 korte natuurlijke taalzoekopdrachten die tussen 5 augustus en 20 augustus 2025 werden gegenereerd. Querygeneratie volgde een reproduceerbaar sjabloon: de informatiebehoeften van kandidaten werden getest uit personen, instellingen, plaatsen, datums, beroepen, gebeurtenissen en thematische thema's; elke query werd genormaliseerd tot 2–9 woorden; en doelwitrelevante records werden geïdentificeerd vóór systeemvergelijking. Elke query werd geëvalueerd onder vijf opsporingsvoorwaarden, wat 2.100 gematchte zoekconditiewaarnemingen opleverde.

Referentielabeling en kwaliteitscontrole

Referentielabeling werd uitgevoerd van 1 mei tot 15 juli 2025 door drie annotatoren: twee archiefmedewerkers met ervaring in beschrijvende catalogisering en één onderzoeker in digitale geesteswetenschappen met ervaring in het beoordelen van historische documenten. De annotatiegids definieerde documentklassen, taalcontextcategorieën, historische periode-bins, metadata-volledigheidsvelden, naamgevende-entiteitscategorieën en regels voor het selecteren van OCR-evaluatieregio's.

Voor OCR-evaluatie selecteerden annotators representatieve tekstdragende regio's die kopjes, namen, data, institutionele termen, marginale notities, tabelvermeldingen en, indien aanwezig, ruisachtige indelingsgebieden bevatten. Wanneer een pagina meerdere tekstgebieden bevatte, moest het geselecteerde gebied relevant zijn voor het ophalen en voldoende tekens bevatten voor CER- en WER-berekeningen. Meningsverschillen werden eerst opgelost door overleg tussen de twee primaire annotators; Onopgeloste zaken werden beoordeeld door de Digital Humanities Researcher.

De kwaliteitscontrole gebruikte een willekeurige subset van 12% van de records. De overeenkomst tussen de annotators voor het primaire documenttype was Cohen's kappa = 0,86, wat een substantiële overeenkomst ondersteunt. Het beoordelingslogboek behield de oorspronkelijke en definitieve labels, de discord-categorie en de reden voor resolutie zodat toekomstige gebruikers klassedefinities en randgevallen kunnen controleren.

Beeldvoorbewerking

Alle afbeeldingen werden op recordniveau verwerkt met Python 3.11.8 met OpenCV 4.9.0, Pillow 10.3.0 en NumPy 1.26.4. Elke invoerpagina werd omgezet naar 8-bits grijstinten, tenzij kleur semantische informatie bevatte, zoals kaarten, posters, postzegels of kleurgecodeerde annotaties. De scheefheid werd geschat met behulp van projectieprofielen en Hough-lijndetectie; Deskewing werd alleen toegepast wanneer de absolute scheefhoek meer dan 1,5 graden was en was begrensd op 8,0 graden om vervorming te voorkomen.

Contrastversterking gebruikte contrastbeperkte adaptieve histogramequalizing met clipLimit = 2.0 en tileGridSize = 8 × 8. Een mediaanfilter met een kern van 3 × 10−23 werd alleen toegepast wanneer de geschatte achtergrondruisverhouding boven de 0,35 uitkwam. Beelden gemaakt bij 150–299 dpi werden opnieuw gesampled tot 300 dpi voor optische tekenherkenning; Beelden die al op 300 DPI of hoger zaten, werden niet opgeschaald. Er werd geen superresolutie, generatieve restauratie of inhoudshallucinatie gebruikt.

Doorloop, randverduistering, ongelijke papiertextuur, marginale stempels, handschrift, gelijnde lijnen en tafelgrenzen werden behouden tenzij deze OCR-regioselectie verhinderden. Deze regel behield archiefbewijs terwijl beeldinvoer voldoende werd gestandaardiseerd voor reproduceerbare OCR en classificatie.

OCR-basisgeneratie en post-correctie

De basislijn OCR werd gegenereerd met Tesseract OCR 5.3.0. Het primaire taalpakket werd geselecteerd uit de catalogustaal en het zichtbare schrift; meertalige decodering werd ingeschakeld wanneer de catalogustaal en het paginascript niet overeenkwamen. OCR-uitvoeren werden op recordniveau gegroepeerd en opgeslagen met pagina-identificaties, OCR-betrouwbaarheid, coördinaten voor boundingboxen indien beschikbaar, en ruwe tekst vóór correctie.

Post-OCR-correctie gebruikte een conservatieve procedure in drie fasen. Ten eerste corrigeerde normalisatie op tekenniveau frequente historische herkenningsverwarringen, waaronder ligaturen, long-s/short-s-substituties, gefragmenteerde interpunctie en cijferlettersubstituties. Ten tweede gebruikte token-niveau correctie kandidaten op bewerkafstand en frequentie uit een archiefspecifiek lexicon van persoonsnamen, plaatsnamen, instellingen, administratieve termen en historische spellingvarianten. Ten derde valideerde regelgebaseerde sequentiecontroles benoemde entiteiten en data op basis van bewijs uit context en metadata.

Kandidaatvervangers werden alleen geaccepteerd wanneer het vertrouwen in posterior correctie boven de 0,80 uitkwam; Vervangingen van naamgevende entiteiten vereisten een betrouwbaarheid van ten minste 0,85. Kandidaten onder de drempel werden als OCR-tekst behouden maar gemarkeerd voor beoordeling. CER werd berekend als de Levenshtein-bewerkingsafstand gedeeld door het aantal tekens in de referentietranscriptie. WER gebruikte dezelfde formule op tokenniveau. Terugroeping van naamgevende entiteiten werd berekend als correct herkende referentieentiteiten gedeeld door alle referentieentiteiten in de geselecteerde evaluatieregio.

Visuele documentclassificatie

De visuele classificatiemodule verdeelde elk record aan een van acht archiefdocumentklassen: handgeschreven brief, grootboek, kaart, krant, foto met bijschrift, poster, registerboek en getypte correspondentie. Het voorspelde documenttype werd gebruikt als ophaal- en filtersignaal, niet als gezaghebbende vervanging voor archiefcatalogisatie.

Het model werd geïmplementeerd in PyTorch 2.2.2 en torchvision 0.17.2 met behulp van een door ImageNet-pretrainde EfficientNet-B3 backbone. Thumbnails op recordniveau werden verkleind tot 384 x 384 pixels. Om lekkage te verminderen, werden records per repository en documentklasse opgesplitst in trainings-, validatie- en testsets in een verhouding van 70:15:15, wat overeenkomt met ongeveer 1.120, 240 en 240 records.

Training gebruikte AdamW met initiële leersnelheid = 1 × 10-4, gewichtsafname = 1 × 10−2, batchgrootte = 16, labelverzachting = 0,05, en vroegtijdig stoppen wanneer validatieverlies gedurende vijf opeenvolgende epochs niet verbeterde. Horizontaal omslaan was uitgeschakeld omdat gespiegelde archieflay-outs niet realistisch zijn. De augmentatie was beperkt tot rotatie van -3 graden naar +3 graden en helderheidsvariatie binnen ±10%.

Modeldiagnostiek op epochniveau is samengevat in 20 trainingsrijen, elk met trainingsverlies, validatieverlies, trainingsnauwkeurigheid, validatienauwkeurigheid, macro-F1, gewogen F1, ROC-AUC en PR-AUC.

Metadata-verrijkingsworkflow

Metadata-verrijking is ontworpen om de vindbaarheid te verbeteren terwijl het archiefconservatisme behouden blijft. Bestaande cataloguswaarden werden behouden tenzij ze een expliciete tegenstrijdigheid bevatten, zoals een onmogelijke datum of een documenttype conflict bevestigd door zowel OCR als visueel bewijs. Kandidatenverrijkingsvelden omvatten genormaliseerde titel, documenttype, geschatte datum, vermeldingen van instellingen, geografische vermeldingen, persoonlijke namen, onderwerpskoppen en trefwoorden.

Bewijsprioriteit volgde een vaste volgorde: (1) bestaande catalogusmetadata, (2) gecorrigeerde OCR-output, en (3) visuele documenttypevoorspelling. Gecontroleerde woordenschatmatching werd gebruikt voor onderwerpkoppen, en naaste-buur semantische uitbreiding met zinstransformatoren 2.7.0 werd alleen gebruikt wanneer cosinusgelijkenis minstens 0,72 was. Datumnormalisatie vereiste een betrouwbaarheid van ten minste 0,85 of overeenstemming tussen OCR en metadata. Elk automatisch toegevoegd veld behield zijn bron, betrouwbaarheid en regelidentificatie.

Metadata-volledigheid werd gedefinieerd als het aantal ingevulde kernbeschrijvende velden gedeeld door het aantal toepasselijke kernvelden voor dat record. Onderwerpstitelmatch werd gedefinieerd als de aanwezigheid van ten minste één subjectlabel met gecontroleerde woordenschat, ondersteund door recordniveau inhoudelijk bewijs en relevant beoordeeld voor de querycategorie.

Constructie van het terughaalsysteem

Vijf retrieval-indices werden geconstrueerd om modulebijdragen te isoleren: baseline indexing; alleen correctie voor optische tekenherkenning; alleen visuele classificatie; alleen verrijking van metadata; en volledige multimodale integratie. Alle indexen werden gebouwd in de zoekmachinesoftware die in de Table of Materials (versie 8.11.1) op recordniveau is vermeld. BM25-parameters waren vastgesteld op k1 = 1,2 en b = 0,75 vóór evaluatie.

De basisindex gebruikte originele metadata en basis-OCR-tekst. De OCR-voorwaarde verving de basislijn OCR door gecorrigeerde OCR. De visuele conditie voegde document-type priors en klassebewuste rankingverhogingen toe. De metadatavoorwaarde voegde verrijkte beschrijvende velden toe. De volledige multimodale conditie combineerde gecorrigeerde OCR, visuele priors en verrijkte metadata. Veldgewichten waren vastgesteld vóór de test: genormaliseerde titel = 3,0, onderwerpskoppen = 2,5, persoon- en instellingsvermeldingen = 2,2, plaatsvermeldingen = 2,0, documenttype = 1,8, gecorrigeerde OCR-tekst = 1,0, en basislijn OCR-inhoud = 0,8, waar van toepassing.

Exacte zinskoppeling was ingeschakeld voor citaatzoeken. Query-uitbreiding was alleen toegestaan in metadata-verrijking en full-multimodale omstandigheden en was beperkt tot geaccepteerde gecontroleerde-vocabulaire synoniemen en onderwerpsvarianten. Zoeklogs werden gegenereerd van 25 augustus tot 28 augustus 2025 in de containerized Linux-omgeving die in de Table of Materials is vermeld, met vaste seeds en bevroren indexconfiguraties.

Queryontwerp en uitkomstmaten

De 420 zoekopdrachten vertegenwoordigden gemeenschappelijke archiefzoekgedragingen in plaats van alleen benchmarkprompts met trefwoorden. Onderwerpen omvatten persoonlijke namen, instellingen, plaatsen, data en databereiken, beroepen, gebeurtenissen en thematische onderwerpen. Elke query werd opgeslagen met zijn genormaliseerde formulering, doelrecordset, query-topic categorie en moeilijkheidsscore.

De moeilijkheidsgraad werd vóór het ophalen gemeten met behulp van doelambiguïteit, lexicale specificiteit en verwachte expressiefrequentie. Samengestelde scores onder 0,40 werden geclassificeerd als lage moeilijkheidsgraad, scores van 0,40–0,69 als matige moeilijkheidsgraad, en scores van 0,70 of hoger als hoog. Relevantieoordelen werden afgerond vóór systeemvergelijking en vervolgens vergeleken met de definitieve verzameling.

De opsporingsuitkomsten omvatten P@10, R@10, nDCG@10, tijd tot eerste relevante resultaat en succesvolle zoeksnelheid. P@10 was het aandeel van de top 10 records dat relevant werd beoordeeld. R@10 was het aandeel van alle bekende relevante records die in de top 10 stonden. nDCG@10 gebruikte graded relevance waar beschikbaar en binaire relevantie anders. De tijd tot het eerste relevante resultaat werd gemeten vanaf het indienen van een query tot het eerste relevante record verscheen in de gerangschikte output. Een succesvolle zoekopdracht werd gedefinieerd als ten minste één relevant resultaat uit de top 10 records.

Statistiekenverzameling

Alle analyses werden uitgevoerd met behulp van de softwareversies die in de Materiaaltabel staan. Continue uitkomsten werden samengevat als gemiddelde ± SD wanneer ongeveer symmetrisch en als mediaan met interkwartielbereik anders. Categorische uitkomsten werden samengevat als tellingen en percentages.

De normaliteit van gepaarde verschillen werd beoordeeld met de Shapiro-Wilk test en distributiegrafieken. OCR en metadata pre/post uitkomsten werden vergeleken met gepaarde T-tests wanneer de parverschillen ongeveer normaal waren, en met Wilcoxon signed-rank tests anders. De classificatieprestaties vóór en na het fijn afstellen werden vergeleken met behulp van McNemar's test op gekoppelde correcte/onjuiste labels. Matched multi-arm retrieval uitkomsten werden vergeleken met de Friedman-test, gevolgd door Holm-gecorrigeerde paarwijze Wilcoxon teken-rank tests.

Alle statistische tests waren tweezijdig, en P < 0,05 werd als statistisch significant beschouwd. Betrouwbaarheidsintervallen werden geschat met behulp van 2.000 bootstrap-resamples, waarbij de willekeurige seed vaststond op 2025. Effecten werden gerapporteerd als gemiddelde verschillen, gematchte odds ratio's of op rang gebaseerde effectgroottes volgens uitkomsttype.

Reproduceerbaarheid, reikwijdte en beschikbaarheid van middelen

Alle pipelineparameters werden vastgesteld vóór de terugwinningstesten. Geen enkele parameter werd geoptimaliseerd op de vastgehouden retrieval-benchmark. Configuratiebestanden, gecontroleerde vocabulaires, lexicontabellen, querytemplates, veldmappingen, annotatierichtlijnen, statistische scripts en figuurgeneratiescripts werden onderhouden in het versiebeheersysteem dat is vermeld in de Table of Materials with random seed 2025.

Om onafhankelijke validatie te ondersteunen, bevat het brondata-werkboek een gedeïdentificeerde tabel met 1.600 records en 17 variabelen die worden gebruikt voor optische tekenherkenning, metadata en visuele classificatie-analyses. Afgeleide Tabel 1, Tabel 2, Tabel 3, Tabel 4 en Tabel 5, figuur-bronsamenvattingen, benchmarkquerydefinities, relevantie-oordelen, ophaal-log-vervangers, trainingsdiagnostiek, lexiconcategorieën, vocabulairemappingregels en annotatie-richtlijnvelden worden als aparte uploadbare tabellen of materiaalbestanden verstrekt waar van toepassing. Materialen die niet openbaar gedeeld kunnen worden vanwege repositorybeperkingen worden weergegeven door gedeïdentificeerde metadatavelden en reproduceerbare steekproefvelden.

Dit protocol evalueert retrieval-georiënteerde ontdekking in plaats van de waarheid van historische beweringen. Het vervangt geen archivaristaxatie, herkomstbeoordeling, privacybeoordeling of repository-specifieke toegangsregels.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

OCR-correctie verbeterde de transcriptie, vooral in handgeschreven en tabelachtige records

Optische tekenherkenningscorrectie verbeterde de transcriptiekwaliteit over alle acht archiefdocumentklassen (n = 1.600 records). De gemiddelde WER daalde van 0,529 ± 0,172 naar 0,384 ± 0,123, met een gemiddelde gepaarde verandering van −0,144 (95% BI, −0,149 tot −0,139; Wilcoxon tekende met rang P < 0,001). De gemiddelde CER daalde van 0,377 ± 0,126 naar 0,258 ± 0,086, met een gemiddelde gepaarde verandering van −0,119 (95% BI, −0,123 tot −0,116; Wilcoxon tekende met rang P < 0,001). Tabel 2 toont dat de basislijn WER het hoogst was voor handgeschreven brieven, grootboeken en registerboeken, wat aangeeft dat de meest visueel complexe records ook de grootste initiële herkenningslast hadden.

Na correctie nam de WER af over alle documentklassen. De grootste gemiddelde gepaarde WER-reducties vonden plaats in handgeschreven brieven (n = 262; −0,200; 95% BI, −0,213 tot −0,188), grootboeken (n = 263; −0,195; 95% BI, −0,206 tot −0,183) en registerboeken (n = 194; −0,173; 95% BI, −0,187 tot −0,160). CER volgde hetzelfde patroon en ondersteunde de interpretatie dat de post-correctiemodule vooral voordeel had voor moeilijke handgeschreven, tabel- en gemengde lay-outs.

Het terugroepen van naamgevende entiteiten verbeterde ook bij alle documenttypen, zoals te zien is in de samenvattingstabel. De grootste stijgingen vonden plaats in handgeschreven brieven (0,302–0,440), grootboeken (0,336–0,471) en registerboeken (0,369–0,504). Getypte correspondentie bereikte de hoogste postcorrectie-naam-entiteit herinnering (0,646), maar de absolute winst was kleiner omdat de basisherkenning voor deze klasse al sterker was. Figuur 2 vat de record-niveau baseline CER-WER relatie samen, de associatie tussen handschriftintensiteit en correctievoordeel, en de post-correctie verschuiving in record-niveau ontdekbaarheid.

Visuele documentclassificatie verbeterde over het algemeen wel, maar de prestatieverbeteringen waren ongelijk tussen de klassen

De classificatie van visuele documenten verbeterde over het geheel genomen over de testset van 1.600 records. Top-1 nauwkeurigheid steeg van 0,717 naar 0,796 (absolute verandering, 0,079; McNemar chi-kwadraat = 27,33; P < 0,001), en het gemiddelde voorspellingsvertrouwen steeg van 0,736 ± 0,131 naar 0,800 ± 0,108 (gemiddelde gepaarde verandering, 0,064; 95% BI, 0,057–0,071; gepaarde toets P < 0,001). Zoals weergegeven in Tabel 3, verbeterden zeven van de acht klassen na archiefspecifieke fijnafstelling, met de grootste winst voor kaarten, posters, kranten en registerboeken.

De getypeerde correspondentie verbeterde niet wezenlijk na fijnafstemming (0,796–0,791), wat suggereert dat de basisvisuele kenmerken al stabiel waren en dat de trainingsprocedure weinig extra klassenscheiding toevoegde voor deze categorie.

Figuur 3 vat de visuele documentclassificatieprestaties samen vóór en na archiefspecifieke fine-tuning; het brondata-werkboek vermeldt 20 epochs van trein-/validatieverlies en nauwkeurigheid, samen met macro-F1, gewogen F1, ROC-AUC en PR-AUC diagnostische samenvattingen.

Metadata-verrijking verbeterde de beschrijvende volledigheid over alle historische perioden heen (n = 1.600 records). De gemiddelde volledigheid steeg van 0,657 ± 0,125 naar 0,907 ± 0,070, met een gemiddelde gepaarde verandering van 0,250 (95% BI, 0,243–0,257; Wilcoxon tekende met rang P < 0,001). Zoals te zien is in Tabel 4, was de basislijnvolledigheid het laagst in 1850–1879 en nam toe in latere periodes vóór de verrijking. Figuur 4 vat de verbetering in metadatavolledigheid, nieuw gerealiseerde metadatavelden per documenttype en winst in onderwerphead-matching over historische perioden samen.

Na verrijking nam de volledigheid toe in elke historische periode: 1850–1879 (n = 281; gemiddelde verandering, 0,207; 95% BI, 0,191–0,223), 1880–1909 (n = 474; gemiddelde verandering, 0,236; 95% BI, 0,223–0,248), 1910–1939 (n = 549; gemiddelde verandering, 0,277; 95% BI, 0,265–0,288), en 1940–1969 (n = 296; gemiddelde verandering, 0,263; 95% BI, 0,247–0,279). De gemiddelde tellingen van bevolkte velden namen ook consequent toe over periodes heen.

De overeenkomst tussen onderwerpen en kop verbeterde parallel. De baseline matchpercentages varieerden van 64,3% tot 69,4%, terwijl de matchpercentages na verrijking varieerden van 82,1% tot 85,4%. De grootste absolute winst vond plaats in de vroegste periode (Delta = 0,178), wat de waarde van conservatieve verrijking voor archieven met een schaarse initiële beschrijving ondersteunt.

De ophaalprestaties verbeterden in alle verbeterde systemen, met de sterkste winst onder volledige multimodale integratie

De effectiviteit van het terughalen verbeterde onder elke verbeteringsvoorwaarde ten opzichte van de basislijn, maar de omvang van de verbetering varieerde per systeemarm (n = 420 gematchte benchmarkzoeken). De algemene resultaten van de retrieval zijn weergegeven in Tabel 5. De basisprestaties waren laag: P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, gemiddelde tijd tot eerste relevante resultaat = 156,079 s, en succes-zoekpercentage = 5,0% (21/420; 95% BI, 3,3%–7,5%). Figuur 5 vat de opzoekprestaties samen over de vijf experimentele systeemarmen, inclusief algemene opzoekstatistieken, succespercentages op onderwerpniveau en zoekmoeilijkheidsstrata.

Alle drie de systemen met één component presteerden in totaal beter dan de basislijn. De correctie van optische tekenherkenning steeg P@10 naar 0,484, R@10 naar 0,346 en nDCG@10 naar 0,475, terwijl de tijd tot het eerste relevante resultaat werd teruggebracht tot 124,261 s en het succesrate van zoekopdrachten steeg tot 30,2% (127/420; 95% BI, 26,0%–34,8%). Visuele classificatie leverde P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, gemiddelde tijd tot eerste relevante resultaat = 131,985 s, en succes-zoekpercentage = 22,9% (96/420; 95% BI, 19,1%–27,1%). Metadata-verrijking behaalde de sterkste single-component retrievalprestatie, met P@10 = 0,507, R@10 = 0,347, nDCG@10 = 0,513, gemiddelde tijd tot eerste relevante resultaat = 117,474 s, en een succesvolle zoeksnelheid van 38,3% (161/420; 95% BI, 33,8%–43,1%).

Het volledige multimodale systeem presteerde het beste op alle ophaaleindpunten. P@10 steeg van 0,394 aan de begin naar 0,624, R@10 van 0,238 naar 0,492, en nDCG@10 van 0,392 naar 0,634. De gemiddelde tijd tot het eerste relevante resultaat daalde van 156,079 s naar 58,485 s, en het succes-zoekpercentage steeg van 5,0% naar 95,5% (401/420; 95% BI, 93,0%–97,1%). Deze waarden komen overeen met absolute winsten van 0,230 voor P@10, 0,254 voor R@10 en 0,242 voor nDCG@10.

Onderwerpspecifieke retrieval verbeterde ook onder volledige multimodale integratie. De succesvolle zoekpercentages namen toe tussen mensen, instellingen, plaatsen, beroepen, evenementen en onderwerpen, waarbij de categorie beroep de grootste praktische winst liet zien, met het basissuccespercentage van 0,0% en steeg tot 90,0% onder de volledige multimodale conditie. Plaatsnaamzoekopdrachten hadden de sterkste basisprestaties, maar profiteerden nog steeds van multimodale integratie.

Multimodale winsten varieerden tussen document-, periode- en taallagen

Subgroepanalyses toonden aan dat multimodale winsten breed verdeeld waren over documenttypen, historische periodes en taalcontexten, hoewel de omvang van de verbetering varieerde. Deze heterogeniteit geeft aan dat de workflow binnen elke doelcollectie geëvalueerd moet worden, in plaats van dat er wordt aangenomen dat er uniforme winsten worden opgeleverd. Figuur 6 toont de heterogeniteit van multimodale opzoekwinsten over het doeldocumenttype, historische periode en taalcontext.

Op het niveau van documenttypen is nDCG@10 verbeterd over alle doelklassen. Foto's met bijschriften, handgeschreven brieven, kaarten, grootboeken en registerboeken lieten sterke vooruitgang zien, terwijl kranten en getypte correspondentie bescheidener verbeterden. Deze patronen suggereren dat records met zwakke initiële metadata of complexe visuele structuur het meest profiteren van gecombineerde tekst-, afbeeldings- en metadatasignalen.

Op historisch niveau steeg R@10 van 0,175 naar 0,429 voor 1850–1879 en bereikte 0,506 voor 1880–1909, 0,501 voor 1910–1939 en 0,519 voor 1940–1969 onder volledige multimodale integratie. De winst was vergelijkbaar in absolute schaal over periodes heen, wat suggereert dat verrijking en gecorrigeerde herkenning zowel vroege spaarzame records als latere records met rijkere basismetadata hielpen.

Taal-context resultaten lieten een vergelijkbaar patroon zien. P@10 onder de volledige multimodale conditie bereikte 0,607 voor gemengde Latijnse schriftrecords, 0,628 voor Engels, 0,618 voor Frans, 0,661 voor Duits en 0,639 voor Portugees en Spaans. De grootste precisiewinst vond plaats bij gemengde Latijnse schriftrecords, die de zwakste basisprecisie hadden.

Componentniveaupatronen: complementaire in plaats van redundante bijdragen

Samen tonen de resultaten aan dat de protocolcomponenten complementair zijn in plaats van redundant. OCR-correctie verbeterde de tekstherkenbaarheid, visuele classificatie voegde structuurbewuste documenttypesignalen toe, en metadata-verrijking breidde de doorzoekbare beschrijvende laag uit. De volledige multimodale voorwaarde leverde de sterkste en meest consistente opzoekwinsten op, wat het studiedoel ondersteunde om een auditeerbare, opzoekgerichte workflow voor heterogene digitale archieven te testen.

Deze bevindingen ondersteunen een protocolmodel waarin multimodale kunstmatige intelligentie archiefzoekopdrachten aanvult, terwijl de noodzaak voor repositorybeheer, gegevensherkomst en deskundige validatie behouden blijft.

BESCHIKBAARHEID GEGEVENS:

De gedeïdentificeerde dataset van 1.600 records die voor de hoofdanalyses is gebruikt, is beschikbaar op Zenodo als data.xlsx (https://doi.org/10.5281/zenodo.20774456).

figure-results-1
Figuur 1: Reproduceerbare workflow voor multimodale archiefontdekking. (A) Corpusconstructie van archiefrecords op repository-niveau met inclusie-/uitsluitingsscreening. (B) Referentielabeling en kwaliteitscontrole, inclusief documenttype, OCR-referentieregio's, taalcontext, historische periode en metadata-volledigheid. (C) Beeldvoorbewerking, OCR-generatie en -nacorrectie, visuele documentclassificatie en conservatieve metadataverrijking. (D) Indexconstructie, vijfarmige retrieval-evaluatie, statistische analyse en resource packaging. Afkortingen: OCR, optische tekenherkenning; CER, foutpercentage van tekens; WER, woordfoutpercentage. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-2
Figuur 2: Structuur en ontdekbaarheid van optische tekenherkenning op recordniveau na correctie. (A) Baseline CER versus baseline WER over 1.600 archiefrecords, ingekleurd op documenttype voor representatieve klassen. (B) Verband tussen geschaalde handschriftintensiteit en verandering in WER na correctie; Negatieve waarden geven een lagere WER aan na correctie. De afgestemde lijn en grijze band tonen de lineaire trend en het 95% betrouwbaarheidsinterval. (C) Recordniveau ontdekbaarheidsscore voor en na correctie per documenttype, die post-correctie verschuivingen in doorzoekbaar bewijs illustreert. Afkortingen: CER, foutpercentage van tekens; WER, woordfoutpercentage. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-3
Figuur 3: Visuele documentclassificatie vóór en na archiefspecifieke fine-tuning. (A) Top-1 nauwkeurigheid per documenttype bij en na fine-tuning. (B) Betrouwbaarheidsverdelingen voor correcte en onjuiste voorspellingen onder basis- en post-tuning condities. (C) Prestatiematrix op klasseniveau die top-1 nauwkeurigheid en gemiddelde achterste betrouwbaarheid voor en na afstelling samenvat. Modeldiagnostische gegevens omvatten 20 epochs van verlies-/nauwkeurigheidscurves, macro-F1, gewogen F1, ROC-AUC en PR-AUC. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-4
Figuur 4: Metadata-volledigheid en onderwerp-kop match na conservatieve verrijking. (A) Record-niveau metadata-volledigheid vóór en na verrijking. (B) Nieuw gerealiseerde metadatavelden per documenttype. (C) Winst in onderwerp-kop overeenkomst over historische periodes. Volledigheid werd berekend als het aantal bevolkte toepasbare kernvelden gedeeld door het totale aantal toepasbare kernvelden. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-5
Figuur 5: Terughaalprestaties over de vijf experimentele systeemarmen. (A) Algemene P@10, R@10, nDCG@10, tijd tot het eerste relevante resultaat en succesvolle zoeksnelheid voor baseline, correctie van optische tekenherkenning, visuele classificatie, metadataverrijking en volledige multimodale integratie. (B) Bubbelgrafiek van succesvolle zoeksnelheid per zoekonderwerp en systeemarm; kleur geeft systeemarm aan, en de grootte van de bubbel geeft het percentage succes aan. (C) P@10, R@10 en nDCG@10 over gemakkelijke, matige en moeilijke query-moeilijkheidsstraten. (D) Alternatieve slagingspercentageweergave op onderwerpniveau die de verdeling van succesvolle zoekopdrachten over zoekonderwerpen en systeemarmen toont. Afkortingen: P@10, precisie op 10; R@10, terugroep om 10; nDCG@10, genormaliseerde gediskonteerde cumulatieve winst op 10. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-6
Figuur 6: Heterogeniteit van multimodale opsporingswinsten over archiefsubgroepen. (A) nDCG@10 op doeldocumenttype en ophaalconditie. (B) R@10 op historische periode en terugvindconditie. (C) P@10 op basis van de context van de doeltaal en de ophaalconditie. Voorwaarden zijn Baseline, OCR-correctie, visuele classificatie, metadata-verrijking, volledige multimodale integratie, OCR+Text, Text+Visual+Metadata en Visual+Metadata. De figuur benadrukt dat multimodale winsten wijdverspreid zijn, maar niet uniform over document-, periode- en taallagen. Klik hier om een grotere versie van deze figuur te bekijken.

Documenttypen recordsMediaanpagina'sHandgeschreven documentenGemiddelde basislijn
WER
Gemiddelde basislijn
metadata
volledigheid
Gemiddelde basislijn
Ontdekbaarheid
(%)
Handgeschreven brief2622950.7290.64868.2
Grootboek263763.50.6790.67472.2
Kaart10212.90.4570.55274.1
Krant26180.80.4950.6675.5
Foto met bijschrift17911.10.3740.60173.6
Poster87100.4130.57174.8
Registerboek19410180.6160.70371.3
Getypte correspondentie252340.3150.68976.4

Tabel 1: Kenmerken van de archiefcollectie per documenttype. De tabel geeft het aantal records, het mediane paginaaantal, het percentage records met handschrift, de gemiddelde baseline WER, de gemiddelde baseline metadata-volledigheid en de gemiddelde baseline baseline ontdekbaarheidsscore voor elk van de acht documentklassen weer.

DocumenttypeSteekproefgrootteCERCERWERWERNaamgevende entiteit
Terugroeping
Naamgevende entiteit
Terugroeping
ΔWER
(n)(Baseline)(Post)(Baseline)(Post)(Baseline)(Post)
Handgeschreven brief2620.5310.3630.7290.5310.3020.44−0.198
Grootboek2630.490.3260.6790.4850.3360.471−0,194
Kaart1020.3220.2280.4570.3470.380.503−0,11
Krant2610.3540.2560.4950.3810.4360.558−0.114
Foto met bijschrift1790.2570.1810.3740.2860.4940.616−0,088
Poster870.2870.1990.4130.3160.4480.57−0,097
Registerboek1940.4420.2930.6160.4390.3690.504−0,177
Getypte correspondentie2520.2190.1550.3150.2320.5240.646−.083

Tabel 2: OCR-prestaties vóór en na correctie per documenttype. CER en WER werden berekend aan de hand van referentietranscripties; Terugroepen van naamloze entiteiten werden berekend aan de hand van gelabelde entiteiten van persoon, plaats, instelling en datum. Delta WER is post-correctie WER minus baseline WER.

DocumenttypenNauwkeurigheid,
Basislijn
Nauwkeurigheid,
Functie
Vertrouwen,
Basislijn
Vertrouwen,
Functie
ΔAccuracy
Handgeschreven brief2620.6150.6450.6160.6550.03
Grootboek2630.7070.7490.7250.7670.042
Kaart1020.7650.9020.8010.8990.137
Krant2610.7160.8430.7280.830.127
Foto met bijschrift1790.8150.8690.8240.890.054
Poster870.7710.9030.7920.8890.132
Registerboek1940.6870.7930.7010.7870.106
Getypte correspondentie2520.7960.7910.8040.82-0.005

Tabel 3: Visuele documentclassificatieprestaties vóór en na archiefspecifieke fijnafstemming. De tabel geeft de steekproefgrootte, top-1 nauwkeurigheid, gemiddelde posterior betrouwbaarheid en de verandering in nauwkeurigheid per documenttype weer. De diagnostische gegevens omvatten 20 epoch-niveau rijen met macro-F1, gewogen F1, ROC-AUC, PR-AUC, trainingsverlies, validatieverlies, trainingsnauwkeurigheid en validatienauwkeurigheid.

VolledigheidVolledigheidBevolkte veldenBevolkte veldenOnderwerpskop
Wedstrijd
Onderwerpskop
Wedstrijd
Δ VolledigheidΔ Onderwerpstitel
Wedstrijd
(Baseline)(Post)(Baseline)(Post)(Baseline)(Post)
0.5340.8684.2748.5840.6430.8210.3340.178
0.6070.8984.8388.7090.6720.8410.2910.169
0.680.9275.4269.0950.6860.8490.2470.163
0.6860.9225.488.9530.6940.8540.2360.16

Tabel 4: Metadata-verrijking per historische periode. Volledigheid is het aandeel van toepasbare kernbeschrijvende velden die voor een record worden ingevuld; bevolkte velden worden gerapporteerd als gemiddelde tellingen; Onderwerpstitelovereenkomst geeft aan of bewijs op recordniveau ten minste één subjectlabel met gecontroleerde woordenschat ondersteunde.

Systeemarmn zoekopdrachtenP@10R@10nDCG@10Tijd om eerst relevant te zijn
Resultaat(s)
Succesvolle zoeksnelheid
(%)
Basislijn4200.3940.2380.392156.0795
OCR-correctie4200.4840.3460.475124.26130.2
Visuele classificatie4200.490.3020.478131.98522.9
Metadata-verrijking4200.5070.3470.513117.47438.3
Volledig multimodaal4200.6240.4920.63458.48595.5

Tabel 5: Terughaalprestaties voor de vijf experimentele systeemarmen. P@10, R@10, nDCG@10, tijd tot eerste relevante resultaat en succesvolle zoeksnelheid werden berekend over de 420-zoekbenchmark onder matched-query-condities.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol toont aan dat ontdekking in historische digitale archieven het meest verbeterde wanneer OCR-correctie, visueel documentbegrip en conservatieve metadata-verrijking werden geëvalueerd als verbonden opzoekcomponenten in plaats van als geïsoleerde technische upgrades. De grootste OCR-winst vond plaats in handgeschreven, tabel- en registermateriaal, wat de waarde van post-correctie ondersteunt voor documentklassen waar de basisherkenning het zwakst is. Tegelijkertijd toont restfout na correctie aan dat OCR-opruiming niet als definitieve transcriptie kan worden behandeld en controleerbaar moet blijven.

De visuele classificatieresultaten vereisen ook zorgvuldige interpretatie. Fijnafstelling verbeterde visueel onderscheidende klassen zoals kaarten, posters, kranten en registerboeken, maar de winst was kleiner voor handgeschreven brieven en grootboeken, waar de lay-outs overlappen en klassengrenzen visueel minder van elkaar scheidbaar zijn. De relatief kleine corpusgrootte betekent dat classificatieprestaties moeten worden geïnterpreteerd als protocolbewijs en niet als bewijs dat een productie-multimodaal model alleen al uit 1.600 records kan worden getraind. Toekomstige validatie moet EfficientNet-B3 vergelijken met documenttransformers, Vision Transformers, Swin Transformers, ConvNeXt en multimodale document-foundation modellen 8,11,12,13,14,15,16,17,18.

Metadata-verrijking droeg aanzienlijk bij aan het ophalen door spaarzame beschrijvende records uit te breiden tot doorzoekbare velden, terwijl bron- en betrouwbaarheidsinformatie behouden bleef. Deze bevinding is consistent met de archiefbehoefte aan rijkere toegangspunten, maar verhoogt ook governance-risico's. Geautomatiseerde verrijking kan OCR-fouten versterken, historisch ambigu namen te agressief normaliseren, of bias introduceren als gecontroleerde woordenschat onvolledig is. Om die reden gebruikt de workflow betrouwbaarheidsdrempels, bronlogging en review-vlaggen in plaats van volledig geautomatiseerde vervanging van catalogusrecords.

De retrieval-evaluatie levert bewijs van complementaire module-effecten, maar heeft beperkingen. De huidige vergelijking gebruikte basis- en interne module-ablatiecondities; het benchmarkte niet tegen dichte retrieval, late-interaction rankers zoals ColBERT, hybride sparse-dense retrieval, neural re-ranking of retrieval-augmented generation systems 22,23,24. Deze benaderingen zouden in toekomstig onderzoek moeten worden toegevoegd om te bepalen of de waargenomen multimodale winsten concurrerend blijven ten opzichte van de huidige retrieval-architecturen.

Implementatie vereist ook aandacht voor datalekken, rekenkundige beperkingen en schaalbaarheid. Verrijking gebruikte optische tekenherkenningsuitgangen, visuele voorspellingen en bestaande metadata, dus train/validatie/testsplitsing en query-evaluatie moeten gescheiden blijven van verrijkingsbeslissingen. Toekomstige implementaties moeten hardware, runtime, geheugengebruik, indexgrootte en kosten per 1.000 records rapporteren. Beeldvormingsherstelbenaderingen uit aangrenzend computervisiewerk, waaronder multischaal- en aandachtgebaseerde occlusieverwijderingsmodellen, kunnen toekomstige preprocessing-experimenten inspireren, maar ze moeten zorgvuldig worden getest omdat archiefworkflows geen hallucinaten of bewijzende inhoud mogen beïnvloeden26,27.

Over het algemeen is de workflow het beste te begrijpen als een reproduceerbaar toegangsprotocol in plaats van een vervanging van archiefbeschrijving. Multimodale kunstmatige intelligentie kan de ontdekking verbeteren wanneer de output wordt beperkt, geregistreerd en beoordeeld, maar archivarissen blijven essentieel voor de beoordeling van herkomst, beslissingen over toegang en bestuur en interpretatie van historisch complexe documenten21,25.

CONCLUSIES:
Deze studie testte of correctie van optische tekenherkenning, visuele documentclassificatie en conservatieve metadata-verrijking kunnen dienen als complementaire opzoekcomponenten in historische digitale archieven. Het protocol verbeterde transcriptie, classificatie, metadata-volledigheid en geaggregeerde ophaalprestaties, terwijl expliciete drempels, bronregistratie en menselijke beoordelingswaarborgen werden behouden. De workflow moet daarom worden gebruikt als een controleerbaar toegangsondersteuningsprotocol, niet als vervanging voor het oordeel van archivisten of het beheer van de repository.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs hebben niets te onthullen.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs danken oprecht de twee ervaren archiefmedewerkers en de professionele onderzoeker in digitale geesteswetenschappen voor hun waardevolle hulp bij tekstannotatie en kwaliteitscontrole. Dit onderzoek werd financieel ondersteund door het Jiangsu Provincial Archives Science and Technology Project Plan (Subsidie nr. 2024-9) voor de bouw van een intelligent, spraakgebaseerd mondelinge archiefsysteem, en het Jiangsu Provincial Science and Technology Development Plan for Traditional Chinese Medicine (subsidie nr. MS2025025) voor het bestuderen van de overerving en ontwikkeling van TCM-scholen vanuit een archiefperspectief.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow scripting, data processing, optical character recognition post-correction, and statistical support
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Statistische analyse en genereren van eindfiguren
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractBasisgeneratie voor optische tekenherkenning
Tesseract language packsTesseract OCR ProjectStudiespecifieke taalpakken; https://github.com/tesseract-ocr/tessdataPrimaire en gemengde taal decodering voor optische tekenherkenning
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Deskewing, ruisschatting en beeldvoorverwerking
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Beeldinvoer/uitvoer en formaatnormalisatie
NumPyNumPy developersv1.26.4; https://numpy.org/Arrayberekening voor beeld- en metriekverwerking
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Verwerking van tabelgegevens en samenvattende exporten
SciPySciPy developersv1.13.1; https://scipy.org/Statistische tests en numerieke hulpmiddelen
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Statistisch modelleren en ondersteuning voor gepaarde vergelijkingen
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Classificatiemetrieken, ROC/PR-diagnostiek en validatiehulpmiddelen
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzEdit-afstand kandidaat ranking voor optische tekenherkenning correctie
spaCyExplosion AIv3.7.4; https://spacy.io/Naamverwerking met aangepaste lexicontabellen
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Training van visuele documentclassificator
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3 implementatie en beeldtransformaties
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlBackbone voor visuele documentclassificatie
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Semantische uitbreiding voor gecontroleerde woordenschatkandidaten
Search-engine softwareElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25 indexering, opvragen en rangschikken
Container engineDocker Inc.Docker v26.1.1; https://www.docker.com/Containerized opvraagomgeving
Linux operating systemCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Vaste opvoersomgeving voor opvraaklussen
Version-control systemGit projectGit v2.44.0; https://git-scm.com/Versiecontrole voor configuratie, vocabularia, scripts en figuurcode
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/R-gebaseerd figuurrenderen
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Aanvullende visualisatie en kwaliteitsborgingsplots
AnnotatierichtlijnAuteurs5 annotatiefdelen; 8 documentklasselabels; OCR-regio's; entiteitslabels; relevantieoordelen; beslechtingsregelsDefinities voor documentklassen, OCR-regio's, entiteiten, relevantieoordelen en beslechting
Archiefspecifiek OCR-lexiconAuteurs6 lexiconcategorieën: persoonvarianten, plaatsnamen, instellingsnamen, datumpatronen, administratieve termen, afkortingenNamen, plaatsen, instellingen, administratieve termen en spellingvarianten
Gecontroleerde woordenschattoewijzingAuteurs / archiefbewaarders5 toewijzingsregels die OCR-entiteiten, visuele klasse, titelsleutelwoorden, datumdekking en vraagonderwerp koppelen aan metadataveldenOnderwerp-heading matching en semantische uitbreiding
Benchmark-querysetAuteurs420 benchmark-vragen; 6 vraagonderwerpen; 3 moeilijkheidsniveaus; 8 doeldocumentklassen; 4 historische perioden; 6 taakcontextenGematchte opvragebenchmark over vijf systeemtakken
RelevantieoordelenAuteurs / annotatoren2.100 vraag-systeem rijen; 420 vragen x 5 systeemtakken; relevante totaal, relevant-in-top-10-tellingen, gegradeerde relevantie en succesvlaggenGround-truth surrogaat voor P@10, R@10, nDCG@10 en succesvolle-zoeksnelheid
TrainingsdiagnostiekAuteurs20 epochen; trainingsverlies; validatie-verlies; trainingsnauwkeurigheid; validatienauwkeurigheid; macro-F1; gewogen-F1; ROC-AUC; PR-AUCDiagnostische samenvattingen op epochniveau
Computationele hardwareAuteurs8 CPU-kernen; 32 GB RAM; NVIDIA GPU-klasse trainingsomgevingReproduceerbaarheidsresourcedetail voor JoVE-inzending
Dataset-bestandAuteursdata.xlsx; 1.600 records; 17 variabelen; DOI vermeld in manuscript Data BeschikbaarheidBrongegevens op recordniveau voor optische tekenherkenning, metadatavolledigheid, ontdekbaarheid en visuele classificatieanalyses

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

EngineeringNummer 234Nummer 234Lege waardeNummerDigitale archievenMultimodale AIOCR correctieMetadata verrijkingVisuele classificatie en query s voor historische registers

Gerelateerde artikelen