Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Onderzoeksartikel

Reproducerbare multimodale kunstmatige intelligentie-workflow voor het ontdekken van historisch digitaal archief

71 weergaven

DOI:

10.3791/71698

7 augustus 2026

In dit artikel

Samenvatting

Hier presenteren we een protocol om ontdekking in historische digitale archieven te verbeteren door post-correctie optische tekenherkenning, visuele documentclassificatie, metadataverrijking en opzoekevaluatie te integreren in een auditeerbare workflow.

Samenvatting

Historische digitale archieven zijn steeds meer doorzoekbaar, maar ontdekking blijft beperkt wanneer optische tekenherkenningsfouten, visueel heterogene documenttypen en schaarse metadata apart worden behandeld. Deze studie had als doel een reproduceerbaar protocol te ontwikkelen om te evalueren of een conservatieve multimodale workflow van kunstmatige intelligentie de archivering kan verbeteren zonder de archivarisbeoordeling te vervangen. Een corpus van 1.600 gedigitaliseerde archiefrecords uit acht documentklassen werd samengesteld, en een benchmark van 420 vragen werd gebruikt om vijf opzoekvoorwaarden te vergelijken: baseline-indexering, correctie alleen optische tekenherkenning, visuele classificatie alleen, metadataverrijking alleen en volledige multimodale integratie. Uitkomsten op recordniveau omvatten het foutpercentage van het teken (CER), het aantal woordfouten (WER), het terughalen van de naamgezel entiteit, nauwkeurigheid van documenttypeclassificatie, voorspellingsvertrouwen, volledigheid van metadata en overeenstemming met onderwerpheads. Resultaten op zoekniveau omvatten P@10, R@10, nDCG@10, tijd tot eerste relevante resultaat en succesvolle zoekpercentage. Optische tekenherkenningscorrectie verminderde WER het sterkst voor handgeschreven brieven, grootboeken en registerboeken; visuele fijnafstelling verbeterde de classificatienauwkeurigheid vooral voor kaarten, posters, kranten en registerboeken; en metadata-verrijking verhoogde de volledigheid over alle historische periodes. De volledige multimodale voorwaarde behaalde de hoogste ophaalprestatie (P@10 = 0,624, R@10 = 0,492, nDCG@10 = 0,634) en verkortte de gemiddelde tijd tot het eerste relevante resultaat van 156,079 s naar 58,485 s. Deze resultaten ondersteunen een modulaire, controleerbare workflow waarin tekst, afbeelding en beschrijvende signalen worden gecombineerd onder expliciete drempels en menselijke beoordeling.

Inleiding

Digitale archieven zijn snel uitgebreid en ondersteunen nu onderzoek op het gebied van geschiedenis, cultureel erfgoed, openbaar bestuur en de digitale geesteswetenschappen. De toegang blijft echter ongelijk omdat archiefrecords vaak een slechte optische tekenherkenningsuitvoer, visueel diverse paginalay-outs, inconsistente catalogiseringspraktijken en historisch variabele namen, plaatsen en instellingen combineren. Deze beperkingen beïnvloeden niet alleen de transcriptiekwaliteit, maar ook het ophalen, filteren en downstream hergebruik van gedigitaliseerde collecties 1,2,3,4,5,6,7.

Bestaande documentkunstmatige intelligentie en archiefophaalstudies hebben individuele componenten verbeterd, zoals optische tekenherkenning na correctie, document-beeldclassificatie, metadata-normalisatie, onderwerpmodellering, woordembeddings, neurale opvraging en data-governance praktijk 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. Toch evalueren veel archiefsystemen deze componenten nog steeds apart, waardoor het moeilijk is te bepalen of een gecombineerde workflow de ontdekking verbetert onder realistische zoekomstandigheden. De methodologische kloof die hier wordt aangepakt, is het ontbreken van een reproduceerbaar, controleerbaar protocol dat tekst-, afbeeldings- en metadatamodules verbindt met ophaalresultaten in één enkele archiefworkflow.

Het centrale doel was te testen of correctie van optische tekenherkenning, visuele documentclassificatie en regelgebonden metadataverrijking complementaire verbeteringen opleveren wanneer ze worden geëvalueerd tegen dezelfde ophaalbenchmark.

We veronderstelden dat de volledige multimodale voorwaarde elke enkelcomponentconditie zou overtreffen, omdat archiefontdekking afhankelijk is van de interactie tussen leesbare tekst, visueel interpreteerbare documentstructuur en doorzoekbare beschrijvende metadata. De workflow was conservatief ontworpen: geautomatiseerde uitvoer konden de ophaalindices verrijken, maar voorspellingen met weinig vertrouwen werden gemarkeerd voor beoordeling in plaats van als gezaghebbende archiefbeschrijving te gebruiken.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Deze studie gebruikte gedigitaliseerde archiefrecords en gesimuleerde opzoekopdrachten als analyse-eenheden. Archiefbewaarders kunnen de toegang tot gevoelige of cultureel beperkte documenten beperken. Volg de toegangsregels voor de repository, institutionele gegevensbeveiligingsprocedures en de-identificatievereisten voordat je documenten verwerkt of deelt. Er werd geen gevaarlijk chemisch, biologisch, scherp, radioactief of ander gereguleerd laboratoriumafval geproduceerd door deze digitale workflow.

Studieontwerp en corpusconstructie

Figuur 1 toont de volledige studieworkflow, inclusief corpusconstructie, referentielabeling, beeldvoorbewerking, OCR-generatie en postcorrectie, visuele classificatie, metadataverrijking, indexconstructie, opzoekevaluatie, statistische analyse en reproduceerbaarheidsverpakking.

De bouw van Corpus vond plaats van 15 januari tot 30 april 2025, gevolgd door systeemontwerp en debugging van 1 mei tot 31 oktober 2025. Het corpus bevatte 1.600 gedigitaliseerde archiefarchieven, geselecteerd uit acht depots die staats-, stads-, religieuze-, museum-, universiteits- en bibliotheeksystemen vertegenwoordigen. Het steekproefkader werd gestratificeerd op repository en documentklasse om archiefheerogeniteit te behouden over handgeschreven brieven, grootboeken, kaarten, kranten, foto's met bijschriften, posters, registerboeken en getypte correspondentie.

Voor elk kandidaatrecord registreerde het selectielog de repository- of collectie-identificatie, catalogusidentificatie, documentklasse, geschatte historische periode, dominante taalcontext, beschikbare afbeeldingsformaat, beeldresolutie, paginatelling en baseline beschrijvende velden. Opname vereiste het volgende: een stabiele catalogusidentificatie; minstens één TIFF-, JPEG- of PNG-paginaafbeelding; bronbeeldresolutie van minstens 150 DPI; leesbare tekstuele, tabel- of documentstructurele inhoud; en toewijzing aan een van de acht vooraf gedefinieerde documentklassen. Uitsluitingscriteria waren exacte duplicaten, blanco achterpagina's, afbeeldingen zo bijgesneden dat meer dan 30% van het tekstdragende gebied ontbrak, en dossiers die na handmatige inspectie onleesbaar werden beoordeeld.

De retrieval-benchmark bevatte 420 korte natuurlijke taalzoekopdrachten die tussen 5 augustus en 20 augustus 2025 werden gegenereerd. Querygeneratie volgde een reproduceerbaar sjabloon: de informatiebehoeften van kandidaten werden getest uit personen, instellingen, plaatsen, datums, beroepen, gebeurtenissen en thematische thema's; elke query werd genormaliseerd tot 2–9 woorden; en doelwitrelevante records werden geïdentificeerd vóór systeemvergelijking. Elke query werd geëvalueerd onder vijf opsporingsvoorwaarden, wat 2.100 gematchte zoekconditiewaarnemingen opleverde.

Referentielabeling en kwaliteitscontrole

Referentielabeling werd uitgevoerd van 1 mei tot 15 juli 2025 door drie annotatoren: twee archiefmedewerkers met ervaring in beschrijvende catalogisering en één onderzoeker in digitale geesteswetenschappen met ervaring in het beoordelen van historische documenten. De annotatiegids definieerde documentklassen, taalcontextcategorieën, historische periode-bins, metadata-volledigheidsvelden, naamgevende-entiteitscategorieën en regels voor het selecteren van OCR-evaluatieregio's.

Voor OCR-evaluatie selecteerden annotators representatieve tekstdragende regio's die kopjes, namen, data, institutionele termen, marginale notities, tabelvermeldingen en, indien aanwezig, ruisachtige indelingsgebieden bevatten. Wanneer een pagina meerdere tekstgebieden bevatte, moest het geselecteerde gebied relevant zijn voor het ophalen en voldoende tekens bevatten voor CER- en WER-berekeningen. Meningsverschillen werden eerst opgelost door overleg tussen de twee primaire annotators; Onopgeloste zaken werden beoordeeld door de Digital Humanities Researcher.

De kwaliteitscontrole gebruikte een willekeurige subset van 12% van de records. De overeenkomst tussen de annotators voor het primaire documenttype was Cohen's kappa = 0,86, wat een substantiële overeenkomst ondersteunt. Het beoordelingslogboek behield de oorspronkelijke en definitieve labels, de discord-categorie en de reden voor resolutie zodat toekomstige gebruikers klassedefinities en randgevallen kunnen controleren.

Beeldvoorbewerking

Alle afbeeldingen werden op recordniveau verwerkt met Python 3.11.8 met OpenCV 4.9.0, Pillow 10.3.0 en NumPy 1.26.4. Elke invoerpagina werd omgezet naar 8-bits grijstinten, tenzij kleur semantische informatie bevatte, zoals kaarten, posters, postzegels of kleurgecodeerde annotaties. De scheefheid werd geschat met behulp van projectieprofielen en Hough-lijndetectie; Deskewing werd alleen toegepast wanneer de absolute scheefhoek meer dan 1,5 graden was en was begrensd op 8,0 graden om vervorming te voorkomen.

Contrastversterking gebruikte contrastbeperkte adaptieve histogramequalizing met clipLimit = 2.0 en tileGridSize = 8 × 8. Een mediaanfilter met een kern van 3 × 10−23 werd alleen toegepast wanneer de geschatte achtergrondruisverhouding boven de 0,35 uitkwam. Beelden gemaakt bij 150–299 dpi werden opnieuw gesampled tot 300 dpi voor optische tekenherkenning; Beelden die al op 300 DPI of hoger zaten, werden niet opgeschaald. Er werd geen superresolutie, generatieve restauratie of inhoudshallucinatie gebruikt.

Doorloop, randverduistering, ongelijke papiertextuur, marginale stempels, handschrift, gelijnde lijnen en tafelgrenzen werden behouden tenzij deze OCR-regioselectie verhinderden. Deze regel behield archiefbewijs terwijl beeldinvoer voldoende werd gestandaardiseerd voor reproduceerbare OCR en classificatie.

OCR-basisgeneratie en post-correctie

De basislijn OCR werd gegenereerd met Tesseract OCR 5.3.0. Het primaire taalpakket werd geselecteerd uit de catalogustaal en het zichtbare schrift; meertalige decodering werd ingeschakeld wanneer de catalogustaal en het paginascript niet overeenkwamen. OCR-uitvoeren werden op recordniveau gegroepeerd en opgeslagen met pagina-identificaties, OCR-betrouwbaarheid, coördinaten voor boundingboxen indien beschikbaar, en ruwe tekst vóór correctie.

Post-OCR-correctie gebruikte een conservatieve procedure in drie fasen. Ten eerste corrigeerde normalisatie op tekenniveau frequente historische herkenningsverwarringen, waaronder ligaturen, long-s/short-s-substituties, gefragmenteerde interpunctie en cijferlettersubstituties. Ten tweede gebruikte token-niveau correctie kandidaten op bewerkafstand en frequentie uit een archiefspecifiek lexicon van persoonsnamen, plaatsnamen, instellingen, administratieve termen en historische spellingvarianten. Ten derde valideerde regelgebaseerde sequentiecontroles benoemde entiteiten en data op basis van bewijs uit context en metadata.

Kandidaatvervangers werden alleen geaccepteerd wanneer het vertrouwen in posterior correctie boven de 0,80 uitkwam; Vervangingen van naamgevende entiteiten vereisten een betrouwbaarheid van ten minste 0,85. Kandidaten onder de drempel werden als OCR-tekst behouden maar gemarkeerd voor beoordeling. CER werd berekend als de Levenshtein-bewerkingsafstand gedeeld door het aantal tekens in de referentietranscriptie. WER gebruikte dezelfde formule op tokenniveau. Terugroeping van naamgevende entiteiten werd berekend als correct herkende referentieentiteiten gedeeld door alle referentieentiteiten in de geselecteerde evaluatieregio.

Visuele documentclassificatie

De visuele classificatiemodule verdeelde elk record aan een van acht archiefdocumentklassen: handgeschreven brief, grootboek, kaart, krant, foto met bijschrift, poster, registerboek en getypte correspondentie. Het voorspelde documenttype werd gebruikt als ophaal- en filtersignaal, niet als gezaghebbende vervanging voor archiefcatalogisatie.

Het model werd geïmplementeerd in PyTorch 2.2.2 en torchvision 0.17.2 met behulp van een door ImageNet-pretrainde EfficientNet-B3 backbone. Thumbnails op recordniveau werden verkleind tot 384 x 384 pixels. Om lekkage te verminderen, werden records per repository en documentklasse opgesplitst in trainings-, validatie- en testsets in een verhouding van 70:15:15, wat overeenkomt met ongeveer 1.120, 240 en 240 records.

Training gebruikte AdamW met initiële leersnelheid = 1 × 10-4, gewichtsafname = 1 × 10−2, batchgrootte = 16, labelverzachting = 0,05, en vroegtijdig stoppen wanneer validatieverlies gedurende vijf opeenvolgende epochs niet verbeterde. Horizontaal omslaan was uitgeschakeld omdat gespiegelde archieflay-outs niet realistisch zijn. De augmentatie was beperkt tot rotatie van -3 graden naar +3 graden en helderheidsvariatie binnen ±10%.

Modeldiagnostiek op epochniveau is samengevat in 20 trainingsrijen, elk met trainingsverlies, validatieverlies, trainingsnauwkeurigheid, validatienauwkeurigheid, macro-F1, gewogen F1, ROC-AUC en PR-AUC.

Metadata-verrijkingsworkflow

Metadata-verrijking is ontworpen om de vindbaarheid te verbeteren terwijl het archiefconservatisme behouden blijft. Bestaande cataloguswaarden werden behouden tenzij ze een expliciete tegenstrijdigheid bevatten, zoals een onmogelijke datum of een documenttype conflict bevestigd door zowel OCR als visueel bewijs. Kandidatenverrijkingsvelden omvatten genormaliseerde titel, documenttype, geschatte datum, vermeldingen van instellingen, geografische vermeldingen, persoonlijke namen, onderwerpskoppen en trefwoorden.

Bewijsprioriteit volgde een vaste volgorde: (1) bestaande catalogusmetadata, (2) gecorrigeerde OCR-output, en (3) visuele documenttypevoorspelling. Gecontroleerde woordenschatmatching werd gebruikt voor onderwerpkoppen, en naaste-buur semantische uitbreiding met zinstransformatoren 2.7.0 werd alleen gebruikt wanneer cosinusgelijkenis minstens 0,72 was. Datumnormalisatie vereiste een betrouwbaarheid van ten minste 0,85 of overeenstemming tussen OCR en metadata. Elk automatisch toegevoegd veld behield zijn bron, betrouwbaarheid en regelidentificatie.

Metadata-volledigheid werd gedefinieerd als het aantal ingevulde kernbeschrijvende velden gedeeld door het aantal toepasselijke kernvelden voor dat record. Onderwerpstitelmatch werd gedefinieerd als de aanwezigheid van ten minste één subjectlabel met gecontroleerde woordenschat, ondersteund door recordniveau inhoudelijk bewijs en relevant beoordeeld voor de querycategorie.

Constructie van het terughaalsysteem

Vijf retrieval-indices werden geconstrueerd om modulebijdragen te isoleren: baseline indexing; alleen correctie voor optische tekenherkenning; alleen visuele classificatie; alleen verrijking van metadata; en volledige multimodale integratie. Alle indexen werden gebouwd in de zoekmachinesoftware die in de Table of Materials (versie 8.11.1) op recordniveau is vermeld. BM25-parameters waren vastgesteld op k1 = 1,2 en b = 0,75 vóór evaluatie.

De basisindex gebruikte originele metadata en basis-OCR-tekst. De OCR-voorwaarde verving de basislijn OCR door gecorrigeerde OCR. De visuele conditie voegde document-type priors en klassebewuste rankingverhogingen toe. De metadatavoorwaarde voegde verrijkte beschrijvende velden toe. De volledige multimodale conditie combineerde gecorrigeerde OCR, visuele priors en verrijkte metadata. Veldgewichten waren vastgesteld vóór de test: genormaliseerde titel = 3,0, onderwerpskoppen = 2,5, persoon- en instellingsvermeldingen = 2,2, plaatsvermeldingen = 2,0, documenttype = 1,8, gecorrigeerde OCR-tekst = 1,0, en basislijn OCR-inhoud = 0,8, waar van toepassing.

Exacte zinskoppeling was ingeschakeld voor citaatzoeken. Query-uitbreiding was alleen toegestaan in metadata-verrijking en full-multimodale omstandigheden en was beperkt tot geaccepteerde gecontroleerde-vocabulaire synoniemen en onderwerpsvarianten. Zoeklogs werden gegenereerd van 25 augustus tot 28 augustus 2025 in de containerized Linux-omgeving die in de Table of Materials is vermeld, met vaste seeds en bevroren indexconfiguraties.

Queryontwerp en uitkomstmaten

De 420 zoekopdrachten vertegenwoordigden gemeenschappelijke archiefzoekgedragingen in plaats van alleen benchmarkprompts met trefwoorden. Onderwerpen omvatten persoonlijke namen, instellingen, plaatsen, data en databereiken, beroepen, gebeurtenissen en thematische onderwerpen. Elke query werd opgeslagen met zijn genormaliseerde formulering, doelrecordset, query-topic categorie en moeilijkheidsscore.

De moeilijkheidsgraad werd vóór het ophalen gemeten met behulp van doelambiguïteit, lexicale specificiteit en verwachte expressiefrequentie. Samengestelde scores onder 0,40 werden geclassificeerd als lage moeilijkheidsgraad, scores van 0,40–0,69 als matige moeilijkheidsgraad, en scores van 0,70 of hoger als hoog. Relevantieoordelen werden afgerond vóór systeemvergelijking en vervolgens vergeleken met de definitieve verzameling.

De opsporingsuitkomsten omvatten P@10, R@10, nDCG@10, tijd tot eerste relevante resultaat en succesvolle zoeksnelheid. P@10 was het aandeel van de top 10 records dat relevant werd beoordeeld. R@10 was het aandeel van alle bekende relevante records die in de top 10 stonden. nDCG@10 gebruikte graded relevance waar beschikbaar en binaire relevantie anders. De tijd tot het eerste relevante resultaat werd gemeten vanaf het indienen van een query tot het eerste relevante record verscheen in de gerangschikte output. Een succesvolle zoekopdracht werd gedefinieerd als ten minste één relevant resultaat uit de top 10 records.

Statistiekenverzameling

Alle analyses werden uitgevoerd met behulp van de softwareversies die in de Materiaaltabel staan. Continue uitkomsten werden samengevat als gemiddelde ± SD wanneer ongeveer symmetrisch en als mediaan met interkwartielbereik anders. Categorische uitkomsten werden samengevat als tellingen en percentages.

De normaliteit van gepaarde verschillen werd beoordeeld met de Shapiro-Wilk test en distributiegrafieken. OCR en metadata pre/post uitkomsten werden vergeleken met gepaarde T-tests wanneer de parverschillen ongeveer normaal waren, en met Wilcoxon signed-rank tests anders. De classificatieprestaties vóór en na het fijn afstellen werden vergeleken met behulp van McNemar's test op gekoppelde correcte/onjuiste labels. Matched multi-arm retrieval uitkomsten werden vergeleken met de Friedman-test, gevolgd door Holm-gecorrigeerde paarwijze Wilcoxon teken-rank tests.

Alle statistische tests waren tweezijdig, en P < 0,05 werd als statistisch significant beschouwd. Betrouwbaarheidsintervallen werden geschat met behulp van 2.000 bootstrap-resamples, waarbij de willekeurige seed vaststond op 2025. Effecten werden gerapporteerd als gemiddelde verschillen, gematchte odds ratio's of op rang gebaseerde effectgroottes volgens uitkomsttype.

Reproduceerbaarheid, reikwijdte en beschikbaarheid van middelen

Alle pipelineparameters werden vastgesteld vóór de terugwinningstesten. Geen enkele parameter werd geoptimaliseerd op de vastgehouden retrieval-benchmark. Configuratiebestanden, gecontroleerde vocabulaires, lexicontabellen, querytemplates, veldmappingen, annotatierichtlijnen, statistische scripts en figuurgeneratiescripts werden onderhouden in het versiebeheersysteem dat is vermeld in de Table of Materials with random seed 2025.

Om onafhankelijke validatie te ondersteunen, bevat het brondata-werkboek een gedeïdentificeerde tabel met 1.600 records en 17 variabelen die worden gebruikt voor optische tekenherkenning, metadata en visuele classificatie-analyses. Afgeleide Tabel 1, Tabel 2, Tabel 3, Tabel 4 en Tabel 5, figuur-bronsamenvattingen, benchmarkquerydefinities, relevantie-oordelen, ophaal-log-vervangers, trainingsdiagnostiek, lexiconcategorieën, vocabulairemappingregels en annotatie-richtlijnvelden worden als aparte uploadbare tabellen of materiaalbestanden verstrekt waar van toepassing. Materialen die niet openbaar gedeeld kunnen worden vanwege repositorybeperkingen worden weergegeven door gedeïdentificeerde metadatavelden en reproduceerbare steekproefvelden.

Dit protocol evalueert retrieval-georiënteerde ontdekking in plaats van de waarheid van historische beweringen. Het vervangt geen archivaristaxatie, herkomstbeoordeling, privacybeoordeling of repository-specifieke toegangsregels.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

OCR-correctie verbeterde de transcriptie, vooral in handgeschreven en tabelachtige records

Optische tekenherkenningscorrectie verbeterde de transcriptiekwaliteit over alle acht archiefdocumentklassen (n = 1.600 records). De gemiddelde WER daalde van 0,529 ± 0,172 naar 0,384 ± 0,123, met een gemiddelde gepaarde verandering van −0,144 (95% BI, −0,149 tot −0,139; Wilcoxon tekende met rang P < 0,001). De gemiddelde CER daalde van 0,377 ± ...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Dit protocol toont aan dat ontdekking in historische digitale archieven het meest verbeterde wanneer OCR-correctie, visueel documentbegrip en conservatieve metadata-verrijking werden geëvalueerd als verbonden opzoekcomponenten in plaats van als geïsoleerde technische upgrades. De grootste OCR-winst vond plaats in handgeschreven, tabel- en registermateriaal, wat de waarde van post-correctie ondersteunt voor documentklassen waar de basisherkenning het zwakst is. Tegelijkertijd toont restfo...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs hebben niets te onthullen.

Dankbetuigingen

De auteurs danken oprecht de twee ervaren archiefmedewerkers en de professionele onderzoeker in digitale geesteswetenschappen voor hun waardevolle hulp bij tekstannotatie en kwaliteitscontrole. Dit onderzoek werd financieel ondersteund door het Jiangsu Provincial Archives Science and Technology Project Plan (Subsidie nr. 2024-9) voor de bouw van een intelligent, spraakgebaseerd mondelinge archiefsysteem, en het Jiangsu Provincial Science and Technology Development Plan for Traditional Chinese Medicine (subsidie nr. MS2025025) voor het bestuderen van de overerving en ontwikkeling van TCM-scholen vanuit een archiefperspectief.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow scripting, data processing, optical character recognition post-correction, and statistical support
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/Statistische analyse en genereren van eindfiguren
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractBasisgeneratie voor optische tekenherkenning
Tesseract language packsTesseract OCR ProjectStudiespecifieke taalpakken; https://github.com/tesseract-ocr/tessdataPrimaire en gemengde taal decodering voor optische tekenherkenning
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Deskewing, ruisschatting en beeldvoorverwerking
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Beeldinvoer/uitvoer en formaatnormalisatie
NumPyNumPy developersv1.26.4; https://numpy.org/Arrayberekening voor beeld- en metriekverwerking
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Verwerking van tabelgegevens en samenvattende exporten
SciPySciPy developersv1.13.1; https://scipy.org/Statistische tests en numerieke hulpmiddelen
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/Statistisch modelleren en ondersteuning voor gepaarde vergelijkingen
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Classificatiemetrieken, ROC/PR-diagnostiek en validatiehulpmiddelen
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzEdit-afstand kandidaat ranking voor optische tekenherkenning correctie
spaCyExplosion AIv3.7.4; https://spacy.io/Naamverwerking met aangepaste lexicontabellen
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Training van visuele documentclassificator
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3 implementatie en beeldtransformaties
EfficientNet-B3 backbonetorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlBackbone voor visuele documentclassificatie
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Semantische uitbreiding voor gecontroleerde woordenschatkandidaten
Search-engine softwareElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25 indexering, opvragen en rangschikken
Container engineDocker Inc.Docker v26.1.1; https://www.docker.com/Containerized opvraagomgeving
Linux operating systemCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Vaste opvoersomgeving voor opvraaklussen
Version-control systemGit projectGit v2.44.0; https://git-scm.com/Versiecontrole voor configuratie, vocabularia, scripts en figuurcode
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/R-gebaseerd figuurrenderen
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Aanvullende visualisatie en kwaliteitsborgingsplots
AnnotatierichtlijnAuteurs5 annotatiefdelen; 8 documentklasselabels; OCR-regio's; entiteitslabels; relevantieoordelen; beslechtingsregelsDefinities voor documentklassen, OCR-regio's, entiteiten, relevantieoordelen en beslechting
Archiefspecifiek OCR-lexiconAuteurs6 lexiconcategorieën: persoonvarianten, plaatsnamen, instellingsnamen, datumpatronen, administratieve termen, afkortingenNamen, plaatsen, instellingen, administratieve termen en spellingvarianten
Gecontroleerde woordenschattoewijzingAuteurs / archiefbewaarders5 toewijzingsregels die OCR-entiteiten, visuele klasse, titelsleutelwoorden, datumdekking en vraagonderwerp koppelen aan metadataveldenOnderwerp-heading matching en semantische uitbreiding
Benchmark-querysetAuteurs420 benchmark-vragen; 6 vraagonderwerpen; 3 moeilijkheidsniveaus; 8 doeldocumentklassen; 4 historische perioden; 6 taakcontextenGematchte opvragebenchmark over vijf systeemtakken
RelevantieoordelenAuteurs / annotatoren2.100 vraag-systeem rijen; 420 vragen x 5 systeemtakken; relevante totaal, relevant-in-top-10-tellingen, gegradeerde relevantie en succesvlaggenGround-truth surrogaat voor P@10, R@10, nDCG@10 en succesvolle-zoeksnelheid
TrainingsdiagnostiekAuteurs20 epochen; trainingsverlies; validatie-verlies; trainingsnauwkeurigheid; validatienauwkeurigheid; macro-F1; gewogen-F1; ROC-AUC; PR-AUCDiagnostische samenvattingen op epochniveau
Computationele hardwareAuteurs8 CPU-kernen; 32 GB RAM; NVIDIA GPU-klasse trainingsomgevingReproduceerbaarheidsresourcedetail voor JoVE-inzending
Dataset-bestandAuteursdata.xlsx; 1.600 records; 17 variabelen; DOI vermeld in manuscript Data BeschikbaarheidBrongegevens op recordniveau voor optische tekenherkenning, metadatavolledigheid, ontdekbaarheid en visuele classificatieanalyses

Referenties

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Tags

EngineeringNummer 234Nummer 234Lege waardeNummerDigitale archievenMultimodale AIOCR correctieMetadata verrijkingVisuele classificatie en query s voor historische registers