Araştırma makalesi

Tarihsel Dijital Arşiv Keşfi için Tekrarlanabilir Çok Modlu Yapay Zeka İş Akışı

DOI:

10.3791/71698

7 Ağustos 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada, düzeltme sonrası optik karakter tanıma, görsel belge sınıflandırma, meta veri zenginleştirme ve geri alma değerlendirmesini denetlenebilir bir iş akışına entegre ederek tarihsel dijital arşivlerde keşfi geliştirmek için bir protokol sunuyoruz.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tarihsel dijital arşivler giderek daha fazla aranabilir hale gelir, ancak optik karakter tanıma hataları, görsel olarak heterojen belge türleri ve az sayıda meta veri ayrı ele alındığında keşif sınırlı kalır. Bu çalışma, muhafazakar çok modlu yapay zeka iş akışının, arşivci incelemesini değiştirmeden arşiv bulgularını iyileştirip iyileştiremeyeceğini değerlendirmek için tekrarlanabilir bir protokol geliştirmeyi amaçladı. Sekiz belge sınıfından 1.600 dijitalleştirilmiş arşiv kaydı bir korpus oluşturuldu ve 420 sorgulu bir kıyaslama kullanılarak beş başvuru koşulları karşılaştırıldı: temel indeksleme, yalnızca optik karakter tanıma düzeltmesi, yalnızca görsel sınıflandırma, yalnızca meta veri zenginleştirmesi ve tam çok modlu entegrasyon. Kayıt düzeyindeki sonuçlar arasında karakter hata oranı (CER), kelime hata oranı (WER), isimli varlık hatırlaması, belge türü sınıflandırma doğruluğu, tahmin güvenilirliği, meta veri tamlığı ve konu-başlık eşleşmesi yer aldı. Sorgu düzeyindeki sonuçlar arasında P@10, R@10, nDCG@10, ilk ilgili sonuca ulaşma süresi ve başarılı arama oranı yer alıyordu. Optik karakter tanıma düzeltmesi, el yazısı mektuplar, defterler ve kayıt defterleri için GER'yi en çok azalttı; görsel ince ayar, özellikle haritalar, posterler, gazeteler ve kayıt defterleri için sınıflandırma doğruluğunu artırdı; ve meta veri zenginleştirmesi, tüm tarihsel dönemlerde tamlığı artırdı. Tam multimodal koşul, en yüksek geri alma performansını elde etti (P@10 = 0.624, R@10 = 0.492, nDCG@10 = 0.634) ve ilk ilgili sonucun ortalama süresini 156.079 saniyeden 58.485 saniyeye indirdi. Bu sonuçlar, metin, görüntü ve tanımlayıcı sinyallerin açık eşikler ve insan incelemesi altında birleştirildiği modüler, denetlenebilir bir iş akışını destekler.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dijital arşivler hızla genişledi ve artık tarih, kültürel miras, kamu yönetimi ve dijital beşeri bilimler alanlarındaki araştırmaları desteklemektedir. Ancak, arşiv kayıtları genellikle bozulmuş optik karakter tanıma çıktısını, görsel olarak çeşitli sayfa düzenlerini, tutarsız kataloglama uygulamalarını ve tarihsel olarak değişken isimler, yerler ve kurumları birleştirdiği için erişim eşit olmaya devam eder. Bu sınırlamalar sadece transkripsiyon kalitesini değil, aynı zamanda dijitalleştirilmişkoleksiyonlar 1,2,3,4,5,6,7'nin geri dönüş yeniden kullanımını da etkiler.

Mevcut belge yapay zekası ve arşiv-arama çalışmaları, düzeltme sonrası optik karakter tanıma, belge-görüntü sınıflandırması, meta veri normalizasyonu, konu modelleme, kelime gömmeleri, sinirsel arama ve veri yönetişimi uygulamaları gibi bireysel bileşenlerigeliştirmiştir 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. Ancak birçok arşiv sistemi bu bileşenleri ayrı ayrı değerlendiriyor ve bu da birleşik iş akışının gerçekçi arama koşullarında keşfi iyileştirip iyileştirmediğini belirlemeyi zorlaştırıyor. Burada ele alınan metodolojik eksiklik, metin, görüntü ve meta veri modüllerini tek bir arşiv iş akışında arama sonuçlarına bağlayan tekrarlanabilir, denetlenebilir bir protokolün eksikliğidir.

Temel amaç, optik karakter tanıma düzeltmesi, görsel belge sınıflandırması ve kurallarla sınırlı meta veri zenginleştirmesinin aynı arama kıyaslamasına göre değerlendirildiğinde tamamlayıcı iyileştirmeler sağlayıp sağlamadığını test etmekti.

Arşiv keşfi, okunabilir metin, görsel olarak yorumlanabilir belge yapısı ve aranabilir betimleyici meta verilerin etkileşimine bağlı olduğu için, tam multimodal koşulun her tek bileşenli koşulu daha iyi performans göstereceğini varsaydık. İş akışı muhafazakar şekilde tasarlandı: otomatik çıktılar geri alım indekslerini zenginleştirebilirken, düşük güvenli tahminler yetkili arşiv açıklaması olarak kullanılmak yerine inceleme için işaretlendi.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, analiz birimleri olarak dijitalleştirilmiş arşiv kayıtları ve simüle edilmiş geri alma sorgularını kullandı. Arşiv depoları, hassas veya kültürel olarak kısıtlanmış kayıtlara erişimi kısıtlayabilir. Herhangi bir kayıt işlemeden veya paylaşmadan önce depo erişim kurallarına, kurumsal veri güvenliği prosedürlerine ve kimlik kaldırma gereksinimlerine uyun. Bu dijital iş akışı nedeniyle tehlikeli kimyasal, biyolojik, keskin madde, radyoaktif veya diğer düzenlenmiş laboratuvar atıkları oluşmadı.

Çalışma tasarımı ve korpus yapısı

Şekil 1, korpus oluşturma, referans etiketleme, görüntü ön işleme, OCR üretimi ve düzeltme sonrası işlemler, görsel sınıflandırma, meta veri zenginleştirme, indeks oluşturma, geri alma değerlendirmesi, istatistiksel analiz ve tekrarlanabilirlik paketleme dahil olmak üzere tüm çalışma iş akışını sunmaktadır.

Korpus inşaatı 15 Ocak-30 Nisan 2025 tarihleri arasında gerçekleştirildi, ardından 1 Mayıs - 31 Ekim 2025 tarihleri arasında sistem tasarımı ve hata ayıklama yapıldı. Korpus, eyalet, şehir, dini, müze, üniversite ve kütüphane sistemlerini temsil eden sekiz depodan seçilmiş 1.600 dijitalleştirilmiş arşiv kaydını içeriyordu. Örnekleme çerçevesi, el yazısı mektuplar, defterler, haritalar, gazeteler, başlıklı fotoğraflar, posterler, kayıt defterleri ve yazılı yazışmalar arasında arşiv heterojenliğini korumak için depo ve belge sınıfına göre katmanlandırılmıştır.

Her aday kayıt için, seçim günlüğü depo veya koleksiyon tanımlayıcısı, katalog tanımlayıcısı, belge sınıfı, yaklaşık tarihsel dönem, baskın dil bağlamı, mevcut görüntü formatı, görüntü çözünürlüğü, sayfa sayısı ve temel tanımlayıcı alanları kaydetmiştir. Dahil etmek için aşağıdakilerin hepsi gerekti: kararlı bir katalog tanımlayıcısı; en az bir TIFF, JPEG veya PNG sayfa görseli; en az 150 dpi kaynak görüntü çözünürlüğü; okunabilir metin, tablo veya belge-yapısal içerik; ve sekiz önceden tanımlanmış belge sınıfından birine atanma. Dışlama kriterleri ise tam kopyalar, boş ters sayfalar, metin içeren alanın %30'undan fazlasının eksik olacak şekilde kırpılmış görüntüler ve manuel incelemeden sonra okunamaz sayılanan kayıtlardı.

Geri alma kıyaslası, 5 Ağustos ile 20 Ağustos 2025 arasında oluşturulan 420 kısa doğal dil sorgusunu içeriyordu. Sorgu oluşturma tekrarlanabilir bir şablon izledi: aday bilgi ihtiyaçları insanlardan, kurumlardan, yerlerden, tarih aralıklarından, mesleklerden, etkinliklerden ve güncel temalardan örneklendi; her sorgu 2–9 kelimeye normalleştirildi; ve hedef ilgili kayıtlar sistem karşılaştırmasından önce belirlendi. Her sorgu, beş toplama koşulunda değerlendirildi ve 2.100 eşleşen sorgu-koşulu gözlemi elde edildi.

Referans etiketleme ve kalite kontrolü

Referans etiketleme, 1 Mayıs - 15 Temmuz 2025 tarihleri arasında üç annotör tarafından gerçekleştirildi: betimleyici kataloglamada deneyimli iki arşiv personeli ve tarihi belge değerlendirmesinde deneyimli bir dijital beşeri bilimler araştırmacısı. Açıklama rehberi, belge sınıflarını, dil bağlamı kategorilerini, tarihsel dönem kutularını, metaveri tamlık alanlarını, adlandırılmış varlık kategorilerini ve OCR değerlendirme bölgelerini seçme kurallarını tanımladı.

OCR değerlendirmesi için, annotatörler başlıklar, isimler, tarihler, kurumsal terimler, kenar notları, tablo girişleri ve varsa gürültülü düzen alanlarını içeren temsil metin içeren bölgeleri seçtiler. Bir sayfa birden fazla metin bölgesi içerdiğinde, seçilen bölge geri alınma için ilgili olmalı ve CER ile WER hesaplaması için yeterli karakter içermeliydi. Anlaşmazlıklar ilk olarak iki ana anlatıcı arasındaki tartışmayla uzlaştırıldı; Çözülmemiş davalar Dijital Beşeri Bilimler Araştırmacısı tarafından değerlendirildi.

Kalite kontrolü, rastgele %12'lik bir kayıt alt kümesi kullandı. Birincil belge tipi için annotatörler arası anlaşma Cohen'in kappa'sı = 0.86 idi ve önemli bir uyumu destekledi. Karar günlüğü, gelecekteki kullanıcıların sınıf tanımlarını ve kenar durumlarını denetleyebilmesi için orijinal ve nihai etiketleri, anlaşmazlık kategorisini ve çözüm sebebini korudu.

Görüntü ön işleme

Tüm görüntüler, Python 3.11.8 ile OpenCV 4.9.0, Pillow 10.3.0 ve NumPy 1.26.4 ile kayıt seviyesinde işlendi. Her giriş sayfası, renkler haritalar, posterler, pullar veya renk kodlu notlar gibi anlamsal bilgiler taşımadıkça 8 bit gri tonlu olarak dönüştürülürdü. Eğiklik, projeksiyon profilleri ve Hough çizgisi tespiti kullanılarak tahmin edildi; Desewing yalnızca mutlak eğik açı 1,5 dereceyi geçtiğinde uygulanır ve bozulmayı önlemek için 8,0 derece ile sınırlandırılmıştır.

Kontrast artırma, clipLimit = 2.0 ve tileGridSize = 8 × 8 ile kontrast sınırlı adaptif histogram eşitleme kullandı. 3 × 10−23 çekirdeğe sahip bir medyan filtre, ancak tahmini arka plan gürültü oranı 0.35'i aştığında uygulandı. 150–299 dpi arasında çekilen görüntüler, optik karakter tanıma için 300 dpi'ye yeniden örneklendi; 300 DPI veya üzerindeki görüntüler yukarı ölçeklendirilmedi. Süper çözünürlük, üretken restorasyon veya içerik halüsinasyonu kullanılmadı.

Sızma izileri, kenar karartması, düzensiz kağıt dokusu, kenar damgaları, el yazısı, çizgili çizgiler ve tablo sınırları, OCR bölge seçimini engellemedikçe korundu. Bu kural, arşiv kanıtlarını koruyarak görüntü girişlerini tekrarlanabilir OCR ve sınıflandırma için yeterince standartlaştırdı.

OCR baz üretimi ve düzeltme sonrası

Temel OCR Tesseract OCR 5.3.0 ile oluşturuldu. Ana dil paketi, katalog dili ve görünür alfabeden seçildi; katalog dili ile sayfa betiği eşleşmediğinde çok dilli çözme etkinleştirildi. OCR çıktıları kayıt seviyesinde gruplandırılır ve sayfa tanımlayıcıları, OCR güveni, mevcut olduğunda sınırlayıcı kutu koordinatları ve düzeltmeden önce ham metinle birlikte saklanırdı.

OCR sonrası düzeltme üç aşamalı konservatif bir prosedür kullandı. İlk olarak, karakter düzeyinde normalizasyon, ligatürler, uzun/kısa-s ikameleri, parçalı noktalama işaretlemeleri ve rakam-harf ikameleri gibi sık karşılaşılan tarihsel tanıma karışıklıklarını düzeltti. İkinci olarak, token düzeyinde düzeltme, arşivlere özgü kişisel isimler, yer adları, kurumlar, idari terimler ve tarihsel yazım varyantlarından oluşan arşiv sözlüğünden düzenleme mesafesi ve sık dereceli adaylar kullandı. Üçüncü olarak, kural tabanlı dizi kontrolleri, isimlendirilmiş varlıkları ve tarihleri bağlam ve meta verilerden elde edilen kanıtlarla doğrular.

Aday değiştirmeler yalnızca arka düzeltme güveni 0,80'i geçtiğinde kabul edildi; Adı geçen varlık değişiklikleri için en az 0,85 güven gerekiyordu. Eşiğin altındaki adaylar OCR metni olarak tutuldu ancak inceleme için işaretlendi. CER, Levenshtein düzenleme mesafesinin referans transkripsiyondaki karakter sayısına bölünmesiyle hesaplandı. WER aynı formülü token seviyesinde kullandı. Adlandırılmış varlık geri çağırma, doğru tanınan referans varlıkların seçilen değerlendirme bölgesindeki tüm referans varlıklara bölünmesi olarak hesaplandı.

Görsel belge sınıflandırması

Görsel sınıflandırma modülü her kaydı sekiz arşiv belge sınıfından birine atayırdı: el yazısı mektup, defter, harita, gazete, başlıklı fotoğraf, poster, kayıt defteri ve daktilo ile yazışma. Tahmin edilen belge türü, arşiv kataloglamasının yetkili bir yerine değil, bir buluşma ve filtreleme sinyali olarak kullanıldı.

Model, PyTorch 2.2.2 ve torchvision 0.17.2 ile ImageNet ön eğitilmiş EfficientNet-B3 omurgası kullanılarak uygulanmıştır. Rekor seviyesinde küçük resimler 384 x 384 piksele boyutlandırıldı. Sızıntıyı azaltmak için, kayıtlar depo ve belge sınıflarına göre eğitim, doğrulama ve test setlerine 70:15:15 oranında bölündü; bu yaklaşık 1.120, 240 ve 240 kayıtlara karşılık gelir.

Eğitimde AdamW kullanıldı; başlangıç öğrenme oranı = 1 × 10-4, ağırlık kaybı = 1 × 10−2, parti büyüklüğü = 16, etiket yumuşatma = 0.05 ve doğrulama kaybı beş üst üste düzelmediğinde erken durma yöntemi kullanıldı. Yatay çevirme durduruldu çünkü aynalı arşiv düzenleri gerçekçi değil. Artırma, -3 dereceden +3 dereceye kadar dönüş ve parlaklık değişimi %±10 ile sınırlıydı.

Dönem düzeyindeki model tanılaması, her biri eğitim kaybı, doğrulama kaybı, eğitim doğruluğu, doğrulama doğruluğu, makro-F1, ağırlıklı-F1, ROC-AUC ve PR-AUC içeren 20 eğitim satırında özetlenmiştir.

Metaveri zenginleştirme iş akışı

Meta veri zenginleştirmesi, arşivsel muhafazakarlığı koruyarak keşfedilebilirliği artırmak için tasarlanmıştır. Mevcut katalog değerleri, imkansız bir tarih veya hem OCR hem de görsel kanıtlarla doğrulanan belge türü çakışması gibi açık bir çelişki içermedikçe korundu. Aday zenginleştirme alanları arasında normalleştirilmiş başlık, belge türü, yaklaşık tarih, kurum anmaları, coğrafi belirtmeler, kişisel isim belirtmeleri, konu başlıkları ve anahtar kelimeler yer alıyordu.

Kanıt önceliği sabit bir sıraya uyuyordu: (1) mevcut katalog meta verileri, (2) düzeltilmiş OCR çıktısı ve (3) görsel belge tipi tahmin. Kontrollü kelime dağarcığı eşleştirmesi konu başlıkları için kullanıldı ve cümle-dönüştürücüler 2.7.0 ile en yakın komşu anlamsal genişletme yalnızca kosinüs benzerliği en az 0.72 olduğunda kullanıldı. Tarih normalizasyonu için en az 0.85 güven veya OCR ile meta veri arasında uyum gerekiyordu. Her otomatik eklenen alan kaynağını, güvenini ve kural tanımlayıcısını korudu.

Metaveri tamlığı, doldurulmuş çekirdek tanımlayıcı alanların sayısının o kayıt için uygulanabilir çekirdek alanların sayısına bölünmesi olarak tanımlanmıştır. Konu-başlık eşleşmesi, kayıt düzeyinde içerik kanıtlarıyla desteklenen ve sorgu kategorisiyle ilgili olarak değerlendirilen en az bir kontrollü kelime etiketinin varlığı olarak tanımlandı.

Geri alma sistemi inşası

Modül katkılarını izole etmek için beş geri dönüş endeksi oluşturuldu: temel indeksleme; sadece optik karakter tanıma düzeltmesi; sadece görsel sınıflandırma; sadece meta veri zenginleştirmesi; ve tam multimodal entegrasyon. Tüm endeksler, kayıt düzeyinde Materyaller Tablosunda (sürüm 8.11.1) listelenen arama motoru yazılımında oluşturulmuştur. BM25 parametreleri değerlendirmeden önce k1 = 1.2 ve b = 0.75 olarak sabitlendi.

Temel indeks, orijinal meta veri ve temel OCR metni kullandı. OCR koşulu, temel OCR'nin yerine düzeltilmiş OCR aldı. Görsel durum, belge tipi öncelikler ve sınıf farkında sıralama artışları ekledi. Meta veri koşulu zenginleştirici betimleyici alanlar ekledi. Tam multimodal koşul, düzeltilmiş OCR, görsel öncelikler ve zenginleştirilmiş meta verileri birleştirdi. Saha ağırlıkları testten önce sabitlendi: normalleştirilmiş başlık = 3.0, konu başlıkları = 2.5, kişi ve kurum referansları = 2.2, yer belirtmeleri = 2.0, belge tipi = 1.8, düzeltilmiş OCR gövde metni = 1.0 ve başlangıç OCR gövde metni = 0.8, uygun olduğunda.

Alıntılanan sorgular için tam ifade eşleştirmesi etkinleştirildi. Sorgu genişletme yalnızca meta veri zenginleştirme ve tam multimodal koşullarda izin verildi ve kabul edilen kontrollü kelime zenginleri ile konu başlığı varyantlarıyla sınırlıydı. Arama günlükleri, 25 Ağustos - 28 Ağustos 2025 tarihleri arasında, Materyaller Tablosu'nda listelenen konteynerize Linux ortamında, sabit tohumlar ve dondurulmuş indeks konfigürasyonlarıyla oluşturuldu.

Sorgu tasarımı ve sonuç ölçütleri

420 sorgu, sadece anahtar kelime ölçüt önerileri yerine yaygın arşiv arama davranışlarını temsil ediyordu. Konular arasında kişisel isimler, kurumlar, yerler, tarihler ve tarih aralıkları, meslekler, etkinlikler ve tematik konular yer alıyordu. Her sorgu, normalleştirilmiş ifadeleri, hedef kayıt seti, sorgu-konu kategorisi ve zorluk puanıyla birlikte saklanıyordu.

Zorluk, geri alımdan önce hedef belirsizliği, sözcük özgüllüğü ve beklenen ifade sıklığı kullanılarak puanlandırıldı. 0.40'ın altındaki bileşik puanlar düşük zorluk, 0.40–0.69 arası skorlar orta zorluk ve 0.70 veya üzerindeki puanlar yüksek zorluk olarak sınıflandırıldı. İlgi değerlendirmeleri sistem karşılaştırmasından önce tamamlanmış ve nihai koleksiyonla karşılaştırılmıştır.

Arama sonuçları arasında P@10, R@10, nDCG@10, ilk ilgili sonuca ulaşma süresi ve başarılı arama oranı yer alıyordu. P@10, ilgili olarak değerlendirilen ilk 10 kayıt oranıydı. R@10, ilk 10'da bulunan bilinen tüm ilgili kayıtların oranıydı. nDCG@10 mevcut olduğunda dereceli alaka düzeyini, diğer halde ikili alaka kullandı. İlk ilgili sonuca kadar olan süre, sorgu göndermesinden sıralanmış çıktıda ilk ilgili kayıt ortaya çıkana kadar ölçülüyordu. Başarılı bir arama, en az bir ilgili sonuç olarak tanımlandı, ilk 10 kayıt arasında en az bir ilgili sonuç olarak tanımlandı.

İstatistik toplama

Tüm analizler, Materyaller Tablosu'nda listelenen yazılım sürümleri kullanılarak gerçekleştirildi. Sürekli sonuçlar, yaklaşık simetrik olduğunda ortalama SD ± ve diğer durumlarda orta çeyrek arası aralıkla median olarak özetlendi. Kategorik sonuçlar sayım ve yüzdeler olarak özetlendi.

Çift farkların normalliği Shapiro-Wilk testi ve dağılım grafikleriyle değerlendirildi. OCR ve meta veriler, eşleşmiş farklar yaklaşık normalken eşleştirilmiş t testleriyle karşılaştırıldı ve Wilcoxon işaretli sıralama testleri aksi halde yapıldı. İnce ayar öncesi ve sonrası sınıflandırma performansı, McNemar'ın eşleştirilmiş doğru/yanlış etiketler testi kullanılarak karşılaştırıldı. Eşleşen çoklu kol toplama sonuçları, Friedman testi ile karşılaştırıldı ve ardından Holm ile ayarlanmış çift Wilcoxon imzalı sıralama testleri yapıldı.

Tüm istatistiksel testler iki kuyrukluydu ve P < 0.05 istatistiksel olarak anlamlı kabul edildi. Güven aralıkları, rastgele tohum 2025 olarak sabitlenmiş şekilde 2.000 bootstrap yeniden örnekleme kullanılarak tahmin edildi. Etkiler, ortalama farklar, eşleşen olasılık oranları veya sonuç türüne göre sıralama tabanlı etki boyutları olarak bildirildi.

Tekrarlanabilirlik, kapsam ve kaynak erişilebilirliği

Tüm boru hattı parametreleri geri alma testinden önce sabitlendi. Bekletilmiş geri alma kıyaslamasında hiçbir parametre optimize edilmedi. Yapılandırma dosyaları, kontrol edilen kelime deflerleri, sözlük tabloları, sorgu şablonları, alan eşlemeleri, notasyon kılavuzları, istatistiksel betikler ve şekil oluşturma betikleri, rastgele tohum 2025 ile Materyaller Tablosu'nda listelenen sürüm kontrol sisteminde korundu.

Bağımsız doğrulamayı desteklemek için, kaynak veri çalışma defteri, optik karakter tanıma, meta veri ve görsel sınıflandırma analizleri için kullanılan 17 değişken içeren kimliği silinmiş 1.600 kayıtlık bir tablo içerir. Türedilen Tablo 1, Tablo 2, Tablo 3, Tablo 4 ve Tablo 5, şekil kaynağı özetleri, kıyaslama sorgusu tanımları, alaka değerlendirmesi özetleri, geri alma günlüğü vekili, eğitim tanıları, sözlük kategorileri, kelime eşleme kuralları ve açıklama-kılavuz alanları, uygun olduğunda ayrı yüklenebilir tablolar veya materyal dosyaları olarak sağlanır. Depo kısıtlamaları nedeniyle kamuya açık paylaşılamayan materyaller, kimliği silinmiş meta veri alanları ve tekrarlanabilir örnekleme alanlarıyla temsil edilir.

Bu protokol, tarihsel iddiaların doğruluğundan ziyade geri arama odaklı keşfi değerlendirir. Arşivci değerleme, kaynak değerlendirmesi, gizlilik incelemesi veya depoya özgü erişim kurallarının yerini almaz.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

OCR düzeltmesi, özellikle el yazısı ve tablo şeklinde kayıtlarda transkripsiyonu iyileştirdi

Optik karakter tanıma düzeltmesi, sekiz arşiv belge sınıfının tamamında transkripsiyon kalitesini artırdı (n = 1.600 kayıt). Ortalama WER 0,529 ± 0,172'den 0,384'e ± 0,123'e düştü, ortalama çift değişim ise −0,144 (%95 GÜ, −0,149 ile −0,139; Wilcoxon, P < 0.001 ile imzaladı). Ortalama CER 0,377 ± 0,126'dan 0,258'± 0,086'ya düştü, ortalama çift değişim ise −0,119 (%95 CI, −0,123'ten −0,116'ya; Wilcoxon, P < 0.001 ile imzaladı). Tablo 2 , temel GER'nin el yazısı mektuplar, defterler ve kayıt defterleri için en yüksek olduğunu göstermektedir; bu da en görsel olarak karmaşık kayıtların en büyük ilk tanıma yüküne sahip olduğunu gösterir.

Düzeltmeden sonra, WER tüm belge sınıflarında azaldı. En büyük ortalama çift WER indirgenmeleri el yazısı mektuplarda (n = 262; −0.200; %95 CI, −0.213 ile −0.188), defterlerde (n = 263; −0.195; %95 CI, −0.206 ile −0.183) ve kayıt defterlerinde (n = 194; −0.173; %95 CI, −0.187 ile −0.160) gerçekleşmiştir. CER aynı modeli takip etti ve düzeltme sonrası modülün esas olarak zor el yazısı, tablo ve karışık düzenli kayıtlara fayda sağladığı yorumunu destekledi.

Adlandırılmış varlık geri çağırması da özet tablosunda gösterildiği gibi tüm belge türlerinde gelişti. En büyük artışlar el yazısı mektuplarda (0.302–0.440), defterlerde (0.336–0.471) ve kayıt defterlerinde (0.369–0.504) gerçekleşti. Tipli yazışma, düzeltme sonrası en yüksek isimli varlık geri çağırışına (0.646) ulaştı, ancak bu sınıf için temel tanıma zaten daha güçlü olduğu için mutlak kazancı daha küçüktü. Şekil 2 , kayıt düzeyindeki temel CER-WER ilişkisini, el yazısı yoğunluğu ile düzeltme faydası arasındaki ilişkiyi ve düzeltme sonrası kayıt düzeyinde bulunabilirlikteki değişimi özetlemektedir.

Görsel belge sınıflandırması genel olarak gelişti, ancak sınıflar arasında performans artışları eşit değildi

Görsel belge sınıflandırması, 1.600 kayıtlık test seti boyunca genel olarak gelişti. Top-1 doğruluğu 0.717'den 0.796'ya yükseldi (mutlak değişim, 0.079; McNemar kare kare = 27.33; P < 0.001) ve ortalama tahmin güvenilirliği 0.736 ± 0.131'den 0.800'e ± 0.108'e yükseldi (ortalama çift değişim, 0.064; %95 CI, 0.057–0.071; çift t testi P < 0.001). Tablo 3'te gösterildiği gibi, sekiz sınıftan yedisi arşivlere özgü ince ayar sonrası gelişti ve en büyük kazançlar haritalar, afişler, gazeteler ve kayıt defterleri için oldu.

Tiplenen yazışma, ince ayarlamadan sonra (0.796–0.791) önemli ölçüde iyileşmedi; bu da temel görsel özelliklerinin zaten stabil olduğunu ve eğitim prosedürünün bu kategori için ek sınıf ayrımı çok az eklediğini düşündürdü.

Şekil 3, arşivlere özgü ince ayar öncesi ve sonrası görsel belge sınıflandırma performansını özetler; kaynak veri çalışma defteri, tren/doğrulama kayıpları ve doğruluğu için 20 dönem ile birlikte makro-F1, ağırlıklı-F1, ROC-AUC ve PR-AUC tanı özetleri listeler.

Meta veri zenginleştirmesi, tüm tarihsel dönemlerde betimleyici tamlığı artırdı (n = 1.600 kayıt). Ortalama tamlık 0,657 ± 0,125'ten 0,907± 0,070'e yükseldi, ortalama çift değişim ise 0,250 (%95 CI, 0,243–0,257; Wilcoxon, P < 0.001 ile imzaladı). Tablo 4'te gösterildiği gibi, temel tamlık 1850–1879 yılları arasında en düşük seviyedeydi ve zenginleşmeden önceki sonraki dönemlerde artmıştır. Şekil 4 , metaveri tamlığındaki iyileşmeyi, belge türüne göre yeni gerçekleşen meta veri alanlarını ve tarihsel dönemler boyunca konu başlığı eşleşme kazanımlarını özetlemektedir.

Zenginleştirmeden sonra, her tarihsel dönemde tamlık arttı: 1850–1879 (n = 281; ortalama değişim 0,207; %95 GA, 0,191–0,223), 1880–1909 (n = 474; ortalama değişim 0,236; %95 GA, 0,223–0,248), 1910–1939 (n = 549; ortalama değişim 0,277; %95 GA, 0,265–0,288) ve 1940–1969 (n = 296; ortalama değişim 0,263; %95 GA, 0,247–0,279). Nüfuslu tarlaların ortalama sayıları da dönemler boyunca tutarlı şekilde arttı.

Konu-başlık eşleşmesi paralel olarak geliştirildi. Temel eşleşme oranları %64,3 ile %69,4 arasında varken, zenginleştirme sonrası eşleşme oranları %82,1 ile %85,4 arasında değişiyordu. En büyük mutlak kazanç en erken dönemde gerçekleşmiştir (Delta = 0.178), bu da az orijinal tanıma sahip kayıtlar için muhafazakar zenginleştirmenin değerini desteklemektedir.

Tüm geliştirilmiş sistemlerde geri alma performansı arttı ve en güçlü kazançlar tam multimodal entegrasyonda elde edildi

Geri alma etkinliği, her geliştirme koşulu altında başlangıç seviyesine göre arttı, ancak iyileşmenin büyüklüğü sistem koluna göre değişiyordu (n = 420 eşleşen kıyaslama sorusu). Genel toplama sonuçları Tablo 5'te listelenmiştir. Başlangıç performansı düşüktü: P@10 = 0,394, R@10 = 0,238, nDCG@10 = 0,392, ilk ilgili sonuca ortalama süre = 156,079 s, ve başarılı arama oranı = %5,0 (21/420; %95 GA, %3,3–%7,5). Şekil 5 , toplam geri alma metrikleri, konu düzeyinde başarı oranları ve sorgu zorluk katmanları dahil olmak üzere beş deneysel sistem kolu boyunca geri alma performansını özetler.

Üç tek bileşenli sistemin tamamı toplamda tabanı geride bıraktı. Optik karakter tanıma düzeltmesi P@10 arttı 0,484'e, R@10 0,346'ya ve nDCG@10 arttı 0,475'e yükseldi; ilk ilgili sonucun süresi 124,261 saniyeye düşürüldü ve başarılı arama oranı %30,2'ye yükseltildi (127/420; %95 GA, %26,0–%34,8). Görsel sınıflandırmada P@10 = 0,490, R@10 = 0,302, nDCG@10 = 0,478, ilk ilgili sonuca ortalama süre = 131,985 s, başarılı arama oranı ise %22,9 (%96/420; %95 GA, %19,1–%27,1) üretti. Metaveri zenginleştirmesi, en güçlü tek bileşenli geri dönüş performansını sağladı; P@10 = 0.507, R@10 = 0.347, nDCG@10 = 0.513, ilk ilgili sonuca ortalama zaman = 117.474 saniye ve başarılı arama oranı %38.3 (161/420; %95 GA, %33.8–%43.1).

Tam multimodal sistem, tüm alım uç noktalarında en iyi performans gösterdi. P@10 başlangıçta 0,394'ten 0,624'e, R@10 0,238'den 0,492'ye ve nDCG@10 0,392'den 0,634'e yükseldi. İlk ilgili sonucun ortalama süresi 156.079 saniyeden 58.485 saniyeye düştü ve başarılı arama oranı %5.0'dan %95.5'e yükseldi (401/420; %95 GA, %93.0–%97.1). Bu değerler, P@10 için 0.230, R@10 için 0.254 ve nDCG@10 için 0.242 mutlak kazançlara karşılık gelir.

Konuya özgü alım da tam multimodal entegrasyon altında gelişti. Başarılı arama oranları insanlar, kurumlar, yerler, meslekler, etkinlikler ve konu temaları arasında arttı; meslek kategorisi en büyük pratik kazancı gösterdi; temel başarı oranı %0,0 iken tam multimodal koşullarda %90,0'a yükseldi. Yer adı sorguları en güçlü temel performansa sahipti ancak yine de multimodal entegrasyondan fayda sağladı.

Multimodal kazanımlar belge, dönem ve dil katmanlarına göre değişiyordu

Alt grup analizleri, çoklu modal kazanımların belge türleri, tarihsel dönemler ve dil bağlamları arasında geniş dağıldığını gösterdi, ancak iyileşmenin büyüklüğü değişkenlik gösterdi. Bu heterojenlik, iş akışının her hedef koleksiyon içinde değerlendirilmesi gerektiğini, eşit kazançlar elde edileceği varsayılması gerektiğini gösterir. Şekil 6, hedef belge türü, tarihsel dönem ve dil bağlamı genelinde çoklu modal alım kazanımlarının heterojenliğini göstermektedir.

Belge türü düzeyinde, nDCG@10 tüm hedef sınıflarda gelişti. Başlıklar, el yazısı mektuplar, haritalar, defterler ve kayıt defterleri içeren fotoğraflar güçlü artışlar gösterirken, gazeteler ve yazılı yazışmalar daha mütevazı şekilde gelişti. Bu desenler, zayıf başlangıç meta verilerine veya karmaşık görsel yapısına sahip kayıtların birleşik metin, görüntü ve meta veri sinyallerinden en çok fayda sağladığını göstermektedir.

Tarihsel dönem düzeyinde, R@10 1850–1879 için 0.175'ten 0.429'a yükseldi ve tam multimodal entegrasyonda 1880–1909 için 0.506, 1910–1939 için 0.501 ve 1940–1969 için 0.519'a ulaştı. Kazanımlar, dönemler arasında mutlak ölçekte benzerdi; bu da zenginleştirme ve düzeltilmiş tanımanın hem erken seyrek kayıtlara hem de daha zengin temel meta verilere sahip sonraki kayıtlara yardımcı olduğunu gösteriyor.

Dil-bağlam sonuçları benzer bir desen gösterdi. P@10 tam multimodal koşulda karışık Latin alfabesi kayıtları için 0.607, İngilizce için 0.628, Fransızca için 0.618, Almanca için 0.661 ve Portekizce ile İspanyolca için 0.639'a ulaştı. En büyük hassasiyet artışı, en zayıf temel hassasiyete sahip olan karışık Latin alfabesiyle kayıtlarda gerçekleşti.

Bileşen düzeyindeki kalıplar: tamamlayıcı katkılar, tekrarlı değil

Sonuçlar birlikte, protokol bileşenlerinin gereksiz değil, tamamlayıcı olduğunu gösterir. OCR düzeltmesi metin tanınabilirliğini artırdı, görsel sınıflandırma yapıya duyarlı belge tipi sinyaller ekledi ve meta veri zenginleştirmesi arama yapılabilir betimleyici katmanı genişletti. Tam multimodal koşul, en güçlü ve tutarlı geri alım kazanımlarını sağladı ve heterojen dijital arşivler için denetlenebilir, arama odaklı bir iş akışını test etme çalışma hedefini destekledi.

Bu bulgular, çoklu modal yapay zekanın arşiv aramasını artırırken depo yönetimi, veri kaynağı ve uzman doğrulama ihtiyacını koruyarak bir protokol modelini desteklemektedir.

VERİ ERIŞILEBILIRLIĞI:

Ana analizler için kullanılan kimliği silinmiş 1.600 kayıtlık veri seti Zenodo'da data.xlsx (https://doi.org/10.5281/zenodo.20774456) olarak mevcuttur.

figure-results-1
Şekil 1: Multimodal arşiv keşifleri için tekrarlanabilir iş akışı. (A) Depo düzeyindeki arşiv kayıtlarından dahil etme/hariç tarama ile korpus oluşturma. (B) Referans etiketleme ve kalite kontrolü, belge türü, OCR referans bölgeleri, dil bağlamı, tarihsel dönem ve meta veri tamlığı. (C) Görüntü ön işleme, OCR üretimi ve düzeltme sonrası işlemler, görsel belge sınıflandırması ve muhafazakar meta veri zenginleştirmesi. (D) Indeks yapısı, beş kollu geri alım değerlendirmesi, istatistiksel analiz ve kaynak paketleme. Kısaltmalar: OCR, optik karakter tanıma; CER, karakter hata oranı; WER, kelime hata oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-2
Şekil 2: Düzeltme sonrası kayıt düzeyinde optik karakter tanıma hata yapısı ve bulunabilirlik. (A) 1.600 arşiv kaydında temel CER ile temel WER karşılaştırması, temsilci sınıflar için belge türüne göre renklendirilmiş. (B) Ölçekli el yazısı yoğunluğu ile düzeltme sonrası WER'deki değişim arasındaki ilişki; negatif değerler düzeltmeden sonra daha düşük WR'yi gösterir. Uyumlu çizgi ve gri bant, doğrusal eğilimi ve %95 güven aralığını gösterir. (C) Düzeltme öncesi ve sonrası belge türüne göre kayıt düzeyinde bulunabilirlik puanı, düzeltme sonrası aranabilir kanıttaki değişimleri gösterir. Kısaltmalar: CER, karakter hata oranı; WER, kelime hata oranı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-3
Şekil 3: Arşiv-özel ince ayar öncesi ve sonrası görsel belge sınıflandırması. (A) Temel ve ince ayar sonrası belge türüne göre en üst 1 doğruluğu. (B) Temel ve ayar sonrası koşullarda doğru ve yanlış tahminler için güven dağılımları. (C) Akort öncesi ve sonrası en üst 1 doğruluğunu ve ortalama arka güveni özetleyen sınıf düzeyinde performans matrisi. Model tanı verileri 20 epoch kayıp/doğruluk eğrisi, makro-F1, ağırlıklı-F1, ROC-AUC ve PR-AUC içerir. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-4
Şekil 4: Muhafazakar zenginleştirme sonrası metaveri tamlığı ve konu-başlık eşleşmesi. (A) Zenginleştirme öncesi ve sonrası kayıt düzeyinde meta veri tamlığı. (B) Belge türüne göre yeni oluşturulan meta veri alanları. (C) Tarihsel dönemler arasında konu-başlık eşleşmesinde kazanç. Tamlık, doldurulmuş uygulanabilir çekirdek alanların sayısının toplam geçerli çekirdek alanların toplam sayısına bölünmesiyle hesaplandı. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-5
Şekil 5: Beş deneysel sistem kolu boyunca geri alma performansı. (A) Genel P@10, R@10, nDCG@10, ilk ilgili sonuca kadar zaman ve başlangıç, optik karakter tanıma düzeltmesi, görsel sınıflandırma, meta veri zenginleştirmesi ve tam multimodal entegrasyon için başarılı arama oranı. (B) Sorgu konusu ve sistem kolu ile başarılı arama oranının baloncuk grafiki; Renk sistem kolunu gösterir, balon boyutu ise başarı yüzdesini gösterir. (C) P@10, R@10 ve nDCG@10 kolay, orta ve zor sorgu zorluklu katmanlarda bulunur. (D) Başarılı aramaların sorgu konuları ve sistem kolları arasında dağılımını gösteren alternatif konu düzeyinde başarı oranı görünümü. Kısaltmalar: P@10, hassasiyet 10; R@10, saat 10'da geri çağırma; nDCG@10, normalleştirilmiş diskont kümülatif kazanç 10'da. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

figure-results-6
Şekil 6: Arşiv alt grupları arasında çoklu modlu alım kazanımlarının heterojenliği. (A) Hedef belge tipi ve geri alma koşullarına göre nDCG@10. (B) Tarihsel dönem ve geri alma koşullarına göre R@10. (C) Hedef dil bağlamı ve geri alma koşullarına göre P@10. Koşullar şunlardır: Temel, OCR düzeltme, görsel sınıflandırma, meta veri zenginleştirme, Tam çok modlu entegrasyon, OCR+Metin, Metin+Görsel+Metaveri ve Görsel+Metadata. Bu şekil, çoklu modal kazanımların yaygın olduğunu ancak belgeler, dönem ve dil katmanları arasında eşit olmadığını vurguluyor. Bu figürün daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Belge türün RecordsMedya sayfalarEl yazısı kayıtlarOrtalama taban
BAKIR
Ortalama taban
Meta veri
Tamlık
Ortalama taban
Keşfedilebilirlik
(%)
El yazısıyla yazılmış mektup2622950.7290.64868.2
Defter263763.50.6790.67472.2
Harita10212.90.4570.55274.1
Gazete26180.80.4950.6675.5
Fotoğraf ve başlık17911.10.3740.60173.6
Poster87100.4130.57174.8
Kayıt defteri19410180.6160.70371.3
Yazılı yazışmalar252340.3150.68976.4

Tablo 1: Arşiv koleksiyonunun belge türüne göre özellikleri. Tablo, sekiz belge sınıfının her biri için kayıt sayısını, medyan sayfa sayısını, el yazısı içeren kayıtların yüzdesini, ortalama temel WER'yi, ortalama temel meta veri dolayını ve ortalama temel bulabilirlik puanını bildirir.

Belge TipiÖrneklem BüyüklüğüCERCERBAKIRBAKIRAdlandırılmış varlık
Geri Çağırma
Adlandırılmış varlık
Geri Çağırma
ΔWER
(n)(Başlangıç)(Yazı)(Başlangıç)(Yazı)(Başlangıç)(Yazı)
El yazısıyla yazılmış mektup2620.5310.3630.7290.5310.3020.44−0.198
Defter2630.490.3260.6790.4850.3360.471−0.194
Harita1020.3220.2280.4570.3470.380.503−0.11
Gazete2610.3540.2560.4950.3810.4360.558−0.114
Fotoğraf ve başlık1790.2570.1810.3740.2860.4940.616−0.088
Poster870.2870.1990.4130.3160.4480.57−0.097
Kayıt defteri1940.4420.2930.6160.4390.3690.504−0.177
Yazılı yazışmalar2520.2190.1550.3150.2320.5240.646−.083

Tablo 2: Belge türüne göre düzeltme öncesi ve sonrası OCR performansı. CER ve WER referans transkripsiyonlara göre hesaplandı; Adı verilen varlık geri çağırılması, manuel olarak etiketlenmiş kişi, yer, kurum ve tarih varlıklarına karşı hesaplandı. Delta WER, düzeltme sonrası WER çıkarılmış temel WER'dir.

Belge türünDoğruluk,
Temel çizgi
Doğruluk,
Post
Güven,
Temel çizgi
Güven,
Post
ΔAccuracy
El yazısıyla yazılmış mektup2620.6150.6450.6160.6550.03
Defter2630.7070.7490.7250.7670.042
Harita1020.7650.9020.8010.8990.137
Gazete2610.7160.8430.7280.830.127
Fotoğraf ve başlık1790.8150.8690.8240.890.054
Poster870.7710.9030.7920.8890.132
Kayıt defteri1940.6870.7930.7010.7870.106
Yazılı yazışmalar2520.7960.7910.8040.82-0.005

Tablo 3: Arşivlere özgü ince ayar öncesi ve sonrası görsel belge sınıflandırma performansı. Tablo, örneklem büyüklüğünü, ilk 1 doğruluğunu, ortalama arka güveni ve belge türüne göre doğruluk değişimini bildirir. Tanı verileri, makro-F1, ağırlıklı F1, ROC-AUC, PR-AUC, eğitim kaybı, doğrulama kaybı, eğitim doğruluğu ve doğrulama doğruluğu içeren 20 epoch seviyesinde satırı içerir.

TamlıkTamlıkNüfuslu TarlalarNüfuslu TarlalarKonu başlığı
Maç
Konu başlığı
Maç
Δ TamlıkΔ Konu-başlığı
Maç
(Başlangıç)(Yazı)(Başlangıç)(Yazı)(Başlangıç)(Yazı)
0.5340.8684.2748.5840.6430.8210.3340.178
0.6070.8984.8388.7090.6720.8410.2910.169
0.680.9275.4269.0950.6860.8490.2470.163
0.6860.9225.488.9530.6940.8540.2360.16

Tablo 4: Tarihsel döneme göre meta veri zenginleşmesi. Tamlık, bir kayıt için doldurulmuş geçerli çekirdek tanımlayıcı alanların oranıdır; Nüfuslu alanlar ortalama sayım olarak bildirilir; Konu başlığı eşleşmesi, kayıt düzeyindeki kanıtların en az bir kontrollü kelime etiketini destekleyip desteklemediğini gösterir.

Sistem kolun sorguP@10R@10nDCG@10İlk olarak önemli olma zamanı
Sonuç(lar)
Başarılı arama oranı
(%)
Temel Durum4200.3940.2380.392156.0795
OCR düzeltmesi4200.4840.3460.475124.26130.2
Görsel sınıflandırma4200.490.3020.478131.98522.9
Meta veri zenginleştirme4200.5070.3470.513117.47438.3
Tam multimodal4200.6240.4920.63458.48595.5

Tablo 5: Beş deneysel sistem kolu için geri alma performansı. P@10, R@10, nDCG@10, ilk ilgili sonuca kadar zaman ve başarılı arama oranı 420 sorgulu kıyaslama ölçütünde eşleştirilmiş sorgu koşullarında hesaplandı.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokol, tarihsel dijital arşivlerdeki keşifin en çok OCR düzeltmesi, görsel belge anlayışı ve muhafazakar meta veri zenginleştirmesi, izole teknik yükseltmeler olarak değil, bağlantılı erişim bileşenleri olarak değerlendirildiğinde geliştiğini göstermektedir. En büyük OCR kazanımları el yazısı, tablo ve kayıt materyallerinde gerçekleşti ve temel tanımanın en zayıf olduğu belge sınıfları için düzeltme sonrası değeri destekledi. Aynı zamanda, düzeltme sonrası kalan hata OCR temizliğinin kesin transkripsiyon olarak değerlendirilemez ve denetlenebilir kalması gerektiğini gösterir.

Görsel sınıflandırma sonuçları da dikkatli yorumlama gerektirir. İnce ayar, haritalar, posterler, gazeteler ve kayıt defterleri gibi görsel olarak ayırt edici sınıfları geliştirdi, ancak el yazısı mektuplar ve defterlerde daha küçük kazançlar oldu; çünkü düzenler örtüşüyor ve sınıf sınırları görsel olarak daha az ayrılıyor. Görece küçük korpus boyutu, sınıflandırma performansının, üretim çoklu modal modelinin sadece 1.600 kayıttan eğitilebileceğinin kanıtı yerine protokol kanıtı olarak yorumlanması gerektiği anlamına gelir. Gelecekteki doğrulama için EfficientNet-B3 belge transformatörleri, Vision Transformers, Swin Transformers, ConvNeXt ve multimodal document-foundationmodelleri 8,11,12,13,14,15,16,17,18 ile karşılaştırılmalıdır.

Meta veri zenginliği, kaynak ve güven bilgilerini korurken seyrek tanımlayıcı kayıtları aranabilir alanlara genişleterek elde etmeye önemli katkı sağladı. Bu bulgu, arşivde daha zengin erişim noktalarına olan ihtiyacla tutarlıdır, ancak aynı zamanda yönetişim risklerini de artırır. Otomatik zenginleştirme, OCR hatalarını artırabilir, tarihsel olarak belirsiz isimleri çok agresif normalleştirebilir veya kontrol edilen kelime dağarcığı eksikse önyargı oluşturabilir. Bu nedenle, iş akışı katalog kayıtlarının tam otomatik olarak değiştirilmesi yerine güven eşikleri, kaynak kaydı ve inceleme bayrakları kullanır.

Geri dönüş değerlendirmesi, tamamlayıcı modül etkilerine dair kanıtlar sunar, ancak sınırlamaları vardır. Mevcut karşılaştırma, temel ve dahili modül ablasyon koşullarını kullandı; yoğun geri dönüş, ColBERT gibi geç etkileşimli sıralamacılar, hibrit seyrek-yoğun geri dönüş, sinirsel yeniden sıralama veya geri getirme artırılmış üretim sistemleri 22,23,24 ile karşılaştırma yapmadı. Bu yaklaşımlar, gözlemlenen çok modlu kazanımların mevcut arama mimarileriyle rekabetçi olup olmadığını belirlemek için gelecekteki çalışmalarda eklenmelidir.

Uygulama ayrıca veri sızıntısı, hesaplama kısıtlamaları ve ölçeklenebilirlik konularına da dikkat gerektirir. Zenginleştirme, optik karakter tanıma çıktıları, görsel tahminler ve mevcut meta verileri kullandığından, tren/doğrulama/test bölmesi ve sorgu değerlendirmesi zenginleştirme kararlarından ayrı tutulmalıdır. Gelecekteki dağıtımlar donanım, çalışma zamanı, bellek kullanımı, endeks boyutu ve 1.000 kayıt başına maliyeti raporlamalıdır. Yan bilgisayar görme çalışmalarından alınan görüntüleme-restorasyon yaklaşımları, çok ölçekli ve dikkat odaklı tıkanma-kaldırma modelleri dahil, gelecekteki ön işleme deneylerine ilham verebilir, ancak arşiv iş akışları kanıt içeriğini halüsinasyon veya değiştirmemelidir26,27.

Genel olarak, iş akışı en iyi şekilde tekrarlanabilir bir erişim protokolü olarak anlaşılır, arşiv açıklamasının yerine değil. Çok modlu yapay zeka, çıktıları kısıtlandığında, kaydedildiğinde ve incelendiğinde keşfi artırabilir, ancak arşivciler kaynak değerlendirmesi, erişim-yönetim kararları ve tarihsel olarak karmaşık kayıtların yorumlanması için hayati önemesahiptir 21,25.

SONUÇLAR:
Bu çalışma, optik karakter tanıma düzeltmesi, görsel belge sınıflandırması ve muhafazakar meta veri zenginleştirmesinin tarihsel dijital arşivlerde tamamlayıcı erişim bileşenleri olarak hizmet edip edemeyeceğini test etti. Protokol, transkripsiyon, sınıflandırma, meta veri tamlığını ve toplam erişim performansını iyileştirirken, açık eşikleri, kaynak kaydını ve insan incelemesi önlemlerini korudu. Bu nedenle iş akışı, arşivci yargısı veya depo yönetiminin yerine değil, denetlenebilir bir erişim-destek protokolü olarak kullanılmalıdır.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların açıklayacak hiçbir şeyi yok.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarlar, metin notasyonu ve kalite kontrolü konusundaki değerli yardımları için iki deneyimli arşiv personeline ve profesyonel dijital beşeri bilimler araştırmacısına içtenlikle teşekkür etmektedir. Bu araştırma, Jiangsu Eyalet Arşivleri Bilim ve Teknoloji Projesi Planı (Hibe No. 2024-9) tarafından finansal olarak desteklendi; bu plan akıllı konuşma tabanlı sözlü arşiv sisteminin inşası için ve Jiangsu Eyaleti Geleneksel Çin Tıbbı için Bilim ve Teknoloji Geliştirme Planı (Hibe No. MS2025025) TCM okullarının miras ve gelişimini arşiv açısından incelediği için.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow komut dosyası, veri işleme, optik karakter tanıma son düzeltme ve istatistiksel destek
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/İstatistiksel analiz ve son şekil oluşturma
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractTemel optik karakter tanıma oluşturma
Tesseract dil paketleriTesseract OCR ProjectÇalışmaya özgü dil paketleri; https://github.com/tesseract-ocr/tessdataBirincil ve karışık dil optik karakter tanıma çözme
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Düzeltme, gürültü tahmini ve görüntü ön işleme
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Görüntü giriş/çıkış ve biçim normalleştirme
NumPyNumPy developersv1.26.4; https://numpy.org/Görüntü ve metrik işleme için dizi hesaplama
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Tablo veri işleme ve özet dışa aktarma
SciPySciPy developersv1.13.1; https://scipy.org/İstatistiksel testler ve sayısal yardımcı programlar
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/İstatistiksel modelleme ve eşleştirilmiş-karşılaştırma desteği
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Sınıflandırma metrikleri, ROC/PR teşhisleri ve doğrulama yardımcı programları
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzOptik karakter tanıma düzeltme için düzenleme-mesafesi aday sıralaması
spaCyExplosion AIv3.7.4; https://spacy.io/Özel sözlük tabloları ile adlandırılmış varlık işleme
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Görsel belge sınıflandırıcı eğitimi
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3 uygulaması ve görüntü dönüşümleri
EfficientNet-B3 omurgatorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlGörsel belge sınıflandırma omurgası
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Kontrollü sözlük adayları için anlamsal genişleme
Arama motoru yazılımıElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25 indeksleme, geri alma ve sıralama
Kapsayıcı motorDocker Inc.Docker v26.1.1; https://www.docker.com/Kapsayıcılı geri alma ortamı
Linux işletim sistemiCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Geri alma çalışmaları için sabit işletim ortamı
Sürüm kontrol sistemiGit projectGit v2.44.0; https://git-scm.com/Yapılandırma, sözlükler, komut dosyaları ve şekil kodu için sürüm kontrolü
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/R tabanlı şekil oluşturma
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Tamlayıcı görselleştirme ve kalite güvence çizimleri
Etiketleme yönergesiYazarlar5 açıklama bölümü; 8 belge sınıfı etiketi; OCR bölgeleri; varlık etiketleri; alaka ölçütleri; karar kurallarıBelge sınıfları, OCR bölgeleri, varlıklar, alaka ölçütleri ve karar tanımları için tanımlar
Arşiv özgü optik karakter tanıma sözlüğüYazarlar6 sözlük kategorisi: kişi varyantları, yer isimleri, kurum isimleri, tarih desenleri, idari terimler, kısaltmalarİsimler, yerler, kurumlar, idari terimler ve yazım varyantları
Kontrollü sözlük eşlemesiYazarlar / arşiv depolarıOCR varlıklarını, görsel sınıfı, başlık anahtar kelimeleri, tarih kapsamı ve sorgu konusunu meta veri alanlarına bağlayan 5 eşleme kuralıKonu başlığı eşleştirme ve anlamsal genişleme
Kıyaslama sorgu setiYazarlar420 kıyaslama sorgusu; 6 sorgu konusu; 3 zorluk seviyesi; 8 hedef belge sınıfı; 4 tarihsel dönem; 6 dil bağlamıBeş sistem kolu boyunca eşleşen geri alma kıyaslaması
Alaka ölçütleriYazarlar / açıklayıcılar2.100 sorgu-sistem satırı; 420 sorgu x 5 sistem kolu; ilgili toplamlar, en üstteki 10'da ilgili sayımlar, derecelendirilmiş alaka ve başarı bayraklarıP@10, R@10, nDCG@10 ve başarılı-arama oranı için gerçek-temelli vekil
Eğitim teşhisleriYazarlar20 dönem; eğitim kaybı; doğrulama kaybı; eğitim doğruluğu; doğrulama doğruluğu; makro-F1; ağırlıklı-F1; ROC-AUC; PR-AUCDönem düzeyinde model teşhis özetleri
Bilgisayar donanımıYazarlar8 CPU çekirdeği; 32 GB RAM; NVIDIA GPU sınıfı eğitim ortamıJoVE sunumu için tekrarlanabilirlik kaynağı ayrıntısı
Veri seti dosyasıYazarlardata.xlsx; 1.600 kayı

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

M hendislikSay 234Say 234Bo De erSayDijital Ar ivlerok Modlu Yapay ZekaOCR d zeltmeMetaveri Zenginle tirmeG rsel S n fland rma ve tarihsel kay t sorgulama

İlgili makaleler