Bu içeriği görüntülemek için JoVE aboneliğiniz gereklidir. Giriş yapın veya ücretsiz denemenizi bugün başlatın.

Araştırma makalesi

Tarihsel Dijital Arşiv Keşfi için Tekrarlanabilir Çok Modlu Yapay Zeka İş Akışı

71 görüntülenme

DOI:

10.3791/71698

7 Ağustos 2026

Bu makalede

Özet

Burada, düzeltme sonrası optik karakter tanıma, görsel belge sınıflandırma, meta veri zenginleştirme ve geri alma değerlendirmesini denetlenebilir bir iş akışına entegre ederek tarihsel dijital arşivlerde keşfi geliştirmek için bir protokol sunuyoruz.

Özet

Tarihsel dijital arşivler giderek daha fazla aranabilir hale gelir, ancak optik karakter tanıma hataları, görsel olarak heterojen belge türleri ve az sayıda meta veri ayrı ele alındığında keşif sınırlı kalır. Bu çalışma, muhafazakar çok modlu yapay zeka iş akışının, arşivci incelemesini değiştirmeden arşiv bulgularını iyileştirip iyileştiremeyeceğini değerlendirmek için tekrarlanabilir bir protokol geliştirmeyi amaçladı. Sekiz belge sınıfından 1.600 dijitalleştirilmiş arşiv kaydı bir korpus oluşturuldu ve 420 sorgulu bir kıyaslama kullanılarak beş başvuru koşulları karşılaştırıldı: temel indeksleme, yalnızca optik karakter tanıma düzeltmesi, yalnızca görsel sınıflandırma, yalnızca meta veri zenginleştirmesi ve tam çok modlu entegrasyon. Kayıt düzeyindeki sonuçlar arasında karakter hata oranı (CER), kelime hata oranı (WER), isimli varlık hatırlaması, belge türü sınıflandırma doğruluğu, tahmin güvenilirliği, meta veri tamlığı ve konu-başlık eşleşmesi yer aldı. Sorgu düzeyindeki sonuçlar arasında P@10, R@10, nDCG@10, ilk ilgili sonuca ulaşma süresi ve başarılı arama oranı yer alıyordu. Optik karakter tanıma düzeltmesi, el yazısı mektuplar, defterler ve kayıt defterleri için GER'yi en çok azalttı; görsel ince ayar, özellikle haritalar, posterler, gazeteler ve kayıt defterleri için sınıflandırma doğruluğunu artırdı; ve meta veri zenginleştirmesi, tüm tarihsel dönemlerde tamlığı artırdı. Tam multimodal koşul, en yüksek geri alma performansını elde etti (P@10 = 0.624, R@10 = 0.492, nDCG@10 = 0.634) ve ilk ilgili sonucun ortalama süresini 156.079 saniyeden 58.485 saniyeye indirdi. Bu sonuçlar, metin, görüntü ve tanımlayıcı sinyallerin açık eşikler ve insan incelemesi altında birleştirildiği modüler, denetlenebilir bir iş akışını destekler.

Giriş

Dijital arşivler hızla genişledi ve artık tarih, kültürel miras, kamu yönetimi ve dijital beşeri bilimler alanlarındaki araştırmaları desteklemektedir. Ancak, arşiv kayıtları genellikle bozulmuş optik karakter tanıma çıktısını, görsel olarak çeşitli sayfa düzenlerini, tutarsız kataloglama uygulamalarını ve tarihsel olarak değişken isimler, yerler ve kurumları birleştirdiği için erişim eşit olmaya devam eder. Bu sınırlamalar sadece transkripsiyon kalitesini değil, aynı zamanda dijitalleştirilmişkoleksiyonlar 1,2,3,4,5,6,7'nin geri dönüş yeniden kullanımını da etkiler.

Mevcut belge yapay zekası ve arşiv-arama çalışmaları, düzeltme sonrası optik karakter tanıma, belge-görüntü sınıflandırması, meta veri normalizasyonu, konu modelleme, kelime gömmeleri, sinirsel arama ve veri yönetişimi uygulamaları gibi bireysel bileşenlerigeliştirmiştir 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. Ancak birçok arşiv sistemi bu bileşenleri ayrı ayrı değerlendiriyor ve bu da birleşik iş akışının gerçekçi arama koşullarında keşfi iyileştirip iyileştirmediğini belirlemeyi zorlaştırıyor. Burada ele alınan metodolojik eksiklik, metin, görüntü ve meta veri modüllerini tek bir arşiv iş akışında arama sonuçlarına bağlayan tekrarlanabilir, denetlenebilir bir protokolün eksikliğidir.

Temel amaç, optik karakter tanıma düzeltmesi, görsel belge sınıflandırması ve kurallarla sınırlı meta veri zenginleştirmesinin aynı arama kıyaslamasına göre değerlendirildiğinde tamamlayıcı iyileştirmeler sağlayıp sağlamadığını test etmekti.

Arşiv keşfi, okunabilir metin, görsel olarak yorumlanabilir belge yapısı ve aranabilir betimleyici meta verilerin etkileşimine bağlı olduğu için, tam multimodal koşulun her tek bileşenli koşulu daha iyi performans göstereceğini varsaydık. İş akışı muhafazakar şekilde tasarlandı: otomatik çıktılar geri alım indekslerini zenginleştirebilirken, düşük güvenli tahminler yetkili arşiv açıklaması olarak kullanılmak yerine inceleme için işaretlendi.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Bu çalışma, analiz birimleri olarak dijitalleştirilmiş arşiv kayıtları ve simüle edilmiş geri alma sorgularını kullandı. Arşiv depoları, hassas veya kültürel olarak kısıtlanmış kayıtlara erişimi kısıtlayabilir. Herhangi bir kayıt işlemeden veya paylaşmadan önce depo erişim kurallarına, kurumsal veri güvenliği prosedürlerine ve kimlik kaldırma gereksinimlerine uyun. Bu dijital iş akışı nedeniyle tehlikeli kimyasal, biyolojik, keskin madde, radyoaktif veya diğer düzenlenmiş laboratuvar atıkları oluşmadı.

Çalışma tasarımı ve korpus yapısı

Şekil 1, korpus oluşturma, referans etiketleme, görüntü ön işleme, OCR üretimi ve düzeltme sonrası işlemler, görsel sınıflandırma, meta veri zenginleştirme, indeks oluşturma, geri alma değerlendirmesi, istatistiksel analiz ve tekrarlanabilirlik paketleme dahil olmak üzere tüm çalışma iş akışını sunmaktadır.

Korpus inşaatı 15 Ocak-30 Nisan 2025 tarihleri arasında gerçekleştirildi, ardından 1 Mayıs - 31 Ekim 2025 tarihleri arasında sistem tasarımı ve hata ayıklama yapıldı. Korpus, eyalet, şehir, dini, müze, üniversite ve kütüphane sistemlerini temsil eden sekiz depodan seçilmiş 1.600 dijitalleştirilmiş arşiv kaydını içeriyordu. Örnekleme çerçevesi, el yazısı mektuplar, defterler, haritalar, gazeteler, başlıklı fotoğraflar, posterler, kayıt defterleri ve yazılı yazışmalar arasında arşiv heterojenliğini korumak için depo ve belge sınıfına göre katmanlandırılmıştır.

Her aday kayıt için, seçim günlüğü depo veya koleksiyon tanımlayıcısı, katalog tanımlayıcısı, belge sınıfı, yaklaşık tarihsel dönem, baskın dil bağlamı, mevcut görüntü formatı, görüntü çözünürlüğü, sayfa sayısı ve temel tanımlayıcı alanları kaydetmiştir. Dahil etmek için aşağıdakilerin hepsi gerekti: kararlı bir katalog tanımlayıcısı; en az bir TIFF, JPEG veya PNG sayfa görseli; en az 150 dpi kaynak görüntü çözünürlüğü; okunabilir metin, tablo veya belge-yapısal içerik; ve sekiz önceden tanımlanmış belge sınıfından birine atanma. Dışlama kriterleri ise tam kopyalar, boş ters sayfalar, metin içeren alanın %30'undan fazlasının eksik olacak şekilde kırpılmış görüntüler ve manuel incelemeden sonra okunamaz sayılanan kayıtlardı.

Geri alma kıyaslası, 5 Ağustos ile 20 Ağustos 2025 arasında oluşturulan 420 kısa doğal dil sorgusunu içeriyordu. Sorgu oluşturma tekrarlanabilir bir şablon izledi: aday bilgi ihtiyaçları insanlardan, kurumlardan, yerlerden, tarih aralıklarından, mesleklerden, etkinliklerden ve güncel temalardan örneklendi; her sorgu 2–9 kelimeye normalleştirildi; ve hedef ilgili kayıtlar sistem karşılaştırmasından önce belirlendi. Her sorgu, beş toplama koşulunda değerlendirildi ve 2.100 eşleşen sorgu-koşulu gözlemi elde edildi.

Referans etiketleme ve kalite kontrolü

Referans etiketleme, 1 Mayıs - 15 Temmuz 2025 tarihleri arasında üç annotör tarafından gerçekleştirildi: betimleyici kataloglamada deneyimli iki arşiv personeli ve tarihi belge değerlendirmesinde deneyimli bir dijital beşeri bilimler araştırmacısı. Açıklama rehberi, belge sınıflarını, dil bağlamı kategorilerini, tarihsel dönem kutularını, metaveri tamlık alanlarını, adlandırılmış varlık kategorilerini ve OCR değerlendirme bölgelerini seçme kurallarını tanımladı.

OCR değerlendirmesi için, annotatörler başlıklar, isimler, tarihler, kurumsal terimler, kenar notları, tablo girişleri ve varsa gürültülü düzen alanlarını içeren temsil metin içeren bölgeleri seçtiler. Bir sayfa birden fazla metin bölgesi içerdiğinde, seçilen bölge geri alınma için ilgili olmalı ve CER ile WER hesaplaması için yeterli karakter içermeliydi. Anlaşmazlıklar ilk olarak iki ana anlatıcı arasındaki tartışmayla uzlaştırıldı; Çözülmemiş davalar Dijital Beşeri Bilimler Araştırmacısı tarafından değerlendirildi.

Kalite kontrolü, rastgele %12'lik bir kayıt alt kümesi kullandı. Birincil belge tipi için annotatörler arası anlaşma Cohen'in kappa'sı = 0.86 idi ve önemli bir uyumu destekledi. Karar günlüğü, gelecekteki kullanıcıların sınıf tanımlarını ve kenar durumlarını denetleyebilmesi için orijinal ve nihai etiketleri, anlaşmazlık kategorisini ve çözüm sebebini korudu.

Görüntü ön işleme

Tüm görüntüler, Python 3.11.8 ile OpenCV 4.9.0, Pillow 10.3.0 ve NumPy 1.26.4 ile kayıt seviyesinde işlendi. Her giriş sayfası, renkler haritalar, posterler, pullar veya renk kodlu notlar gibi anlamsal bilgiler taşımadıkça 8 bit gri tonlu olarak dönüştürülürdü. Eğiklik, projeksiyon profilleri ve Hough çizgisi tespiti kullanılarak tahmin edildi; Desewing yalnızca mutlak eğik açı 1,5 dereceyi geçtiğinde uygulanır ve bozulmayı önlemek için 8,0 derece ile sınırlandırılmıştır.

Kontrast artırma, clipLimit = 2.0 ve tileGridSize = 8 × 8 ile kontrast sınırlı adaptif histogram eşitleme kullandı. 3 × 10−23 çekirdeğe sahip bir medyan filtre, ancak tahmini arka plan gürültü oranı 0.35'i aştığında uygulandı. 150–299 dpi arasında çekilen görüntüler, optik karakter tanıma için 300 dpi'ye yeniden örneklendi; 300 DPI veya üzerindeki görüntüler yukarı ölçeklendirilmedi. Süper çözünürlük, üretken restorasyon veya içerik halüsinasyonu kullanılmadı.

Sızma izileri, kenar karartması, düzensiz kağıt dokusu, kenar damgaları, el yazısı, çizgili çizgiler ve tablo sınırları, OCR bölge seçimini engellemedikçe korundu. Bu kural, arşiv kanıtlarını koruyarak görüntü girişlerini tekrarlanabilir OCR ve sınıflandırma için yeterince standartlaştırdı.

OCR baz üretimi ve düzeltme sonrası

Temel OCR Tesseract OCR 5.3.0 ile oluşturuldu. Ana dil paketi, katalog dili ve görünür alfabeden seçildi; katalog dili ile sayfa betiği eşleşmediğinde çok dilli çözme etkinleştirildi. OCR çıktıları kayıt seviyesinde gruplandırılır ve sayfa tanımlayıcıları, OCR güveni, mevcut olduğunda sınırlayıcı kutu koordinatları ve düzeltmeden önce ham metinle birlikte saklanırdı.

OCR sonrası düzeltme üç aşamalı konservatif bir prosedür kullandı. İlk olarak, karakter düzeyinde normalizasyon, ligatürler, uzun/kısa-s ikameleri, parçalı noktalama işaretlemeleri ve rakam-harf ikameleri gibi sık karşılaşılan tarihsel tanıma karışıklıklarını düzeltti. İkinci olarak, token düzeyinde düzeltme, arşivlere özgü kişisel isimler, yer adları, kurumlar, idari terimler ve tarihsel yazım varyantlarından oluşan arşiv sözlüğünden düzenleme mesafesi ve sık dereceli adaylar kullandı. Üçüncü olarak, kural tabanlı dizi kontrolleri, isimlendirilmiş varlıkları ve tarihleri bağlam ve meta verilerden elde edilen kanıtlarla doğrular.

Aday değiştirmeler yalnızca arka düzeltme güveni 0,80'i geçtiğinde kabul edildi; Adı geçen varlık değişiklikleri için en az 0,85 güven gerekiyordu. Eşiğin altındaki adaylar OCR metni olarak tutuldu ancak inceleme için işaretlendi. CER, Levenshtein düzenleme mesafesinin referans transkripsiyondaki karakter sayısına bölünmesiyle hesaplandı. WER aynı formülü token seviyesinde kullandı. Adlandırılmış varlık geri çağırma, doğru tanınan referans varlıkların seçilen değerlendirme bölgesindeki tüm referans varlıklara bölünmesi olarak hesaplandı.

Görsel belge sınıflandırması

Görsel sınıflandırma modülü her kaydı sekiz arşiv belge sınıfından birine atayırdı: el yazısı mektup, defter, harita, gazete, başlıklı fotoğraf, poster, kayıt defteri ve daktilo ile yazışma. Tahmin edilen belge türü, arşiv kataloglamasının yetkili bir yerine değil, bir buluşma ve filtreleme sinyali olarak kullanıldı.

Model, PyTorch 2.2.2 ve torchvision 0.17.2 ile ImageNet ön eğitilmiş EfficientNet-B3 omurgası kullanılarak uygulanmıştır. Rekor seviyesinde küçük resimler 384 x 384 piksele boyutlandırıldı. Sızıntıyı azaltmak için, kayıtlar depo ve belge sınıflarına göre eğitim, doğrulama ve test setlerine 70:15:15 oranında bölündü; bu yaklaşık 1.120, 240 ve 240 kayıtlara karşılık gelir.

Eğitimde AdamW kullanıldı; başlangıç öğrenme oranı = 1 × 10-4, ağırlık kaybı = 1 × 10−2, parti büyüklüğü = 16, etiket yumuşatma = 0.05 ve doğrulama kaybı beş üst üste düzelmediğinde erken durma yöntemi kullanıldı. Yatay çevirme durduruldu çünkü aynalı arşiv düzenleri gerçekçi değil. Artırma, -3 dereceden +3 dereceye kadar dönüş ve parlaklık değişimi %±10 ile sınırlıydı.

Dönem düzeyindeki model tanılaması, her biri eğitim kaybı, doğrulama kaybı, eğitim doğruluğu, doğrulama doğruluğu, makro-F1, ağırlıklı-F1, ROC-AUC ve PR-AUC içeren 20 eğitim satırında özetlenmiştir.

Metaveri zenginleştirme iş akışı

Meta veri zenginleştirmesi, arşivsel muhafazakarlığı koruyarak keşfedilebilirliği artırmak için tasarlanmıştır. Mevcut katalog değerleri, imkansız bir tarih veya hem OCR hem de görsel kanıtlarla doğrulanan belge türü çakışması gibi açık bir çelişki içermedikçe korundu. Aday zenginleştirme alanları arasında normalleştirilmiş başlık, belge türü, yaklaşık tarih, kurum anmaları, coğrafi belirtmeler, kişisel isim belirtmeleri, konu başlıkları ve anahtar kelimeler yer alıyordu.

Kanıt önceliği sabit bir sıraya uyuyordu: (1) mevcut katalog meta verileri, (2) düzeltilmiş OCR çıktısı ve (3) görsel belge tipi tahmin. Kontrollü kelime dağarcığı eşleştirmesi konu başlıkları için kullanıldı ve cümle-dönüştürücüler 2.7.0 ile en yakın komşu anlamsal genişletme yalnızca kosinüs benzerliği en az 0.72 olduğunda kullanıldı. Tarih normalizasyonu için en az 0.85 güven veya OCR ile meta veri arasında uyum gerekiyordu. Her otomatik eklenen alan kaynağını, güvenini ve kural tanımlayıcısını korudu.

Metaveri tamlığı, doldurulmuş çekirdek tanımlayıcı alanların sayısının o kayıt için uygulanabilir çekirdek alanların sayısına bölünmesi olarak tanımlanmıştır. Konu-başlık eşleşmesi, kayıt düzeyinde içerik kanıtlarıyla desteklenen ve sorgu kategorisiyle ilgili olarak değerlendirilen en az bir kontrollü kelime etiketinin varlığı olarak tanımlandı.

Geri alma sistemi inşası

Modül katkılarını izole etmek için beş geri dönüş endeksi oluşturuldu: temel indeksleme; sadece optik karakter tanıma düzeltmesi; sadece görsel sınıflandırma; sadece meta veri zenginleştirmesi; ve tam multimodal entegrasyon. Tüm endeksler, kayıt düzeyinde Materyaller Tablosunda (sürüm 8.11.1) listelenen arama motoru yazılımında oluşturulmuştur. BM25 parametreleri değerlendirmeden önce k1 = 1.2 ve b = 0.75 olarak sabitlendi.

Temel indeks, orijinal meta veri ve temel OCR metni kullandı. OCR koşulu, temel OCR'nin yerine düzeltilmiş OCR aldı. Görsel durum, belge tipi öncelikler ve sınıf farkında sıralama artışları ekledi. Meta veri koşulu zenginleştirici betimleyici alanlar ekledi. Tam multimodal koşul, düzeltilmiş OCR, görsel öncelikler ve zenginleştirilmiş meta verileri birleştirdi. Saha ağırlıkları testten önce sabitlendi: normalleştirilmiş başlık = 3.0, konu başlıkları = 2.5, kişi ve kurum referansları = 2.2, yer belirtmeleri = 2.0, belge tipi = 1.8, düzeltilmiş OCR gövde metni = 1.0 ve başlangıç OCR gövde metni = 0.8, uygun olduğunda.

Alıntılanan sorgular için tam ifade eşleştirmesi etkinleştirildi. Sorgu genişletme yalnızca meta veri zenginleştirme ve tam multimodal koşullarda izin verildi ve kabul edilen kontrollü kelime zenginleri ile konu başlığı varyantlarıyla sınırlıydı. Arama günlükleri, 25 Ağustos - 28 Ağustos 2025 tarihleri arasında, Materyaller Tablosu'nda listelenen konteynerize Linux ortamında, sabit tohumlar ve dondurulmuş indeks konfigürasyonlarıyla oluşturuldu.

Sorgu tasarımı ve sonuç ölçütleri

420 sorgu, sadece anahtar kelime ölçüt önerileri yerine yaygın arşiv arama davranışlarını temsil ediyordu. Konular arasında kişisel isimler, kurumlar, yerler, tarihler ve tarih aralıkları, meslekler, etkinlikler ve tematik konular yer alıyordu. Her sorgu, normalleştirilmiş ifadeleri, hedef kayıt seti, sorgu-konu kategorisi ve zorluk puanıyla birlikte saklanıyordu.

Zorluk, geri alımdan önce hedef belirsizliği, sözcük özgüllüğü ve beklenen ifade sıklığı kullanılarak puanlandırıldı. 0.40'ın altındaki bileşik puanlar düşük zorluk, 0.40–0.69 arası skorlar orta zorluk ve 0.70 veya üzerindeki puanlar yüksek zorluk olarak sınıflandırıldı. İlgi değerlendirmeleri sistem karşılaştırmasından önce tamamlanmış ve nihai koleksiyonla karşılaştırılmıştır.

Arama sonuçları arasında P@10, R@10, nDCG@10, ilk ilgili sonuca ulaşma süresi ve başarılı arama oranı yer alıyordu. P@10, ilgili olarak değerlendirilen ilk 10 kayıt oranıydı. R@10, ilk 10'da bulunan bilinen tüm ilgili kayıtların oranıydı. nDCG@10 mevcut olduğunda dereceli alaka düzeyini, diğer halde ikili alaka kullandı. İlk ilgili sonuca kadar olan süre, sorgu göndermesinden sıralanmış çıktıda ilk ilgili kayıt ortaya çıkana kadar ölçülüyordu. Başarılı bir arama, en az bir ilgili sonuç olarak tanımlandı, ilk 10 kayıt arasında en az bir ilgili sonuç olarak tanımlandı.

İstatistik toplama

Tüm analizler, Materyaller Tablosu'nda listelenen yazılım sürümleri kullanılarak gerçekleştirildi. Sürekli sonuçlar, yaklaşık simetrik olduğunda ortalama SD ± ve diğer durumlarda orta çeyrek arası aralıkla median olarak özetlendi. Kategorik sonuçlar sayım ve yüzdeler olarak özetlendi.

Çift farkların normalliği Shapiro-Wilk testi ve dağılım grafikleriyle değerlendirildi. OCR ve meta veriler, eşleşmiş farklar yaklaşık normalken eşleştirilmiş t testleriyle karşılaştırıldı ve Wilcoxon işaretli sıralama testleri aksi halde yapıldı. İnce ayar öncesi ve sonrası sınıflandırma performansı, McNemar'ın eşleştirilmiş doğru/yanlış etiketler testi kullanılarak karşılaştırıldı. Eşleşen çoklu kol toplama sonuçları, Friedman testi ile karşılaştırıldı ve ardından Holm ile ayarlanmış çift Wilcoxon imzalı sıralama testleri yapıldı.

Tüm istatistiksel testler iki kuyrukluydu ve P < 0.05 istatistiksel olarak anlamlı kabul edildi. Güven aralıkları, rastgele tohum 2025 olarak sabitlenmiş şekilde 2.000 bootstrap yeniden örnekleme kullanılarak tahmin edildi. Etkiler, ortalama farklar, eşleşen olasılık oranları veya sonuç türüne göre sıralama tabanlı etki boyutları olarak bildirildi.

Tekrarlanabilirlik, kapsam ve kaynak erişilebilirliği

Tüm boru hattı parametreleri geri alma testinden önce sabitlendi. Bekletilmiş geri alma kıyaslamasında hiçbir parametre optimize edilmedi. Yapılandırma dosyaları, kontrol edilen kelime deflerleri, sözlük tabloları, sorgu şablonları, alan eşlemeleri, notasyon kılavuzları, istatistiksel betikler ve şekil oluşturma betikleri, rastgele tohum 2025 ile Materyaller Tablosu'nda listelenen sürüm kontrol sisteminde korundu.

Bağımsız doğrulamayı desteklemek için, kaynak veri çalışma defteri, optik karakter tanıma, meta veri ve görsel sınıflandırma analizleri için kullanılan 17 değişken içeren kimliği silinmiş 1.600 kayıtlık bir tablo içerir. Türedilen Tablo 1, Tablo 2, Tablo 3, Tablo 4 ve Tablo 5, şekil kaynağı özetleri, kıyaslama sorgusu tanımları, alaka değerlendirmesi özetleri, geri alma günlüğü vekili, eğitim tanıları, sözlük kategorileri, kelime eşleme kuralları ve açıklama-kılavuz alanları, uygun olduğunda ayrı yüklenebilir tablolar veya materyal dosyaları olarak sağlanır. Depo kısıtlamaları nedeniyle kamuya açık paylaşılamayan materyaller, kimliği silinmiş meta veri alanları ve tekrarlanabilir örnekleme alanlarıyla temsil edilir.

Bu protokol, tarihsel iddiaların doğruluğundan ziyade geri arama odaklı keşfi değerlendirir. Arşivci değerleme, kaynak değerlendirmesi, gizlilik incelemesi veya depoya özgü erişim kurallarının yerini almaz.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

OCR düzeltmesi, özellikle el yazısı ve tablo şeklinde kayıtlarda transkripsiyonu iyileştirdi

Optik karakter tanıma düzeltmesi, sekiz arşiv belge sınıfının tamamında transkripsiyon kalitesini artırdı (n = 1.600 kayıt). Ortalama WER 0,529 ± 0,172'den 0,384'e ± 0,123'e düştü, ortalama çift değişim ise −0,144 (%95 GÜ, −0,149 ile −0,139; Wilcoxon, P < 0.001 ile imzaladı). Ortalama CER 0,377 ± 0,126'dan 0,258'± 0,086'ya düştü, ortalama çift...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Bu protokol, tarihsel dijital arşivlerdeki keşifin en çok OCR düzeltmesi, görsel belge anlayışı ve muhafazakar meta veri zenginleştirmesi, izole teknik yükseltmeler olarak değil, bağlantılı erişim bileşenleri olarak değerlendirildiğinde geliştiğini göstermektedir. En büyük OCR kazanımları el yazısı, tablo ve kayıt materyallerinde gerçekleşti ve temel tanımanın en zayıf olduğu belge sınıfları için düzeltme sonrası değeri destekledi. Aynı zamanda, düzeltme sonrası kalan hata OCR temizliğin...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Yazarların açıklayacak hiçbir şeyi yok.

Teşekkürler

Yazarlar, metin notasyonu ve kalite kontrolü konusundaki değerli yardımları için iki deneyimli arşiv personeline ve profesyonel dijital beşeri bilimler araştırmacısına içtenlikle teşekkür etmektedir. Bu araştırma, Jiangsu Eyalet Arşivleri Bilim ve Teknoloji Projesi Planı (Hibe No. 2024-9) tarafından finansal olarak desteklendi; bu plan akıllı konuşma tabanlı sözlü arşiv sisteminin inşası için ve Jiangsu Eyaleti Geleneksel Çin Tıbbı için Bilim ve Teknoloji Geliştirme Planı (Hibe No. MS2025025) TCM okullarının miras ve gelişimini arşiv açısından incelediği için.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
PythonPython Software Foundationv3.11.8; https://www.python.org/Workflow komut dosyası, veri işleme, optik karakter tanıma son düzeltme ve istatistiksel destek
RR Foundation for Statistical Computingv4.3.3; https://www.r-project.org/İstatistiksel analiz ve son şekil oluşturma
Tesseract OCRTesseract OCR Projectv5.3.0; https://github.com/tesseract-ocr/tesseractTemel optik karakter tanıma oluşturma
Tesseract dil paketleriTesseract OCR ProjectÇalışmaya özgü dil paketleri; https://github.com/tesseract-ocr/tessdataBirincil ve karışık dil optik karakter tanıma çözme
OpenCVOpenCV Teamv4.9.0; https://opencv.org/Düzeltme, gürültü tahmini ve görüntü ön işleme
PillowPython Imaging Library contributorsv10.3.0; https://python-pillow.org/Görüntü giriş/çıkış ve biçim normalleştirme
NumPyNumPy developersv1.26.4; https://numpy.org/Görüntü ve metrik işleme için dizi hesaplama
pandaspandas development teamv2.2.2; https://pandas.pydata.org/Tablo veri işleme ve özet dışa aktarma
SciPySciPy developersv1.13.1; https://scipy.org/İstatistiksel testler ve sayısal yardımcı programlar
statsmodelsstatsmodels developersv0.14.2; https://www.statsmodels.org/İstatistiksel modelleme ve eşleştirilmiş-karşılaştırma desteği
scikit-learnscikit-learn developersv1.4.2; https://scikit-learn.org/Sınıflandırma metrikleri, ROC/PR teşhisleri ve doğrulama yardımcı programları
rapidfuzzMax Bachmann and contributorsv3.9.0; https://github.com/rapidfuzz/RapidFuzzOptik karakter tanıma düzeltme için düzenleme-mesafesi aday sıralaması
spaCyExplosion AIv3.7.4; https://spacy.io/Özel sözlük tabloları ile adlandırılmış varlık işleme
PyTorchPyTorch Foundationv2.2.2; https://pytorch.org/Görsel belge sınıflandırıcı eğitimi
torchvisionPyTorch Foundationv0.17.2; https://pytorch.org/vision/EfficientNet-B3 uygulaması ve görüntü dönüşümleri
EfficientNet-B3 omurgatorchvision / ImageNet pretrained weightsEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlGörsel belge sınıflandırma omurgası
sentence-transformersUKP Lab / Hugging Face ecosystemv2.7.0; https://www.sbert.net/Kontrollü sözlük adayları için anlamsal genişleme
Arama motoru yazılımıElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchBM25 indeksleme, geri alma ve sıralama
Kapsayıcı motorDocker Inc.Docker v26.1.1; https://www.docker.com/Kapsayıcılı geri alma ortamı
Linux işletim sistemiCanonicalUbuntu 22.04 LTS; https://ubuntu.com/Geri alma çalışmaları için sabit işletim ortamı
Sürüm kontrol sistemiGit projectGit v2.44.0; https://git-scm.com/Yapılandırma, sözlükler, komut dosyaları ve şekil kodu için sürüm kontrolü
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/R tabanlı şekil oluşturma
MatplotlibMatplotlib developersv3.8.4; https://matplotlib.org/Tamlayıcı görselleştirme ve kalite güvence çizimleri
Etiketleme yönergesiYazarlar5 açıklama bölümü; 8 belge sınıfı etiketi; OCR bölgeleri; varlık etiketleri; alaka ölçütleri; karar kurallarıBelge sınıfları, OCR bölgeleri, varlıklar, alaka ölçütleri ve karar tanımları için tanımlar
Arşiv özgü optik karakter tanıma sözlüğüYazarlar6 sözlük kategorisi: kişi varyantları, yer isimleri, kurum isimleri, tarih desenleri, idari terimler, kısaltmalarİsimler, yerler, kurumlar, idari terimler ve yazım varyantları
Kontrollü sözlük eşlemesiYazarlar / arşiv depolarıOCR varlıklarını, görsel sınıfı, başlık anahtar kelimeleri, tarih kapsamı ve sorgu konusunu meta veri alanlarına bağlayan 5 eşleme kuralıKonu başlığı eşleştirme ve anlamsal genişleme
Kıyaslama sorgu setiYazarlar420 kıyaslama sorgusu; 6 sorgu konusu; 3 zorluk seviyesi; 8 hedef belge sınıfı; 4 tarihsel dönem; 6 dil bağlamıBeş sistem kolu boyunca eşleşen geri alma kıyaslaması
Alaka ölçütleriYazarlar / açıklayıcılar2.100 sorgu-sistem satırı; 420 sorgu x 5 sistem kolu; ilgili toplamlar, en üstteki 10'da ilgili sayımlar, derecelendirilmiş alaka ve başarı bayraklarıP@10, R@10, nDCG@10 ve başarılı-arama oranı için gerçek-temelli vekil
Eğitim teşhisleriYazarlar20 dönem; eğitim kaybı; doğrulama kaybı; eğitim doğruluğu; doğrulama doğruluğu; makro-F1; ağırlıklı-F1; ROC-AUC; PR-AUCDönem düzeyinde model teşhis özetleri
Bilgisayar donanımıYazarlar8 CPU çekirdeği; 32 GB RAM; NVIDIA GPU sınıfı eğitim ortamıJoVE sunumu için tekrarlanabilirlik kaynağı ayrıntısı
Veri seti dosyasıYazarlardata.xlsx; 1.600 kayı

Kaynaklar

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Etiketler

M hendislikSay 234Say 234Bo De erSayDijital Ar ivlerok Modlu Yapay ZekaOCR d zeltmeMetaveri Zenginle tirmeG rsel S n fland rma ve tarihsel kay t sorgulama