Bu çalışma, analiz birimleri olarak dijitalleştirilmiş arşiv kayıtları ve simüle edilmiş geri alma sorgularını kullandı. Arşiv depoları, hassas veya kültürel olarak kısıtlanmış kayıtlara erişimi kısıtlayabilir. Herhangi bir kayıt işlemeden veya paylaşmadan önce depo erişim kurallarına, kurumsal veri güvenliği prosedürlerine ve kimlik kaldırma gereksinimlerine uyun. Bu dijital iş akışı nedeniyle tehlikeli kimyasal, biyolojik, keskin madde, radyoaktif veya diğer düzenlenmiş laboratuvar atıkları oluşmadı.
Çalışma tasarımı ve korpus yapısı
Şekil 1, korpus oluşturma, referans etiketleme, görüntü ön işleme, OCR üretimi ve düzeltme sonrası işlemler, görsel sınıflandırma, meta veri zenginleştirme, indeks oluşturma, geri alma değerlendirmesi, istatistiksel analiz ve tekrarlanabilirlik paketleme dahil olmak üzere tüm çalışma iş akışını sunmaktadır.
Korpus inşaatı 15 Ocak-30 Nisan 2025 tarihleri arasında gerçekleştirildi, ardından 1 Mayıs - 31 Ekim 2025 tarihleri arasında sistem tasarımı ve hata ayıklama yapıldı. Korpus, eyalet, şehir, dini, müze, üniversite ve kütüphane sistemlerini temsil eden sekiz depodan seçilmiş 1.600 dijitalleştirilmiş arşiv kaydını içeriyordu. Örnekleme çerçevesi, el yazısı mektuplar, defterler, haritalar, gazeteler, başlıklı fotoğraflar, posterler, kayıt defterleri ve yazılı yazışmalar arasında arşiv heterojenliğini korumak için depo ve belge sınıfına göre katmanlandırılmıştır.
Her aday kayıt için, seçim günlüğü depo veya koleksiyon tanımlayıcısı, katalog tanımlayıcısı, belge sınıfı, yaklaşık tarihsel dönem, baskın dil bağlamı, mevcut görüntü formatı, görüntü çözünürlüğü, sayfa sayısı ve temel tanımlayıcı alanları kaydetmiştir. Dahil etmek için aşağıdakilerin hepsi gerekti: kararlı bir katalog tanımlayıcısı; en az bir TIFF, JPEG veya PNG sayfa görseli; en az 150 dpi kaynak görüntü çözünürlüğü; okunabilir metin, tablo veya belge-yapısal içerik; ve sekiz önceden tanımlanmış belge sınıfından birine atanma. Dışlama kriterleri ise tam kopyalar, boş ters sayfalar, metin içeren alanın %30'undan fazlasının eksik olacak şekilde kırpılmış görüntüler ve manuel incelemeden sonra okunamaz sayılanan kayıtlardı.
Geri alma kıyaslası, 5 Ağustos ile 20 Ağustos 2025 arasında oluşturulan 420 kısa doğal dil sorgusunu içeriyordu. Sorgu oluşturma tekrarlanabilir bir şablon izledi: aday bilgi ihtiyaçları insanlardan, kurumlardan, yerlerden, tarih aralıklarından, mesleklerden, etkinliklerden ve güncel temalardan örneklendi; her sorgu 2–9 kelimeye normalleştirildi; ve hedef ilgili kayıtlar sistem karşılaştırmasından önce belirlendi. Her sorgu, beş toplama koşulunda değerlendirildi ve 2.100 eşleşen sorgu-koşulu gözlemi elde edildi.
Referans etiketleme ve kalite kontrolü
Referans etiketleme, 1 Mayıs - 15 Temmuz 2025 tarihleri arasında üç annotör tarafından gerçekleştirildi: betimleyici kataloglamada deneyimli iki arşiv personeli ve tarihi belge değerlendirmesinde deneyimli bir dijital beşeri bilimler araştırmacısı. Açıklama rehberi, belge sınıflarını, dil bağlamı kategorilerini, tarihsel dönem kutularını, metaveri tamlık alanlarını, adlandırılmış varlık kategorilerini ve OCR değerlendirme bölgelerini seçme kurallarını tanımladı.
OCR değerlendirmesi için, annotatörler başlıklar, isimler, tarihler, kurumsal terimler, kenar notları, tablo girişleri ve varsa gürültülü düzen alanlarını içeren temsil metin içeren bölgeleri seçtiler. Bir sayfa birden fazla metin bölgesi içerdiğinde, seçilen bölge geri alınma için ilgili olmalı ve CER ile WER hesaplaması için yeterli karakter içermeliydi. Anlaşmazlıklar ilk olarak iki ana anlatıcı arasındaki tartışmayla uzlaştırıldı; Çözülmemiş davalar Dijital Beşeri Bilimler Araştırmacısı tarafından değerlendirildi.
Kalite kontrolü, rastgele %12'lik bir kayıt alt kümesi kullandı. Birincil belge tipi için annotatörler arası anlaşma Cohen'in kappa'sı = 0.86 idi ve önemli bir uyumu destekledi. Karar günlüğü, gelecekteki kullanıcıların sınıf tanımlarını ve kenar durumlarını denetleyebilmesi için orijinal ve nihai etiketleri, anlaşmazlık kategorisini ve çözüm sebebini korudu.
Görüntü ön işleme
Tüm görüntüler, Python 3.11.8 ile OpenCV 4.9.0, Pillow 10.3.0 ve NumPy 1.26.4 ile kayıt seviyesinde işlendi. Her giriş sayfası, renkler haritalar, posterler, pullar veya renk kodlu notlar gibi anlamsal bilgiler taşımadıkça 8 bit gri tonlu olarak dönüştürülürdü. Eğiklik, projeksiyon profilleri ve Hough çizgisi tespiti kullanılarak tahmin edildi; Desewing yalnızca mutlak eğik açı 1,5 dereceyi geçtiğinde uygulanır ve bozulmayı önlemek için 8,0 derece ile sınırlandırılmıştır.
Kontrast artırma, clipLimit = 2.0 ve tileGridSize = 8 × 8 ile kontrast sınırlı adaptif histogram eşitleme kullandı. 3 × 10−23 çekirdeğe sahip bir medyan filtre, ancak tahmini arka plan gürültü oranı 0.35'i aştığında uygulandı. 150–299 dpi arasında çekilen görüntüler, optik karakter tanıma için 300 dpi'ye yeniden örneklendi; 300 DPI veya üzerindeki görüntüler yukarı ölçeklendirilmedi. Süper çözünürlük, üretken restorasyon veya içerik halüsinasyonu kullanılmadı.
Sızma izileri, kenar karartması, düzensiz kağıt dokusu, kenar damgaları, el yazısı, çizgili çizgiler ve tablo sınırları, OCR bölge seçimini engellemedikçe korundu. Bu kural, arşiv kanıtlarını koruyarak görüntü girişlerini tekrarlanabilir OCR ve sınıflandırma için yeterince standartlaştırdı.
OCR baz üretimi ve düzeltme sonrası
Temel OCR Tesseract OCR 5.3.0 ile oluşturuldu. Ana dil paketi, katalog dili ve görünür alfabeden seçildi; katalog dili ile sayfa betiği eşleşmediğinde çok dilli çözme etkinleştirildi. OCR çıktıları kayıt seviyesinde gruplandırılır ve sayfa tanımlayıcıları, OCR güveni, mevcut olduğunda sınırlayıcı kutu koordinatları ve düzeltmeden önce ham metinle birlikte saklanırdı.
OCR sonrası düzeltme üç aşamalı konservatif bir prosedür kullandı. İlk olarak, karakter düzeyinde normalizasyon, ligatürler, uzun/kısa-s ikameleri, parçalı noktalama işaretlemeleri ve rakam-harf ikameleri gibi sık karşılaşılan tarihsel tanıma karışıklıklarını düzeltti. İkinci olarak, token düzeyinde düzeltme, arşivlere özgü kişisel isimler, yer adları, kurumlar, idari terimler ve tarihsel yazım varyantlarından oluşan arşiv sözlüğünden düzenleme mesafesi ve sık dereceli adaylar kullandı. Üçüncü olarak, kural tabanlı dizi kontrolleri, isimlendirilmiş varlıkları ve tarihleri bağlam ve meta verilerden elde edilen kanıtlarla doğrular.
Aday değiştirmeler yalnızca arka düzeltme güveni 0,80'i geçtiğinde kabul edildi; Adı geçen varlık değişiklikleri için en az 0,85 güven gerekiyordu. Eşiğin altındaki adaylar OCR metni olarak tutuldu ancak inceleme için işaretlendi. CER, Levenshtein düzenleme mesafesinin referans transkripsiyondaki karakter sayısına bölünmesiyle hesaplandı. WER aynı formülü token seviyesinde kullandı. Adlandırılmış varlık geri çağırma, doğru tanınan referans varlıkların seçilen değerlendirme bölgesindeki tüm referans varlıklara bölünmesi olarak hesaplandı.
Görsel belge sınıflandırması
Görsel sınıflandırma modülü her kaydı sekiz arşiv belge sınıfından birine atayırdı: el yazısı mektup, defter, harita, gazete, başlıklı fotoğraf, poster, kayıt defteri ve daktilo ile yazışma. Tahmin edilen belge türü, arşiv kataloglamasının yetkili bir yerine değil, bir buluşma ve filtreleme sinyali olarak kullanıldı.
Model, PyTorch 2.2.2 ve torchvision 0.17.2 ile ImageNet ön eğitilmiş EfficientNet-B3 omurgası kullanılarak uygulanmıştır. Rekor seviyesinde küçük resimler 384 x 384 piksele boyutlandırıldı. Sızıntıyı azaltmak için, kayıtlar depo ve belge sınıflarına göre eğitim, doğrulama ve test setlerine 70:15:15 oranında bölündü; bu yaklaşık 1.120, 240 ve 240 kayıtlara karşılık gelir.
Eğitimde AdamW kullanıldı; başlangıç öğrenme oranı = 1 × 10-4, ağırlık kaybı = 1 × 10−2, parti büyüklüğü = 16, etiket yumuşatma = 0.05 ve doğrulama kaybı beş üst üste düzelmediğinde erken durma yöntemi kullanıldı. Yatay çevirme durduruldu çünkü aynalı arşiv düzenleri gerçekçi değil. Artırma, -3 dereceden +3 dereceye kadar dönüş ve parlaklık değişimi %±10 ile sınırlıydı.
Dönem düzeyindeki model tanılaması, her biri eğitim kaybı, doğrulama kaybı, eğitim doğruluğu, doğrulama doğruluğu, makro-F1, ağırlıklı-F1, ROC-AUC ve PR-AUC içeren 20 eğitim satırında özetlenmiştir.
Metaveri zenginleştirme iş akışı
Meta veri zenginleştirmesi, arşivsel muhafazakarlığı koruyarak keşfedilebilirliği artırmak için tasarlanmıştır. Mevcut katalog değerleri, imkansız bir tarih veya hem OCR hem de görsel kanıtlarla doğrulanan belge türü çakışması gibi açık bir çelişki içermedikçe korundu. Aday zenginleştirme alanları arasında normalleştirilmiş başlık, belge türü, yaklaşık tarih, kurum anmaları, coğrafi belirtmeler, kişisel isim belirtmeleri, konu başlıkları ve anahtar kelimeler yer alıyordu.
Kanıt önceliği sabit bir sıraya uyuyordu: (1) mevcut katalog meta verileri, (2) düzeltilmiş OCR çıktısı ve (3) görsel belge tipi tahmin. Kontrollü kelime dağarcığı eşleştirmesi konu başlıkları için kullanıldı ve cümle-dönüştürücüler 2.7.0 ile en yakın komşu anlamsal genişletme yalnızca kosinüs benzerliği en az 0.72 olduğunda kullanıldı. Tarih normalizasyonu için en az 0.85 güven veya OCR ile meta veri arasında uyum gerekiyordu. Her otomatik eklenen alan kaynağını, güvenini ve kural tanımlayıcısını korudu.
Metaveri tamlığı, doldurulmuş çekirdek tanımlayıcı alanların sayısının o kayıt için uygulanabilir çekirdek alanların sayısına bölünmesi olarak tanımlanmıştır. Konu-başlık eşleşmesi, kayıt düzeyinde içerik kanıtlarıyla desteklenen ve sorgu kategorisiyle ilgili olarak değerlendirilen en az bir kontrollü kelime etiketinin varlığı olarak tanımlandı.
Geri alma sistemi inşası
Modül katkılarını izole etmek için beş geri dönüş endeksi oluşturuldu: temel indeksleme; sadece optik karakter tanıma düzeltmesi; sadece görsel sınıflandırma; sadece meta veri zenginleştirmesi; ve tam multimodal entegrasyon. Tüm endeksler, kayıt düzeyinde Materyaller Tablosunda (sürüm 8.11.1) listelenen arama motoru yazılımında oluşturulmuştur. BM25 parametreleri değerlendirmeden önce k1 = 1.2 ve b = 0.75 olarak sabitlendi.
Temel indeks, orijinal meta veri ve temel OCR metni kullandı. OCR koşulu, temel OCR'nin yerine düzeltilmiş OCR aldı. Görsel durum, belge tipi öncelikler ve sınıf farkında sıralama artışları ekledi. Meta veri koşulu zenginleştirici betimleyici alanlar ekledi. Tam multimodal koşul, düzeltilmiş OCR, görsel öncelikler ve zenginleştirilmiş meta verileri birleştirdi. Saha ağırlıkları testten önce sabitlendi: normalleştirilmiş başlık = 3.0, konu başlıkları = 2.5, kişi ve kurum referansları = 2.2, yer belirtmeleri = 2.0, belge tipi = 1.8, düzeltilmiş OCR gövde metni = 1.0 ve başlangıç OCR gövde metni = 0.8, uygun olduğunda.
Alıntılanan sorgular için tam ifade eşleştirmesi etkinleştirildi. Sorgu genişletme yalnızca meta veri zenginleştirme ve tam multimodal koşullarda izin verildi ve kabul edilen kontrollü kelime zenginleri ile konu başlığı varyantlarıyla sınırlıydı. Arama günlükleri, 25 Ağustos - 28 Ağustos 2025 tarihleri arasında, Materyaller Tablosu'nda listelenen konteynerize Linux ortamında, sabit tohumlar ve dondurulmuş indeks konfigürasyonlarıyla oluşturuldu.
Sorgu tasarımı ve sonuç ölçütleri
420 sorgu, sadece anahtar kelime ölçüt önerileri yerine yaygın arşiv arama davranışlarını temsil ediyordu. Konular arasında kişisel isimler, kurumlar, yerler, tarihler ve tarih aralıkları, meslekler, etkinlikler ve tematik konular yer alıyordu. Her sorgu, normalleştirilmiş ifadeleri, hedef kayıt seti, sorgu-konu kategorisi ve zorluk puanıyla birlikte saklanıyordu.
Zorluk, geri alımdan önce hedef belirsizliği, sözcük özgüllüğü ve beklenen ifade sıklığı kullanılarak puanlandırıldı. 0.40'ın altındaki bileşik puanlar düşük zorluk, 0.40–0.69 arası skorlar orta zorluk ve 0.70 veya üzerindeki puanlar yüksek zorluk olarak sınıflandırıldı. İlgi değerlendirmeleri sistem karşılaştırmasından önce tamamlanmış ve nihai koleksiyonla karşılaştırılmıştır.
Arama sonuçları arasında P@10, R@10, nDCG@10, ilk ilgili sonuca ulaşma süresi ve başarılı arama oranı yer alıyordu. P@10, ilgili olarak değerlendirilen ilk 10 kayıt oranıydı. R@10, ilk 10'da bulunan bilinen tüm ilgili kayıtların oranıydı. nDCG@10 mevcut olduğunda dereceli alaka düzeyini, diğer halde ikili alaka kullandı. İlk ilgili sonuca kadar olan süre, sorgu göndermesinden sıralanmış çıktıda ilk ilgili kayıt ortaya çıkana kadar ölçülüyordu. Başarılı bir arama, en az bir ilgili sonuç olarak tanımlandı, ilk 10 kayıt arasında en az bir ilgili sonuç olarak tanımlandı.
İstatistik toplama
Tüm analizler, Materyaller Tablosu'nda listelenen yazılım sürümleri kullanılarak gerçekleştirildi. Sürekli sonuçlar, yaklaşık simetrik olduğunda ortalama SD ± ve diğer durumlarda orta çeyrek arası aralıkla median olarak özetlendi. Kategorik sonuçlar sayım ve yüzdeler olarak özetlendi.
Çift farkların normalliği Shapiro-Wilk testi ve dağılım grafikleriyle değerlendirildi. OCR ve meta veriler, eşleşmiş farklar yaklaşık normalken eşleştirilmiş t testleriyle karşılaştırıldı ve Wilcoxon işaretli sıralama testleri aksi halde yapıldı. İnce ayar öncesi ve sonrası sınıflandırma performansı, McNemar'ın eşleştirilmiş doğru/yanlış etiketler testi kullanılarak karşılaştırıldı. Eşleşen çoklu kol toplama sonuçları, Friedman testi ile karşılaştırıldı ve ardından Holm ile ayarlanmış çift Wilcoxon imzalı sıralama testleri yapıldı.
Tüm istatistiksel testler iki kuyrukluydu ve P < 0.05 istatistiksel olarak anlamlı kabul edildi. Güven aralıkları, rastgele tohum 2025 olarak sabitlenmiş şekilde 2.000 bootstrap yeniden örnekleme kullanılarak tahmin edildi. Etkiler, ortalama farklar, eşleşen olasılık oranları veya sonuç türüne göre sıralama tabanlı etki boyutları olarak bildirildi.
Tekrarlanabilirlik, kapsam ve kaynak erişilebilirliği
Tüm boru hattı parametreleri geri alma testinden önce sabitlendi. Bekletilmiş geri alma kıyaslamasında hiçbir parametre optimize edilmedi. Yapılandırma dosyaları, kontrol edilen kelime deflerleri, sözlük tabloları, sorgu şablonları, alan eşlemeleri, notasyon kılavuzları, istatistiksel betikler ve şekil oluşturma betikleri, rastgele tohum 2025 ile Materyaller Tablosu'nda listelenen sürüm kontrol sisteminde korundu.
Bağımsız doğrulamayı desteklemek için, kaynak veri çalışma defteri, optik karakter tanıma, meta veri ve görsel sınıflandırma analizleri için kullanılan 17 değişken içeren kimliği silinmiş 1.600 kayıtlık bir tablo içerir. Türedilen Tablo 1, Tablo 2, Tablo 3, Tablo 4 ve Tablo 5, şekil kaynağı özetleri, kıyaslama sorgusu tanımları, alaka değerlendirmesi özetleri, geri alma günlüğü vekili, eğitim tanıları, sözlük kategorileri, kelime eşleme kuralları ve açıklama-kılavuz alanları, uygun olduğunda ayrı yüklenebilir tablolar veya materyal dosyaları olarak sağlanır. Depo kısıtlamaları nedeniyle kamuya açık paylaşılamayan materyaller, kimliği silinmiş meta veri alanları ve tekrarlanabilir örnekleme alanlarıyla temsil edilir.
Bu protokol, tarihsel iddiaların doğruluğundan ziyade geri arama odaklı keşfi değerlendirir. Arşivci değerleme, kaynak değerlendirmesi, gizlilik incelemesi veya depoya özgü erişim kurallarının yerini almaz.