هنا، نقدم بروتوكولا لتحسين الاكتشاف في الأرشيفات الرقمية التاريخية من خلال دمج التعرف البصري على الحروف بعد التصحيح، وتصنيف المستندات البصرية، وإثراء البيانات الوصفية، وتقييم الاسترجاع في سير عمل قابل للتدقيق.
مقالة بحثية
هنا، نقدم بروتوكولا لتحسين الاكتشاف في الأرشيفات الرقمية التاريخية من خلال دمج التعرف البصري على الحروف بعد التصحيح، وتصنيف المستندات البصرية، وإثراء البيانات الوصفية، وتقييم الاسترجاع في سير عمل قابل للتدقيق.
الأرشيفات الرقمية التاريخية أصبحت أكثر قابلية للبحث، لكن الاكتشاف يظل محدودا عندما يتم التعامل مع أخطاء التعرف البصري على الحروف، وأنواع المستندات البصرية المتجانسة، والبيانات الوصفية المتفرقة بشكل منفصل. هدفت هذه الدراسة إلى تطوير بروتوكول قابل للتكرار لتقييم ما إذا كان سير عمل الذكاء الاصطناعي متعدد الوسائط محافظا يمكن أن يحسن استرجاع الأرشيف دون استبدال مراجعة الأرشيفيين. تم تجميع مجموعة من 1,600 سجل أرشيفي رقمي من ثماني فئات مستندات، واستخدم معيار 420 استعلاما لمقارنة خمسة شروط استرجاع: الفهرسة الأساسية، تصحيح التعرف البصري على الحروف فقط، التصنيف البصري فقط، إثراء البيانات الوصفية وحده، والتكامل متعدد الوسائط الكامل. شملت نتائج السجل معدل خطأ الحروف (CER)، معدل خطأ الكلمة (WER)، استرجاع الكيان المسمى، دقة تصنيف نوع المستند، ثقة التنبؤ، اكتمال البيانات الوصفية، ومطابقة الموضوع والرأس. شملت نتائج مستوى الاستعلام P@10، R@10، nDCG@10، الوقت حتى أول نتيجة ذات صلة، ومعدل نجاح البحث. أدى تصحيح التعرف البصري على الحروف إلى تقليل WER بشكل أكبر في الرسائل المكتوبة يدويا، والدفاتر المكتوبة، ودفاتر السجل؛ حسن الضبط البصري دقة التصنيف بشكل رئيسي للخرائط والملصقات والصحف وكتب السجل؛ وزاد إثراء البيانات الوصفية من اكتمال جميع الفترات التاريخية. حقق الشرط المتعدد الوسائط الكامل أعلى أداء في الاسترجاع (P@10 = 0.624، R@10 = 0.492، nDCG@10 = 0.634) وخفض متوسط الوقت إلى النتيجة الأولى ذات الصلة من 156.079 ثانية إلى 58.485 ثانية. تدعم هذه النتائج سير عمل معياري وقابل للتدقيق حيث يتم دمج الإشارات النصية والصورة والوصفية تحت عتبات صريحة ومراجعة بشرية.
توسعت الأرشيفات الرقمية بسرعة وتدعم الآن البحث في مجالات التاريخ، والتراث الثقافي، والإدارة العامة، والعلوم الإنسانية الرقمية. ومع ذلك، يبقى الوصول غير متساو لأن سجلات الأرشيف غالبا ما تجمع بين تدهور مخرجات التعرف البصري على الحروف، وتنسيقات صفحات متنوعة بصريا، وممارسات فهرسة غير متسقة، وأسماء وأماكن ومؤسسات متغيرة تاريخيا. تؤثر هذه القيود ليس فقط على جودة النسخ بل أيضا على الاسترجاع، والتصفية، وإعادة استخدام المجموعات الرقمية 1,2,3,4,5,6,7.
لقد حسنت الدراسات الحالية للذكاء الاصطناعي للوثائق واسترجاع الأرشيف مكونات فردية مثل التعرف البصري على الحروف بعد التصحيح، وتصنيف صور المستندات، وتطبيع البيانات الوصفية، ونمذجة المواضيع، وتضمينات الكلمات، واسترجاع الأعصاب، وممارسات حوكمة البيانات 8,9,10,11,12,13,14,15,16، 17، 18، 19، 20، 21، 22، 23، 24، 25. ومع ذلك، لا تزال العديد من أنظمة الأرشيف تقيم هذه المكونات بشكل منفصل، مما يصعب تحديد ما إذا كان سير العمل المشترك يحسن الاكتشاف في ظروف بحث واقعية. الفجوة المنهجية التي يتم معالجتها هنا هي غياب بروتوكول قابل للتكرار وقابل للتدقيق يربط وحدات النصوص والصور والبيانات الوصفية بنتائج الاسترجاع في سير عمل أرشيفي واحد.
كان الهدف المركزي هو اختبار ما إذا كانت تصحيح التعرف البصري على الحروف، وتصنيف المستندات البصرية، وإثراء البيانات الوصفية المقيد بالقواعد تحقق تحسينات تكميلية عند تقييمها مقابل نفس معيار الاسترجاع.
افترضنا أن الشرط متعدد الوسائط الكامل سيتفوق على كل حالة مكون واحد لأن الاكتشاف الأرشيفي يعتمد على تفاعل النص المقروء، وبنية المستند القابلة للتفسير بصريا، والبيانات الوصفية القابلة للبحث. تم تصميم سير العمل بشكل محافظ: يمكن للمخرجات الآلية إثراء مؤشرات الاسترجاع، لكن توقعات الثقة المنخفضة تم تمييزها للمراجعة بدلا من استخدامها كوصف أرشيفي موثوق.
استخدمت هذه الدراسة سجلات أرشيفية رقمية واستعلامات استرجاع محاكاة كوحدات تحليل. قد تقيد مستودعات الأرشيفات الوصول إلى السجلات الحساسة أو المقيدة ثقافيا. اتبع قواعد الوصول إلى المستودعات، وإجراءات أمن البيانات المؤسسية، ومتطلبات إزالة الهوية قبل معالجة أو مشاركة أي سجلات. لم تنتج هذا السير الرقمي أي نفايات كيميائية أو بيولوجية أو حادة أو مشعة أو نفايات مختبرية منظمة أخرى.
تصميم الدراسة وبناء المجموعة
يعرض الشكل 1 سير عمل الدراسة الكامل، بما في ذلك بناء المجموعة، وتصنيف المراجع، والمعالجة المسبقة للصور، وتوليد وتصحيح السجلات الضوئية (OCR) وما بعده، والتصنيف البصري، وإثراء البيانات الوصفية، وبناء الفهرس، وتقييم الاسترجاع، والتحليل الإحصائي، وتغليف قابلية التكرار.
تم تنفيذ بناء الكوربوس من 15 يناير إلى 30 أبريل 2025، تلاه تصميم النظام وتصحيح الأخطاء من 1 مايو إلى 31 أكتوبر 2025. احتوى هذا المجموع على 1,600 سجل أرشيفي رقمي تم اختياره من ثمانية مستودعات تمثل أنظمة الولاية والمدن والديانات والمتاحف والجامعة والمكتبات. تم تصنيف إطار العينات حسب فئة المستودع والوثائق للحفاظ على التباين الأرشيفي عبر الرسائل المكتوبة بخط اليد، والدفاتر العلمية، والخرائط، والصحف، والصور مع التعليقات، والملصقات، وكتب السجل، والمراسلات المكتوبة.
لكل سجل مرشح، سجل الاختيار يسجل معرف المستودع أو المجموعة، معرف الفهرس، فئة المستند، الفترة التاريخية التقريبية، السياق اللغوي السائد، تنسيق الصورة المتاح، دقة الصورة، عدد الصفحات، والحقول الوصفية الأساسية. كان الإدراج يتطلب كل ما يلي: معرف فهرس مستقر؛ على الأقل صورة صفحة واحدة من TIFF أو JPEG أو PNG؛ دقة صورة المصدر لا تقل عن 150 نقطة في البوصة الأولى؛ محتوى نصي أو جدولي أو هيكلي للوثائق قابل للقراءة؛ وتعيين أحد فئات المستندات الثمانية المحددة مسبقا. كانت معايير الاستبعاد هي النسخ المكررة تماما، وصفحات عكسية فارغة، وصور مقطوعة إلى درجة أن أكثر من 30٪ من مساحة النص مفقودة، وسجلات تم اعتبارها غير قابلة للقراءة بعد الفحص اليدوي.
احتوى معيار الاسترجاع على 420 استعلاما قصيرا بلغة طبيعية تم إنشاؤها بين 5 أغسطس و20 أغسطس 2025. اتبع توليد الاستعلامات قالبا قابلا للتكرار: تم أخذ عينات من احتياجات معلومات المرشحين من الأشخاص، والمؤسسات، والأماكن، والفترات التاريخية، والمهن، والأحداث، والمواضيع الراهنة؛ تم تطبيع كل استعلام إلى 2–9 كلمات؛ وتم تحديد السجلات ذات الصلة المستهدفة قبل مقارنة النظام. تم تقييم كل استعلام تحت خمسة شروط استرجاع، مما أدى إلى 2,100 ملاحظة مطابقة لشروط الاستعلام.
الموضع المرجعي ومراقبة الجودة
تم إجراء تصنيف المراجع من 1 مايو إلى 15 يوليو 2025 بواسطة ثلاثة معلقين: اثنان من موظفي الأرشيف ذو خبرة في الفهرسة الوصفية وباحث في العلوم الإنسانية الرقمية ذو خبرة في تقييم الوثائق التاريخية. حدد دليل التعليقات فئات المستندات، وفئات اللغة-السياق، وحوامل الفترة التاريخية، وحقول اكتمال البيانات الوصفية، وفئات الكيانات المسماة، وقواعد اختيار مناطق تقييم OCR.
لتقييم OCR، اختار المعلقون مناطق تحمل نصوص تمثيلية تشمل العناوين، الأسماء، التواريخ، المصطلحات المؤسسية، الملاحظات الهامشية، الإدخالات الجدولية، وعند الوجود، مناطق التخطيط المزعجة. عندما تحتوي الصفحة على عدة مناطق نصية، يجب أن تكون المنطقة المختارة ذات صلة بالاسترجاع ويجب أن تتضمن عددا كافيا من الأحرف لحساب CER و WER. تم التوفيق بين الخلافات أولا من خلال النقاش بين المعلقين الرئيسيين؛ تم البت في القضايا غير المحلولة من قبل باحث العلوم الإنسانية الرقمية.
استخدم ضبط الجودة مجموعة عشوائية تبلغ 12٪ من السجلات. كان الاتفاق بين المعلقين لنوع المستند الأساسي هو كابا كوهين = 0.86، مما يدعم الاتفاق الجوهري. احتفظ سجل التحكيم بالتصنيفات الأصلية والنهائية، وفئة الاختلاف، وسبب الحل حتى يتمكن المستخدمون المستقبليون من مراجعة تعريفات الفئات والحالات الطرفية.
معالجة الصور مسبقة
تمت معالجة جميع الصور على مستوى السجلات باستخدام بايثون 3.11.8 مع OpenCV 4.9.0، وبيلو 10.3.0، وNumPy 1.26.4. يتم تحويل كل صفحة إدخال إلى رمادي بحجم 8-بت ما لم يكن اللون يحمل معلومات دلالية، مثل الخرائط أو الملاحظات أو الطوابع أو التعليقات الملونة. تم تقدير الانحراف باستخدام ملفات الإسقاط وكشف خطوط هوف؛ تم تطبيق ديسكوينغ فقط عندما تتجاوز زاوية الانحراف المطلقة 1.5 درجة وتم تقييد 8.0 درجات لتجنب التشوه.
استخدم تعزيز التباين معادلة المدرج التكيفي المحدود للتباين مع clipLimit = 2.0 و tileGridSize = 8 × 8. تم تطبيق مرشح وسيط بنواة 3 × 10−23 فقط عندما تجاوزت نسبة الضوضاء الخلفية المقدرة 0.35. تم إعادة أخذ عينات الصور الملتقطة عند 150–299 DPI إلى 300 dpi للتعرف البصري على الحروف؛ الصور التي كانت بالفعل على 300 dpi أو أعلى لم ترفع حجمها. لم يتم استخدام أي دقة فائقة أو استعادة توليدية أو هلوسة محتوى.
تم الاحتفاظ بالتسريب من الداخل، وسواد الحواف، وعدم استواء نسيج الورق، والأختام الهامشية، والخط اليدوي، والخطوط المسطرة، وحدود الجداول ما لم تمنع اختيار منطقة OCR. حافظت هذه القاعدة على الأدلة الأرشيفية مع توحيد مدخلات الصور بما يكفي لإعادة إنتاج السجلات الضوئية والتصنيف.
توليد قواعد OCR وتصحيحها بعد ذلك
تم توليد السجل الضوئي الواضح الأساسي باستخدام Tesseract OCR 5.3.0. تم اختيار حزمة اللغة الأساسية من لغة الكتالوج والخط المرئي؛ تم تفعيل فك الترميز متعدد اللغات عندما لا تتطابق لغة الكتالوج ونص الصفحة. تم تجميع مخرجات OCR على مستوى السجل وتخزينها مع معرفات الصفحات، وثقة OCR، وإحداثيات صندوق الحدود عند توفرها، والنص الخام قبل التصحيح.
استخدم تصحيح ما بعد السجل الوثائقي إجراء محافظا من ثلاث مراحل. أولا، صحح التطبيع على مستوى الحرف الارتباكات المتكررة في التعرف التاريخي، بما في ذلك الربطات، والاستبدال الطويل ب s/قصير s، وعلامات الترقيم المجزأة، واستبدال الحروف الرقمية. ثانيا، استخدم التصحيح على مستوى الرموز المرشحين المصنفين حسب مسافة التحرير والتكرار من معجم خاص بأرشيف يشمل الأسماء الشخصية، وأسماء الأماكن، والمؤسسات، والمصطلحات الإدارية، والأشكال الإملائية التاريخية. ثالثا، تحقق التسلسل القائم على القواعد الكيانات والتواريخ المسماة مقابل الأدلة من السياق والبيانات الوصفية.
تم قبول البدلاء المرشحين فقط عندما تجاوزت الثقة في التصحيح الخلفي 0.80؛ كانت البدائل المسماة تتطلب ثقة لا تقل عن 0.85. تم الاحتفاظ بالمتقدمين الذين تقل عتبة السجل كنص لمراجعة الحقوق المدنية ولكن تم تصنيفهم للمراجعة. تم حساب CER كمسافة تحرير ليفنشتين مقسومة على عدد الأحرف في النسخ المرجعي. استخدم WER نفس الصيغة على مستوى الرمز. تم حساب استدعاء الكيان المسمى ككيانات مرجعية معترف بها بشكل صحيح مقسومة على جميع الكيانات المرجعية في منطقة التقييم المختارة.
تصنيف المستندات البصرية
كانت وحدة التصنيف البصري تعطي كل سجل لأحد فئات الوثائق الأرشيفية الثمانية: رسالة مكتوبة بخط اليد، دفتر حساب، خريطة، صحيفة، صورة فوتوغرافية مع تعليق، ملصق، دفتر سجل، ومراسلات مكتوبة. تم استخدام نوع المستند المتوقع كإشارة استرجاع وتصفية، وليس كبديل موثوق للفهرسة الأرشيفية.
تم تنفيذ النموذج في PyTorch 2.2.2 وtorchvision 0.17.2 باستخدام عمود فقري EfficientNet-B3 مدرب مسبقا من ImageNet. تم تغيير حجم الصور المصغرة على مستوى السجلات إلى 384 × 384 بكسل. لتقليل التسرب، تم تقسيم السجلات حسب المستودع وفئة المستندات إلى مجموعات تدريب، وتأكيد، واختبار بنسبة 70:15:15، تمثل تقريبا 1,120 و240 و240 سجلة.
استخدم التدريب AdamW مع معدل التعلم الأولي = 1 × 10-4، وتناقص الوزن = 1 × 10−2، وحجم الدفعة = 16، وتنعيم المسموم = 0.05، والتوقف المبكر عندما فشل فقدان التحقق في التحسن لخمس فترات متتالية. تم تعطيل الانقلاب الأفقي لأن تخطيطات الأرشيفات المعكوسة غير واقعية. كان التعزيز محدودا بالدوران من -3 درجات إلى +3 درجات وتغير السطوع ضمن ±10٪.
تلخص تشخيصات النماذج على مستوى العصر في 20 صفا تدريبيا، كل منها يحتوي على فقدان التدريب، فقدان التحقق، دقة التدريب، دقة التحقق، ماكرو-F1، موزون-F1، ROC-AUC، وPR-AUC.
سير عمل إثراء البيانات الوصفية
تم تصميم إثراء البيانات الوصفية لتحسين قابلية الاكتشاف مع الحفاظ على المحافظة الأرشيفية. تم الاحتفاظ بقيم الكتالوج القائمة ما لم تحتوي على تناقض صريح، مثل تاريخ مستحيل أو تعارض من نوع المستند تم تأكيده بواسطة كل من الأدلة الضحية البصرية والمعلومات. شملت حقول إثراء المرشحين العنوان الموحد، نوع المستند، التاريخ التقريبي، ذكر المؤسسات، الإشارات الجغرافية، ذكر الأسماء الشخصية، عناوين الموضوعات، والكلمات المفتاحية.
اتبعت أولوية الأدلة ترتيبا ثابتا: (1) بيانات وصفية الكتالوج الموجودة، (2) مخرجات التعرف الضوئي على الحروف المصححة، و(3) التنبؤ البصري بنوع المستند. تم استخدام مطابقة المفردات المحكمة لعناوين الفاعل، واستخدم التوسع الدلالي الأقرب للجار مع محولات الجمل 2.7.0 فقط عندما يكون التشابه الجيب التمام على الأقل 0.72. كان تطبيع التاريخ يتطلب ثقة لا تقل عن 0.85 أو توافقا بين السجل الضوئي للسجلات الضوئية والبيانات الوصفية. كل حقل يضاف تلقائيا يحتفظ بمصدره وثقته ومعرف القاعدة.
تم تعريف اكتمال البيانات الوصفية بأنه عدد الحقول الوصفية الأساسية المملوءة مقسوما على عدد الحقول الأساسية القابلة للتطبيق لذلك السجل. تم تعريف مطابقة الموضوع مع عنوان بأنها وجود تصنيف موضوع واحد على الأقل موجه محكومة مدعوم بأدلة محتوى على مستوى السجل ويعتبر ذا صلة بفئة الاستعلام.
بناء نظام الاسترجاع
تم إنشاء خمسة مؤشرات استرجاع لعزل مساهمات الوحدات: الفهرسة الأساسية؛ تصحيح التعرف البصري على الحروف فقط؛ التصنيف البصري فقط؛ إثراء البيانات الوصفية فقط؛ والتكامل متعدد الوسائط الكامل. تم بناء جميع المؤشرات باستخدام برنامج محركات البحث المدرج في جدول المواد (الإصدار 8.11.1) على مستوى القياس. تم تثبيت معلمات BM25 عند k1 = 1.2 و b = 0.75 قبل التقييم.
استخدم فهرس الأساس بيانات وصفية أصلية ونص OCR أساسي. استبدلت حالة OCR القاعدة بمعدل تصحيح للسجل الضوئي الضوئي (OCR). أضافت الحالة البصرية سابقات من نوع المستندات وتعزيزات في الترتيب الوعي بالفئة. أضاف شرط البيانات الوصفية حقول وصفية مثرية. يجمع الشرط متعدد الوسائط الكامل بين تصحيح السجلات الضوئية (OCR)، والسوابق البصرية، والبيانات الوصفية المثرية. تم تحديد أوزان الحقول قبل الاختبار: العنوان المصحح = 3.0، عناوين الموضوعات = 2.5، ذكر الأشخاص والمؤسسة = 2.2، ذكر الأماكن = 2.0، نوع المستند = 1.8، نص النص المصحح للسجل الضوئي الواضح = 1.0، ونص الOCR الأساسي = 0.8، حيثما ينطبق.
تم تفعيل مطابقة العبارات الدقيقة للاستفسارات المقتبسة. كان توسيع الاستعلامات مسموحا فقط في شروط إثراء البيانات الوصفية ووضع متعدد الوسائط الكامل، وكان محدودا بمرادفات المفردات المحكومة المقبولة وأشكال عناوين الفاعل. تم إنشاء سجلات البحث من 25 أغسطس إلى 28 أغسطس 2025، في بيئة لينكس المعبأة في الحاويات المدرجة في جدول المواد، مع بذور ثابتة وتكوينات فهرسة مجمدة.
تصميم الاستعلام ومقاييس النتائج
مثلت 420 استعلام سلوكيات بحث أرشيفية شائعة بدلا من توجيهات مرجعية تعتمد فقط على الكلمات المفتاحية. شملت المواضيع أسماء شخصية، مؤسسات، أماكن، تواريخ ومجالات تاريخية، مهن، أحداث، ومواضيع موضوعية. تم تخزين كل استعلام مع صياغته الموحدة، ومجموعة سجلات الهدف، وفئة موضوع الاستعلام، ودرجة الصعوبة.
تم قياس الصعوبة قبل الاسترجاع باستخدام غموض الهدف، وخصوصية المعجم، والتكرار المتوقع للتعبير. تم تصنيف الدرجات المركبة التي تقل عن 0.40 إلى درجات منخفضة الصعوبة، والدرجات من 0.40 إلى 0.69 على أنها متوسطة الصعوبة، ودرجات 0.70 أو أعلى على أنها عالية الصعوبة. تم إتمام أحكام الصلة قبل مقارنة النظام ثم التحقق منها مقابل المجموعة النهائية.
شملت نتائج الاسترجاع P@10، R@10، nDCG@10، الوقت حتى النتيجة ذات الصلة الأولى، ومعدل البحث الناجح. P@10 كانت نسبة التسجيلات العشرة الأولى التي تم الحكم عليها ذات صلة. R@10 كانت نسبة جميع الأرقام القياسية ذات الصلة المعروفة التي تم استرجاعها ضمن أفضل 10. nDCG@10 تستخدم الصلة المصنفة حيثما كانت متاحة وذات الصلة الثنائية بخلاف ذلك. تم قياس الوقت حتى أول نتيجة ذات صلة من تقديم الاستعلام حتى ظهور أول سجل ذي صلة في المخرجات المصنفة. تم تعريف البحث الناجح بأنه نتيجة واحدة ذات صلة واحدة على الأقل من بين أفضل 10 سجليات.
جمع الإحصائيات
تم إجراء جميع التحليلات باستخدام نسخ البرمجيات المدرجة في جدول المواد. تم تلخيص النتائج المستمرة كمتوسط ± SD عندما تكون متماثلة تقريبا وكوسيط مع نطاق رباعي غير ذلك. تم تلخيص النتائج التصنيفية كأعداد ونسب مئوية.
تم تقييم طبيعية الفروق المزدوجة من خلال اختبار شابيرو-ويلك ومخططات التوزيع. تمت مقارنة النتائج المسبقة وبعد الرسومات الضمادية والبيانات الوصفية مع اختبارات التستوستيرون المزدوجة عندما كانت الفروق المزدوجة تقريبا طبيعية، واختبارات ويلكوكسون الموقعة في الترتيب بخلاف ذلك. تمت مقارنة أداء التصنيف قبل وبعد الضبط الدقيق باستخدام اختبار ماكنيمار على التسميات الصحيحة وغير الصحيحة الزوجية. تمت مقارنة نتائج الاسترجاع متعددة الأذرع المتطابقة مع اختبار فريدمان تلاه اختبارات ترتيب ويلكوكسون المعدلة من هولم.
كانت جميع الاختبارات الإحصائية ذات طرفين، واعتبر P < 0.05 ذات دلالة إحصائية. تم تقدير فترات الثقة باستخدام 2000 عينة إعادة تمهيد مع تثبيت البذرة العشوائية في 2025. تم الإبلاغ عن التأثيرات على شكل فروق متوسطة، أو نسب احتمالات متطابقة، أو أحجام تأثير تعتمد على الرتبة حسب نوع النتيجة.
قابلية التكرار، النطاق، وتوفر الموارد
تم تثبيت جميع معلمات خط الأنابيب قبل اختبار الاسترجاع. لم يتم تحسين أي معلمة على معيار الاسترجاع المحجوز. تم الحفاظ على ملفات التكوين، والمفردات المحكمة، وجداول المعجميات، وقوالب الاستعلام، ورسم الخرائط الحقولية، وإرشادات التعليقات، والنصوص الإحصائية، وسكريبتات توليد الأشكال في نظام التحكم بالإصدارات المدرج في جدول المواد مع البذرة العشوائية لعام 2025.
لدعم التحقق المستقل، يتضمن كتاب بيانات المصدر جدولا غير محدد يحتوي على 1,600 سجل يحتوي على 17 متغيرا يستخدم للتعرف البصري على الحروف، والبيانات الوصفية، وتحليلات التصنيف البصري. الجداول المشتقسة 1، الجدول 2، الجدول 3، الجدول 4، والجدول 5، وملخصات المصدر للشكل، وتعريفات الاستعلام المرجعي، وملخصات الحكم على الصلة، وبدائل سجلات الاسترجاع، وتشخيصات التدريب، وفئات المعجم، وقواعد تعيين المفردات، وحقول إرشادات التعليقات التوضيحية كجداول أو ملفات مواد منفصلة قابلة للرفع حيثما كان ذلك مناسبا. المواد التي لا يمكن مشاركتها علنا بسبب قيود المستودع تمثل بحقول بيانات وصفية غير محددة وحقول أخذ عينات قابلة لإعادة الإنتاج.
يقيم هذا البروتوكول الاكتشاف الموجه نحو الاسترجاع بدلا من صحة الادعاءات التاريخية. لا تحل محل تقييم الأرشيفيين، أو تقييم المصدر، أو مراجعة الخصوصية، أو قواعد الوصول الخاصة بالمستودعات.
حسن تصحيح السجلات الضوئية الشفافة (OCR) النسخ، خاصة في السجلات المكتوبة بخط اليد والجداول
حسن تصحيح التعرف البصري على الحروف جودة النسخ عبر جميع فئات الوثائق الأرشيفية الثمانية (n = 1,600 سجل). انخفض متوسط WER من 0.529 ± 0.172 إلى 0.384 ± 0.123، مع متوسط تغير مزدوج −0.144 (فترة الثقة 95٪، −0.149 إلى −0.139؛ وقع ويلكوكسون مع التصنيف P < 0.001). انخفض متوسط معدل الحمل المتوسط من 0.377 ± 0.126 إلى 0.258 ± 0.086، مع متوسط تغير مزدوج قدره −0.119 (فترة الثقة 95٪، −0.123 إلى −0.116؛ وقع ويلكوكسون مع التصنيف P < 0.001). يوضح الجدول 2 أن WER الأساسي كان الأعلى للرسائل المكتوبة بخط اليد، والدفاتر المكتوبة، ودفاتر السجل، مما يشير إلى أن أكثر السجلات تعقيدا بصريا كانت أيضا تحمل أكبر عبء التعرف الأولي.
بعد التصحيح، انخفض معدل التقييم الوظيفي عبر جميع فئات المستندات. حدثت أكبر انخفاضات متوسط WER المزدوجة في الحروف المكتوبة بخط اليد (n = 262؛ −0.200؛ 95٪ CI، −0.213 إلى −0.188)، والسجلات (n = 263؛ −0.195؛ 95٪ CI، −0.206 إلى −0.183)، ودفاتر السجلات (n = 194؛ −0.173؛ 95٪ CI، −0.187 إلى −0.160). اتبعت CER نفس النمط، مؤيدة التفسير بأن وحدة ما بعد التصحيح كانت تستفيد بشكل أساسي من السجلات المكتوبة بخط اليد والجدول والتوزيع المختلط الصعبة.
كما تحسنت استدعاء الكيانات المسماة عبر جميع أنواع المستندات، كما هو موضح في جدول الملخص. حدثت أكبر الزيادات في الرسائل المكتوبة بخط اليد (0.302–0.440)، والدفاتر (0.336–0.471)، ودفاتر السجلات (0.369–0.504). وصلت المراسلات المكتوبة إلى أعلى استدعاء للكيان المسمى بعد التصحيح (0.646)، لكن مكسبها المطلق كان أقل لأن التعرف الأساسي كان أقوى بالفعل لهذه الفئة. يلخص الشكل 2 علاقة CER-WER على مستوى السجل على مستوى الأساس، والعلاقة بين شدة الكتابة اليدوية وفائدة التصحيح، والتحول بعد التصحيح في قابلية الاكتشاف على مستوى السجل.
تحسنت تصنيفات المستندات البصرية بشكل عام، لكن مكاسب الأداء كانت غير متساوية بين الفئات
تحسنت تصنيفات المستندات البصرية بشكل عام عبر مجموعة الاختبارات التي تضم 1,600 سجل. زادت دقة التصنيف الأول من 0.717 إلى 0.796 (التغيير المطلق، 0.079؛ ماكنيمار كاي-تربيع = 27.33; P < 0.001)، وارتفع متوسط الثقة في التنبؤ من 0.736 ± 0.131 إلى 0.800 ± 0.108 (متوسط التغير المزدوج 0.064؛ فترة الثقة 95٪ 0.057–0.071؛ اختبار الt المزدوج P < 0.001). كما هو موضح في الجدول 3، تحسنت سبع من أصل ثماني فئات بعد التعديل الدقيق لكل أرشيف، مع أكبر مكاسب للخرائط والملصقات والصحف وكتب السجل.
لم تتحسن المراسلات النوعية بشكل كبير بعد الضبط الدقيق (0.796–0.791)، مما يشير إلى أن ميزاتها البصرية الأساسية كانت مستقرة بالفعل وأن إجراء التدريب لم يضف الكثير من الفصل الإضافي للفئات لهذه الفئة.
يلخص الشكل 3 أداء تصنيف المستندات البصرية قبل وبعد الضبط الدقيق الخاص بالأرشيف؛ يسرد كتاب بيانات المصدر 20 حقبة من فقدان ودقة التحقق/القطار، إلى جانب ملخصات تشخيصية ماكرو-F1، موزون-F1، ROC-AUC، وPR-AUC.
حسن إثراء البيانات الوصفية اكتمال الوصف عبر جميع الفترات التاريخية (n = 1,600 سجل). ارتفع متوسط الاكتمال من 0.657 ± 0.125 إلى 0.907 ± 0.070، مع متوسط تغير مزدوج قدره 0.250 (فترة الثقة 95٪، 0.243–0.257؛ وقع ويلكوكسون مع التصنيف P < 0.001). كما هو موضح في الجدول 4، كان اكتمال الأساس الأدنى بين 1850–1879 وارتفع عبر الفترات اللاحقة قبل الإثراء. يلخص الشكل 4 التحسن في اكتمال البيانات الوصفية، والحقول الجديدة للبيانات الوصفية حسب نوع المستند، وتحقيق مكاسب مطابقة عناوين الموضوع عبر الفترات التاريخية.
بعد الإثراء، زاد الكمال في كل فترة تاريخية: 1850–1879 (n = 281؛ التغير المتوسط، 0.207؛ 95٪ CI، 0.191–0.223)، 1880–1909 (n = 474؛ متوسط التغيير، 0.236؛ 95٪ CI، 0.223–0.248)، 1910–1939 (n = 549؛ متوسط التغيير، 0.277؛ 95٪ CI، 0.265–0.288)، و1940–1969 (n = 296؛ التغير المتوسط، 0.263؛ 95٪ CI، 0.247–0.279). كما ارتفع متوسط أعداد الحقول المأهولة بشكل مستمر عبر الفترات.
تحسنت مطابقة الموضوع والعنوان بالتوازي. تراوحت معدلات المطابقة الأساسية بين 64.3٪ و69.4٪، في حين تراوحت معدلات المطابقة بعد الإثراء بين 82.1٪ و85.4٪. أكبر مكسب مطلق حدث في الفترة الأولى (دلتا = 0.178)، مما يدعم قيمة الإثراء المحافظ للسجلات ذات الوصف الأولي المحدود.
تحسن أداء الاسترجاع في جميع الأنظمة المحسنة، مع أقوى المكاسب تحت التكامل متعدد الوسائط الكامل
تحسنت فعالية الاسترجاع تحت كل حالة تعزيز مقارنة بخط الأساس، لكن حجم التحسن اختفى حسب ذراع النظام (n = 420 استعلام معياري مطابق). النتائج العامة للاسترجاع مدرجة في الجدول 5. كان الأداء الأساسي منخفضا: P@10 = 0.394، R@10 = 0.238، nDCG@10 = 0.392، متوسط الوقت حتى النتيجة الأولى ذات الصلة = 156.079 ثانية، ومعدل البحث الناجح = 5.0٪ (21/420؛ 95٪ CI، 3.3٪–7.5٪). يلخص الشكل 5 أداء الاسترجاع عبر أذرع النظام التجريبي الخمسة، بما في ذلك مقاييس الاسترجاع العامة، ونسب النجاح على مستوى الموضوع، وطبقات صعوبة الاستعلام.
جميع الأنظمة الثلاثة ذات المكون الواحد تفوقت على الأساس من حيث الأداء الإجمالي. ارتفع تصحيح التعرف البصري على الحروف P@10 إلى 0.484، R@10 إلى 0.346، و nDCG@10 إلى 0.475، مع تقليل الوقت للوصول إلى النتيجة الأولى ذات الصلة إلى 124.261 ثانية وزيادة معدل البحث الناجح إلى 30.2٪ (127/420؛ فترة الثقة 95٪، 26.0٪–34.8٪). التصنيف البصري الناتج P@10 = 0.490، R@10 = 0.302، nDCG@10 = 0.478، متوسط الوقت حتى أول نتيجة ذات صلة = 131.985 ثانية، ومعدل البحث الناجح = 22.9٪ (96/420؛ فترة الثقة 95٪، 19.1٪–27.1٪). حقق إثراء البيانات الوصفية أقوى أداء في الاسترجاع بمكون واحد، حيث P@10 = 0.507، R@10 = 0.347، nDCG@10 = 0.513، متوسط الوقت حتى النتيجة ذات الصلة = 117.474 ثانية، ومعدل بحث ناجح بلغ 38.3٪ (161/420؛ فترة الثقة 95٪، 33.8٪–43.1٪).
كان النظام متعدد الوسائط الكامل يؤدي بشكل أفضل عبر جميع نقاط الاسترجاع. ارتفع P@10 من 0.394 عند الأساس إلى 0.624، R@10 من 0.238 إلى 0.492، nDCG@10 من 0.392 إلى 0.634. انخفض متوسط الوقت حتى أول نتيجة ذات صلة من 156.079 ثانية إلى 58.485 ثانية، وارتفع معدل البحث الناجح من 5.0٪ إلى 95.5٪ (401/420؛ فترة الثقة 95٪، 93.0٪–97.1٪). تتوافق هذه القيم مع مكاسب مطلقة تبلغ 0.230 ل P@10، و0.254 ل R@10، و0.242 ل nDCG@10.
كما تحسن الاسترجاع حسب الموضوع تحت التكامل الكامل متعدد الوسائط. ارتفعت معدلات البحث الناجح عبر الأشخاص والمؤسسات والأماكن والمهن والفعاليات والمواضيع الموضوعية، حيث أظهرت فئة المهن أكبر مكسب عملي، حيث بلغت نسبة نجاحها الأساسية 0.0٪ وارتفعت إلى 90.0٪ تحت الوضع المتعدد الوسائط الكامل. كانت استعلامات أسماء الأماكن تحقق أقوى أداء أساسي لكنها استفادت من التكامل متعدد الوسائط.
تفاوتت المكاسب متعددة الوسائط بين طبقات الوثائق والفترات واللغة
أظهرت تحليلات المجموعات الفرعية أن المكاسب متعددة الوسائط كانت موزعة بشكل واسع عبر أنواع الوثائق والفترات التاريخية والسياقات اللغوية، رغم أن حجم التحسن كان مختلفا. يشير هذا التباين إلى أنه يجب تقييم سير العمل داخل كل مجموعة مستهدفة بدلا من افتراض أنه ينتج مكاسب موحدة. يوضح الشكل 6 تباين مكاسب الاسترجاع متعددة الوسائط عبر نوع المستند المستهدف، والفترة التاريخية، وسياق اللغة.
على مستوى نوع المستند، تحسنت nDCG@10 عبر جميع الفئات المستهدفة. أظهرت الصور التي تحتوي على تعليقات ورسائل مكتوبة بخط اليد وخرائط ودفاتر ودفاتر تسجيل مكاسب قوية، بينما تحسنت الصحف والمراسلات المكتوبة بشكل أكثر تواضعا. تشير هذه الأنماط إلى أن السجلات ذات البيانات الوصفية الضعيفة أو البنية البصرية المعقدة تستفيد أكثر من الإشارات النصية والصورة والبيانات الوصفية المجمعة.
على مستوى الفترة التاريخية، ارتفع R@10 من 0.175 إلى 0.429 في الفترة 1850–1879 ووصل إلى 0.506 في الفترة من 1880 إلى 1909، و0.501 في 1910–1939، و0.519 في الفترة 1940–1969 تحت التكامل متعدد الوسائط الكامل. كانت المكاسب متشابهة في الحجم المطلق عبر الفترات، مما يشير إلى أن الإثراء والتعرف المصحح ساعدا كل من السجلات المتفرقة المبكرة والسجلات اللاحقة ذات البيانات الوصفية الأساسية الأكثر ثراء.
أظهرت نتائج السياق اللغوي نمطا مشابها. P@10 في حالة الوسائط المتعددة الكاملة وصلت إلى 0.607 للأسطوانات المختلطة بالخط اللاتيني، و0.628 للإنجليزية، و0.618 للفرنسية، و0.661 للألمانية، و0.639 للبرتغالية والإسبانية. أكبر زيادة في الدقة حدثت في التسجيلات المختلطة بالخط اللاتيني، والتي كانت أضعف دقة أساسية.
أنماط على مستوى المكونات: مساهمات مكملة بدلا من مكررة
تظهر النتائج معا أن مكونات البروتوكول مكملة وليست زائدة. حسن تصحيح التعرف الضوئي على الحروف الواضحة على التعرف على النص، وأضاف التصنيف البصري إشارات نوعية المستندات الواعية للهيكل، وسع إثراء البيانات الوصفية طبقة الوصف القابلة للبحث. أنتجت الحالة متعددة الوسائط الكاملة أقوى وأقدر مكاسب الاسترجاع، مما دعم هدف الدراسة في اختبار سير عمل قابل للتدقيق ويعتمد على الاسترجاع للأرشيفات الرقمية غير المتجانسة.
تدعم هذه النتائج نموذج بروتوكول يعزز فيه الذكاء الاصطناعي متعدد الوسائط البحث الأرشيفي مع الحفاظ على الحاجة إلى حوكمة المستودعات، ومصدر البيانات، والتحقق من صحة الخبراء.
توفر البيانات:
مجموعة البيانات التي تم إلغاء تحديد 1600 سجل والمستخدمة في التحليلات الرئيسية متاحة على زينودو برقم data.xlsx (https://doi.org/10.5281/zenodo.20774456).

الشكل 1: سير عمل قابل للتكرار لاكتشاف الأرشيفات متعددة الوسائط. (أ) بناء المجموعات من سجلات أرشيفية على مستوى المستودع مع فحص الشمول/الاستبعاد. (ب) تصنيف المراجع ومراقبة الجودة، بما في ذلك نوع المستند، ومناطق مرجعية التعرف الضوئي على الحروف المدنية، وسياق اللغة، والفترة التاريخية، واكتمال البيانات الوصفية. (ج) معالجة الصور المسبقة، توليد وتصحيح التعرف الضوئي على الحروف (OCR) وبعد تصحيحها، وتصنيف المستندات البصرية، وإثراء البيانات الوصفية المحافظ. (د) بناء المؤشر، تقييم الاسترجاع بخمسة أذرع، التحليل الإحصائي، وتغليف الموارد. الاختصارات: OCR، التعرف البصري على الحروف؛ CER، معدل خطأ الحروف؛ WER، معدل خطأ في الكلمات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: هيكل الأخطاء في التعرف البصري على الحروف على مستوى السجل وقابلية الاكتشاف بعد التصحيح. (أ) CER الأساسي مقابل WER الأساسي عبر 1,600 سجل أرشيفي، ملون حسب نوع المستند للفئات الممثلة. (ب) الارتباط بين شدة الخط المعدلة والتغير في WER بعد التصحيح؛ تشير القيم السلبية إلى انخفاض WER بعد التصحيح. الخط المناسب والشريط الرمادي يظهران الاتجاه الخطي وفترة الثقة 95٪. (ج) درجة قابلية الاكتشاف على مستوى السجل قبل وبعد التصحيح حسب نوع المستند، مما يوضح التحولات في الأدلة القابلة للبحث بعد التصحيح. الاختصارات: CER، معدل خطأ الحرف؛ WER، معدل خطأ في الكلمات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: تصنيف المستندات البصرية قبل وبعد الضبط الدقيق الخاص بالأرشيف. (أ) دقة أعلى 1 حسب نوع المستند في الأساس وبعد الضبط الدقيق. (ب) توزيعات الثقة للتنبؤات الصحيحة والخاطئة تحت ظروف الأساس وما بعد الضبط. (ج) مصفوفة الأداء على مستوى الصف تلخص الدقة العليا ومتوسط الثقة الخلفية قبل وبعد الضبط. تشمل بيانات التشخيص النموذجي 20 حقرا من منحنيات الفقدان/الدقة، ماكرو-F1، موزون-F1، ROC-AUC، وPR-AUC. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: اكتمال البيانات الوصفية ومطابقة الموضوع والرأس بعد الإثراء المحافظ. (أ) اكتمال البيانات الوصفية على مستوى السجل قبل وبعد الإثراء. (ب) حقول البيانات الوصفية الجديدة حسب نوع المستند. (ج) تحقيق مكاسب في تطابق العنوان بين الموضوعات عبر الفترات التاريخية. تم حساب الاكتمال كعدد الحقول الأساسية المأهولة القابلة للتطبيق مقسوما على إجمالي عدد الحقول الأساسية القابلة للتطبيق. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: أداء الاسترجاع عبر أذرع النظام التجريبي الخمسة. (أ) P@10 و R@10 و nDCG@10 والوقت حتى النتيجة الأولى ذات الصلة، ومعدل البحث الناجح للخط الأساسي، وتصحيح التعرف البصري على الحروف، والتصنيف البصري، وإثراء البيانات الوصفية، والتكامل متعدد الوسائط الكامل. (ب) مخطط الفقاعة لمعدل البحث الناجح حسب موضوع الاستعلام وذراع النظام؛ اللون يشير إلى ذراع النظام، وحجم الفقاعة يشير إلى نسبة النجاح. (C) P@10 و R@10 و nDCG@10 عبر طبقات صعوبة الاستعلام السهلة والمتوسطة والصعبة. (د) عرض معدل نجاح بديل على مستوى الموضوع يظهر توزيع عمليات البحث الناجحة عبر مواضيع الاستعلام وأذرع النظام. الاختصارات: P@10، الدقة 10؛ R@10، استدعاء عند الساعة 10؛ nDCG@10، الربح التراكمي المخصوم المعدل عند 10. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 6: تباين مكاسب الاسترجاع متعددة الوسائط عبر المجموعات الفرعية الأرشيفية. (أ) nDCG@10 حسب نوع المستند المستهدف وحالة الاسترجاع. (ب) R@10 حسب الفترة التاريخية وحالة الاسترجاع. (ج) P@10 حسب سياق اللغة المستهدفة وحالة الاسترجاع. الشروط هي: خط الأساس، تصحيح التعرف الضوئي على الحروف السرية، التصنيف البصري، إثراء البيانات الوصفية، التكامل الكامل متعدد الوسائط، OCR+النص، النص+الصورة+البيانات الوصفية، والبصري+البيانات الوصفية. يبرز الشكل أن المكاسب متعددة الوسائط منتشرة لكنها ليست موحدة عبر طبقات الوثائق والفترات واللغات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
| نوع المستند | n ريكوردز | الصفحات الوسيطة | السجلات المكتوبة بخط اليد | خط الأساس المتوسط WER | خط الأساس المتوسط البيانات الوصفية الاكتمال | خط الأساس المتوسط قابلية الاكتشاف |
| (%) | ||||||
| رسالة مكتوبة بخط اليد | 262 | 2 | 95 | 0.729 | 0.648 | 68.2 |
| ليدجر | 263 | 7 | 63.5 | 0.679 | 0.674 | 72.2 |
| الخريطة | 102 | 1 | 2.9 | 0.457 | 0.552 | 74.1 |
| الصحيفة | 261 | 8 | 0.8 | 0.495 | 0.66 | 75.5 |
| صورة مع تعليق | 179 | 1 | 1.1 | 0.374 | 0.601 | 73.6 |
| الملصق | 87 | 1 | 0 | 0.413 | 0.571 | 74.8 |
| كتاب السجل | 194 | 10 | 18 | 0.616 | 0.703 | 71.3 |
| المراسلات المطبوعة | 252 | 3 | 4 | 0.315 | 0.689 | 76.4 |
الجدول 1: خصائص المجموعة الأرشيفية حسب نوع المستند. يعرض الجدول عدد السجلات، ومتوسط عدد الصفحات، ونسبة السجلات التي تحتوي على خط اليد، ومتوسط WER الأساسي، ومتوسط اكتمال البيانات الوصفية، ومتوسط درجة الاكتشاف الأساسية لكل من فئات المستندات الثمانية.
| نوع المستند | حجم العينة | CER | CER | WER | WER | الكيان المسمى الاستدعاء | الكيان المسمى الاستدعاء | ΔWER |
| (ن) | (خط الأساس) | (منشور) | (خط الأساس) | (منشور) | (خط الأساس) | (منشور) | ||
| رسالة مكتوبة بخط اليد | 262 | 0.531 | 0.363 | 0.729 | 0.531 | 0.302 | 0.44 | −0.198 |
| ليدجر | 263 | 0.49 | 0.326 | 0.679 | 0.485 | 0.336 | 0.471 | −0.194 |
| الخريطة | 102 | 0.322 | 0.228 | 0.457 | 0.347 | 0.38 | 0.503 | −0.11 |
| الصحيفة | 261 | 0.354 | 0.256 | 0.495 | 0.381 | 0.436 | 0.558 | −0.114 |
| صورة مع تعليق | 179 | 0.257 | 0.181 | 0.374 | 0.286 | 0.494 | 0.616 | −0.088 |
| الملصق | 87 | 0.287 | 0.199 | 0.413 | 0.316 | 0.448 | 0.57 | −0.097 |
| كتاب السجل | 194 | 0.442 | 0.293 | 0.616 | 0.439 | 0.369 | 0.504 | −0.177 |
| المراسلات المطبوعة | 252 | 0.219 | 0.155 | 0.315 | 0.232 | 0.524 | 0.646 | −.083 |
الجدول 2: أداء التعرف الضوئي على الحروف قبل وبعد التصحيح حسب نوع المستند. تم حساب CER وWER مقابل النسخ المرجعية؛ تم حساب استدعاء الكيان المسمى بناء على الشخص والمكان والمؤسسات والكيانات التاريخية التي تم تصنيفها يدويا. دلتا WER هو WER بعد التصحيح ناقص WER في الخط الأساسي.
| نوع المستند | n | الدقة، خط الأساس | الدقة، المنشور | الثقة، خط الأساس | الثقة، المنشور | Δالأكورسي |
| رسالة مكتوبة بخط اليد | 262 | 0.615 | 0.645 | 0.616 | 0.655 | 0.03 |
| ليدجر | 263 | 0.707 | 0.749 | 0.725 | 0.767 | 0.042 |
| الخريطة | 102 | 0.765 | 0.902 | 0.801 | 0.899 | 0.137 |
| الصحيفة | 261 | 0.716 | 0.843 | 0.728 | 0.83 | 0.127 |
| صورة مع تعليق | 179 | 0.815 | 0.869 | 0.824 | 0.89 | 0.054 |
| الملصق | 87 | 0.771 | 0.903 | 0.792 | 0.889 | 0.132 |
| كتاب السجل | 194 | 0.687 | 0.793 | 0.701 | 0.787 | 0.106 |
| المراسلات المطبوعة | 252 | 0.796 | 0.791 | 0.804 | 0.82 | -0.005 |
الجدول 3: أداء تصنيف المستندات البصرية قبل وبعد الضبط الدقيق الخاص بالأرشيف. يعرض الجدول حجم العينة، ودقة النموذج الأول، ومتوسط الثقة في الخلفية، والتغير في الدقة حسب نوع المستند. تشمل بيانات التشخيص 20 صفا على مستوى العصر مع macro-F1، وموزون-F1، وROC-AUC، PR-AUC، وفقدان التدريب، وفقدان التحقق، ودقة التدريب، ودقة التحقق.
| الاكتمال | الاكتمال | الحقول المأهولة | الحقول المأهولة | عنوان الموضوع المباراة | عنوان الموضوع المباراة | Δ الاكتمال | Δ عنوان الفاعل المباراة |
| (خط الأساس) | (منشور) | (خط الأساس) | (منشور) | (خط الأساس) | (منشور) | ||
| 0.534 | 0.868 | 4.274 | 8.584 | 0.643 | 0.821 | 0.334 | 0.178 |
| 0.607 | 0.898 | 4.838 | 8.709 | 0.672 | 0.841 | 0.291 | 0.169 |
| 0.68 | 0.927 | 5.426 | 9.095 | 0.686 | 0.849 | 0.247 | 0.163 |
| 0.686 | 0.922 | 5.48 | 8.953 | 0.694 | 0.854 | 0.236 | 0.16 |
الجدول 4: إثراء البيانات الوصفية حسب الفترة التاريخية. الاكتمال هو نسبة الحقول الوصفية الأساسية القابلة للتطبيق التي تم ملؤها لسجلة؛ يتم الإبلاغ عن الحقول المأهولة كعدات متوسطة؛ تشير مطابقة الموضوع مع العنوان إلى ما إذا كانت الأدلة على مستوى السجل تدعم على الأقل تصنيف موضوع واحد للمفردات المحكمة.
| ذراع النظام | n استعلامات | P@10 | R@10 | nDCG@10 | حان وقت الارتباط أولا النتيجة (النتائج) | معدل البحث الناجح |
| (%) | ||||||
| خط الأساس | 420 | 0.394 | 0.238 | 0.392 | 156.079 | 5 |
| تصحيح التعرف الضوئي على الحروف | 420 | 0.484 | 0.346 | 0.475 | 124.261 | 30.2 |
| التصنيف البصري | 420 | 0.49 | 0.302 | 0.478 | 131.985 | 22.9 |
| إثراء البيانات الوصفية | 420 | 0.507 | 0.347 | 0.513 | 117.474 | 38.3 |
| متعدد الوسائط الكامل | 420 | 0.624 | 0.492 | 0.634 | 58.485 | 95.5 |
الجدول 5: أداء الاسترجاع للأذرع الخمسة للأنظمة التجريبية. تم حساب P@10، R@10، nDCG@10، الوقت حتى أول نتيجة ذات صلة، ومعدل البحث الناجح عبر معيار 420 استعلام تحت شروط الاستعلام المتطابقة.
يظهر هذا البروتوكول أن الاكتشاف في الأرشيفات الرقمية التاريخية تحسن أكثر عندما تم تقييم تصحيح التعرف الضوئي على الحرارة، وفهم المستندات البصرية، وإثراء البيانات الوصفية المحافظ كمكونات استرجاع متصلة بدلا من تطويرات تقنية معزولة. حدثت أكبر مكاسب في السجلات الضوئية في المواد المكتوبة بخط اليد، والجداول، والمواد المسجلة، مما يدعم قيمة التصحيح اللاحق لفئات المستندات التي يكون فيها التعرف الأساسي أضعف. وفي الوقت نفسه، يظهر الخطأ المتبقي بعد التصحيح أن تنظيف السجل الضوئي على الحروف الضوئية لا يمكن اعتباره نسخا نهائيا ويجب أن يبقى قابلا للتدقيق.
تتطلب نتائج التصنيف البصري أيضا تفسيرا حذرا. حسن الضبط الدقيق الفئات المميزة بصريا مثل الخرائط، والملصقات، والصحف، وكتب السجلات، لكن الفوائد كانت أقل للرسائل والدفاتر المكتوبة بخط اليد، حيث تتداخل التصاميم، وتكون حدود الفئات أقل قابلية للفصل بصريا. حجم المجموعة الصغير نسبيا يعني أن أداء التصنيف يجب أن يفسر كدليل بروتوكولي بدلا من دليل على أن نموذج متعدد الوسائط إنتاجي يمكن تدريبه من 1600 سجل فقط. يجب أن يقارن التحقق المستقبلي EfficientNet-B3 مع محولات المستندات، محولات البصر، محولات Swin، ConvNeXt، ونماذج الأساس المستندية متعددة الوسائط 8,11,12,13,14,15,16,17,18.
ساهم إثراء البيانات الوصفية بشكل كبير في الاسترجاع من خلال توسيع السجلات الوصفية المتفرقة إلى حقول قابلة للبحث مع الاحتفاظ بمعلومات المصدر والثقة. هذا الاكتشاف يتوافق مع الحاجة الأرشيفية إلى نقاط وصول أغنى، لكنه يثير أيضا مخاطر الحوكمة. يمكن أن يؤدي الإثراء الآلي إلى تضخيم أخطاء التعرف الضوئي على الحرارة، أو تطبيع الأسماء الغامضة تاريخيا بشكل مفرط، أو إدخال تحيز إذا كانت المفردات المسيطر عليها غير مكتملة. لهذا السبب، يستخدم سير العمل عتبات الثقة، وتسجيل المصدر، وعلامات المراجعة بدلا من الاستبدال الآلي الكامل لسجلات الكتالوج.
يوفر تقييم الاسترجاع دليلا على تأثيرات الوحدة التكميلية، لكنه له قيود. استخدمت المقارنة الحالية شروط الاستئصال الأساسية والداخلية للوحدات؛ لم يقارن بين أنظمة السحب الكثيفة والتفاعل المتأخر مثل ColBERT، أو الاسترجاع الهجين المتناثر-كثيف، أو إعادة الترتيب العصبي، أو أنظمة التوليد المعززة بالسحب 22,23,24. يجب إضافة هذه الأساليب في الأعمال المستقبلية لتحديد ما إذا كانت المكاسب متعددة الوسائط الملحوظة لا تزال تنافسية مع هياكل الاسترجاع الحالية.
يتطلب التنفيذ أيضا الانتباه لتسريب البيانات، والقيود الحاسوبية، وقابلية التوسع. استخدم الإثراء مخرجات التعرف على الحروف البصرية، والتنبؤات البصرية، والبيانات الوصفية الموجودة، لذا يجب فصل التدريب/التحقق/الاختبار وتقييم الاستعلام منفصلين عن قرارات الإثراء. يجب أن تبلغ عمليات النشر المستقبلية عن العتاد، وقت التشغيل، استخدام الذاكرة، حجم الفهرس، والتكلفة لكل 1000 سجل. قد تلهم أساليب التصوير والاستعادة من أعمال رؤية الحاسوب المجاورة، بما في ذلك نماذج إزالة الانسداد متعددة المقاييس والمعتمدة على الانتباه، تجارب معالجة مسبقة مستقبلية، ولكن يجب اختبارها بعناية لأن سير العمل الأرشيفي يجب ألا يهلوس أو يغير محتوى الأدلة26,27.
بشكل عام، من الأفضل فهم سير العمل كبروتوكول وصول قابل للتكرار بدلا من كونه بديلا للوصف الأرشيفي. يمكن للذكاء الاصطناعي متعدد الوسائط تحسين الاكتشاف عندما تكون مخرجاته مقيدة وتسجل وراجعة، لكن الأرشيفيين يظلون أساسيين لتقييم المصدر، وقرارات حوكمة الوصول، وتفسير السجلات التاريخيةالمعقدة 21,25.
الاستنتاجات:
اختبرت هذه الدراسة ما إذا كان يمكن لتصحيح التعرف البصري على الحروف، وتصنيف المستندات البصرية، وإثراء البيانات الوصفية المحافظ أن يكون مكونات استرجاع مكملة في الأرشيفات الرقمية التاريخية. حسن البروتوكول النسخ والتصنيف واكتمال البيانات الوصفية وأداء الاسترجاع المجمع مع الحفاظ على العتبات الصريحة، وتسجيل المصادر، وإجراءات المراجعة البشرية. لذا يجب استخدام سير العمل كبروتوكول دعم وصول قابل للتدقيق، وليس كبديل لحكم الأرشيف أو حوكمة المستودعات.
المؤلفون ليس لديهم ما يكشفون عنه.
يشكر المؤلفون بصدق عضوي الأرشيف ذوي الخبرة والباحث المحترف في العلوم الإنسانية الرقمية على مساعدتهم القيمة في تعليق النص ومراقبة الجودة. وقد تم دعم هذا البحث ماليا من قبل خطة مشروع العلوم والتكنولوجيا لأرشيف مقاطعة جيانغسو (المنحة رقم 2024-2029) لبناء نظام أرشيفات شفوية ذكي قائم على الكلام، وخطة تطوير العلوم والتكنولوجيا الإقليمية لطب الصيني التقليدي في جيانغسو (المنحة رقم MS2025025) لدراسة وراثة وتطور مدارس طب الصيني التقليدي من منظور أرشيفي.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| Python | مؤسسة برمجيات Python | v3.11.8؛ https://www.python.org/ | البرمجة النصية للسيرورة، معالجة البيانات، التصحيح بعد التعرف البصري على الحروف، والدعم الإحصائي |
| R | مؤسسة R للحسابات الإحصائية | v4.3.3؛ https://www.r-project.org/ | التحليل الإحصائي وتوليد الشكل النهائي |
| Tesseract OCR | مشروع Tesseract OCR | v5.3.0؛ https://github.com/tesseract-ocr/tesseract | إنشاء معياري للتعرف البصري على الحروف |
| حزم لغة Tesseract | مشروع Tesseract OCR | حزم لغة خاصة بالدراسة؛ https://github.com/tesseract-ocr/tessdata | فك ترميز التعرف البصري على الحروف للغة الأساسية والمختلطة |
| OpenCV | فريق OpenCV | v4.9.0؛ https://opencv.org/ | إزالة الالتواء، تقدير الضوضاء، والمعالجة المسبقة للصورة |
| Pillow | مساهمو مكتبة Python للتصوير | v10.3.0؛ https://python-pillow.org/ | إدخال/إخراج الصورة وتطبيع التنسيق |
| NumPy | مطورو NumPy | v1.26.4؛ https://numpy.org/ | حساب المصفوفات لمعالجة الصورة والمقاييس |
| pandas | فريق تطوير pandas | v2.2.2؛ https://pandas.pydata.org/ | معالجة البيانات الجداول والتصدير الموجز |
| SciPy | مطورو SciPy | v1.13.1؛ https://scipy.org/ | الاختبارات الإحصائية والأدوات العددية |
| statsmodels | مطورو statsmodels | v0.14.2؛ https://www.statsmodels.org/ | النمذجة الإحصائية ودعم المقارنات المقترنة |
| scikit-learn | مطورو scikit-learn | v1.4.2؛ https://scikit-learn.org/ | مقاييس التصنيف، تشخيصات ROC/PR، وأدوات التحقق |
| rapidfuzz | Max Bachmann والمساهمون | v3.9.0؛ https://github.com/rapidfuzz/RapidFuzz | ترتيب المرشحين بناءً على مسافة التحرير لتصحيح التعرف البصري على الحروف |
| spaCy | Explosion AI | v3.7.4؛ https://spacy.io/ | معالجة الكيانات المسماة مع جداول المعجم المخصصة |
| PyTorch | مؤسسة PyTorch | v2.2.2؛ https://pytorch.org/ | تدريب المصنف المرئي للوثيقة |
| torchvision | مؤسسة PyTorch | v0.17.2؛ https://pytorch.org/vision/ | تنفيذ EfficientNet-B3 وتحويلات الصورة |
| الهيكل الأساسي لـ EfficientNet-B3 | أوزان torchvision / ImageNet المدرَّبة مسبقاً | EfficientNet-B3؛ https://pytorch.org/vision/stable/models/efficientnet.html | الهيكل الأساسي لتصنيف الوثيقة المرئية |
| sentence-transformers | UKP Lab / بيئة Hugging Face | v2.7.0؛ https://www.sbert.net/ | التوسيع الدلالي للمرشحين في المفردات المحكومة |
| برنامج محرك البحث | Elastic | Elasticsearch v8.11.1؛ https://www.elastic.co/elasticsearch | فهرسة BM25، الاسترجاع، والترتيب |
| محرك الحاويات | Docker Inc. | Docker v26.1.1؛ https://www.docker.com/ | بيئة الاسترجاع المحوَّزة |
| نظام تشغيل Linux | Canonical | Ubuntu 22.04 LTS؛ https://ubuntu.com/ | بيئة تشغيل ثابتة لعمليات الاسترجاع |
| نظام التحكم في الإصدار | مشروع Git | Git v2.44.0؛ https://git-scm.com/ | التحكم في الإصدار للتكوين، والمفردات، والسكريبتات، ورمز الأشكال |
| ggplot2 | tidyverse | v3.5.1؛ https://ggplot2.tidyverse.org/ | التقديم القائم على R للأشكال |
| Matplotlib | مطورو Matplotlib | v3.8.4؛ https://matplotlib.org/ | الرسوم البيانية التكميليَّة ورسوم الضمان النوعي |
| إرشادات التعليق | المؤلفون | 5 أقسام تعليق؛ 8 تسميات لفئات المستندات؛ مناطق OCR؛ تسميات الكيانات؛ أحكام الأهمية؛ قواعد التحكيم | التعريفات لفئات الوثائق، ومناطق OCR، والكيانات، وأحكام الأهمية، والتحكيم |
| معجم OCR الخاص بالأرشيف | المؤلفون | 6 فئات معجم: متغيرات الأشخاص، وأسماء الأماكن، وأسماء المؤسسات، وأنماط التواريخ، والمصطلحات الإدارية، والاختصارات | الأسماء، والأماكن، والمؤسسات، والمصطلحات الإدارية، ومتغيرات الإملاء |
| الربط الدلالي للمفردات المحكومة | المؤلفون / المستودعات الأرشيفية | 5 قواعد ربط تربط بين كيانات OCR، والفئة المرئية، والعناوين الرئيسية، وتغطية التواريخ، وموضوع الاستعلام إلى حقول البيانات الوصفية | تطابق العناوين الرئيسية والتوسع الدلالي |
| مجموعة استعلامات المعيار | المؤلفون | 420 استعلامًا معياريًا؛ 6 مواضيع استعلام؛ 3 مستويات صعوبة؛ 8 فئات مستندات مستهدفة؛ 4 فترات تاريخية؛ 6 سياقات لغوية | معيار الاسترجاع المتوافق عبر خمسة أذرع نظام |
| أحكام الأهمية | المؤلفون / المعلِّقون | 2100 صف نظام-استعلام؛ 420 استعلامًا × 5 أذرع نظام؛ إجماليات ذات صلة، وأرقام ذات صلة في أفضل 10، ودرجات الأهمية، وعلامات النجاح | البديل الموثوق به لـ P@10، R@10، nDCG@10، ومعدل البحث الناجح |
| تشخيصات التدريب | المؤلفون | 20 حقبة؛ خسارة تدريب؛ خسارة تحقق؛ دقة تدريب؛ دقة تحقق؛ F1 الكلي؛ F1 المرجح؛ ROC-AUC؛ PR-AUC | ملخصات تشخيص النموذج على مستوى الحقبة |
| الأجهزة الحسابية | المؤلفون | 8 أنوية CPU؛ 32 جيجابايت رام؛ بيئة تدريب بفئة GPU من NVIDIA | تفاصيل الموارد لقابلية إعادة الإنتاج لتقديم JoVE |
| ملف مجموعة البيانات | المؤلفون | data.xlsx؛ 1600 سجل؛ 17 متغير؛ معرف DOI مدرج في مخطوطة توافر البيانات | بيانات المصدر على مستوى السجل لتحليلات التعرف البصري على الحروف، واكتمال البيانات الوصفية، والاكتشاف، والتصنيف المرئي |
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن