הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר מחקר

תהליך עבודה רב-מודלי לשכפול של בינה מלאכותית לגילוי ארכיון דיגיטלי היסטורי

71 צפיות

DOI:

10.3791/71698

7 באוגוסט 2026

במאמר זה

סיכום

כאן, אנו מציגים פרוטוקול לשיפור הגילוי בארכיונים דיגיטליים היסטוריים על ידי שילוב זיהוי תווים אופטי לאחר תיקון, סיווג מסמכים חזותיים, העשרת מטא-דאטה והערכת שליפה לתוך תהליך עבודה שניתן לביקורת.

תקציר

ארכיונים דיגיטליים היסטוריים הופכים לניתנים לחיפוש יותר ויותר, אך הגילוי נשאר מוגבל כאשר שגיאות בזיהוי תווים אופטי, סוגי מסמכים הטרוגניים ויזואלית, ומטא-דאטה דלילה מטופלים בנפרד. מחקר זה נועד לפתח פרוטוקול שניתן לשחזר כדי להעריך האם תהליך עבודה שמרני של בינה מלאכותית רב-מודלית יכול לשפר את שליפת הארכיון מבלי להחליף את סקירת הארכיונאי. אוסף של 1,600 רשומות ארכיון דיגיטליות משמונה מחלקות מסמכים הורכב, ונעשה שימוש במדד של 420 שאילתות להשוואת חמישה תנאי שחזור: אינדוקס בסיסי, תיקון זיהוי תווים אופטי בלבד, סיווג חזותי בלבד, העשרת מטא-דאטה בלבד, ואינטגרציה מולטימודלית מלאה. תוצאות ברמת הרשומה כללו שיעור שגיאת תווים (CER), שיעור שגיאת מילים (WER), שליחת ישות בשם, דיוק סיווג סוגי מסמך, ביטחון תחזית, שלמות מטא-דאטה, והתאמה בין נושא לכותרת. תוצאות ברמת השאילתות כללו P@10, R@10, nDCG@10, זמן להגיע לתוצאה הרלוונטית הראשונה ושיעור חיפוש מוצלח. תיקון זיהוי תווים אופטי הפחית את ה-WER בצורה המשמעותית עבור מכתבים בכתב יד, פנקסים וספרי רישום; כיוונון חזותי שיפר את דיוק הסיווג בעיקר עבור מפות, פוסטרים, עיתונים וספרי רישום; והעשרת מטא-דאטה הגבירה את השלמות בכל התקופות ההיסטוריות. המצב הרב-מודלי המלא השיג את ביצועי השחזור הגבוהים ביותר (P@10 = 0.624, R@10 = 0.492, nDCG@10 = 0.634) והפחית את הזמן הממוצע לתוצאה הרלוונטית הראשונה מ-156.079 שניות ל-58.485 שניות. תוצאות אלו תומכות בזרימת עבודה מודולרית וניתנת לביקורת שבה טקסט, תמונה ואותות תיאוריים משולבים תחת סף מפורש וביקורת אנושית.

מבוא

הארכיונים הדיגיטליים התרחבו במהירות וכיום תומכים במחקר בהיסטוריה, מורשת תרבותית, מנהל ציבורי ומדעי הרוח הדיגיטליים. עם זאת, הגישה נותרת לא אחידה מכיוון שרשומות ארכיוניות לעיתים קרובות משלבות ירידה בפלט זיהוי תווים אופטי, פריסות דפים מגוונות ויזואלית, שיטות קטלוג לא עקביות, ושמות, מקומות ומוסדות משתנים היסטורית. מגבלות אלו משפיעות לא רק על איכות השעתוק אלא גם על שליפה, סינון ושימוש חוזר באוספים דיגיטלייםבמורד הדרך 1,2,3,4,5,6,7.

מחקרים קיימים בבינה מלאכותית של מסמכים ושליפה ארכיונית שיפרו רכיבים בודדים כגון זיהוי תווים אופטי לאחר תיקון, סיווג תמונות-מסמך, נרמול מטא-דאטה, מידול נושאים, הטמעות, שליפה עצבית, ושיטות ממשל נתונים 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. עם זאת, מערכות ארכיון רבות עדיין מעריכות רכיבים אלו בנפרד, מה שמקשה לקבוע האם תהליך עבודה משולב משפר את הגילוי בתנאי חיפוש ריאליסטיים. הפער המתודולוגי שמטופל כאן הוא היעדר פרוטוקול שניתן לשחזר וניתן לביקורת שמחבר מודולי טקסט, תמונה ומטא-דאטה לתוצאות שליפת בתהליך עבודה ארכיוני אחד.

המטרה המרכזית הייתה לבדוק האם תיקון זיהוי תווים אופטי, סיווג מסמכים חזותיים והעשרת מטא-דאטה מוגבלת בכללים מניבים שיפורים משלימים כאשר הם מוערכים מול אותו מדד שחזור.

השענו שהתנאי המולטימודלי המלא יעלה על כל תנאי חד-רכיבי, משום שגילוי ארכיוני תלוי באינטראקציה בין טקסט קריא, מבנה מסמך שניתן לפרש ויזואלית, ומטא-דאטה תיאורית ניתנת לחיפוש. תהליך העבודה תוכנן באופן שמרני: פלטים אוטומטיים יכלו להעשיר מדדי שחזור, אך תחזיות בביטחון נמוך סומנו לבדיקה במקום לשמש כתיאור ארכיוני סמכותי.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

מחקר זה השתמש ברשומות ארכיוניות דיגיטליות ובשאילתות שליפת מדומות כיחידות ניתוח. מאגרי ארכיון עשויים להגביל גישה לרשומות רגישות או מוגבלות תרבותית. פעלו לפי כללי גישה למאגר, נהלי אבטחת נתונים מוסדיים ודרישות הסרת זיהוי לפני עיבוד או שיתוף רשומות. לא נוצרה פסולת כימית, ביולוגית, חדה, רדיואקטיבית או פסולת מעבדתית מסוכנת על ידי תהליך העבודה הדיגיטלי הזה.

עיצוב מחקר ובניית קורפוס

איור 1 מציג את תהליך העבודה המלא של המחקר, כולל בניית קורפוס, תיוג רפרנס, עיבוד מוקדם של תמונה, יצירת OCR ותיקון לאחר תיקון, סיווג חזותי, העשרת מטא-נתונים, בניית אינדקס, הערכת שחזור, ניתוח סטטיסטי ואריזת שחזוריות.

בניית הקורפוס בוצעה מ-15 בינואר עד 30 באפריל 2025, ואחריה תכנון מערכת וניפוי שגיאות בין 1 במאי ל-31 באוקטובר 2025. הקורפוס כלל 1,600 רשומות ארכיוניות דיגיטליות שנבחרו משמונה מחסנים המייצגים מערכות מדינה, עירוניות, דתיות, מוזיאונים, אוניברסיטאות ומערכות ספריות. מסגרת הדגימה סווגה לפי מחלקת מאגר ומסמכים כדי לשמור על הטרוגניות ארכיונית בין מכתבים בכתב יד, פנקסים, מפות, עיתונים, תמונות עם כיתובים, פוסטרים, ספרי רישום ותכתובות מוקלדת.

לכל רשומת מועמד, יומן הבחירה רשם את מזהה המאגר או האוסף, מזהה הקטלוג, מחלקת המסמך, התקופה ההיסטורית המשוערת, הקשר השפה הדומיננטית, פורמט התמונה הזמין, רזולוציית התמונה, מספר העמודים ושדות תיאוריים בסיסיים. הכללה דרשה את כל הדברים הבאים: מזהה קטלוג יציב; לפחות תמונת עמוד אחת ב-TIFF, JPEG או PNG; רזולוציית תמונת המקור של לפחות 150 DPI; תוכן טקסטואלי, טבלאי או מבני מסמכי קריא; והקצאה לאחת משמונה מחלקות המסמכים המוגדרות מראש. קריטריוני ההחרגה היו שכפולים מדויקים, דפים ריקים לאחור, תמונות שנחתכו עד כדי כך שיותר מ-30% משטח הטקסט חסר, ורשומות שנמצאו בלתי קריאות לאחר בדיקה ידנית.

מדד השליפה כלל 420 שאילתות קצרות בשפה טבעית שנוצרו בין 5 באוגוסט ל-20 באוגוסט 2025. יצירת השאילתות התבצעה לפי תבנית שניתן לשחזר: צורכי המידע של המועמדים נלקחו מאנשים, מוסדות, מקומות, טווחי תאריכים, עיסוקים, אירועים ונושאים אקטואליים; כל שאילתה נורמל ל-2–9 מילים; ורשומות רלוונטיות זוהו לפני השוואת המערכת. כל שאילתה הוערכה תחת חמישה תנאי שחזור, והניבו 2,100 תצפיות תנאי שאילתה תואמות.

תיוג עיון ובקרת איכות

תיוג המקורות בוצע בין 1 במאי ל-15 ביולי 2025 על ידי שלושה מעריצים: שני אנשי צוות ארכיון בעלי ניסיון בקטלוג תיאורי ואחד חוקר מדעי הרוח הדיגיטליים המנוסה בהערכת מסמכים היסטוריים. מדריך ההערות הגדיר מחלקות מסמכים, קטגוריות לקשר-שפה, תיבות תקופות היסטוריות, שדות שלמות מטא-דאטה, קטגוריות ישות בשם וכללים לבחירת אזורי הערכת OCR.

לצורך הערכת OCR, המערחים בחרו אזורים ייצוגיים הנושאים טקסט שכללו כותרות, שמות, תאריכים, מונחים מוסדיים, הערות שוליות, רשומות טבלאות, וכאשר קיימים, אזורי פריסה רועשים. כאשר עמוד הכיל מספר אזורי טקסט, האזור הנבחר היה חייב להיות רלוונטי לשחזור וחייב לכלול מספיק תווים לחישוב CER ו-WER. המחלוקות הופתרו תחילה באמצעות דיון בין שני המפרשים הראשיים; מקרים לא פתורים נפטרו על ידי חוקר מדעי הרוח הדיגיטליים.

בקרת איכות השתמשה בתת-קבוצה אקראית של 12% של רשומות. ההסכמה בין המפרשים לסוג המסמך הראשי הייתה כהן קאפה = 0.86, מה שתומך בהסכמה מהותית. יומן השיפוט שמר על התוויות המקוריות והסופיות, קטגוריית אי-ההסכמה וסיבת הפתרון כדי שמשתמשים עתידיים יוכלו לבדוק הגדרות מחלקות ומקרים קיצוניים.

עיבוד מוקדם של תמונה

כל התמונות עובדו ברמת הרשומה באמצעות Python 3.11.8 עם OpenCV 4.9.0, Pillow 10.3.0 ו-NumPy 1.26.4. כל עמוד קלט הומר לגווני אפור של 8 ביט, אלא אם הצבע נשא מידע סמנטי, כגון מפות, פוסטרים, חותמות או הערות מקודדות בצבעים. ההטיה הוערכה באמצעות פרופילי הקרנה וזיהוי קווי הוג; Deskewing הוחל רק כאשר זווית ההטיה האבסולוטית עלתה על 1.5 מעלות והוגבלה ל-8.0 מעלות כדי למנוע עיוות.

שיפור הניגודיות השתמש באקוליזציה אדפטיבית עם היסטוגרמות אדפטיבית מוגבלת ניגודיות עם clipLimit = 2.0 ו-tileGridSize = 8 × 8. מסנן חציוני עם גרעין 3 × 10−23 הוחל רק כאשר יחס רעש הרקע-רקע המשוער עלה על 0.35. תמונות שצולמו ב-150–299 dpi נדגמו מחדש ל-300 dpi לזיהוי תווים אופטי; תמונות שכבר היו ב-300 dpi ומעלה לא הוגדלו. לא נעשה שימוש בסופר-רזולוציה, שיקום גנרטיבי או הזיות תוכן.

דליפה דרך, כהיית הקצוות, מרקם נייר לא אחיד, חותמות שוליות, כתב יד, קווים מסודרים וגבולות טבלאות נשמרו אלא אם כן מנעו בחירת אזורי OCR. כלל זה שמר על ראיות ארכיוניות תוך סטנדרטיזציה מספקת של קלטי התמונה לצורך OCR וסיווג שניתן לשחזר.

יצירת בסיסים ב-OCR ותיקון לאחר

OCR בסיסי נוצר באמצעות Tesseract OCR 5.3.0. חבילת השפה הראשית נבחרה מתוך שפת הקטלוג והכתב הנראה; פענוח רב-לשוני הופעל כאשר שפת הקטלוג וסקריפט הדף לא התאימו. פלטי OCR אוחדו ברמת הרשומה ונשמרו עם מזהי עמודים, ביטחון OCR, קואורדינטות תיבת הגבול כאשר זמינות, וטקסט גולמי לפני תיקון.

תיקון לאחר OCR השתמש בהליך שמרני בן שלושה שלבים. ראשית, נורמליזציה ברמת תווים תיקנה בלבולים תכופים בזיהוי היסטורי, כולל ליגטורות, החלפות s/s-s ארוכות, פיסוק מקוטע והחלפות אותיות ספרתיות. שנית, תיקון ברמת הטוקן השתמש במועמדים מדורגים לפי מרחק עריכה ותדירות מתוך לקסיקון ייחודי לארכיון של שמות אישיים, שמות מקומות, מוסדות, מונחים מנהליים וגרסאות איות היסטוריות. שלישית, בדיקות רצף מבוססות כללים מאמתות ישויות ותאריכים בשם מול ראיות מהקשר ומטא-דאטה.

מחליפים התקבלו רק כאשר ביטחון התיקון האחורי עלה על 0.80; החלפת ישויות בשם דרשה ביטחון של לפחות 0.85. מועמדים מתחת לסף נשמרו כטקסט OCR אך סומנו לבדיקה. CER חושב כמרחק העריכה של לבנשטיין חלקי מספר התווים בתמלול ההפניות. WER השתמשה באותה נוסחה ברמת האסימון. שחזור ישות בשם חושב כישויות ייחוס שזוהו נכון, מחולקות לכל ישויות ההתייחסות באזור ההערכה הנבחר.

סיווג מסמך חזותי

מודול הסיווג הוויזואלי הקצה כל רשומה לאחת משמונה סוגי מסמכים ארכיוניים: מכתב בכתב יד, פנקס, מפה, עיתון, צילום עם כיתוב, פוסטר, ספר רישום והתכתבות מוקלדת. סוג המסמך החזוי שימש כאות שלילוף וסינון, ולא כתחליף סמכותי לקטלוג ארכיוני.

המודל יושם ב-PyTorch 2.2.2 וב-Torchvision 0.17.2 באמצעות עמוד שדרה EfficientNet-B3 מאומן מראש על ידי ImageNet. תמונות ממוזערות ברמת השיא שונו לגודל 384 על 384 פיקסלים. כדי להפחית דליפה, הרשומות חולקו לפי מאגר ומחלקת מסמכים לקבוצות אימון, אימות ובדיקות ביחס של 70:15:15, התואם לכ-1,120, 240 ו-240 רשומות.

האימון השתמש ב-AdamW עם קצב למידה התחלתי = 1 × 10-4, דעיכת משקל = 1 × 10−2, גודל אצווה = 16, החלקת תווית = 0.05, והפסקה מוקדמת כאשר אובדן האימות לא השתפר במשך חמש תקופות רצופות. הפיכה אופקית הושבת כי פריסות ארכיון מראות אינן ריאליסטיות. ההגברה הוגבלה לסיבוב מ-3- מעלות עד +3 מעלות ושינוי בהירות בטווח של ±10%.

אבחון מודלים ברמת אפוק מסוכם ב-20 שורות אימון, שכל אחת מהן כוללת אובדן אימון, אובדן אימות, דיוק אימון, דיוק אימות, מאקרו-F1, משקלל-F1, ROC-AUC ו-PR-AUC.

תהליך העשרת מטא-נתונים

העשרת מטא-דאטה נועדה לשפר את הגילוי תוך שמירה על שמרנות ארכיונית. ערכי הקטלוג הקיימים נשמרו אלא אם כן הכילו סתירה מפורשת, כגון תאריך בלתי אפשרי או סתירה מסוג מסמך שאושר הן על ידי OCR והן על ידי ראיות חזותיות. שדות העשרת המועמדים כללו כותרת מנורמלת, סוג מסמך, תאריך משוער, אזכורים למוסד, אזכורים גאוגרפיים, אזכורים לשמות פרטיים, כותרות נושא ומילות מפתח.

עדיפות הראיות הייתה לפי סדר קבוע: (1) מטא-נתונים קיימים של הקטלוג, (2) פלט OCR מתוקן, ו-(3) חיזוי חזותי מסוג מסמך. התאמת אוצר מילים מבוקרת שימשה לכותרות נושאים, והרחבת סמנטיקה של שכנים קרובים עם טרנספורמרים 2.7.0 שימשה רק כאשר דמיון הקוסינוס היה לפחות 0.72. נרמול תאריך דרש ביטחון של לפחות 0.85 או התאמה בין OCR למטא-נתונים. כל שדה שהתווסף אוטומטית שמר על המקור, הביטחון ומזהה הכללים שלו.

שלמות מטא-דאטה הוגדרה כמספר שדות הליבה התיאוריים המאוכלסים חלקי מספר שדות הליבה הרלוונטיים לרשומה זו. התאמת נושא לכותרת הוגדרה כנוכחות לפחות תווית נושא אחת עם אוצר מילים מבוקר, הנתמכת על ידי ראיות תוכן ברמת שיא ונחשבה רלוונטית לקטגוריית השאילתה.

בניית מערכת שליפה

נבנו חמישה אינדקסי שליפה כדי לבודד תרומות למודולים: אינדוקס בסיסי; תיקון זיהוי תווים אופטי בלבד; סיווג חזותי בלבד; העשרת מטא-דאטה בלבד; ואינטגרציה מולטימודלית מלאה. כל האינדקסים נבנו בתוכנת מנועי החיפוש המופיעה בטבלת החומרים (גרסה 8.11.1) ברמת שיא. פרמטרי BM25 היו קבועים ב-k1 = 1.2 ו-b = 0.75 לפני ההערכה.

אינדקס הבסיס השתמש במטא-דאטה מקורי ובטקסט OCR בסיסי. מצב ה-OCR החליף את ה-OCR הבסיסי ב-OCR מתוקן. המצב הוויזואלי הוסיף קודמים מסוג מסמך ושיפורי דירוג מודעים למחלקה. תנאי המטא-דאטה הוסיף שדות תיאוריים מועשרים. המצב הרב-מודלי המלא שילב OCR מתוקן, עדכונים חזותיים ומטא-דאטה מועשר. משקלי השדה נקבעו לפני הבדיקה: כותרת מנורמלת = 3.0, כותרות נושאים = 2.5, אזכורים של אדם ומוסד = 2.2, אזכורים למקום = 2.0, סוג מסמך = 1.8, טקסט גוף OCR מתוקן = 1.0, וטקסט גוף OCR בסיסי = 0.8, כאשר רלוונטי.

התאמת ביטוי מדויקת הופעלה עבור שאילתות מצוטטים. הרחבת השאילתות הותרה רק בתנאי העשרת מטא-דאטה ורב-מודליים מלאים, והוגבלה למילים נרדפות מבולטות וכותרות נושא מקובלות וכותרות נושא. יומני חיפוש נוצרו מ-25 באוגוסט עד 28 באוגוסט 2025, בסביבת לינוקס מכולת המופיעה בטבלת החומרים, עם זרעים קבועים ותצורות אינדקס קפואים.

עיצוב שאילתות ומדדי תוצאה

420 השאילתות ייצגו התנהגויות חיפוש ארכיוניות נפוצות ולא הנחיות מדד המבוססות רק על מילות מפתח. הנושאים כללו שמות אישיים, מוסדות, מקומות, תאריכים וטווחי תאריכים, עיסוקים, אירועים ונושאים נושאיים. כל שאילתה נשמרה עם הניסוח המנורמל, קבוצת רשומות היעד, קטגוריית נושא השאילתה, וציון הקושי.

רמת הקושי נמדדה לפני השליפה באמצעות עמימות המטרה, ספציפיות לקסיקלית ותדירות הביטוי הצפויה. ציונים משולבים מתחת ל-0.40 סווגו כקושי נמוך, ציונים בין 0.40–0.69 לקושי בינוני, וציונים של 0.70 ומעלה כקושי גבוה. שיפוטי רלוונטיות הושלמו לפני השוואת מערכות ואז נבדקו מול האוסף הסופי.

תוצאות השליפה כללו P@10, R@10, nDCG@10, זמן לתוצאות הרלוונטיות הראשונות ושיעור חיפוש מוצלח. P@10 היה החלק מהעשרת האלבומים המובילים שנחשב רלוונטי. R@10 היה החלק של כל השיאים הרלוונטיים הידועים שנאספו בעשירייה הראשונה. nDCG@10 השתמשו ברלוונטיות מדורגת כאשר הייתה קיימת וברלוונטיות בינארית אחרת. הזמן עד התוצאה הרלוונטית הראשונה נמדד מהגשת השאילתה ועד להופעת הרשומה הרלוונטית הראשונה בתוצאה המדורגת. חיפוש מוצלח הוגדר כלפחות תוצאה רלוונטית אחת מתוך עשרת הרשומות המובילות.

איסוף סטטיסטיקות

כל הניתוחים בוצעו באמצעות גרסאות התוכנה המפורטות בטבלת החומרים. תוצאות רציפות סוכמו כממוצע ± SD כאשר בערך סימטרי וכחציון עם טווח בין-רבעוני. התוצאות הקטגוריות סוכמו כספירות ואחוזים.

נורמליות ההבדלים הזוגיים הוערכה באמצעות מבחן שפירו-וילק וגרפים של התפלגות. תוצאות OCR ומטא-דאטה לפני/אחרי הושוו לבדיקות T זוגיות כאשר ההבדלים הזוגיים היו בערך תקינים ובדיקות דירוג חתום של וילקוקסון לעומת זאת. ביצועי הסיווג לפני ואחרי הכוונון המדויק הושוו באמצעות מבחן מקנמר על תוויות מזווגות נכונות/שגויות. תוצאות השליפה הרב-זרועיות שהותאמו הושוו למבחן פרידמן, ואחריו מבחני דירוג חתום וילקוקסון מותאמים על ידי הולם.

כל המבחנים הסטטיסטיים היו דו-זנביים, ו-P < 0.05 נחשב מובהק סטטיסטית. טווחי האמון הוערכו באמצעות 2,000 דגימות אתחול עם הזרע האקראי שנקבע ב-2025. ההשפעות דווחו כהבדלי ממוצע, יחס סיכויים תואמים או גודל השפעה מבוססי דרגה בהתאם לסוג התוצאה.

שחזוריות, היקף וזמינות משאבים

כל פרמטרי הצינור נקבעו לפני בדיקות השחזור. אף פרמטר לא אופטימיזם על מדד השחזור שהוחזק. קבצי קונפיגורציה, אוצר מילים מבוקר, טבלאות לקסיקונים, תבניות שאילתה, מיפוי שדות, הנחיות להערות, סקריפטים סטטיסטיים וסקריפטים ליצירת איורים נשמרו במערכת בקרת הגרסאות המופיעה בטבלת החומרים עם זרע אקראי 2025.

כדי לתמוך באימות עצמאי, חוברת נתוני המקור כוללת טבלה של 1,600 רשומות שאינה מזוהה עם 17 משתנים המשמשים לזיהוי תווים אופטי, מטא-דאטה וניתוחי סיווג ויזואליים. טבלה נגזרת 1, טבלה 2, טבלה 3, טבלה 4 וטבלה 5, סיכומי מקורות איור, הגדרות שאילתות מדד, סיכומי שיפוט רלוונטיות, תחליפים ביומן שליפה, אבחון אימונים, קטגוריות לקסיקונים, כללי מיפוי אוצר מילים, ושדות הנחיות להערות מסופקים כטבלאות או קבצי חומרים נפרדים להעלאה כאשר רלוונטי. חומרים שאינם יכולים להיות משותפים לציבור עקב מגבלות מאגר מיוצגים על ידי שדות מטא-דאטה שאינם מזוהים ושדות דגימה ניתנים לשחזור.

פרוטוקול זה מעריך גילוי ממוקד שליפה במקום את האמת של טענות היסטוריות. הוא אינו מחליף את הערכת הארכיונאי, הערכת המקור, סקירת פרטיות או כללי גישה ספציפיים למאגר.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

תיקון OCR שיפר את התמלול, במיוחד ברשומות בכתב יד ובטבלאות

תיקון זיהוי תווים אופטי שיפר את איכות התמלול בכל שמונת מחלקות המסמכים הארכיוניים (n = 1,600 רשומות). ממוצע WER ירד מ-0.529 ± 0.172 ל-0.384 ± 0.123, עם שינוי זוגי ממוצע של −0.144 (רווח בר-סמך 95%, −0.149 ל-−0.139; וילקוקסון חתם בדירוג P < 0.001). ממוצע CER ירד מ-0.377 ± 0.126 ל-0.258 ±-0.086, עם שינוי זוגי ממוצע של −0.119 (רווח בר-סמך 95%, −0.123 ל-−0.116; וילקוקסון חתם בדירוג <...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

פרוטוקול זה מראה כי הגילוי בארכיונים דיגיטליים היסטוריים השתפר בעיקר כאשר תיקון OCR, הבנת מסמכים חזותיים והעשרת מטא-נתונים שמרנית הוערכו כרכיבי שליפה מחוברים ולא כשדרוגים טכניים מבודדים. הרווחים הגדולים ביותר ב-OCR התרחשו בחומרים בכתב יד, טבלאי ורישום, מה שתומך בערך של תיקון לאחר תיקון עבור מחלקות מסמכים שבהן הזיהוי הבסיסי חלש ביותר. במקביל, שגיאה שאריתית לאחר תיקון מראה שניקוי OCR אינו יכול להיחשב כתמלול סופי וחייב להישאר ניתן לביקורת.

תוצאות הסיווג החזותי דו...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

למחברים אין מה לחשוף.

תודות

המחברים מודים בכנות לשני אנשי הצוות המנוסים בארכיון ולחוקר המדעי הרוח הדיגיטליים המקצועי על עזרתם היקרה בהערות טקסט ובקרת איכות. מחקר זה נתמך כלכלית על ידי תוכנית פרויקט המדע והטכנולוגיה של ארכיון מחוז ג'יאנגסו (מענק מס' 2024-9) לבניית מערכת ארכיונים אוראלית מבוססת דיבור חכמה, ועל ידי תוכנית פיתוח המדע והטכנולוגיה של מחוז ג'יאנגסו לרפואה סינית מסורתית (מענק מס' MS2025025) ללימוד הירושה וההתפתחות של בתי הספר לרפואה הסינית הסינית מנקודת מבט ארכיונית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Pythonקרן תוכנת Pythonv3.11.8; https://www.python.org/סקריפט זרימה, עיבוד נתונים, תיקון פוסט של זיהוי תווים אופטי ותמיכה סטטיסטית
Rקרן R לחישוב סטטיסטיv4.3.3; https://www.r-project.org/ניתוח סטטיסטי ויצירת דמויות סופיות
Tesseract OCRפרויקט Tesseract OCRv5.3.0; https://github.com/tesseract-ocr/tesseractיצירת זיהוי תווים אופטי בסיסי
חבילות שפה של Tesseractפרויקט Tesseract OCRחבילות שפה ספציפיות למחקר; https://github.com/tesseract-ocr/tessdataפענוח זיהוי תווים אופטי ראשוני ומעורב-שפות
OpenCVצוות OpenCVv4.9.0; https://opencv.org/הסרת הטיה, אומדן רעש ועיבוד מוקדם של תמונות
Pillowתורמי ספריית התמונות של Pythonv10.3.0; https://python-pillow.org/קלט/פלט תמונות ונורמליזציה של פורמט
NumPyמפתחי NumPyv1.26.4; https://numpy.org/חישוב מערכים לעיבוד תמונות ומטריקות
pandasצוות הפיתוח של pandasv2.2.2; https://pandas.pydata.org/טיפול בנתונים טבלאיים וייצוא סיכומים
SciPyמפתחי SciPyv1.13.1; https://scipy.org/מבחנים סטטיסטיים וכלי חישוב מספריים
statsmodelsמפתחי statsmodelsv0.14.2; https://www.statsmodels.org/מודלים סטטיסטיים ותמיכה בהשוואות זוגיות
scikit-learnמפתחי scikit-learnv1.4.2; https://scikit-learn.org/מדדי סיווג, אבחונים ROC/PR וכלי אימות
rapidfuzzMax Bachmann ותורמיםv3.9.0; https://github.com/rapidfuzz/RapidFuzzדירוג מועמדים בעזרת מרחק עריכה לתיקון זיהוי תווים אופטי
spaCyExplosion AIv3.7.4; https://spacy.io/עיבוד ישויות ממוינות עם טבלאות לקסיקון מותאמות אישית
PyTorchקרן PyTorchv2.2.2; https://pytorch.org/אימון מסווג מסמכים חזותיים
torchvisionקרן PyTorchv0.17.2; https://pytorch.org/vision/יישום EfficientNet-B3 ותמורות תמונות
בסיס EfficientNet-B3משקלות מוכוונים מראש של torchvision / ImageNetEfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.htmlבסיס לסיווג מסמכים חזותיים
sentence-transformersUKP Lab / מערכת האקולוגית של Hugging Facev2.7.0; https://www.sbert.net/הרחבה סמנטית עבור מועמדים עם אוצר מילים מבוקר
תוכנת מנוע חיפושElasticElasticsearch v8.11.1; https://www.elastic.co/elasticsearchאינדקס, אחזור ודירוג של BM25
מנוע מיכולותDocker Inc.Docker v26.1.1; https://www.docker.com/סביבת אחזור מכולות
מערכת הפעלה לינוקסCanonicalUbuntu 22.04 LTS; https://ubuntu.com/סביבת הפעלה קבועה להפעלות אחזור
מערכת בקרת גרסאותפרויקט GitGit v2.44.0; https://git-scm.com/בקרת גרסאות עבור תצורה, אוצר מילים, סקריפטים וקוד דמויות
ggplot2tidyversev3.5.1; https://ggplot2.tidyverse.org/עיבוד דמויות מבוסס R
Matplotlibמפתחי Matplotlibv3.8.4; https://matplotlib.org/ויזואליזציות משלימות וגרפים להבטחת איכות
הנחיות ביצוע אנוטציותמחברים5 חלקי אנוטציות; 8 תוויות סוגי מסמכים; אזורי OCR; תוויות ישויות; שיפוטי רלוונטיות; כללי פסיקההגדרות עבור סוגי מסמכים, אזורי OCR, ישויות, שיפוטי רלוונטיות ופסיקה
אוצר מילים ספציפי לארכיוןמחברים6 קטגוריות אוצר מילים: גרסאות של אנשים, שמות מקומות, שמות מוסדות, דפוסי תאריכים, מונחים מינהליים, קיצוריםשמות, מקומות, מוסדות, מונחים מינהליים ווריאציות איות
מיפוי אוצר מילים מבוקרמחברים / מאגרי ארכיון5 כללי מיפוי המקשרים ישויות OCR, סיווג ויזואלי, מילות מפתח של כותרת, כיסוי תאריכי ונושא שאילתה לשדות מטא נתוניםהתאמה של כותרת נושא ורחבה סמנטית
קבוצת שאילתות מדדמחברים420 שאילתות מדד; 6 נושאי שאילתות; 3 רמות קושי; 8 סוגי מסמכי יעד; 4 תקופות היסטוריות; 6 הקשרים לשונייםמדד אחזור תואם על פני חמישה זרועות מערכת
שיפוטי רלוונטיותמחברים

מקורות

  1. Xu Y, et al. LayoutLM: pre-training of text and layout for document image understanding. Presented at: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; Virtual Event; 2020:1192-1200. https://doi.org/10.1145/3394486.3403172.
  2. Aske K, Giardinetti M. (Mis)matching metadata: improving accessibility in digital visual archives through the EyCon project. J Comput Cult Herit. 2023;16(4):1-20. doi:10.1145/3594726.
  3. Jaillant L, Aske K. Are users of digital archives ready for the artificial intelligence era Obstacles to the application of computational research methods and new opportunities. J Comput Cult Herit. 2023;16(4):1-18. doi:10.1145/3631125.
  4. Sugimoto S. Digital archives and metadata as critical infrastructure to keep community memory safe for the future: lessons from Japanese activities. Arch Manuscr. 2014;42(1):61-72.
  5. Du L, Le B, Honig E. Probing historical image contexts: enhancing visual archive retrieval through computer vision. J Comput Cult Herit. 2023;16(4):84. doi:10.1145/3631129.
  6. Michalak H, Okarma K. Robust combined binarization method of non-uniformly illuminated document images for alphanumerical character recognition. Sensors. 2020;20(10):2914. doi:10.3390/s20102914.
  7. Kettunen K, et al. Optical character recognition quality affects subjective user perception of historical newspaper clippings. J Doc. 2023;79(7):137-156.
  8. Huang Y, et al. LayoutLMv3: pre-training for document AI with unified text and image masking. Presented at: Proceedings of the 30th ACM International Conference on Multimedia; Lisbon, Portugal; 2022:4083-4091. https://doi.org/10.1145/3503161.3548112.
  9. Blei DM, Ng AY, Jordan MI. Latent Dirichlet allocation. J Mach Learn Res. 2003;3:993-1022.
  10. Mikolov T, et al. Distributed representations of words and phrases and their compositionality. Presented at: Advances in Neural Information Processing Systems; Lake Tahoe, NV; 2013:3111-3119. https://papers.nips.cc/paper/5021-distributed-representations-of-words-and-phrases-and-their-compositionality.
  11. Harley AW, Ufkes A, Derpanis KG. Evaluation of deep convolutional nets for document image classification and retrieval. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:991-995. https://doi.org/10.1109/ICDAR.2015.7333910.
  12. Alghamdi T, Snoussi S, Hsairi L. Arabic document classification by deep learning. Int J Adv Comput Sci Appl. 2021;12(10):34-40.
  13. Afzal MZ, et al. Deepdocclassifier: document classification with deep convolutional neural network. Presented at: 13th International Conference on Document Analysis and Recognition; Tunis, Tunisia; 2015:1111-1115. https://doi.org/10.1109/ICDAR.2015.7333933.
  14. Tan M, Le QV. EfficientNet: rethinking model scaling for convolutional neural networks. Presented at: Proceedings of the 36th International Conference on Machine Learning; Long Beach, CA; 2019:6105-6114. https://proceedings.mlr.press/v97/tan19a.html.
  15. Reimers N, Gurevych I. Sentence-BERT: sentence embeddings using Siamese BERT-networks. Presented at: Conference on Empirical Methods in Natural Language Processing and International Joint Conference on Natural Language Processing; Hong Kong, China; 2019:3982-3992. https://doi.org/10.18653/v1/D19-1410.
  16. Devlin J, Chang MW, Lee K, Toutanova K. BERT: pre-training of deep bidirectional transformers for language understanding. Presented at: 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies; Minneapolis, MN; 2019:4171-4186. https://doi.org/10.18653/v1/N19-1423.
  17. Wei Y, et al. Cross-modal retrieval with CNN visual features: a new baseline. IEEE Trans Cybern. 2017;47(2):449-460.
  18. He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Presented at: IEEE Conference on Computer Vision and Pattern Recognition; Las Vegas, NV; 2016:770-778. https://doi.org/10.1109/CVPR.2016.90.
  19. Beshirov A, et al. Post-OCR text correction for Bulgarian historical documents. Int J Digit Libr. 2025;26(1):4. doi:10.1007/s00799-025-00415-x.
  20. Baltrušaitis T, Ahuja C, Morency LP. Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell. 2019;41(2):423-443.
  21. Cushing AL, Osti G. "So how do we balance all of these needs": how the concept of AI technology impacts digital archival expertise. J Doc. 2023;79(7):12-29.
  22. Thakur N, et al. BEIR: a heterogeneous benchmark for zero-shot evaluation of information retrieval models. Presented at: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track; Virtual Event; 2021. https://openreview.net/forumid=wCu6T5xFjeJ.
  23. Khattab O, Zaharia M. ColBERT: efficient and effective passage search via contextualized late interaction over BERT. Presented at: Proceedings of the 43rd International ACM SIGIR Conference on Research and Development in Information Retrieval; Virtual Event, China; 2020:39-48. https://doi.org/10.1145/3397271.3401075.
  24. Lewis P, et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. Adv Neural Inf Process Syst. 2020;33:9459-9474.
  25. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018. doi:10.1038/sdata.2016.18.
  26. Senussi MF, Kang HS. Occlusion removal in light-field images using CSPDarknet53 and bidirectional feature pyramid network: a multi-scale fusion-based approach. Appl Sci. 2024;14(20):9332. doi:10.3390/app14209332.
  27. Senussi MF, et al. U2-LFOR: a two-stage U2 network for light-field occlusion removal. Mathematics. 2025;13(17):2748. doi:10.3390/math13172748.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

234234OCR