כאן, אנו מציגים פרוטוקול לשיפור הגילוי בארכיונים דיגיטליים היסטוריים על ידי שילוב זיהוי תווים אופטי לאחר תיקון, סיווג מסמכים חזותיים, העשרת מטא-דאטה והערכת שליפה לתוך תהליך עבודה שניתן לביקורת.
הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.
מאמר מחקר
כאן, אנו מציגים פרוטוקול לשיפור הגילוי בארכיונים דיגיטליים היסטוריים על ידי שילוב זיהוי תווים אופטי לאחר תיקון, סיווג מסמכים חזותיים, העשרת מטא-דאטה והערכת שליפה לתוך תהליך עבודה שניתן לביקורת.
ארכיונים דיגיטליים היסטוריים הופכים לניתנים לחיפוש יותר ויותר, אך הגילוי נשאר מוגבל כאשר שגיאות בזיהוי תווים אופטי, סוגי מסמכים הטרוגניים ויזואלית, ומטא-דאטה דלילה מטופלים בנפרד. מחקר זה נועד לפתח פרוטוקול שניתן לשחזר כדי להעריך האם תהליך עבודה שמרני של בינה מלאכותית רב-מודלית יכול לשפר את שליפת הארכיון מבלי להחליף את סקירת הארכיונאי. אוסף של 1,600 רשומות ארכיון דיגיטליות משמונה מחלקות מסמכים הורכב, ונעשה שימוש במדד של 420 שאילתות להשוואת חמישה תנאי שחזור: אינדוקס בסיסי, תיקון זיהוי תווים אופטי בלבד, סיווג חזותי בלבד, העשרת מטא-דאטה בלבד, ואינטגרציה מולטימודלית מלאה. תוצאות ברמת הרשומה כללו שיעור שגיאת תווים (CER), שיעור שגיאת מילים (WER), שליחת ישות בשם, דיוק סיווג סוגי מסמך, ביטחון תחזית, שלמות מטא-דאטה, והתאמה בין נושא לכותרת. תוצאות ברמת השאילתות כללו P@10, R@10, nDCG@10, זמן להגיע לתוצאה הרלוונטית הראשונה ושיעור חיפוש מוצלח. תיקון זיהוי תווים אופטי הפחית את ה-WER בצורה המשמעותית עבור מכתבים בכתב יד, פנקסים וספרי רישום; כיוונון חזותי שיפר את דיוק הסיווג בעיקר עבור מפות, פוסטרים, עיתונים וספרי רישום; והעשרת מטא-דאטה הגבירה את השלמות בכל התקופות ההיסטוריות. המצב הרב-מודלי המלא השיג את ביצועי השחזור הגבוהים ביותר (P@10 = 0.624, R@10 = 0.492, nDCG@10 = 0.634) והפחית את הזמן הממוצע לתוצאה הרלוונטית הראשונה מ-156.079 שניות ל-58.485 שניות. תוצאות אלו תומכות בזרימת עבודה מודולרית וניתנת לביקורת שבה טקסט, תמונה ואותות תיאוריים משולבים תחת סף מפורש וביקורת אנושית.
הארכיונים הדיגיטליים התרחבו במהירות וכיום תומכים במחקר בהיסטוריה, מורשת תרבותית, מנהל ציבורי ומדעי הרוח הדיגיטליים. עם זאת, הגישה נותרת לא אחידה מכיוון שרשומות ארכיוניות לעיתים קרובות משלבות ירידה בפלט זיהוי תווים אופטי, פריסות דפים מגוונות ויזואלית, שיטות קטלוג לא עקביות, ושמות, מקומות ומוסדות משתנים היסטורית. מגבלות אלו משפיעות לא רק על איכות השעתוק אלא גם על שליפה, סינון ושימוש חוזר באוספים דיגיטלייםבמורד הדרך 1,2,3,4,5,6,7.
מחקרים קיימים בבינה מלאכותית של מסמכים ושליפה ארכיונית שיפרו רכיבים בודדים כגון זיהוי תווים אופטי לאחר תיקון, סיווג תמונות-מסמך, נרמול מטא-דאטה, מידול נושאים, הטמעות, שליפה עצבית, ושיטות ממשל נתונים 8,9,10,11,12,13,14,15, 16,17,18,19,20,21,22,23,24,25. עם זאת, מערכות ארכיון רבות עדיין מעריכות רכיבים אלו בנפרד, מה שמקשה לקבוע האם תהליך עבודה משולב משפר את הגילוי בתנאי חיפוש ריאליסטיים. הפער המתודולוגי שמטופל כאן הוא היעדר פרוטוקול שניתן לשחזר וניתן לביקורת שמחבר מודולי טקסט, תמונה ומטא-דאטה לתוצאות שליפת בתהליך עבודה ארכיוני אחד.
המטרה המרכזית הייתה לבדוק האם תיקון זיהוי תווים אופטי, סיווג מסמכים חזותיים והעשרת מטא-דאטה מוגבלת בכללים מניבים שיפורים משלימים כאשר הם מוערכים מול אותו מדד שחזור.
השענו שהתנאי המולטימודלי המלא יעלה על כל תנאי חד-רכיבי, משום שגילוי ארכיוני תלוי באינטראקציה בין טקסט קריא, מבנה מסמך שניתן לפרש ויזואלית, ומטא-דאטה תיאורית ניתנת לחיפוש. תהליך העבודה תוכנן באופן שמרני: פלטים אוטומטיים יכלו להעשיר מדדי שחזור, אך תחזיות בביטחון נמוך סומנו לבדיקה במקום לשמש כתיאור ארכיוני סמכותי.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
מחקר זה השתמש ברשומות ארכיוניות דיגיטליות ובשאילתות שליפת מדומות כיחידות ניתוח. מאגרי ארכיון עשויים להגביל גישה לרשומות רגישות או מוגבלות תרבותית. פעלו לפי כללי גישה למאגר, נהלי אבטחת נתונים מוסדיים ודרישות הסרת זיהוי לפני עיבוד או שיתוף רשומות. לא נוצרה פסולת כימית, ביולוגית, חדה, רדיואקטיבית או פסולת מעבדתית מסוכנת על ידי תהליך העבודה הדיגיטלי הזה.
עיצוב מחקר ובניית קורפוס
איור 1 מציג את תהליך העבודה המלא של המחקר, כולל בניית קורפוס, תיוג רפרנס, עיבוד מוקדם של תמונה, יצירת OCR ותיקון לאחר תיקון, סיווג חזותי, העשרת מטא-נתונים, בניית אינדקס, הערכת שחזור, ניתוח סטטיסטי ואריזת שחזוריות.
בניית הקורפוס בוצעה מ-15 בינואר עד 30 באפריל 2025, ואחריה תכנון מערכת וניפוי שגיאות בין 1 במאי ל-31 באוקטובר 2025. הקורפוס כלל 1,600 רשומות ארכיוניות דיגיטליות שנבחרו משמונה מחסנים המייצגים מערכות מדינה, עירוניות, דתיות, מוזיאונים, אוניברסיטאות ומערכות ספריות. מסגרת הדגימה סווגה לפי מחלקת מאגר ומסמכים כדי לשמור על הטרוגניות ארכיונית בין מכתבים בכתב יד, פנקסים, מפות, עיתונים, תמונות עם כיתובים, פוסטרים, ספרי רישום ותכתובות מוקלדת.
לכל רשומת מועמד, יומן הבחירה רשם את מזהה המאגר או האוסף, מזהה הקטלוג, מחלקת המסמך, התקופה ההיסטורית המשוערת, הקשר השפה הדומיננטית, פורמט התמונה הזמין, רזולוציית התמונה, מספר העמודים ושדות תיאוריים בסיסיים. הכללה דרשה את כל הדברים הבאים: מזהה קטלוג יציב; לפחות תמונת עמוד אחת ב-TIFF, JPEG או PNG; רזולוציית תמונת המקור של לפחות 150 DPI; תוכן טקסטואלי, טבלאי או מבני מסמכי קריא; והקצאה לאחת משמונה מחלקות המסמכים המוגדרות מראש. קריטריוני ההחרגה היו שכפולים מדויקים, דפים ריקים לאחור, תמונות שנחתכו עד כדי כך שיותר מ-30% משטח הטקסט חסר, ורשומות שנמצאו בלתי קריאות לאחר בדיקה ידנית.
מדד השליפה כלל 420 שאילתות קצרות בשפה טבעית שנוצרו בין 5 באוגוסט ל-20 באוגוסט 2025. יצירת השאילתות התבצעה לפי תבנית שניתן לשחזר: צורכי המידע של המועמדים נלקחו מאנשים, מוסדות, מקומות, טווחי תאריכים, עיסוקים, אירועים ונושאים אקטואליים; כל שאילתה נורמל ל-2–9 מילים; ורשומות רלוונטיות זוהו לפני השוואת המערכת. כל שאילתה הוערכה תחת חמישה תנאי שחזור, והניבו 2,100 תצפיות תנאי שאילתה תואמות.
תיוג עיון ובקרת איכות
תיוג המקורות בוצע בין 1 במאי ל-15 ביולי 2025 על ידי שלושה מעריצים: שני אנשי צוות ארכיון בעלי ניסיון בקטלוג תיאורי ואחד חוקר מדעי הרוח הדיגיטליים המנוסה בהערכת מסמכים היסטוריים. מדריך ההערות הגדיר מחלקות מסמכים, קטגוריות לקשר-שפה, תיבות תקופות היסטוריות, שדות שלמות מטא-דאטה, קטגוריות ישות בשם וכללים לבחירת אזורי הערכת OCR.
לצורך הערכת OCR, המערחים בחרו אזורים ייצוגיים הנושאים טקסט שכללו כותרות, שמות, תאריכים, מונחים מוסדיים, הערות שוליות, רשומות טבלאות, וכאשר קיימים, אזורי פריסה רועשים. כאשר עמוד הכיל מספר אזורי טקסט, האזור הנבחר היה חייב להיות רלוונטי לשחזור וחייב לכלול מספיק תווים לחישוב CER ו-WER. המחלוקות הופתרו תחילה באמצעות דיון בין שני המפרשים הראשיים; מקרים לא פתורים נפטרו על ידי חוקר מדעי הרוח הדיגיטליים.
בקרת איכות השתמשה בתת-קבוצה אקראית של 12% של רשומות. ההסכמה בין המפרשים לסוג המסמך הראשי הייתה כהן קאפה = 0.86, מה שתומך בהסכמה מהותית. יומן השיפוט שמר על התוויות המקוריות והסופיות, קטגוריית אי-ההסכמה וסיבת הפתרון כדי שמשתמשים עתידיים יוכלו לבדוק הגדרות מחלקות ומקרים קיצוניים.
עיבוד מוקדם של תמונה
כל התמונות עובדו ברמת הרשומה באמצעות Python 3.11.8 עם OpenCV 4.9.0, Pillow 10.3.0 ו-NumPy 1.26.4. כל עמוד קלט הומר לגווני אפור של 8 ביט, אלא אם הצבע נשא מידע סמנטי, כגון מפות, פוסטרים, חותמות או הערות מקודדות בצבעים. ההטיה הוערכה באמצעות פרופילי הקרנה וזיהוי קווי הוג; Deskewing הוחל רק כאשר זווית ההטיה האבסולוטית עלתה על 1.5 מעלות והוגבלה ל-8.0 מעלות כדי למנוע עיוות.
שיפור הניגודיות השתמש באקוליזציה אדפטיבית עם היסטוגרמות אדפטיבית מוגבלת ניגודיות עם clipLimit = 2.0 ו-tileGridSize = 8 × 8. מסנן חציוני עם גרעין 3 × 10−23 הוחל רק כאשר יחס רעש הרקע-רקע המשוער עלה על 0.35. תמונות שצולמו ב-150–299 dpi נדגמו מחדש ל-300 dpi לזיהוי תווים אופטי; תמונות שכבר היו ב-300 dpi ומעלה לא הוגדלו. לא נעשה שימוש בסופר-רזולוציה, שיקום גנרטיבי או הזיות תוכן.
דליפה דרך, כהיית הקצוות, מרקם נייר לא אחיד, חותמות שוליות, כתב יד, קווים מסודרים וגבולות טבלאות נשמרו אלא אם כן מנעו בחירת אזורי OCR. כלל זה שמר על ראיות ארכיוניות תוך סטנדרטיזציה מספקת של קלטי התמונה לצורך OCR וסיווג שניתן לשחזר.
יצירת בסיסים ב-OCR ותיקון לאחר
OCR בסיסי נוצר באמצעות Tesseract OCR 5.3.0. חבילת השפה הראשית נבחרה מתוך שפת הקטלוג והכתב הנראה; פענוח רב-לשוני הופעל כאשר שפת הקטלוג וסקריפט הדף לא התאימו. פלטי OCR אוחדו ברמת הרשומה ונשמרו עם מזהי עמודים, ביטחון OCR, קואורדינטות תיבת הגבול כאשר זמינות, וטקסט גולמי לפני תיקון.
תיקון לאחר OCR השתמש בהליך שמרני בן שלושה שלבים. ראשית, נורמליזציה ברמת תווים תיקנה בלבולים תכופים בזיהוי היסטורי, כולל ליגטורות, החלפות s/s-s ארוכות, פיסוק מקוטע והחלפות אותיות ספרתיות. שנית, תיקון ברמת הטוקן השתמש במועמדים מדורגים לפי מרחק עריכה ותדירות מתוך לקסיקון ייחודי לארכיון של שמות אישיים, שמות מקומות, מוסדות, מונחים מנהליים וגרסאות איות היסטוריות. שלישית, בדיקות רצף מבוססות כללים מאמתות ישויות ותאריכים בשם מול ראיות מהקשר ומטא-דאטה.
מחליפים התקבלו רק כאשר ביטחון התיקון האחורי עלה על 0.80; החלפת ישויות בשם דרשה ביטחון של לפחות 0.85. מועמדים מתחת לסף נשמרו כטקסט OCR אך סומנו לבדיקה. CER חושב כמרחק העריכה של לבנשטיין חלקי מספר התווים בתמלול ההפניות. WER השתמשה באותה נוסחה ברמת האסימון. שחזור ישות בשם חושב כישויות ייחוס שזוהו נכון, מחולקות לכל ישויות ההתייחסות באזור ההערכה הנבחר.
סיווג מסמך חזותי
מודול הסיווג הוויזואלי הקצה כל רשומה לאחת משמונה סוגי מסמכים ארכיוניים: מכתב בכתב יד, פנקס, מפה, עיתון, צילום עם כיתוב, פוסטר, ספר רישום והתכתבות מוקלדת. סוג המסמך החזוי שימש כאות שלילוף וסינון, ולא כתחליף סמכותי לקטלוג ארכיוני.
המודל יושם ב-PyTorch 2.2.2 וב-Torchvision 0.17.2 באמצעות עמוד שדרה EfficientNet-B3 מאומן מראש על ידי ImageNet. תמונות ממוזערות ברמת השיא שונו לגודל 384 על 384 פיקסלים. כדי להפחית דליפה, הרשומות חולקו לפי מאגר ומחלקת מסמכים לקבוצות אימון, אימות ובדיקות ביחס של 70:15:15, התואם לכ-1,120, 240 ו-240 רשומות.
האימון השתמש ב-AdamW עם קצב למידה התחלתי = 1 × 10-4, דעיכת משקל = 1 × 10−2, גודל אצווה = 16, החלקת תווית = 0.05, והפסקה מוקדמת כאשר אובדן האימות לא השתפר במשך חמש תקופות רצופות. הפיכה אופקית הושבת כי פריסות ארכיון מראות אינן ריאליסטיות. ההגברה הוגבלה לסיבוב מ-3- מעלות עד +3 מעלות ושינוי בהירות בטווח של ±10%.
אבחון מודלים ברמת אפוק מסוכם ב-20 שורות אימון, שכל אחת מהן כוללת אובדן אימון, אובדן אימות, דיוק אימון, דיוק אימות, מאקרו-F1, משקלל-F1, ROC-AUC ו-PR-AUC.
תהליך העשרת מטא-נתונים
העשרת מטא-דאטה נועדה לשפר את הגילוי תוך שמירה על שמרנות ארכיונית. ערכי הקטלוג הקיימים נשמרו אלא אם כן הכילו סתירה מפורשת, כגון תאריך בלתי אפשרי או סתירה מסוג מסמך שאושר הן על ידי OCR והן על ידי ראיות חזותיות. שדות העשרת המועמדים כללו כותרת מנורמלת, סוג מסמך, תאריך משוער, אזכורים למוסד, אזכורים גאוגרפיים, אזכורים לשמות פרטיים, כותרות נושא ומילות מפתח.
עדיפות הראיות הייתה לפי סדר קבוע: (1) מטא-נתונים קיימים של הקטלוג, (2) פלט OCR מתוקן, ו-(3) חיזוי חזותי מסוג מסמך. התאמת אוצר מילים מבוקרת שימשה לכותרות נושאים, והרחבת סמנטיקה של שכנים קרובים עם טרנספורמרים 2.7.0 שימשה רק כאשר דמיון הקוסינוס היה לפחות 0.72. נרמול תאריך דרש ביטחון של לפחות 0.85 או התאמה בין OCR למטא-נתונים. כל שדה שהתווסף אוטומטית שמר על המקור, הביטחון ומזהה הכללים שלו.
שלמות מטא-דאטה הוגדרה כמספר שדות הליבה התיאוריים המאוכלסים חלקי מספר שדות הליבה הרלוונטיים לרשומה זו. התאמת נושא לכותרת הוגדרה כנוכחות לפחות תווית נושא אחת עם אוצר מילים מבוקר, הנתמכת על ידי ראיות תוכן ברמת שיא ונחשבה רלוונטית לקטגוריית השאילתה.
בניית מערכת שליפה
נבנו חמישה אינדקסי שליפה כדי לבודד תרומות למודולים: אינדוקס בסיסי; תיקון זיהוי תווים אופטי בלבד; סיווג חזותי בלבד; העשרת מטא-דאטה בלבד; ואינטגרציה מולטימודלית מלאה. כל האינדקסים נבנו בתוכנת מנועי החיפוש המופיעה בטבלת החומרים (גרסה 8.11.1) ברמת שיא. פרמטרי BM25 היו קבועים ב-k1 = 1.2 ו-b = 0.75 לפני ההערכה.
אינדקס הבסיס השתמש במטא-דאטה מקורי ובטקסט OCR בסיסי. מצב ה-OCR החליף את ה-OCR הבסיסי ב-OCR מתוקן. המצב הוויזואלי הוסיף קודמים מסוג מסמך ושיפורי דירוג מודעים למחלקה. תנאי המטא-דאטה הוסיף שדות תיאוריים מועשרים. המצב הרב-מודלי המלא שילב OCR מתוקן, עדכונים חזותיים ומטא-דאטה מועשר. משקלי השדה נקבעו לפני הבדיקה: כותרת מנורמלת = 3.0, כותרות נושאים = 2.5, אזכורים של אדם ומוסד = 2.2, אזכורים למקום = 2.0, סוג מסמך = 1.8, טקסט גוף OCR מתוקן = 1.0, וטקסט גוף OCR בסיסי = 0.8, כאשר רלוונטי.
התאמת ביטוי מדויקת הופעלה עבור שאילתות מצוטטים. הרחבת השאילתות הותרה רק בתנאי העשרת מטא-דאטה ורב-מודליים מלאים, והוגבלה למילים נרדפות מבולטות וכותרות נושא מקובלות וכותרות נושא. יומני חיפוש נוצרו מ-25 באוגוסט עד 28 באוגוסט 2025, בסביבת לינוקס מכולת המופיעה בטבלת החומרים, עם זרעים קבועים ותצורות אינדקס קפואים.
עיצוב שאילתות ומדדי תוצאה
420 השאילתות ייצגו התנהגויות חיפוש ארכיוניות נפוצות ולא הנחיות מדד המבוססות רק על מילות מפתח. הנושאים כללו שמות אישיים, מוסדות, מקומות, תאריכים וטווחי תאריכים, עיסוקים, אירועים ונושאים נושאיים. כל שאילתה נשמרה עם הניסוח המנורמל, קבוצת רשומות היעד, קטגוריית נושא השאילתה, וציון הקושי.
רמת הקושי נמדדה לפני השליפה באמצעות עמימות המטרה, ספציפיות לקסיקלית ותדירות הביטוי הצפויה. ציונים משולבים מתחת ל-0.40 סווגו כקושי נמוך, ציונים בין 0.40–0.69 לקושי בינוני, וציונים של 0.70 ומעלה כקושי גבוה. שיפוטי רלוונטיות הושלמו לפני השוואת מערכות ואז נבדקו מול האוסף הסופי.
תוצאות השליפה כללו P@10, R@10, nDCG@10, זמן לתוצאות הרלוונטיות הראשונות ושיעור חיפוש מוצלח. P@10 היה החלק מהעשרת האלבומים המובילים שנחשב רלוונטי. R@10 היה החלק של כל השיאים הרלוונטיים הידועים שנאספו בעשירייה הראשונה. nDCG@10 השתמשו ברלוונטיות מדורגת כאשר הייתה קיימת וברלוונטיות בינארית אחרת. הזמן עד התוצאה הרלוונטית הראשונה נמדד מהגשת השאילתה ועד להופעת הרשומה הרלוונטית הראשונה בתוצאה המדורגת. חיפוש מוצלח הוגדר כלפחות תוצאה רלוונטית אחת מתוך עשרת הרשומות המובילות.
איסוף סטטיסטיקות
כל הניתוחים בוצעו באמצעות גרסאות התוכנה המפורטות בטבלת החומרים. תוצאות רציפות סוכמו כממוצע ± SD כאשר בערך סימטרי וכחציון עם טווח בין-רבעוני. התוצאות הקטגוריות סוכמו כספירות ואחוזים.
נורמליות ההבדלים הזוגיים הוערכה באמצעות מבחן שפירו-וילק וגרפים של התפלגות. תוצאות OCR ומטא-דאטה לפני/אחרי הושוו לבדיקות T זוגיות כאשר ההבדלים הזוגיים היו בערך תקינים ובדיקות דירוג חתום של וילקוקסון לעומת זאת. ביצועי הסיווג לפני ואחרי הכוונון המדויק הושוו באמצעות מבחן מקנמר על תוויות מזווגות נכונות/שגויות. תוצאות השליפה הרב-זרועיות שהותאמו הושוו למבחן פרידמן, ואחריו מבחני דירוג חתום וילקוקסון מותאמים על ידי הולם.
כל המבחנים הסטטיסטיים היו דו-זנביים, ו-P < 0.05 נחשב מובהק סטטיסטית. טווחי האמון הוערכו באמצעות 2,000 דגימות אתחול עם הזרע האקראי שנקבע ב-2025. ההשפעות דווחו כהבדלי ממוצע, יחס סיכויים תואמים או גודל השפעה מבוססי דרגה בהתאם לסוג התוצאה.
שחזוריות, היקף וזמינות משאבים
כל פרמטרי הצינור נקבעו לפני בדיקות השחזור. אף פרמטר לא אופטימיזם על מדד השחזור שהוחזק. קבצי קונפיגורציה, אוצר מילים מבוקר, טבלאות לקסיקונים, תבניות שאילתה, מיפוי שדות, הנחיות להערות, סקריפטים סטטיסטיים וסקריפטים ליצירת איורים נשמרו במערכת בקרת הגרסאות המופיעה בטבלת החומרים עם זרע אקראי 2025.
כדי לתמוך באימות עצמאי, חוברת נתוני המקור כוללת טבלה של 1,600 רשומות שאינה מזוהה עם 17 משתנים המשמשים לזיהוי תווים אופטי, מטא-דאטה וניתוחי סיווג ויזואליים. טבלה נגזרת 1, טבלה 2, טבלה 3, טבלה 4 וטבלה 5, סיכומי מקורות איור, הגדרות שאילתות מדד, סיכומי שיפוט רלוונטיות, תחליפים ביומן שליפה, אבחון אימונים, קטגוריות לקסיקונים, כללי מיפוי אוצר מילים, ושדות הנחיות להערות מסופקים כטבלאות או קבצי חומרים נפרדים להעלאה כאשר רלוונטי. חומרים שאינם יכולים להיות משותפים לציבור עקב מגבלות מאגר מיוצגים על ידי שדות מטא-דאטה שאינם מזוהים ושדות דגימה ניתנים לשחזור.
פרוטוקול זה מעריך גילוי ממוקד שליפה במקום את האמת של טענות היסטוריות. הוא אינו מחליף את הערכת הארכיונאי, הערכת המקור, סקירת פרטיות או כללי גישה ספציפיים למאגר.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
תיקון OCR שיפר את התמלול, במיוחד ברשומות בכתב יד ובטבלאות
תיקון זיהוי תווים אופטי שיפר את איכות התמלול בכל שמונת מחלקות המסמכים הארכיוניים (n = 1,600 רשומות). ממוצע WER ירד מ-0.529 ± 0.172 ל-0.384 ± 0.123, עם שינוי זוגי ממוצע של −0.144 (רווח בר-סמך 95%, −0.149 ל-−0.139; וילקוקסון חתם בדירוג P < 0.001). ממוצע CER ירד מ-0.377 ± 0.126 ל-0.258 ±-0.086, עם שינוי זוגי ממוצע של −0.119 (רווח בר-סמך 95%, −0.123 ל-−0.116; וילקוקסון חתם בדירוג <...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
פרוטוקול זה מראה כי הגילוי בארכיונים דיגיטליים היסטוריים השתפר בעיקר כאשר תיקון OCR, הבנת מסמכים חזותיים והעשרת מטא-נתונים שמרנית הוערכו כרכיבי שליפה מחוברים ולא כשדרוגים טכניים מבודדים. הרווחים הגדולים ביותר ב-OCR התרחשו בחומרים בכתב יד, טבלאי ורישום, מה שתומך בערך של תיקון לאחר תיקון עבור מחלקות מסמכים שבהן הזיהוי הבסיסי חלש ביותר. במקביל, שגיאה שאריתית לאחר תיקון מראה שניקוי OCR אינו יכול להיחשב כתמלול סופי וחייב להישאר ניתן לביקורת.
תוצאות הסיווג החזותי דו...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
למחברים אין מה לחשוף.
המחברים מודים בכנות לשני אנשי הצוות המנוסים בארכיון ולחוקר המדעי הרוח הדיגיטליים המקצועי על עזרתם היקרה בהערות טקסט ובקרת איכות. מחקר זה נתמך כלכלית על ידי תוכנית פרויקט המדע והטכנולוגיה של ארכיון מחוז ג'יאנגסו (מענק מס' 2024-9) לבניית מערכת ארכיונים אוראלית מבוססת דיבור חכמה, ועל ידי תוכנית פיתוח המדע והטכנולוגיה של מחוז ג'יאנגסו לרפואה סינית מסורתית (מענק מס' MS2025025) ללימוד הירושה וההתפתחות של בתי הספר לרפואה הסינית הסינית מנקודת מבט ארכיונית.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| Python | קרן תוכנת Python | v3.11.8; https://www.python.org/ | סקריפט זרימה, עיבוד נתונים, תיקון פוסט של זיהוי תווים אופטי ותמיכה סטטיסטית |
| R | קרן R לחישוב סטטיסטי | v4.3.3; https://www.r-project.org/ | ניתוח סטטיסטי ויצירת דמויות סופיות |
| Tesseract OCR | פרויקט Tesseract OCR | v5.3.0; https://github.com/tesseract-ocr/tesseract | יצירת זיהוי תווים אופטי בסיסי |
| חבילות שפה של Tesseract | פרויקט Tesseract OCR | חבילות שפה ספציפיות למחקר; https://github.com/tesseract-ocr/tessdata | פענוח זיהוי תווים אופטי ראשוני ומעורב-שפות |
| OpenCV | צוות OpenCV | v4.9.0; https://opencv.org/ | הסרת הטיה, אומדן רעש ועיבוד מוקדם של תמונות |
| Pillow | תורמי ספריית התמונות של Python | v10.3.0; https://python-pillow.org/ | קלט/פלט תמונות ונורמליזציה של פורמט |
| NumPy | מפתחי NumPy | v1.26.4; https://numpy.org/ | חישוב מערכים לעיבוד תמונות ומטריקות |
| pandas | צוות הפיתוח של pandas | v2.2.2; https://pandas.pydata.org/ | טיפול בנתונים טבלאיים וייצוא סיכומים |
| SciPy | מפתחי SciPy | v1.13.1; https://scipy.org/ | מבחנים סטטיסטיים וכלי חישוב מספריים |
| statsmodels | מפתחי statsmodels | v0.14.2; https://www.statsmodels.org/ | מודלים סטטיסטיים ותמיכה בהשוואות זוגיות |
| scikit-learn | מפתחי scikit-learn | v1.4.2; https://scikit-learn.org/ | מדדי סיווג, אבחונים ROC/PR וכלי אימות |
| rapidfuzz | Max Bachmann ותורמים | v3.9.0; https://github.com/rapidfuzz/RapidFuzz | דירוג מועמדים בעזרת מרחק עריכה לתיקון זיהוי תווים אופטי |
| spaCy | Explosion AI | v3.7.4; https://spacy.io/ | עיבוד ישויות ממוינות עם טבלאות לקסיקון מותאמות אישית |
| PyTorch | קרן PyTorch | v2.2.2; https://pytorch.org/ | אימון מסווג מסמכים חזותיים |
| torchvision | קרן PyTorch | v0.17.2; https://pytorch.org/vision/ | יישום EfficientNet-B3 ותמורות תמונות |
| בסיס EfficientNet-B3 | משקלות מוכוונים מראש של torchvision / ImageNet | EfficientNet-B3; https://pytorch.org/vision/stable/models/efficientnet.html | בסיס לסיווג מסמכים חזותיים |
| sentence-transformers | UKP Lab / מערכת האקולוגית של Hugging Face | v2.7.0; https://www.sbert.net/ | הרחבה סמנטית עבור מועמדים עם אוצר מילים מבוקר |
| תוכנת מנוע חיפוש | Elastic | Elasticsearch v8.11.1; https://www.elastic.co/elasticsearch | אינדקס, אחזור ודירוג של BM25 |
| מנוע מיכולות | Docker Inc. | Docker v26.1.1; https://www.docker.com/ | סביבת אחזור מכולות |
| מערכת הפעלה לינוקס | Canonical | Ubuntu 22.04 LTS; https://ubuntu.com/ | סביבת הפעלה קבועה להפעלות אחזור |
| מערכת בקרת גרסאות | פרויקט Git | Git v2.44.0; https://git-scm.com/ | בקרת גרסאות עבור תצורה, אוצר מילים, סקריפטים וקוד דמויות |
| ggplot2 | tidyverse | v3.5.1; https://ggplot2.tidyverse.org/ | עיבוד דמויות מבוסס R |
| Matplotlib | מפתחי Matplotlib | v3.8.4; https://matplotlib.org/ | ויזואליזציות משלימות וגרפים להבטחת איכות |
| הנחיות ביצוע אנוטציות | מחברים | 5 חלקי אנוטציות; 8 תוויות סוגי מסמכים; אזורי OCR; תוויות ישויות; שיפוטי רלוונטיות; כללי פסיקה | הגדרות עבור סוגי מסמכים, אזורי OCR, ישויות, שיפוטי רלוונטיות ופסיקה |
| אוצר מילים ספציפי לארכיון | מחברים | 6 קטגוריות אוצר מילים: גרסאות של אנשים, שמות מקומות, שמות מוסדות, דפוסי תאריכים, מונחים מינהליים, קיצורים | שמות, מקומות, מוסדות, מונחים מינהליים ווריאציות איות |
| מיפוי אוצר מילים מבוקר | מחברים / מאגרי ארכיון | 5 כללי מיפוי המקשרים ישויות OCR, סיווג ויזואלי, מילות מפתח של כותרת, כיסוי תאריכי ונושא שאילתה לשדות מטא נתונים | התאמה של כותרת נושא ורחבה סמנטית |
| קבוצת שאילתות מדד | מחברים | 420 שאילתות מדד; 6 נושאי שאילתות; 3 רמות קושי; 8 סוגי מסמכי יעד; 4 תקופות היסטוריות; 6 הקשרים לשוניים | מדד אחזור תואם על פני חמישה זרועות מערכת |
| שיפוטי רלוונטיות | מחברים |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.