מאמר מחקר

מערכת מענה לשאלות סמנטיות בתחום סגור כמקרה שימוש של מודלים מבוססי BERT מבוססי שנאי

DOI:

10.3791/69424

14 בנובמבר 2025

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מתכנן מערכת למידה אדפטיבית לחילוץ ידע מטקסט כדי לענות על שאלות, תוך השוואה בין מודל Google-BERT, DistilBERT, RoBERTa ו-TF-IDF, תוך שימוש בדמיון קוסינוס, על חביון והכללה סמנטית. Google-BERT מתפקדת בצורה הטובה ביותר, אם כי המערכת נותרה רגישה לשגיאות כתיב, ומדגישה את הצורך בעיבוד מקדים חזק ליישום מעשי.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כדי לחלץ ידע מקבצי טקסט ולענות על שאלות המשתמשים על ידי מציאת המידע הנכון בהקשר, מערכת למידה אדפטיבית, כגון מערכת מענה לשאלות (QAS), מיועדת למטרה זו. התמקדות זו מעודדת לימוד נוסף על מערכות תשובה ישירה ושימוש במבחנים בקנה מידה גדול למשימות מענה לשאלות (QA). כדי להקל על כך, מערך נתונים סמנטי של QA בתחום סגור (SCD-QA), המקיף שאלות עובדתיות ולא עובדתיות כאחד, משמש בשילוב עם מודלים של שנאים מאומנים מראש. במחקר זה, היכולת להסיק מסקנות נמדדת ומושווה בין שלושה מודלים של שנאים מאומנים מראש, כמו Google-BERT, DistilBERT ו-RoBERTa, על מערך הנתונים של SQuAD, ומודל TF-IDF קלאסי מבוסס מילות מפתח עם דמיון קוסינוס. התוצאות מראות ש-Google-BERT משיגה את הביצועים הטובים ביותר, עם ציון התאמה מדויקת ממוצע (EM) של 90.0 וזמן אחזור ממוצע של 1.27 שניות. המערכת גם מתפקדת היטב בשאלות עם מילים נרדפות, ומראה הבנה חזקה של משמעות. אך הוא אינו מתפקד כראוי בשאלות עם שגיאות כתיב, מה שמצביע על כך שהוא רגיש לשגיאות כתיב ודורש עיבוד מוקדם טוב יותר בשימוש.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עיבוד שפה טבעית (NLP) הוא תת-תחום של בינה מלאכותית (AI) שבו ניתן לבנות QAS, המאפשר למערכות מחשב לייצר באופן אוטומטי תשובות לשאלות1. NLP מתמקד בעיקר בהבנה ופרשנות של שפה כתובה באופן המדמה את התהליכים הקוגניטיביים של המוח האנושי2. העיסוק במשימות אלה מבסס את ה-NLP כטכניקה מרכזית בבניית מערכת המסוגלת לייצר תגובות דמויות אנושיות.

QAS, שעונה לשאלות המשתמש, היא דוגמה אחת לאופן השימוש ב-NLP3. QAS הוא תחום מחקר המשלב מחקרים מתחומים שונים עם נושאים נפוצים, כגון אחזור מידע (IR), חילוץ מידע (IE) ו-NLP. נכון לעכשיו, מנועי חיפוש עכשוויים מבצעים בעיקר משימות אחזור מסמכים4. במילים אחרות, כאשר הם מסופקים עם מילות מפתח ספציפיות, מנועי חיפוש אלה מניבים אך ורק רשימה של מסמכים רלוונטיים המדורגים על סמך רלוונטיות ומכילים את מילות המפתח שצוינו. הם לא מספקים תשובה מדויקת. מטרת QAS היא לסייע לאנשים באיתור תשובות מדויקות לשאילתות מסוימות בתחומי נושא מוגבלים5. ניתן לבצע את הקיבוץ של QAS על סמך הקטגוריות הבאות המפורטות באיור 1, 6. גם ה-QAS העובדתי וגם הלא-עובדתי פועלים באמצעות שפה טבעית (NL) ונועדו לענות על שאלות המוצגות ב-NL. המערכת משתמשת בטכניקות NLP כדי לספק תשובות על בסיס קורפוס7 הזמין.

איור 1
איור 1: סיווג מערכות QA. האיור ממחיש מפת חשיבה של המרכיבים העיקריים של מערכת QA. במרכז נמצאת מערכת QA, המטפלת בסוגים שונים של שאלות, כולל עובדות, לא עובדות, היברידיות, חזותיות, שיחה ושאלות רב ברירה. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

מחקר זה מציג מערכת סמנטית למענה על שאלות דומיין סגור (SCD-QA) למענה למשתמשים ב-NL לגבי מדיניות ונהלי קבלה לדוקטורט. המערכת משתמשת בכללים ובתקנות PDF8 של הדוקטורט כהקשר הליבה שלה ומיישמת את מודל המקודד הדו-כיווני מבוסס השנאים (BERT)9 כמסגרת העיקרית ליצירת תגובות. המטרה היא לעצב QAS מבוסס שאלות נפוצות מבוססות שיחה סמנטית המספק תשובות מדויקות לשאלות נפוצות, מה שמקל על סטודנטים שהתקבלו לאחרונה למצוא במהירות את המידע החיוני הדרוש להם.

כדי להשיג מטרה זו, נעשה שימוש בשלושה מודלים ידועים של BERT מבוססי שנאי: Google-BERT9, DistilBERT10,11 ו-RoBERTa12,13, כולם הוכשרו על מערך הנתונים של סטנפורד למענה על שאלות (SQuAD)14. הביצועים שלהם הוערכו באמצעות שני פרמטרים קריטיים: התאמה סמנטית, שנמדדה על ידי התאמה מדויקת (EM)14, ומודלחביון 15, שנותח לפי זמני תגובה ממוצעים. בנוסף, נעשה שימוש במסד נתונים וקטורי (VD)16,17 לאחסון הטמעות סמנטיות, מה שמקל על אחזור ההקשר הרלוונטי ביותר מבחינה סמנטית לשאלת משתמש על סמך ציוני דמיון סמנטי.

סקירת ספרות

מודלים מבוססי שנאים שינו את תחום ה-NLP, והניבו שיפורים משמעותיים ב-QAS. הצגת BERT9 הדגישה היטב את ארכיטקטורות השנאים כמרכיב חיוני בפיתוח QAS חזק ומדויק. בחלק זה, מוצגת סקירה מקיפה של השיפורים האחרונים במודלים מבוססי שנאים והטמעות סמנטיות, תוך התמקדות ברלוונטיות שלהם ל-QA של דיאלוג שיחה סמנטי (SeCD). ניתוח השוואתי מבוצע כדי להצדיק את שילובם של מודלים אלה בעבודה זו, תוך שימת דגש על כדאיותם להניע תובנות משמעותיות בתחום.

ארכיטקטורות מבוססות שנאים כמו BERT, DistilBERT ו-RoBERTa משתמשות במתודולוגיית תשומת לב עצמית כדי ללכוד קשרים קונטקסטואליים מורכבים בטקסט, מה שהופך אותם לאידיאליים עבור משימות הדורשות הבנה סמנטית משמעותית, כגון QAS. מודלים אלה, יחד עם שנאי משפטים מיוחדים, מייצרים הטמעות סמנטיות, עוזרים לאפשר אחזור הקשר מהיר ומדויק באמצעות חיפושי דמיון מבוססי וקטור ב-SeCD QA. המחקר האחרון מתמקד בשיפור מודלים אלה ובהטמעת טכניקות כדי להגביר את התפוקה, המדרגיות והיעילות, במיוחד עבור שימושים ספציפיים למשימה כמו SCD-QA.

סנגופטה ואחרים הציגו גישה יצירתית להגברת QAS רב ברירה (MCQAS) לשאלות מבוססות מדע על ידי כוונון עדין של מודלים של BERT. במסגרתם, הם העריכו תחילה דמיון סמנטי מבוזר בין זוגות השאלות-תשובות ולאחר מכן הזינו את ציוני הדמיון הללו, יחד עם תכונות מקוריות, לשכבת סיווג. גישה משולבת זו השיגה ציון F1 של 90.2% במערך הנתונים של SciQ, מה שמדגיש את היעילות של BERT ב-QAS ספציפיים למשימה הדורשים הבנה ניואנסית וסיווג מדויק.

Cichecki et al.19 השוו את ChatGPT ומודלים מכווננים של BERT עבור מערכות תמיכה בעיצוב חכם ומצאו שמודלים מכווננים של BERT מצטיינים במודלים של שפה גדולה למטרות כלליות (LLMs) כמו ChatGPT במשימות ספציפיות לתחום, ומשיגים ציון F1 של 88.5% במערך נתונים מעוצב בהתאמה אישית. המחקר מראה את החשיבות של כוונון עדין ספציפי לתחום לשיפור ביצועי המודל ביישומים מיוחדים.

Guo et al.20 בחנו את היעילות של אסטרטגיות כוונון עדינות ספציפיות למשימה עבור QAS תחת תקציבי הערות מוגבלים. עבודתם חשפה כי גישת כוונון עדין כפול - בתחילה על מערך נתונים כללי של QA כגון SQuAD, ולאחר מכן כוונון עדין על מערך נתונים ספציפי למשימה - משיגה התקדמות משמעותית של 15% בציון F1 במערכי נתונים כמו COVID-QA. ממצא זה מדגיש את התפקיד הקריטי של כוונון עדין רציף בשיפור הביצועים של SeCD QASs.

Pudasaini ו-Shakya21 בחנו את היישום של מודלים מכווננים של BERT ל-QA במאמרים מחקריים ביו-רפואיים, ודיווחו על ציוני EM ו-F1 של 83.89% ו-89.67%, בהתאמה, על מערך נתונים ביו-רפואי מותאם אישית שמקורו ב-PubMed. על ידי מינוף למידת העברה עם PubMedBERT, הטכניקה שלהם הדגימה יכולת בולטת לעבד שאילתות ביו-רפואיות מורכבות, תוך הדגשת הפוטנציאל של כוונון עדין ספציפי למשימה בתחום זה.

Baek et al.22 הציעו את מסגרת Knowledge-Augmented Language Prompting עבור QA של גרף ידע אפס (KG). גישה זו משתמשת בדמיון סמנטי כדי לאחזר עובדות רלוונטיות מ-KG ומשלבת אותן בשאלת הקלט. כתוצאה מכך, היא השיגה ציון F1 של כ-85% במערכי הנתונים של KG-QA. העבודה ממחישה את הפוטנציאל של שילוב KGs ומודלים של שנאים, ומדגישה את היתרונות של הגדלת הידע בשיפור ביצועי QA.

Hu et al.23 תיארו QAS המיועד לתחום רישום משקי הבית, תוך מינוף KG לצד מודלים מבוססי BERT (RoBERTa-BiLSTM-MultiHeadAttention) לסיווג כוונות וניתוח סמנטי. על ידי פישוט שאלות לישויות של אירוע יחיד וקשרי כוונה, זה השיג דיוק גבוה בשאילתות על נתונים מובנים. יתר על כן, יכולת ההרחבה של המתודולוגיה לתחומים אחרים מדגישה את הפוטנציאל שלה ליישום רחב ב-QAS מבוסס KG.

Luo et al.24 הציגו סכימה מבוססת BERT עבור מאגר ידע (KB) QA, המשלבת מודל גיזום רב-גרעיני (MGPM) עם תשומת לב מודעת ליחס. הגישה שלהם משיגה דיוק משמעותי של 94.4% ב-SimpleQuestions, 68.6% ב-WebQuestionsSP ו-63.7% ב-WebQuestions. תוצאות אלה מראות את היעילות של BERT במינוף דמיון סמנטי לשאילתות נתונים מובנות. בסך הכל, מחקר זה מדגיש את הפוטנציאל של מודלים מבוססי שנאי עבור KB-QA, במיוחד בתרחישים שבהם זיהוי מדויק של ישות וקשר חשוב.

Wu et al.25 עיצבו מסגרת ייצור מוגברת לאחזור עבור QA בניהול בנייה, עם התמקדות ספציפית בשאילתות בטיחות ותאימות. על ידי שילוב הטמעות סמנטיות מבוססות BERT עם מודל שנאי גנרטיבי ו-KG ספציפי למשימה, הגישה שלהם השיגה ציון F1 של 88.7% במערך נתוני QA הקשור לבנייה. מחקר זה מדגים את הפוטנציאל של שילוב הבנה סמנטית עם אחזור מבוסס KG כדי לשפר את הדיוק במערך נתוני QA ספציפי למשימה לניהול בנייה.

Peng et al.26 העריכו באופן שיטתי LLMs, כולל מודלים מבוססי BERT ו-GPT, עבור QA רפואי. על ידי שילוב ההבנה ההקשרית של BERT והיכולות הגנרטיביות של GPT, הם השתמשו בייצור מוגבר של אחזור וכוונון עדין ספציפי לתחום כדי להשיג ציון F1 של 86.2% על מערך נתונים מ-PubMed והערות קליניות. מחקר זה מדגיש את הפוטנציאל של מודלים אנסמבל לשפר את דיוק ההסקה בשירותי בריאות, כאשר הן ההקשר והן היצירה המדויקת הם קריטיים.

Gardazi et al.27 סקרו את השימוש ב-BERT במשימות NLP כגון QA, ניתוח סנטימנטים וזיהוי ישויות בשם (NER). הניתוח שלהם הראה שמודלים מכווננים של BERT משיגים ציוני F1 של 85%-92% במערכי QA ספציפיים למשימה כגון SQuAD. זה מראה ש-BERT מייצר באופן אמין הטמעות הקשריות יעילות ומוסיף KGs, מה שהופך אותו למתאים היטב עבור SeCD QAS.

מודלים מבוססי שנאי הפכו לבחירה המכרעת עבור SeCD QAS בשל יכולתם הייחודית ללכוד עיבוד רגיש להקשר, קנה מידה יעיל ולהסתגל למשימות ספציפיות לתחום. טבלה 1 ממחישה את היתרון המכריע הזה על ידי השוואת מודלים מבוססי שנאים עם שיטות חלופיות שנבחנו במחקר זה 18,20,22,23,24,25.

גישהפיצ'רים עיקרייםיתרונותמגבלותמדדי ביצועים (SQuAD)התאמת מקרה שימוש
מודלים מבוססי רובוטריקים (BERT, RoBERTa, DistilBERT)מידול הקשר דו-כיווני, תשומת לב עצמית, כוונון עדין על נתונים ספציפיים לתחום 16, 17, 19, 24, 25דיוק גבוה, הבנה סמנטית חזקה, ניתנת להרחבה עם מסדי נתונים וקטוריים 18, 20, 22, 24, 25עלות חישובית גבוהה יותר, דורשת הכשרה מוקדמת 17, 18EM: 80-90%, F1: 85-93% 16, 17, 19, 24, 25אידיאלי עבור תחום סגור (CD) -QA, מערכות שאלות נפוצות וחיפוש סמנטי 16, 17, 19, 20, 22, 24, 25
מערכות מסורתיות מבוססות כלליםכללים בעבודת יד, התאמת מילות מפתח 16עלות חישובית נמוכה, יישום פשוט 16מדרגיות מוגבלת, טיפול לקוי בשאילתות מורכבות 16, 18EM: 50–60%, F1: 55–65% 16QAS בסיסי עם נתונים מובנים 16
רשתות עצביות חוזרות (RNNs)עיבוד רציף, ארכיטקטורות LSTM/GRU 19ביצועים בינוניים עבור פעילויות רציפות 19מאבקים עם תלות ארוכת טווח, הסקה איטית יותר 19, 9EM: 65–75%, F1: 70–80% 19משימות NLP כלליות, פחות יעילות עבור CD-QA 19, 9
מערכות אחזור מבוססות מילות מפתחTF-IDF, אלגוריתמים BM25 18, 22שליפה מהירה, שימוש נמוך במשאבים 18, 22מוגבל להתאמה ברמת פני השטח, הבנה סמנטית לקויה 18, 22EM: 40–50%, F1: 45–55% 18, 22אחזור מסמכים, לא מתאים ל-QAS 18, 22 מדויק
רשתות עצביות קונבולוציוניות (CNNs)חילוץ מאפיינים מקומיים, שכבות קונבולוציוניות 25יעיל לסיווג טקסט קצר, הסקה מהירה 25הבנה הקשרית מוגבלת, פחות יעילה עבור QAS 25 מורכבEM: 60–70%, F1: 65–75% 25סיווג טקסט, לא אידיאלי עבור CD-QA 25
רשתות עצביות גרפים (GNNs)מידול מבוסס גרפים, חשיבה התייחסותית 20יעיל להסקת מסקנות מרובות דילוגים, לוכד קשרי גומלין של מסמכים 20מורכבות חישובית גבוהה, דורשת נתונים מובנים 20EM: 70–80%, F1: 75–85% 20QAS מרובה דילוגים, פחות מתאים ל-CD-QA 20 בהקשר יחיד
מערכות מבוססות גרף ידעייצוג ידע מובנה, קישור ישויות 21חזק לשאילתות נתונים מובנים, ממנף ידע חיצוני 21דורש גרפי ידע מובנים מראש, מוגבלים לישויות ידועות 21EM: 65–75%, F1: 70–80% 21QAS ספציפי לתחום עם נתונים מובנים 21
דגמים מוגברים עם תשומת לבמנגנוני קשב משופרים, עיבוד ממוקד הקשר 24התמקדות משופרת בקטעי טקסט רלוונטיים, דיוק גבוה 24עלות חישובית גבוהה יותר, מימוש מורכב 24EM: 85–90%, F1: 88–92% 24CD-QA מורכב, שאלות לא עובדתיות 24
דגמי שק המיליםייצוג מבוסס תדר מילים 22פשוט, קל משקל מבחינה חישובית 22הבנה סמנטית לקויה, לא יעילה לשאילתות מורכבות 22, 25EM: 35–45%, F1: 40–50% 22אחזור טקסט בסיסי, לא מתאים ל- QAS 22, 25
מודלים עצביים היברידיים (CNN+RNN)משלב עיבוד מקומי ורציף: 25מאזן בין הבנה מקומית להבנה הקשרית 25מורכבות בינונית, התמודדות עם הקשרים ארוכים 25EM: 68–78%, F1: 72–82% 25משימות NLP כלליות, התאמה בינונית ל-CD-QA 25
מודלים של שפה סטטיסטיתאסוציאציות מילים הסתברותיות 18מהיר לשאילתות פשוטות, שימוש נמוך במשאבים 18הבנה הקשרית מוגבלת, מדרגיות ירודה 18EM: 45–55%, F1: 50–60% 18QAS בסיסי, לא מתאים ל-CD-QA 18 מורכב

טבלה 1: השוואה בין מודלים מבוססי שנאי לגישות אחרות עבור QAS. הטבלה מספקת השוואה זו לצד זו של גישות שונות של מערכות QA, כולל מודלים מבוססי שנאים, מערכות מבוססות כללים, RNNs ואחרות. הוא מסכם את התכונות העיקריות שלהם, החוזקות, החולשות, הביצועים ב-SQuAD והמשימות שעבורן הם מתאימים ביותר, כגון CD-QA, חיפוש סמנטי וסיווג טקסט.

המטרה העיקרית של מחקר זה היא לשפר את הגישה של הסטודנטים למידע מוסדי על ידי פיתוח מערכות SCD-QA יעילות, ניתנות להרחבה ומדויקות ב-NLP. באופן ספציפי, מחקר אישור זה מיישם ומאמת מודלים מבוססי שנאים שהוכשרו מראש בתחום מדיניות הקבלה לדוקטורט. המטרה היא להדגים את יעילותם והיתכנותו המעשית על ידי שילוב התאמה סמנטית, הערכת חביון מודל ושליפה סמנטית מונעת VD. גישה זו מציעה ניתוח מעמיק למתן תשובות מדויקות וספציפיות לתחום בהקשר מוסדי ממוקד. איור 2 ממחיש את המסגרת האדריכלית ההוליסטית של המערכת.

איור 2
איור 2: סכימה כוללת של מערכת SCD-QA. האיור ממחיש תרשים זרימה של מערכת QA המשתמשת במודלים גדולים של שפה (LLM). זה מתחיל בקובץ הקשר ושאלת משתמש, המטופלים על ידי שלושה מודלים: Google-BERT, DistilBERT ו-RoBERTa, ומודל מבוסס מילות מפתח אחד: TF-IDF. המערכת מעריכה את הביצועים של כל דגם באמצעות רשימת בדיקה, ולאחר מכן בוחרת את הטוב ביותר על סמך התוצאות. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

בסיס תיאורטי מקיף

רכיב QAS: מסגרת ה-QAS מורכבת משלושה מקטעים, כפי שמוצג באיור 3: i) מודול עיבוד שאלות (QPM), ii) מודול עיבוד מסמכים (DPM) ו-iii) מודול חילוץ וניסוח תשובות (AEFM). המערכת מקבלת שאלות המתחלקות לשתי קטגוריות עיקריות: עובדה ולא-עובדה. שאלות עובדתיות משתמשות בדרך כלל במילות חקירה כמו מה, איפה, מתי או מי, בעוד ששאלות שאינן עובדתיות משתמשות במילים כמו איך ולמה.

DPM: מהרשימה המסופקת, המשתמש רשאי לבחור קטע ספציפי. לאחר מכן, כל אסימון בקטע מתויג באמצעות תיוג חלק מהדיבור (POS). כדי לחלץ פעלים, זהה את כל האסימונים המתויגים כפעלים. שלב פעלים אלה עם רשימה של פעלים לא קונבנציונליים והחל לוגיקה עבור פעלים רגילים. צור מבנה נתונים (מערך) המכיל את הפעלים שחולצו, הזמנים שלהם וצורות ה-ing שלהם.

QPM: המערכת מקבלת קלט בצורה של שאלה מהמשתמש. הטקסט עובר אסימונים באמצעות המחלקה StringTokenizer, והאסימונים המתקבלים מאוחסנים במבנה נתונים נפרד. מבנה נתונים זה מוחזר לאחר מכן לשימוש נוסף בתוך התוכנית.

AEFM: הצעד הראשון הוא זיהוי הפועל בשאלה הנתונה. הפועל שזוהה לאחרונה מותאם כעת לאסימונים שנוצרו בשלב עיבוד המסמכים. המקרה הנבחר עבור סוג מסוים של שאלה עובדתית (כגון מה או מתי) מנוצל כדי לחלץ ולבנות את התשובה בצורה מדויקת יותר.

לפני בחירת סוג התשאול, המשתמש מתבקש תחילה לבחור את הקטע לבחירתו. ה-QPM אחראי לעיבוד שאלת המשתמש והעברתה ל-AEFM. ה-AEFM משתמש בחילוצים המתקבלים מה-DPM ובמסמכים המעובדים המכילים את הפורמט המתויג של מסמך הקלט המקורי. המודול יעביר את האלגוריתמים הנדרשים למודול הפורמולציה כדי לקבל את התשובה הרצויה.

איור 3
איור 3: רכיבי QAS. האיור ממחיש את התהליך בן ארבעת השלבים של מערכת QA: שאלות, עיבוד שאלות, עיבוד תשובות ותשובה. בעיבוד שאלות, המערכת מסווגת את השאלה. בעיבוד תשובות, הוא מוצא ובודק מסמכים וקטעים כדי לייצר את התשובה. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

דגם BERT: כדי לגלות את האסוציאציות בין מילים בטקסט, שיטת BERT משתמשת בשנאי. ישנם שני מנגנונים בשנאי - מקודד ומפענח28, אך רק המקודד נחוץ ל-BERT. BERT נוקט בגישה דו-כיוונית וסורק באופן שיטתי את טקסט הקלט כדי ללמד את עצמו את משמעות המילים בהקשר שלהן. המקודד לוקח כקלט סדרה של אסימונים שעברו וקטוריזציה. לאחר מכן הווקטורים מוזנים לרשת העצבית, המייצרת סדרה של וקטורים המשקפים את הקלט. וקטור הפלט של מילה משתנה בהתאם למשפט שבו היא מופיעה. הווקטור של מילה עשוי להשתנות בהתאם להקשר שבו היא מופיעה; לדוגמה, ל"כמו" ב"הוא אוהב לשחק קריקט" יש וקטור שונה מ"כמו" ב"פניו הפכו אדומות כמו עגבנייה". הגישה מתחילה בשלב של עיבוד טקסט לפני המעבר לשלב בניית המודל. השלבים ש-BERT נוקט כדי לעבד טקסט נדונים בסעיף28 הבא.

עיבוד טקסט: מודל BERT מייצג טקסט קלט בהתאם למערכת עקרונות שנקבעה. בנוסף, גורם זה תורם לשיפור הביצועים של הדגם. הטמעת הקלט ב-BERT מורכבת משילוב של שלושה סוגים נפרדים של הטמעות28.

הטמעות מיקום (PEs): כדי ללמוד את המידע הקשור לסדר בהטמעות, נעשה שימוש ב-PEs. PEs משמשים לשחזור מידע על הסדר שאבד בשנאים. BERT מפתחת PEs נפרדים במיוחד עבור כל נקודה ברצף הקלט. ל-BERT יש את היכולת להעביר את המידע המיקומי של מילים בתוך משפט על ידי שימוש ב-PEs. זה מאפשר ל-BERT ללכוד ולייצג ביעילות את הרצף או הסדר של המילים.

הטמעות משפטים (SEs): בנוסף, כדי לסייע למודל להבחין בין המשפט הראשון לשני, BERT לומד הטמעה ייחודית לכל אחד מהם. הוא גם מסוגל לקבל משפטים זוגיים כקלט לפעילויות כגון QA.

הטבעת אסימונים (TEs): TEs נלמדים עבור כל אסימון באוצר המילים של אסימון WordPiece. אוצר המילים של אסימון WordPiece מורכב מיחידות תת-מילים הנגזרות ממילים שנמצאות בתוך הקורפוס. כדוגמה להמחשה, אוסף אוצר מילים זה יקיף את כל מילות המשנה האפשריות של המונח שאלה, כולל Questio, Questi וכן הלאה.

ייצוג הקלט של אסימון נבנה על ידי חיבור ההטמעות שלו ברמת הפלח והמיקום. בשל כך, זוהי גישת הטמעה נרחבת המספקת שפע של מידע למודל. איור 49 מתאר את ההטמעות של מודל BERT.

איור 4
איור 4: הטמעות BERT. האיור מראה כיצד נוצרות הטמעות קלט עבור מודל שנאי. זה מתחיל ברצף קלט: [CLS] השמיים [MASK] מעוננים [SEP] ירד גשם [SEP]. כל אסימון ברצף מקבל הטמעה משלו, כגון Ethe או E[MASK]. לאחר מכן, הטמעות משפטים מתווספות לכל משפט, כגון EA עבור הראשון ו- EB עבור השני. הטמעות מיקום, המסומנות E0 עד E9, כלולות גם הן כדי לציין את המיקום של כל אסימון. כל אלה משולבים ליצירת הטמעות הקלט הסופיות. נתון זה שונהמ-9אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

תכנון QAS באמצעות BERT: לשם המחשה, בחנו את השאלה הזו בשילוב עם פסקה שנלקחה מערך בוויקיפדיה על פוטבול ליג28.

שאלה: היכן הוקמה הפוטבול ליג?

מעבר: בשנת 1888 נוסדה ליגת הפוטבול באנגליה, והפכה לראשונה מבין תחרויות כדורגל מקצועניות רבות. במהלך המאה ה-20, כמה מסוגי הכדורגל השונים גדלו והפכו לכמה מענפי הספורט הקבוצתיים הפופולריים ביותר בעולם.

תשובה: אנגליה

מודל ה-BERT משתמש בחילוץ אסימונים הן מהשאלה והן מההקשר, ולאחר מכן משלב אותם לקלט מאוחד. כאמור, התהליך מתחיל בשימוש באסימון [CLS], המשמש כאינדיקטור לתחילת משפט. בנוסף, נעשה שימוש במפריד [SEP] כדי להפריד באופן ברור בין השאלה לקטע. בנוסף לאסימון [SEP], BERT משלב SEs כדי להבחין בין השאלה לבין הקטע28 המכיל את התשובה. BERT משתמש בשני SEs, אחד מוקדש לשאלה והשני לקטע, כדי לבסס הבחנה ברורה ביניהם. ההטמעות משולבות לאחר מכן עם ייצוג חם אחד של28 אסימונים כדי להבדיל בין השאלה לקטע. תהליך זה מתואר באיור 5.

איור 5
איור 5: ייצוג קלט BERT. האיור ממחיש כיצד נוצרות הטמעות קלט עבור QAS מבוסס BERT. זה מתחיל עם האסימון [CLS], ואז השאלה כמה? [SEP], והקטע BERT גדול הוא, כל אחד עם שיבוצי המשפטים שלו (A לשאלה, B לקטע). הטמעות אסימון, משפט ומיקום משולבות כדי ליצור את הקלט הסופי. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

לאחר מכן, הייצוג המוטבעהמשולב 28 של השאלה וההקשר משמש כקלט במודל BERT. השכבה הנסתרת הסופית של BERT משתנה כדי להשתמש ב-SoftMax כדי ליצור התפלגויות הסתברות. התפלגויות אלו קובעות את מדדי ההתחלה והסיום של תת-מחרוזת בתוך משפט טקסט הקלט, המייצג תשובה, כפי שמתואר באיור 6, עבור ייצוג חזותי.

איור 6
איור 6: זרימת עבודה של עיבוד BERT עבור QA. האיור מראה כיצד מודל BERT עובד עבור QA. הוא מציג רצף קלט הכולל שאלה, המסומנת על ידי אסימון סיווג [CLS] בהתחלה ואסימון מפריד [SEP] בסוף, ואחריו הקשר, מופרד על ידי אחר [SEP]. האסימונים ברצף זה הופכים להטמעות. לאחר מכן המודל חוזה את מיקומי ההתחלה והסיום של התשובה בתוך הקטע. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

מסד נתונים וקטורי (VD): VD17,18 היא מערכת מיוחדת לאחסון, ניהול, אינדקס ושאילתות ביעילות של ייצוגים וקטוריים בממדים גבוהים של נתונים. וקטורים נוצרים לרוב ממודלים של למידה עמוקה ומכילים מידע סמנטי או הקשרי על הנתונים. כל ממד של וקטור מייצג תכונה ספציפית. הטמעות הן ייצוגים מספריים של אובייקטים כגון טקסט, תמונות, סרטונים ואודיו. הטמעות אלו משמשות ביישומים שונים, כולל למידת מכונה (ML), NLP, מערכות המלצות, ראייה ממוחשבת ו-IR. VDs מאפשרים חיפושי דמיון יעילים ושאילתות סמנטיות על ידי קיבוץ אובייקטים דומים קרוב זה לזה במרחב הווקטורי. Facebook AI Similarity Search (FAISS)29 הוא VD בולט ששימש במחקר זה כדי לזהות את ההקשר הרלוונטי ביותר לשאילתות משתמשים. טבלה 2 מתארת את המאפיינים העיקריים של VDs ומקרי השימוש בהם.

תכונהתיאור
נתונים בממדים גבוהיםמטפל בנתונים עם מאות או אלפי ממדים.
השכן הקרוב ביותר (ANN)מאפשר חיפושי דמיון מהירים על ידי קירוב מרחקים.
מדרגיותתומך במערכי נתונים בקנה מידה גדול עם מיליארדי וקטורים.
שילובמשתלב לעתים קרובות עם מסגרות וכלים של AI/ML לזרימות עבודה חלקות.
שאילתות בזמן אמתמספק חיפושים וקטוריים עם השהיה נמוכה עבור יישומים אינטראקטיביים.

טבלה 2: המאפיינים העיקריים של VD. הטבלה מדגישה תכונות חשובות של VD. אלה כוללים טיפול בנתונים בממדים גבוהים, הפעלת חיפושי דמיון מהירים באמצעות אלגוריתמים של ANN, קנה מידה למערכי נתונים גדולים, עבודה עם כלי AI ו-ML ותמיכה בשאילתות מהירות בזמן אמת לשימוש אינטראקטיבי.

מדדי הערכת ביצועים: מערכת SCD-QA הוערכה באמצעות שני מדדים עיקריים: ציון EM14 ומודל חביון15. ציון EM, מדד סטנדרטי במחקרי QA, מעריך את דיוק החיזוי על ידי מדידת שיעור התשובות החזויות התואמות בדיוק את האמת הבסיסית. עבור קבוצה של N שאלות, ציון ה-EM מוגדר רשמית במשוואה 1 באופן הבא:

משוואה 1כאשר משוואה 2 (1)

מדד זה מקצה ציון של 1 להתאמה מדויקת עם תשובת ההתייחסות, ו-0 לכל הפרש.

מדד ההשהיה מכמת את זמן העיבוד הכולל הנדרש למערכת כדי ליצור תגובה לשאילתה בודדת. מדד זה מחושב כזמן שחלף הממוצע בכל השאילתות, כפי שמוצג במשוואה 2:

משוואה 3 (2)

כאשר Tמתחילi ו-T סוףi הם חותמות הזמן המסמנות את ההתחלה והסיום של עיבוד השאילתה i, בהתאמה. ההשהיה מדווחת ב-s ולוכדת את היענות המערכת, המקיפה את כל השלבים מעיבוד קלט ועד ליצירת תשובות.

שיטת

על מנת ליישם את ה-SCD-QA, משולבים במאמר זה מחקרי הבדיקה הבאים.

מערך נתונים של SCD-QA: מערך נתונים מוצע30 מוצג ליישום מערכת SCD-QA. מערך נתונים זה נגזר מקורפוס טקסט המכיל כללי דוקטורט לשנת 20228, עבור הנחיות סטודנטים מ-NIT ארונאצ'ל פראדש, הודו. כדי להקים את מערכת SCD-QA, יש צורך ליצור קובץ JSON שיקיף את כל המידע הרלוונטי בפורמט מדויק. מערך הנתונים נוצר מקורפוס הטקסט באמצעות כלי הביאור Haystack (גרסה 2.18.1)31, מסגרת קוד פתוח. כלי זה מקל על יצירת מערך הנתונים SCD-QA בסגנון SQuAD14. השלבים ליצירת מערך נתונים מבואר מסוג SQuAD מקובץ ה-PDF מוצגים באיור 7, והמבנה של מערך הנתונים שלנו בסגנון SQuAD מתואר באיור 8.

איור 7
איור 7: שלבים ליצירת מערך נתונים מבואר מקובץ PDF. האיור ממחיש זרימת עבודה מדורגת ליצירת מערך נתונים מבואר בסגנון SQuAD באמצעות כלי Haystack. הוא מתאר את התהליך החל מחילוץ טקסט מקובצי PDF, ניקויו ופיצולו למעברים, הערות ידניות של זוגות שאלות-תשובות, אחסון ההערות בפורמט SQuAD JSON, ולבסוף ייצוא מערך הנתונים לאימון מודלים. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

איור 8
איור 8: מבנה מערך הנתונים של עובדות QA. האיור מציג מבנה נתונים של JSON המייצג פסקה וצמד QA ממערך נתונים. יש בו קטע פסקאות, המכיל קבוצה של שאלות ותשובות. שאלה אחת שואלת, מהו הציון המינימלי הנדרש כדי להתקבל לדוקטורט במדעים? לכל שאלה יש תעודת זהות ומערך תשובות. התשובה כוללת מזהה מסמך, מזהה שאלה, הטקסט 60% ציונים, מיקום ההתחלה של התשובה וקטגוריית תשובה לא מוגדרת. דגל is_impossible מוגדר כ- false. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

מערך הנתונים בנוי כרשימת מילונים, כאשר כל מילון מכיל שדות מפתח כגון נתונים, פסקאות, שאלה, answer_id, document_id, question_id, טקסט, answer_start, answer_end, is_impossible והקשר.

נתונים: הוא מכיל את המידע הכולל על תשובות לשאלות.
פסקאות: הקשר מסוים, יחד עם השאלות והתשובות שלו.
שאלה: שאלה מסוימת.
answer_id: מספר זיהוי ייחודי לכל טקסט תשובה.
document_id: מספר זיהוי ייחודי לכל הקשר.
question_id: מספר זיהוי ייחודי לכל שאלה.
טקסט: טקסט התשובה.
answer_start: מיקום ההתחלה של התשובה הנכונה בהקשר.
answer_end: מיקום סיום התשובה של התשובה הנכונה בהקשר.
is_impossible: זה אומר אם התשובה לשאלה שנשאלה זמינה בהקשר או לא.
הקשר: קורפוס הטקסט שממנו ניתן למצוא תשובה.
כל 80 השאלות במערך הנתונים המוצע עוקבות אחר פורמט השאלות העובדתיות והלא עובדתיות. דוגמאות של סוגים מסוימים של שאלות ממוסגרות מוצגות בטבלה 3.

שאלות
מיהו נ.ב?
מהו גודל הגופן של המסמך המתקדם?
כמה ימים יש בחופשת לידה?

טבלה 3: שאלה לדוגמה ממערך הנתונים. הטבלה מציגה דוגמאות לשני סוגים של שאלות: הראשונה והשנייה הן שאלות עובדתיות, ואילו השלישית היא שאלה לא עובדתית.

FAISS: FAISS (גרסה faiss_cpu-1.9.0)29,32, שפותחה על ידי Facebook AI Research (FAIR), היא ספריית קוד פתוח המאפשרת חיפוש דמיון יעיל ואשכולות של וקטורים צפופים. הוא תוכנן במיוחד לניהול נתונים בקנה מידה גדול וממדים גבוהים ביעילות. מערכת זו מאפשרת חיפושי ANN מהירים וניתנים להרחבה בתוך מערכי נתונים הכוללים מיליוני או מיליארדי וקטורים. הוא נמצא בשימוש נרחב ביישומים הקשורים להטמעות, כולל NLP, מערכות המלצות ואחזור תמונות או וידאו. FAISS מציעה שיטות אינדקס מרובות, כולל שטוח (כוח גס), קובץ הפוך (IVF), גרפים היררכיים של עולם קטן הניתנים לניווט (HNSW) וקוונטיזציה של מוצרים (PQ). שיטות אלה מאפשרות למשתמשים למטב את ביצועי החיפוש בהתאם לגודל הנתונים, הממדים ומפרטי החומרה. במחקר זה נעשה שימוש באינדקס שטוח, המבצע חיפוש בכוח גס תוך שימוש במרחק L2 (אוקלידי) כדי לזהות את השכנים הקרובים ביותר. יכולת ההרחבה של המערכת תומכת הן ביישומי CPU והן ב-GPU, ומאפשרת חישובים בעלי ביצועים גבוהים על פני מערכי נתונים נרחבים. בנוסף, הוא מספק גמישות כדי לייעל את האיזון בין מהירות ודיוק בהתבסס על דרישות יישום ספציפיות. FAISS משמש לעתים קרובות ב-NLP כדי להעריך דמיון סמנטי בהטמעות, כגון BERT או Word2Vec. FAISS משמש ב-QAS לאחסון וניהול ייצוגים וקטוריים של מסמכים או משפטים. הוא מבצע חיפושי ANN משוערים33 כדי לאחזר את ההקשר הרלוונטי ביותר לשאלות משתמשים, ומשפר את החיפוש הסמנטי עם הטמעות ממודלים של שנאים כגון BERT. FAISS הוא כלי בסיסי בתהליכי עבודה של AI ו-ML בשל הרבגוניות שלו.

מודל BERT-large-uncased-whole-word-masking-finetuned- SQuAD: העבודה הנוכחית משתמשת במודל שפה מאומן מראש המכונה BERT-large-uncased-whole-word-masking fine-tuned-squad9 כדי לפתח QAS עובדתי באמצעות מערך הנתונים המוצע במחקר. מודל BERT עבר הכשרה מוקדמת ב-BookCorpus, מערך נתונים של 11,038 ספרים שלא פורסמו9, כמו גם בוויקיפדיה האנגלית, למעט רשימות, טבלאות וכותרות. הדגם המדובר אינו מסומן, כלומר אינו מבחין בין המילים אנגלית ואנגלית. המודל הוא מודל שנאי מאומן מראש שהוכשר על כמות משמעותית של נתונים באנגלית באמצעות גישה בפיקוח עצמי. המודל הוכשר מראש אך ורק על טקסטים גולמיים, ללא הערות אנושיות. זה מאפשר לו למנף כמות גדולה של נתונים נגישים לציבור. תהליך ההכשרה המקדים כולל יצירה אוטומטית של תשומות ותוויות מהטקסטים המסופקים. המודל הוכשר עם שתי מטרות ספציפיות9:

MLM: התהליך כולל מיסוך אקראי של 15%9 מהמילים במשפט הקלט. לאחר מכן המודל מעבד את כל המשפט המסיכה וחוזה את המילים המסיכות. גישה זו שונה מרשתות עצביות חוזרות קונבנציונליות (RNNs), שבדרך כלל מעבדות מילים ברצף, וממודלים אוטורגרסיביים כמו GPT, המשתמשים במיסוך פנימי של אסימונים עתידיים. הפונקציונליות מאפשרת למודל לרכוש ייצוג דו-כיווני של המשפט.

NSP: בשלב הקדם-אימון, המודל משלב שני משפטים מוסווים כקלט. במקרים מסוימים, משפטים אלה סמוכים בטקסט המקורי, מה שמעיד על קשר ישיר. במקרים אחרים, הם לא, כלומר אין קרבה מקורית או הקשר המקשר ביניהם. השלב הבא כולל את המודל המנבא אם שני המשפטים קוהרנטיים מבחינה לוגית.

המודל הנוכחי מאופיין בתצורה שלאחר מכן: ארכיטקטורת המודל מורכבת מ-24 שכבות, עם ממד נסתר של 1024. הוא משתמש ב-16 ראשי קשב ויש לו בסך הכל 336 מיליון פרמטרים9.

WordPiece משמש לאסימונים של הטקסטים בגודל אוצר מילים של 30,000 מילים בשלבי העיבוד המקדים. לאחר מכן הקלט של המודל ייראה כך: [CLS] משפט A [SEP] משפט B [SEP]. הדרישה היחידה היא שהאורך הכולל של המשפטים המשולבים יהיה פחות מ-512 אסימונים9. המודל הספציפי שהוכשר מראש מניב את התפוקה הבאה: ציון F1 שהושג הוא 93.15%, בעוד שציון ההתאמה המדויק הוא 86.91%9.

מודל Distilbert/distilbert-base-cased-distilled-squad: מודל DistilBERT10 הוא גרסה קומפקטית, מהירה ויעילה יותר של מודל BERT9 , שפותח כדי לשמור על רוב יכולת ההבנה הסמנטית של BERT תוך שהוא פחות עתיר משאבים ומתאים יותר ליישומים מעשיים עם יכולת חישובית מוגבלת. הגרסה distilbert-base-cased-distilled-squad כווננה עדינה ב-SQuAD14 למשימות QA. המודל משתמש בארכיטקטורת השנאי, כולל גודל מופחת של 66 מיליון פרמטרים לעומת 110 מיליון של BERT, תוך שמירה על 97% מהיעילות של BERT בהבנת השפה. DistilBERT מגיעה לכך באמצעות שיטה המכונה זיקוק ידע, המעבירה מידע ממודל BERT הגדול יותר למודל DistilBERT הקומפקטי יותר. בגלל גודלו הקטן יותר, הוא יכול להסיק מידע מהר יותר ולהשתמש בפחות זיכרון, מה שהופך אותו למושלם עבור יישומים מוגבלים במשאבים כמו מכשירים ניידים או קצה. המודל, שכוונן בקפידה על מערך הנתונים של SQuAD 1.1, מפגין מיומנות יוצאת דופן במשימות QA חילוץ, לפיה המטרה היא לאתר קטע טקסט מהקשר מוגדר שעונה על שאלה. DistilBERT משיגה כ-85% מציון ה-F1 של BERT בטבלת המובילים של SQuAD ושומרת על חלק ניכר מהיכולת הלשונית של BERT, למרות גודלה הקטן. מודל זה הוא פתרון יעיל במיוחד לעבודות QA ברמת הייצור, וממטב הן את הביצועים והן את היעילות החישובית.

Deepset/roberta-base-squad2: דגם Deepset/roberta-base-squad212,13 הוא גרסה מכווננת של ארכיטקטורת RoBERTa. הוא תוכנן במיוחד עבור מערך הנתונים SQuAD14 2.0, הכולל שאלות שנענו ושלא ניתן לענות עליהן. מסגרת RoBERTa משופרת זו מבטלתאת 9 משרות ה-NSP של BERT. הוא גם משתמש במיסוך דינמי במהלך האימון כדי להגביר את היעילות והביצועים במשימות הבנת NL. לדגם 125 מיליון פרמטרים והוא משתמש בשנאי דו-כיווני. זה מאפשר לו לרכוש מידע הקשרי משני הכיוונים ולהצטיין במשימות QA חילוץ.

כוונון עדין ב-SQuAD 2.0 מאפשר למודל לזהות את טווח התגובה הנכון בהקשר נתון ולזהות מתי אין תשובה. הוא משתמש בטוקנייזר קידוד זוגות בתים (BPE) המטפל בטוקניזציה של תת-מילים ושומר על רגישות לאותיות גדולות. זה משפר את יכולתו לעבד מילים לא שגרתיות ומורכבות. המודל מתפקד היטב, ומשיג בערך 85%-90% F1 ו-80%-85% EM. היכולת שלו לזהות שאלות שאין עליהן מענה והפריסה היעילה שלו הופכות אותו לבעל ערך עבור שירות לקוחות, אחזור ידע ועוזרים וירטואליים.

הדרך היעילה ביותר לפרוס דגמי BERT מכווננים עדינים של SQuAD עבור QA היא להשתמש בצינור Hugging Face Transformers34. מסגרת זו מייעלת טוקניזציה, עיצוב קלט, טעינת מודלים ועיבוד לאחר פלט. מודלים אלה מוכרים באופן נרחב ביעילותם ב-QA חילוץ, כאשר התשובה היא טווח טקסט שאוחזר ישירות מההקשר הנתון. כדי להנחות את היישום, ההליך הבא מתאר את השלבים לביצוע מודלים של BERT.

קלט והגדרה: תהליך זה דורש ארבעה כניסות עיקריות ופרמטרי הגדרה: שם הדגם, שצוין כמזהה מחרוזת מ-Hugging Face Hub (לדוגמה, google-bert/bert-large-uncased-whole-word-masking-finetuned-squad, distilbert/distilbert-base-cased-distilled-squad, או deepset/roberta-base-squad2); השאלה (Q), המסופקת כמחרוזת המכילה את השאילתה; וההקשר (C), מחרוזת המייצגת את הטקסט או הקטע הרלוונטיים. הכלי העיקרי בו נעשה שימוש הוא פונקציית הצינור ברמה גבוהה מספריית השנאים של Hugging Face (גרסה 4.57.0) ב-Python (גרסה 3.12.12).

תהליך: ביצוע (צינור חיבוק פנים): התהליך מורכב משישה שלבים עיקריים ומשתמש בצינור חיבוק פנים כדי לטפל במורכבות משימת ה-QA:

התקן ספרייה: התחל בהתקנת הספרייה הנדרשת עם הפקודה pip להתקין שנאים. התקנה זו מאפשרת גישה למודלים ולפונקציונליות היעילה של הצינור.

צינור ייבוא: ייבא את פונקציית קו הצינור באמצעות: מקו צינור ייבוא שנאים.

אתחול צינור QA: אתחל את קו הצינור של QA באמצעות qa_pipeline = pipeline("question-answering", model=""). פקודה זו מורידה את המודל ואת הטוקנייזר, והופכת אותם מוכנים להסקה.

הגדר קלט: הגדר שאלה = ... והקשר = ... כדי להכין את נתוני המודל.

הפעל מסקנה: העבר את השאלה וההקשר לקו הצינור עם תוצאה = qa_pipeline(שאלה=שאלה, הקשר=הקשר). המודל מעבד את הקלט ומספק תשובה.

חלץ תשובה: קבל את מחרוזת התשובה ממילון הפלט באמצעות: answer = result['answer'].

פלט: התהליך מייצר מספר פרמטרי פלט בסדר הבא: תשובה (טווח הטקסט שחולץ מההקשר, מוצג כמחרוזת), ציון (ערך נקודה צפה המכמת את הביטחון של המודל בחיזוי שלו), ומדדי התחלה וסיום (מספרים שלמים המציינים את מיקומי התווים של טווח התשובה בתוך ההקשר).

שנאי משפטים/all-MiniLM-L6-v2: ה-all-MiniLM-L6-v235 הוא שנאי משפטים מאומן מראש מספריית Sentence-Transformers (גרסה 5.1.1)36. הוא ממוטב להטמעת טקסט יעילה ומדויקת. פותח על מסגרת MiniLM של מיקרוסופט, הוא כולל שש שכבות שנאים והטמעות 384 מימדים. עיצוב זה מאזן בין ביצועים למיומנות חישובית, מה שהופך אותו למתאים ליישומים בזמן אמת. המודל אומן על למעלה ממיליארד זוגות ביטויים ממערכי נתונים כמו SNLI, MultiNLI, מדדי STS ונתונים שנסרקו באינטרנט. כתוצאה מכך, הוא מפגין מיומנות בדמיון סמנטי, קיבוץ ומשימות הקשורות לחיפוש. בגלל גודלו הקטן (~22MB) וביצועי ההסקה המשופרים, ה-All-MiniLM-L6-v2 מפשט יישומים כגון חיפוש סמנטי, זיהוי כפילויות וסיווג טקסט. למרות שהוא קל משקל, הוא מספק דיוק חזק במדדים כגון STS-B ו-SICK-R, מה שהופך אותו לבחירה יעילה עבור תרחישים ניתנים להרחבה ומוגבלים במשאבים. זרימת העבודה ליצירת ההטמעה באמצעות שנאי משפטים מתוארת באיור 9 להלן.

איור 9
איור 9: שלב בתהליך ההטמעה באמצעות מודל שנאי המשפט. האיור ממחיש את זרימת העבודה ליצירת הטמעות טקסט באמצעות מסגרת שנאי המשפטים. הוא מתאר את התהליך מייבוא ספריות וטעינת מודל מאומן מראש ועד הכנת נתוני טקסט, יצירת הטמעות, המרתם למערכי NumPy ואחסונם למשימות במורד הזרם כמו אינדקס או חיפוש דמיון. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

אלגוריתם מוצע: מחקר זה מתאר מתודולוגיה מוצעת באלגוריתם 1 לפיתוח מערכת SCD-QA מבוססת SeCD, המסוגלת לענות על שאלות עובדתיות ולא עובדתיות שנשאלו על ידי משתמשים.

אלגוריתם 1: אלגוריתם של מערכת SCD-QA מבוססת SeCD המוצעת
קלט: קבוצה של קובץ הקשר גולמי (C) ושאילתת המשתמש (Q).
פלט: ה-LLM האופטימלי מבוסס השנאי (M') שנבחר והתגובה שנוצרה על ידי M'.
הקשרים מקדימים לעיבוד: הוסף הערות לערכת ההקשר הגולמי C כדי ליצור מערך נתונים מובנה בפורמט DSQuAD .
DSQuAD = fאנונאט (C)
צור הטמעות הקשר: השתמשבהטמעת f של שנאי משפט כדי להמיר כל הקשר c משוואה 100 DSQuAD להטמעה ec.
משוואה 15
הטמעות אחסון: אחסן את Ec במסד נתונים וקטורי V לחיפוש דמיון יעיל.
משוואה 18
צור הטמעת שאילתה: הפוך את שאילתת המשתמש Q להטמעה eq באמצעות אותו שנאי משפטים.
משוואה 20
אחזור הקשר: אחזר את הטמעת משוואה 21 ההקשר הרלוונטית ביותר ממסד הנתונים V בהתבסס על דמיון ל- eq.
משוואה 22
כאשר sim(eq,e c), היא פונקציית הדמיון.
העבר הקשר ל-LLMs: הזין את ההקשר משוואה 21 שאוחזר ל-3 LLMs מבוססי שנאים: Google-BERT (M1), DistilBERT (M2), RoBERTa (M3) ומודל מסורתי: TF-IDF+Cosine Similarity (M4)
משוואה 28
הערכת מודל: השווה את התגובות {R1,R 2,R 3,R 4} באמצעות פונקציית הערכה feval, שנותנת ציון לכל תגובה.
משוואה 31
בחר את הדגם הטוב ביותר: זהה את המודל M' עם ציון ההערכה הגבוה ביותר S'
משוואה 33
צור פלט סופי: השתמש ב-M' כדי ליצור את התגובה הסופית R בהתבסס עלמשוואה 36
משוואה 37
קצה

תהליך האלגוריתם המוצע מתאר גישה שיטתית (איור 10) לבחירת LLM אידיאלי מבוסס שנאי כדי לענות על שאלות המשתמשים. הוא משלב עיבוד מקדים, אחזור הקשר מבוסס הטמעה והערכה מרובת מודלים כדי להבטיח תשובות איכותיות ורלוונטיות להקשר. להלן מוסבר התהליך שלב אחר שלב לבהירות:

הכנת נתונים ועיבוד מקדים: השלב הראשון כולל עיבוד נתונים טקסטואליים גולמיים-

קלט: קבצי הטקסט הגולמי8 מותאמים למערכת.

כלי הערות31: הקלט הופך למערך נתונים מובנה בפורמט SQuAD14 . שלב זה כולל יצירת זוגות QA. הוא גם מארגן נתונים טקסטואליים רלוונטיים בבלוקי הקשר מוגדרים היטב.

פלט: מערך הנתונים מוכן כעת ליצירת הטמעות.

יצירת הטמעת הקשר: כדי לאפשר אחזור הקשר יעיל וניתן להרחבה, מוחל מודל Sentence-Transformer35,36 מאומן על מערך הנתונים המבואר. שנאי זה ממיר טקסט להטמעות בממדים גבוהים הלוכדים משמעות סמנטית. ההטמעות מאוחסנות ב-VD, FAISS29,32 כדי לאפשר חיפושים מהירים מבוססי דמיון.

עיבוד שאילתות משתמש: כאשר משתמש שולח שאלה, השאלה מעובדת על ידי אותו שנאי משפטים35,36. זה יוצר הטמעה מתאימה באותו מרחב וקטורי29,32 כמו הטמעות ההקשר. עיצוב זה מבטיח שניתן להתאים את השאילתה לערכי הקשר רלוונטיים.

אחזור הקשר באמצעות דמיון וקטורי: באמצעות מדד דמיון (למשל, דמיון קוסינוס), המערכת משווה את הטמעת השאילתה עם הטמעות הקשר מאוחסנות. המערכת בוחרת את ההקשר הרלוונטי ביותר על סמך ציון הדמיון הגבוה ביותר. זה מבטיח שרק הקשר רלוונטי מועבר למודלים במורד הזרם. התהליך מפחית את התקורה החישובית ומשפר את הרלוונטיות.

הערכת מודל על פני מספר LLMs: ההקשר שנבחר מוערך על ידי שלושה LLMs מבוססי שנאים: Google-BERT28, DistilBERT10 ו-RoBERTa12. הוא מוערך גם על ידי TF-IDF37 מסורתי מבוסס מילות מפתח עם מודל דמיון קוסינוס. כל מודל מעבד את ההקשר ומייצר תגובה לשאלת המשתמש.

הערכה השוואתית: התגובות מארבעת המודלים של LLM מוערכות באמצעות שני מדדים מרכזיים. ראשית, התאמה סמנטית מוערכת על ידי EM14. שנית, חביון המודל מנותח על ידי זמני התגובה הממוצעים15.

בחירת מודל ותפוקה סופית: המודל בעל הביצועים הטובים ביותר נבחר כ-LLM המתאים לשאלת המשתמש. התגובה הסופית מהדגם הנבחר נחשבת. זה מבטיח איזון בין יעילות חישובית לאיכות תגובה.

איור 10
איור 10: זרימת העבודה של מערכת SCD-QA באמצעות מודלים מבוססי שנאים. האיור מראה כיצד פועלת מערכת SCD-QA. ראשית, קובץ הקשר גולמי מעובד על ידי כלי הערות ליצירת מערך נתונים בפורמט SQuAD. לאחר מכן שנאי משפט מייצר הטמעות, המאוחסנות במסד נתונים וקטורי של FAISS. כאשר משתמש שואל שאלה, המערכת יוצרת עבורה הטמעה ובוחרת את ההקשר הרלוונטי ביותר. הוא משווה שלושה מודלים מבוססי שנאים - Google-BERT, DistilBERT ו-RoBERTa, וציון דמיון מסורתי אחד של TFIDF + קוסינוס - ומשתמש במודלים בעלי הביצועים הטובים ביותר כדי לספק את התשובה. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

יישום מערכת SCD-QA השתמש בארבעה LLMs ומערך נתונים של 80 שאלות עובדתיות ולא עובדתיות. העיבוד בוצע ב-Google Colab, תוך שימוש במעבדי NVIDIA Tesla T4 GPUs (גרסת מנהל התקן: 550.54.15, גרסת CUDA: 12.4) עם זיכרון RAM של 12.7GB, זיכרון RAM של 15GB GPU ושטח דיסק של 112.6GB. ביצועי המודל הוערכו באמצעות שני מדדים: EM14 להתאמה סמנטית וחביון מודל15 לזמני תגובה.

מערך נתונים SCD-QA

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציג את מערכת SCD-QA, הממנפת מודלים של שפה מבוססי שנאים כדי לספק תגובות מדויקות ומודעות להקשר ממסמכים מוסדיים מובנים. זרימת העבודה של המערכת מורכבת מ: (1) עיבוד מקדים של נתונים; (2) הטמעת יצירת באמצעות שנאי המשפטים המתקדם ביותר, all-MiniLM-L6-v2; (3) אחזור מבוסס דמיון באמצעות FAISS; ו-(4) הערכת מודל מקיפה. הצינור נבדק על מערך הנתונים של SCD-QA, הכולל 80 שאלות עובדתיות ולא עובדתיות מבוארות בקפידה, הניתנות לתשובה שנלקחו ממסמכי מדיניות מוסדיים.

מבין שלושת...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין מה לחשוף.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מודים בהכרת תודה לסגל ולהנהלה המסורים של NIT ארונאצ'ל פראדש על תמיכתם וההדרכה הבלתי מעורערת לאורך מחקר זה. בנוסף, אנו אסירי תודה למפתחים ולתורמים של כלי NLP בקוד פתוח ומודלים מאומנים מראש, שעבודתם אפשרה את המחקר הזה. במהלך הכנת כתב היד הזה, המחברים השתמשו ב-Grammarly Proofreader כדי לשפר את הבהירות. המחברים לוקחים אחריות מלאה על דיוק ושלמות התוכן.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
כל MiniLM-L6-v2מיקרוסופטגרסה 5.1.1מודל טרנספורמר משפטים מאומן מראש ליצירת הטמעות-ממד גבוה. ממיר טקסט להטמעות לצורך שליפת הקשר.
כלי הערותערימת השחתגרסה 2.18.1פלטפורמה למבנה טקסט גולמי בפורמט SQuAD. מכין מערך נתונים על ידי יצירת זוגות QA ובלוקי הקשר.
מודל DistilBERTפנים חיבוקנהLLM קל משקל מבוסס שנאי עם דרישות חישוב מופחתות. מוערך להשוואה, מציע השהייה נמוכה יותר אך דיוק מופחת.
FAISS VDפייסבוקfaiss_cpu-1.9.0מחלות מין ניתנות להרחבה לחיפושים מבוססי דמיון. מאחסן ומשחזר הטבעות בממדים גבוהים להתאמה יעילה של שאילתות.
מודל Google-BERTגוגלנהLLM מבוסס טרנספורמרים מאומן מראש עם מידול הקשר דו-כיווני. מודל ראשי ליצירת תגובות מדויקות לשאילתות עובדתיות ולא-עובדתיות.
כרטיסי NVIDIA טסלה T4NVIDIAגרסת דרייבר: 550.54.15
גרסת CUDA: 12.4
כרטיסי מסך עם 15GB זיכרון GPU להסקת מודל. מספק כוח חישוב לעיבוד והערכת מודלים גדולים גדולים.
פיתוןקרן התוכנה של פייתוןגרסה 3.12.12פייתון היא שפת תכנות מובילה בתחום עיבוד שפה טבעית (NLP) בזכות התחביר הפשוט, הספריות המקיפות והתמיכה הקהילתית החזקה שלה. הוא תומך במגוון רחב של משימות NLP, כולל עיבוד טקסט בסיסי ומימושי למידת מכונה מורכבים.
מודל RoBERTaדיפסטנהLLM מבוסס טרנספורמרים אופטימלי עם אסטרטגיות אימון משופרות. הוערך להשוואה, מאזן בין דיוק לזמן השהייה.
מערך נתונים SCD-QA כ-SQuAD  תבניתנהגרסה 2.0פורמט סטנדרטי לזוגות שאלה-תשובות. מערך נתונים של מבנים לתאימות למודלים של טרנספורמר.

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Pirtoaca, G. S., Rebedea, T., Ruseti, S. Improving retrieval-based question answering with deep inference models. Int Joint Conf Neural Network. , 1-8 (2019).
  2. NLP-QA framework based on LSTM-RNN. Zhang, X., Chen, M. H., Qin, Y. Int Conf Data Sci Business Anal, , 307-311 (2018).
  3. Natural language processing based new approach to design factoid question answering system. Machhirke, V. S., Soni, A. Second Int Conf Inventive Res Computing Appl, , 276-281 (2020).
  4. Biancofiore, G. M., Deldjoo, Y., Di Noia, T., Di Sciascio, E., Narducci, F. Interactive question answering systems: literature review. ACM Comput Surv. 1 (1), Article 1(2024).
  5. Singh, S., Das, N., Michael, R., Tanwar, P. The question answering system using NLP and AI. Int J Sci Eng Res. 7 (12), 2229-5518 (2016).
  6. Pandya, H. A., Bhatt, B. S. Question answering survey: Directions, challenges, datasets, evaluation matrices. arXiv. , (2021).
  7. Khvalchik, M. A., Kulkarni, K. Open-domain non-factoid question answering. , Springer International Publishing. Cham. (2017).
  8. NIT Arunachal Pradesh PhD rules and regulations year. , National Institute of Technology Arunachal Pradesh. https://www.nitap.ac.in/storage/pdf/140508582e7c89a8b2295595085e3abe-%2003-37-28F%20IN%20AL.pdf (2022).
  9. Devlin, J., Chang, M. W., Lee, K., Toutanova, K. BERT: Pre-training of deep bidirectional transformers for language understanding. Proc NAACL-HLT. , 4171-4186 (2019).
  10. Sanh, V., Debut, L., Chaumond, J., Wolf, T. DistilBERT, a distilled version of BERT: Smaller, faster, cheaper and lighter. arXiv. , (2019).
  11. DistilBERT HuggingFace. , https://huggingface.co/distilbert/distilbert-base-cased-distilled-squad (2023).
  12. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  13. RoBERTa base squad2. Deepset. , https://huggingface.co/deepset/roberta-base-squad2 (2023).
  14. SQuAD: 100,000+ questions for machine comprehension of text. Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P. Proc 2016 Conf Empirical Meth Natural Language Proc, , 2383-2392 (2016).
  15. Attention is all you need. Vaswani, A., et al. 31st Conf Neural Informat Proc Syst, , 1-11 (2017).
  16. Malkov, Y. A., Yashunin, D. A. Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE Trans Pattern Anal Mach Intell. 42 (4), 824-836 (2018).
  17. Similarity search in high dimensions via hashing. Gionis, A., Indyk, P., Motwani, R. Proc 25th VLDB Conf, , 518-529 (1999).
  18. HIJLI_JU at SemEval-2024 task 7: Enhancing quantitative question answering using fine-tuned BERT models. Sengupta, P., Sarkar, S., Das, D. Proc 18th Int Workshop Semantic Evaluat, , 279-284 (2024).
  19. Kocoń, J., et al. ChatGPT: Jack of all trades, master of none. Inf Fusion. 99, 101861(2023).
  20. Fine-tuning strategies for domain specific question answering under low annotation budget constraints. Guo, K., Diefenbach, D., Gourru, A., Gravier, C. IEEE 35th Int Conf Tools with Artificial Intell, , 166-171 (2023).
  21. Question answering on biomedical research papers using transfer learning on BERT-base models. Pudasaini, S., Shakya, S. 7th Int Conf I-SMAC (IoT in Social, Mobile, Analytics and Cloud), , 496-501 (2023).
  22. Knowledge-augmented language model prompting for zero-shot knowledge graph question answering. Baek, J., Aji, A. F., Saffari, A. Proc 1st Workshop Natural Language Reasoning Struct Explanat, , 78-106 (2023).
  23. Hu, S., Zhang, H., Zhang, W. Domain knowledge graph question answering based on semantic analysis and data augmentation. Appl Sci. 13 (15), (2023).
  24. A BERT-based approach for knowledge base question answering. Luo, D., Su, J., Yu, S. Int Joint Conf Neural Networks, , 1-8 (2020).
  25. Wu, C., et al. Retrieval augmented generation-driven information retrieval and question answering in construction management. Adv Eng Inform. 65, 103158(2025).
  26. Peng, C., et al. A study of generative large language model for medical research and healthcare. NPJ Digit Med. 6 (1), 210(2023).
  27. Gardazi, N. M., et al. applications in natural language processing: a review. Artif Intell Rev. 58 (6), 1-49 (2025).
  28. Sabharwal, N., Agrawal, A. Hands-on question answering systems with BERT: applications in neural networks and natural language processing. , Apress Berkeley. CA. (2021).
  29. FAISS documentation. , https://faiss.ai/ (2025).
  30. Bhattacharya, D. SCD-QA dataset. Zenodo. , (2025).
  31. Annotation tool. , https://docs.haystack.deepset.ai/docs/annotation (2025).
  32. Johnson, J., Douze, M., Jégou, H. Billion-scale similarity search with GPUs. IEEE Transac Big Data. 7 (3), 535-547 (2021).
  33. Sun, P., Guo, R., Kumar, S. Automating nearest neighbor search configuration with constrained optimization. arXiv. , (2023).
  34. BERT. , Hugging Face. https://huggingface.co/docs/transformers/model_doc/bert (2025).
  35. MiniLM: Deep self-attention distillation for task-agnostic compression of pre-trained transformers. Wang, W., et al. Proc 34th Int Conf Neural Informat Process Syst, , 5776-5788 (2020).
  36. Sentence transformer documentation. , https://www.sbert.net/ (2025).
  37. Cosine similarity to determine similarity measure: study case in online essay assessment. Lahitani, A. R., Permanasari, A. E., Setiawan, N. A. 4th Int Conf Cyber IT Service Manag, , 1-6 (2016).
  38. A comparative analysis of transformer models in zero-shot text classification. Kyritsis, K., Liapis, C. M., Spatiotis, N., Perikos, I., Paraskevas, M. 15th Int Conf Informat Intelligence Syst Applicat, , 1-4 (2024).
  39. Howard, J., Ruder, S. Universal language model fine-tuning for text classification. Proc 56th Ann Meeting Associat Computat Linguistics. , 328-339 (2018).
  40. Asai, A., Hashimoto, K., Hajishirzi, H., Socher, R., Xiong, C. Learning to retrieve reasoning paths over Wikipedia graph for question answering. arXiv. , (2019).
  41. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv. , (2021).
  42. Leveraging passage retrieval with generative models for open domain question answering. Izacard, G., Grave, E. Proc Conf Eur Chapter Associat Computat Linguistics, , 874-880 (2021).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

TransformerQASQuADTF IDF

מאמרים קשורים