מאמר מחקר

סיווג טקסטים באנגלית קל משקל עם למידה עמוקה המבוססת על תורת מערכות מורכבות

DOI:

10.3791/69344

9 ביוני 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מחקר זה מציע רשת עצבית גרפית קלה עם מטה-דיסטילציה ומטה-למידה, לשיפור סיווג הטקסט באנגלית. משפר הכללה בסביבות עם נתונים דלים ובין-תחומיים, תוך הפחתת עלויות חישוביות ושמירה על ביצועים גבוהים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הגלובליזציה ופיתוח טכנולוגיית המידע הובילו לעלייה בנתוני טקסט באנגלית, ויש צורך דחוף בסיווג יעיל. כדי לשפר את יכולת ההכללה של סיווג טקסט באנגלית בתרחישים של מדגמים קטנים וחוצי תחום, ולהשיג מודלים קלים, מחקר זה משלב תורת מערכות מורכבות עם למידה עמוקה לבניית מודל רשת עצבית גרפית שמסביר במלואו את מאפייני ההתפלגות של דגימות טקסט. שיטת מטה-זיקוק דו-רמתית, בשילוב עם אסטרטגיות למידת מטא, מתאימה באופן דינמי את הפרמטרים של מודל המורה וממקמת את כל תהליך העברת הידע. תוצאות הניסוי מראות כי ביצועי הסיווג של המודל המוצע במשימות סיווג טקסט עם מספר מועט וחוצה תחומים טובים משמעותית מאלו של רשתות עצביות גרפיות מסורתיות ומודלים השוואתיים מרכזיים אחרים. מבחינת משקל קל, ה-SM שנוצר על ידי מנגנון המטה-זיקוק הדו-שלבי שומר על רמת שימור ביצועים גבוהה מאוד במאגרי סיווג טקסטים רב-נושאיים, תוך שהוא מפחית משמעותית את זמן החישוב. בנוסף, שיטה זו יכולה לשמור על יעילות גבוהה וביצועי סיווג יציבים בתרחישי עיבוד טקסט ארוך ומציעה יתרונות ברורים ביעילות חישובית בהשוואה לשיטות זיקוק מסורתיות ושיטות נוספות המדווחות בספרות. השיטה המוצעת משפרת באופן יעיל את ביצועי הסיווג של טקסט באנגלית בתרחישי יישום במדגם נמוך ובבין-תחומי, תוך הפחתת העלות החישובית באופן משמעותי, ובכך מספקת פתרון טכני מעשי ויעיל לסיווג טקסט באנגלית בסביבות מוגבלות משאבים.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

האצת הגלובליזציה וההתקדמות בטכנולוגיית המידע הובילו לצמיחה האדירה של נתוני טקסט באנגלית בתחומים כמו מדיה חברתית, מחקר אקדמי ותקשורת עסקית. סיווג יעיל של טקסטים אלו לצורך שליפת מידע, ניתוח רגשות, ניהול תוכן ופונקציות נוספות הפך למשימה חשובה בעיבוד שפה טבעית1. מטרת סיווג הטקסט האנגלי (ETC) היא לסווג טקסטים לקטגוריות מוגדרות מראש בהתבסס על התוכן הסמנטי שלהם. עם זאת, המורכבות של השפה הטבעית, כולל עמימות שלה, תלות בהקשר ומגוון הביטוי, מציבה אתגרים רבים למשימות סיווג טקסט2. כיום, הצמיחה של טכנולוגיית הלמידה העמוקה (DL) יצרה הזדמנויות חדשות לסיווג טקסטים. מודלים לשוניים מאומנים מראש המיוצגים על ידי ייצוגי מקודדים דו-כיווניים מ-Transformers (BERT) וגרסאותיהם, יכולים ללמוד מידע סמנטי הקשרי עשיר באמצעות הכשרה מוקדמת על קורפוסים בקנה מידה גדול, מה שמשפר משמעותית את ביצועי סיווג הטקסט3. עם זאת, שיטות ETC הנוכחיות עדיין מתמודדות עם שתי מגבלות עיקריות: ראשית, הן לעיתים קרובות מדגישות אופטימיזציה של מודל או תכונה יחידה, תוך התעלמות מהתכונות הטבועות של השפה כמערכת מורכבת, כגון הדינמיקה שלה והתנהגותה המתהווה, מה שמוביל להכללה לא מספקת בתרחישים עם נתונים נמוכים או חוצי תחומים; שנית, למרות הביצועים החזקים של מודלים מאומנים מראש, העלות החישובית הגבוהה שלהם וספירת הפרמטרים הגדולה שלהם מפריעים מאוד לפריסה מעשית בסביבות מוגבלות משאבים 4,5. כדי להתמודד עם סוגיות אלו, מחקר זה מציע מסגרת סיווג טקסט קלה המשלבת את תורת המערכות המורכבות (CST) ומנגנון המטה-זיקוק הדו-שלבי (TSMDM).

בהקשר של מחקר זה, CST מתייחס למסגרת התיאורטית הרואה בשפה טבעית מערכת מורכבת טיפוסית עם אבולוציה דינמית, הופעה סמנטית ופיזור הטרוגני של השפעת צמתים לקסיקליים. הוא מיושם כדי לדמות את התפקיד הדומיננטי של אוצר המילים המרכזי בהפצת סמנטיקה ואת החוק המתהווה של הסמנטיקה הכוללת מתוך תכונות לקסיקליות מקומיות, ובכך משפר את ההבנה העמוקה של המודל בסמנטיקת טקסט ואת היכולת להסתגל לתרחישי נתונים בעלי צילום מועט וחוצה תחומים. התרומות המרכזיות שלו הן כדלקמן: תיאורטית, למיטב ידיעתנו, CST מוכנס באופן שיטתי למשימות סיווג טקסט, המדמה את ההתפתחות הדינמית וההופעה הסמנטית של מערכות שפה כדי לשפר את ההבנה העמוקה של המודל ויכולת ההסתגלות לנתונים מועטים וחוצי תחומים. מתודולוגית, מתוכננת רשת עצבית גרפית (GNN) הכוללת מאפייני התפלגות דגימה. ה-TSMDM החדשני המשולב שונה במהותו מזיקוק הידע הסטנדרטי. זיקוק ידע סטנדרטי מבצע העברת ידע חד-כיוונית ממודל מורה עם פרמטר קבוע (TM) למודל תלמיד קל משקל (SM). המטה-זיקוק במחקר זה משלב אסטרטגיות מטא-למידה על בסיס הזיקוק ויכול להתאים דינמית את פרמטרי ה-TM בהתבסס על משוב הלמידה של ה-SM. העיצוב הדו-שלבי מגדיר גם את מודל עוזר ההוראה כשכבת בופר ביניים כדי לצמצם אובדן מידע הנגרם מפערי מורכבות מופרזים בין ה-TM ל-SM, ומשיג משקל קל משמעותי של המודל תוך שמירה על דיוק גבוה, ובכך מספק פתרון סיווג יעיל לתרחישים מוגבלים במשאבים.

בתחום ETC, חוקרים ערכו חקירה נרחבת והציעו פתרונות שונים המשלבים תכונות שונות וארכיטקטורות מודלים כדי להתמודד עם אתגרים טכניים בתרחישים שונים. ר. ג'אנג ואחרים עיצבו מודל מיזוג רב-מאפיינים רב-לשוני מאומן מראש (MP-MFFM) כדי להתמודד עם בעיית הלכידה הלקויה של מידע מבני לטווח ארוך ב-ETC באמצעות שיטות DL קיימות. שיטה זו שילבה BERT רב-לשוני, BiLSTM וטקסט CNN כדי להפיק מידע מבני סמנטי, גלובלי ומקומי עמוק ולמזג אותם. שיטה זו שיפרה את הדיוק, הרגישות והדיוק בשלושה מערכי נתונים, ואישרה את יעילותה6. C. Madhu ואחרים אימצו מסגרת למידה מבוססת תכונות דיאלקט (DF-FGLF) כדי להתמודד עם צרכי סיווג טקסט של נתונים לא מובנים ובעלי הערות נמוכות ברשתות חברתיות, וכן להשפעת ההבדלים בדיאלקטים על סיווג בינלאומי באנגלית. הם שילבו תכונות למידת הבדל סמנטי ודיאלקטי לבניית גרף מטושטש אופטימלי. כאשר היו רק 10 דגימות עם הערות, ערך F1 לזיהוי ניבים וסיווג טקסט עלה על 93% ו-80%, שהיה עדיף על שיטות דומות ומתאים לסיווג מעשי7. ב. שנאק ואח' ערכו ניסויים באמצעות מאגרי נתונים באנגלית ובערבית כדי לחקור את השפעת אורך n-גרם על סיווג הטקסט במערכות כתיבה שונות ואת השפעת מאפייני השפה על אורך ה-n-גרם האופטימלי. הביצועים של 2 גרם באנגלית היו הטובים ביותר (דיוק 0.482, זיכרון 0.489, ערך F1 = 0.472), בעוד שערבית 6 גרם הייתה הטובה ביותר (ערך F1 בערך 0.85). מורפולוגיית שפה ותכונות תחביריות השפיעו משמעותית על ביצועי מודלים בגודל n-גרם8. N. S. Lagutina ואחרים השתמשו בווקטור טקסט שנבנה על פי תכונות ביבליומטריות של תווים, אוצר מילים ומבנה משפטים כדי להשיג סיווג אוטומטי של טקסטים קצרים באנגלית להערכת למידת תלמידים, בשילוב עם מסווגי למידת מכונה סטנדרטיים כמו SVM. ערך F1 של SVM במסגרת האירופית המשותפת לקורפוס שפות היה 67%, וערך F1 של מודל ה-BERT הטוב ביותר (מבוסס על בסיס bert) היה 69%. הטעויות היו בעיקר ברמות סמוכות, ואיכות הסיווג הייתה תלויה בקורפוס9.

זיקוק הידע, כאמצעי יעיל להשגת קלות משקל של המודלים, שיפור ביצועי המודל בתרחישי מדגמים קטנים והפחתת עלויות חישוביות, גם הוא השיג התקדמות משמעותית במחקרים קשורים. מחקרים קודמים בחנו את יישום זיקוק הידע לטיפול באתגרים מרכזיים בעיבוד שפה טבעית, כולל: שיפור ביצועי מודלים בעלי פרמטרים קטנים בתנאי תווית נמוכה, אופטימיזציה של משימות סיווג טקסט רב-לשוניות, דחיסת מודלים גדולים שמאומנים מראש באמצעות אסטרטגיות דחיסה היברידיות, וזיקוק ייצוגי משפטים יעילים לצמצום פער הביצועים בין מודלים גדולים לקטנים תוך התאמה לחומרה מגבלות 10,11,12,13. למרות ההתקדמות הזו, גישות זיקוק הידע הקיימות עדיין סובלות ממגבלות קריטיות עבור ETC: הן חסרות מנגנוני אופטימיזציה דינמיים לתהליך העברת הידע, לעיתים סובלות מאובדן מידע חמור בעת זיקוק בין TMs מורכבים מאוד ל-SMs קלים, ואינן משתלבות ביעילות עם מאפייני ההתפלגות הטבועים בנתוני הטקסט. חסרונות אלו גורמים לביצועי הכללה לא אופטימליים בתרחישים של יריות מועטות וחוצות תחומים. המודלים הקלים שהושגו בשיטות אלו לעיתים קרובות מתקשים לאזן בין יעילות סיווג ליעילות חישובית בסביבות מוגבלות משאבים. זהו הפער המרכזי שהמחקר במאמר זה שואף לטפל בו.

מחקר זה בוחן את השערת המחקר הבאה: ראשית, שילוב CST ב-ETC יכול לדמות ביעילות את האבולוציה הדינמית ואת מאפייני ההופעה הסמנטית של מערכות שפה טבעית. אינטגרציה תיאורטית זו יכולה לשפר משמעותית את יכולת ההכללה של המודל בתרחישים חד-מורגשים וחוצי תחום, בהשוואה למודלים מסורתיים של סיווג טקסט המתעלמים מתכונות המערכת המורכבות של השפה. שנית, מודל GNN שתוכנן תוך התחשבות מפורשת במאפייני התפלגות דגימות טקסט יכול לפצות על המגבלות של GNNs מסורתיים המתמקדים רק במודלים יחסיים ברמת מופע, ולהשיג כרייה מעמיקה יותר של מידע סמנטי גלובלי ומקומי בטקסטים באנגלית. שלישית, ה-TSMDM בשילוב עם אסטרטגיות מטא-למידה ומודל עוזר הוראה יכולים להשיג העברת ידע יעילה ובעלת אובדן נמוך ממחשבים מורכבים ל-SMs קלים. דבר זה יכול להפחית משמעותית את עלות החישוב של המודל ואת קנה המידה הפרמטרי תוך שמירה על ביצועי סיווג גבוהים. בנוסף, המודל הקל שמקורו במנגנון זה עדיין יכול לשמור על ביצועי סיווג יציבים ויעילים בתרחישי עיבוד טקסט ארוך עם מבנים סמנטיים מורכבים.

לסיכום, מחקר רלוונטי שיפר את ביצועי סיווג הטקסט באמצעות מיזוג רב-תכונות, למידת תכונות ניביות, אופטימיזציה של n-גרם ותכונות מטריקה סגנוניות, והשיג גם קלות משקל של מודלים באמצעות זיקוק ידע. עם זאת, השיטות הקיימות עדיין סובלות מחסרונות בלכידת מידע למרחקים ארוכים, הכללת מדגמים קטנים והתאמת מודלים מורכבים ופשוטים. כדי להפחית את העלות החישובית של מודל ETC תוך שמירה על דיוקו, מחקר זה בונה מודל קל משקל על ידי שילוב CST ו-TSMDM כדי לשפר את יכולת ההכללה והיעילות החישובית של המודל.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כדי לשפר את יכולת ההכללה של ETC בתרחישים של מדגמים קטנים וחוצי תחומים ולהשיג מודל קל משקל, מחקר זה מציע מסגרת סיווג טקסט המשלבת CST ו-TSMDM. התהליך הכולל של מסגרת זו מוצג באיור 1.

figure-protocol-1
איור 1: ויזואליזציה של מסגרת סיווג טקסט אנגלית קלה בת ארבעה שלבים המשלבת CST ו-TSMDM. תהליך העבודה מורכב מארבעה שלבים. שלב 1 מבצע ייצוג טקסט באמצעות הטמעות דינמיות מבוססות BERT מהטקסט האנגלי הקלט. שלב 2 מיישם מידול רשתות עצביות גרפיות על ידי בניית גרף טקסט וחישוב קשרים ברמת מופע ורמת התפלגה. שלב 3 מדמה הופעה סמנטית באמצעות שחזור מרכזיות הצמתים ומסגרת יצירת אב-טיפוס רב-רמתית להשגת אב-טיפוס סופי. שלב 4 מבצע זיקוק יסודי דו-שלבי, שבו מודל מורה מאומן והידע מועבר באמצעות מטה-זיקוק ליצירת מודל התלמיד הסופי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

ראשית, בשלב ייצוג הטקסט וההטמעה הדינמית, מודל BERT משמש להטמעת טקסט הקלט באופן דינמי וללכידת המידע הסמנטי ההקשרי. השלב השני הוא מודל GNN מודע להתפלגות, המתחשב במאפייני ההתפלגות של הדגימות, בונה מודל GNN ומשפר ייצוג תכונות באמצעות אינטראקציה עם מידע כפול ברמת המופע וברמת ההתפלגה. השלב השלישי הוא מודל הופעה סמנטי המונחה על ידי תורת המערכת ההיברידית, הכולל את שחזור מרכזיות הצמתים ומנגנון יצירת אב-טיפוס בשלושה רמות לסימולציה של דינמיקה והתפתחות מערכת השפה. לבסוף, בשלב הרביעי, מתבצעת פעולה דו-רמתית של זיקוק מטא-זיקוק קל משקל בשני שלבים. תהליך זיקוק הידע מותאם באמצעות מודל העוזר ואסטרטגיית המטה-למידה, כדי להשיג דחיסת מודל יעילה והאצה.

מודל ETC המבוסס על מאפייני התפלגות ו-CST
סקירת ארכיטקטורת המודל
מודל סיווג הטקסט המוצע עושה תחילה שימוש ב-BERT מאומן מראש לביצוע קידוד דינמי קונטקסטואלי של הטקסט הנכנס, ויוצר הטמעות מילים עשירות סמנטית וייצוג גלובלי. לאחר מכן, גרף מופע וגרף התפלגות נבנים מתכונות אלו: גרף המופע לוכד דמיון במדגם זוגי, בעוד שגרף ההתפלגות מדמה את התפלגות הנתונים הכוללת; החלפת מידע איטרטיבית בין שני הגרפים מאפשרת שיפור סינרגטי של תכונות בודדות ומבנה גלובלי. בהמשך, CST משולב להרחבה עמוקה של רשת הגרפים. שחזור מרכזיות הצמתים משתמש ב-PageRank לכימות השפעה לקסיקלית, המדמה את התפקיד הדומיננטי של אלמנטים מרכזיים ברשתות שפה. זוהי שיטה מאומתת באופן נרחב למדידת ההשפעה הגלובלית של צמתים בטופולוגיות רשת מורכבות, והיא מתאימה היטב ללכוד את הפיזור הסמנטי הא-סימטרי של צמתים לקסיקליים מרכזיים במערכות שפה. מסגרת יצירת אב-טיפוס בת שלוש רמות "מיקרו-מזו-מאקרו" מדמה את התהליך המתהווה מסמנטיקה מקומית לייצוגים הוליסטיים של קטגוריות. לבסוף, ייצוגי התכונות המשופרים מוזנים למסווג כדי לייצר את הסתברויות המחלקה הסופית.

אינטראקציה עם GNN מודע להפצה
כדי למקסם את יכולת ההכללה של ETC, וללכוד ביעילות יחסים סמנטיים מורכבים בין טקסטים לתכונות התפלגות לדוגמה (SDFs), מחקר זה בונה מודל ETC המבוסס על מאפייני התפלגות ו-CST. הוא משיג כריית מידע גלובלית ומקומית לעומק בטקסט על ידי שילוב מנגנונים כמו GNN והטמעת טקסט דינמית. GNN הוא מודל DL שתוכנן במיוחד לעיבוד נתונים מובנים על גרף. העיקרון המרכזי הוא להשתמש במנגנון העברת הודעות (שבו כל צומת בגרף מאגד את מידע התכונות של הצמתים השכנים שלו) ולשלב אותו עם מצבו. באמצעות סבבים רבים של עדכונים איטרטיביים, הוא לומד בהדרגה ייצוג מממד גבוה הכולל את מבנה הטופולוגיה. תהליך זה מאפשר לצמתים ללכוד את המבנה והתלות בתכונות של השכונה המקומית ואפילו של הגרף הגלובלי. כדי להתגבר על המגבלות של מודלים מסורתיים של רצפים במידול תלות לטווח ארוך ויחסים גלובליים, מחקר זה משתמש ב-GNN כדי ללכוד אסוציאציות סמנטיות מורכבות ויחסים מבניים בין דגימות. עקב המיקוד של GNN במידע המתאם הישיר בין דגימות בודדות, הוא מתעלם ממאפייני ההתפלגות הכלליים של קבוצת המדגם 14,15,16. לכן, מחקר זה מציע מודל GNN המתחשב ב-SDF. מודל זה מציג את BERT להטמעת טקסט דינמית ומשלב אותו עם רשת אב-טיפוס לחישוב הבדלי התכונות של הדגימות. BERT הוא מודל שפה מאומן מראש המבוסס על ארכיטקטורת הטרנספורמר. העיקרון המרכזי הוא ללכוד בו-זמנית את המידע הסמנטי של כל מילה בהקשר באמצעות מקודד דו-כיווני, ולאמן אותו מראש על קורפוס רחב היקף באמצעות שתי משימות: "מודל שפה מוסתר" ו"חיזוי משפט הבא". במודלים של שפה מוסתרים, חלק מהמילים בקלט מוסכמות באקראי, והמודל צריך לחזות את המילה המקורית בהתבסס על ההקשר. התחזית הבאה קובעת האם שני המשפטים עוקבים. לאחר הכשרה מוקדמת, BERT יכול להסתגל במהירות למשימות עיבוד שפה טבעית שונות באמצעות כיוונון עדין, מה שמשפר משמעותית את הביצועים ומספק ייצוגים איכותיים של תכונות לבניית מבנה גרף מאוחר יותר. המבנה הספציפי של מודל ETC שנבנה במחקר זה מוצג באיור 2.

figure-protocol-2
איור 2: עיצוב ארכיטקטוני של מודל סיווג טקסט אנגלי משולב ב-CST, תוך התחשבות במאפייני התפלגות הדגימה. התרשים מציג את העיצוב האדריכלי של מודל סיווג הטקסט האנגלי המשולב עם תורת המערכות המורכבות (CST) ומתחשב במאפייני התפלגות דגימות טקסט. הארכיטקטורה משלבת הטמעה דינמית הקשרי מבוססת BERT, רשת עצבית גרפית מודעת להתפלגות (GNN) ומנגנוני שיפור CST, ומממשת כרייה מעמיקה של מידע סמנטי גלובלי ומקומי בטקסטים באנגלית באמצעות מודלים שיתופיים מרובי מודולים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

במודל זה, עבור מערך נתונים כללי, הטקסט האנגלי שנכנס למודל BERT יוצר רצף טוקנים דרך טוקנייזר. שיטת בניית הרצף מוצגת במשוואה (1).

[CLS], 1,2,... an, [SEP] (1)

במשוואה (1), [CLS] הוא סמן הסיווג הממוקם בתחילת הרצף. BERT ייצור מצב נסתר קבוע עבור [CLS] במהלך תהליך האימון. מצב זה משמש ישירות לייצוג הסמנטי הגלובלי של כל הטקסט. 1,2,... n מייצג מילה או תת-מילה בטקסט. [SEP] הוא מפריד המשמש לסימון סוף משפט. לאחר עיבוד הרצף הנ״ל על ידי ברט, מתקבלות תכונות של כל טוקן, המספקים מידע קונטקסטואלי מובנה למודל. עבור מערכי נתונים מיוחדים המכילים ישויות, אם משתמשים בשיטות בניית רצף קונבנציונליות, המידע המקומי הכלול בישויות יאבד. לכן, מחקר זה בונה את הרצף באמצעות השיטה המוצגת במשוואה (2).

figure-protocol-3(2)

במשוואה (2), [E1], [/E1], [E2] ו-[/E2] הם האסימונים שנקבעו לקביעת מיקומי ההתחלה והסוף של שתי ישויות. באופן דומה, לאחר עיבוד ברט, תכונות הפלט של הטוקנים הללו יישאו מידע סמנטי של הישויות המתאימות, ובכך ינצלו טוב יותר את המידע החשוב על מיקום הישות. בהמשך, מחקר זה משתמש במודל GNN המתחשב ב-SDF כדי לשפר את ההתפלגות ותכונות המופעים של הדגימות. מבנה המודל מוצג באיור 3.

figure-protocol-4
איור 3: ארכיטקטורת אינטראקציה של תכונות גרף כפול של מודל רשת נוירונים מודעת להתפלגות בגרפים. האיור מציג את ארכיטקטורת האינטראקציה של תכונות גרף כפול של מודל GNN המודע להתפלגות לסיווג טקסט באנגלית. הארכיטקטורה בונה גרף נקודות לקידוד דמיון ברמת מופע וגרף הפצה לקידוד דמיון ברמת התפלגות, ומשיגה שיפור תכונות באמצעות אינטראקציה איטרטיבית בין שני הגרפים, ומשלימה את מחזור המידע החוצה-רמות של תכונות המופע ותכונות ההתפלגה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

המודל משיג שיפור תכונות באמצעות מנגנון אינטראקציה דו-שלבי. ראשית, הוא מנתח תכונות התפלגות מאסוציאציות ברמת מופע של דגימות נתונים, ואז מייעל באופן דינמי תכונות מופעים באמצעות חילופי מידע ברמת ההתפלגה. על ידי חיזוק איטרטיבי של תכונות המופעים ורמות ההתפלגה, הוא משלים בסופו של דבר את משימת הסיווג. באופן ספציפי, המודל משתמש בגרפים נקודתיים ובגרפים של התפלגות כדי להשיג חילופי מידע. מפת הנקודות משתמשת בווקטור תכונות הדגימה של הטקסט (שעודכן על ידי שתי השכבות האחרונות של BERT) כצומת, מכמת את הפרש תכונות הדגימה כדי לחשב את משקל הקצה דרך רשת קידוד ייעודית (שכבת סיגמואיד אחת + שתי שכבות נורמליזציה קונבולוציונליות באצווה), ומשתמשת בנירמול מינימלי-מקסימלי לנרמול לטווח [0,1. סף דמיון אמפירי של 0.2 נקבע לסף קשתות, כאשר קשתות עם משקלים מתחת לסף זה נחתכות כדי לבטל מתאמים חלשים ברמת מופע. גרף ההתפלגות לוקח את תכונות התפלגות הטקסט הממוזגות כצמתים, כאשר משקלי הקצוות מחושבים על פי דמיון קוסינוס של וקטורי תכונות ההתפלגות ומנורמל באמצעות נרמול L2 כדי להבטיח עקביות מטרית. סף קצה של 0.15 מאומץ, וקשתות עם משקלים מתחת לערך זה מוסרות, בעוד שמשקלי הקצוות התקפים הנותרים ממופים ומותאמים על ידי פרספטרון רב-שכבתי כדי לשפר את ההבחנה בין אסוציאציות ברמת התפלגות. מחקר זה מגדיר גרף figure-protocol-5 נקודות לאיטרציית שכבת l, שבו הצומת figure-protocol-6 מייצג תכונות דגימות וקשתות figure-protocol-7 מקודדות דמיון ברמת המופע. מפת figure-protocol-8התפלגות , הצומת figure-protocol-9 מייצג תכונות דגימה, והקצה figure-protocol-10 מקודד דמיון ברמת ההתפלגה. אם לוקחים לדוגמה את הגלגל מ-1 ל-l+1, חישוב היחסים ברמת המופע מחשב דמיון נקודתי דרך הבדלי תכונות, כפי שמוצג במשוואה (3).

figure-protocol-11 (3)

במשוואה (3), figure-protocol-12 וfigure-protocol-13- הם משקלי הקצוות בין הצמתים i ו-j במהלך האיטרציות ה-l-th ו-l-1 של גרף הנקודות, המשקפים את הדמיון של מאפייני הדגימה. figure-protocol-14 היא רשת קידוד המשמשת להמרת הבדלים בתכונות הצומת לסולמות משקל קצה, המורכבת משכבה אחת של סיגמואיד ושתי שכבות של פונקציות הפעלה של נרמול קונבולוציה באצוות. כאשר figure-protocol-15 ו- figure-protocol-16 הם האיטרציה l-1, וקטורי העצמי של הצמתים i ו-j מתעדכנים על ידי ברט בשתי השכבות האחרונות. לאחר מכן, מאפייני ההתפלגות מחושבים על בסיס יחסי המופעים, כפי שמוצג במשוואה (4).

figure-protocol-17(4)

במשוואה (4), figure-protocol-18 הוא וקטור עצמי של הצומת i בגרף ההתפלגות של השכבה ה-l. MLP1 הוא פרספטרון רב-שכבתי המורכב מפונקציות הפעלה ושכבות מחוברות במלואן, שממפה את התכונות המשולבות המקושרפות לתכונות התפלגות חדשות. לאחר מכן, יחסי ההתפלגות מחושבים על פי מאפייני ההתפלגות, ותכונות המופע מחושבות מתוך מערכת היחסים כדי להשלים את לולאת המידע החוצה-רמות.

מנגנוני שיפור מערכות מורכבות
כדי לשפר עוד יותר את יכולת ההכללה, CST מיושם במודל הנ״ל במחקר זה. האבולוציה הדינמית של מערכות מורכבות מתבטאת בהתפלגות ההטרוגנית של השפעת הצמתים. כדי לדמות את התפקיד הדומיננטי של אוצר המילים המרכזי בהפצת סמנטיקה במערכות שפה, מחקר זה מציג את מדד מרכזיות הצמתים כדי לשחזר את מנגנון הפצת המידע. גרף הנקודות Hp שנבנה עבור כל משימת תרחיש משתמש באלגוריתם PageRank כדי לכמת את מרכזיות הצומת C(hi), כפי שמוצג במשוואה (5)17.

figure-protocol-19(5)

במשוואה (5), α הוא מקדם ההחלכה, α = 0.85. N(hi) מייצג את קבוצת הצמתים השכנים, ו-L(hj) הוא דרגת הצמת. משוואה (5) מחליפה את תהליך ההפצה המדורגת של השפעת אוצר המילים ברשתות שפה מדומות, ומאפשרת לאוצר המילים המרכזי (כגון פעלים ומילות נושא) לקבל מרכזיות גבוהה יותר. לאחר מכן, מרכזיות הצומת משולבת עם משקלי קצה כדי להתאים דינמית את עוצמת ההפצה של המידע בין הצמתים. פונקציית הקישור λij מוצגת במשוואה (6).

figure-protocol-20(6)

במשוואה (6), σ היא פונקציית ההפעלה הסיגמואידית, WT הוא וקטור המשקל הניתן ללמידה, ו-b הוא מונח ההטיה. הקישור בין מרכזיות למשקלי קצה מאזן דינמי בין יחסים מקומיים לחשיבות גלובלית, ובכך משפר את יכולת ההסתגלות של המודל לשינויים דינמיים במשימות. הופעת CST מתבטאת בשפה האנגלית כאשר המשמעות הכוללת עולה על סכום אוצר המילים המקומי18. כדי לנצל תכונה זו ב-ETC, מחקר זה מעצב מסגרת יצירת אב-טיפוס בת שלוש רמות לסימולציה של תהליך ההופעה מתכונות מיקרו לקטגוריות מאקרו, כפי שמוצג באיור 4.

figure-protocol-21
איור 4: בנייה שלעדית של מסגרת יצירת אב-טיפוס מיקרו-מזו-מאקרו תלת-רמות להתפתחות סמנטית לשנית. האיור ממחיש את הבנייה שלב אחר שלב של מסגרת יצירת אב-טיפוס מיקרו-מזו-מאקרו בת שלוש רמות לסימולציה של הופעת סמנטיקה לשונית בסיווג טקסטים באנגלית. המסגרת בונה ייצוגי קטגוריות טקסט היררכיים באמצעות אשכולות תת-מחלקות מיקרו עם K-ממוצעים, מיזוג פרוטוטייפ של תת-מחלקות מזו המבוסס על משקל דמיון בהתפלגות, ואינטגרציה מאקרו-לא ליניארית באמצעות מנגנון תשומת לב, המדמה את התכונה המתהווה של "השלם גדול מסך חלקיו" במערכות שפה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

התהליך לעיל בונה ייצוגי קטגוריות טקסט שלב אחר שלב ממיקרו למקרו כדי לשפר את יכולת ההכללה של המודל. ברמה המיקרו, תת-מחלקות K נוצרות על ידי אשכול ייצוגי ההטמעה של כל קטגוריית טקסט. K-ממוצעים משמשים לחלוקת הדגימות בתוך הקטגוריה לתת-קבוצות, ומיקום המרכז של כל תת-קבוצה מחושב כפרוטוטיפ תת-מחלקה19. ברמה המזוסקופית, מחושבת דמיון התפלגות של כל אב-טיפוס תת-מחלקה, נוצרת מטריצת דמיון, ואז פרוטוטיפים של תת-המחלקה מורכבים מחדש על בסיס משקלי דמיון כדי לכמת את המתאם בין תת-מחלקות. חישוב משקל דמיון תת-מחלקה wij מוצג במשוואה (7).

figure-protocol-22 (7)

במשוואה (7) figure-protocol-23 נמצאת הסטייה של ג'נסן-שאנון, המשמשת למדידת ההפרש בהתפלגות בין שתי תת-מחלקות figure-protocol-24ל-20figure-protocol-25. לבסוף, אב-טיפוסי תת-המחלקה משוקללים ומתוזגים לקבלת קבוצת ייצוגי התפלגות figure-protocol-26מחלקות . ברמה המאקרו, משקלי החשיבות של כל תת-מחלקה נלמדים באמצעות מנגנוני תשומת לב, ומוצגות טרנספורמציות לא ליניאריות כדי לדמות את תהליך ההופעה, מה שמוביל לפרוטוטיפ הסופי של המחלקה c כפי שמוצג במשוואה (8).

figure-protocol-27(8)

במשוואה (8), αk מתייחס למשקל תשומת הלב של מחלקת k. U מציין את מטריצת משקל הטרנספורמציה הלא-ליניארית. tanh(·) משמשת לשיפור הייצוג הלא-ליניארי ולסימולציה של הגדול הכולל מסכום החלקים האופייניים למערכות מורכבות. כל רמה לוכדת את הגיוון בתוך קטגוריות דרך מבנה תת-מחלקה, משקללת את דמיון התפלגות כדי להפחית את השפעת תת-מחלקות רועשות, ומתמקדת דינמית במאפיינים מובחנים באמצעות מנגנוני קשב לשיפור יכולת ההכללה של המודל. CST משולב בעיקר עם GNN דרך שני מנגנונים. הראשון הוא להכניס מרכזיות צומת כדי לשחזר את תהליך הפצת המידע ולדמות התפלגות ההטרוגנית של השפעה לקסיקלית במערכת השפה. מרכזיות הצמתים מכותת באמצעות אלגוריתם PageRank ומשולבת דינמית עם משקלי הקצוות, מה שמאפשר לאוצר המילים המרכזי לשלוט בהפצה סמנטית ומגביר את יכולת ההסתגלות של המודל לשינויים הדינמיים במשימות. השנייה היא לעצב מסגרת יצירת אב-טיפוס בת שלוש רמות, מאשכול תת-מחלקות מיקרו ועד מיזוג פרוטוטיפוס בקטגוריות גדולות, כדי לדמות את התכונה המתהווים במערכת השפה ש"השלם גדול מסך חלקיו". מסגרת זו משיגה אינטגרציה היררכית מתכונות מקומיות לסמנטיקה גלובלית באמצעות דמיון התפלגות, משקל ומנגנוני תשומת לב.

לסיכום, החידוש המרכזי במודל ETC שנבנה טמון בשילוב עמוק של רעיונות CST במסגרת GNN. על ידי שיקום מנגנון הפצת המידע באמצעות מרכזיות הצמתים, המודל מדמה את התפקיד המוביל של האלמנטים המרכזיים במערכת השפה ומגביר את ההתאמה שלו לדינמיקת המשימות. באמצעות מסגרת יצירת אב-טיפוס בת שלושה רמות, המודל מממש את תהליך ההופעה מתכונות מקומיות לסמנטיקה גלובלית, ובכך משפר את יכולתו של המודל ללכוד את הגיוון והתכונות ההבחנה בתוך הקטגוריה. שיטה זו נמנעת מהמגבלה של GNNs מסורתיים שמסתמכים רק על קשרים ברמת מופע. באמצעות אינטראקציה ברמת התפלגות ומאפייני מערכת מורכבים, היא מספקת פתרון חדש לשיפור יכולת ההכללה של המודל בתרחישים מעטים וחוצי תחומים.

התכונות המתהוות של CST מתאימות למסגרת יצירת אב-טיפוס בת שלוש רמות. במערכות שפה, העיקרון ש"השלם גדול מסך חלקיו" מתבטא בקפיצה סמנטית ממשמעויות מילים מקומיות לקטגוריות טקסט כוללות. מחקר זה מדמה תהליך זה באמצעות מנגנון יצירת אב-טיפוס תלת-רמות "מיקרו-מזו-מאקרו": ברמה המיקרו, הטבעות הדגימות מקובצות ליצירת אב-טיפוס תת-מחלקה; ברמת המזו, אב-טיפוס אלו משוקללים ומאוחים על פי דמיון התפלגתי; וברמה המאקרו, אב-טיפוסי הקטגוריה הסופית מסונתזים באופן לא ליניארי באמצעות מנגנון תשומת לב. לדוגמה, בסיווג רגשות, מספר מילים שליליות כמו "מאכזב", "איטי" ו"יקר" מתמזגות ומשתנות באופן לא ליניארי והופכות לתחושה כוללת חזקה של "הערכה שלילית". מרכזיות הצמתים וההטרוגניות ב-CST מתיישבות עם מנגנון הפצת מידע המבוסס על שחזור מרכזיות הצמת. בתוך רשתות השפה, השפעת המילים מפוזרת באופן לא שווה, כאשר מילים מרכזיות (למשל, פעלים, מונחים נושאיים) ממלאות תפקידים דומיננטיים בהפצת סמנטיקה. מחקר זה מכמת את מרכזיות הצמתים באמצעות אלגוריתם PageRank ומחבר אותו דינמית עם משקלי קצוות כדי להתאים את עוצמת פיזור המידע בין הצמתים. לדוגמה, בסיווג חדשות, למונח "בחירות" יש מרכזיות גבוהה בטקסטים פוליטיים, מה שמוביל לצמתים סמוכים כמו "הצביע" ו"קמפיין" לקבל משקל גבוה יותר במהלך איסוף המידע, ובכך לשפר את הייצוג הסמנטי של אותו נושא. הטבע הדינמי והמסתגל של CST תואם ל-GNNs מודעים להתפלגות ולמנגנון ניסוי הוראה בתוך מטה-זיקוק. מערכות שפה מתפתחות באופן דינמי בהתאם להקשר ולדרישות המשימה. מודלים לוכדים שינויים כלליים בהתפלגות במאגרי נתונים באמצעות GNNs מודעים להתפלגות. במקביל, מנגנון ניסוי הוראה המונע על ידי מטא-למידת מוצג ב-TSMDM, המאפשר ל-TMs להתאים פרמטרים דינמית בהתבסס על משוב מ-SMs. לדוגמה, בניתוח סנטימנט חוצה תחומים, המודל יכול להתאים במהירות את משקלי התכונות בהתבסס על התפלגות הנתונים של תחום היעד ולחדד את פרמטרי ה-TM במהלך המטה-דיסטילציה כדי לשפר את יעילות ההתאמה לתחומים חדשים.

מודל LTC המבוסס על TSMDM
צינור מטה-זיקוק דו-שלבי
כדי להתמודד עם האתגרים של עלות חישובית גבוהה וקושי פריסה בסביבות מוגבלות במשאבים, מוצע מודל סיווג טקסט קל משקל המבוסס על TSMDM. שיטת המטה-זיקוק הזו מבצעת את תהליך הזיקוק בסדר רציף קפדני עם שני שלבים מובחנים. השלב השני מתחיל רק לאחר סיום והתכנסות ההכשרה של השלב הראשון: 1) שלב דחיסת הידע מהמורה לעוזר הוראה (TA), ו-2) שלב הזיקוק הקל בין עוזר הוראה לתלמיד המשולב עם התאמת פרמטרי מטא-למידה. גישה זו משיגה העברת ידע יעילה מ-TM מורכב ל-SM קל משקל באמצעות זיקוק דו-שלבי, תוך שילוב מנגנון מטא-למידה לאופטימיזציה דינמית של אסטרטגיית העברת הידע במהלך התהליך21,22. הצינור הכולל מוצג באיור 5.

figure-protocol-28
איור 5: עיצוב צינור של מודל סיווג הטקסט הקל עם מנגנון מטה-זיקוק דו-שלבי. האיור מתכנן את צינור מודל סיווג הטקסט הקל עם מנגנון המטא-זיקוק הדו-שלבי (TSMDM). הצינור כולל מודל מורה (מקור ידע במורכבות גבוהה), מודל עוזר הוראה (שכבת זיכרון מורכבות בינונית) ומודל תלמיד (מודל יעד קל משקל), ומיישם העברת ידע יעילה בשני שלבים עוקבים: דחיסת ידע בין עוזר הוראה ותיקוק קל משקל בין עוזר הוראה לתלמיד המשולבת עם למידת מטא. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

השיטה כוללת שלושה תפקידים: TM, מודל TA, ו-SM, כאשר תהליך הזיקוק מחולק לשני שלבים: זיקוק מורה-TA וזיקוק TA-תלמיד. בשלב דחיסת הידע הראשון בין מורה ל-TA, הידע מה-TM נדחס תחילה למודל TA במורכבות בינונית כדי לצמצם אובדן מידע הנגרם מפערי קיבולת מופרזים בזיקוק ישיר. ה-TM, המשמש כמקור הידע, מעביר הן את הסתברויות סיווג הפלט שלו והן את תכונות השכבה הבינוניות למודל TA. מודל ה-TA מאומן על ידי יישור הפלטים והייצוגים של התכונות עם אלו של המורה, באמצעות פונקציית אובדן משולב שמשלבת אובדן סיווג ואובדן יישור תכונות21. בשלב השני של זיקוק קל מ-TA-לסטודנט, שמתחיל עם התכנסות מודל ה-TA, הידע מזוקק עוד יותר מהמודל TA אל ה-SM הקל הסופי. שלב זה כולל גם פיקוח כפול (יומני סיווג ותכונות ביניים) ומשלב מנגנון למידת מטא: ה-TM מבצע "ניסויים הוראה" במשימות עזר להערכת מצב הלמידה של התלמיד ומתאים באופן דינמי את הפרמטרים שלו כדי לספק הנחיה אדפטיבית וממוקדת יותר. ה-SM משלים את ההכשרה על ידי מזעור הן את פערי הפלט והן את מרחק התכונות ביחס למודל TA, ובכך משיג הפחתה משמעותית של פרמטרים תוך שמירה על ביצועי הסיווג במידה המרביתהאפשרית 22.

למידה מטה-למידה עם ניסויים בהוראה
בשיטות זיקוק הידע המסורתיות, ה-TM המיומן מנחה את ה-SM על ידי השתתפות בחישוב ההפסד. עם זאת, TM פרמטרים קבועים קשים להערכה של מצב הלמידה בפועל של SMs, וגם לא יכולים לכמת את התרומה הספציפית של ההנחיה שלהם לעדכון פרמטרי SM23,24. לכן, מחקר זה מכניס רעיונות למידת מטא לתהליך הזיקוק, ומאפשר ל-TM להתאים את הפרמטרים שלו בהתאם למשוב הלמידה של ה-SM. תהליך הזיקוק מוצג באיור 6.

figure-protocol-29
איור 6: תהליך אופטימיזציה איטרטיבית של מטה-זיקוק בשילוב עם מנגנון ניסוי הוראה. האיור מתאר את תהליך אופטימיזציית הפרמטרים האיטרטיבי של מטה-זיקוק בשילוב עם מנגנון ניסוי ההוראה למודל סיווג טקסטים באנגלית במשקל קל. התהליך מייצר לומד פנימי זמני מתוך מודל התלמיד, מכמת את אובדן אפקט ההוראה דרך ביצועי האימון המדומים של הלומד הפנימי, ומאפשר למודל המורה להתאים את הפרמטרים שלו באמצעות הפצת ההפצה האחורית של האובדן, ובכך אופטימציה של אסטרטגיית העברת הידע הבאה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

ה-TM מייעל את הפרמטרים באמצעות משימות סיווג קונבנציונליות במהלך שלב האימון שלו, מה שמוביל לאובדן סיווג בסיסי LT המשקף את ביצועיו המקוריים. לאחר סיום ההכשרה, SM S משוכפל ליצירת עותק זמני של S 1 הפנימי של הלומד. ה-TM מבצע ניסויי הוראה על S1, ושגיאת הביצועים המקיפה שמראה S1 באימון המדומה הזה נמדדת כאובדן LQ. אות זה משמש כמשוב ל-TM להערכת יעילות ההוראה. באמצעות הפצת הידע האחורית של LQ, ה-TM מתאים באופן פעיל את הפרמטרים שלו ומייעל את שיטת העברת הידע שלו. לאחר השלמת אופטימיזציית הלמידה, ה-TM מבצע זיקוק ידע פורמלי על ה-SM S המקורי, ומשתמש גם באובדן המודל LS כמשוב להערכת יעילות הוראה ל-TM. כדי להשיג הקלת משקל של מודל ETC, מחקר זה ישקול לשלב את מודל SDF GNN כ-TM בתהליך ניסוי ההוראה, כפי שמוצג באיור 7.

figure-protocol-30
איור 7: זרימת עדכון הפרמטרים של מנגנון ניסויי ההוראה לאופטימיזציה של מודל מורים במטא-דיסטילציה. האיור מציג את זרימת עדכון הפרמטרים במנגנון ניסוי ההוראה לאופטימיזציה של מודל המורה בתהליך המטה-זיקוק. הזרימה מחשבת תחילה את האובדן הרך בין תחזית הלומד הפנימי לבין תחזית מודל המורה באמצעות פונקציית הפסד ממוצע ריבועי, משלבת את ההפסד הרך עם שגיאת תווית קשה ליצירת אובדן האימון הכולל, ומעדכנת את פרמטרי מודל המורה באמצעות הפצה לאחור של השגיאה הכוללת המשוקללת כדי לשפר את יעילות ההוראה. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

לאחר סיום הכשרה בזיקוק הידע, ה-SM מחשב תחילה את ההפרש בין התוצאות החזויות של ה-TM לבין התוויות האמיתיות. בהמשך, פונקציית אובדן MSE משמשת למדידת המרחק בין חיזוי ה-SM ( לומד פנימי S1) לבין תחזית TM. ערך המרחק הזה משמש כהפסד רך25. מטרת האימון הסופית כוללת שילוב משוקלל של שגיאת תווית קשה והפסד רך. על ידי הפצת השגיאה הכוללת המשוקללת, הפרמטרים של השגיאה המשוקללת מתעדכנים, ובכך משפרים את יעילות ההוראה של השגיאה המשוקללת. חישוב הפרמטרים של הלומד הפנימי S1 מוצג במשוואה (9).

figure-protocol-31(9)

במשוואה (9), figure-protocol-32 ו figure-protocol-33 - הם הפרמטרים הפנימיים של הלומד והפרמטרים ההתחלתיים שלהם מושפעים מפרמטר TM γT. λ (קצב הלמידה, λ = 0.005) שולט בגודל שלב עדכון הפרמטרים עבור הלומדים הפנימיים (כלומר, עותקים של SMs) במהלך מטה-זיקוק26. משוואה (9) מחשבת גרדיאנטים של אובדן באמצעות הפצה אחורית, בעוד λ מעדכנת את הפרמטרים של הלומדים הפנימיים. מנגנון זה משקף את מאפייני הלמידה של SMs, ומאפשר ל-TMs לקבל משוב ולהתאים את אסטרטגיות ההוראה שלהם, ובכך לשפר את יעילות זיקוק הידע בהמשך. חישוב האובדן LS בלמידת מטא מוצג במשוואה (10).

figure-protocol-34 (10)

במשוואה (10), B הוא רצף הדגימה של המטא-למידה.

אופטימיזציה של העברת ידע באמצעות עיצוב אובדן ומודל עוזר
כדי לשפר עוד יותר את יעילות זיקוק הידע, מחקר זה משיג את האובדן הכולל על ידי חישוב אובדן הסיווג ואובדן התכונות. ביניהם, אובדן התכונה מאמץ מנגנון רטרוספקטיבי, המשתמש ביציאות התכונה הרדודות והנוכחיות של ה-TM כדי להנחות את ה-SM, כפי שמובע במשוואה (11).

figure-protocol-35(11)

במשוואה (11), I הוא קבוצת אינדקסי שכבת התכונות. D היא פונקציית מרחק הנלקחת לחישוב ההפרש בין שני ייצוגי תכונות. figure-protocol-36 והן figure-protocol-37 פונקציות ייצוג אובייקטיביות ב-TM וב-SM, שממירותן את פלטי figure-protocol-38 התכונה ושל figure-protocol-39 שכבות i-th ו-j למטריצות קשב. אובדן הסיווג משלב את אובדן האנטרופיה החוצה בין פלט ה-SM לתווית האמיתית, וכן את ה-MSE בין שני המודלים, כהפסד רך27,28. בסופו של דבר, ההפסד הכולל מתקבל על ידי שקילת השניים, מה שעוזר ל-SM לקבל טוב יותר הכוונה מה-TM. כדי למזער את אובדן הביצועים במהלך תהליך זיקוק הידע, מחקר זה מציב את מודל עוזר ההוראה בין שני מודלים, כפי שמוצג באיור 8.

figure-protocol-40
איור 8: זרימת עיבוד זיקוק ידע דו-שלבית עם מודל עוזר הוראה כשכבת בופר ביניים. האיור מציג את זרימת עיבוד זיקוק הידע הדו-שלבית, כאשר מודל עוזר ההוראה משמש כשכבת הבופר הביניים. השלב הראשון מאחד אובדן תכונות ואובדן סיווג כדי לבנות את אובדן הזיקוק הכולל, ומכשיר את מודל עוזר ההוראה עם הידע של מודל המורה; השלב השני מאמץ את אותה אסטרטגיית מיזוג אובדן כדי לזקק את הידע של מודל עוזר ההוראה למודל התלמיד, ובכך להפחית אובדן מידע הנגרם מפערי מורכבות מופרזים בין מודל המורה לתלמיד. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

לאחר סיום שלב הזיקוק המטא, מודל TA וה-TM עוברים זיקוק ידע קונבנציונלי. במהלך תהליך זה, התכונות של שניהם מופקות סינכרונית, ומחשבים את ההפסד המתאים La . בהמשך, אובדן תכונה זה מתמזג עם אובדן הסיווג LM1 של המודל ליצירת פונקציית figure-protocol-41 אובדן הזיקוק בשלב הראשון, כפי שמוצג במשוואה (12).

figure-protocol-42(12)

במשוואה (12), β הוא מקדם המשקל המשמש לשליטה בשיעור אובדן התכונות ואובדן הסיווג ביחס לאובדן הכולל. figure-protocol-43 והן figure-protocol-44 פונקציות ייצוג אובייקטיביות במודל עוזר ההוראה וב-TM, שממירים את פלטי figure-protocol-45 התכונות ושל figure-protocol-46 שכבות i-th ו-J למטריצות קשב. zT  ו-zM הם הפלטים של ה-TM ומודל העוזר. תהליך הזיקוק ממודל עוזר ההוראה ל-SM זהה לתהליך הנ״ל, שממזער את אובדן ה-SM דרך איטרציות מרובות להשלמת העברת הידע.

לסיכום, התרומה המרכזית של ה-TSMDM המוצע טמונה באופטימיזציה של תהליך העברת הידע באמצעות מנגנון המטה-למידה. בהשוואה לזיקוק מסורתי, היתרון המרכזי של שיטה זו טמון ביכולת ההוראה הדינמית שלה: ה-TM יכול להתאים את הפרמטרים שלו באמצעות מנגנון ניסוי ההוראה בהתבסס על משוב בזמן אמת של ה-SM, ובכך לספק הדרכה ממוקדת יותר. במקביל, מודל עוזר ההוראה מוצג כשכבת מאגר, מה שמגשר על פער המורכבות בין ה-TMs ל-SMs ומפחית אובדן מידע בהעברת ידע. העיצוב השיתופי של "אסטרטגיית ההוראה לאופטימיזציה של מטא-למידה" ו"באפרינג דו-רמתי להפחתת קושי ההעברה" מאפשר ל-SM הסופי להשיג משקל קל משמעותי תוך שמירה על הידע המרכזי שנלקח מה-TM המורכב במידה המרבית.

זמינות נתונים
מערכי הנתונים שנוצרו במהלך ו/או נותחו במהלך המחקר הנוכחי מסופקים בקובץ משלים 1.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הגדרת ניסוי ומערך נתונים:
כדי להעריך באופן מקיף את ביצועי המודל המוצע ואת היעילות הקלה-קלה במשימות סיווג חוצה תחומים במדגם קטן, נערכו ניסויים על ארבעה מאגרי נתונים: FewRel (סיווג יחסי במדגם קטן), ARSC (ניתוח סנטימנט חוצה תחומים), רויטרס-21578 (קטגוריזציה של חדשות רב-נושאיות), ו-ArXiv (תקצירים אקדמיים ארוכים). FewRel, מאגר נתוני סיווג יחסי קטן נפוץ שמקורו בויקיפדיה, מכיל 100 קטגוריות יחסים סמנטיות (למשל, "עסקים/מייסדי חברה" ו"מיקום/הון מדינה") עם 700 משפטים איכותיים בכ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

כדי לשפר את יכולת ההכללה של ETC בתרחישים קצרים וחוצי תחומים תוך הפחתת עלויות חישוביות, מחקר זה מציע מסגרת סיווג טקסט קלה המשלבת CST עם TSMDM. שילוב CST עם מסגרת TSMDM מתמודד עם המגבלות המרכזיות של שיטות ETC קיימות (הכללה חלשה של מועטים/חוצת תחומים ועלויות חישוביות גבוהות) על ידי שילוב דינמיקת מערכות לשונית ותכונות סמנטיות מתהוות בעיצוב המודלים ומאפשר העברת ידע יעילה לדחיסה קלה. סינרגיה עיצובית זו היא המפתח לביצועים מעולים של המודל לעומת שיטות קונבנציונליות בסביבות מוגבלות משאבים.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין מה לחשוף.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

לכותבים אין מה להודות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Central Processing Unit (CPU)ספקי חומרה מסחריים (Intel, Dell, Lenovo)Intel i5-7300HQמפרט חומרה
Graphics Processing Unit (GPU)ספקי חומרה מסחריים (NVIDIA, ASUS)NVIDIA GeForce RTX 3060, 12 GB VRAMמפרט חומרה
Random Access Memory (RAM)ספקי חומרה מסחריים16 GB DDR4מפרט חומרה
Solid State Drive (SSD)ספקי חומרה מסחריים1 TB NVMe SSDמפרט חומרה
מערכת הפעלהאתר האינטרנט הרשמי של מיקרוסופטWindows 10 (64-bit)תוכנת מערכת
Pythonאתר האינטרנט הרשמי של פייתון (python.org)Python 3.8שפת תכנות
PyTorchאתר האינטרנט הרשמי של PyTorch (pytorch.org)PyTorch 1.11.0מסגרות למידת עמוק וספריות ליבה
CUDAאתר האינטרנט הרשמי של NVIDIACUDA 11.3מסגרות למידת עמוק וספריות ליבה
Hugging Face Transformersרכזת Hugging Face (huggingface.co)גרסה יציבה (מותאמת ל-Python 3.8/PyTorch 1.11.0)מסגרות למידת עמוק וספריות ליבה
NumPyPyPI (pypi.org)גרסה יציבה (מותאמת ל-Python 3.8)ספריות לעיבוד נתונים וסטטיסטיקה
PandasPyPI (pypi.org)גרסה יציבה (מותאמת ל-Python 3.8)ספריות לעיבוד נתונים וסטטיסטיקה
Scikit-learnPyPI (pypi.org)גרסה יציבה (מותאמת ל-Python 3.8)ספריות לעיבוד נתונים וסטטיסטיקה
SciPyPyPI (pypi.org)גרסה יציבה (מותאמת ל-Python 3.8)ספריות לעיבוד נתונים וסטטיסטיקה
MatplotlibPyPI (pypi.org)גרסה יציבה (מותאמת ל-Python 3.8)ספריית הדמיה
AdamWמובנה ב-PyTorchמשולב ב-PyTorch 1.11.0אופטימייזר
BERTרכזת Hugging Face (huggingface.co)BERT-base (bert-base-cased)מודלים מאוחזרים
FewRelמאגר רשמי של FewRel (GitHub) / ויקיפדיה100 קטגוריות יחס סמנטי, 700 משפטים לכל קטגוריה; חלוקה לאימון/אימות/בדיקה (5:2:3)מאגרי נתונים
ARSCמאגרי נתונים ציבוריים לניתוח סנטימנט חוצה תחומים (GitHub/ACL Anthology)23 קטגוריות מוצרים של אמזון, 69 משימות ניתוח סנטימנט בינארי; חלוקה לאימון/אימות/בדיקה (4:2:3)מאגרי נתונים
Reuters-21578מאגר למידת מכונות של UCI / ארכיון רשמי של Reuters21,578 מאמרי חדשות, 90 קטגוריות נושאיות; שיטת חלוקת ModApteמאגרי נתונים
ArXivAPI ציבורית של ArXiv (arxiv.org)תקצירים של מאמרים במדעי המחשב; חלוקה לאימון/אימות/בדיקה (7:2:1)מאגרי נתונים
Tokenizerרכזת Hugging Face (huggingface.co)מפרק BERT-base-casedכלים חיוניים נוספים
Gitאתר האינטרנט הרשמי של Git (git-scm.com)הגרסה היציבה האחרונהכלים חיוניים נוספים

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wen, J., Liu, P. A classification method for English texts based on hybrid recurrent neural network and graph construction in social recommendation systems. IEEE Syst J. 17 (4), 5272-5279 (2023).
  2. Choudhuri, S., Adeniye, S., Sen, A. Distribution alignment using complement entropy objective and adaptive consensus-based label refinement for partial domain adaptation. Artif. Intell. Appl. 1 (1), 43-51 (2023).
  3. Li, X., Jia, L. English text topic classification using BERT-based model. J. Comput. Methods Sci. Eng. 25 (1), 669-684 (2025).
  4. Peng, B., Zhang, T., Han, K., Zhang, Z., Ma, Y., et al. BVMHA: text classification model with variable multihead hybrid attention based on BERT. J. Intell. Fuzzy Syst. 46 (1), 1443-1454 (2024).
  5. De Santis, E., Martino, A., Rizzi, A. Human versus machine intelligence: assessing natural language generation models through complex systems theory. IEEE Trans. Pattern Anal. Mach. Intell. 46 (7), 4812-4829 (2024).
  6. Zhang, R. Multilingual pretrained based multi-feature fusion model for English text classification. Comput. Sci. Inf. Syst. 22 (1), 133-152 (2025).
  7. Madhu, C., et al. Dialectic feature-based fuzzy graph learning for label propagation assisting text classification. IEEE Trans. Fuzzy Syst. 32 (10), 5598-5612 (2024).
  8. Shannaq, B., Boumedyen, A. Optimizing n-gram lengths for cross-linguistic text classification: a comparative analysis of English and Arabic morphosyntactic structures. Int. J. Adv. Appl. Sci. 12 (4), 136-145 (2025).
  9. Lagutina, N. S., Lagutina, K. V., Brederman, A. M., Kasatkina, N. N. Text classification by CEFR levels using machine learning methods and the BERT language model. Autom. Control Comput. Sci. 58 (7), 869-878 (2024).
  10. Rahman, M. H., et al. Optimizing BERT for Bengali emotion classification: evaluating knowledge distillation, pruning, and quantization. Comput. Model. Eng. Sci. 142 (2), 1637-1666 (2025).
  11. Ševerdija, D., et al. Efficient sentence representation learning via knowledge distillation with maximum coding rate reduction. J. Comput. Inf. Technol. 31 (4), 251-266 (2023).
  12. Liu, T., Ren, X., Yin, J., Ni, W. Knowledge distillation with few labeled samples. Data Anal. Knowl. Discov. 8 (1), 104-113 (2024).
  13. Ye, E., et al. Multilingual taxonomic web page categorization through ensemble knowledge distillation. IEEE Trans. Knowl. Data Eng. 36 (11), 6614-6627 (2024).
  14. Sun, G., Li, J., Cheng, Y., Zhang, Z. LMTCSG: multilabel text classification combining sequence-based and GNN-based features. IEEE Trans. Ind. Inform. 21 (1), 849-857 (2025).
  15. Pham, P., Nguyen, L. T. T., Pedrycz, W., Vo, B. Deep learning, graph-based text representation and classification: a survey, perspectives and challenges. Artif. Intell. Rev. 56 (6), 4893-4927 (2023).
  16. Samseer, R. H., et al. A new conceptualization of self as an energetic node in cultural dynamics: transitioning from classical theories to complex systems. Appl. Math. Inf. Sci. 19 (2), 259-270 (2025).
  17. Bentbib, A. H., Boubekraoui, M., Jbilou, K. Extrapolation methods for multilinear PageRank. Numer. Algorithms. 98 (2), 1013-1043 (2025).
  18. Baniata, L. H., Kang, S. Switching self-attention text classification model with innovative reverse positional encoding for right-to-left languages: a focus on Arabic dialects. Mathematics. 12 (6), 1-15 (2024).
  19. Tang, L., Wang, Z., Wang, S., Fan, J., Yue, G. A novel rough semi-supervised k-means algorithm for text clustering. Int. J. Bio-Inspired Comput. 21 (2), 57-68 (2023).
  20. Hu, Z., Li, D., Yang, K., Xu, Y., Peng, B. Optimizing data distributions based on Jensen-Shannon divergence for federated learning. Tsinghua Sci. Technol. 30 (2), 670-681 (2025).
  21. Ling, Y., Nie, F., Yu, W., Li, X. Self-labeling and self-knowledge distillation unsupervised feature selection. IEEE Trans. Knowl. Data Eng. 37 (7), 4270-4284 (2025).
  22. Feng, K., Miao, Y., Li, C., Yuan, Y., Wang, G. Shared growth of graph neural networks via prompted free-direction knowledge distillation. IEEE Trans. Pattern Anal. Mach. Intell. 47 (6), 4377-4394 (2025).
  23. Song, Y., Zhang, P., Huang, W., Zha, Y., Zhang, Y. Flexible temperature parallel distillation for dense object detection: make response-based knowledge distillation great again. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4963-4975 (2025).
  24. Yang, Y., et al. Uncertainty-aware self-knowledge distillation. IEEE Trans. Circuits Syst. Video Technol. 35 (5), 4464-4478 (2025).
  25. Mao, L., Zhao, L., Yu, D., Sun, B. Enterprise-named entity recognition model based on knowledge distillation. J. Comput. Eng. 49 (5), 90-96 (2023).
  26. Chen, Z., Tian, P., Liao, W., Chen, X., Xu, G., et al. Resource-aware knowledge distillation for federated learning. IEEE Trans. Emerg. Top. Comput. 11 (3), 706-719 (2023).
  27. Kuang, Z., Wang, J., Sun, D., Zhao, J., Shi, L., et al. Incremental attribute learning by knowledge distillation method. J. Comput. Des. Eng. 11 (5), 259-283 (2024).
  28. Li, Y., Tian, T., Zhuang, M., Sun, Y. De-biased knowledge distillation framework based on knowledge infusion and label de-biasing techniques. J. Electron. Sci. Technol. 22 (3), 57-68 (2024).
  29. Wang, Z., Wang, L., Huang, C., Sun, S., Luo, X. BERT-based Chinese text classification for emergency management with a novel loss function. Appl. Intell. 53 (9), 10417-10428 (2023).
  30. Braun, A., Kohler, M., Langer, S., Walk, H. Convergence rates for shallow neural networks learned by gradient descent. Bernoulli. 30 (1), 475-502 (2024).
  31. Taha, K., Yoo, P. D., Yeun, C., Taha, A. Text Classification Techniques: A Holistic Review, Observational Analysis, and Experimental Investigation. Big Data Min. Anal. 8 (3), 624-660 (2025).
  32. Zhou, N., Yao, N. M., Li, Q. B. Neural Network Based on Inter-layer Perturbation Strategy for Text Classification. Mach. Intell. Res. 22 (1), 176-188 (2025).
  33. Ige, O. P., Gan, K. H. Ensemble Filter-Wrapper Text Feature Selection Methods for Text Classification. Comput. Model. Eng. Sci. 141 (11), 1847-1865 (2024).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

English Text ClassificationDeep LearningComplex System TheoryGraph Neural NetworkMeta LearningMeta DistillationFew Shot ClassificationCross Domain ClassificationLightweight ModelKnowledge Transfer

מאמרים קשורים