מטרת הפרוטוקול הנתון היא לזהות נכון שפות ברמת מילה בתוך טקסט מעורבב קוד אנגלית-קוקבורוק באמצעות מודל לא מפוקח שמשלב תווים n-גרמים ומילונים בתדרים.
מאמר מחקר
מטרת הפרוטוקול הנתון היא לזהות נכון שפות ברמת מילה בתוך טקסט מעורבב קוד אנגלית-קוקבורוק באמצעות מודל לא מפוקח שמשלב תווים n-גרמים ומילונים בתדרים.
יש צורך גובר במודל לזיהוי שפה אוטומטי ברמת המילה בשל השימוש הגובר בטקסט רב-לשוני. כדי לזהות משפטים מעורבים בקוד ומעורבים בקוד בשפת קוקבורוק ובאנגלית ברמת המילה, אנו מציעים מודל לא מפוקח. פורסמו מחקרים רבים על טקסטים מעורבים בקוד, כולל עבור מספר שפות הודיות. עם זאת, למיטב ידיעתנו, עבודתנו מהווה מאמץ פורץ דרך, והיינו הראשונים לזיהוי שפות לזוגות אנגלית-קוקבורוק בעלי משאבים דלים. השתמשנו בשיטה שממזגת נתונים ממילון תדרים עם נתונים ממודל תווים n-גרם. טכניקת ויטרבי משלבת מודל מרקוב של תו n-גרם עם לקסיקון תדר כדי לסייע בזיהוי מדויק של שפה ברמת המילה. השיטה המוצעת הציגה ביצועים טובים, עם דיוק ברמת המילה של 93.15%, טוב יותר ממודל BiLSTM-CRF של 88.5% ומהבסיס מבוסס הכללים של 85.3%. דבר זה מדגים את היעילות של שילוב לקסיקון ומתודולוגיה סטטיסטית לטיפול בשפות דלות משאבים מבלי להסתמך על מאגרי נתונים מוסערים עצומים.
בעידן הדיגיטלי הזה, הצמיחה המהירה של תקשורת רב-לשונית במיקס קוד והחלפת קוד בפלטפורמות מדיה חברתית הופכת למרכזית בתקשורת הגלובלית. הצורך בזיהוי מדויק של שפות בתוך תוכן טקסטואלי הוא קריטי. לאחר התצפית, מצאנו ששפות הודיות רבות כמו הינדי, בנגלית וטלוגו כבר נחקרו בזיהוי שפה, ושפות הודיות דלות משאבים כמו מניפורי, בודו ואסאמית טופלו חלקית במחקר זיהוי שפה. עם זאת, עדיין קיים פער מחקרי משמעותי בפיתוח מודלים לקוקבורוק, שפה דלה במשאבים שהיא מובחנת הן מבחינה לשונית והן מבנית.
בניגוד לשפות מניפורי, אסאמית ובודו דלות משאבים, לקוקבורוק יש רמת שונות אורתוגרפית גבוהה והיא נכתבת בכתב רומי או בנגלי, לעיתים לסירוגין בתקשורת. זה יוצר הרבה עמימות בגבולות הטוקנים, בתעתיק ובהפקת תכונות ברמת הדמות, מה שמציב אתגרים מובחנים וכמעט ולא נלקח בחשבון בספרות. יתרה מזאת, קוקבורוק היא שפה אגלוטינטיבית, והמורפולוגיה שלה כוללת קידומות וסיומות עשירות (למשל, -o, -do, -no) וטונים פונמיים, מה שמקשה על יישום מודלים קיימים לזיהוי שפות מעורבות קוד שפותחו ביחס לשפות הודו-אריות.
הבעיות הללו מחמירות עוד יותר על ידי הרשתות החברתיות. דוברי קוקבורוק נוטים לערבב מילים באנגלית בטקסט, לא רק למיקס קוד והחלפת קוד, אלא גם כדי לפצות על חסרים של פריטים לקסיקליים במשפט קוקבורוק. דבר זה מוביל לאורתוגרפיות לא סטנדרטיות ולשימוש הקשור להקשר, מה שמהווה נסיגה למערכות מבוססות כללים או לקסיקאליות טהורות.
במחקר זה, פערים אלו מטופלים על ידי הצעת מודל לא מפוקח המשלב מילוני תדרים והסתברויות תווים n-גרם עם מסגרת פענוח ויטרבי. השיטה מתמקדת במיוחד במורכבויות האורתוגרפיות, המורפולוגיות וההקשריות של זוג אנגלית-קוקבורוק, ולכן היא אחת הניסיונות החישוביים הראשונים לטפל ולזהות באופן שיטתי את מחסומי השפה ברמת המילה בשפה דלה משאבים זו.
רקע על קוקבורוק
המילים "קוק", שמסמלת שפה, ו"בורוק", שמרמזת על אדם, משתלבות ליצירת המילה המורכבת "קוק-בורוק", שמסמלת אדם. המונח "קוק-בורוק" מתייחס לשפה המדוברת על ידי בני הבורוק בטריפורה, וכן על ידי המדינות השכנות בנגלדש ומיאנמר, ותושבי מיזוראם, מניפור ואסאם. שפת הקוקבורוק, המדוברת בעיקר בטריפורה, נכתבת הן בכתבים רומיים והן בבנגליים. הכתב הרומי מועדף על פני הכתב הבנגלי בקרב רוב דוברי הקוקבורוק. למעשה, תת-הקבוצה הלשונית הסינו-טיבטית הידועה כטיבטי-בורמנית היא המקום בו מקור שפת הקוקבורוק. שפת הקוקבורוק ושפת הבודו דומות בעדינות. 36 הווריאציות של שפת הקוקבורוק דומות בעדינות לשתי שפות הבודו והקצ'ארי.
קולומה היה ידוע ככתב הקוקבורוק המקורי. המדינה היחידה בהודו, טריפורה, נשלטה על ידי 184 אנשים לפני שאוחדה לאיחוד ההודי ב-15 באוקטובר 1949. כתב קולומה שנמצא בספר ראג'רטנקר הוא זה ששימש לכתיבת הנרטיבים ההיסטוריים. מאוחר יותר, במאה הארבע עשרה, שני ברהמינים בשם סוקרסוואר וונשוואר תרגמו את השפה לסנסקריט ואז שוב לכתב בנגלי. ישנם הומופוניה של שורש, טון פונמי, מורפולוגיית פועלים, סדר מילים וסיומות נגזרות פועל שנוצרות מהפעלים בשפת קוקבורוק.
עם הזמן, קוקבורוק פגש שפות כמו אנגלית, ערבית, בנגלית, פרסית ועוד. סוגים שונים של מבנים אגלוטנטיים מורכבים ניתן למצוא בשפת קוקבורוק. אנשים המדברים קוקבורוק כשפת אם בטריפורה אינם יכולים לגשת בקלות למידע כי השפה עדיין לא מאומצת בכתב רחב, אך זה נמצא בתהליך עבודה.
ישנם מספר ניבים של קוקבורוק המדוברים בטריפורה. בטריפורה מדוברים ניבים שונים, כולל טריפורה/טריפורי, דברמה, ריאנג, ג'מטיה, אוצ'אי, נואטיה, לוסאי, קוקיס, צ'יימל, הלאם, סנטל, לפצ'ה, צ'קמה, חסיה, אורנג, מוג וגרוס. לפי דוח מפקד האוכלוסין משנת 2011, ישנם 1,011,294 דוברי קוקבורוק בהודו ויותר מ-400,000 בבנגלדש, מדינה שכנה.
סקירת ספרות
המחברים מתארים את מחקרם המתמשך על זיהוי שפה אוטומטי באמצעות מאגר נתונים חדש של פוסטים בפייסבוק עם קוד משולב בהינדי, בנגלית ואנגלית. הם מנסים טכניקות שונות, כגון גישות מבוססות מילון וסיווג מפוקח, לזיהוי שפה ברמת המילה, ומדגישים את החשיבות של התחשבות ברמזים הקשריים לזיהוי שפה מדויק בסביבות כאלה.
המאמר מציג מאגר נתונים של ציוצים עם הערות לצורך זיהוי דיבור שנאה בפלטפורמות מדיה חברתית עם שילוב קוד הינדי-אנגליהמשתמש בטכניקות מבוססות לקסיקונים, רמת תווים ומילים. שיטת סיווג טקסט סובלת לשגיאות המבוססת על N-גרמים מוצגת במאמר. ראשית, המערכת משמשת לחישוב פרופילים באמצעות נתוני סט אימונים, כגון דגימות של חומר או ביטויים של קבוצות חדשות, המשקפים את הקטגוריות השונות. לאחר מכן, המערכת יוצרת פרופיל למסמך הספציפי שיש לסווג. לבסוף, האלגוריתם מחשב את מדידת המרחק בין כל פרופיל קטגוריה לבין פרופיל המסמך. הקטגוריה שפרופילה הקרוב ביותר לפרופיל המסמך נבחרת על ידי המערכת2.
מספר טכניקות הטמעת מילים, כולל Continuous Bag of Words ו-Skip-Gram, הושוו כדי ליצור וקטורי תכונות. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine ו-Logistic Regression כולם הניבו ציוני אימות צולב טובים3. סיכום של הגישות הקודמות מופיע בטבלה 1.
באמצעות מסווגים מבוססי לקסיקונים, המחקר עולה על מסווגים קיימים בשלוש זוגות שפות שנבדקו במחקר: ספרדית-אנגלית, הולנדית-אנגלית, וגרמנית-טורקית עם מערכי נתונים ברשתות החברתיות4. הגישה של המחקר מראה שיפור בעמידות המודל מבחינת התכנסות ועקביות בביצועי המבחן, ומצטיין על הטכניקות הנוכחיות לניתוח סנטימנטים בטקסטים מעורבים ב-3.31 אחוז דיוק5.
בעבודתם פורצת הדרך, הזיהוי הסטטיסטי של שפה של דאנינג הוצג לראשונה על ידי מעבדת מחקר המחשוב באוניברסיטת מדינת ניו מקסיקו בדוח טכני6. מאמר זה מנתח סוגים שונים של למידה מפוקחת באמצעות מודל מרקוב נסתר, שיטת מסווג יער אקראי, שדה אקראי מותנה, ומסווג בייס נאיבי, בהתבססעל זוג השפה של נתונים מעורבים בקוד אנגלית-טלוגו. המאמר מתמקד בשפות הודיות, כולל אנגלית, בודו ואסאמזית, תוך דיון בגישה חדשנית לזיהוי שפות בחומר מדיה חברתית מעורב בקוד. החוקרים משתמשים בזיכרון דו-כיווני ארוך-טווח קצר במודל למידה עמוקה8.
במאמר זה הם השתמשו במאגר נתונים משמעותי הקשור לשפה הגוג'ראטית – שבה השפה הגוג'ראטית מעורבבת עם אנגלית והינדי. הם השתמשו במגוון מסווגי למידת מכונה. מתוכם, מסווג וקטורי התמיכה נתן את הדיוק הטוב ביותר של דיוק של 92אחוז.
מסגרת לשונית משמשת בשלב הסיווג הנפרד להבחנה בין החלפת קוד לבין השאלה של ציוצים הולנדית-אנגלית. באמצעות LID מבוססי כללים, מכונות וקטוריות תמיכה ומסווגי עץ החלטות, הם לומדים ש-DTC (micro F1 = 0.95) ומערכת LID מבוססת כללים (micro F1 = .95) מבצעים אתה-10 הטובים ביותר.
ביצועי המודל שלהם הוערכו באמצעות מאגר הנתונים TRAC-1 לזיהוי אגרסיביות מקוד-ממותג, מאגר הציוץ Hinglish Offensive, ומערך סיווג הומור11. כדי לשפר את השימור ברכישת לקסיקלית במבוגרים באמצעות קריאה, הוצעה גישה הסתברותית כמתודולוגיה לשפת 2 ליצירת טקסט מעורבבקוד 12. מודול מילון משולב ומשמש לביצוע בדיקות על מסווגים מפוקחים שונים במטרה לשלוט במיקס קוד ברמת מילים13.
הם השתמשו במגוון מדדים לניתוח דפוסי החלפת קוד וגילו שעבור ספרדית-אנגלית והינדי-אנגלית, מודלים של רשת עצבית ביצעו ביצועים גרועים יותר ממודל השדות האקראיים המותנים (CRF) בפער של 2.5 ו-3.5 נקודות אחוז, בהתאמה14.
באמצעות לקסיקון דו-לשוני וטקסט באנגלית כקלט, השיטה בונה גרף גורמים מעל אזכורים לקסיקליים כדי לייצר טקסט מקוד-מתג שמייעל פרמטר "למידה" נתון. במאמר זה, הם שואפים להבין טוב יותר את מושגי ארגז הכלים CanVEC בהתבסס על זוגות השפה של נתוני קוד-מיתוג בהינדי-אנגלית. הם השיגו בהצלחה ציון F1 של 87.99 אחוז דיוקב-15.16.
המחברים בוחנים תחילה ערבוב קוד בין גוג'ראטיתלאנגלית 17, תוך יישום צינור תלת-שלבי לזיהוי שפת כל טוקן, נרמול האורתוגרפיה ותעתיק קטעים חזרה לכתב האם שלהם. לאחר מכן הם משנים את המיקוד לקורפוס הינדי-אנגלי18, שם הם מציגים אלגוריתמים חדשים לזיהוי רגשות המותאמים במיוחד למבני משפטים דו-לשוניים. כדי לתמוך בניסויים מבוקרים, הם מייצרים טקסט מעורבב בקוד סינתטי על ידי אימון מודלים של דילוג-גרם על נתונים חד-לשוניים ומיזוג הפלטים19.
לאחר מכן, מערך נתונים של מדיה חברתית קונקנית-אנגלית20 מעובד באמצעות שיטת זיהוי מבוססת חוקים ברמת מילה, ומשיג ביצועים עמידים ללא נתוני אימון עם הערות ידניות21. בהרחבת ההיקף, מחקר אחד מנצל קורפוס מתועתק גדול של אנגלית, הינדי, בנגלית ואסאמית מפלטפורמות כמו Facebook22 כדי להעריך מגוון טכניקות תיוג ברמת מילה. בהתבסס על כך, מסגרת נוספת23 מחליפה דינמית בין שפות כדי לזהות ביטויים מוטמעים או מושאלים בדיוק גבוה. בתחום החקלאות, תגובות פנג'אבי-אנגלית מסווגות באמצעות מספר מודלים – ביניהם, מסווג n-גרם מספק את הדיוק הטובביותר 24. עבור CMST סינהלי-אנגלית, לומדים קבוצתיים (יער אקראי, SVM, בייז נאיבי, עץ החלטות, רגרסיה לוגיסטית) משווים, כאשר יער רנדומי יוצא כמוביל25, בעוד שהטבעות ברמת דמות יחד עם SVMs משיגות תוצאות חזקות בזוגות26 טמילית-אנגלית ומלאיאלאם-אנגלית. לבסוף, פרויקט Crúbadán27 מוצג כמאמץ רחב היקף לבניית קורפורות שפות עם משאבים מוגבלים על ידי סריקת האינטרנט, ומניח את היסודות למחקר עתידי במיקס קוד.
| מערך נתונים | תוצאות מרכזיות | דיוק/ציון F1/דיוק/פרספקטיה/זיכרון |
| מאגר נתונים הינדי–בנגלי–אנגלי שנלקח מפוסטים בפייסבוק | הדגיש את אתגרי זיהוי השפה בטקסט ברשתות חברתיות ברמת מילים. | 89.30% |
| מאמרי חדשות, מסמכים | ביצוע יעיל באמצעות N-גרמים לזיהוי שפה | 0.99% |
| מערכי נתונים מעורבים בקוד הודי | הדגמת הדיוק הטוב בזיהוי שפה ברמת מילה | לא דווח (NR) |
| מערכי נתונים מבוססי ויקיפדיה | זיהוי מתג קוד ברמת טוקן חזק | לא דווח (NR) |
| ציוצים בהינדי–אנגלית | ביצועים משופרים בסיווג רגשי של הודית ואנגלית מעורבים בקוד | 0.78% |
| קורפוסים רב-לשוניים | מסגרת יסוד לזיהוי שפה שהוקמה | 78.00% |
| Code_mixed נתונים באנגלית–טלוגו | CRF השיג את הביצועים הטובים ביותר | 89.30% |
| טקסט מעורבב בקוד אנגלית–בודו | הושגה דיוק גבוה ברמת מילה | 92.00% |
| כתב גוג'ראטי–הינדי מעורבב בקוד | דיוק זיהוי שפה ברמת המשפט הוא ≈92% | 92.00% |
| ציוצים הולנדיים–אנגליים | מודלים מבוססי DTC וכללים השיגו דירוג F1 ≈0.95 | 95.00% |
| מערכי נתונים מקוד-ממותגים | ביצועים תחרותיים בין דגמים | לא דווח (NR) |
| טקסט מעורבב בקוד סינתטי | שיפור בלמידת הלקסיקליות | לא דווח (NR) |
| טקסט מעורבב בין אנגלית לקנאדה | LID אוטומטי אפקטיבי | לא דווח (NR) |
| TRAC-1, מערכי הנתונים של Hinglish | ה-CRF הצטיין במודלים של רשת עצבית | 91.00% |
| נתונים מקוונים רב-לשוניים | זיהוי מדויק ברמת המילה Lnaguage | 88.00% |
| מדיה חברתית הינדית–אנגלית | דיוק גבוה בזיהוי שפה של הינדי-אנגלית | 0.93% |
| קוד אנגלי–גוג'ראטי - מעורב | עיבוד דו-לשוני יעיל | |
| מערכי נתונים מעורבים בקוד מדיה חברתית | שיפור בזיהוי הסנטימנט | 0.90% |
| נתונים סינתטיים מעורבים בקוד | ייצוגי הטמעה חזקים | לא דווח (NR) |
| טקסט מדיה חברתית מעורב בקוד קונקני–אנגלי | ביצועים עמידים ללא הערות | 0.89% |
| מערך נתונים מעורב בקוד מטוויטר | זיהוי משופר של מתגים | 90.20% |
| אסאמית–בנגלית–הינדי–אנגלית | זיהוי שפה רב-לשוני מדויק | 91.00% |
| טקסט מעורב קוד מדיה חברתית | ציון F1 ≈0.95 | 0.95% |
| נתונים מעורבים בקוד אנגלית–פנג'אבי | מודל N-גרם הציג את הביצועים הטובים ביותר | 0.88% |
| נתונים מעורבים בקוד סינהלי–אנגלי | RF השיג את הדיוק הטוב ביותר | 0.92% |
| תגובות מעורבות בקוד פייסבוק | LID משופר ברמת המילה | 0.93% |
| קורפוס קרובאדאן | אפשר מחקר שפה דל-משאבים | לא דווח (NR) |
| מערכי נתונים מעורבים בקוד | ביצועים טובים מוצגים ברמת המילה Language Identification | 0.94% |
טבלה 1: תקציר ספרות בשפות מעורבת בקוד.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
הטקסט המעורבב והקוד-סוויץ' באנגלית ובקוקבורוק נאסף ידנית משיחות מקומיות ופוסטים זמינים ברשתות החברתיות. לא נאסף מידע אישי מזהה או רגיש. כל ההליכים פעלו לפי קווים מנחים אתיים מוסדיים.
3. עיצוב ויישום
3.1 אלגוריתם
3.1.1 עבור כל אסימון במשפט (S):
a. באמצעות מילון התדרים, מחושבת ההסתברות הלקסיקלית Plexi .
b. בהתבסס על מודל N-גרם, מחושבת ההסתברות המבוססת על תווים Pchar
ג. אינטרפולציה משוקללת של שניהם:
Pמשולב = λlexi Plexi + λchar Pchar
3.1.2. שילוב ההסתברות Pעבור כל אסימון נשמר כהסתברות פליטה.
3.1.3. יישום אלגוריתם ויטרבי:
a. בהינתן ראשוני עם הסתברויות שפה התחלתיות.
b. לכל טוקן:
i. לחשב את מעברמספר P (המשך באותה שפה).
ו-P switch (סבירות להחלפת שפה).
ii. בחר את נתיב השפה ומקסום את הסתברות הרצף.
3.1.4. להוציא את רצף השפה L עם ההסתברות הכוללת הגבוהה ביותר.
3.2 סביבה חישובית
המימוש של כל הניסויים נעשה באמצעות פייתון 3.10 בפלטפורמת Google Colab. המערכת השתמשה בחבילות פייתון בסיסיות כמו NumPy, Pandas ו-Matplotlib לעיבוד והמחשת נתונים, וב-scikit-learn (v1.3) לחיזוי וניתוחים סטטיסטיים. אינטגרציה של מילון תדרים, מידול n-גרם תווים ופענוח Viterbi יושמו באמצעות סקריפטים מותאמים אישית של פייתון. המודל אומן ונבדק על בסיס נתונים של 10,000 משפטים, עם חלוקה של 70/30 לאימון ובבדיקות.
3.3 זיהוי שפה
לאחר שמשפט עבר טוקניזציה, מודול זיהוי השפה מחליט אם כל טוקן הוא בקוקבורוק או באנגלית. ארכיטקטורת המערכת המלאה מוצגת באיור 1. הקצאת שפה זו משמשת לקביעת אילו מודולי תעתיק מתאימים. על ידי מיזוג נתונים ממודל תו n-גרם ומילון תדר, נקבעת שפת האסימון.
בגלל ההבדלים האורתוגרפיים המשמעותיים בין שתי השפות שתוארו לעיל, מסווג המשתמש רק במידע מהאסימון עצמו, ללא תכונות הקשריות, כבר מתפקד היטב. עם זאת, לאחר ההקצאה הראשונית, מיושם מסווג נוסף המשתמש באלגוריתם ויטרבי. מסווג שני זה מפחית סיווג שגוי של הומוגרפים בין-לשוניים ומעדיף קבוצות מילים השייכות לאותה שפה.

איור 1: דפוסים ברמת מילה והענשת החלפות שפה באמצעות ריתם האלגוריתם של ויטרבי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של איור זה.

איור 2: שיטה לזיהוי שפה של משפטים מעורבים בקוד. אנא לחצו כאן כדי לצפות בגרסה רחבה יותר של איור זה.
אספנו את הנתונים מקורפוס Crúbadán27 עבור המילון ומודל התווים. שפות רבות, כולל שפות מיעוט רבות כמו קוקבורוק, נמצאות בקורפוס זה.
מכיוון שמערך הנתונים בקורפוס של קרובאדאן אינו מספיק למטרתנו, בדקנו מאגר נתונים חדש של תנ"ך קוקבורוק. בהשוואה לשפות אחרות, יש מעט מאוד מקורות זמינים. בהתאם לכך, הנתונים למשפטים מעורבים במאמר זה נאספו מקבוצות וואטסאפ דוברות קוקבורוק כגון Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, קרישנה נגר (EU), Uchoi Christian Fellowship (UCF), טיפרה קוסראנג בודול, Tribal Engineering Society, המכון הלאומי לטכנולוגיה סטודנטים בורוק, Information Yarung ו-Tripura Uchoi Youth Association (TUYA).
בסך הכל נאספו 10,000 משפטים מעורבים בקוד בקוקבורוק ובאנגלית מקבוצות הוואטסאפ הללו בין אוגוסט 2021 לדצמבר 2023. המקורות וההתפלגות של מאגר הנתונים מפורטים בטבלה 2.
| שם | סך כל המילים |
| מילות התנ"ך בקוקבורוק | 718883 |
| משפטים מעורבים בקוד באנגלית וקוקבורוק | 68789 |
טבלה 2: סך כל המילים בקוקבורוק.
| שפה | סך כל האסימונים |
| קוקבורוק (trp) | 711509 |
| אנגלית (en) | 1767141 |
טבלה 3: מודל דמות במשקל 2 גרם.
| סל. לא | סך כל המשפטים מעורבים בקוד |
| 1 | 10,768 |
טבלה 4: סך כל המשפטים המעורבים שנלמדו.
מודל התווים והמילון נלקחו מקורפוס Crúbadán27. אוסף זה, הנגיש למגוון רחב של שפות, כולל שפות מיעוט רבות, נוצר אוטומטית על ידי חיפוש באינטרנט אחר חומרים בשפת היעד. קורפוס קוקבורוק בפרט קטן יחסית כי הגישה נוצרה במקור עבור קוקבורוק.
למרות שגם קורפוס של Kokborok ואנגלית זמין, הוא לא נעשה בשימוש במכוון בשל מחסור במאגרי נתונים, במיוחד במונחים של ערבוב קודים והפיכת קודים. ישנם מספר מונחים באנגלית גם בקורפוס קוקבורוק; חלק מהמילים הללו (כולל no, do ו-o) נפוצות יותר מאשר בקורפוס האנגלי.
המילון ומודל השפה מבצעים את משימת התיוג הבלתי תלוי במילים בודדות. המשימה שלנו דומה לזו של קינג ואחרים. 28.
הסתברויות הלקסיקליות (lexical (lex), תו (ch) ותווית מילים משמשות ליצירת אינטרפולציה ליניארית בין תדירויות רכיבי הלקסיקלי (ch) והלקסיקלי (lexical). ההסתברות המשולבת (מסרקת) הנובעת מכך מוצגת במשוואה (1) למטה; פרמטרי האינטרפולציה המפורטים מוצגים בטבלה 3. אסטרטגיית האינטרפולציה מוצגת באיור 2.
Pמשולב = λלקסי · Plexi + λchar · Pchar (1)
כאשר 0 ≤ λלקסי, λchar ≤ 1; ו-λלקסי + λchar = 1. מילים ללא בסיס לקסיקלי הן בעלות סבירות לקסיקלית נמוכה מאוד אך לא אפסית. כנראה שבמקרה שמילה נעדרת משתי שפות הלקסיקונים, מודל התווים משמש ליישום במקום ההסתברות הלקסיקלית, גם אם λlexi = 1.
השיטה שלנו לפיתוח מודל הדמות מבוססת על שרשרת מרקוב n-גרם של דאנינג (1994). זה מתבצע על ידי ספירת n-גרמים בתחילת ובסוף הטוקנים, בהתאמה, כדי להעריך את ההסתברויות ההתחלתיות והמעבר.
השוואת הביצועים בין הדגמים המאומנים של 2 גרם ו-4 גרם מוצגת להלן.
(2)
·
(3)
ניתן להכפיל את המילים ההתחלתיות והמעבריות של הסתברות כדי לקבל את הסבירות למילה באמצעות מודל השפה (4).
P(〈w1w2w3〉) = ראשיP (〈w1w2) · מעבר P (c3|〈w1w2) · מעבר P(〉|W1W2W3) (4)
שפת הקוקבורוק עשירה מאוד בתחיליות וסיומות והיא שפה מורפולוגית אגלוטינטיבית שבה סיומות כמו "o", "do" ו-"no" מתווספות למילים הבסיסיות. ה-2 גרם מסייע בלכידת המעברים המורפולוגיים המקומיים ביעילות בגבולות הסיומת, בעוד ש-4 גרם יכול ללכוד את המילים הקוקבורוקיות שיש להן תלות אורתוגרפית ארוכה יותר במילים שורשיות ומורכבות כמו Phailaidido, Thanlainai ו-Mwchangkha.
זה חל על קורפוס גדול, מה שמעלה את הסבירות למספר בעיות דלילות נתונים. בנוסף, שילוב התווים עשוי שלא להופיע בכל המקרים, מה שעלול לגרום להסתברות להגיע לאפס. החלקת למבדה משמשת לפתרון בעיות מסוג זה על ידי מתן ערך קטן לכל n-גרם המכיל תווים בלתי נראים עם הסתברות שאינה אפס. ערך הלמדה נקבע כ-0.001.
(5)
כאשר N = מייצג את כמות התצפיות המובחנות ב-n-גרמים.
(6)
כאשר D= הוא מספר ההבדלים שזוהו ב-n-גרמים. מניחים שההסתברות ל-n-גרם שלא נצפה היא זהה.
(7)
כאשר C מציין את גודל התו.
הערכים ההתחלתיים של Pcount, λlexi ו-λchar נקבעו אמפירית על ידי ניתוח תדרים של קורפוסי Kokborok והאנגלית. ראשית, אתחלנו את λlexi ל-0.5 ושקילנו גם הסתברויות לקסיקליות וגם מבוססות תווים, כך ששניהם תורמים באופן שווה בריצה הראשונה. רמת אתחול זו אפשרה לנו לזהות את התפקיד היחסי של הלקסיקון ומודל התו n-גרם בין מערכי הנתונים.
פרמטר המעבר Pcount (בהמשך באותה שפה) הוגדר ל-0.6, בהתבסס על היחס בין רצפים חד-לשוניים לנקודות ההחלפה במאגר הנתונים המסומן ידנית. ערכים אלו סיפקו נקודת התחלה טובה להתכנסות במהלך הכיוון. לאחר מכן, בוצעה שיפור כל הפרמטרים באמצעות סדרת ניסויים חוזרים כדי למקסם את מקדם הקורלציה של מת'יוס (MCC), כפי שמפורט בסעיף התוצאות.
זיהוי קונטקסטואלי
המודל ההקשרי משתמש בהסתברויות שכבר אותחלו (Pcount ו-Pswitch) במהלך שלב הזיהוי העצמאי ומחדד אותן באמצעות פענוח רצף Viterbi כך שאי-עקביות במעבר יופחתו והחלפת שפה מזוהה בצורה מיטבית.
הפלט האנליטי של מודל השפה תלוי בהקשר ומושג בעיקר על ידי שילוב האסימון הנוכחי עם האסימון הבא ושימוש גם בטוקנים הקודמים וגם בהווה. מכיוון שיש אפשרות ששתי מילים עם אותו ערך תדירות יהיו בעלות משמעויות דומות ויגרמו לסיווג שגוי, שימשה הגישה התלויה בהקשר כדי למצוא את מונחי הדמיון הקיימים בשתי השפות.
מילים מסוימות, כמו "לא", "דו", "ו", "הן", "דה (יום)", "גו", "סה (אומר)", "ורד", "טבעת" ועוד רבות, דומות בשתי השפות. כתוצאה מכך, קשה מאוד לזהות את השפה הנכונה כאשר מתעוררת עמימות כזו, ולעיתים השפות מסווגות בצורה שגויה.
כדי להתמודד עם בעיות זיהוי שפה אלו, הצגנו סט של מודלים לשוניים באמצעות מודל מרקוב נסתר הבחנה ולמידת מכונה מפוקחת. ההסתברות למעבר בשתי השפות נחשבת זהה. עבור Pcount באותה שפה, ההסתברות המתמשכת היא הפרמטר הראשי שיש להכריז. באמצעות זה, ניתן לחשב את הסבירות להחלפת השפה.
מתג P = 1 − מספר P (8)
סיווג הקשרי באמצעות נתיב ויטרבי מוצג באיור 3. מטרת אלגוריתם ויטרבי היא לקבוע איזו מהשפות של רצפי הטוקנים היא הטובה ביותר לפי Pcount ו-Pswitch.
אלגוריתם ויטרבי מיושם לסיווג הקשרי. Pcount ו-Pswitch משמשים לתיוג קשתות, והצמתים מסומנים לפי הסבירות היחסית שהוקצתה על ידי המסווג הראשון.
עקב הסבירות הגבוהה יותר להשתמש בשפת קוקבורוק, המסלול המקווקו ייבחר אם המסווג הראשון היה היחיד בשימוש ולא היה מידע הקשרי זמין.
השפעת ההתאמה מבוססת הקשר מוצגת באיור 4. דבר זה מדגים כיצד, בהיעדר מידע הקשרי, המילים השנייה, השלישית והחמישית בביטוי "Next week o phaisidi do" מזוהות בטעות כאנגלית (en) (דרך מקווקו). למרות שההסתברויות באנגלית מעט גבוהות יותר, הערכים היחסיים קרובים.
שני שינויים בשפה ייענשו, וההסתברות של הרצף תהיה נמוכה יותר מהמסלול האופטימלי של אלגוריתם ויטרבי אם לוקחים בחשבון גם הסתברויות מעבר. לכן, רק מילים שסביר בהרבה שמקורן בשפה השנייה – ולא מונחים נפוצים שמופיעים בשתיהן – יכולות לגרום לשינויים בשפה ברצפים קצרים.
מקדם הקורלציה של מת'יוס נבחר כמדד ההערכה משום שבהשוואה למדדים אחרים כמו דיוק, שחזור ודיוק, הוא מתאים משמעותית יותר למשימות סיווג בינאריות, שכן הוא לוקח בחשבון חיוביים אמיתיים ושליליים אמיתיים וכן חיוביים שגויים ושליליים שגויים.
(9)
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בטבלה 4 הצגנו את תוצאות ציוני MCC ותוצאות כיוונון פרמטרים עבור Ptrp שחישבו את ההטיה ההתחלתית לכיוון רצפי התחלה עם מילות קוקברוק וחישבנו את ה-Pcount, שהוא ההסתברות להמשיך באותה שפה.
| λ_lex | Pcount = 0.66 | Pcount = 0.70 | Pcount = 0.74 | Pcount = 0.79 | Pcount = 0.82 | מספר נקודות = 0.86 | Pcount = 0.9... |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בעוד שהמודל המוצע מראה דיוק של 93.15% ברמת המילים, ניתוח מעמיק של שגיאות מגלה מספר דפוסים חוזרים המדגישים את האתגרים בזיהוי שפה מעורבת בין קוד אנגלית-קוקבורוק.
שימוש במילים מושאלות ומילים עמומות
חלק משמעותי מהטעויות נובע משימוש במילים אנגליות מושאלות, שהפכו לנפוצות בשימוש בקוקבורוק. מילים כמו no, do, o, go, ring, rose, ומופיעות לעיתים קרובות בשתי השפות וניתן להש...
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
למחברים אין ניגודי עניינים להצהיר עליהם.
ברצוננו להודות לדוברי הילידים המקומיים, לקבוצות וואטסאפ, לארגונים, לאגודות הסטודנטים ולאגודת התנ"ך של הודו על שעזרו לנו להשיג את מאגר הנתונים הגולמי של משפטים מעורבים בקוד. אנו גם מודים למחלקה למדעי המחשב והנדסה במכון הלאומי לטכנולוגיה, ארונאצ'ל פרדש, ולאוניברסיטת לאבלי פרפרשן על שסיפקו לנו את הפלטפורמה לבחון ולבדוק את מערך הנתונים שלנו.
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| Raspberry Pi 4 | קרן Raspberry Pi | RPI4-MODBP-4GB | משמש לעיבוד שפה במשאבים דלים |
| כרטיס MicroSD 64GB | SanDisk | SDSQUAR-064G-GN6MA | לאחסון מערכת הפעלה ומערך נתונים |
| ספק כוח 5V/3A | ה-Raspberry Pi הרשמי | SC0218 | כדי להפעיל את לוח הפאי |
| מיקרופון USB | בויה | BY-M1 | לקלט אודיו באיסוף נתוני שפה |
| מסך (HDMI) | LG | 22MK600M | תצוגת פלט במהלך הבדיקה |
| קלידים & קומבו עכבר | לוג'יטק | MK270 | בקרת ממשק |
| דונגל WiFi (אם Pi 3) | TP-Link | TL-WN725N | העברת נתונים אלחוטית (אם אין WiFi מובנה) |
| Python IDE (Thonny) | קוד פתוח | - | IDE לתכנות |
| מאגר נתונים של לקסיקון | בהתאמה אישית | - | זוג קוקבורוק-אנגלית |
| מערך נתונים של N-gram | בהתאמה אישית | זוג שפות אנגלית-קוקבורוק | |
| קוד-מיקס וקוד-סוויץ' | בהתאמה אישית | 10,000 עונשים | נאסף מטקסטים ברשתות החברתיות, גרופים בוואטסאפ, ארגוני NGO, תנ"ך ועוד |
הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה