מאמר מחקר

זיהוי שפה במשאבים נמוכים של אנגלית ומשפטים מעורבים בקוד קוקבורוק

DOI:

10.3791/69130

2 בינואר 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מטרת הפרוטוקול הנתון היא לזהות נכון שפות ברמת מילה בתוך טקסט מעורבב קוד אנגלית-קוקבורוק באמצעות מודל לא מפוקח שמשלב תווים n-גרמים ומילונים בתדרים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

יש צורך גובר במודל לזיהוי שפה אוטומטי ברמת המילה בשל השימוש הגובר בטקסט רב-לשוני. כדי לזהות משפטים מעורבים בקוד ומעורבים בקוד בשפת קוקבורוק ובאנגלית ברמת המילה, אנו מציעים מודל לא מפוקח. פורסמו מחקרים רבים על טקסטים מעורבים בקוד, כולל עבור מספר שפות הודיות. עם זאת, למיטב ידיעתנו, עבודתנו מהווה מאמץ פורץ דרך, והיינו הראשונים לזיהוי שפות לזוגות אנגלית-קוקבורוק בעלי משאבים דלים. השתמשנו בשיטה שממזגת נתונים ממילון תדרים עם נתונים ממודל תווים n-גרם. טכניקת ויטרבי משלבת מודל מרקוב של תו n-גרם עם לקסיקון תדר כדי לסייע בזיהוי מדויק של שפה ברמת המילה. השיטה המוצעת הציגה ביצועים טובים, עם דיוק ברמת המילה של 93.15%, טוב יותר ממודל BiLSTM-CRF של 88.5% ומהבסיס מבוסס הכללים של 85.3%. דבר זה מדגים את היעילות של שילוב לקסיקון ומתודולוגיה סטטיסטית לטיפול בשפות דלות משאבים מבלי להסתמך על מאגרי נתונים מוסערים עצומים.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

בעידן הדיגיטלי הזה, הצמיחה המהירה של תקשורת רב-לשונית במיקס קוד והחלפת קוד בפלטפורמות מדיה חברתית הופכת למרכזית בתקשורת הגלובלית. הצורך בזיהוי מדויק של שפות בתוך תוכן טקסטואלי הוא קריטי. לאחר התצפית, מצאנו ששפות הודיות רבות כמו הינדי, בנגלית וטלוגו כבר נחקרו בזיהוי שפה, ושפות הודיות דלות משאבים כמו מניפורי, בודו ואסאמית טופלו חלקית במחקר זיהוי שפה. עם זאת, עדיין קיים פער מחקרי משמעותי בפיתוח מודלים לקוקבורוק, שפה דלה במשאבים שהיא מובחנת הן מבחינה לשונית והן מבנית.

בניגוד לשפות מניפורי, אסאמית ובודו דלות משאבים, לקוקבורוק יש רמת שונות אורתוגרפית גבוהה והיא נכתבת בכתב רומי או בנגלי, לעיתים לסירוגין בתקשורת. זה יוצר הרבה עמימות בגבולות הטוקנים, בתעתיק ובהפקת תכונות ברמת הדמות, מה שמציב אתגרים מובחנים וכמעט ולא נלקח בחשבון בספרות. יתרה מזאת, קוקבורוק היא שפה אגלוטינטיבית, והמורפולוגיה שלה כוללת קידומות וסיומות עשירות (למשל, -o, -do, -no) וטונים פונמיים, מה שמקשה על יישום מודלים קיימים לזיהוי שפות מעורבות קוד שפותחו ביחס לשפות הודו-אריות.

הבעיות הללו מחמירות עוד יותר על ידי הרשתות החברתיות. דוברי קוקבורוק נוטים לערבב מילים באנגלית בטקסט, לא רק למיקס קוד והחלפת קוד, אלא גם כדי לפצות על חסרים של פריטים לקסיקליים במשפט קוקבורוק. דבר זה מוביל לאורתוגרפיות לא סטנדרטיות ולשימוש הקשור להקשר, מה שמהווה נסיגה למערכות מבוססות כללים או לקסיקאליות טהורות.

במחקר זה, פערים אלו מטופלים על ידי הצעת מודל לא מפוקח המשלב מילוני תדרים והסתברויות תווים n-גרם עם מסגרת פענוח ויטרבי. השיטה מתמקדת במיוחד במורכבויות האורתוגרפיות, המורפולוגיות וההקשריות של זוג אנגלית-קוקבורוק, ולכן היא אחת הניסיונות החישוביים הראשונים לטפל ולזהות באופן שיטתי את מחסומי השפה ברמת המילה בשפה דלה משאבים זו.

רקע על קוקבורוק
המילים "קוק", שמסמלת שפה, ו"בורוק", שמרמזת על אדם, משתלבות ליצירת המילה המורכבת "קוק-בורוק", שמסמלת אדם. המונח "קוק-בורוק" מתייחס לשפה המדוברת על ידי בני הבורוק בטריפורה, וכן על ידי המדינות השכנות בנגלדש ומיאנמר, ותושבי מיזוראם, מניפור ואסאם. שפת הקוקבורוק, המדוברת בעיקר בטריפורה, נכתבת הן בכתבים רומיים והן בבנגליים. הכתב הרומי מועדף על פני הכתב הבנגלי בקרב רוב דוברי הקוקבורוק. למעשה, תת-הקבוצה הלשונית הסינו-טיבטית הידועה כטיבטי-בורמנית היא המקום בו מקור שפת הקוקבורוק. שפת הקוקבורוק ושפת הבודו דומות בעדינות. 36 הווריאציות של שפת הקוקבורוק דומות בעדינות לשתי שפות הבודו והקצ'ארי.

קולומה היה ידוע ככתב הקוקבורוק המקורי. המדינה היחידה בהודו, טריפורה, נשלטה על ידי 184 אנשים לפני שאוחדה לאיחוד ההודי ב-15 באוקטובר 1949. כתב קולומה שנמצא בספר ראג'רטנקר הוא זה ששימש לכתיבת הנרטיבים ההיסטוריים. מאוחר יותר, במאה הארבע עשרה, שני ברהמינים בשם סוקרסוואר וונשוואר תרגמו את השפה לסנסקריט ואז שוב לכתב בנגלי. ישנם הומופוניה של שורש, טון פונמי, מורפולוגיית פועלים, סדר מילים וסיומות נגזרות פועל שנוצרות מהפעלים בשפת קוקבורוק.

עם הזמן, קוקבורוק פגש שפות כמו אנגלית, ערבית, בנגלית, פרסית ועוד. סוגים שונים של מבנים אגלוטנטיים מורכבים ניתן למצוא בשפת קוקבורוק. אנשים המדברים קוקבורוק כשפת אם בטריפורה אינם יכולים לגשת בקלות למידע כי השפה עדיין לא מאומצת בכתב רחב, אך זה נמצא בתהליך עבודה.

ישנם מספר ניבים של קוקבורוק המדוברים בטריפורה. בטריפורה מדוברים ניבים שונים, כולל טריפורה/טריפורי, דברמה, ריאנג, ג'מטיה, אוצ'אי, נואטיה, לוסאי, קוקיס, צ'יימל, הלאם, סנטל, לפצ'ה, צ'קמה, חסיה, אורנג, מוג וגרוס. לפי דוח מפקד האוכלוסין משנת 2011, ישנם 1,011,294 דוברי קוקבורוק בהודו ויותר מ-400,000 בבנגלדש, מדינה שכנה.

סקירת ספרות
המחברים מתארים את מחקרם המתמשך על זיהוי שפה אוטומטי באמצעות מאגר נתונים חדש של פוסטים בפייסבוק עם קוד משולב בהינדי, בנגלית ואנגלית. הם מנסים טכניקות שונות, כגון גישות מבוססות מילון וסיווג מפוקח, לזיהוי שפה ברמת המילה, ומדגישים את החשיבות של התחשבות ברמזים הקשריים לזיהוי שפה מדויק בסביבות כאלה.

המאמר מציג מאגר נתונים של ציוצים עם הערות לצורך זיהוי דיבור שנאה בפלטפורמות מדיה חברתית עם שילוב קוד הינדי-אנגליהמשתמש בטכניקות מבוססות לקסיקונים, רמת תווים ומילים. שיטת סיווג טקסט סובלת לשגיאות המבוססת על N-גרמים מוצגת במאמר. ראשית, המערכת משמשת לחישוב פרופילים באמצעות נתוני סט אימונים, כגון דגימות של חומר או ביטויים של קבוצות חדשות, המשקפים את הקטגוריות השונות. לאחר מכן, המערכת יוצרת פרופיל למסמך הספציפי שיש לסווג. לבסוף, האלגוריתם מחשב את מדידת המרחק בין כל פרופיל קטגוריה לבין פרופיל המסמך. הקטגוריה שפרופילה הקרוב ביותר לפרופיל המסמך נבחרת על ידי המערכת2.

מספר טכניקות הטמעת מילים, כולל Continuous Bag of Words ו-Skip-Gram, הושוו כדי ליצור וקטורי תכונות. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine ו-Logistic Regression כולם הניבו ציוני אימות צולב טובים3. סיכום של הגישות הקודמות מופיע בטבלה 1.

באמצעות מסווגים מבוססי לקסיקונים, המחקר עולה על מסווגים קיימים בשלוש זוגות שפות שנבדקו במחקר: ספרדית-אנגלית, הולנדית-אנגלית, וגרמנית-טורקית עם מערכי נתונים ברשתות החברתיות4. הגישה של המחקר מראה שיפור בעמידות המודל מבחינת התכנסות ועקביות בביצועי המבחן, ומצטיין על הטכניקות הנוכחיות לניתוח סנטימנטים בטקסטים מעורבים ב-3.31 אחוז דיוק5.

בעבודתם פורצת הדרך, הזיהוי הסטטיסטי של שפה של דאנינג הוצג לראשונה על ידי מעבדת מחקר המחשוב באוניברסיטת מדינת ניו מקסיקו בדוח טכני6. מאמר זה מנתח סוגים שונים של למידה מפוקחת באמצעות מודל מרקוב נסתר, שיטת מסווג יער אקראי, שדה אקראי מותנה, ומסווג בייס נאיבי, בהתבססעל זוג השפה של נתונים מעורבים בקוד אנגלית-טלוגו. המאמר מתמקד בשפות הודיות, כולל אנגלית, בודו ואסאמזית, תוך דיון בגישה חדשנית לזיהוי שפות בחומר מדיה חברתית מעורב בקוד. החוקרים משתמשים בזיכרון דו-כיווני ארוך-טווח קצר במודל למידה עמוקה8.

במאמר זה הם השתמשו במאגר נתונים משמעותי הקשור לשפה הגוג'ראטית – שבה השפה הגוג'ראטית מעורבבת עם אנגלית והינדי. הם השתמשו במגוון מסווגי למידת מכונה. מתוכם, מסווג וקטורי התמיכה נתן את הדיוק הטוב ביותר של דיוק של 92אחוז.

מסגרת לשונית משמשת בשלב הסיווג הנפרד להבחנה בין החלפת קוד לבין השאלה של ציוצים הולנדית-אנגלית. באמצעות LID מבוססי כללים, מכונות וקטוריות תמיכה ומסווגי עץ החלטות, הם לומדים ש-DTC (micro F1 = 0.95) ומערכת LID מבוססת כללים (micro F1 = .95) מבצעים אתה-10 הטובים ביותר.

ביצועי המודל שלהם הוערכו באמצעות מאגר הנתונים TRAC-1 לזיהוי אגרסיביות מקוד-ממותג, מאגר הציוץ Hinglish Offensive, ומערך סיווג הומור11. כדי לשפר את השימור ברכישת לקסיקלית במבוגרים באמצעות קריאה, הוצעה גישה הסתברותית כמתודולוגיה לשפת 2 ליצירת טקסט מעורבבקוד 12. מודול מילון משולב ומשמש לביצוע בדיקות על מסווגים מפוקחים שונים במטרה לשלוט במיקס קוד ברמת מילים13.

הם השתמשו במגוון מדדים לניתוח דפוסי החלפת קוד וגילו שעבור ספרדית-אנגלית והינדי-אנגלית, מודלים של רשת עצבית ביצעו ביצועים גרועים יותר ממודל השדות האקראיים המותנים (CRF) בפער של 2.5 ו-3.5 נקודות אחוז, בהתאמה14.

באמצעות לקסיקון דו-לשוני וטקסט באנגלית כקלט, השיטה בונה גרף גורמים מעל אזכורים לקסיקליים כדי לייצר טקסט מקוד-מתג שמייעל פרמטר "למידה" נתון. במאמר זה, הם שואפים להבין טוב יותר את מושגי ארגז הכלים CanVEC בהתבסס על זוגות השפה של נתוני קוד-מיתוג בהינדי-אנגלית. הם השיגו בהצלחה ציון F1 של 87.99 אחוז דיוקב-15.16.

המחברים בוחנים תחילה ערבוב קוד בין גוג'ראטיתלאנגלית 17, תוך יישום צינור תלת-שלבי לזיהוי שפת כל טוקן, נרמול האורתוגרפיה ותעתיק קטעים חזרה לכתב האם שלהם. לאחר מכן הם משנים את המיקוד לקורפוס הינדי-אנגלי18, שם הם מציגים אלגוריתמים חדשים לזיהוי רגשות המותאמים במיוחד למבני משפטים דו-לשוניים. כדי לתמוך בניסויים מבוקרים, הם מייצרים טקסט מעורבב בקוד סינתטי על ידי אימון מודלים של דילוג-גרם על נתונים חד-לשוניים ומיזוג הפלטים19.

לאחר מכן, מערך נתונים של מדיה חברתית קונקנית-אנגלית20 מעובד באמצעות שיטת זיהוי מבוססת חוקים ברמת מילה, ומשיג ביצועים עמידים ללא נתוני אימון עם הערות ידניות21. בהרחבת ההיקף, מחקר אחד מנצל קורפוס מתועתק גדול של אנגלית, הינדי, בנגלית ואסאמית מפלטפורמות כמו Facebook22 כדי להעריך מגוון טכניקות תיוג ברמת מילה. בהתבסס על כך, מסגרת נוספת23 מחליפה דינמית בין שפות כדי לזהות ביטויים מוטמעים או מושאלים בדיוק גבוה. בתחום החקלאות, תגובות פנג'אבי-אנגלית מסווגות באמצעות מספר מודלים – ביניהם, מסווג n-גרם מספק את הדיוק הטובביותר 24. עבור CMST סינהלי-אנגלית, לומדים קבוצתיים (יער אקראי, SVM, בייז נאיבי, עץ החלטות, רגרסיה לוגיסטית) משווים, כאשר יער רנדומי יוצא כמוביל25, בעוד שהטבעות ברמת דמות יחד עם SVMs משיגות תוצאות חזקות בזוגות26 טמילית-אנגלית ומלאיאלאם-אנגלית. לבסוף, פרויקט Crúbadán27 מוצג כמאמץ רחב היקף לבניית קורפורות שפות עם משאבים מוגבלים על ידי סריקת האינטרנט, ומניח את היסודות למחקר עתידי במיקס קוד.

מערך נתוניםתוצאות מרכזיותדיוק/ציון F1/דיוק/פרספקטיה/זיכרון
מאגר נתונים הינדי–בנגלי–אנגלי שנלקח מפוסטים בפייסבוקהדגיש את אתגרי זיהוי השפה בטקסט ברשתות חברתיות ברמת מילים.89.30%
מאמרי חדשות, מסמכיםביצוע יעיל באמצעות N-גרמים לזיהוי שפה0.99%
מערכי נתונים מעורבים בקוד הודיהדגמת הדיוק הטוב בזיהוי שפה ברמת מילהלא דווח (NR)
מערכי נתונים מבוססי ויקיפדיהזיהוי מתג קוד ברמת טוקן חזקלא דווח (NR)
ציוצים בהינדי–אנגליתביצועים משופרים בסיווג רגשי של הודית ואנגלית מעורבים בקוד0.78%
קורפוסים רב-לשונייםמסגרת יסוד לזיהוי שפה שהוקמה78.00%
Code_mixed נתונים באנגלית–טלוגוCRF השיג את הביצועים הטובים ביותר89.30%
טקסט מעורבב בקוד אנגלית–בודוהושגה דיוק גבוה ברמת מילה92.00%
כתב גוג'ראטי–הינדי מעורבב בקודדיוק זיהוי שפה ברמת המשפט הוא ≈92%92.00%
ציוצים הולנדיים–אנגלייםמודלים מבוססי DTC וכללים השיגו דירוג F1 ≈0.9595.00%
מערכי נתונים מקוד-ממותגיםביצועים תחרותיים בין דגמיםלא דווח (NR)
טקסט מעורבב בקוד סינתטישיפור בלמידת הלקסיקליותלא דווח (NR)
טקסט מעורבב בין אנגלית לקנאדהLID אוטומטי אפקטיבילא דווח (NR)
TRAC-1, מערכי הנתונים של Hinglishה-CRF הצטיין במודלים של רשת עצבית91.00%
נתונים מקוונים רב-לשונייםזיהוי מדויק ברמת המילה Lnaguage88.00%
מדיה חברתית הינדית–אנגליתדיוק גבוה בזיהוי שפה של הינדי-אנגלית0.93%
קוד אנגלי–גוג'ראטי - מעורבעיבוד דו-לשוני יעיל
מערכי נתונים מעורבים בקוד מדיה חברתיתשיפור בזיהוי הסנטימנט0.90%
נתונים סינתטיים מעורבים בקודייצוגי הטמעה חזקיםלא דווח (NR)
טקסט מדיה חברתית מעורב בקוד קונקני–אנגליביצועים עמידים ללא הערות0.89%
מערך נתונים מעורב בקוד מטוויטרזיהוי משופר של מתגים90.20%
אסאמית–בנגלית–הינדי–אנגליתזיהוי שפה רב-לשוני מדויק91.00%
טקסט מעורב קוד מדיה חברתיתציון F1 ≈0.950.95%
נתונים מעורבים בקוד אנגלית–פנג'אבימודל N-גרם הציג את הביצועים הטובים ביותר0.88%
נתונים מעורבים בקוד סינהלי–אנגליRF השיג את הדיוק הטוב ביותר0.92%
תגובות מעורבות בקוד פייסבוקLID משופר ברמת המילה0.93%
קורפוס קרובאדאןאפשר מחקר שפה דל-משאביםלא דווח (NR)
מערכי נתונים מעורבים בקודביצועים טובים מוצגים ברמת המילה Language Identification0.94%

טבלה 1: תקציר ספרות בשפות מעורבת בקוד.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הטקסט המעורבב והקוד-סוויץ' באנגלית ובקוקבורוק נאסף ידנית משיחות מקומיות ופוסטים זמינים ברשתות החברתיות. לא נאסף מידע אישי מזהה או רגיש. כל ההליכים פעלו לפי קווים מנחים אתיים מוסדיים.

3. עיצוב ויישום

3.1 אלגוריתם
3.1.1 עבור כל אסימון במשפט (S):
a. באמצעות מילון התדרים, מחושבת ההסתברות הלקסיקלית Plexi .
b. בהתבסס על מודל N-גרם, מחושבת ההסתברות המבוססת על תווים Pchar
ג. אינטרפולציה משוקללת של שניהם:
Pמשולב = λlexi Plexi + λchar Pchar
3.1.2. שילוב ההסתברות Pעבור כל אסימון נשמר כהסתברות פליטה.
3.1.3. יישום אלגוריתם ויטרבי:
a. בהינתן ראשוני עם הסתברויות שפה התחלתיות.
b. לכל טוקן:
i. לחשב את מעברמספר P (המשך באותה שפה).
ו-P switch (סבירות להחלפת שפה).
ii. בחר את נתיב השפה ומקסום את הסתברות הרצף.
3.1.4. להוציא את רצף השפה L עם ההסתברות הכוללת הגבוהה ביותר.

3.2 סביבה חישובית
המימוש של כל הניסויים נעשה באמצעות פייתון 3.10 בפלטפורמת Google Colab. המערכת השתמשה בחבילות פייתון בסיסיות כמו NumPy, Pandas ו-Matplotlib לעיבוד והמחשת נתונים, וב-scikit-learn (v1.3) לחיזוי וניתוחים סטטיסטיים. אינטגרציה של מילון תדרים, מידול n-גרם תווים ופענוח Viterbi יושמו באמצעות סקריפטים מותאמים אישית של פייתון. המודל אומן ונבדק על בסיס נתונים של 10,000 משפטים, עם חלוקה של 70/30 לאימון ובבדיקות.

3.3 זיהוי שפה
לאחר שמשפט עבר טוקניזציה, מודול זיהוי השפה מחליט אם כל טוקן הוא בקוקבורוק או באנגלית. ארכיטקטורת המערכת המלאה מוצגת באיור 1. הקצאת שפה זו משמשת לקביעת אילו מודולי תעתיק מתאימים. על ידי מיזוג נתונים ממודל תו n-גרם ומילון תדר, נקבעת שפת האסימון.

בגלל ההבדלים האורתוגרפיים המשמעותיים בין שתי השפות שתוארו לעיל, מסווג המשתמש רק במידע מהאסימון עצמו, ללא תכונות הקשריות, כבר מתפקד היטב. עם זאת, לאחר ההקצאה הראשונית, מיושם מסווג נוסף המשתמש באלגוריתם ויטרבי. מסווג שני זה מפחית סיווג שגוי של הומוגרפים בין-לשוניים ומעדיף קבוצות מילים השייכות לאותה שפה.

figure-protocol-1
איור 1: דפוסים ברמת מילה והענשת החלפות שפה באמצעות ריתם האלגוריתם של ויטרבי. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של איור זה.  

figure-protocol-2
איור 2: שיטה לזיהוי שפה של משפטים מעורבים בקוד. אנא לחצו כאן כדי לצפות בגרסה רחבה יותר של איור זה.

אספנו את הנתונים מקורפוס Crúbadán27 עבור המילון ומודל התווים. שפות רבות, כולל שפות מיעוט רבות כמו קוקבורוק, נמצאות בקורפוס זה.

מכיוון שמערך הנתונים בקורפוס של קרובאדאן אינו מספיק למטרתנו, בדקנו מאגר נתונים חדש של תנ"ך קוקבורוק. בהשוואה לשפות אחרות, יש מעט מאוד מקורות זמינים. בהתאם לכך, הנתונים למשפטים מעורבים במאמר זה נאספו מקבוצות וואטסאפ דוברות קוקבורוק כגון Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, קרישנה נגר (EU), Uchoi Christian Fellowship (UCF), טיפרה קוסראנג בודול, Tribal Engineering Society, המכון הלאומי לטכנולוגיה סטודנטים בורוק, Information Yarung ו-Tripura Uchoi Youth Association (TUYA).

בסך הכל נאספו 10,000 משפטים מעורבים בקוד בקוקבורוק ובאנגלית מקבוצות הוואטסאפ הללו בין אוגוסט 2021 לדצמבר 2023. המקורות וההתפלגות של מאגר הנתונים מפורטים בטבלה 2.

שםסך כל המילים
מילות התנ"ך בקוקבורוק718883
משפטים מעורבים בקוד באנגלית וקוקבורוק68789

טבלה 2: סך כל המילים בקוקבורוק.

שפהסך כל האסימונים
קוקבורוק (trp)711509
אנגלית (en)1767141

טבלה 3: מודל דמות במשקל 2 גרם.

סל. לאסך כל המשפטים מעורבים בקוד
110,768

טבלה 4: סך כל המשפטים המעורבים שנלמדו.

מודל התווים והמילון נלקחו מקורפוס Crúbadán27. אוסף זה, הנגיש למגוון רחב של שפות, כולל שפות מיעוט רבות, נוצר אוטומטית על ידי חיפוש באינטרנט אחר חומרים בשפת היעד. קורפוס קוקבורוק בפרט קטן יחסית כי הגישה נוצרה במקור עבור קוקבורוק.

למרות שגם קורפוס של Kokborok ואנגלית זמין, הוא לא נעשה בשימוש במכוון בשל מחסור במאגרי נתונים, במיוחד במונחים של ערבוב קודים והפיכת קודים. ישנם מספר מונחים באנגלית גם בקורפוס קוקבורוק; חלק מהמילים הללו (כולל no, do ו-o) נפוצות יותר מאשר בקורפוס האנגלי.

המילון ומודל השפה מבצעים את משימת התיוג הבלתי תלוי במילים בודדות. המשימה שלנו דומה לזו של קינג ואחרים. 28.

הסתברויות הלקסיקליות (lexical (lex), תו (ch) ותווית מילים משמשות ליצירת אינטרפולציה ליניארית בין תדירויות רכיבי הלקסיקלי (ch) והלקסיקלי (lexical). ההסתברות המשולבת (מסרקת) הנובעת מכך מוצגת במשוואה (1) למטה; פרמטרי האינטרפולציה המפורטים מוצגים בטבלה 3. אסטרטגיית האינטרפולציה מוצגת באיור 2.

Pמשולב = λלקסי · Plexi + λchar · Pchar (1)

כאשר 0 ≤ λלקסי, λchar ≤ 1; ו-λלקסי + λchar = 1. מילים ללא בסיס לקסיקלי הן בעלות סבירות לקסיקלית נמוכה מאוד אך לא אפסית. כנראה שבמקרה שמילה נעדרת משתי שפות הלקסיקונים, מודל התווים משמש ליישום במקום ההסתברות הלקסיקלית, גם אם λlexi = 1.

השיטה שלנו לפיתוח מודל הדמות מבוססת על שרשרת מרקוב n-גרם של דאנינג (1994). זה מתבצע על ידי ספירת n-גרמים בתחילת ובסוף הטוקנים, בהתאמה, כדי להעריך את ההסתברויות ההתחלתיות והמעבר.

השוואת הביצועים בין הדגמים המאומנים של 2 גרם ו-4 גרם מוצגת להלן.

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

ניתן להכפיל את המילים ההתחלתיות והמעבריות של הסתברות כדי לקבל את הסבירות למילה באמצעות מודל השפה (4).

P(〈w1w2w3〉) = ראשיP (〈w1w2) · מעבר P (c3|〈w1w2) · מעבר P(〉|W1W2W3) (4)

שפת הקוקבורוק עשירה מאוד בתחיליות וסיומות והיא שפה מורפולוגית אגלוטינטיבית שבה סיומות כמו "o", "do" ו-"no" מתווספות למילים הבסיסיות. ה-2 גרם מסייע בלכידת המעברים המורפולוגיים המקומיים ביעילות בגבולות הסיומת, בעוד ש-4 גרם יכול ללכוד את המילים הקוקבורוקיות שיש להן תלות אורתוגרפית ארוכה יותר במילים שורשיות ומורכבות כמו Phailaidido, Thanlainai ו-Mwchangkha.

זה חל על קורפוס גדול, מה שמעלה את הסבירות למספר בעיות דלילות נתונים. בנוסף, שילוב התווים עשוי שלא להופיע בכל המקרים, מה שעלול לגרום להסתברות להגיע לאפס. החלקת למבדה משמשת לפתרון בעיות מסוג זה על ידי מתן ערך קטן לכל n-גרם המכיל תווים בלתי נראים עם הסתברות שאינה אפס. ערך הלמדה נקבע כ-0.001.

figure-protocol-6  (5)

כאשר N = מייצג את כמות התצפיות המובחנות ב-n-גרמים.

figure-protocol-7   (6)

כאשר D= הוא מספר ההבדלים שזוהו ב-n-גרמים. מניחים שההסתברות ל-n-גרם שלא נצפה היא זהה.

figure-protocol-8   (7)

כאשר C מציין את גודל התו.

הערכים ההתחלתיים של Pcount, λlexi ו-λchar נקבעו אמפירית על ידי ניתוח תדרים של קורפוסי Kokborok והאנגלית. ראשית, אתחלנו את λlexi ל-0.5 ושקילנו גם הסתברויות לקסיקליות וגם מבוססות תווים, כך ששניהם תורמים באופן שווה בריצה הראשונה. רמת אתחול זו אפשרה לנו לזהות את התפקיד היחסי של הלקסיקון ומודל התו n-גרם בין מערכי הנתונים.

פרמטר המעבר Pcount (בהמשך באותה שפה) הוגדר ל-0.6, בהתבסס על היחס בין רצפים חד-לשוניים לנקודות ההחלפה במאגר הנתונים המסומן ידנית. ערכים אלו סיפקו נקודת התחלה טובה להתכנסות במהלך הכיוון. לאחר מכן, בוצעה שיפור כל הפרמטרים באמצעות סדרת ניסויים חוזרים כדי למקסם את מקדם הקורלציה של מת'יוס (MCC), כפי שמפורט בסעיף התוצאות.

זיהוי קונטקסטואלי
המודל ההקשרי משתמש בהסתברויות שכבר אותחלו (Pcount ו-Pswitch) במהלך שלב הזיהוי העצמאי ומחדד אותן באמצעות פענוח רצף Viterbi כך שאי-עקביות במעבר יופחתו והחלפת שפה מזוהה בצורה מיטבית.

הפלט האנליטי של מודל השפה תלוי בהקשר ומושג בעיקר על ידי שילוב האסימון הנוכחי עם האסימון הבא ושימוש גם בטוקנים הקודמים וגם בהווה. מכיוון שיש אפשרות ששתי מילים עם אותו ערך תדירות יהיו בעלות משמעויות דומות ויגרמו לסיווג שגוי, שימשה הגישה התלויה בהקשר כדי למצוא את מונחי הדמיון הקיימים בשתי השפות.

מילים מסוימות, כמו "לא", "דו", "ו", "הן", "דה (יום)", "גו", "סה (אומר)", "ורד", "טבעת" ועוד רבות, דומות בשתי השפות. כתוצאה מכך, קשה מאוד לזהות את השפה הנכונה כאשר מתעוררת עמימות כזו, ולעיתים השפות מסווגות בצורה שגויה.

כדי להתמודד עם בעיות זיהוי שפה אלו, הצגנו סט של מודלים לשוניים באמצעות מודל מרקוב נסתר הבחנה ולמידת מכונה מפוקחת. ההסתברות למעבר בשתי השפות נחשבת זהה. עבור Pcount באותה שפה, ההסתברות המתמשכת היא הפרמטר הראשי שיש להכריז. באמצעות זה, ניתן לחשב את הסבירות להחלפת השפה.

מתג P = 1 − מספר P (8)

סיווג הקשרי באמצעות נתיב ויטרבי מוצג באיור 3. מטרת אלגוריתם ויטרבי היא לקבוע איזו מהשפות של רצפי הטוקנים היא הטובה ביותר לפי Pcount ו-Pswitch.

אלגוריתם ויטרבי מיושם לסיווג הקשרי. Pcount ו-Pswitch משמשים לתיוג קשתות, והצמתים מסומנים לפי הסבירות היחסית שהוקצתה על ידי המסווג הראשון.

עקב הסבירות הגבוהה יותר להשתמש בשפת קוקבורוק, המסלול המקווקו ייבחר אם המסווג הראשון היה היחיד בשימוש ולא היה מידע הקשרי זמין.

השפעת ההתאמה מבוססת הקשר מוצגת באיור 4. דבר זה מדגים כיצד, בהיעדר מידע הקשרי, המילים השנייה, השלישית והחמישית בביטוי "Next week o phaisidi do" מזוהות בטעות כאנגלית (en) (דרך מקווקו). למרות שההסתברויות באנגלית מעט גבוהות יותר, הערכים היחסיים קרובים.

שני שינויים בשפה ייענשו, וההסתברות של הרצף תהיה נמוכה יותר מהמסלול האופטימלי של אלגוריתם ויטרבי אם לוקחים בחשבון גם הסתברויות מעבר. לכן, רק מילים שסביר בהרבה שמקורן בשפה השנייה – ולא מונחים נפוצים שמופיעים בשתיהן – יכולות לגרום לשינויים בשפה ברצפים קצרים.

מקדם הקורלציה של מת'יוס נבחר כמדד ההערכה משום שבהשוואה למדדים אחרים כמו דיוק, שחזור ודיוק, הוא מתאים משמעותית יותר למשימות סיווג בינאריות, שכן הוא לוקח בחשבון חיוביים אמיתיים ושליליים אמיתיים וכן חיוביים שגויים ושליליים שגויים.

figure-protocol-9   (9)

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

בטבלה 4 הצגנו את תוצאות ציוני MCC ותוצאות כיוונון פרמטרים עבור Ptrp שחישבו את ההטיה ההתחלתית לכיוון רצפי התחלה עם מילות קוקברוק וחישבנו את ה-Pcount, שהוא ההסתברות להמשיך באותה שפה.

λ_lexPcount = 0.66Pcount = 0.70Pcount = 0.74Pcount = 0.79Pcount = 0.82מספר נקודות = 0.86Pcount = 0.9...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

בעוד שהמודל המוצע מראה דיוק של 93.15% ברמת המילים, ניתוח מעמיק של שגיאות מגלה מספר דפוסים חוזרים המדגישים את האתגרים בזיהוי שפה מעורבת בין קוד אנגלית-קוקבורוק.

שימוש במילים מושאלות ומילים עמומות
חלק משמעותי מהטעויות נובע משימוש במילים אנגליות מושאלות, שהפכו לנפוצות בשימוש בקוקבורוק. מילים כמו no, do, o, go, ring, rose, ומופיעות לעיתים קרובות בשתי השפות וניתן להש...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין ניגודי עניינים להצהיר עליהם.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ברצוננו להודות לדוברי הילידים המקומיים, לקבוצות וואטסאפ, לארגונים, לאגודות הסטודנטים ולאגודת התנ"ך של הודו על שעזרו לנו להשיג את מאגר הנתונים הגולמי של משפטים מעורבים בקוד. אנו גם מודים למחלקה למדעי המחשב והנדסה במכון הלאומי לטכנולוגיה, ארונאצ'ל פרדש, ולאוניברסיטת לאבלי פרפרשן על שסיפקו לנו את הפלטפורמה לבחון ולבדוק את מערך הנתונים שלנו.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Raspberry Pi 4קרן Raspberry PiRPI4-MODBP-4GBמשמש לעיבוד שפה במשאבים דלים
כרטיס MicroSD 64GBSanDiskSDSQUAR-064G-GN6MAלאחסון מערכת הפעלה ומערך נתונים
ספק כוח 5V/3Aה-Raspberry Pi הרשמיSC0218כדי להפעיל את לוח הפאי
מיקרופון USBבויהBY-M1לקלט אודיו באיסוף נתוני שפה
מסך (HDMI)LG22MK600Mתצוגת פלט במהלך הבדיקה
קלידים & קומבו עכברלוג'יטקMK270בקרת ממשק
דונגל WiFi (אם Pi 3)TP-LinkTL-WN725Nהעברת נתונים אלחוטית (אם אין WiFi מובנה)
Python IDE (Thonny)קוד פתוח-IDE לתכנות
מאגר נתונים של לקסיקוןבהתאמה אישית-זוג קוקבורוק-אנגלית
מערך נתונים של N-gramבהתאמה אישיתזוג שפות אנגלית-קוקבורוק
קוד-מיקס וקוד-סוויץ'בהתאמה אישית10,000 עונשיםנאסף מטקסטים ברשתות החברתיות, גרופים בוואטסאפ, ארגוני NGO, תנ"ך ועוד

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

NViterbi
הסרטון יגיע בקרוב

מאמרים קשורים