Celem danego protokołu jest poprawna identyfikacja języków na poziomie wyrazowym w tekstach mieszanych kodem angielsko-kokborok, używając modelu nienadzorowanego łączącego słowniki znaków n-gramów i częstotliwości.
Artykuł badawczy
Celem danego protokołu jest poprawna identyfikacja języków na poziomie wyrazowym w tekstach mieszanych kodem angielsko-kokborok, używając modelu nienadzorowanego łączącego słowniki znaków n-gramów i częstotliwości.
Rośnie zapotrzebowanie na model automatycznego wykrywania języka na poziomie słów ze względu na rosnące wykorzystanie tekstu wielojęzycznego. Aby zidentyfikować zdania przełączane i kodowe mieszane w języku kokborok i angielskim na poziomie wyrazowym, proponujemy model nienadzorowany. Opublikowano liczne badania dotyczące tekstów kodowo-mieszanych, w tym dla kilku języków indyjskich. Jednak według naszej wiedzy, nasza praca stanowi pionierskie przedsięwzięcie, będąc pierwszym, które zidentyfikowało języki dla par języków angielsko-kokborok, które nie mają niskich zasobów. Zastosowaliśmy metodę łączenia danych ze słownika częstotliwości z danymi z modelu znakowego n-gramowego. Technika Viterbiego łączy model Markowa z znakami n-gramami z leksykonem częstotliwościowym, co pomaga w precyzyjnym rozpoznawaniu języka na poziomie słów. Proponowana metoda sprawdziła się dobrze, z dokładnością na poziomie słów 93,15%, co jest lepszym wynikiem niż model BiLSTM-CRF (88,5%) i bazowy oparty na regułach (85,3%). To pokazuje skuteczność łączenia leksykonu i metodologii statystycznej w obsłudze języków o niskich zasobach bez polegania na ogromnych anotowanych zbiorach danych.
W tej cyfrowej erze szybki rozwój wielojęzycznej komunikacji z mieszaniem kodów i przełączania kodów na platformach mediów społecznościowych staje się kluczowym elementem komunikacji globalnej. Potrzeba dokładnej identyfikacji języków w treści tekstowej jest kluczowa. Po obserwacji ustaliliśmy, że wiele języków indyjskich, takich jak hindi, bengalski i telugu, zostało już zbadanych w identyfikacji językowej, a inne indyjskie języki o niskich zasobach, takie jak manipuri, bodō i asamski, zostały częściowo pojęte w badaniach nad identyfikacją języków. Jednak wciąż istnieje znaczna luka badawcza w opracowaniu modeli dla Kokborok, języka o niskich zasobach, który jest zarówno językowo, jak i strukturalnie odrębny.
W przeciwieństwie do języków manipuri, assamskiego i bodo o niskich zasobach, kokborok charakteryzuje się dużą różnorodnością ortograficzną i jest zapisywany alfabetem łacińskim lub bengalskim, często zamiennie w komunikacji. Powoduje to wiele niejasności w granicach tokenów, transliteracji i wyodrębnianiu cech na poziomie postaci, co stanowi wyraźne wyzwania i rzadko było rozważane w literaturze. Ponadto Kokborok jest językiem aglutynacyjnym, a jego morfologia obejmuje bogate przedrostki i sufiksy (np. -o, -do, -no) oraz tony fonemyczne, co utrudnia stosowanie istniejących modeli identyfikacji języków kodowych opracowanych w odniesieniu do języków indoaryjskich.
Problemy te są dodatkowo spotęgowane przez media społecznościowe. Mówiący w języku kokborok często mieszają angielskie słowa z tekstem, nie tylko w celu miksowania kodów i przełączania kodów, ale także by zrekompensować brakujące elementy leksykalne w zdaniu kokborok. Prowadzi to do niestandardowych ortografii i kontekstowego użycia słów, co jest cofnięciem dla systemów opartych na regułach lub czysto leksykalnych.
W tym badaniu te luki zostały wypełnione poprzez propozycję modelu nienadzorowanego, który łączy słowniki częstotliwości i prawdopodobieństwa znaków n-gram z ramami dekodowania Viterbiego. Metoda ta koncentruje się szczególnie na złożoności ortograficznej, morfologicznej i kontekstowej pary angielsko-kokborok, dlatego jest jedną z pierwszych obliczeniowych prób systematycznego leczenia i wykrywania barier językowych na poziomie wyrazowym w tym języku o ograniczonych zasobach.
TŁO KOKBOROK
Słowa "Kok", które oznacza język, oraz "Borok", co oznacza człowieka, łączą się, tworząc złożone słowo "Kok-borok", które oznacza człowieka. Termin "Kok-borok" odnosi się do języka używanego przez lud Borok z Tripury, a także mieszkańców sąsiednich krajów Bangladeszu i Mjanmy, a także mieszkańców Mizoram, Manipur i Assam. Język kokborok, używany głównie w Tripurze, jest zapisywany zarówno pismem łacińskim, jak i bengalskim. Większość mówiących po kokboroku preferuje pismo łacińskie nad pismem bengalskim. W rzeczywistości to właśnie podgrupa językowa sino-tybetańskia znana jako tybetańsko-birmańska jest miejscem, gdzie powstał język kokborok. Język Kokborok i język Bodo są subtelnie podobne. 36 odmian języka Kokborok wykazuje subtelne podobieństwa zarówno do języków Bodo, jak i Kachari.
Koloma była znana jako oryginalne pismo Kokborok. Jedynym stanem w Indiach, Tripura, było kontrolowane przez 184 osoby, zanim zostało włączone do Unii Indyjskiej 15 października 1949 roku. Pismo Koloma znalezione w księdze Rajratnakar to to, które służyło do zapisywania narracji historycznych. Później, w XIV wieku, dwóch braminów o imionach Sukreswar i Vaneswar przetłumaczyło ten język na sanskryt, a następnie ponownie na pismo bengalskie. W języku Kokborok występują homofonia rdzenia, ton fonemiczny, morfologia czasowników, szyk wyrazów oraz przyrostki pochodne czasowników.
Z czasem Kokborok spotkał języki takie jak angielski, arabski, bengalski, perski itd. W języku Kokborok można znaleźć różne rodzaje złożonych struktur aglutynujących. Osoby mówiące w języku Kokborok jako ojczystym w Tripurze nie mają łatwego dostępu do informacji, ponieważ język ten nie ma jeszcze szeroko przyjętego pisma, ale nad tym pracują.
W Tripurze mówi się kilkoma dialektami kokboroku. W Tripurze mówi się różnymi dialektami, w tym tripura/tripuri, debbarma, reang, jamatia, uchai, noatia, lusai, kukis, chaimal, halam, santal, lepcha, chakma, khassia, orang, mog i garos. Według raportu spisu ludności z 2011 roku, w Indiach jest 1 011 294 osób mówiących po kokborok, a w Bangladeszu, sąsiednim kraju, ponad 400 000.
PRZEGLĄD LITERATURY
Autorzy opisują swoje trwające badania nad automatyczną identyfikacją języka, wykorzystując nowy zestaw danych postów na Facebooku z kodem hindi, bengalskim i angielskim zmieszanym razem. Eksperymentują z różnymi technikami, takimi jak podejścia oparte na słowniku i klasyfikacja nadzorowana, aby rozpoznać język na poziomie wyrazu, podkreślając znaczenie uwzględniania wskazówek kontekstowych dla dokładnej identyfikacji języka w takich środowiskach.
Artykuł prezentuje zbiór danych tweetów z adnotacjami w celu identyfikacji mowy nienawiści na platformach społecznościowych z wykorzystaniem kodu hindi i angielskiego, wykorzystującego techniki oparte na leksykonie, poziomie znaków i słowach1. W artykule przedstawiono metodę kategoryzacji tekstu odporną na błędy opartą na N-gramach. Po pierwsze, system służy do obliczania profili na podstawie danych zbioru treningowego, takich jak próbki materiałów z grupy dyskusyjnej lub frazy, które odzwierciedlają różne kategorie. Następnie system tworzy profil dla konkretnego dokumentu, który musi zostać sklasyfikowany. Na koniec algorytm oblicza miarę odległości między profilami kategorii a profilem dokumentu. Kategoria, której profil jest najbliższy profilu dokumentu, jest wybierana przez system2.
Porównano kilka technik osadzania słów, w tym modele Continuous Bag of Words oraz Skip-Gram, aby uzyskać wektory cech. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine oraz Logistic Regression wszystkie uzyskały dobre wyniki walidacji krzyżowej3. Podsumowanie wcześniejszych podejść znajduje się w Tabeli 1.
Wykorzystując klasyfikatory oparte na leksykonie, badanie przewyższa istniejące klasyfikatory w trzech parach językowych ocenianych w badaniu: hiszpańsko-angielskim, niderlandzko-angielskim oraz niemiecko-tureckim z zestawami danych z mediów społecznościowych4. Podejście badania wykazuje poprawę odporności modelu pod względem zbieżności i spójności wyników testów, przewyższając obecne techniki analizy nastrojów w tekstach mieszanych kodem o 3,31 procent dokładności5.
W swojej przełomowej pracy statystyczna identyfikacja języka przez Dunninga została po raz pierwszy przedstawiona przez Computing Research Lab na New Mexico State University w Technical Report6. Niniejszy artykuł analizuje różne typy uczenia nadzorowanego za pomocą Ukrytego Modelu Markowa, Metody Klasyfikatora Losowego Lasu, warunkowego pola losowego oraz Naivnego Klasyfikatora Bayesa na podstawie pary językowej danych mieszanych kodem angielsko-telugu7. Artykuł koncentruje się na językach indyjskich, w tym angielskim, Bodo i assamskim, jednocześnie omawiając nowatorskie podejście do rozpoznawania języków w materiałach code-mixed w mediach społecznościowych. Naukowcy wykorzystują dwukierunkową pamięć długotrwałą krótkotrwałą w modelu uczenia głębokiego8.
W tym artykule wykorzystano obszerny zbiór danych dotyczących języka gudżarackiego – w którym gudżaracki jest wymieszany z angielskim i hindi. Stosowali różne klasyfikatory uczenia maszynowego. Wśród nich klasyfikator wektorów wsparcia dawał najlepszą dokładność 92 procent –9.
W osobnym etapie klasyfikacji stosuje się ramy językowe, aby rozróżnić przełączanie kodu od zapożyczania tweetów niderlandzko-angielskich. Korzystając z regułowego LID, maszyn wektorowych wspierających oraz klasyfikatorów drzewa decyzyjnego, dowiadują się, że DTC (micro F1 = 0,95) oraz system LID oparty na regułach (micro F1 = 0,95) osiągają najlepsze10.
Wydajność ich modelu oceniono na podstawie zestawu danych TRAC-1 do wykrywania agresji z przełączaniem kodów, zbioru danych Hinglish Offensive Tweet oraz zbioru klasyfikacji humoru11. Aby poprawić zapamiętywanie w dorosłym przyswajaniu leksykalnym poprzez czytanie, zaproponowano podejście probabilistyczne jako metodologię L2 do tworzenia tekstu code-mixed12. Wbudowany jest moduł słownikowy, który służy do testów różnych nadzorowanych klasyfikatorów w celu kontrolowania miksowania kodu na poziomie słów13.
Wykorzystali różne metryki do analizy wzorców przełączania kodów i odkryli, że zarówno dla hiszpańsko-angielskiego, jak i hindi-angielskiego modele sieci neuronowych osiągały gorsze wyniki niż model warunkowych pól losowych (CRF) odpowiednio o 2,5 i 3,5 punktu procentowego, czylio 14.
Wykorzystując leksykon dwujęzyczny i angielski tekst jako wejście wejściowe, metoda buduje graf czynnikowy nad wzmiankami leksykalnymi, aby uzyskać tekst przełączany kodem, który optymalizuje dany parametr "przyswajalności". W niniejszym artykule starają się lepiej zrozumieć koncepcje zestawu narzędzi CanVEC oparte na parach językowych danych przełączanych kodem hindi i angielskim. Uzyskali wynik F1 na poziomie 87,99 procent z dokładnością 15,16.
Autorzy najpierw analizują mieszanie kodów między językiem gudżarackim a angielskim17, stosując trzyetapowy proces identyfikacji języka każdego tokena, normalizację ortografii i transliterację segmentów z powrotem do ich rodzimych pism. Następnie skupiają się na korpusie18 w języku hindi-angielskim, gdzie wprowadzają nowe algorytmy wykrywania sentymentów dostosowane specjalnie do dwujęzycznych struktur zdaniowych. Aby wspierać kontrolowane eksperymenty, generują syntetyczny tekst zmieszany kodem poprzez trenowanie modeli skip-gram na danych monolingwalnych i mieszanie wyników19.
Następnie zbiór danych mediów społecznościowych konkani-angielski20 jest przetwarzany za pomocą metody identyfikacji na poziomie słów opartej na regułach, osiągając solidne wyniki bez ręcznie adnotowanych danych treningowych21. Poszerzając zakres, jedno z badań wykorzystuje duży zbiór transliteracji angielskiego, hindi, bengalskiego i assamskiego z platform takich jak Facebook22, aby ocenić różne techniki tagowania na poziomie słowa. Na tym bazując na tym, inny frameworkdynamicznie przełącza się między językami, aby z dużą precyzją wykrywać osadzone lub zapożyczone frazy. W dziedzinie rolnictwa komentarze w języku pendżabskim są klasyfikowane za pomocą kilku modeli – wśród nich klasyfikator n-gramowy zapewnia najlepszą dokładność24. W przypadku CMST syngalesko-angielskiego porównywane są uczniowie zespołowi (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression), przy czym Random Forest wychodzi na25 najlepszych wykonawców, podczas gdy osadzenia na poziomie znaków połączone z SVM dają dobre wyniki w parach tamil-angielski i malajalam-angielski26. Wreszcie, Projekt Crúbadán27 przedstawiony jest jako szeroko zakrojona inicjatywa mająca na celu budowę korpusów językowych o ograniczonych zasobach poprzez indeksowanie sieci, co stanowi fundament pod przyszłe badania nad miksowaniem kodu.
| Zbiór danych | Kluczowe wyniki | Dokładność/F1-wynik/Dokładność/Lokalizacja/Przypomnienie |
| Zbiór danych w języku hindi, bengalskim i angielskim zaczerpnięty z postów na Facebooku | Podkreślono wyzwania związane z identyfikacją języka w tekście na poziomie słów w mediach społecznościowych | 89.30% |
| Artykuły prasowe, dokumenty | Skuteczne wykonywane przy użyciu N-gramów do identyfikacji języka | 0.99% |
| Indyjskie zbiory danych kodowo-mieszanych | Wykazanie dobrej dokładności w identyfikacji języka na poziomie słów | Niezgłoszono (NR) |
| Zbiory danych oparte na Wikipedii | Odporne wykrywanie przełączników kodu na poziomie tokenów | Niezgłoszono (NR) |
| Tweety hindi–angielskie | Wyniki Poprawione w klasyfikacji sentymentów hindi i angielskiego Code-Mixed | 0.78% |
| Korpusy wielojęzyczne | Ustalony podstawowy framework identyfikacji języka | 78.00% |
| Code_mixed Dane angielsko-telugu | CRF osiągnął najlepsze wyniki | 89.30% |
| Tekst kodowy w języku angielskio–bodo. | Osiągnięto wysoką dokładność słów | 92.00% |
| Kodowe pisma gudżaracko-hindi | Dokładność rozpoznawania języka na poziomie zdań wynosi ≈92%. | 92.00% |
| Tweety niderlandzko-angielskie | Modele DTC i oparte na regułach osiągnęły F1 ≈0.95 | 95.00% |
| Zbiory danych przełączane kodem | Konkurencyjne wyniki w różnych modelach | Niezgłoszono (NR) |
| Syntetyczny tekst kodowo-zmieszany | Ulepszona leksykalna nauka | Niezgłoszono (NR) |
| Tekst mieszany w kodzie angielsko-kannada | Skuteczny automatyczny LID | Niezgłoszono (NR) |
| TRAC-1, zbiory danych Hinglish | CRF przewyższył wyniki w modelach sieci neuronowych | 91.00% |
| Wielojęzyczne dane online | Dokładna identyfikacja na poziomie słowa Lnaguage | 88.00% |
| Hindi-angielskie media społecznościowe | Wysoka dokładność w rozpoznawaniu języka hindi-angielski | 0.93% |
| Kod angielsko-gudżaracki - mieszany | Efektywne przetwarzanie dwujęzyczne | |
| Zbiory danych z mediami społecznościowymi – kodem mieszanym | Ulepszona detekcja sentymentu | 0.90% |
| Syntetyczne dane kodowe | Reprezentacje silnego osadzenia | Niezgłoszono (NR) |
| Konkani–angielski tekst kodowy w mediach społecznościowych | Wydajność odporna bez adnotacji | 0.89% |
| Zbiór danych code-mixed z Twittera | Ulepszone wykrywanie przełączników | 90.20% |
| Asamski, bengalski, hindi–angielski | Dokładna identyfikacja języków wielojęzycznych | 91.00% |
| Media społecznościowe – tekst kodowy-mieszany | Wynik F1 ≈0,95 | 0.95% |
| Dane mieszane kodowe w języku angielskim–pendżabskim | Model N-gram wypadł najlepiej | 0.88% |
| Dane kodowe mieszane w języku syngalesko-angielskim | RF osiągał najlepszą dokładność | 0.92% |
| Komentarze kodowe na Facebooku | Ulepszony poziom LID na poziomie słów | 0.93% |
| Crúbadán Corpus | Umożliwił badania językowe o niskich zasobach | Niezgłoszono (NR) |
| Zbiory danych code-mixed | Dobre wyniki wykazane w identyfikacji języka na poziomie wyrazowym | 0.94% |
Tabela 1: Podsumowanie literatury języków kodowych.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Teksty zmieszane i kodowe w języku angielskim i kokborok były ręcznie zbierane z lokalnych rozmów i publicznie dostępnych postów na platformach społecznościowych. Nie zebrano żadnych danych osobowych lub wrażliwych. Wszystkie procedury były zgodne z wytycznymi etycznymi instytucji.
3. Projekt i wdrożenie
3.1 Algorytm
3.1.1 Dla każdego tokena w zdaniu (S):
a. Za pomocą słownika częstotliwości oblicza się prawdopodobieństwo leksykalne Plexi .
b. Na podstawie modelu N-gramowego oblicza się prawdopodobieństwo Pchar oparte na znakach
c. Ważona interpolacja obu:
P łączone = λlexi Plexi + λchar Pchar
3.1.2. Kombinacja prawdopodobieństwaP połączona dla każdego tokena została zapisana jako prawdopodobieństwo emisji.
3.1.3. Zastosowanie algorytmu Viterbiego:
a. Dane początkowe prawdopodobieństwa języka startowego.
b. Dla każdego tokena:
i. Oblicz przejścieP liczenia przejścia (kontynuacja w tym samym języku).
orazP switch (prawdopodobieństwo zmiany języka).
ii. Wybierz ścieżkę językową i zmaksymalizuj prawdopodobieństwo sekwencji.
3.1.4. Wyjść sekwencję języka o najwyższym ogólnym prawdopodobieństwie L z maksymalnym prawdopodobieństwem.
3.2 Środowisko obliczeniowe
Implementacja wszystkich eksperymentów została przeprowadzona przy użyciu Pythona 3.10 na platformie Google Colab. System wykorzystywał zestaw podstawowych pakietów Pythona, takich jak NumPy, Pandas i Matplotlib, do przetwarzania i wizualizacji danych oraz scikit-learn (v1.3) do generowania przewidywań i analiz statystycznych. Integracja słownika częstotliwości, modelowanie znaków n-gramów oraz dekodowanie Viterbi zostały zaimplementowane za pomocą niestandardowych skryptów Pythona. Model został wytrenowany i przetestowany na zbiorze danych liczącym 10 000 zdań, z podziałem 70/30 na trening i testowanie.
3.3 Identyfikacja języka
Po tokenizacji zdania moduł identyfikacji języka decyduje, czy każdy token jest w języku Kokborok czy angielskim. Pełna architektura systemu została zilustrowana na Rysunku 1. To przypisanie językowe służy następnie do określenia, które moduły transkrypcyjne są odpowiednie. Łącząc dane z modelu znaków n-gramowych i słownika częstotliwości, określa się język tokena.
Ze względu na istotne różnice ortograficzne między dwoma opisanymi powyżej, klasyfikator wykorzystujący wyłącznie informacje z samego tokena, bez żadnych cech kontekstowych, już dobrze się sprawdza. Jednak po początkowym przypisaniu stosuje się inny klasyfikator wykorzystujący algorytm Viterbiego. Ten drugi klasyfikator zmniejsza błędną klasyfikację homografów międzyjęzycznych i faworyzuje grupowania słów należące do tego samego języka.

Rysunek 1: Wzorce na poziomie wyrazowym i karanie zmian językowych za pomocą algorytmu Viterbi. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 2: Metoda identyfikacji językowej zdania zmieszanych kodowo. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.
Zebraliśmy dane z korpusuCrúbadán 27 do słownika oraz modelu znaków. W tym korpusie występuje wiele języków, w tym wiele języków mniejszościowych, takich jak kokborok.
Ponieważ zbiór danych w korpusie Crúbadán jest niewystarczający do naszych celów, przetestowaliśmy nowy zbiór danych Biblii Kokborok. W porównaniu z innymi językami, dostępnych źródeł jest stosunkowo niewiele. W związku z tym dane dotyczące mieszanych zdań tej pracy zostały zebrane z grup WhatsApp mówiących w języku kokborok, takich jak Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (UE), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung, oraz Tripura Uchoi Youth Association (TUYA).
Łącznie 10 000 zdania mieszanych kodem w języku kokborok i angielskim zebrano z tych grup WhatsApp między sierpniem 2021 a grudniem 2023. Źródła i rozkład domenowy zbioru danych są wymienione w Tabeli 2.
| Nazwa | Łączna liczba słów |
| Słowa biblijne Kokborok | 718883 |
| Zdania kodowe mieszane w języku angielskim i kokborok | 68789 |
Tabela 2: Łączna liczba słów Kokborok.
| Język | Łączna liczba tokenów |
| Kokborok (trp) | 711509 |
| Angielski (ang) | 1767141 |
Tabela 3: Model znaku 2-gramowy.
| Sl. Nie | Użyte zdania Total Code-Mixed |
| 1 | 10,768 |
Tabela 4: Łączna liczba wytrenowanych zdań mieszanych.
Model znaków i słownik zostały zaczerpnięte z korpusu Crúbadán27. Zbiór ten, dostępny dla szerokiego zakresu języków, w tym licznych języków mniejszościowych, powstaje automatycznie poprzez wyszukiwanie w internecie materiałów w języku docelowym. Korpus Kokborok jest szczególnie niewielki, ponieważ podejście zostało pierwotnie stworzone dla Kokboroka.
Chociaż dostępny jest także korpus Kokborok i angielski, celowo nie był on używany ze względu na brak zbiorów danych, szczególnie w zakresie miksowania kodu i przełączania kodu. W korpusie Kokborok występuje także kilka angielskich terminów; niektóre z tych słów ( w tym no, do i o) są częstsze niż w korpusie angielskim.
Słownik i model językowy realizują zadanie niezależnego od poszczególnych wyrazów etykietowania. Nasze zadanie jest porównywalne z zadaniem Kinga i in.28.
Prawdopodobieństwa leksykalnego (lex), znaku (ch) i etykiet słów są wykorzystywane do tworzenia liniowej interpolacji między częstotliwościami składników leksykalnych (ch) i leksykalnych (lex). Połączone (grzebieńowe) prawdopodobieństwo, które z tego wynika, pokazano w równaniu (1) poniżej; szczegółowe parametry interpolacji przedstawiono w Tabeli 3. Strategia interpolacji została przedstawiona na Rysunku 2.
P łączone = λlexi · Plexi + λchar · Pchar (1)
Gdzie 0 ≤ λlexi, λchar ≤ 1; oraz λlexi + λchar = 1. Słowa bez podstawy leksykalnej mają niezwykle niskie, ale niezerowe prawdopodobieństwo leksykalne. Przypuszczalnie, jeśli w obu językach leksykonowych brakuje słowa, do implementacji stosuje się model znaków zamiast prawdopodobieństwa leksykalnego, nawet jeśli λlexi = 1.
Nasza metoda tworzenia modelu znaku opiera się na łańcuchu Markowa znaków n-gram Dunninga (1994). Osiąga się to poprzez zliczenie n-gramów odpowiednio na początku i końcu tokenów, aby oszacować prawdopodobieństwo początkowe i przejściowe.
Poniżej pokazano porównanie wydajności wytrenowanych modeli 2-gramowych i 4-gramowych.
(2)
·
(3)
Początkowe i przejściowe słowa prawdopodobieństwa można pomnożyć, aby uzyskać prawdopodobieństwo wystąpienia słowa przy użyciu modelu językowego (4).
P(〈w1w2w3〉) = P początkowy (〈w1w2) · P przejście (c3|〈w1w2) · Przejście P(〉|W1W2W3) (4)
Język Kokborok jest bardzo bogaty w przedrostki i sufiksy oraz jest językiem morfologicznie aglutynacyjnym, w którym do słów podstawowych dodawane są sufiksy takie jak "o", "do" i "no". 2-gram pomaga skutecznie uchwycić lokalne przejścia morfologiczne na granicach afiksów, podczas gdy 4-gram może uchwycić te słowa Kokborok, które mają dłuższe zależności ortograficzne, występujące w rdzeniach i złożonych, takich jak Phailaidido, Thanlainai i Mwchangkha.
Dotyczy to dużego korpusu, co zwiększa prawdopodobieństwo wystąpienia kilku problemów z rzadkością danych. Dodatkowo, kombinacja znaków może nie pojawiać się we wszystkich przypadkach, co może powodować spadek prawdopodobieństwa do zera. Wygładzanie lambda stosuje się do rozwiązania tego typu problemów, nadając każdemu n-gramowi zawierającemu niewidoczne znaki niewielką wartość o niezerowym prawdopodobieństwie. Wartość lambda jest ustalona na 0,001.
(5)
gdzie N = oznacza ilość różnych obserwacji w n-gramach.
(6)
gdzie D= to liczba wykrytych różnic w n-gramach. Zakłada się, że prawdopodobieństwo istnienia nieobserwowanego n-grama jest takie samo.
(7)
gdzie C oznacza rozmiar znaku.
Początkowe wartości Pcount, λlexi i λchar zostały empirycznie ustalone na podstawie analizy częstotliwości korpusów Kokborok i angielskich. Najpierw zainicjowaliśmy λlexi do 0,5 i ważyliśmy zarówno prawdopodobieństwa leksykalne, jak i znakowe, dzięki czemu oba były równie ważne w pierwszym wydaniu. Ten poziom inicjalizacji pozwolił nam zidentyfikować porównawczą rolę leksykonu i modelu znaków n-gramowych między zbiorami danych.
Parametr przejścia Pcount (kontynuujący w tym samym języku) został ustawiony na 0,6, w zależności od stosunku sekwencji monolingwalnych do punktów przełączania w ręcznie oznaczonym zbiorze danych. Te wartości stanowiły dobry punkt wyjścia do zbieżności podczas strojenia. Następnie doprecyzowanie wszystkich parametrów przeprowadzono poprzez serię powtarzanych prób maksymalizacji współczynnika korelacji Matthewsa (MCC), który jest szczegółowo opisany w sekcji Wyniki.
Identyfikacja kontekstowa
Model kontekstowy wykorzystuje prawdopodobieństwa już zainicjalizowane (Pcount i Pswitch) podczas fazy niezależnej identyfikacji i doprecyzuje je za pomocą sekwencji Viterbiego, aby zmniejszyć niespójności przejść i optymalnie wykryć przełączanie języków.
Wyniki analityczne modelu językowego są zależne od kontekstu i uzyskiwane są głównie przez połączenie aktualnego tokena z kolejnym tokenem oraz wykorzystanie zarówno poprzedniego, jak i obecnego tokena. Ponieważ istnieje możliwość, że dwa słowa o tej samej wartości częstotliwości będą miały podobne znaczenia i spowodowały błędną klasyfikację, zastosowano podejście zależne od kontekstu, aby znaleźć terminy podobieństwa obecne w obu językach.
Niektóre słowa, takie jak "nie", "zrobić", "o", "jest", "jest", "da (dzień)", "idź", "sa (mówi)", "róża", "pierścień" i wiele innych, są podobne w obu językach. W rezultacie może być bardzo trudno zidentyfikować poprawny język, gdy pojawia się taka niejednoznaczność, a czasami języki są błędnie klasyfikowane.
Aby rozwiązać te problemy z identyfikacją języków, przedstawiliśmy zestaw modeli językowych wykorzystujących dyskryminacyjny ukryty model Markowa oraz nadzorowane uczenie maszynowe. Prawdopodobieństwo przejścia dla obu języków jest zakładane jako takie samo. Dla Pcount w tym samym języku, głównym parametrem, który należy zadeklarować, jest prawdopodobieństwo ciągłe. Dzięki temu możemy obliczyć prawdopodobieństwo zmiany języka.
P przełącznik = 1 − Pliczba (8)
Klasyfikacja kontekstowa z użyciem ścieżki Viterbiego pokazana jest na Rysunku 3. Celem algorytmu Viterbiego jest określenie, który z języków sekwencji tokenów jest najlepszy według Pcount i Pswitch.
Algorytm Viterbiego jest stosowany do klasyfikacji kontekstowej. Pcount i Pswitch służą do oznaczania krawędzi, a węzły są oznaczane względną prawdopodobieństwem przypisanym przez pierwszy klasyfikator.
Ze względu na większe prawdopodobieństwo użycia języka Kokborok, przerywana ścieżka byłaby wybrana, jeśli używany byłby tylko pierwszy klasyfikator i nie było dostępnych informacji kontekstowych.
Wpływ dostosowania opartego na kontekście jest zobrazowany na Rysunku 4. Pokazuje to, że w braku informacji kontekstowych drugie, trzecie i piąte słowo w frazie "Next week o phaisidi do" mogłyby być błędnie zidentyfikowane jako angielskie (en) (przerywana ścieżka). Chociaż prawdopodobieństwa są nieco większe dla angielskiego, wartości względne są zbliżone.
Dwie zmiany językowe zostaną ukarane, a prawdopodobieństwo sekwencji będzie niższe niż optymalna ścieżka algorytmu Viterbiego, jeśli uwzględni się także prawdopodobieństwa przejścia. Dlatego tylko słowa, które znacznie częściej pochodzą z drugiego języka – a nie powszechne terminy pojawiające się w obu – mogą wywołać zmiany językowe w krótkich sekwencjach.
Współczynnik korelacji Matthewsa został wybrany jako metryka oceny, ponieważ w porównaniu z innymi wskaźnikami, takimi jak precyzja, przypominanie i dokładność, jest on znacznie bardziej odpowiedni do zadań klasyfikacji binarnej, ponieważ uwzględnia zarówno prawdziwe pozytywne i prawdziwie negatywne, jak również fałszywie pozytywne i fałszywie negatywne.
(9)
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
W Tabeli 4 pokazaliśmy wyniki MCC oraz wyniki strojenia parametrów dla Ptrp , które obliczyły początkową tendencję do rozpoczynania sekwencji słowami Kokborok oraz obliczyły Pcount, czyli prawdopodobieństwo kontynuowania w tym samym języku.
| λ_lex | Pcount = 0,66 | Pcount = 0,70 | Pcount = 0,74 | Pcount = 0,79 | Pcount = 0,82 | Pcount = 0,86 |
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Chociaż sugerowany model wykazuje dokładność 93,15% na poziomie słów, dokładna analiza błędów ujawnia kilka powtarzających się wzorców, które podkreślają wyzwania związane z identyfikacją języka angielskiego i kodu kokborok.
Używanie zapożyczonych i niejednoznacznych słów
Znaczna część błędów wynika z używania zapożyczonych angielskich słów, które stały się powszechne w języku Kokborok. Słowa takie jak no, do, o, go,
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Autorzy nie mają żadnych konfliktów interesów do zgłoszenia.
Chcielibyśmy podziękować lokalnym rodzimym użytkownikom, grupom WhatsApp, organizacjom, związkom studenckim oraz Towarzystwu Biblijnemu Indii za pomoc w uzyskaniu surowego zbioru danych zmieszanych zdań kodowych. Jesteśmy również wdzięczni Wydziałowi Informatyki i Inżynierii Komputerowej w National Institute of Technology w Arunachal Pradesh oraz Lovely Professional University za udostępnienie nam platformy do analizy i testowania naszego zbioru danych.
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| Raspberry Pi 4 | Fundacja Raspberry Pi | RPI4-MODBP-4GB | Wykorzystywane do przetwarzania języka o niskich zasobach |
| Karta MicroSD 64GB | SanDisk | SDSQUAR-064G-GN6MA | Do przechowywania systemów operacyjnych i zbiorów danych |
| Zasilacz 5V/3A | Oficjalne Raspberry Pi | SC0218 | Aby zasilić płytę Pi |
| Mikrofon USB | Boya | BY-M1 | Do wprowadzania dźwięku w zbieraniu danych językowych |
| Monitor (HDMI) | LG | 22MK600M | Wyświetlacz wyjściowy podczas testów |
| Klawiatura i Mouse Combo | Logitech | MK270 | Sterowanie interfejsem |
| Adapter WiFi (jeśli Pi 3) | TP-Link | TL-WN725N | Bezprzewodowy transfer danych (jeśli nie ma wbudowanego WiFi) |
| Python IDE (Thonny) | Open Source | - | IDE do programowania |
| Zbiór danych leksykonu | Budowa na zamówienie | - | Para językowa Kokborok-Angielski |
| N-gramowy zbiór danych | Budowa na zamówienie | Para językowa angielsko-kokborok | |
| Code-Mixed i Code-Switched | Budowa na zamówienie | 10 000 zdań | Zebrane z tekstów z mediów społecznościowych, WhatsAppów, NGO, Biblii itd |
Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.
Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE
Poproś o pozwolenie