Artykuł badawczy

Identyfikacja języków o niskich zasobach dla angielskiego i zdania kodowe kokborok

DOI:

10.3791/69130

2 stycznia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Celem danego protokołu jest poprawna identyfikacja języków na poziomie wyrazowym w tekstach mieszanych kodem angielsko-kokborok, używając modelu nienadzorowanego łączącego słowniki znaków n-gramów i częstotliwości.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Rośnie zapotrzebowanie na model automatycznego wykrywania języka na poziomie słów ze względu na rosnące wykorzystanie tekstu wielojęzycznego. Aby zidentyfikować zdania przełączane i kodowe mieszane w języku kokborok i angielskim na poziomie wyrazowym, proponujemy model nienadzorowany. Opublikowano liczne badania dotyczące tekstów kodowo-mieszanych, w tym dla kilku języków indyjskich. Jednak według naszej wiedzy, nasza praca stanowi pionierskie przedsięwzięcie, będąc pierwszym, które zidentyfikowało języki dla par języków angielsko-kokborok, które nie mają niskich zasobów. Zastosowaliśmy metodę łączenia danych ze słownika częstotliwości z danymi z modelu znakowego n-gramowego. Technika Viterbiego łączy model Markowa z znakami n-gramami z leksykonem częstotliwościowym, co pomaga w precyzyjnym rozpoznawaniu języka na poziomie słów. Proponowana metoda sprawdziła się dobrze, z dokładnością na poziomie słów 93,15%, co jest lepszym wynikiem niż model BiLSTM-CRF (88,5%) i bazowy oparty na regułach (85,3%). To pokazuje skuteczność łączenia leksykonu i metodologii statystycznej w obsłudze języków o niskich zasobach bez polegania na ogromnych anotowanych zbiorach danych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tej cyfrowej erze szybki rozwój wielojęzycznej komunikacji z mieszaniem kodów i przełączania kodów na platformach mediów społecznościowych staje się kluczowym elementem komunikacji globalnej. Potrzeba dokładnej identyfikacji języków w treści tekstowej jest kluczowa. Po obserwacji ustaliliśmy, że wiele języków indyjskich, takich jak hindi, bengalski i telugu, zostało już zbadanych w identyfikacji językowej, a inne indyjskie języki o niskich zasobach, takie jak manipuri, bodō i asamski, zostały częściowo pojęte w badaniach nad identyfikacją języków. Jednak wciąż istnieje znaczna luka badawcza w opracowaniu modeli dla Kokborok, języka o niskich zasobach, który jest zarówno językowo, jak i strukturalnie odrębny.

W przeciwieństwie do języków manipuri, assamskiego i bodo o niskich zasobach, kokborok charakteryzuje się dużą różnorodnością ortograficzną i jest zapisywany alfabetem łacińskim lub bengalskim, często zamiennie w komunikacji. Powoduje to wiele niejasności w granicach tokenów, transliteracji i wyodrębnianiu cech na poziomie postaci, co stanowi wyraźne wyzwania i rzadko było rozważane w literaturze. Ponadto Kokborok jest językiem aglutynacyjnym, a jego morfologia obejmuje bogate przedrostki i sufiksy (np. -o, -do, -no) oraz tony fonemyczne, co utrudnia stosowanie istniejących modeli identyfikacji języków kodowych opracowanych w odniesieniu do języków indoaryjskich.

Problemy te są dodatkowo spotęgowane przez media społecznościowe. Mówiący w języku kokborok często mieszają angielskie słowa z tekstem, nie tylko w celu miksowania kodów i przełączania kodów, ale także by zrekompensować brakujące elementy leksykalne w zdaniu kokborok. Prowadzi to do niestandardowych ortografii i kontekstowego użycia słów, co jest cofnięciem dla systemów opartych na regułach lub czysto leksykalnych.

W tym badaniu te luki zostały wypełnione poprzez propozycję modelu nienadzorowanego, który łączy słowniki częstotliwości i prawdopodobieństwa znaków n-gram z ramami dekodowania Viterbiego. Metoda ta koncentruje się szczególnie na złożoności ortograficznej, morfologicznej i kontekstowej pary angielsko-kokborok, dlatego jest jedną z pierwszych obliczeniowych prób systematycznego leczenia i wykrywania barier językowych na poziomie wyrazowym w tym języku o ograniczonych zasobach.

TŁO KOKBOROK
Słowa "Kok", które oznacza język, oraz "Borok", co oznacza człowieka, łączą się, tworząc złożone słowo "Kok-borok", które oznacza człowieka. Termin "Kok-borok" odnosi się do języka używanego przez lud Borok z Tripury, a także mieszkańców sąsiednich krajów Bangladeszu i Mjanmy, a także mieszkańców Mizoram, Manipur i Assam. Język kokborok, używany głównie w Tripurze, jest zapisywany zarówno pismem łacińskim, jak i bengalskim. Większość mówiących po kokboroku preferuje pismo łacińskie nad pismem bengalskim. W rzeczywistości to właśnie podgrupa językowa sino-tybetańskia znana jako tybetańsko-birmańska jest miejscem, gdzie powstał język kokborok. Język Kokborok i język Bodo są subtelnie podobne. 36 odmian języka Kokborok wykazuje subtelne podobieństwa zarówno do języków Bodo, jak i Kachari.

Koloma była znana jako oryginalne pismo Kokborok. Jedynym stanem w Indiach, Tripura, było kontrolowane przez 184 osoby, zanim zostało włączone do Unii Indyjskiej 15 października 1949 roku. Pismo Koloma znalezione w księdze Rajratnakar to to, które służyło do zapisywania narracji historycznych. Później, w XIV wieku, dwóch braminów o imionach Sukreswar i Vaneswar przetłumaczyło ten język na sanskryt, a następnie ponownie na pismo bengalskie. W języku Kokborok występują homofonia rdzenia, ton fonemiczny, morfologia czasowników, szyk wyrazów oraz przyrostki pochodne czasowników.

Z czasem Kokborok spotkał języki takie jak angielski, arabski, bengalski, perski itd. W języku Kokborok można znaleźć różne rodzaje złożonych struktur aglutynujących. Osoby mówiące w języku Kokborok jako ojczystym w Tripurze nie mają łatwego dostępu do informacji, ponieważ język ten nie ma jeszcze szeroko przyjętego pisma, ale nad tym pracują.

W Tripurze mówi się kilkoma dialektami kokboroku. W Tripurze mówi się różnymi dialektami, w tym tripura/tripuri, debbarma, reang, jamatia, uchai, noatia, lusai, kukis, chaimal, halam, santal, lepcha, chakma, khassia, orang, mog i garos. Według raportu spisu ludności z 2011 roku, w Indiach jest 1 011 294 osób mówiących po kokborok, a w Bangladeszu, sąsiednim kraju, ponad 400 000.

PRZEGLĄD LITERATURY
Autorzy opisują swoje trwające badania nad automatyczną identyfikacją języka, wykorzystując nowy zestaw danych postów na Facebooku z kodem hindi, bengalskim i angielskim zmieszanym razem. Eksperymentują z różnymi technikami, takimi jak podejścia oparte na słowniku i klasyfikacja nadzorowana, aby rozpoznać język na poziomie wyrazu, podkreślając znaczenie uwzględniania wskazówek kontekstowych dla dokładnej identyfikacji języka w takich środowiskach.

Artykuł prezentuje zbiór danych tweetów z adnotacjami w celu identyfikacji mowy nienawiści na platformach społecznościowych z wykorzystaniem kodu hindi i angielskiego, wykorzystującego techniki oparte na leksykonie, poziomie znaków i słowach1. W artykule przedstawiono metodę kategoryzacji tekstu odporną na błędy opartą na N-gramach. Po pierwsze, system służy do obliczania profili na podstawie danych zbioru treningowego, takich jak próbki materiałów z grupy dyskusyjnej lub frazy, które odzwierciedlają różne kategorie. Następnie system tworzy profil dla konkretnego dokumentu, który musi zostać sklasyfikowany. Na koniec algorytm oblicza miarę odległości między profilami kategorii a profilem dokumentu. Kategoria, której profil jest najbliższy profilu dokumentu, jest wybierana przez system2.

Porównano kilka technik osadzania słów, w tym modele Continuous Bag of Words oraz Skip-Gram, aby uzyskać wektory cech. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine oraz Logistic Regression wszystkie uzyskały dobre wyniki walidacji krzyżowej3. Podsumowanie wcześniejszych podejść znajduje się w Tabeli 1.

Wykorzystując klasyfikatory oparte na leksykonie, badanie przewyższa istniejące klasyfikatory w trzech parach językowych ocenianych w badaniu: hiszpańsko-angielskim, niderlandzko-angielskim oraz niemiecko-tureckim z zestawami danych z mediów społecznościowych4. Podejście badania wykazuje poprawę odporności modelu pod względem zbieżności i spójności wyników testów, przewyższając obecne techniki analizy nastrojów w tekstach mieszanych kodem o 3,31 procent dokładności5.

W swojej przełomowej pracy statystyczna identyfikacja języka przez Dunninga została po raz pierwszy przedstawiona przez Computing Research Lab na New Mexico State University w Technical Report6. Niniejszy artykuł analizuje różne typy uczenia nadzorowanego za pomocą Ukrytego Modelu Markowa, Metody Klasyfikatora Losowego Lasu, warunkowego pola losowego oraz Naivnego Klasyfikatora Bayesa na podstawie pary językowej danych mieszanych kodem angielsko-telugu7. Artykuł koncentruje się na językach indyjskich, w tym angielskim, Bodo i assamskim, jednocześnie omawiając nowatorskie podejście do rozpoznawania języków w materiałach code-mixed w mediach społecznościowych. Naukowcy wykorzystują dwukierunkową pamięć długotrwałą krótkotrwałą w modelu uczenia głębokiego8.

W tym artykule wykorzystano obszerny zbiór danych dotyczących języka gudżarackiego – w którym gudżaracki jest wymieszany z angielskim i hindi. Stosowali różne klasyfikatory uczenia maszynowego. Wśród nich klasyfikator wektorów wsparcia dawał najlepszą dokładność 92 procent –9.

W osobnym etapie klasyfikacji stosuje się ramy językowe, aby rozróżnić przełączanie kodu od zapożyczania tweetów niderlandzko-angielskich. Korzystając z regułowego LID, maszyn wektorowych wspierających oraz klasyfikatorów drzewa decyzyjnego, dowiadują się, że DTC (micro F1 = 0,95) oraz system LID oparty na regułach (micro F1 = 0,95) osiągają najlepsze10.

Wydajność ich modelu oceniono na podstawie zestawu danych TRAC-1 do wykrywania agresji z przełączaniem kodów, zbioru danych Hinglish Offensive Tweet oraz zbioru klasyfikacji humoru11. Aby poprawić zapamiętywanie w dorosłym przyswajaniu leksykalnym poprzez czytanie, zaproponowano podejście probabilistyczne jako metodologię L2 do tworzenia tekstu code-mixed12. Wbudowany jest moduł słownikowy, który służy do testów różnych nadzorowanych klasyfikatorów w celu kontrolowania miksowania kodu na poziomie słów13.

Wykorzystali różne metryki do analizy wzorców przełączania kodów i odkryli, że zarówno dla hiszpańsko-angielskiego, jak i hindi-angielskiego modele sieci neuronowych osiągały gorsze wyniki niż model warunkowych pól losowych (CRF) odpowiednio o 2,5 i 3,5 punktu procentowego, czylio 14.

Wykorzystując leksykon dwujęzyczny i angielski tekst jako wejście wejściowe, metoda buduje graf czynnikowy nad wzmiankami leksykalnymi, aby uzyskać tekst przełączany kodem, który optymalizuje dany parametr "przyswajalności". W niniejszym artykule starają się lepiej zrozumieć koncepcje zestawu narzędzi CanVEC oparte na parach językowych danych przełączanych kodem hindi i angielskim. Uzyskali wynik F1 na poziomie 87,99 procent z dokładnością 15,16.

Autorzy najpierw analizują mieszanie kodów między językiem gudżarackim a angielskim17, stosując trzyetapowy proces identyfikacji języka każdego tokena, normalizację ortografii i transliterację segmentów z powrotem do ich rodzimych pism. Następnie skupiają się na korpusie18 w języku hindi-angielskim, gdzie wprowadzają nowe algorytmy wykrywania sentymentów dostosowane specjalnie do dwujęzycznych struktur zdaniowych. Aby wspierać kontrolowane eksperymenty, generują syntetyczny tekst zmieszany kodem poprzez trenowanie modeli skip-gram na danych monolingwalnych i mieszanie wyników19.

Następnie zbiór danych mediów społecznościowych konkani-angielski20 jest przetwarzany za pomocą metody identyfikacji na poziomie słów opartej na regułach, osiągając solidne wyniki bez ręcznie adnotowanych danych treningowych21. Poszerzając zakres, jedno z badań wykorzystuje duży zbiór transliteracji angielskiego, hindi, bengalskiego i assamskiego z platform takich jak Facebook22, aby ocenić różne techniki tagowania na poziomie słowa. Na tym bazując na tym, inny frameworkdynamicznie przełącza się między językami, aby z dużą precyzją wykrywać osadzone lub zapożyczone frazy. W dziedzinie rolnictwa komentarze w języku pendżabskim są klasyfikowane za pomocą kilku modeli – wśród nich klasyfikator n-gramowy zapewnia najlepszą dokładność24. W przypadku CMST syngalesko-angielskiego porównywane są uczniowie zespołowi (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression), przy czym Random Forest wychodzi na25 najlepszych wykonawców, podczas gdy osadzenia na poziomie znaków połączone z SVM dają dobre wyniki w parach tamil-angielski i malajalam-angielski26. Wreszcie, Projekt Crúbadán27 przedstawiony jest jako szeroko zakrojona inicjatywa mająca na celu budowę korpusów językowych o ograniczonych zasobach poprzez indeksowanie sieci, co stanowi fundament pod przyszłe badania nad miksowaniem kodu.

Zbiór danychKluczowe wynikiDokładność/F1-wynik/Dokładność/Lokalizacja/Przypomnienie
Zbiór danych w języku hindi, bengalskim i angielskim zaczerpnięty z postów na FacebookuPodkreślono wyzwania związane z identyfikacją języka w tekście na poziomie słów w mediach społecznościowych89.30%
Artykuły prasowe, dokumentySkuteczne wykonywane przy użyciu N-gramów do identyfikacji języka0.99%
Indyjskie zbiory danych kodowo-mieszanychWykazanie dobrej dokładności w identyfikacji języka na poziomie słówNiezgłoszono (NR)
Zbiory danych oparte na WikipediiOdporne wykrywanie przełączników kodu na poziomie tokenówNiezgłoszono (NR)
Tweety hindi–angielskieWyniki Poprawione w klasyfikacji sentymentów hindi i angielskiego Code-Mixed0.78%
Korpusy wielojęzyczneUstalony podstawowy framework identyfikacji języka78.00%
Code_mixed Dane angielsko-teluguCRF osiągnął najlepsze wyniki89.30%
Tekst kodowy w języku angielskio–bodo.Osiągnięto wysoką dokładność słów92.00%
Kodowe pisma gudżaracko-hindiDokładność rozpoznawania języka na poziomie zdań wynosi ≈92%.92.00%
Tweety niderlandzko-angielskieModele DTC i oparte na regułach osiągnęły F1 ≈0.9595.00%
Zbiory danych przełączane kodemKonkurencyjne wyniki w różnych modelachNiezgłoszono (NR)
Syntetyczny tekst kodowo-zmieszanyUlepszona leksykalna naukaNiezgłoszono (NR)
Tekst mieszany w kodzie angielsko-kannadaSkuteczny automatyczny LIDNiezgłoszono (NR)
TRAC-1, zbiory danych HinglishCRF przewyższył wyniki w modelach sieci neuronowych91.00%
Wielojęzyczne dane onlineDokładna identyfikacja na poziomie słowa Lnaguage88.00%
Hindi-angielskie media społecznościoweWysoka dokładność w rozpoznawaniu języka hindi-angielski0.93%
Kod angielsko-gudżaracki - mieszanyEfektywne przetwarzanie dwujęzyczne
Zbiory danych z mediami społecznościowymi – kodem mieszanymUlepszona detekcja sentymentu0.90%
Syntetyczne dane kodoweReprezentacje silnego osadzeniaNiezgłoszono (NR)
Konkani–angielski tekst kodowy w mediach społecznościowychWydajność odporna bez adnotacji0.89%
Zbiór danych code-mixed z TwitteraUlepszone wykrywanie przełączników90.20%
Asamski, bengalski, hindi–angielskiDokładna identyfikacja języków wielojęzycznych91.00%
Media społecznościowe – tekst kodowy-mieszanyWynik F1 ≈0,950.95%
Dane mieszane kodowe w języku angielskim–pendżabskimModel N-gram wypadł najlepiej0.88%
Dane kodowe mieszane w języku syngalesko-angielskimRF osiągał najlepszą dokładność0.92%
Komentarze kodowe na FacebookuUlepszony poziom LID na poziomie słów0.93%
Crúbadán CorpusUmożliwił badania językowe o niskich zasobachNiezgłoszono (NR)
Zbiory danych code-mixedDobre wyniki wykazane w identyfikacji języka na poziomie wyrazowym0.94%

Tabela 1: Podsumowanie literatury języków kodowych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Teksty zmieszane i kodowe w języku angielskim i kokborok były ręcznie zbierane z lokalnych rozmów i publicznie dostępnych postów na platformach społecznościowych. Nie zebrano żadnych danych osobowych lub wrażliwych. Wszystkie procedury były zgodne z wytycznymi etycznymi instytucji.

3. Projekt i wdrożenie

3.1 Algorytm
3.1.1 Dla każdego tokena w zdaniu (S):
a. Za pomocą słownika częstotliwości oblicza się prawdopodobieństwo leksykalne Plexi .
b. Na podstawie modelu N-gramowego oblicza się prawdopodobieństwo Pchar oparte na znakach
c. Ważona interpolacja obu:
P łączone = λlexi Plexi + λchar Pchar
3.1.2. Kombinacja prawdopodobieństwaP połączona dla każdego tokena została zapisana jako prawdopodobieństwo emisji.
3.1.3. Zastosowanie algorytmu Viterbiego:
a. Dane początkowe prawdopodobieństwa języka startowego.
b. Dla każdego tokena:
i. Oblicz przejścieP liczenia przejścia (kontynuacja w tym samym języku).
orazP switch (prawdopodobieństwo zmiany języka).
ii. Wybierz ścieżkę językową i zmaksymalizuj prawdopodobieństwo sekwencji.
3.1.4. Wyjść sekwencję języka o najwyższym ogólnym prawdopodobieństwie L z maksymalnym prawdopodobieństwem.

3.2 Środowisko obliczeniowe
Implementacja wszystkich eksperymentów została przeprowadzona przy użyciu Pythona 3.10 na platformie Google Colab. System wykorzystywał zestaw podstawowych pakietów Pythona, takich jak NumPy, Pandas i Matplotlib, do przetwarzania i wizualizacji danych oraz scikit-learn (v1.3) do generowania przewidywań i analiz statystycznych. Integracja słownika częstotliwości, modelowanie znaków n-gramów oraz dekodowanie Viterbi zostały zaimplementowane za pomocą niestandardowych skryptów Pythona. Model został wytrenowany i przetestowany na zbiorze danych liczącym 10 000 zdań, z podziałem 70/30 na trening i testowanie.

3.3 Identyfikacja języka
Po tokenizacji zdania moduł identyfikacji języka decyduje, czy każdy token jest w języku Kokborok czy angielskim. Pełna architektura systemu została zilustrowana na Rysunku 1. To przypisanie językowe służy następnie do określenia, które moduły transkrypcyjne są odpowiednie. Łącząc dane z modelu znaków n-gramowych i słownika częstotliwości, określa się język tokena.

Ze względu na istotne różnice ortograficzne między dwoma opisanymi powyżej, klasyfikator wykorzystujący wyłącznie informacje z samego tokena, bez żadnych cech kontekstowych, już dobrze się sprawdza. Jednak po początkowym przypisaniu stosuje się inny klasyfikator wykorzystujący algorytm Viterbiego. Ten drugi klasyfikator zmniejsza błędną klasyfikację homografów międzyjęzycznych i faworyzuje grupowania słów należące do tego samego języka.

figure-protocol-1
Rysunek 1: Wzorce na poziomie wyrazowym i karanie zmian językowych za pomocą algorytmu Viterbi. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

figure-protocol-2
Rysunek 2: Metoda identyfikacji językowej zdania zmieszanych kodowo. Proszę kliknąć tutaj, aby zobaczyć większą wersję tego rysunku.

Zebraliśmy dane z korpusuCrúbadán 27 do słownika oraz modelu znaków. W tym korpusie występuje wiele języków, w tym wiele języków mniejszościowych, takich jak kokborok.

Ponieważ zbiór danych w korpusie Crúbadán jest niewystarczający do naszych celów, przetestowaliśmy nowy zbiór danych Biblii Kokborok. W porównaniu z innymi językami, dostępnych źródeł jest stosunkowo niewiele. W związku z tym dane dotyczące mieszanych zdań tej pracy zostały zebrane z grup WhatsApp mówiących w języku kokborok, takich jak Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (UE), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung, oraz Tripura Uchoi Youth Association (TUYA).

Łącznie 10 000 zdania mieszanych kodem w języku kokborok i angielskim zebrano z tych grup WhatsApp między sierpniem 2021 a grudniem 2023. Źródła i rozkład domenowy zbioru danych są wymienione w Tabeli 2.

NazwaŁączna liczba słów
Słowa biblijne Kokborok718883
Zdania kodowe mieszane w języku angielskim i kokborok68789

Tabela 2: Łączna liczba słów Kokborok.

JęzykŁączna liczba tokenów
Kokborok (trp)711509
Angielski (ang)1767141

Tabela 3: Model znaku 2-gramowy.

Sl. NieUżyte zdania Total Code-Mixed
110,768

Tabela 4: Łączna liczba wytrenowanych zdań mieszanych.

Model znaków i słownik zostały zaczerpnięte z korpusu Crúbadán27. Zbiór ten, dostępny dla szerokiego zakresu języków, w tym licznych języków mniejszościowych, powstaje automatycznie poprzez wyszukiwanie w internecie materiałów w języku docelowym. Korpus Kokborok jest szczególnie niewielki, ponieważ podejście zostało pierwotnie stworzone dla Kokboroka.

Chociaż dostępny jest także korpus Kokborok i angielski, celowo nie był on używany ze względu na brak zbiorów danych, szczególnie w zakresie miksowania kodu i przełączania kodu. W korpusie Kokborok występuje także kilka angielskich terminów; niektóre z tych słów ( w tym no, do i o) są częstsze niż w korpusie angielskim.

Słownik i model językowy realizują zadanie niezależnego od poszczególnych wyrazów etykietowania. Nasze zadanie jest porównywalne z zadaniem Kinga i in.28.

Prawdopodobieństwa leksykalnego (lex), znaku (ch) i etykiet słów są wykorzystywane do tworzenia liniowej interpolacji między częstotliwościami składników leksykalnych (ch) i leksykalnych (lex). Połączone (grzebieńowe) prawdopodobieństwo, które z tego wynika, pokazano w równaniu (1) poniżej; szczegółowe parametry interpolacji przedstawiono w Tabeli 3. Strategia interpolacji została przedstawiona na Rysunku 2.

P łączone = λlexi · Plexi + λchar · Pchar (1)

Gdzie 0 ≤ λlexi, λchar ≤ 1; oraz λlexi + λchar = 1. Słowa bez podstawy leksykalnej mają niezwykle niskie, ale niezerowe prawdopodobieństwo leksykalne. Przypuszczalnie, jeśli w obu językach leksykonowych brakuje słowa, do implementacji stosuje się model znaków zamiast prawdopodobieństwa leksykalnego, nawet jeśli λlexi = 1.

Nasza metoda tworzenia modelu znaku opiera się na łańcuchu Markowa znaków n-gram Dunninga (1994). Osiąga się to poprzez zliczenie n-gramów odpowiednio na początku i końcu tokenów, aby oszacować prawdopodobieństwo początkowe i przejściowe.

Poniżej pokazano porównanie wydajności wytrenowanych modeli 2-gramowych i 4-gramowych.

figure-protocol-3 (2)

figure-protocol-4·

figure-protocol-5 (3)

Początkowe i przejściowe słowa prawdopodobieństwa można pomnożyć, aby uzyskać prawdopodobieństwo wystąpienia słowa przy użyciu modelu językowego (4).

P(〈w1w2w3〉) = P początkowy (〈w1w2) · P przejście (c3|〈w1w2) · Przejście P(〉|W1W2W3) (4)

Język Kokborok jest bardzo bogaty w przedrostki i sufiksy oraz jest językiem morfologicznie aglutynacyjnym, w którym do słów podstawowych dodawane są sufiksy takie jak "o", "do" i "no". 2-gram pomaga skutecznie uchwycić lokalne przejścia morfologiczne na granicach afiksów, podczas gdy 4-gram może uchwycić te słowa Kokborok, które mają dłuższe zależności ortograficzne, występujące w rdzeniach i złożonych, takich jak Phailaidido, Thanlainai i Mwchangkha.

Dotyczy to dużego korpusu, co zwiększa prawdopodobieństwo wystąpienia kilku problemów z rzadkością danych. Dodatkowo, kombinacja znaków może nie pojawiać się we wszystkich przypadkach, co może powodować spadek prawdopodobieństwa do zera. Wygładzanie lambda stosuje się do rozwiązania tego typu problemów, nadając każdemu n-gramowi zawierającemu niewidoczne znaki niewielką wartość o niezerowym prawdopodobieństwie. Wartość lambda jest ustalona na 0,001.

figure-protocol-6 (5)

gdzie N = oznacza ilość różnych obserwacji w n-gramach.

figure-protocol-7 (6)

gdzie D= to liczba wykrytych różnic w n-gramach. Zakłada się, że prawdopodobieństwo istnienia nieobserwowanego n-grama jest takie samo.

figure-protocol-8 (7)

gdzie C oznacza rozmiar znaku.

Początkowe wartości Pcount, λlexi i λchar zostały empirycznie ustalone na podstawie analizy częstotliwości korpusów Kokborok i angielskich. Najpierw zainicjowaliśmy λlexi do 0,5 i ważyliśmy zarówno prawdopodobieństwa leksykalne, jak i znakowe, dzięki czemu oba były równie ważne w pierwszym wydaniu. Ten poziom inicjalizacji pozwolił nam zidentyfikować porównawczą rolę leksykonu i modelu znaków n-gramowych między zbiorami danych.

Parametr przejścia Pcount (kontynuujący w tym samym języku) został ustawiony na 0,6, w zależności od stosunku sekwencji monolingwalnych do punktów przełączania w ręcznie oznaczonym zbiorze danych. Te wartości stanowiły dobry punkt wyjścia do zbieżności podczas strojenia. Następnie doprecyzowanie wszystkich parametrów przeprowadzono poprzez serię powtarzanych prób maksymalizacji współczynnika korelacji Matthewsa (MCC), który jest szczegółowo opisany w sekcji Wyniki.

Identyfikacja kontekstowa
Model kontekstowy wykorzystuje prawdopodobieństwa już zainicjalizowane (Pcount i Pswitch) podczas fazy niezależnej identyfikacji i doprecyzuje je za pomocą sekwencji Viterbiego, aby zmniejszyć niespójności przejść i optymalnie wykryć przełączanie języków.

Wyniki analityczne modelu językowego są zależne od kontekstu i uzyskiwane są głównie przez połączenie aktualnego tokena z kolejnym tokenem oraz wykorzystanie zarówno poprzedniego, jak i obecnego tokena. Ponieważ istnieje możliwość, że dwa słowa o tej samej wartości częstotliwości będą miały podobne znaczenia i spowodowały błędną klasyfikację, zastosowano podejście zależne od kontekstu, aby znaleźć terminy podobieństwa obecne w obu językach.

Niektóre słowa, takie jak "nie", "zrobić", "o", "jest", "jest", "da (dzień)", "idź", "sa (mówi)", "róża", "pierścień" i wiele innych, są podobne w obu językach. W rezultacie może być bardzo trudno zidentyfikować poprawny język, gdy pojawia się taka niejednoznaczność, a czasami języki są błędnie klasyfikowane.

Aby rozwiązać te problemy z identyfikacją języków, przedstawiliśmy zestaw modeli językowych wykorzystujących dyskryminacyjny ukryty model Markowa oraz nadzorowane uczenie maszynowe. Prawdopodobieństwo przejścia dla obu języków jest zakładane jako takie samo. Dla Pcount w tym samym języku, głównym parametrem, który należy zadeklarować, jest prawdopodobieństwo ciągłe. Dzięki temu możemy obliczyć prawdopodobieństwo zmiany języka.

P przełącznik = 1 − Pliczba (8)

Klasyfikacja kontekstowa z użyciem ścieżki Viterbiego pokazana jest na Rysunku 3. Celem algorytmu Viterbiego jest określenie, który z języków sekwencji tokenów jest najlepszy według Pcount i Pswitch.

Algorytm Viterbiego jest stosowany do klasyfikacji kontekstowej. Pcount i Pswitch służą do oznaczania krawędzi, a węzły są oznaczane względną prawdopodobieństwem przypisanym przez pierwszy klasyfikator.

Ze względu na większe prawdopodobieństwo użycia języka Kokborok, przerywana ścieżka byłaby wybrana, jeśli używany byłby tylko pierwszy klasyfikator i nie było dostępnych informacji kontekstowych.

Wpływ dostosowania opartego na kontekście jest zobrazowany na Rysunku 4. Pokazuje to, że w braku informacji kontekstowych drugie, trzecie i piąte słowo w frazie "Next week o phaisidi do" mogłyby być błędnie zidentyfikowane jako angielskie (en) (przerywana ścieżka). Chociaż prawdopodobieństwa są nieco większe dla angielskiego, wartości względne są zbliżone.

Dwie zmiany językowe zostaną ukarane, a prawdopodobieństwo sekwencji będzie niższe niż optymalna ścieżka algorytmu Viterbiego, jeśli uwzględni się także prawdopodobieństwa przejścia. Dlatego tylko słowa, które znacznie częściej pochodzą z drugiego języka – a nie powszechne terminy pojawiające się w obu – mogą wywołać zmiany językowe w krótkich sekwencjach.

Współczynnik korelacji Matthewsa został wybrany jako metryka oceny, ponieważ w porównaniu z innymi wskaźnikami, takimi jak precyzja, przypominanie i dokładność, jest on znacznie bardziej odpowiedni do zadań klasyfikacji binarnej, ponieważ uwzględnia zarówno prawdziwe pozytywne i prawdziwie negatywne, jak również fałszywie pozytywne i fałszywie negatywne.

figure-protocol-9 (9)

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W Tabeli 4 pokazaliśmy wyniki MCC oraz wyniki strojenia parametrów dla Ptrp , które obliczyły początkową tendencję do rozpoczynania sekwencji słowami Kokborok oraz obliczyły Pcount, czyli prawdopodobieństwo kontynuowania w tym samym języku.

λ_lexPcount = 0,66Pcount = 0,70Pcount = 0,74Pcount = 0,79Pcount = 0,82Pcount = 0,86

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Chociaż sugerowany model wykazuje dokładność 93,15% na poziomie słów, dokładna analiza błędów ujawnia kilka powtarzających się wzorców, które podkreślają wyzwania związane z identyfikacją języka angielskiego i kodu kokborok.

Używanie zapożyczonych i niejednoznacznych słów
Znaczna część błędów wynika z używania zapożyczonych angielskich słów, które stały się powszechne w języku Kokborok. Słowa takie jak no, do, o, go,

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają żadnych konfliktów interesów do zgłoszenia.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Chcielibyśmy podziękować lokalnym rodzimym użytkownikom, grupom WhatsApp, organizacjom, związkom studenckim oraz Towarzystwu Biblijnemu Indii za pomoc w uzyskaniu surowego zbioru danych zmieszanych zdań kodowych. Jesteśmy również wdzięczni Wydziałowi Informatyki i Inżynierii Komputerowej w National Institute of Technology w Arunachal Pradesh oraz Lovely Professional University za udostępnienie nam platformy do analizy i testowania naszego zbioru danych.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Raspberry Pi 4Fundacja Raspberry PiRPI4-MODBP-4GBWykorzystywane do przetwarzania języka o niskich zasobach
Karta MicroSD 64GBSanDiskSDSQUAR-064G-GN6MADo przechowywania systemów operacyjnych i zbiorów danych
Zasilacz 5V/3AOficjalne Raspberry PiSC0218Aby zasilić płytę Pi
Mikrofon USBBoyaBY-M1Do wprowadzania dźwięku w zbieraniu danych językowych
Monitor (HDMI)LG22MK600MWyświetlacz wyjściowy podczas testów
Klawiatura i Mouse ComboLogitechMK270Sterowanie interfejsem
Adapter WiFi (jeśli Pi 3)TP-LinkTL-WN725NBezprzewodowy transfer danych (jeśli nie ma wbudowanego WiFi)
Python IDE (Thonny)Open Source-IDE do programowania
Zbiór danych leksykonuBudowa na zamówienie-Para językowa Kokborok-Angielski
N-gramowy zbiór danychBudowa na zamówieniePara językowa angielsko-kokborok
Code-Mixed i Code-SwitchedBudowa na zamówienie10 000 zdańZebrane z tekstów z mediów społecznościowych, WhatsAppów, NGO, Biblii itd

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

J zyki o niskich zasobachj zyk kokborokangielski kokborokdetekcja na poziomie s owan gram znakowyleksykon cz stotliwo citechnika Viterbimodel nienadzorowany
Film wkrótce dostępny

Powiązane artykuły