Het doel van het gegeven protocol is om woordniveau-talen correct te identificeren binnen de Engels-Kokborok code-gemengde tekst met behulp van een onbewaakt model dat karakter-n-grammen en frequentiewoordenboeken combineert.
Onderzoeksartikel
Het doel van het gegeven protocol is om woordniveau-talen correct te identificeren binnen de Engels-Kokborok code-gemengde tekst met behulp van een onbewaakt model dat karakter-n-grammen en frequentiewoordenboeken combineert.
Er is een groeiende behoefte aan een model voor automatische taaldetectie op woordniveau vanwege het toenemende gebruik van meertalige tekst. Om code-switched en code-mixed zinnen in de Kokborok-taal en Engels op woordniveau te identificeren, stellen we een ongecontroleerd model voor. Talrijke studies over code-gemengde tekst zijn gepubliceerd, onder andere voor verschillende Indiase talen. Voor zover wij weten vertegenwoordigt ons werk echter een pioniersinitiatief, waarbij we als eerste talen identificeerden voor Engels-Kokborok-taalparen met weinig bronnen. We hebben een methode toegepast waarbij gegevens uit een frequentiewoordenboek worden samengevoegd met gegevens uit een karakter n-gram model. De Viterbi-techniek combineert een karakter n-gram Markov-model met een frequentielexicon om nauwkeurige taalidentificatie op woordniveau te ondersteunen. De voorgestelde methode presteerde goed, met een woordnauwkeurigheid van 93,15%, wat beter is dan het BiLSTM-CRF-model van 88,5% en de regelgebaseerde baseline van 85,3%. Dit toont de effectiviteit aan van het combineren van lexicon en statistische methodologie voor het omgaan met talen met weinig middelen zonder afhankelijk te zijn van enorme geannoteerde datasets.
In dit digitale tijdperk wordt de snelle groei van codemixing en codeswitching meertalige communicatie op sociale mediaplatforms steeds belangrijker voor wereldwijde communicatie. De noodzaak van nauwkeurige identificatie van talen binnen tekstuele inhoud is van het grootste belang. Na observatie ontdekten we dat veel Indiase talen zoals Hindi, Bengaals en Telugu al zijn onderzocht in taalidentificatie, en andere Indiase talen met weinig hulpbronnen zoals Manipuri, Bodo en Assamees zijn deels behandeld in taalidentificatieonderzoek. Er is echter nog steeds een aanzienlijke onderzoekskloof bij het ontwikkelen van modellen voor Kokborok, een taal met weinig middelen die zowel taalkundig als structureel onderscheidend is.
In tegenstelling tot Manipuri, Assamees en Bodo talen met weinig bronnen, heeft Kokborok een hoge mate van orthografische variatie en wordt het geschreven in het Romeinse of Bengaalse schrift, vaak door elkaar in communicatie. Dit zorgt voor veel ambiguïteit in de tokengrenzen, transliteratie en feature-extractie op karakterniveau, wat duidelijke uitdagingen met zich meebrengt en zelden in de literatuur is overwogen. Bovendien is Kokborok een agglutinerende taal, en zijn morfologie bevat rijke voorvoegsels en achtervoegsels (bijv. -o, -do, -no) en fonemische tonen, waardoor het moeilijker wordt om bestaande code-gemengde taalidentificatiemodellen toe te passen die zijn ontwikkeld met betrekking tot Indo-Arische talen.
Deze problemen worden verder versterkt door sociale media. Kokborok-sprekers hebben vaak de neiging Engelse woorden in de tekst te mengen, niet alleen voor code-mixing en code-switching, maar ook om ontbrekende lexicale items in de Kokborok-zin te compenseren. Dit leidt tot niet-standaard orthografieën en contextgerelateerd gebruik van woorden, wat een tegenslag is voor regelgebaseerde of puur lexicale systemen.
In deze studie worden deze hiaten aangevuld door een onbegeleid model voor te stellen dat frequentiewoordenboeken en kansen voor teken n-gram combineert met een Viterbi-decodeerkader. De methode richt zich vooral op de orthografische, morfologische en contextuele complexiteiten van het Engels-Kokborok-paar, en is daarmee een van de eerste computationele pogingen om systematisch de taalbarrières op woordniveau in deze taal met weinig middelen te behandelen en te detecteren.
ACHTERGROND VAN KOKBOROK
De woorden "Kok", wat taal betekent, en "Borok," wat menselijk impliceert, vormen samen het samengestelde woord "Kok-borok," dat menselijk aanduidt. De term "Kok-borok" verwijst naar de taal die wordt gesproken door het Borok-volk van Tripura, evenals die in de aangrenzende landen Bangladesh en Myanmar, en de inwoners van Mizoram, Manipur en Assam. De Kokborok-taal, die voornamelijk in Tripura wordt gesproken, wordt geschreven in zowel Romeinse als Bengaalse schriften. Het Romeinse schrift wordt door de meerderheid van de Kokborok-sprekers verkozen boven het Bengaalse schrift. In werkelijkheid is de Sino-Tibetaanse taalsubgroep bekend als Tibeto-Birmaans waar de Kokborok-taal is ontstaan. De Kokborok-taal en de Bodo-taal lijken subtiel op elkaar. De 36 varianten van de Kokborok-taal vertonen subtiele overeenkomsten met zowel de Bodo- als de Kachari-talen.
Koloma stond bekend als het oorspronkelijke Kokborok-schrift. De enige staat in India, Tripura, werd door 184 mensen bestuurd voordat het op 15 oktober 1949 werd verenigd met de Indiase Unie. Het Koloma-schrift dat in het boek Rajratnakar wordt gevonden, is het schrift dat werd gebruikt om de historische verhalen op te schrijven. Later, in de veertiende eeuw, vertaalden twee brahmanen genaamd Sukreswar en Vaneswar de taal naar het Sanskriet en daarna opnieuw naar Bengaalse schriften. Er zijn stamhomofonie, fonemische toon, werkwoordmorfologie, woordvolgorde en werkwoordsafleidingssuffixen die voortkomen uit de werkwoorden in de Kokborok-taal.
In de loop der tijd heeft Kokborok talen als Engels, Arabisch, Bengaals, Perzisch, enzovoort leren kennen. Verschillende soorten ingewikkelde agglutinerende structuren zijn te vinden in de Kokborok-taal. Mensen die Kokborok als moedertaal spreken in Tripura kunnen niet gemakkelijk toegang krijgen tot informatie omdat de taal nog geen breed geaccepteerd schrift heeft, maar hieraan wordt gewerkt.
Er worden verschillende dialecten van Kokborok gesproken in Tripura. In Tripura worden verschillende dialecten gesproken, waaronder Tripura/Tripuri, Debbarma, Reang, Jamatia, Uchai, Noatia, Lusai, Kukis, Chaimal, Halam, Santal, Lepcha, Chakma, Khasia, Orang, Mog en Garos. Volgens het volkstellingsrapport van 2011 zijn er 1.011.294 Kokborok-sprekers in India en meer dan 400.000 in Bangladesh, een buurland.
LITERATUUROVERZICHT
De auteurs beschrijven hun lopende onderzoek naar automatische taalidentificatie met behulp van een nieuwe dataset van Facebook-berichten met gemengde Hindi-, Bengaalse en Engelse code. Ze experimenteren met verschillende technieken, zoals woordenboekgebaseerde benaderingen en begeleide classificatie, voor taalidentificatie op woordniveau, waarmee ze het belang benadrukken van het overwegen van contextuele aanwijzingen voor nauwkeurige taalidentificatie in dergelijke omgevingen.
Het artikel presenteert een dataset van geannoteerde tweets met als doel haatzaaien op sociale mediaplatforms te identificeren met een Hindi-Engelse codemix die gebruikmaakt van lexicon-gebaseerde, teken- en woordniveautechnieken1. Een fouttolerante tekstcategorisatiemethode gebaseerd op N-grammen wordt in het artikel gepresenteerd. Ten eerste wordt het systeem gebruikt om profielen te berekenen met behulp van trainingssetgegevens, zoals voorbeelden van nieuwsgroepmateriaal of -frases, die de verschillende categorieën weerspiegelen. Daarna maakt het systeem een profiel aan voor het specifieke document dat gecategoriseerd moet worden. Ten slotte berekent het algoritme de afstandsmaat tussen elk categorieprofiel en het profiel van het document. De categorie waarvan het profiel het dichtst bij het profiel van het document ligt, wordt gekozen door systeem2.
Verschillende woordembeddingtechnieken, waaronder Continuous Bag of Words en Skip-Gram-modellen, werden vergeleken om featurevectoren te creëren. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine en Logistic Regression leverden allemaal goede cross-validatiescoresop 3. Een samenvatting van eerdere benaderingen is te vinden in Tabel 1.
Met gebruik van lexicon-gebaseerde classificatoren presteert de studie beter dan bestaande classifiers op drie taalcombinaties die in de studie werden geëvalueerd: Spaans-Engels, Nederlands-Engels en Duits-Turks met sociale media-datasets4. De aanpak van de studie toont een verbeterde modelveerkracht op het gebied van convergentie en consistentie in testprestaties, waarbij de huidige technieken voor sentimentanalyse in code-gemengde teksten met 3,31 procent nauwkeurigheid overtreft5.
In hun baanbrekende werk werd Dunnings statistische identificatie van taal voor het eerst gepresenteerd door het Computing Research Lab van de New Mexico State University in Technical Report6. Dit artikel analyseert verschillende soorten supervised learning met behulp van het Hidden Markov Model, Random Forest Classifier Method, Conditional Random Field en Naive Bayes Classifier, gebaseerd op het taalpaar Engels-Telugu code-gemengde data7. Het artikel richt zich op Indiase talen waaronder Engels, Bodo en Assamees, terwijl het een nieuwe benadering bespreekt om talen te herkennen in gecode-mixte sociale media-materiaal. De onderzoekers gebruiken Bidirectioneel Langetermijngeheugen in een deep learning-model8.
In dit artikel hebben zij een omvangrijke dataset gebruikt die betrekking heeft op de Gujarati-taal—waarin de Gujarati-taal wordt gemengd met Engels en Hindi. Ze maakten gebruik van verschillende machine learning-classifiers. Onder hen gaf de Support Vector Classifier de beste nauwkeurigheid van 92 procent nauwkeurigheid9.
In de aparte classificatiefase wordt een taalkundig kader gebruikt om code-switching en het lenen van Nederlands-Engelse tweets te onderscheiden. Met behulp van regelgebaseerde LID, Support Vector Machines en Decision Tree Classifiers leren ze dat de DTC (micro F1 = .95) en het regelgebaseerde LID-systeem (micro F1 = .95) best10 presteren.
De prestaties van hun model werden geëvalueerd met behulp van de code-switched aggressiviteitsdetectie TRAC-1 dataset, de Hinglish Offensive Tweet dataset en de humorclassificatiedataset11. Om het retentie bij volwassen lexicale verwerving door lezen te verbeteren, werd een probabilistische benadering voorgesteld als L2-methodologie voor het produceren van code-gemengde tekst12. Een woordenboekmodule wordt geïntegreerd en gebruikt om tests uit te voeren op verschillende begeleide classifiers om code-mixing op woordniveau te beheersen13.
Ze gebruikten verschillende meetmethoden om code-switching patronen te analyseren en ontdekten dat neurale netwerkmodellen voor zowel Spaans-Engels als Hindi-Engels slechter presteerden dan het Conditional Random Fields (CRF)-model met een marge van respectievelijk 2,5 en 3,5 procentpunten,namelijk 14 procentpunten.
Met een tweetalig lexicon en een Engelse tekst als invoer bouwt de methode een factorgrafiek over lexicale vermeldingen om een code-geschakelde tekst te produceren die een gegeven "leerbaarheids"-parameter optimaliseert. In dit artikel proberen zij de concepten van de CanVEC-toolbox beter te begrijpen op basis van de taalparen van Hindi-Engelse code-switched data. Ze behaalden met succes een F1-score van 87,99 procent nauwkeurigheid15,16.
De auteurs onderzoeken eerst code-mixing tussen Gujarati en English17, waarbij ze een driestapspijplijn toepassen om de taal van elk token te identificeren, de spelling te normaliseren en segmenten terug te translitereren naar hun eigen schriften. Vervolgens verleggen ze de focus naar een Hindi-Engels corpus18, waar ze nieuwe sentimentdetectie-algoritmen introduceren die specifiek zijn afgestemd op tweetalige zinsstructuren. Om gecontroleerde experimenten te ondersteunen, genereren ze synthetische code-gemengde tekst door skip-gram modellen te trainen op eentalige data en de output19 te blenden.
Vervolgens wordt een Konkani-Engelse social-media dataset20 verwerkt via een regelgebaseerde, woordniveau identificatiemethode, waarbij robuuste prestaties worden bereikt zonder handmatig geannoteerde trainingsgegevens21. Door de scope uit te breiden, maakt een studie gebruik van een groot getranslitereerd corpus van Engels, Hindi, Bengaals en Assamees van platforms als Facebook22 om een reeks woordniveau-taggingtechnieken te evalueren. Hierop voortbouwend schakelt een ander framework23 dynamisch tussen talen om ingebedde of geleende zinnen met hoge precisie te detecteren. In het agrarische domein worden Punjabi-Engelse commentaren geclassificeerd met verschillende modellen—waaronder een n-gram-classifier de beste nauwkeurigheidvan 24. Voor Sinhala-Engels CMST worden ensemble-leerlingen (Random Forest, SVM, Naïeve Bayes, Decision Tree, Logistic Regression) vergeleken, waarbij Random Forest de top presteertop 25, terwijl karakterniveau-embeddings gecombineerd met SVM's sterke resultaten leveren op Tamil-Engels en Malayalam-Engels paren26. Ten slotte wordt het Crúbadán Project27 gepresenteerd als een grootschalige inspanning om onderbemande taalcorpora op te bouwen door het web te crawlen, waarmee de basis ligt voor toekomstig codemixingonderzoek.
| Dataset | Belangrijkste resultaten | Nauwkeurigheid/F1-score/nauwkeurigheid/Nauwkeurigheid/Nauwkeurigheid/Terugroepen |
| Hindi–Bengaals–Engelse dataset afkomstig van Facebook-berichten | Benadrukte de uitdagingen op het gebied van taalidentificatie in tekstniveau op sociale media | 89.30% |
| Nieuwsartikelen, documenten | Effectief uitgevoerd met N-grammen voor taalidentificatie | 0.99% |
| Indiase code-gemengde datasets | Toon van goede nauwkeurigheid in taalidentificatie op woordniveau | Niet gemeld(NR) |
| Op Wikipedia gebaseerde datasets | Robuuste token-niveau codeswitchdetectie | Niet gemeld(NR) |
| Hindi–Engelse tweets | Prestaties Verbeterd in sentimentclassificatie van Hindi en Engels Code-Mixed | 0.78% |
| Meertalige corpora | Vastgesteld fundamenteel kader voor taalidentificatie | 78.00% |
| Code_mixed Engels–Telugu gegevens | CRF behaalde de beste prestaties | 89.30% |
| Engels–Bodo code-gemengde tekst | Bereikte een hoge nauwkeurigheid op woordniveau | 92.00% |
| Code-gemixte Gujarati–Hindi-schriften | De nauwkeurigheid van de taalidentificatie op zinsniveau is ≈92%. | 92.00% |
| Nederlands-Engelse tweets | DTC- en regelgebaseerde modellen behaalden F1 ≈0,95 | 95.00% |
| Code-geschakelde datasets | Competitieve prestaties over verschillende modellen heen | Niet gemeld(NR) |
| Synthetische Code-Gemengde tekst | Verbeterd lexicaal leren | Niet gemeld(NR) |
| Engels–Kannada Code-Gemengde tekst | Effectief automatische LID | Niet gemeld(NR) |
| TRAC-1, Hinglish-datasets | De CRF presteerde beter in Neurale Netwerkmodellen | 91.00% |
| Meertalige online data | Nauwkeurige woordniveau-identificatie van Lnagauge | 88.00% |
| Hindi–Engelse sociale media | Hoge nauwkeurigheid in de taalidentificatie van Hindi-Engels | 0.93% |
| Engels–Gujarati Code - Gemengd | Effectieve tweetalige verwerking | |
| Social media Code-Mixed datasets | Verbeterde sentimentdetectie | 0.90% |
| Code-Mixed Synthetische data | Sterke embeddingrepresentaties | Niet gemeld(NR) |
| Konkani–Engels Code-Gemengde Sociale Media Tekst | Robuuste prestaties zonder annotatie | 0.89% |
| Code-Mixed dataset van Twitter | Verbeterde detectie van schakelaars | 90.20% |
| Assamees–Bengaals–Hindi–Engels | Nauwkeurige meertalige taalidentificatie | 91.00% |
| Sociale media Code-Gemengde tekst | F1-score ≈0,95 | 0.95% |
| Engels–Punjabi Code-Gemengde gegevens | Het N-gram model presteerde het beste | 0.88% |
| Sinhala–Engelse Code-Gemengde gegevens | RF behaalde de beste nauwkeurigheid | 0.92% |
| Facebook Code-Gemengde Reacties | Verbeterde LID op woordniveau | 0.93% |
| Crúbadán Corpus | Taalonderzoek met weinig middelen mogelijk gemaakt | Niet gemeld(NR) |
| Code-Mixed datasets | Goede prestaties getoond in de taalidentificatie op woordniveau | 0.94% |
Tabel 1: Code-Mixed Language Literature samenvatting.
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
De code-gemixte en gecode-geschakelde tekst in het Engels en Kokborok werd handmatig verzameld uit lokale gesprekken en openbaar beschikbare berichten op sociale mediaplatforms. Er werd geen persoonlijk identificeerbare of gevoelige informatie verzameld. Alle procedures volgden de institutionele ethische richtlijnen.
3. Ontwerp en implementatie
3.1 Algoritme
3.1.1 Voor elk token in Zin (S):
a. Met behulp van het frequentiewoordenboek wordt de lexicale kans Plexi berekend.
b. Op basis van het N-grammodel wordt de karaktergebaseerde kans Pchar berekend
c. gewogen interpolatie van beide:
Pgecombineerd = λlexi Plexi + λchar Pchar
3.1.2. Dekanscombinatie P gecombineerd voor elk token is opgeslagen als emissiekans.
3.1.3. Pas het Viterbi-algoritme toe:
a. Gegeven met begintaalkansen.
b. Voor elk token:
i. Bereken de transitieP-telling overgang (voortzetting in dezelfde taal).
enP-schakelaar (waarschijnlijkheid van taalwisseling).
ii. Selecteer het taalpad en maximaliseer de sequentiewaarschijnlijkheid.
3.1.4. Voer de maximale waarschijnlijkheidstaalreeks L uit met de hoogste totale waarschijnlijkheid.
3.2 Computationele omgeving
De implementatie van alle experimenten werd uitgevoerd met Python 3.10 op het Google Coalab-platform. Het systeem gebruikte een set basis-Python-pakketten zoals NumPy, Pandas en Matplotlib om data te verwerken en te visualiseren, en scikit-learn (v1.3) om statistische voorspellingen en analyses te maken. De integratie van het frequentiewoordenboek, de n-grammodellering van tekens en de Viterbi-decodering werden geïmplementeerd met aangepaste Python-scripts. Het model werd getraind en getest op een dataset van 10.000 zinnen, met een 70/30-verdeling voor training en testen.
3.3 Taalidentificatie
Zodra een zin is getokeniseerd, bepaalt de taalidentificatiemodule of elk token in Kokborok of Engels is. De volledige systeemarchitectuur wordt geïllustreerd in Figuur 1. Deze taalopdracht wordt vervolgens gebruikt om te bepalen welke transcriptiemodules geschikt zijn. Door gegevens uit een teken n-gram model en een frequentiewoordenboek samen te voegen, wordt de taal van een token bepaald.
Vanwege de significante orthografische verschillen tussen de twee hierboven beschreven talen presteert een classifier die alleen informatie van het token zelf gebruikt, zonder contextuele kenmerken, al goed. Na de initiële toewijzing wordt echter een andere classifier toegepast met het Viterbi-algoritme. Deze tweede classifier vermindert de verkeerde classificatie van interlinguale homografen en geeft de voorkeur aan woordgroepen die tot dezelfde taal behoren.

Figuur 1: Patronen op woordniveau en het straffen van taalwisselingen met behulp van de Viterbi-algoritme rithm. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2: Methode voor code-gemengde zinnen-taalidentificatie. Klik hier om een grotere versie van deze figuur te bekijken.
We verzamelden de gegevens uit het Crúbadán-corpus27 voor het woordenboek en het karaktermodel. Talrijke talen, waaronder veel minderheidstalen zoals Kokborok, zijn aanwezig in dit corpus.
Omdat de dataset in het Crúbadán-corpus onvoldoende is voor ons doel, hebben we een nieuwe Kokborok Bijbel-dataset getest. In vergelijking met andere talen zijn er relatief weinig beschikbare bronnen. Daarom zijn de gegevens voor de gemengde zinnen in dit artikel verzameld van Kokborok-sprekende WhatsApp-groepen zoals Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (EU), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung en Tripura Uchoi Youth Association (TUYA).
In totaal werden tussen augustus 2021 en december 2023 10.000 code-gemengde zinnen in Kokborok en Engels verzameld uit deze WhatsApp-groepen. De bronnen en domeinverdeling van de dataset worden vermeld in Tabel 2.
| Naam | Totaal aantal woorden |
| Woorden van de Kokborok Bijbel | 718883 |
| Engelse en Kokborok-code-gemengde zinnen | 68789 |
Tabel 2: Totaal aantal Kokborok-woorden.
| Taal | Totaal aantal tokens |
| Kokborok (trp) | 711509 |
| Engels (en) | 1767141 |
Tabel 3: Karakter 2-Gram Model.
| Sl. Nee | Totaal aantal Code-Gemengde Zinnen gebruikt |
| 1 | 10,768 |
Tabel 4: Totaal aantal getrainde gemengde zinnen.
Het karaktermodel en het woordenboek zijn afkomstig uit het Crúbadán-corpus27. Deze collectie, die toegankelijk is voor een breed scala aan talen, waaronder talrijke minderheidstalen, wordt automatisch samengesteld door op internet te zoeken naar materiaal in de doeltaal. Het Kokborok-corpus is in het bijzonder vrij klein omdat de aanpak oorspronkelijk voor Kokborok is ontwikkeld.
Hoewel er ook een Kokborok- en Engels corpus beschikbaar is, werd deze bewust niet gebruikt vanwege een gebrek aan datasets, vooral wat betreft code-mixing en code-flipping. Er zijn ook verschillende Engelse termen in het Kokborok-corpus; sommige van deze woorden (waaronder no, do en o) komen vaker voor dan in het Engelse corpus.
Het woordenboek en taalmodel voeren de taak uit van individuele woordonafhankelijke labeling. Onze taak is vergelijkbaar met die van King et al.28.
De woordenkansen (lex), het teken (ch) en de woordlabel-waarschijnlijkheden worden gebruikt om een lineaire interpolatie te creëren tussen de frequenties van de lexicale (ch) en lexicale (lex) componenten. De gecombineerde (kam) kans die hieruit voortkomt, wordt weergegeven in vergelijking (1) hieronder; de gedetailleerde interpolatieparameters worden weergegeven in Tabel 3. De interpolatiestrategie is weergegeven in Figuur 2.
Pgecombineerd = λlexi · Plexi + λchar · P-char (1)
Waar 0 ≤ λlexi, λchar ≤ 1; en λlexi + λchar = 1. Woorden zonder lexicale basis hebben een extreem lage maar niet-nul lexicale waarschijnlijkheid. Vermoedelijk, als een woord ontbreekt in beide lexicontalen, wordt het karaktermodel gebruikt voor de implementatie in plaats van de lexicale waarschijnlijkheid, zelfs als λlexi = 1.
Onze methode voor het ontwikkelen van het karaktermodel is gebaseerd op Dunnings karakter n-gram Markov-keten (1994). Dit wordt bereikt door respectievelijk n-grammen aan het begin en einde van tokens te tellen om de begin- en overgangskansen te schatten.
De prestatievergelijking van de getrainde 2-gram en 4-gram modellen wordt hieronder weergegeven.
(2)
·
(3)
De begin- en overgangswoorden van een kans kunnen worden vermenigvuldigd om de waarschijnlijkheid van een woord te verkrijgen met behulp van het taalmodel (4).
P(〈w1w2w3〉) = Pinitial(〈w1w2) · P-transitie (c3|〈w1w2) · P-overgang(〉|w1w2w3) (4)
De Kokborok-taal is zeer rijk aan voorvoegsels en achtervoegsels en is een morfologisch agglutinerende taal waarbij achtervoegsels zoals "o," "do" en "no" aan de basiswoorden worden toegevoegd. De 2-gram helpt bij het effectief vastleggen van lokale morfologische overgangen bij affixgrenzen, terwijl 4-gram die Kokborok-woorden kan vastleggen die langere orthografische afhankelijkheden hebben in wortel- en samengestelde woorden zoals Phailaidido, Thanlainai en Mwchangkha.
Dit geldt voor een groot corpus, wat de kans op verschillende problemen met data-schaarsheid vergroot. Bovendien hoeft de karaktercombinatie niet altijd te voorkomen, wat de kans op nul kan brengen. Lambda-gladmaking wordt gebruikt om dit soort problemen op te lossen door elke n-gram met onzichtbare tekens een kleine waarde met een niet-nul kans te geven. De waarde van lambda is vastgesteld op 0,001.
(5)
waarbij N = de hoeveelheid verschillende waarnemingen in n-gram vertegenwoordigt.
(6)
waarbij D= het aantal gedetecteerde verschillen in n-gram is. Er wordt aangenomen dat de kans voor een niet-waargenomen n-gram hetzelfde is.
(7)
waarbij C de tekengrootte aangeeft.
De beginwaarden van Pcount, λlexi en λchar werden empirisch vastgesteld door frequentieanalyse van de Kokborok- en Engelse corpora. Eerst initialiseerden we λlexi naar 0,5 en wogen we zowel lexicale als karaktergebaseerde kansen, waardoor beide even bij de eerste run bijdroegen. Dit niveau van initialisatie stelde ons in staat de vergelijkende rol van het lexicon en het karakter n-gram model tussen datasets te identificeren.
De overgangsparameter Pcount (voortgezet in dezelfde taal) werd ingesteld op 0,6, gebaseerd op de verhouding van de eentalige sequenties tot de schakelpunten in de handmatig gemarkeerde dataset. Deze waarden boden een goed uitgangspunt voor convergentie tijdens het afstemmen. Vervolgens werd alle parameters verfijnd door een reeks herhaalde proeven om de Matthews Correlatiecoëfficiënt (MCC) te maximaliseren, die wordt beschreven in de Resultatensectie.
Contextuele identificatie
Het contextuele model gebruikt de kansen die al geïnitialiseerd waren (Pcount en Pswitch) tijdens de onafhankelijke identificatiefase en verfijnt deze met behulp van de Viterbi-sequentie-decodering zodat overgangsinconsistenties worden verminderd en taalwisseling optimaal wordt gedetecteerd.
De analytische output van het taalmodel is contextafhankelijk en wordt voornamelijk verkregen door het huidige token te combineren met het volgende token en zowel het vorige als het huidige token te gebruiken. Omdat het mogelijk is dat twee woorden met dezelfde frequentiewaarde vergelijkbare betekenissen hebben en verkeerde classificatie veroorzaken, werd de contextafhankelijke benadering gebruikt om de overeenkomsttermen te vinden die in beide talen voorkomen.
Bepaalde woorden, zoals "nee," "do," "o," "are," "da (dag)", "ga," "sa (zeggen)", "roos," "ring" en vele meer, lijken in beide talen op elkaar. Daardoor kan het behoorlijk moeilijk zijn om de juiste taal te identificeren wanneer dit soort ambiguïteit zich voordoet, en soms worden de talen verkeerd geclassificeerd.
Om deze taalidentificatieproblemen aan te pakken, presenteerden we een set taalmodellen met behulp van een discriminatief Verborgen Markov-model en begeleid machine learning. De overgangskans voor beide talen wordt aangenomen hetzelfde te zijn. Voor de gelijktalige Pcount is de voortdurende kans de primaire parameter die moet worden opgegeven. Hierdoor kunnen we de kans berekenen dat de taal wordt gewisseld.
P-schakelaar = 1 − P-telling (8)
Contextuele classificatie met behulp van het Viterbi-pad wordt weergegeven in Figuur 3. Het doel van het Viterbi-algoritme is om te bepalen welke van de tokensequenties de beste taal is volgens Pcount en Pswitch.
Het Viterbi-algoritme wordt toegepast op contextuele classificatie. Pcount en Pswitch worden gebruikt om randen te labelen, en knooppunten worden gelabeld met de relatieve likelihood die door de eerste classifier is toegekend.
Vanwege de grotere kans om de Kokborok-taal te gebruiken, zou het stippelpad worden gekozen als alleen de eerste classifier werd gebruikt en er geen contextuele informatie beschikbaar was.
De impact van contextgebaseerde aanpassing is zichtbaar in Figuur 4. Dit toont aan hoe, bij gebrek aan contextuele informatie, het tweede, derde en vijfde woord in de uitdrukking "Next week o phaisidi do" ten onrechte als Engels (en) (gestreept pad) zouden worden geïdentificeerd. Hoewel de kansen iets hoger zijn voor het Engels, liggen de relatieve waarden dicht bij elkaar.
Twee taalverschuivingen worden bestraft, en de kans op de sequentie zal lager zijn dan het optimale pad van het Viterbi-algoritme als ook overgangskansen worden meegenomen. Dus alleen woorden die aanzienlijk waarschijnlijker uit de andere taal afkomstig zijn – in plaats van veelvoorkomende termen in beide – kunnen taalveranderingen in korte reeksen veroorzaken.
De correlatiecoëfficiënt van Matthews werd gekozen als beoordelingsmaatstaf omdat hij, vergeleken met andere metrics zoals precisie, herinnering en nauwkeurigheid, aanzienlijk geschikter is voor binaire classificatietaken, omdat hij rekening houdt met ware positieven en echte negatieven, evenals valse positieven en valse negatieven.
(9)
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
In Tabel 4 hebben we de MCC-scores en parameters tuning-resultaten voor Ptrp getoond die de initiële bias naar startsequenties met Kokborok-woorden berekenden en de Pcount, wat de kans is om in dezelfde taal door te gaan.
| λ_lex | Pcount = 0,66 | Pcount = 0,70 | Pcount = 0,74 | Pcount = 0,79 | Pcount = 0,82 | Pc... |
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
Hoewel het voorgestelde model een nauwkeurigheid van 93,15% op woordniveau aantoont, onthult een grondige analyse van fouten verschillende terugkerende patronen die de uitdagingen van Engels-Kokborok code-gemengde taalidentificatie benadrukken.
Gebruik van geleende woorden en dubbelzinnige woorden
Een aanzienlijk deel van de fouten ontstaat door het gebruik van geleende Engelse woorden, die gebruikelijk zijn geworden in het...
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
De auteurs hoeven geen belangenconflicten aan te geven.
We willen de lokale moedertaalsprekers, WhatsApp-groepen, organisaties, studentenverenigingen en de Bible Society of India bedanken voor hun hulp bij het verkrijgen van de ruwe dataset van code-mix-zinnen. We zijn ook dankbaar voor de afdeling Computerwetenschappen en Engineering van het National Institute of Technology in Arunachal Pradesh en Lovely Professional University voor het bieden van het platform om onze dataset te onderzoeken en te testen.
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
| Naam | Bedrijf | Catalogusnummer | Opmerkingen |
|---|---|---|---|
| Raspberry Pi 4 | Raspberry Pi Foundation | RPI4-MODBP-4GB | Gebaten voor taalverwerking met lage bronnen |
| MicroSD Kaart 64GB | SanDisk | SDSQUAR-064G-GN6MA | Voor OS en dataset opslag |
| Voeding 5V/3A | Officiële Raspberry Pi | SC0218 | Om de Pi board van stroom te voorzien |
| USB Microfoon | Boya | BY-M1 | Voor audio input in taalgegevensverzameling |
| Monitor (HDMI) | LG | 22MK600M | Output display tijdens testen |
| Toetsenbord & Muis Combo | Logitech | MK270 | Interface controle |
| WiFi Dongle (indien Pi 3) | TP-Link | TL-WN725N | Draadloze gegevensoverdracht (indien geen onboard WiFi) |
| Python IDE (Thonny) | Open Source | - | IDE voor programmeren |
| Lexicon Dataset | Op maat gemaakt | - | Kokborok-Engels taalpaar |
| N-gram Dataset | Op maat gemaakt | Engels-Kokborok taalpaar | |
| Code-Mixed en Code-Switched | Op maat gemaakt | 10.000 zinnen | Verzameld uit Social Media tekst, Whatsapps groepen, NGO, BIBLE, enz. |
Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.
Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken
Toestemming aanvragen