Articolo di ricerca

Identificazione linguistica a basse risorse delle frasi miste in codice inglese e Kokborok

DOI:

10.3791/69130

2 gennaio 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L'obiettivo del protocollo fornito è identificare correttamente le lingue a livello di parola all'interno del testo misto in codice inglese-Kokborok utilizzando un modello non supervisionato che combina n-grammi di caratteri e dizionari di frequenza.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cresce la necessità di un modello per il rilevamento automatico della lingua a livello di parola a causa dell'uso sempre più diffuso di testi multilingue. Per identificare frasi code-switched e code-mixed nella lingua Kokborok e in inglese a livello di parola, proponiamo un modello non supervisionato. Numerosi studi sul testo code-mixed sono stati pubblicati, inclusi diversi studi per diverse lingue indiane. Tuttavia, per quanto ne sappiamo, il nostro lavoro rappresenta uno sforzo pionieristico, essendo il primo a identificare lingue per coppie linguistiche inglese-Kokborok a basse risorse. Abbiamo impiegato un metodo che unisce dati da un dizionario di frequenze con quelli di un modello a n-grammi di caratteri. La tecnica di Viterbi combina un modello di Markov a n-gramma di caratteri con un lessico di frequenza per facilitare l'identificazione precisa della lingua a livello di parola. Il metodo proposto ha ottenuto buoni risultati, con una precisione a livello di parola del 93,15%, meglio del modello BiLSTM-CRF dell'88,5% e della base basata su regole dell'85,3%. Questo dimostra l'efficacia della combinazione di lessico e metodologia statistica per gestire lingue a basse risorse senza dipendere da enormi dataset annotati.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

In questa era digitale, la rapida crescita della comunicazione multilingue di code-mixing e code-switching sulle piattaforme social sta diventando centrale per la comunicazione globale. La necessità di un'identificazione accurata delle lingue all'interno del contenuto testuale è fondamentale. Dopo l'osservazione, abbiamo scoperto che molte lingue indiane come hindi, bengalese e telugu sono già state esplorate nell'identificazione linguistica, e altre lingue indiane a basse risorse come manipuri, bodo e assamese, sono state parzialmente affrontate nella ricerca sull'identificazione linguistica. Tuttavia, esiste ancora un notevole divario nella ricerca nello sviluppo di modelli per il Kokborok, una lingua a poche risorse che è sia linguisticamente che strutturalmente distinta.

A differenza delle lingue manipuri, assamese e bodo, a basso contenuto di risorse, il kokborok presenta un alto livello di variazione ortografica ed è scritto in alfabeto romano o bengalese, spesso in modo intercambiabile nella comunicazione. Questo crea molta ambiguità nei confini dei token, nella traslitterazione e nell'estrazione delle caratteristiche a livello di personaggio, il che presenta sfide distinte e raramente è stato considerato in letteratura. Inoltre, il kokborok è una lingua agglutinativa e la sua morfologia include prefissi e suffissi ricchi (ad esempio, -o, -do, -no) e toni fonemici, rendendo più difficile applicare modelli esistenti di identificazione linguistica a code-mixed sviluppati rispetto alle lingue indo-ariane.

Questi problemi sono ulteriormente aggravati dai social media. I parlanti di kokborok tendono spesso a mescolare parole inglesi nel testo, non solo per il code-mixing e il code-switch, ma anche per compensare la mancanza di elementi lessicali nella frase di Kokborok. Questo porta a ortografie non standard e all'uso delle parole correlato al contesto, il che rappresenta un ostacolo rispetto ai sistemi basati su regole o puramente lessicali.

In questo studio, queste lacune vengono affrontate proponendo un modello non supervisionato che combina dizionari di frequenza e probabilità di n-grammi di caratteri con un framework di decodifica di Viterbi. Il metodo è particolarmente focalizzato sulle complessità ortografiche, morfologiche e contestuali della coppia inglese-Kokborok, ed è quindi uno dei primi tentativi computazionali di trattare e rilevare sistematicamente le barriere linguistiche a livello di parola in questa lingua a basso contenuto di risorse.

CONTESTO DI KOKBOROK
Le parole "Kok", che significa lingua, e "Borok", che implica umano, si combinano per formare la parola composta "Kok-borok", che indica umano. Il termine "Kok-borok" si riferisce alla lingua parlata dal popolo Borok del Tripura, così come da quelli dei paesi confinanti del Bangladesh e del Myanmar, e dagli abitanti di Mizoram, Manipur e Assam. La lingua Kokborok, parlata principalmente in Tripura, è scritta sia in alfabeto romano che bengalese. La scrittura romana è preferita rispetto a quella bengalese dalla maggior parte dei parlanti kokborok. In realtà, il sottogruppo linguistico sino-tibetano noto come tibeto-birmano è il luogo da cui ha avuto origine la lingua kokborok. La lingua Kokborok e la lingua Bodo sono sottilmente simili. Le 36 varietà della lingua kokborok presentano sottili somiglianze sia con le lingue Bodo che con quelle Kachari.

Koloma era conosciuto come la scrittura originale Kokborok. L'unico stato in India, il Tripura, era controllato da 184 persone prima di essere unificato nell'Unione Indiana il 15 ottobre 1949. La scrittura Koloma presente nel libro di Rajratnakar è quella utilizzata per scrivere le narrazioni storiche. Successivamente, nel XIV secolo, due bramini di nome Sukreswar e Vaneswar tradussero la lingua in sanscrito e poi di nuovo in alfabeto bengalese. Esistono omofonia delle radici, tono fonemico, morfologia dei verbi, ordine delle parole e suffissi derivazionali verbali prodotti dai verbi nella lingua kokborok.

Col passare del tempo, Kokborok ha incontrato lingue come inglese, arabo, bengalese, persiano, ecc. Nella lingua Kokborok si possono trovare diversi tipi di strutture agglutinative intricate. Le persone che parlano Kokborok come lingua madre in Tripura non riescono ad accedere facilmente alle informazioni perché la lingua non ha ancora una scrittura ampiamente adottata, ma su questo si sta lavorando.

A Tripura si parlano diversi dialetti del kokborok. In Tripura si parlano vari dialetti, tra cui Tripura/Tripuri, Debbarma, Reang, Jamatia, Uchai, Noatia, Lusai, Kukis, Chaimal, Halam, Santal, Lepcha, Chakma, Khasia, Orango, Mog e Garos. Secondo il rapporto del censimento del 2011, ci sono 1.011.294 parlanti kokborok in India e più di 400.000 in Bangladesh, una nazione confinante.

REVISIONE DELLA LETTERATURA
Gli autori descrivono la loro ricerca in corso sull'identificazione automatica delle lingue utilizzando un nuovo dataset di post su Facebook con codice mescolato in hindi, bengalese e inglese. Sperimentano varie tecniche, come approcci basati su dizionario e classificazione supervisionata, per l'identificazione linguistica a livello di parola, sottolineando l'importanza di considerare indizi contestuali per un'identificazione accurata della lingua in tali ambienti.

L'articolo presenta un dataset di tweet annotati con lo scopo di identificare il discorso d'odio sulle piattaforme social con una combinazione di codice hindi-inglese che utilizza tecniche basate su lessico, a livello di carattere e a livello diparola 1. Un metodo di categorizzazione del testo tollerante agli errori basato su N-grammi è presentato nell'articolo. Innanzitutto, il sistema viene utilizzato per calcolare profili utilizzando dati di set di addestramento, come campioni di materiale o frasi di newsgroup, che riflettono le varie categorie. Dopodiché, il sistema crea un profilo per il documento specifico da categorizzare. Infine, l'algoritmo calcola la misura della distanza tra ogni profilo di categoria e il profilo del documento. La categoria il cui profilo è più vicino al profilo del documento è scelta dal sistema2.

Diverse tecniche di incorporamento di parole, tra cui i modelli Continuous Bag of Words e Skip-Gram, sono state confrontate per creare vettori di caratteristiche. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine e Logistic Regression hanno tutti prodotto buoni punteggi di validazioneincrociata 3. Un riassunto degli approcci precedenti è fornito nella Tabella 1.

Utilizzando classificatori basati su lessico, lo studio supera i classificatori esistenti su tre abbinamenti linguistici valutati nello studio: spagnolo-inglese, olandese-inglese e tedesco-turco con dataset sui socialmedia 4. L'approccio dello studio mostra una maggiore resilienza dei modelli in termini di convergenza e coerenza nelle prestazioni dei test, superando le tecniche attuali di analisi del sentiment nei testi code-mixed con una precisione del 3,31%5.

Nel loro lavoro fondamentale, l'identificazione statistica del linguaggio da parte di Dunning è stata presentata per la prima volta dal Computing Research Lab della New Mexico State University nel RapportoTecnico 6. Questo articolo analizza diversi tipi di apprendimento supervisionato utilizzando il Modello di Markov Nascosto, il Metodo del Classificatore della Foresta Casuale, il Campo Casuale Condizionale e il Classificatore Naive Bayes basandosi sulla coppia linguistica di dati misti in codiceinglese-Telugu 7. Il documento si concentra sulle lingue indiane tra cui inglese, bodo e assamese, discutendo un approccio innovativo per il riconoscimento delle lingue nei materiali code-mixed dei social media. I ricercatori utilizzano la Memoria Bidirezionale a Breve Termine in un modello di deeplearning 8.

In questo articolo hanno utilizzato un ampio dataset relativo alla lingua gujarati, in cui la lingua gujarati è mescolata con inglese e hindi. Utilizzavano una varietà di classificatori per l'apprendimento automatico. Tra questi, il Support Vector Clasificifier ha dato la migliore precisione del 92% e9.

Un quadro linguistico viene utilizzato nella fase di classificazione separata per distinguere tra code-switching e prestito di tweet olandese-inglese. Utilizzando LID basati su regole, Support Vector Machines e classificatori a albero decisionale, apprendono che il DTC (micro F1 = 0,95) e il sistema LID basato su regole (micro F1 = 0,95) ottengono il migliorrisultato di 10.

Le prestazioni del loro modello sono state valutate utilizzando il dataset TRAC-1 per la rilevazione dell'aggressività a cambio di codice, il dataset Hinglish Offensive Tweet e il dataset di classificazione dell'umorismo11. Per migliorare la ritenzione nell'acquisizione lessicale adulta tramite la lettura, è stato proposto un approccio probabilistico come metodologia L2 per produrre testo misto in codice12. Un modulo dizionario è incorporato e utilizzato per effettuare test su vari classificatori supervisionati al fine di controllare il code-mixing a livello diparola 13.

Hanno utilizzato una varietà di metriche per analizzare i modelli di commutazione di codice e hanno scoperto che, sia per spagnolo-inglese che per hindi-inglese, i modelli di reti neurali hanno avuto risultati peggiori rispetto al modello Condizionali Random Fields (CRF) con un margine di 2,5 e 3,5 punti percentuali, rispettivamente14.

Utilizzando un lessico bilingue e un testo inglese come input, il metodo costruisce un grafo fattoriale sopra le menzioni lessicali per produrre un testo code-switched che ottimizza un dato parametro di "apprendimento". In questo articolo, cercano di comprendere meglio i concetti della cassetta degli attrezzi CanVEC basandosi sulle coppie linguistiche di dati codificati Hindi-Inglese. Hanno ottenuto con successo un punteggio F1 dell'87,99% euna precisione 15,16.

Gli autori esaminano innanzitutto il code-mixing tra Gujarati e English17, applicando una pipeline a tre stadi per identificare la lingua di ciascun token, normalizzare l'ortografia e traslitterare i segmenti nei loro script nativi. Successivamente si concentrano su un corpus18 hindi-inglese, dove introducono nuovi algoritmi di rilevamento del sentiment specificamente adattati a strutture di frasi bilingue. Per supportare la sperimentazione controllata, generano testo mixato con codice sintetico addestrando modelli skip-gram su dati monolingui e fondendo i risultati19.

Successivamente, un dataset di social media20 in konkani-inglese viene elaborato tramite un metodo di identificazione a livello di parola basato su regole, ottenendo prestazioni robuste senza alcun dato di addestramentoannotato manualmente 21. Ampliando il campo, uno studio sfrutta un ampio corpus traslitterato di inglese, hindi, bengalese e assamese provenienti da piattaforme come Facebook22 per valutare una serie di tecniche di etichettatura a livello di parola. Sulla base di ciò, un altro framework23 passa dinamicamente da una lingua all'altra per rilevare frasi incorporate o prese in prestito con grande precisione. Nel campo agricolo, i commenti punjabi-inglese sono classificati utilizzando diversi modelli—tra questi, un classificatore n-grammatico offre la miglioreaccuratezza 24. Per il CMST singalese-inglese, vengono confrontati gli apprendenti in ensemble (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression), con Random Forest che emerge come ilmiglior performer 25, mentre gli embedding a livello di carattere abbinati a SVM ottengono ottimi risultati sulle coppie Tamil-Inglese e Malayalam-Inglese26. Infine, il ProgettoCrúbadán 27 viene presentato come un grande sforzo per costruire corpora linguistici sottodotati di risorse attraverso l'esplorazione del web, gettando le basi per future ricerche sul code-mixing.

DatasetRisultati chiavePrecisione/F1-Score/Accuratezza/Pratica/Richiamo
Dataset Hindi–Bengali–Inglese tratto da post su FacebookHa evidenziato le sfide di identificazione linguistica nei testo sui social media a livello di parola89.30%
Articoli di giornale, documentiEseguito efficacemente utilizzando N-grammi per l'identificazione linguistica0.99%
Dataset indiani code-mixedDimostrazione della buona accuratezza nell'identificazione linguistica a livello di parolaNon segnalato (NR)
Dataset basati su WikipediaRilevamento robusto del code-switch a livello di tokenNon segnalato (NR)
Tweet hindi–inglesePrestazioni Migliorate nella classificazione sentimentale di codici misti in hindi e inglese0.78%
Corpora multilingueQuadro fondamentale di identificazione linguistica consolidato78.00%
Code_mixed Dati inglese–teluguCRF ha raggiunto le migliori prestazioni89.30%
Testo misto in codice inglese–BodoHa raggiunto un'elevata accuratezza a livello di parola92.00%
Scritture miste in codice gujarati–hindiL'accuratezza dell'identificazione linguistica a livello di frase è ≈92%92.00%
Tweet olandese-ingleseI modelli DTC e basati su regole hanno raggiunto ≈0,95 F195.00%
Dataset a commutazione di codicePrestazioni competitive tra i modelliNon segnalato (NR)
Testo misto a codice sinteticoProgresso dell'apprendimento lessicaleNon segnalato (NR)
Testo misto inglese–KannadaLID automatico efficaceNon segnalato (NR)
TRAC-1, dataset hinglishIl CRF ha superato le prestazioni nei modelli di reti neurali91.00%
Dati online multilingueIdentificazione accurata a livello di parola in Lnaguage88.00%
Social media hindi–ingleseAlta accuratezza nell'identificazione linguistica dell'hindi-inglese0.93%
Codice inglese–gujarati - mistoElaborazione bilingue efficace
Social media Dataset Code-MixedRilevamento del sentiment migliorato0.90%
Dati sintetici misti in codiceRappresentazioni di embedding forteNon segnalato (NR)
Testo misto sui social media in codice Konkani–InglesePrestazioni robuste senza annotazione0.89%
Dataset code-mixed da TwitterRilevamento migliorato degli interruttori90.20%
Assamese–Bengalese–Hindi–IngleseIdentificazione accurata della lingua multilingue91.00%
Social media - Testo misto in codicePunteggio F1 ≈0,950.95%
Dati misti in codice inglese–punjabiIl modello N-gramma ha ottenuto le migliori prestazioni0.88%
Dati misti in codice singalese–ingleseLa RF ha raggiunto la massima precisione0.92%
Commenti misti in codice su FacebookLID migliorato a livello di parola0.93%
Crúbadán CorpusHa permesso la ricerca linguistica a basse risorseNon segnalato (NR)
Dataset code-mixedBuone prestazioni mostrate nell'Identificazione della Lingua a livello di parola0.94%

Tabella 1: Riassunto della letteratura linguistica mista in codice.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il testo code-mixed e code-switched in inglese e Kokborok è stato raccolto manualmente da conversazioni locali e post pubblici disponibili sulle piattaforme social. Non sono state raccolte informazioni personali identificabili o sensibili. Tutte le procedure seguivano linee guida etiche istituzionali.

3. Progettazione e implementazione

3.1 Algoritmo
3.1.1 Per ogni gettone nella Frase (S):
un. Utilizzando il dizionario di frequenza, si calcola la probabilità lessicale Plexi .
b. Sulla base del modello N-gramma, si calcola la probabilitàP del carattere basata sui caratteri
c. interpolazione pesata di entrambi:
Pcombinato = λlexi Plexi + λchar Pchar
3.1.2. La combinazione di probabilità Pcombinata per ogni token è stata memorizzata come probabilità di emissione.
3.1.3. Applicare l'algoritmo di Viterbi:
un. Dato inizialmente con probabilità linguistiche iniziali.
b. Per ogni gettone:
i. Calcolare latransizione P count transition (continuazione nella stessa lingua).
eP switch (probabilità di cambio di lingua).
ii. Selezionare il percorso linguistico e massimizzare la probabilità della sequenza.
3.1.4. Emettere la sequenza linguistica di massima probabilità L con la probabilità complessiva più alta.

3.2 Ambiente computazionale
L'implementazione di tutti gli esperimenti è stata effettuata utilizzando Python 3.10 sulla piattaforma Google Colab. Il sistema utilizzava un insieme di pacchetti Python di base come NumPy, Pandas e Matplotlib per elaborare e visualizzare i dati, e scikit-learn (v1.3) per fare previsioni e analisi statistiche. L'integrazione del dizionario di frequenze, la modellazione n-gram dei caratteri e la decodifica di Viterbi furono implementate con script Python personalizzati. Il modello è stato addestrato e testato su un dataset di 10.000 frasi, con una divisione 70/30 per addestramento e test.

3.3 Identificazione linguistica
Una volta che una frase è stata tokenizzata, il modulo di identificazione linguistica decide se ogni token è in Kokborok o in inglese. L'architettura completa del sistema è illustrata nella Figura 1. Questa assegnazione linguistica viene poi utilizzata per determinare quali moduli di trascrizione sono appropriati. Unendo i dati di un modello a n-grammi di caratteri e da un dizionario di frequenza, si determina il linguaggio di un token.

A causa delle significative differenze ortografiche tra i due linguaggi descritti sopra, un classificatore che utilizza solo le informazioni del token stesso, senza alcuna caratteristica contestuale, già funziona bene. Tuttavia, dopo l'assegnazione iniziale, viene applicato un altro classificatore utilizzando l'algoritmo di Viterbi. Questo secondo classificatore riduce la classificazione errata degli omografi interlinguali e favorisce i raggruppamenti di parole appartenenti alla stessa lingua.

figure-protocol-1
Figura 1: Pattern a livello di parola e cambiamenti di lingua penalizzanti usando il rithm algoritmico di Viterbi. Clicca qui per visualizzare una versione più grande di questa figura. 

figure-protocol-2
Figura 2: Metodo per l'identificazione linguistica delle frasi in codice misto. Clicca qui per visualizzare una versione più grande di questa figura.

Abbiamo raccolto i dati dal corpusdi Crúbadán 27 per il dizionario e il modello del carattere. In questo corpus sono presenti numerose lingue, incluse molte lingue minoritarie come il kokborok.

Poiché il dataset nel corpus di Crúbadán è insufficiente per il nostro scopo, abbiamo testato un nuovo dataset biblico di Kokborok. Rispetto ad altre lingue, le fonti disponibili sono relativamente poche. Di conseguenza, i dati per le frasi contrastanti di questo articolo sono stati raccolti da gruppi WhatsApp di lingua Kokborok come Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (UE), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung e Tripura Uchoi Youth Association (TUYA).

Un totale di 10.000 frasi codificate in kokborok e inglese sono state raccolte da questi gruppi WhatsApp tra agosto 2021 e dicembre 2023. Le fonti e la distribuzione del dominio del dataset sono elencate nella Tabella 2.

NomeTotale delle parole contate
Parole della Bibbia di Kokborok718883
Frasi miste in codice inglese e Kokborok68789

Tabella 2: Parole totali di Kokborok.

LinguaToken totali
Kokborok (trp)711509
Inglese (en)1767141

Tabella 3: Modello del personaggio a 2 grammi.

Sl. NoFrasi Misti Totali di Codice usate
110,768

Tabella 4: Totale delle frasi miste addestrate.

Il modello del carattere e il dizionario sono stati tratti dal corpusdi Crúbadán 27. Questa collezione, accessibile per una vasta gamma di lingue, incluse numerose lingue minoritarie, viene creata automaticamente cercando su internet materiali nella lingua di destinazione. Il corpus di Kokborok in particolare è piuttosto piccolo perché l'approccio fu inizialmente creato per Kokborok.

Sebbene sia disponibile anche un corpus di Kokborok e inglese, è stato volutamente non utilizzato a causa della mancanza di dataset, in particolare per quanto riguarda il code-mixing e il code-flipping. Ci sono anche diversi termini inglesi nel corpus di Kokborok; alcune di queste parole ( inclusi no, do e o) sono più comuni rispetto al corpus inglese.

Il dizionario e il modello linguistico svolgono il compito di etichettatura indipendente da singola parola. Il nostro compito è paragonabile a quello di King et al.28.

Le probabilità lessicali (lex), carattere (ch) e delle parole vengono utilizzate per creare un'interpolazione lineare tra le frequenze delle componenti lessicale (ch) e lessicale (lex). La probabilità combinata (a pettine) che ne deriva è mostrata nell'equazione (1) qui sotto; i parametri dettagliati di interpolazione sono presentati nella Tabella 3. La strategia di interpolazione è raffigurata nella Figura 2.

Pcombinato = λlexi · Plexi + λchar · Personaggio (1)

Dove 0 ≤ λlexi, λchar ≤ 1; e λlexi + λchar = 1. Le parole senza base lessicale hanno una probabilità lessicale estremamente bassa ma non nulla. Presumibilmente, nel caso in cui una parola sia assente in entrambe le lingue lessiche, per l'implementazione viene utilizzato il modello dei caratteri invece della probabilità lessicale, anche se λlexi = 1.

Il nostro metodo per sviluppare il modello del personaggio si basa sulla catena di Markov n-gramma di Dunning (1994). Questo si ottiene contando rispettivamente n-grammi all'inizio e alla fine dei token, per stimare le probabilità iniziali e di transizione.

Il confronto delle prestazioni tra i modelli addestrati da 2 grammi e 4 grammi è mostrato di seguito.

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

Le parole iniziali e di transizione di una probabilità possono essere moltiplicate per ottenere la probabilità di una parola usando il modello linguistico (4).

P(〈w1w2w3〉) = P iniziale(〈w1 w2) · Transizione P (c3|〈w 1w2) · Transizione P(〉|c1w2w3) (4)

La lingua kokborok è molto ricca di prefissi e suffissi ed è una lingua morfologicamente agglutinante in cui suffissi come "o", "do" e "no" sono aggiunti alle parole base. Il 2-grammo aiuta a catturare efficacemente le transizioni morfologiche locali ai confini degli affassi, mentre il 4-grammo può catturare quelle parole di Kokborok che presentano dipendenze ortografiche più lunghe riscontrate nelle radici e nelle parole composte come Phailaidido, Thanlainai e Mwchangkha.

Questo vale per un corpus ampio, che aumenta la probabilità di diversi problemi di scarsità dei dati. Inoltre, la combinazione di caratteri potrebbe non apparire in tutti i casi, il che potrebbe far sì che la probabilità si azero. Il levigamento lambda viene utilizzato per risolvere questi tipi di problemi assegnando a ogni n-grammo contenente caratteri non visti un piccolo valore con probabilità diversa da zero. Il valore di lambda è fissato a 0,001.

figure-protocol-6  (5)

dove N = rappresenta la quantità di osservazioni distinte in n-grammi.

figure-protocol-7   (6)

dove D= è il numero di differenze rilevate in n-grammi. Si assume che la probabilità per un n-gramma non osservato sia la stessa.

figure-protocol-8   (7)

dove C indica la dimensione del carattere.

I valori iniziali di Pcount, λlexi e λchar furono impostati empiricamente dall'analisi di frequenza dei corpi di Kokborok e inglese. Per prima cosa, abbiamo inizializzato λlexi a 0,5 e pesato sia le probabilità lessicali che basate sui caratteri, rendendo entrambe ugualmente contributive nella prima esecuzione. Questo livello di inizializzazione ci ha permesso di identificare il ruolo comparativo del lessico e del modello a n-grammi di caratteri tra i dataset.

Il parametro di transizione Pcount (che continua nella stessa lingua) è stato impostato a 0,6, basato sul rapporto tra le sequenze monolingui e i punti di interruzione nel dataset segnato manualmente. Questi valori fornivano un buon punto di partenza per la convergenza durante l'accordatura. Successivamente, il perfezionamento di tutti i parametri è stato effettuato attraverso una serie di tentativi ripetuti per massimizzare il Coefficiente di Correlazione di Matthews (MCC), dettagliato nella sezione Risultati.

Identificazione contestuale
Il modello contestuale utilizza le probabilità già inizializzate (Pcount e Pswitch) durante la fase di identificazione indipendente e le affina usando la decodifica di sequenze di Viterbi, così da ridurre le incongruenze di transizione e rilevare in modo ottimale il cambio di lingua.

L'output analitico del modello linguistico dipende dal contesto ed è ottenuto principalmente combinando il token corrente con il token successivo e utilizzando sia i token precedenti che attuali. Poiché esiste la possibilità che due parole con lo stesso valore di frequenza abbiano significati simili e causino una classificazione errata (errata classificazione), è stato utilizzato l'approccio dipendente dal contesto per trovare i termini di somiglianza presenti in entrambe le lingue.

Alcune parole, come "no", "do", "o", "are", "da (giorno)", "va", "sa (di)", "rosa", "anello" e molte altre, sono simili in entrambe le lingue. Di conseguenza, può essere piuttosto difficile identificare il linguaggio corretto quando si presenta questo tipo di ambiguità, e occasionalmente le lingue vengono classificate in modo errato.

Per affrontare questi problemi di identificazione linguistica, abbiamo presentato un insieme di modelli linguistici utilizzando un modello di Markov nascosto discriminativo e un machine learning supervisionato. Si assume che la probabilità di transizione per entrambe le lingue sia la stessa. Per il Pcount della stessa lingua, la probabilità continua è il parametro primario da dichiarare. Attraverso questo possiamo calcolare la probabilità di cambiare lingua.

P switch = 1 − Pcount (8)

La classificazione contestuale usando il percorso di Viterbi è mostrata nella Figura 3. L'obiettivo dell'algoritmo di Viterbi è determinare quale dei linguaggi delle sequenze di token sia il migliore secondo Pcount e Pswitch.

L'algoritmo di Viterbi viene applicato alla classificazione contestuale. Pcount e Pswitch sono usati per etichettare gli archi, e i nodi sono etichettati con la verosimiglianza relativa assegnata dal primo classificatore.

A causa della maggiore probabilità di utilizzare la lingua Kokborok, il percorso a tratteggiamenti verrebbe scelto se il primo classificatore fosse l'unico usato e non fossero disponibili informazioni contestuali.

L'impatto dell'aggiustamento basato sul contesto è visualizzato nella Figura 4. Questo dimostra come, in assenza di informazioni contestuali, la seconda, la terza e la quinta parola nella frase "Next week o phaisidi do" verrebbero erroneamente identificate come inglesi (en) (percorso tratteggiato). Sebbene le probabilità siano leggermente maggiori per l'inglese, i valori relativi sono vicini.

Due spostamenti linguistici saranno penalizzati e la probabilità della sequenza sarà inferiore al percorso ottimale dell'algoritmo di Viterbi se si considerano anche le probabilità di transizione. Pertanto, solo parole che hanno una probabilità sostanzialmente maggiore di originare dall'altra lingua — piuttosto che termini comuni in entrambe — possono innescare cambiamenti linguistici in brevi sequenze.

Il coefficiente di correlazione di Matthews è stato scelto come metrica di valutazione perché, rispetto ad altre metriche come precisione, ricordo e accuratezza, è significativamente più adatto per compiti di classificazione binaria, poiché tiene conto sia dei veri positivi e dei veri negativi, sia dei falsi positivi e dei falsi negativi.

figure-protocol-9   (9)

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nella Tabella 4, abbiamo mostrato i punteggi MCC e i risultati della sintonia dei parametri per Ptrp che hanno calcolato il bias iniziale verso sequenze iniziali con parole di Kokborok e calcolato il Pcount, che è la probabilità di continuare nella stessa lingua.

λ_lexConteggio = 0,66Pcount = 0,70Conteggio = 0,74Pcount...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sebbene il modello suggerito dimostri un'accuratezza del 93,15% a livello di parola, un'analisi approfondita degli errori rivela diversi schemi ricorrenti che evidenziano le sfide dell'identificazione delle lingue in codice misto inglese-Kokborok.

Uso di parole prese in prestito e parole ambigue
Una parte significativa degli errori deriva dall'uso di parole inglesi prese in prestito, che sono diventate comuni nell'uso di Ko...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno conflitti di interesse da dichiarare.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Vorremmo ringraziare i madrelingua locali, i gruppi WhatsApp, le organizzazioni, le unioni studentesche e la Bible Society of India per averci aiutato a ottenere il dataset grezzo di frasi miste in codice. Siamo inoltre grati al Dipartimento di Informatica e Ingegneria del National Institute of Technology dell'Arunachal Pradesh e alla Lovely Professional University per averci fornito la piattaforma per esaminare e testare il nostro dataset.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Raspberry Pi 4Fondotinta Raspberry PiRPI4-MODBP-4GBUtilizzato per l'elaborazione di linguaggi a basse risorse
Scheda MicroSD 64GBSanDiskSDSQUAR-064G-GN6MAPer l'archiviazione di sistemi operativi e dataset
Alimentazione 5V/3ALampberry Pi ufficialeSC0218Per alimentare la scheda Pi
Microfono USBBoyaBY-M1Per l'ingresso audio nella raccolta dei dati linguistici
Monitor (HDMI)LG22MK600MVisualizzazione in uscita durante i test
Tastiera & Mouse ComboLogitechMK270Controllo dell'interfaccia
Dongle WiFi (se Pi 3)TP-LinkTL-WN725NTrasferimento dati wireless (se non c'è WiFi integrato)
IDE Python (Thonny)Open Source-IDE per la programmazione
Dataset dei lessiciCostruiti su misura-Coppia linguistica Kokborok-inglese
Dataset N-grammaCostruiti su misuraCoppia linguistica inglese-Kokborok
Code-Mixed e Code-SwitchingCostruiti su misura10.000 frasiRaccolto da testo sui social media, WhatsApp e WhatsApp, ONG, BIBBIA, ecc

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Lingue a basse risorseLingua KokborokInglese KokborokRilevamento a livello di parolaN gramma di caratteriLessico di frequenzaTecnica di ViterbiModello non supervisionato
Video in arrivo

Articoli correlati