Artigo de investigação

Identificação linguística de baixo recurso para frases mistas de inglês e código Kokborok

DOI:

10.3791/69130

2 de janeiro de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O objetivo do protocolo dado é identificar corretamente línguas em nível de palavra dentro do texto misto em código inglês-Kokborok, usando um modelo não supervisionado que combina n-gramas de caracteres e dicionários de frequência.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Há uma necessidade crescente por um modelo para detecção automática de linguagem em nível de palavra devido ao uso crescente de texto multilíngue. Para identificar frases code-switched e code-mixed na língua Kokborok e no inglês no nível das palavras, propomos um modelo não supervisionado. Numerosos estudos sobre textos codificados foram publicados, inclusive para várias línguas indianas. No entanto, até onde sabemos, nosso trabalho representa um esforço pioneiro, sendo o primeiro a identificar idiomas para pares de línguas inglês-Kokborok de poucos recursos. Empregamos um método que funde dados de um dicionário de frequências com dados de um modelo de n-grama de caracteres. A técnica de Viterbi combina um modelo de Markov n-grama de caracteres com um léxico de frequência para auxiliar na identificação precisa da língua no nível da palavra. O método proposto teve bom desempenho, com uma precisão em nível de palavra de 93,15%, o que é melhor do que o modelo BiLSTM-CRF de 88,5% e a linha de base baseada em regras de 85,3%. Isso demonstra a eficácia de combinar léxico e metodologia estatística para lidar com línguas de baixo recurso sem depender de grandes conjuntos de dados anotados.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nesta era digital, o rápido crescimento da comunicação multilíngue de code-mixing e code-switching nas plataformas de mídia social está se tornando central para a comunicação global. A necessidade de identificação precisa dos idiomas dentro do conteúdo textual é fundamental. Após observação, descobrimos que muitas línguas indianas como hindi, bengali e telugu já foram exploradas na identificação linguística, e outras línguas indianas de baixo recurso, como manipuri, bodo e assamês, foram parcialmente abordadas em pesquisas de identificação linguística. No entanto, ainda existe uma lacuna substancial na pesquisa no desenvolvimento de modelos para o Kokborok, uma língua de poucos recursos que é tanto linguistica quanto estruturalmente distinta.

Ao contrário das línguas de baixo recurso do manipuri, assamês e bodo, o kokborok apresenta um alto nível de variação ortográfica e é escrito em alfabeto romano ou bengali, frequentemente intercambiando na comunicação. Isso cria muita ambiguidade nos limites dos tokens, transliteração e extração de características no nível dos caracteres, o que apresenta desafios distintos e raramente foi considerado na literatura. Além disso, Kokborok é uma língua aglutinante, e sua morfologia inclui prefixos e sufixos ricos (por exemplo, -o, -do, -no) e tons fonêmicos, tornando mais difícil a aplicação dos modelos existentes de identificação de linguagem codificada desenvolvidos em relação às línguas indo-arianas.

Essas questões são ainda mais agravadas pelas redes sociais. Falantes de Kokborok frequentemente tendem a misturar palavras em inglês no texto, não apenas para misturar e trocar de código, mas também para compensar a ausência de itens lexicais na frase de Kokborok. Isso leva a ortografias não padrão e ao uso de palavras relacionado ao contexto, o que representa um revés em relação a sistemas baseados em regras ou puramente lexicais.

Neste estudo, essas lacunas são abordadas propondo um modelo não supervisionado que combina dicionários de frequência e probabilidades de n-gramas de caracteres com uma estrutura de decodificação de Viterbi. O método é particularmente focado nas complexidades ortográficas, morfológicas e contextuais do par English-Kokborok, sendo assim uma das primeiras tentativas computacionais de tratar e detectar sistematicamente as barreiras linguísticas em nível de palavra nessa língua de poucos recursos.

CONTEXTO DE KOKBOROK
As palavras "Kok", que significa língua, e "Borok", que implica humano, combinam-se para formar a palavra composta "Kok-borok", que denota humano. O termo "Kok-borok" refere-se à língua falada pelo povo Borok de Tripura, bem como pelos países vizinhos de Bangladesh e Mianmar, e pelos habitantes de Mizoram, Manipur e Assam. A língua Kokborok, falada principalmente em Tripura, é escrita tanto em alfabeto romano quanto bengali. O alfabeto romano é preferido em detrimento do alfabeto bengali pela maioria dos falantes de Kokborok. Na verdade, o subgrupo linguístico sino-tibetano conhecido como tibeto-birmanês é onde a língua Kokborok se originou. A língua Kokborok e a língua Bodo são sutilmente semelhantes. As 36 variedades da língua kokborok apresentam semelhanças sutis tanto com as línguas Bodo quanto com as Kachari.

Koloma era conhecido como o alfabeto original Kokborok. O único estado na Índia, Tripura, foi controlado por 184 pessoas antes de ser unificado na União Indiana em 15 de outubro de 1949. A escrita Koloma encontrada no livro de Rajratnakar é a que foi usada para escrever as narrativas históricas. Mais tarde, no século XIV, dois brâmanes chamados Sukreswar e Vaneswar traduziram a língua para o sânscrito e depois novamente para o alfabeto bengali. Existem homofonia de raízes, tom fonêmico, morfologia verbal, ordem das palavras e sufixos derivacionais verbais produzidos pelos verbos na língua Kokborok.

Com o passar do tempo, Kokborok encontrou línguas como inglês, árabe, bengali, persa, etc. Diferentes tipos de estruturas aglutinantes intrincadas podem ser encontrados na língua Kokborok. Pessoas que falam Kokborok como língua nativa em Tripura não conseguem acessar facilmente informações porque a língua ainda não possui um sistema de escrita amplamente adotado, mas isso está sendo trabalhado.

Existem vários dialetos do kokborok falados em Tripura. Em Tripura, vários dialetos são falados, incluindo Tripura/Tripuri, Debbarma, Reang, Jamatia, Uchai, Noatia, Lusai, Kukis, Chaimal, Halam, Santal, Lepcha, Chakma, Khasia, Orangotango, Mog e Garos. De acordo com o relatório do Censo de 2011, há 1.011.294 falantes de Kokborok na Índia e mais de 400.000 em Bangladesh, uma nação vizinha.

REVISÃO DA LITERATURA
Os autores descrevem sua pesquisa contínua sobre identificação automática de línguas usando um novo conjunto de dados de postagens no Facebook com código em hindi, bengali e inglês misturados. Eles experimentam diversas técnicas, como abordagens baseadas em dicionário e classificação supervisionada, para identificação linguística no nível da palavra, destacando a importância de considerar pistas contextuais para uma identificação precisa da língua nesses ambientes.

O artigo apresenta um conjunto de dados de tweets anotados com o objetivo de identificar discurso de ódio em plataformas de redes sociais com uma mistura de código hindi-inglês que utiliza técnicas baseadas em léxico, nível de caracteres e palavra1. Um método de categorização de texto tolerante a erros baseado em N-gramas é apresentado no artigo. Primeiro, o sistema é usado para calcular perfis usando dados de conjuntos de treinamento, como amostras de material de newsgroups ou frases, que refletem as várias categorias. Depois disso, o sistema cria um perfil para o documento específico que precisa ser categorizado. Por fim, o algoritmo calcula a medida de distância entre cada perfil de categoria e o perfil do documento. A categoria cujo perfil está mais próximo do perfil do documento é escolhida pelo sistema2.

Várias técnicas de incorporação de palavras, incluindo modelos Continuous Bag of Words e Skip-Gram, foram comparadas para criar vetores de características. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine e Logistic Regression produziram boas pontuações de validaçãocruzada 3. Um resumo das abordagens anteriores é fornecido na Tabela 1.

Utilizando classificadores baseados em léxico, o estudo supera classificadores existentes em três pares de idiomas avaliados no estudo: espanhol-inglês, holandês-inglês e alemão-turco com conjuntos de dadosde redes sociais 4. A abordagem do estudo mostra maior resiliência do modelo em termos de convergência e consistência no desempenho dos testes, superando as técnicas atuais de análise de sentimento em textos codificados por 3,31% de precisão5.

Em seu trabalho seminal, a identificação estatística da linguagem por Dunning foi apresentada pela primeira vez pelo Computing Research Lab da New Mexico State University no RelatórioTécnico 6. Este artigo analisa diferentes tipos de aprendizado supervisionado usando o Modelo de Markov Oculto, o Método do Classificador de Floresta Aleatória, o Campo Aleatório Condicional e o Classificador Naive Bayes, com base no par de idiomas de dados mistos de códigoinglês-Telugu 7. O artigo foca em línguas indianas, incluindo inglês, bodo e assamês, enquanto discute uma abordagem inovadora para reconhecer línguas em material de mídias sociais codificadas. Os pesquisadores utilizam a Memória Bidirecional de Curto Prazo em um modelo de aprendizadoprofundo 8.

Neste artigo, eles usaram um grande conjunto de dados relacionado à língua gujarati — no qual a língua gujarati é misturada com inglês e hindi. Eles empregavam uma variedade de classificadores de aprendizado de máquina. Entre eles, o Classificador de Vetores de Suporte deu a melhor precisão de 92% e9.

Um arcabouço linguístico é usado na fase separada de classificação para diferenciar entre troca de código e empréstimo de tweets em holandês-inglês. Usando LID baseado em regras, Máquinas de Vetores de Suporte e Classificadores de Árvore de Decisão, eles aprendem que o DTC (micro F1 = 0,95) e o sistema LID baseado em regras (micro F1 = 0,95) têm melhordesempenho em 10.

O desempenho do modelo foi avaliado usando o conjunto de dados TRAC-1 de detecção de agressividade com comutação de código, o conjunto de dados Hinglish Offensive Tweet e o conjunto de dados de classificação de humor11. Para melhorar a retenção na aquisição lexical adulta por meio da leitura, foi proposta uma abordagem probabilística como metodologia L2 para produzir texto mixtoem código 12. Um módulo de dicionário é incorporado e usado para realizar testes em vários classificadores supervisionados a fim de controlar a mistura de códigoem nível de palavra 13.

Eles usaram uma variedade de métricas para analisar padrões de comutação de código e descobriram que, tanto para espanhol-inglês quanto para hindi-inglês, os modelos de redes neurais tiveram desempenho pior que o modelo de Campos Aleatórios Condicionais (CRF) por uma margem de 2,5 e 3,5 pontos percentuais, respectivamente14.

Usando um léxico bilíngue e um texto em inglês como entrada, o método constrói um gráfico fatorial sobre menções lexicais para produzir um texto comutado em código que otimiza um dado parâmetro de "aprendibilidade". Neste artigo, eles buscam entender melhor os conceitos da caixa de ferramentas CanVEC com base nos pares de linguagens de dados codificados hindi-inglês. Eles alcançaram com sucesso uma pontuação F1 de 87,99% euma precisão de 15,16.

Os autores examinam primeiro a mistura de código entre Gujarati e English17, aplicando um pipeline de três estágios para identificar o idioma de cada token, normalizar a ortografia e transliterar segmentos de volta para seus alfabetos nativos. Eles então mudam o foco para um corpus18 hindi-inglês, onde introduzem novos algoritmos de detecção de sentimento especificamente ajustados para estruturas bilíngues de frase. Para apoiar experimentação controlada, eles geram texto sintético misturado em código treinando modelos skip-gram em dados monolíngues e misturando as saídas19.

Em seguida, um conjunto de dados de mídias sociais20 em Konkani-English é processado por meio de um método de identificação em nível de palavra baseado em regras, alcançando desempenho robusto sem qualquer dado de treinamento21 anotado manualmente. Expandindo o escopo, um estudo utiliza um grande corpus transliterado de inglês, hindi, bengali e assamês de plataformas como o Facebook22 para avaliar uma variedade de técnicas de marcação em nível de palavra. Com base nisso, outro framework23 alterna dinamicamente entre idiomas para detectar frases embutidas ou emprestadas com alta precisão. No domínio agrícola, os comentários punjabi-ingleses são classificados usando vários modelos — entre eles, um classificador n-grama oferece a melhor precisão24. Para o CMST cingalês-inglês, aprendizes em conjunto (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression) são comparados, com Random Forest emergindo como o25 melhor desempenho, enquanto embeddings em nível de caráter combinados com SVMs alcançam resultados fortes nos pares Tâmil-Inglês e Malaiala-Inglês26. Por fim, o Projeto Crúbadán27 é apresentado como um esforço em grande escala para construir corpora linguísticos com poucos recursos, rastreando a web, estabelecendo as bases para futuras pesquisas em mixagem de código.

Conjunto de dadosPrincipais ResultadosPrecisão/F1-Pontuação/Precisão/Prática/Recordação
Conjunto de dados em hindi–bengali–inglês retirado de postagens no FacebookDestacou os desafios de identificação linguística em mídias sociais em nível de palavra Texto89.30%
Artigos de notícias, documentosEfetivamente realizado usando N-gramas para identificação de línguas0.99%
Conjuntos de dados mistos de código indianosDemonstrando a boa precisão na identificação linguística em nível de palavraNão reportado (NR)
Conjuntos de dados baseados na WikipédiaDetecção robusta de comutadores de código em nível de tokenNão reportado (NR)
Tweets hindi–inglêsDesempenho: Melhora na classificação de sentimento do código misto em hindi e inglês0.78%
Corpora multilíngueEstrutura fundamental estabelecida para identificação linguística78.00%
Code_mixed Dados inglês–teluguO CRF alcançou o melhor desempenho89.30%
Texto mixado em código inglês–BodoAlcançou alta precisão em nível de palavra92.00%
Alfabetos mistos de código Gujarati–HindiA precisão da identificação linguística em nível de frase é ≈92%92.00%
Tweets em holandês-inglêsModelos DTC e baseados em regras alcançaram F1 ≈0,9595.00%
Conjuntos de dados comutados por códigoDesempenho competitivo entre modelosNão reportado (NR)
Texto Misto de Código SintéticoAprimoramento do aprendizado lexicalNão reportado (NR)
Texto misto inglês–canarêsLID automático efetivoNão reportado (NR)
TRAC-1, conjuntos de dados hinglishO CRF superou em modelos de Redes Neurais91.00%
Dados online multilínguesIdentificação precisa em nível de palavra em Lnaguage88.00%
Mídias sociais hindi–inglêsAlta precisão na identificação linguística do hindi-inglês0.93%
Código Inglês–Gujarati - MistoProcessamento bilíngue eficaz
Conjuntos de dados mistos de código para redes sociaisAprimoramento na detecção de sentimento0.90%
Dados sintéticos mistos de códigoRepresentações fortes de imersãoNão reportado (NR)
Código Misto Konkani–Inglês Texto de Mídias SociaisDesempenho robusto sem anotação0.89%
Conjunto de dados code-mixed do TwitterDetecção aprimorada de interruptores90.20%
Assamês–Bengali–Hindi–InglêsIdentificação precisa de línguas multilíngues91.00%
Redes sociais - Código mistoPontuação F1 ≈0,950.95%
Código Inglês–Punjabi Dados mistosO modelo N-grama teve melhor desempenho0.88%
Dados mistos em cingalês–inglêsRF alcançou a melhor precisão0.92%
Comentários mistos no FacebookLID aprimorado em nível de palavra0.93%
Crúbadán CorpusPossibilitou pesquisas linguísticas de baixo recursoNão reportado (NR)
Conjuntos de dados mistos de códigoBom desempenho demonstrado na Identificação de Linguagem em nível de palavra0.94%

Tabela 1: Resumo da Literatura em Línguas Mistas em Código.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O texto em inglês e Kokborok misturado e codificado foi coletado manualmente de conversas locais e publicações públicas em plataformas de redes sociais. Nenhuma informação pessoalmente identificável ou sensível foi coletada. Todos os procedimentos seguiram diretrizes éticas institucionais.

3. Projeto e implementação

3.1 Algoritmo
3.1.1 Para cada ficha na Frase (S):
um. Usando o dicionário de frequências, calcula-se a probabilidade lexical Plexi .
b. Com base no modelo N-grama, a probabilidadebaseada em caracteres P é calculada
c. interpolação ponderada de ambos:
Pcombinado = λlexi Plexi + λchar Pchar
3.1.2. A combinação de probabilidade Pcombinada para cada token foi armazenada como probabilidade de emissão.
3.1.3. Aplique o algoritmo de Viterbi:
um. Dado inicialmente com probabilidades de idioma inicial.
b. Para cada ficha:
i. Calcular atransição P contagem de transições (continuação no mesmo idioma).
eP switch (probabilidade de mudança de idioma).
ii. Selecionar o caminho da linguagem e maximizar a probabilidade da sequência.
3.1.4. Produza a sequência de linguagem de máxima probabilidade L com maior probabilidade geral.

3.2 Ambiente computacional
A implementação de todos os experimentos foi feita usando Python 3.10 na plataforma Google Colab. O sistema usava um conjunto de pacotes básicos em Python como NumPy, Pandas e Matplotlib para processar e visualizar dados, e scikit-learn (v1.3) para fazer previsões e análises estatísticas. A integração do dicionário de frequência, modelagem n-grama de caracteres e decodificação de Viterbi foram implementadas com scripts personalizados em Python. O modelo foi treinado e testado em um conjunto de dados de 10.000 frases, com uma divisão 70/30 para treinamento e teste.

3.3 Identificação do idioma
Uma vez que uma frase é tokenizada, o módulo de identificação de idioma decide se cada token está em Kokborok ou em inglês. A arquitetura completa do sistema está ilustrada na Figura 1. Essa atribuição de idioma é então usada para determinar quais módulos de transcrição são apropriados. Ao mesclar dados de um modelo de n-grama de caracteres e um dicionário de frequência, determina-se a linguagem de um token.

Devido às diferenças ortográficas significativas entre as duas linguagens descritas acima, um classificador que usa apenas informações do próprio token, sem nenhuma característica contextual, já tem um bom desempenho. No entanto, após a atribuição inicial, outro classificador usando o algoritmo de Viterbi é aplicado. Esse segundo classificador reduz a classificação incorreta de homógrafos interlinguais e favorece agrupamentos de palavras que pertencem à mesma língua.

figure-protocol-1
Figura 1: Padrões em nível de palavra e mudanças de linguagem penalizantes usando o rithmo do algoritmo de Viterbi. Por favor, clique aqui para ver uma versão ampliada desta figura. 

figure-protocol-2
Figura 2: Método para identificação linguística em frases misturadas em código. Por favor, clique aqui para ver uma versão ampliada desta figura.

Coletamos os dados do corpus27 de Crúbadán para o dicionário e o modelo de caracteres. Numerosas línguas, incluindo muitas línguas minoritárias como Kokborok, estão presentes neste corpus.

Como o conjunto de dados no corpus de Crúbadán é insuficiente para nosso propósito, testamos um novo conjunto de dados bíblicos Kokborok. Comparado a outras línguas, há relativamente poucas fontes disponíveis. Assim, os dados das frases mistas deste artigo foram coletados de grupos de WhatsApp falantes de Kokborok, como Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (UE), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung e Tripura Uchoi Youth Association (TUYA).

Um total de 10.000 frases codificadas em Kokborok e inglês foram coletadas desses grupos do WhatsApp entre agosto de 2021 e dezembro de 2023. As fontes e a distribuição de domínio do conjunto de dados estão listadas na Tabela 2.

NomeTotal de palavras contadas
Palavras da Bíblia Kokborok718883
Frases mistas em código em inglês e Kokborok68789

Tabela 2: Palavras totais de Kokborok.

IdiomaTotal Tokens
Kokborok (trp)711509
Inglês (en)1767141

Tabela 3: Modelo de 2 gramas de personagem.

Sl. NãoFrases totais de código mistas usadas
110,768

Tabela 4: Total de sentenças mistas treinadas.

O modelo de caracteres e o dicionário foram retirados do corpus27 de Crúbadán. Esta coleção, acessível para uma ampla variedade de idiomas, incluindo inúmeras línguas minoritárias, é criada automaticamente por meio da busca na internet por materiais no idioma alvo. O corpus de Kokborok, em particular, é relativamente pequeno porque a abordagem foi criada inicialmente para Kokborok.

Embora um corpus de Kokborok e inglês também esteja disponível, ele foi propositalmente não utilizado devido à falta de conjuntos de dados, especialmente em termos de code-mixing e code-flipping. Há também vários termos em inglês no corpus de Kokborok; algumas dessas palavras (incluindo no, do e o) são mais comuns do que no corpus inglês.

O dicionário e o modelo de linguagem realizam a tarefa de rotulagem independente de palavras individuais. Nossa tarefa é comparável à de King et al.28.

As probabilidades lexicais (lex), caracteres (ch) e etiquetas de palavra são utilizadas para criar uma interpolação linear entre as frequências dos componentes lexical (ch) e lexical (lex). A probabilidade combinada (pente) que resulta disso é mostrada na equação (1) abaixo; os parâmetros detalhados de interpolação são apresentados na Tabela 3. A estratégia de interpolação é representada na Figura 2.

Pcombinado = λlexi · Plexi + λchar · Personagem de P (1)

Onde 0 ≤ λlexi, λchar ≤ 1; e λlexi + λchar = 1. Palavras sem base lexical têm uma verosimilhança lexical extremamente baixa, mas não nula. Presumivelmente, caso uma palavra esteja ausente em ambas as línguas léxicas, o modelo de caracteres é usado para implementação em vez da probabilidade lexical, mesmo que λlexi = 1.

Nosso método para desenvolver o modelo de personagem é baseado na cadeia de Markov de caráter n-grama de Dunning (1994). Isso é realizado contando n-gramas no início e no fim dos tokens, respectivamente, para estimar as probabilidades inicial e de transição.

A comparação de desempenho dos modelos treinados de 2 gramas e 4 gramas é mostrada abaixo.

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

As palavras iniciais e de transição de uma probabilidade podem ser multiplicadas para obter a probabilidade de uma palavra usando o modelo de linguagem (4).

P(〈w1w2w3〉) = Pinicial(〈w1w2) · Transição P (c3|〈w 1w2) · Transição P(〉|w1w2w3) (4)

A língua kokborok é muito rica em prefixos e sufixos e é uma língua morfologicamente aglutinante, onde sufixos como "o", "do" e "no" são adicionados às palavras base. O 2-grama ajuda a capturar efetivamente as transições morfológicas locais nas fronteiras de afixos, enquanto o 4-grama pode capturar aquelas palavras de Kokborok que possuem dependências ortográficas mais longas encontradas em palavras raiz e compostas como Phailaidido, Thanlainai e Mwchangkha.

Isso se aplica a um corpus grande, o que aumenta a probabilidade de vários problemas de escarabidão de dados. Além disso, a combinação de caracteres pode não aparecer em todos os casos, o que pode fazer com que a probabilidade vá a zero. A suavização lambda é usada para resolver esses tipos de problemas, dando a cada n-grama contendo caracteres não vistos um valor pequeno com probabilidade diferente de zero. O valor de lambda é definido em 0,001.

figure-protocol-6  (5)

onde N = representa a quantidade de observações distintas em n-gramas.

figure-protocol-7   (6)

onde D= é o número de diferenças detectadas em n-gramas. Assume-se que a probabilidade de um n-grama não observado é a mesma.

figure-protocol-8   (7)

onde C indica o tamanho do caractere.

Os valores iniciais de Pcount, λlexi e λchar foram definidos empiricamente pela análise de frequência dos corpora de Kokborok e inglês. Primeiro, inicializamos λlexi em 0,5 e ponderamos as probabilidades lexicais e baseadas em caracteres, fazendo com que ambas contribuíssem igualmente na primeira execução. Esse nível de inicialização nos permitiu identificar o papel comparativo do léxico e do modelo de n-gramas de caracteres entre conjuntos de dados.

O parâmetro de transição Pcount (continuando no mesmo idioma) foi definido para 0,6, com base na razão das sequências monolíngues para os pontos de troca no conjunto de dados marcado manualmente. Esses valores forneciam um bom ponto de partida para convergência durante a afinação. Em seguida, o refinamento de todos os parâmetros foi realizado por meio de uma série de testes repetidos para maximizar o Coeficiente de Correlação de Matthews (MCC), detalhado na seção de Resultados.

Identificação contextual
O modelo contextual utiliza as probabilidades que já estavam inicializadas (Pcount e Pswitch) durante a fase de identificação independente e as refina usando a decodificação de sequência de Viterbi, para que as inconsistências de transição sejam reduzidas e a troca de idioma seja detectada de forma ideal.

A saída analítica do modelo de linguagem depende do contexto e é obtida principalmente combinando o token atual com o token subsequente e usando tanto os tokens anterior quanto o presente. Como existe a possibilidade de que duas palavras com o mesmo valor de frequência tenham significados semelhantes e causem classificação errada, a abordagem dependente do contexto foi usada para encontrar os termos de similaridade presentes em ambas as línguas.

Certas palavras, como "não", "fazer", "o", "são", "da (dia)", "ir", "sa (dizer)", "rosa", "anel" e muitas outras, são semelhantes em ambas as línguas. Como resultado, pode ser bastante difícil identificar a linguagem correta quando surge esse tipo de ambiguidade, e ocasionalmente as línguas são classificadas incorretamente.

Para resolver esses problemas de identificação linguística, apresentamos um conjunto de modelos de linguagem usando um Modelo de Markov Oculto discriminativo e aprendizado de máquina supervisionado. A probabilidade de transição para ambas as línguas é assumida como a mesma. Para o Pcount da mesma língua, a probabilidade contínua é o parâmetro primário que precisa ser declarado. Por meio disso, podemos calcular a probabilidade de trocar de idioma.

P switch = 1 − Pcontagem (8)

A classificação contextual usando o caminho de Viterbi é mostrada na Figura 3. O objetivo do algoritmo de Viterbi é determinar qual das linguagens das sequências de tokens é a melhor segundo Pcount e Pswitch.

O algoritmo de Viterbi é aplicado à classificação contextual. Pcount e Pswitch são usados para rotular arestas, e nós são rotulados com a verosimilhança relativa atribuída pelo primeiro classificador.

Devido à maior probabilidade de usar a língua Kokborok, o caminho tracejado seria escolhido se o primeiro classificador fosse o único usado e nenhuma informação contextual estivesse disponível.

O impacto do ajuste baseado no contexto é visualizado na Figura 4. Isso demonstra como, na ausência de informações contextuais, a segunda, terceira e quinta palavras na frase "Next week o phaisidi do" seriam identificadas incorretamente como inglês (en) (caminho tracejado). Embora as probabilidades sejam um pouco maiores para o inglês, os valores relativos são próximos.

Duas mudanças de linguagem serão penalizadas, e a probabilidade da sequência será menor que o caminho ótimo do algoritmo de Viterbi se também forem consideradas as probabilidades de transição. Assim, apenas palavras que têm mais probabilidade de se originar do outro idioma — em vez de termos comuns em ambos — podem desencadear mudanças linguísticas em sequências breves.

O Coeficiente de Correlação de Matthews foi selecionado como métrica de avaliação porque, em comparação com outras métricas como precisão, recordação e exatidão, é significativamente mais adequado para tarefas de classificação binária, pois leva em conta verdadeiros positivos e verdadeiros negativos, além de falsos positivos e falsos negativos.

figure-protocol-9   (9)

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Na Tabela 4, mostramos as pontuações MCC e os resultados de ajuste de parâmetros para Ptrp que calcularam o viés inicial para sequências iniciais com palavras de Kokborok e calcularam o Pcount, que é a probabilidade de continuar na mesma língua.

λ_lexPcount = 0,66Pcount = 0,70Pcount = 0,74Pcount = 0,79Pcou...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Embora o modelo sugerido demonstre uma precisão de 93,15% no nível das palavras, uma análise aprofundada dos erros revela vários padrões recorrentes que destacam os desafios da identificação de línguas mistas em código inglês-Kokborok.

Uso de palavras emprestadas e palavras ambíguas
Uma parte significativa dos erros surge do uso de palavras emprestadas em inglês, que se tornaram comuns no uso de Kokborok. Palavras como ...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm conflitos de interesse a declarar.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gostaríamos de agradecer aos falantes nativos locais, grupos do WhatsApp, organizações, uniões estudantis e a Sociedade Bíblica da Índia por nos ajudarem a obter o conjunto bruto de frases mistas em código. Também somos gratos ao Departamento de Ciência da Computação e Engenharia do Instituto Nacional de Tecnologia de Arunachal Pradesh e à Lovely Professional University por nos fornecerem a plataforma para examinar e testar nosso conjunto de dados.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Raspberry Pi 4Base de Base Raspberry PiRPI4-MODBP-4GBUsado para processamento de linguagem de baixo recurso
Cartão MicroSD 64GBSanDiskSDSQUAR-064G-GN6MAPara armazenamento de sistemas operacionais e conjuntos de dados
Fonte de Alimentação 5V/3ARaspberry Pi OficialSC0218Para alimentar a placa Pi
Microfone USBBoyaBY-M1Para entrada de áudio na coleta de dados de idiomas
Monitor (HDMI)LG22MK600MExibição de saída durante os testes
Teclado & Combo de Mouse.LogitechMK270Controle de interface
Dongle WiFi (se for Pi 3)TP-LinkTL-WN725NTransferência de dados sem fio (se não houver WiFi a bordo)
IDE Python (Thonny)Código Aberto-IDE para programação
Conjunto de Dados LéxicosConstruído sob medida-Par de línguas Kokborok-inglês
Conjunto de Dados N-gramaConstruído sob medidaPar de línguas inglês-Kokborok
Misturado de Código e Comutado por CódigoConstruído sob medida10.000 sentençasColetado de mensagens de redes sociais, mensagens do WhatsApp, ONGs, BÍBLIA, etc

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

L nguas de Baixo RecursoL ngua KokborokIngl s KokborokDetec o em N vel de PalavraN grama de CaracteresL xico de Frequ nciaT cnica de ViterbiModelo N o Supervisionado
Vídeo em breve

Artigos relacionados