O objetivo do protocolo dado é identificar corretamente línguas em nível de palavra dentro do texto misto em código inglês-Kokborok, usando um modelo não supervisionado que combina n-gramas de caracteres e dicionários de frequência.
Artigo de investigação
O objetivo do protocolo dado é identificar corretamente línguas em nível de palavra dentro do texto misto em código inglês-Kokborok, usando um modelo não supervisionado que combina n-gramas de caracteres e dicionários de frequência.
Há uma necessidade crescente por um modelo para detecção automática de linguagem em nível de palavra devido ao uso crescente de texto multilíngue. Para identificar frases code-switched e code-mixed na língua Kokborok e no inglês no nível das palavras, propomos um modelo não supervisionado. Numerosos estudos sobre textos codificados foram publicados, inclusive para várias línguas indianas. No entanto, até onde sabemos, nosso trabalho representa um esforço pioneiro, sendo o primeiro a identificar idiomas para pares de línguas inglês-Kokborok de poucos recursos. Empregamos um método que funde dados de um dicionário de frequências com dados de um modelo de n-grama de caracteres. A técnica de Viterbi combina um modelo de Markov n-grama de caracteres com um léxico de frequência para auxiliar na identificação precisa da língua no nível da palavra. O método proposto teve bom desempenho, com uma precisão em nível de palavra de 93,15%, o que é melhor do que o modelo BiLSTM-CRF de 88,5% e a linha de base baseada em regras de 85,3%. Isso demonstra a eficácia de combinar léxico e metodologia estatística para lidar com línguas de baixo recurso sem depender de grandes conjuntos de dados anotados.
Nesta era digital, o rápido crescimento da comunicação multilíngue de code-mixing e code-switching nas plataformas de mídia social está se tornando central para a comunicação global. A necessidade de identificação precisa dos idiomas dentro do conteúdo textual é fundamental. Após observação, descobrimos que muitas línguas indianas como hindi, bengali e telugu já foram exploradas na identificação linguística, e outras línguas indianas de baixo recurso, como manipuri, bodo e assamês, foram parcialmente abordadas em pesquisas de identificação linguística. No entanto, ainda existe uma lacuna substancial na pesquisa no desenvolvimento de modelos para o Kokborok, uma língua de poucos recursos que é tanto linguistica quanto estruturalmente distinta.
Ao contrário das línguas de baixo recurso do manipuri, assamês e bodo, o kokborok apresenta um alto nível de variação ortográfica e é escrito em alfabeto romano ou bengali, frequentemente intercambiando na comunicação. Isso cria muita ambiguidade nos limites dos tokens, transliteração e extração de características no nível dos caracteres, o que apresenta desafios distintos e raramente foi considerado na literatura. Além disso, Kokborok é uma língua aglutinante, e sua morfologia inclui prefixos e sufixos ricos (por exemplo, -o, -do, -no) e tons fonêmicos, tornando mais difícil a aplicação dos modelos existentes de identificação de linguagem codificada desenvolvidos em relação às línguas indo-arianas.
Essas questões são ainda mais agravadas pelas redes sociais. Falantes de Kokborok frequentemente tendem a misturar palavras em inglês no texto, não apenas para misturar e trocar de código, mas também para compensar a ausência de itens lexicais na frase de Kokborok. Isso leva a ortografias não padrão e ao uso de palavras relacionado ao contexto, o que representa um revés em relação a sistemas baseados em regras ou puramente lexicais.
Neste estudo, essas lacunas são abordadas propondo um modelo não supervisionado que combina dicionários de frequência e probabilidades de n-gramas de caracteres com uma estrutura de decodificação de Viterbi. O método é particularmente focado nas complexidades ortográficas, morfológicas e contextuais do par English-Kokborok, sendo assim uma das primeiras tentativas computacionais de tratar e detectar sistematicamente as barreiras linguísticas em nível de palavra nessa língua de poucos recursos.
CONTEXTO DE KOKBOROK
As palavras "Kok", que significa língua, e "Borok", que implica humano, combinam-se para formar a palavra composta "Kok-borok", que denota humano. O termo "Kok-borok" refere-se à língua falada pelo povo Borok de Tripura, bem como pelos países vizinhos de Bangladesh e Mianmar, e pelos habitantes de Mizoram, Manipur e Assam. A língua Kokborok, falada principalmente em Tripura, é escrita tanto em alfabeto romano quanto bengali. O alfabeto romano é preferido em detrimento do alfabeto bengali pela maioria dos falantes de Kokborok. Na verdade, o subgrupo linguístico sino-tibetano conhecido como tibeto-birmanês é onde a língua Kokborok se originou. A língua Kokborok e a língua Bodo são sutilmente semelhantes. As 36 variedades da língua kokborok apresentam semelhanças sutis tanto com as línguas Bodo quanto com as Kachari.
Koloma era conhecido como o alfabeto original Kokborok. O único estado na Índia, Tripura, foi controlado por 184 pessoas antes de ser unificado na União Indiana em 15 de outubro de 1949. A escrita Koloma encontrada no livro de Rajratnakar é a que foi usada para escrever as narrativas históricas. Mais tarde, no século XIV, dois brâmanes chamados Sukreswar e Vaneswar traduziram a língua para o sânscrito e depois novamente para o alfabeto bengali. Existem homofonia de raízes, tom fonêmico, morfologia verbal, ordem das palavras e sufixos derivacionais verbais produzidos pelos verbos na língua Kokborok.
Com o passar do tempo, Kokborok encontrou línguas como inglês, árabe, bengali, persa, etc. Diferentes tipos de estruturas aglutinantes intrincadas podem ser encontrados na língua Kokborok. Pessoas que falam Kokborok como língua nativa em Tripura não conseguem acessar facilmente informações porque a língua ainda não possui um sistema de escrita amplamente adotado, mas isso está sendo trabalhado.
Existem vários dialetos do kokborok falados em Tripura. Em Tripura, vários dialetos são falados, incluindo Tripura/Tripuri, Debbarma, Reang, Jamatia, Uchai, Noatia, Lusai, Kukis, Chaimal, Halam, Santal, Lepcha, Chakma, Khasia, Orangotango, Mog e Garos. De acordo com o relatório do Censo de 2011, há 1.011.294 falantes de Kokborok na Índia e mais de 400.000 em Bangladesh, uma nação vizinha.
REVISÃO DA LITERATURA
Os autores descrevem sua pesquisa contínua sobre identificação automática de línguas usando um novo conjunto de dados de postagens no Facebook com código em hindi, bengali e inglês misturados. Eles experimentam diversas técnicas, como abordagens baseadas em dicionário e classificação supervisionada, para identificação linguística no nível da palavra, destacando a importância de considerar pistas contextuais para uma identificação precisa da língua nesses ambientes.
O artigo apresenta um conjunto de dados de tweets anotados com o objetivo de identificar discurso de ódio em plataformas de redes sociais com uma mistura de código hindi-inglês que utiliza técnicas baseadas em léxico, nível de caracteres e palavra1. Um método de categorização de texto tolerante a erros baseado em N-gramas é apresentado no artigo. Primeiro, o sistema é usado para calcular perfis usando dados de conjuntos de treinamento, como amostras de material de newsgroups ou frases, que refletem as várias categorias. Depois disso, o sistema cria um perfil para o documento específico que precisa ser categorizado. Por fim, o algoritmo calcula a medida de distância entre cada perfil de categoria e o perfil do documento. A categoria cujo perfil está mais próximo do perfil do documento é escolhida pelo sistema2.
Várias técnicas de incorporação de palavras, incluindo modelos Continuous Bag of Words e Skip-Gram, foram comparadas para criar vetores de características. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine e Logistic Regression produziram boas pontuações de validaçãocruzada 3. Um resumo das abordagens anteriores é fornecido na Tabela 1.
Utilizando classificadores baseados em léxico, o estudo supera classificadores existentes em três pares de idiomas avaliados no estudo: espanhol-inglês, holandês-inglês e alemão-turco com conjuntos de dadosde redes sociais 4. A abordagem do estudo mostra maior resiliência do modelo em termos de convergência e consistência no desempenho dos testes, superando as técnicas atuais de análise de sentimento em textos codificados por 3,31% de precisão5.
Em seu trabalho seminal, a identificação estatística da linguagem por Dunning foi apresentada pela primeira vez pelo Computing Research Lab da New Mexico State University no RelatórioTécnico 6. Este artigo analisa diferentes tipos de aprendizado supervisionado usando o Modelo de Markov Oculto, o Método do Classificador de Floresta Aleatória, o Campo Aleatório Condicional e o Classificador Naive Bayes, com base no par de idiomas de dados mistos de códigoinglês-Telugu 7. O artigo foca em línguas indianas, incluindo inglês, bodo e assamês, enquanto discute uma abordagem inovadora para reconhecer línguas em material de mídias sociais codificadas. Os pesquisadores utilizam a Memória Bidirecional de Curto Prazo em um modelo de aprendizadoprofundo 8.
Neste artigo, eles usaram um grande conjunto de dados relacionado à língua gujarati — no qual a língua gujarati é misturada com inglês e hindi. Eles empregavam uma variedade de classificadores de aprendizado de máquina. Entre eles, o Classificador de Vetores de Suporte deu a melhor precisão de 92% e9.
Um arcabouço linguístico é usado na fase separada de classificação para diferenciar entre troca de código e empréstimo de tweets em holandês-inglês. Usando LID baseado em regras, Máquinas de Vetores de Suporte e Classificadores de Árvore de Decisão, eles aprendem que o DTC (micro F1 = 0,95) e o sistema LID baseado em regras (micro F1 = 0,95) têm melhordesempenho em 10.
O desempenho do modelo foi avaliado usando o conjunto de dados TRAC-1 de detecção de agressividade com comutação de código, o conjunto de dados Hinglish Offensive Tweet e o conjunto de dados de classificação de humor11. Para melhorar a retenção na aquisição lexical adulta por meio da leitura, foi proposta uma abordagem probabilística como metodologia L2 para produzir texto mixtoem código 12. Um módulo de dicionário é incorporado e usado para realizar testes em vários classificadores supervisionados a fim de controlar a mistura de códigoem nível de palavra 13.
Eles usaram uma variedade de métricas para analisar padrões de comutação de código e descobriram que, tanto para espanhol-inglês quanto para hindi-inglês, os modelos de redes neurais tiveram desempenho pior que o modelo de Campos Aleatórios Condicionais (CRF) por uma margem de 2,5 e 3,5 pontos percentuais, respectivamente14.
Usando um léxico bilíngue e um texto em inglês como entrada, o método constrói um gráfico fatorial sobre menções lexicais para produzir um texto comutado em código que otimiza um dado parâmetro de "aprendibilidade". Neste artigo, eles buscam entender melhor os conceitos da caixa de ferramentas CanVEC com base nos pares de linguagens de dados codificados hindi-inglês. Eles alcançaram com sucesso uma pontuação F1 de 87,99% euma precisão de 15,16.
Os autores examinam primeiro a mistura de código entre Gujarati e English17, aplicando um pipeline de três estágios para identificar o idioma de cada token, normalizar a ortografia e transliterar segmentos de volta para seus alfabetos nativos. Eles então mudam o foco para um corpus18 hindi-inglês, onde introduzem novos algoritmos de detecção de sentimento especificamente ajustados para estruturas bilíngues de frase. Para apoiar experimentação controlada, eles geram texto sintético misturado em código treinando modelos skip-gram em dados monolíngues e misturando as saídas19.
Em seguida, um conjunto de dados de mídias sociais20 em Konkani-English é processado por meio de um método de identificação em nível de palavra baseado em regras, alcançando desempenho robusto sem qualquer dado de treinamento21 anotado manualmente. Expandindo o escopo, um estudo utiliza um grande corpus transliterado de inglês, hindi, bengali e assamês de plataformas como o Facebook22 para avaliar uma variedade de técnicas de marcação em nível de palavra. Com base nisso, outro framework23 alterna dinamicamente entre idiomas para detectar frases embutidas ou emprestadas com alta precisão. No domínio agrícola, os comentários punjabi-ingleses são classificados usando vários modelos — entre eles, um classificador n-grama oferece a melhor precisão24. Para o CMST cingalês-inglês, aprendizes em conjunto (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression) são comparados, com Random Forest emergindo como o25 melhor desempenho, enquanto embeddings em nível de caráter combinados com SVMs alcançam resultados fortes nos pares Tâmil-Inglês e Malaiala-Inglês26. Por fim, o Projeto Crúbadán27 é apresentado como um esforço em grande escala para construir corpora linguísticos com poucos recursos, rastreando a web, estabelecendo as bases para futuras pesquisas em mixagem de código.
| Conjunto de dados | Principais Resultados | Precisão/F1-Pontuação/Precisão/Prática/Recordação |
| Conjunto de dados em hindi–bengali–inglês retirado de postagens no Facebook | Destacou os desafios de identificação linguística em mídias sociais em nível de palavra Texto | 89.30% |
| Artigos de notícias, documentos | Efetivamente realizado usando N-gramas para identificação de línguas | 0.99% |
| Conjuntos de dados mistos de código indianos | Demonstrando a boa precisão na identificação linguística em nível de palavra | Não reportado (NR) |
| Conjuntos de dados baseados na Wikipédia | Detecção robusta de comutadores de código em nível de token | Não reportado (NR) |
| Tweets hindi–inglês | Desempenho: Melhora na classificação de sentimento do código misto em hindi e inglês | 0.78% |
| Corpora multilíngue | Estrutura fundamental estabelecida para identificação linguística | 78.00% |
| Code_mixed Dados inglês–telugu | O CRF alcançou o melhor desempenho | 89.30% |
| Texto mixado em código inglês–Bodo | Alcançou alta precisão em nível de palavra | 92.00% |
| Alfabetos mistos de código Gujarati–Hindi | A precisão da identificação linguística em nível de frase é ≈92% | 92.00% |
| Tweets em holandês-inglês | Modelos DTC e baseados em regras alcançaram F1 ≈0,95 | 95.00% |
| Conjuntos de dados comutados por código | Desempenho competitivo entre modelos | Não reportado (NR) |
| Texto Misto de Código Sintético | Aprimoramento do aprendizado lexical | Não reportado (NR) |
| Texto misto inglês–canarês | LID automático efetivo | Não reportado (NR) |
| TRAC-1, conjuntos de dados hinglish | O CRF superou em modelos de Redes Neurais | 91.00% |
| Dados online multilíngues | Identificação precisa em nível de palavra em Lnaguage | 88.00% |
| Mídias sociais hindi–inglês | Alta precisão na identificação linguística do hindi-inglês | 0.93% |
| Código Inglês–Gujarati - Misto | Processamento bilíngue eficaz | |
| Conjuntos de dados mistos de código para redes sociais | Aprimoramento na detecção de sentimento | 0.90% |
| Dados sintéticos mistos de código | Representações fortes de imersão | Não reportado (NR) |
| Código Misto Konkani–Inglês Texto de Mídias Sociais | Desempenho robusto sem anotação | 0.89% |
| Conjunto de dados code-mixed do Twitter | Detecção aprimorada de interruptores | 90.20% |
| Assamês–Bengali–Hindi–Inglês | Identificação precisa de línguas multilíngues | 91.00% |
| Redes sociais - Código misto | Pontuação F1 ≈0,95 | 0.95% |
| Código Inglês–Punjabi Dados mistos | O modelo N-grama teve melhor desempenho | 0.88% |
| Dados mistos em cingalês–inglês | RF alcançou a melhor precisão | 0.92% |
| Comentários mistos no Facebook | LID aprimorado em nível de palavra | 0.93% |
| Crúbadán Corpus | Possibilitou pesquisas linguísticas de baixo recurso | Não reportado (NR) |
| Conjuntos de dados mistos de código | Bom desempenho demonstrado na Identificação de Linguagem em nível de palavra | 0.94% |
Tabela 1: Resumo da Literatura em Línguas Mistas em Código.
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
O texto em inglês e Kokborok misturado e codificado foi coletado manualmente de conversas locais e publicações públicas em plataformas de redes sociais. Nenhuma informação pessoalmente identificável ou sensível foi coletada. Todos os procedimentos seguiram diretrizes éticas institucionais.
3. Projeto e implementação
3.1 Algoritmo
3.1.1 Para cada ficha na Frase (S):
um. Usando o dicionário de frequências, calcula-se a probabilidade lexical Plexi .
b. Com base no modelo N-grama, a probabilidadebaseada em caracteres P é calculada
c. interpolação ponderada de ambos:
Pcombinado = λlexi Plexi + λchar Pchar
3.1.2. A combinação de probabilidade Pcombinada para cada token foi armazenada como probabilidade de emissão.
3.1.3. Aplique o algoritmo de Viterbi:
um. Dado inicialmente com probabilidades de idioma inicial.
b. Para cada ficha:
i. Calcular atransição P contagem de transições (continuação no mesmo idioma).
eP switch (probabilidade de mudança de idioma).
ii. Selecionar o caminho da linguagem e maximizar a probabilidade da sequência.
3.1.4. Produza a sequência de linguagem de máxima probabilidade L com maior probabilidade geral.
3.2 Ambiente computacional
A implementação de todos os experimentos foi feita usando Python 3.10 na plataforma Google Colab. O sistema usava um conjunto de pacotes básicos em Python como NumPy, Pandas e Matplotlib para processar e visualizar dados, e scikit-learn (v1.3) para fazer previsões e análises estatísticas. A integração do dicionário de frequência, modelagem n-grama de caracteres e decodificação de Viterbi foram implementadas com scripts personalizados em Python. O modelo foi treinado e testado em um conjunto de dados de 10.000 frases, com uma divisão 70/30 para treinamento e teste.
3.3 Identificação do idioma
Uma vez que uma frase é tokenizada, o módulo de identificação de idioma decide se cada token está em Kokborok ou em inglês. A arquitetura completa do sistema está ilustrada na Figura 1. Essa atribuição de idioma é então usada para determinar quais módulos de transcrição são apropriados. Ao mesclar dados de um modelo de n-grama de caracteres e um dicionário de frequência, determina-se a linguagem de um token.
Devido às diferenças ortográficas significativas entre as duas linguagens descritas acima, um classificador que usa apenas informações do próprio token, sem nenhuma característica contextual, já tem um bom desempenho. No entanto, após a atribuição inicial, outro classificador usando o algoritmo de Viterbi é aplicado. Esse segundo classificador reduz a classificação incorreta de homógrafos interlinguais e favorece agrupamentos de palavras que pertencem à mesma língua.

Figura 1: Padrões em nível de palavra e mudanças de linguagem penalizantes usando o rithmo do algoritmo de Viterbi. Por favor, clique aqui para ver uma versão ampliada desta figura.

Figura 2: Método para identificação linguística em frases misturadas em código. Por favor, clique aqui para ver uma versão ampliada desta figura.
Coletamos os dados do corpus27 de Crúbadán para o dicionário e o modelo de caracteres. Numerosas línguas, incluindo muitas línguas minoritárias como Kokborok, estão presentes neste corpus.
Como o conjunto de dados no corpus de Crúbadán é insuficiente para nosso propósito, testamos um novo conjunto de dados bíblicos Kokborok. Comparado a outras línguas, há relativamente poucas fontes disponíveis. Assim, os dados das frases mistas deste artigo foram coletados de grupos de WhatsApp falantes de Kokborok, como Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (UE), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung e Tripura Uchoi Youth Association (TUYA).
Um total de 10.000 frases codificadas em Kokborok e inglês foram coletadas desses grupos do WhatsApp entre agosto de 2021 e dezembro de 2023. As fontes e a distribuição de domínio do conjunto de dados estão listadas na Tabela 2.
| Nome | Total de palavras contadas |
| Palavras da Bíblia Kokborok | 718883 |
| Frases mistas em código em inglês e Kokborok | 68789 |
Tabela 2: Palavras totais de Kokborok.
| Idioma | Total Tokens |
| Kokborok (trp) | 711509 |
| Inglês (en) | 1767141 |
Tabela 3: Modelo de 2 gramas de personagem.
| Sl. Não | Frases totais de código mistas usadas |
| 1 | 10,768 |
Tabela 4: Total de sentenças mistas treinadas.
O modelo de caracteres e o dicionário foram retirados do corpus27 de Crúbadán. Esta coleção, acessível para uma ampla variedade de idiomas, incluindo inúmeras línguas minoritárias, é criada automaticamente por meio da busca na internet por materiais no idioma alvo. O corpus de Kokborok, em particular, é relativamente pequeno porque a abordagem foi criada inicialmente para Kokborok.
Embora um corpus de Kokborok e inglês também esteja disponível, ele foi propositalmente não utilizado devido à falta de conjuntos de dados, especialmente em termos de code-mixing e code-flipping. Há também vários termos em inglês no corpus de Kokborok; algumas dessas palavras (incluindo no, do e o) são mais comuns do que no corpus inglês.
O dicionário e o modelo de linguagem realizam a tarefa de rotulagem independente de palavras individuais. Nossa tarefa é comparável à de King et al.28.
As probabilidades lexicais (lex), caracteres (ch) e etiquetas de palavra são utilizadas para criar uma interpolação linear entre as frequências dos componentes lexical (ch) e lexical (lex). A probabilidade combinada (pente) que resulta disso é mostrada na equação (1) abaixo; os parâmetros detalhados de interpolação são apresentados na Tabela 3. A estratégia de interpolação é representada na Figura 2.
Pcombinado = λlexi · Plexi + λchar · Personagem de P (1)
Onde 0 ≤ λlexi, λchar ≤ 1; e λlexi + λchar = 1. Palavras sem base lexical têm uma verosimilhança lexical extremamente baixa, mas não nula. Presumivelmente, caso uma palavra esteja ausente em ambas as línguas léxicas, o modelo de caracteres é usado para implementação em vez da probabilidade lexical, mesmo que λlexi = 1.
Nosso método para desenvolver o modelo de personagem é baseado na cadeia de Markov de caráter n-grama de Dunning (1994). Isso é realizado contando n-gramas no início e no fim dos tokens, respectivamente, para estimar as probabilidades inicial e de transição.
A comparação de desempenho dos modelos treinados de 2 gramas e 4 gramas é mostrada abaixo.
(2)
·
(3)
As palavras iniciais e de transição de uma probabilidade podem ser multiplicadas para obter a probabilidade de uma palavra usando o modelo de linguagem (4).
P(〈w1w2w3〉) = Pinicial(〈w1w2) · Transição P (c3|〈w 1w2) · Transição P(〉|w1w2w3) (4)
A língua kokborok é muito rica em prefixos e sufixos e é uma língua morfologicamente aglutinante, onde sufixos como "o", "do" e "no" são adicionados às palavras base. O 2-grama ajuda a capturar efetivamente as transições morfológicas locais nas fronteiras de afixos, enquanto o 4-grama pode capturar aquelas palavras de Kokborok que possuem dependências ortográficas mais longas encontradas em palavras raiz e compostas como Phailaidido, Thanlainai e Mwchangkha.
Isso se aplica a um corpus grande, o que aumenta a probabilidade de vários problemas de escarabidão de dados. Além disso, a combinação de caracteres pode não aparecer em todos os casos, o que pode fazer com que a probabilidade vá a zero. A suavização lambda é usada para resolver esses tipos de problemas, dando a cada n-grama contendo caracteres não vistos um valor pequeno com probabilidade diferente de zero. O valor de lambda é definido em 0,001.
(5)
onde N = representa a quantidade de observações distintas em n-gramas.
(6)
onde D= é o número de diferenças detectadas em n-gramas. Assume-se que a probabilidade de um n-grama não observado é a mesma.
(7)
onde C indica o tamanho do caractere.
Os valores iniciais de Pcount, λlexi e λchar foram definidos empiricamente pela análise de frequência dos corpora de Kokborok e inglês. Primeiro, inicializamos λlexi em 0,5 e ponderamos as probabilidades lexicais e baseadas em caracteres, fazendo com que ambas contribuíssem igualmente na primeira execução. Esse nível de inicialização nos permitiu identificar o papel comparativo do léxico e do modelo de n-gramas de caracteres entre conjuntos de dados.
O parâmetro de transição Pcount (continuando no mesmo idioma) foi definido para 0,6, com base na razão das sequências monolíngues para os pontos de troca no conjunto de dados marcado manualmente. Esses valores forneciam um bom ponto de partida para convergência durante a afinação. Em seguida, o refinamento de todos os parâmetros foi realizado por meio de uma série de testes repetidos para maximizar o Coeficiente de Correlação de Matthews (MCC), detalhado na seção de Resultados.
Identificação contextual
O modelo contextual utiliza as probabilidades que já estavam inicializadas (Pcount e Pswitch) durante a fase de identificação independente e as refina usando a decodificação de sequência de Viterbi, para que as inconsistências de transição sejam reduzidas e a troca de idioma seja detectada de forma ideal.
A saída analítica do modelo de linguagem depende do contexto e é obtida principalmente combinando o token atual com o token subsequente e usando tanto os tokens anterior quanto o presente. Como existe a possibilidade de que duas palavras com o mesmo valor de frequência tenham significados semelhantes e causem classificação errada, a abordagem dependente do contexto foi usada para encontrar os termos de similaridade presentes em ambas as línguas.
Certas palavras, como "não", "fazer", "o", "são", "da (dia)", "ir", "sa (dizer)", "rosa", "anel" e muitas outras, são semelhantes em ambas as línguas. Como resultado, pode ser bastante difícil identificar a linguagem correta quando surge esse tipo de ambiguidade, e ocasionalmente as línguas são classificadas incorretamente.
Para resolver esses problemas de identificação linguística, apresentamos um conjunto de modelos de linguagem usando um Modelo de Markov Oculto discriminativo e aprendizado de máquina supervisionado. A probabilidade de transição para ambas as línguas é assumida como a mesma. Para o Pcount da mesma língua, a probabilidade contínua é o parâmetro primário que precisa ser declarado. Por meio disso, podemos calcular a probabilidade de trocar de idioma.
P switch = 1 − Pcontagem (8)
A classificação contextual usando o caminho de Viterbi é mostrada na Figura 3. O objetivo do algoritmo de Viterbi é determinar qual das linguagens das sequências de tokens é a melhor segundo Pcount e Pswitch.
O algoritmo de Viterbi é aplicado à classificação contextual. Pcount e Pswitch são usados para rotular arestas, e nós são rotulados com a verosimilhança relativa atribuída pelo primeiro classificador.
Devido à maior probabilidade de usar a língua Kokborok, o caminho tracejado seria escolhido se o primeiro classificador fosse o único usado e nenhuma informação contextual estivesse disponível.
O impacto do ajuste baseado no contexto é visualizado na Figura 4. Isso demonstra como, na ausência de informações contextuais, a segunda, terceira e quinta palavras na frase "Next week o phaisidi do" seriam identificadas incorretamente como inglês (en) (caminho tracejado). Embora as probabilidades sejam um pouco maiores para o inglês, os valores relativos são próximos.
Duas mudanças de linguagem serão penalizadas, e a probabilidade da sequência será menor que o caminho ótimo do algoritmo de Viterbi se também forem consideradas as probabilidades de transição. Assim, apenas palavras que têm mais probabilidade de se originar do outro idioma — em vez de termos comuns em ambos — podem desencadear mudanças linguísticas em sequências breves.
O Coeficiente de Correlação de Matthews foi selecionado como métrica de avaliação porque, em comparação com outras métricas como precisão, recordação e exatidão, é significativamente mais adequado para tarefas de classificação binária, pois leva em conta verdadeiros positivos e verdadeiros negativos, além de falsos positivos e falsos negativos.
(9)
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Na Tabela 4, mostramos as pontuações MCC e os resultados de ajuste de parâmetros para Ptrp que calcularam o viés inicial para sequências iniciais com palavras de Kokborok e calcularam o Pcount, que é a probabilidade de continuar na mesma língua.
| λ_lex | Pcount = 0,66 | Pcount = 0,70 | Pcount = 0,74 | Pcount = 0,79 | Pcou... |
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Embora o modelo sugerido demonstre uma precisão de 93,15% no nível das palavras, uma análise aprofundada dos erros revela vários padrões recorrentes que destacam os desafios da identificação de línguas mistas em código inglês-Kokborok.
Uso de palavras emprestadas e palavras ambíguas
Uma parte significativa dos erros surge do uso de palavras emprestadas em inglês, que se tornaram comuns no uso de Kokborok. Palavras como ...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Os autores não têm conflitos de interesse a declarar.
Gostaríamos de agradecer aos falantes nativos locais, grupos do WhatsApp, organizações, uniões estudantis e a Sociedade Bíblica da Índia por nos ajudarem a obter o conjunto bruto de frases mistas em código. Também somos gratos ao Departamento de Ciência da Computação e Engenharia do Instituto Nacional de Tecnologia de Arunachal Pradesh e à Lovely Professional University por nos fornecerem a plataforma para examinar e testar nosso conjunto de dados.
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
| Nome | Empresa | Número de catálogo | Comentários |
|---|---|---|---|
| Raspberry Pi 4 | Base de Base Raspberry Pi | RPI4-MODBP-4GB | Usado para processamento de linguagem de baixo recurso |
| Cartão MicroSD 64GB | SanDisk | SDSQUAR-064G-GN6MA | Para armazenamento de sistemas operacionais e conjuntos de dados |
| Fonte de Alimentação 5V/3A | Raspberry Pi Oficial | SC0218 | Para alimentar a placa Pi |
| Microfone USB | Boya | BY-M1 | Para entrada de áudio na coleta de dados de idiomas |
| Monitor (HDMI) | LG | 22MK600M | Exibição de saída durante os testes |
| Teclado & Combo de Mouse. | Logitech | MK270 | Controle de interface |
| Dongle WiFi (se for Pi 3) | TP-Link | TL-WN725N | Transferência de dados sem fio (se não houver WiFi a bordo) |
| IDE Python (Thonny) | Código Aberto | - | IDE para programação |
| Conjunto de Dados Léxicos | Construído sob medida | - | Par de línguas Kokborok-inglês |
| Conjunto de Dados N-grama | Construído sob medida | Par de línguas inglês-Kokborok | |
| Misturado de Código e Comutado por Código | Construído sob medida | 10.000 sentenças | Coletado de mensagens de redes sociais, mensagens do WhatsApp, ONGs, BÍBLIA, etc |
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE
Solicitar permissão