Artículo de investigación

Identificación lingüística de pocos recursos de oraciones mixtas en inglés y código Kokborok

DOI:

10.3791/69130

2 de enero de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El objetivo del protocolo dado es identificar correctamente los idiomas a nivel de palabra dentro del texto mezclado en código inglés-Kokborok utilizando un modelo no supervisado que combina n-gramas de caracteres y diccionarios de frecuencia.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Existe una necesidad creciente de un modelo para la detección automática de lenguas a nivel de palabra debido al uso creciente de texto multilingüe. Para identificar oraciones con cambio de código y mezcladas en el idioma kokborok y el inglés a nivel de palabra, proponemos un modelo no supervisado. Se han publicado numerosos estudios sobre texto mezclado en código, incluyendo para varias lenguas indias. Sin embargo, hasta donde sabemos, nuestro trabajo representa un esfuerzo pionero, siendo el primero en identificar idiomas para pares inglese-Kokborok de pocos recursos. Hemos empleado un método que fusiona datos de un diccionario de frecuencias con datos de un modelo de caracteres n-gramos. La técnica de Viterbi combina un modelo de Markov n-grama de caracteres con un léxico de frecuencia para ayudar en la identificación precisa del lenguaje a nivel de palabra. El método propuesto funcionó bien, con una precisión a nivel de palabra del 93,15%, lo que es mejor que el modelo BiLSTM-CRF del 88,5% y la línea base basada en reglas del 85,3%. Esto demuestra la eficacia de combinar el léxico y la metodología estadística para manejar lenguas de pocos recursos sin depender de grandes conjuntos de datos anotados.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En esta era digital, el rápido crecimiento de la comunicación multilingüe de code-mixing y code-switching en las plataformas de redes sociales se está convirtiendo en un elemento central para la comunicación global. La necesidad de una identificación precisa de los idiomas dentro del contenido textual es fundamental. Tras observar, descubrimos que muchas lenguas indias como el hindi, el bengalí y el telugu ya han sido exploradas en la identificación lingüística, y que otras lenguas indias de bajo recurso como el manipuri, bodo y asamés han sido parcialmente abordadas en la investigación de identificación lingüística. Sin embargo, todavía existe una importante laguna en la investigación en el desarrollo de modelos para el kokborok, una lengua de pocos recursos que es tanto lingüística como estructuralmente distinta.

A diferencia de las lenguas manipuri, asamás y bodo, de baja repercusión, el kokborok presenta un alto nivel de variación ortográfica y se escribe en alfabeto romano o bengalí, a menudo de forma intercambiable en la comunicación. Esto crea mucha ambigüedad en los límites de los tokens, la transliteración y la extracción de características a nivel de personaje, lo que presenta desafíos claros y rara vez se ha considerado en la literatura. Además, el kokborok es una lengua aglutinante, y su morfología incluye prefijos y sufijos ricos (por ejemplo, -o, -do, -no) y tonos fonémicos, lo que dificulta la aplicación de modelos existentes de identificación de lenguas codificadas desarrollados respecto a las lenguas indoarias.

Estos problemas se ven aún más agravados por las redes sociales. Los hablantes de kokborok suelen mezclar palabras en inglés en el texto, no solo para mezclar y cambiar de código, sino también para compensar la ausencia de elementos léxicos en la oración de Kokborok. Esto conduce a ortografías no estándar y al uso de palabras relacionado con el contexto, lo que supone un retroceso frente a sistemas basados en reglas o puramente léxicos.

En este estudio, estas lagunas se abordan proponiendo un modelo no supervisado que combina diccionarios de frecuencia y probabilidades de n-gramas de caracteres con un marco de decodificación de Viterbi. El método se centra especialmente en las complejidades ortográficas, morfológicas y contextuales del par inglés-Kokborok, por lo que es uno de los primeros intentos computacionales de tratar y detectar sistemáticamente las barreras lingüísticas a nivel de palabra en esta lengua de pocos recursos.

ANTECEDENTES DE KOKBOROK
Las palabras "Kok", que significa lenguaje, y "Borok", que implica humano, se combinan para formar la palabra compuesta "Kok-borok", que denota humano. El término "Kok-borok" se refiere a la lengua hablada por el pueblo Borok de Tripura, así como a los de los países vecinos de Bangladesh y Myanmar, y a los habitantes de Mizoram, Manipur y Assam. La lengua kokborok, hablada principalmente en tripura, se escribe tanto en alfabetos romano como bengalí. La escritura romana es preferida por la mayoría de los hablantes de Kokborok sobre la bengalí. En realidad, el subgrupo lingüístico sino-tibetano conocido como tibeto-birmano es donde se originó la lengua kokborok. La lengua kokborok y la lengua bodo son sutilmente similares. Las 36 variedades de la lengua kokborok presentan sutiles similitudes tanto con las lenguas bodo como con la kachari.

Koloma era conocida como la escritura original de Kokborok. El único estado en la India, Tripura, estuvo controlado por 184 personas antes de unirse en la Unión India el 15 de octubre de 1949. La escritura Koloma que se encuentra en el libro de Rajratnakar es la que se utilizó para escribir las narrativas históricas. Más tarde, en el siglo XIV, dos brahmanes llamados Sukreswar y Vaneswar tradujeron el idioma al sánscrito y luego de nuevo a la escritura bengalí. Existen homofonía de raíces, tono fonémico, morfología verbal, orden de palabras y sufijos derivacionales verbales producidos a partir de los verbos en la lengua kokborok.

Con el tiempo, Kokborok ha encontrado idiomas como el inglés, árabe, bengalí, persa, etc. En la lengua kokborok se pueden encontrar diferentes tipos de estructuras aglutinantes intrincadas. Las personas que hablan kokborok como lengua nativa en Tripura no pueden acceder fácilmente a la información porque la lengua aún no tiene una escritura ampliamente adoptada, pero esto se está trabajando en ello.

En Tripura se hablan varios dialectos del kokborok. En Tripura se hablan varios dialectos, incluyendo Tripura/Tripuri, Debbarma, Reang, Jamatia, Uchai, Noatia, Lusai, Kukis, Chaimal, Halam, Santal, Lepcha, Chakma, Khasia, Oranguán, Mog y Garos. Según el informe del censo de 2011, hay 1.011.294 hablantes de kokborok en India y más de 400.000 en Bangladés, una nación vecina.

REVISIÓN DE LA LITERATURA
Los autores describen su investigación en curso sobre la identificación automática de idiomas utilizando un nuevo conjunto de datos de publicaciones en Facebook con código en hindi, bengalí e inglés mezclado. Experimentan con diversas técnicas, como enfoques basados en diccionarios y clasificación supervisada, para la identificación lingüística a nivel de palabra, destacando la importancia de considerar las pistas contextuales para una identificación lingüística precisa en tales entornos.

El artículo presenta un conjunto de datos de tuits anotados con el propósito de identificar discursos de odio en plataformas de redes sociales con una mezcla de código hindi-inglés que utiliza técnicas basadas en léxicos, a nivel de carácter y a nivel depalabra 1. En el artículo se presenta un método de categorización de texto tolerante a errores basado en N-gramas. Primero, el sistema se utiliza para calcular perfiles utilizando datos de conjuntos de entrenamiento, como muestras de material o frases de grupos de noticias, que reflejan las distintas categorías. Después de eso, el sistema crea un perfil para el documento específico que debe categorizarse. Por último, el algoritmo calcula la medida de distancia entre cada perfil de categoría y el perfil del documento. La categoría cuyo perfil está más cerca del perfil del documento es elegida por el sistema2.

Se compararon varias técnicas de incrustación de palabras, incluyendo los modelos Continuous Bag of Words y Skip-Gram, para crear vectores de características. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine y Logistic Regression obtuvieron buenas puntuaciones de validacióncruzada 3. Un resumen de los enfoques previos se ofrece en la Tabla 1.

Utilizando clasificadores basados en léxicos, el estudio supera a los clasificadores existentes en tres emparejamientos lingüísticos evaluados en el estudio: español-inglés, neerlandés-inglés y alemán-turco con conjuntos de datos de redessociales 4. El enfoque del estudio muestra una mayor resiliencia del modelo en términos de convergencia y consistencia en el rendimiento de las pruebas, superando las técnicas actuales de análisis de sentimiento en textos codificados con un 3,31 por ciento de precisión5.

En su trabajo fundamental, la identificación estadística del lenguaje por parte de Dunning fue presentada por primera vez por el Computing Research Lab de la Universidad Estatal de Nuevo México en el InformeTécnico 6. Este artículo analiza diferentes tipos de aprendizaje supervisado utilizando el Modelo de Markov Oculto, el Método del Clasificador de Bosque Aleatorio, el Campo Aleatorio Condicional y el Clasificador Naive Bayes basándose en el par de lenguajes de datos mixtos en códigoinglés-telugu 7. El artículo se centra en lenguas indias, incluyendo inglés, bodo y asamés, mientras discute un enfoque novedoso para reconocer lenguas en material de redes sociales mezclado en código. Los investigadores utilizan la Memoria Bidireccional a Corto Plazo en un modelo de aprendizajeprofundo 8.

En este artículo, han utilizado un conjunto de datos considerable relacionado con la lengua gujarati, en la que la lengua gujarati se mezcla con inglés e hindi. Empleaban una variedad de clasificadores de aprendizaje automático. Entre ellos, el Clasificador de Vectores de Soporte ofreció la mejor precisión del 92 por ciento y9 por ciento.

En la fase de clasificación separada se utiliza un marco lingüístico para diferenciar entre cambio de código y préstamo de tuits en neerlandés-inglés. Utilizando LID basado en reglas, máquinas de vectores de soporte y clasificadores de árbol de decisión, aprenden que el DTC (micro F1 = 0,95) y el sistema LID basado en reglas (micro F1 = 0,95) rinden mejor10.

El rendimiento de su modelo fue evaluado utilizando el conjunto de datos TRAC-1 de detección de agresividad por cambio de código, el conjunto de datos Hinglish Offensive Tweet y el conjunto de datos de clasificación de humor11. Para mejorar la retención en la adquisición léxica adulta mediante la lectura, se propuso un enfoque probabilístico como metodología L2 para producir texto mezcladoen código 12. Se incorpora un módulo de diccionario que se utiliza para realizar pruebas en varios clasificadores supervisados con el fin de controlar la mezcla de códigoa nivel de palabra 13.

Utilizaron una variedad de métricas para analizar los patrones de conmutación de código y descubrieron que, tanto en español-inglés como en hindi-inglés, los modelos de redes neuronales tenían un rendimiento peor que el modelo de Campos Aleatorios Condicionales (CRF) por un margen de 2,5 y 3,5 puntos porcentuales, respectivamente14.

Utilizando un léxico bilingüe y un texto en inglés como entrada, el método construye un grafo de factores sobre menciones léxicas para producir un texto codificado que optimiza un parámetro dado de "aprendibilidad". En este artículo, buscan comprender mejor los conceptos de la caja de herramientas CanVEC basándose en los pares de lenguajes de datos conmutados en código hindi-inglés. Lograron con éxito una puntuación F1 del 87,99 por ciento y una precisiónde 15,16.

Los autores examinan primero la mezcla de código entre el gujarati y el inglés17, aplicando una tubería de tres etapas para identificar el idioma de cada token, normalizar la ortografía y transliterar los segmentos de nuevo a sus escrituras nativas. Luego se centran en un corpus18 hindi-inglés, donde introducen novedosos algoritmos de detección de sentimientos específicamente adaptados a estructuras de oraciones bilingües. Para apoyar la experimentación controlada, generan texto sintético mezclado mediante códigos entrenando modelos skip-gram en datos monolingües y mezclando las salidas19.

A continuación, un conjunto de datos de redessociales 20 en konkani-inglés se procesa mediante un método de identificación a nivel de palabra basado en reglas, logrando un rendimiento robusto sin necesidad de datos de entrenamiento anotadosmanualmente 21. Ampliando el alcance, un estudio utiliza un gran corpus transliterado de inglés, hindi, bengalí y asamés de plataformas como Facebook22 para evaluar una variedad de técnicas de etiquetado a nivel de palabra. A partir de esto, otro marco23 cambia dinámicamente entre idiomas para detectar frases incrustadas o prestadas con alta precisión. En el ámbito agrícola, los comentarios punjabí-inglés se clasifican usando varios modelos; entre ellos, un clasificador n-gram ofrece la mejor precisión24. Para el CMST cingalés-inglés, se comparan los aprendices en conjunto (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression), destacando Random Forest como el mejordesempeño 25, mientras que los embeddings a nivel de carácter combinados con SVMs logran buenos resultados en los pares tamil-inglés y malayalam-inglés26. Finalmente, el ProyectoCrúbadán 27 se presenta como un esfuerzo a gran escala para construir corpus lingüísticos con pocos recursos rastreando la web, sentando las bases para futuras investigaciones de mezcla de código.

Conjunto de datosResultados clavePrecisión/F1-Puntuación/Precisión/Práctica/Recuperación
Conjunto de datos en hindi–bengalí–inglés extraído de publicaciones en FacebookSe destacaron los desafíos de identificación lingüística en el texto de redes sociales a nivel de palabra89.30%
Artículos de prensa, documentosEficaz realizada usando N-gramas para la identificación del idioma0.99%
Conjuntos de datos indios mixtos en códigoDemostrando la buena precisión en la identificación lingüística a nivel de palabraNo reportado (NR)
Conjuntos de datos basados en WikipediaDetección robusta de conmutadores de código a nivel de tokenNo reportado (NR)
Tuits en hindi–inglésRendimiento Mejorado en la clasificación de sentimiento de código mixto en hindi e inglés0.78%
Corpus multilingüesMarco fundamental establecido para la identificación lingüística78.00%
Code_mixed Datos inglés–teluguEl CRF logró su mejor rendimiento89.30%
Texto mezclado en inglés y bodoLogró una alta precisión a nivel de palabra92.00%
Escrituras codificadas mixtas gujarati-hindiLa precisión de identificación lingüística a nivel de oración es ≈92%92.00%
Tuits neerlandés-inglésLos modelos DTC y basados en reglas lograron la F1 ≈0,9595.00%
Conjuntos de datos conmutados por códigoRendimiento competitivo entre modelosNo reportado (NR)
Texto mixto de código sintéticoMejora del aprendizaje léxicoNo reportado (NR)
Texto mixto inglés–kannadaLID automático efectivoNo reportado (NR)
TRAC-1, conjuntos de datos hinglishEl CRF superó en modelos de redes neuronales91.00%
Datos en línea multilingüesIdentificación precisa a nivel de palabra en Lnaguage88.00%
Redes sociales hindi–inglésAlta precisión en la identificación lingüística del hindi-inglés0.93%
Código inglés–gujarati -MixtoProcesamiento bilingüe efectivo
Redes sociales Conjuntos de datos code-MixedMejora en la detección de sentimientos0.90%
Datos sintéticos mezclados en códigoRepresentaciones de incrustación fuertesNo reportado (NR)
Código mixto-código Konkani–Inglés Texto de redes socialesRendimiento robusto sin anotación0.89%
Conjunto de datos code-mixed de TwitterMejora en la detección de interruptores90.20%
Asamés–bengalí–hindi–inglésIdentificación precisa de lenguas multilingües91.00%
Redes sociales Código Texto mixtoPuntuación F1 ≈0,950.95%
Datos mixtos en inglés–punjabiEl modelo N-gram fue el que mejor rindió0.88%
Datos mixtos en código cingalés–inglésRF alcanzó la máxima precisión0.92%
Comentarios mixtos en código de FacebookLID mejorado a nivel de palabra0.93%
Crúbadán CorpusPosibilitó la investigación lingüística con pocos recursosNo reportado (NR)
Conjuntos de datos mixtos de códigoBuen rendimiento demostrado en la Identificación de Lengua a nivel de palabra0.94%

Tabla 1: Resumen de la Literatura de Lenguas Mixtas en Código.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El texto mezclado y modificado en inglés y Kokborok se recopiló manualmente a partir de conversaciones locales y publicaciones públicas en redes sociales. No se recopiló información personal identificable ni sensible. Todos los procedimientos seguían las directrices éticas institucionales.

3. Diseño e implementación

3.1 Algoritmo
3.1.1 Para cada ficha en la Oración (S):
un. Usando el diccionario de frecuencias, se calcula la probabilidad léxica Plexi .
b. Basado en el modelo N-grama, se calcula la probabilidad basada en caracteres Pchar
c. interpolación ponderada de ambos:
Pcombinado = λlexi Plexi + λchar Pchar
3.1.2. La combinación de probabilidad Pcombinada para cada token se ha almacenado como probabilidad de emisión.
3.1.3. Aplicar el algoritmo de Viterbi:
un. Dado inicialmente con probabilidades de idioma inicial.
b. Para cada ficha:
i. Calcular la transiciónP conteo de transición (continuación en el mismo idioma).
yP switch (probabilidad de cambio de idioma).
ii. Seleccionar el camino del idioma y maximizar la probabilidad de secuencia.
3.1.4. Producir la secuencia de lenguaje de máxima probabilidad L con mayor probabilidad global.

3.2 Entorno computacional
La implementación de todos los experimentos se realizó usando Python 3.10 en la plataforma Google Colab. El sistema utilizaba un conjunto de paquetes básicos en Python como NumPy, Pandas y Matplotlib para procesar y visualizar datos, y scikit-learn (v1.3) para hacer predicciones y análisis estadísticos. La integración del diccionario de frecuencias, el modelado n-grama de caracteres y la decodificación de Viterbi se implementaron con scripts personalizados en Python. El modelo fue entrenado y probado con un conjunto de datos de 10.000 frases, con una división 70/30 para entrenamiento y prueba.

3.3 Identificación lingüística
Una vez que una frase ha sido tokenizada, el módulo de identificación del idioma decide si cada ficha está en Kokborok o en inglés. La arquitectura completa del sistema se ilustra en la Figura 1. Esta asignación de idioma se utiliza para determinar qué módulos de transcripción son apropiados. Al fusionar datos de un modelo de n-gramos de caracteres y un diccionario de frecuencias, se determina el lenguaje de un token.

Debido a las significativas diferencias ortográficas entre los dos idiomas descritos anteriormente, un clasificador que utiliza solo información del propio token, sin características contextuales, ya funciona bien. Sin embargo, tras la asignación inicial, se aplica otro clasificador usando el algoritmo de Viterbi. Este segundo clasificador reduce la mala clasificación de homógrafos interlingüísticos y favorece agrupaciones de palabras que pertenecen a la misma lengua.

figure-protocol-1
Figura 1: Patrones a nivel de palabra y cambios de lenguaje penalizantes usando el rithm algotérmico de Viterbi. Por favor, haga clic aquí para ver una versión ampliada de esta figura. 

figure-protocol-2
Figura 2: Método para la identificación lingüística en oraciones mezcladas en código. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Recogimos los datos del corpus27 de Crúbadán para el diccionario y el modelo de caracteres. Numerosas lenguas, incluidas muchas lenguas minoritarias como el kokborok, están presentes en este corpus.

Dado que el conjunto de datos del corpus de Crúbadán es insuficiente para nuestro propósito, probamos un nuevo conjunto de datos bíblico de Kokborok. En comparación con otros idiomas, hay relativamente pocas fuentes disponibles. En consecuencia, los datos de las frases mixtas de este artículo se recopilaron de grupos de WhatsApp de habla Kokborok como Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (UE), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung y Tripura Uchoi Youth Association (TUYA).

Un total de 10.000 frases mixtas en código en kokborok e inglés se recopilaron de estos grupos de WhatsApp entre agosto de 2021 y diciembre de 2023. Las fuentes y la distribución de dominios del conjunto de datos se enumeran en la Tabla 2.

NombreTotal de palabras contadas
Palabras bíblicas de Kokborok718883
Oraciones mixtas en inglés y Kokborok68789

Tabla 2: Palabras totales de Kokborok.

IdiomaTotal de fichas
Kokborok (trp)711509
Inglés (en)1767141

Tabla 3: Modelo de 2 gramos de personaje.

Sl. NoOraciones mixtas en código total utilizadas
110,768

Tabla 4: Total de oraciones mixtas entrenadas.

El modelo de caracteres y el diccionario se tomaron del corpus27 de Crúbadán. Esta colección, accesible para una amplia variedad de idiomas, incluyendo numerosas lenguas minoritarias, se crea automáticamente buscando en internet materiales en el idioma objetivo. El corpus de Kokborok en particular es bastante pequeño porque el enfoque fue creado inicialmente para Kokborok.

Aunque también hay un corpus de Kokborok e inglés, se evitó deliberadamente debido a la falta de conjuntos de datos, especialmente en términos de mezcla y cambio de código. También hay varios términos en inglés en el corpus de Kokborok; algunas de estas palabras (incluyendo no, do y o) son más comunes que en el corpus inglés.

El diccionario y el modelo de lenguaje realizan la tarea de etiquetado independiente de cada palabra. Nuestra tarea es comparable a la de King et al.28.

Las probabilidades léxicas (lex), caracteres (ch) y etiquetas de palabra se utilizan para crear una interpolación lineal entre las frecuencias de los componentes léxico (ch) y léxico (lex). La probabilidad combinada (de peine) que resulta de esto se muestra en la ecuación (1) a continuación; los parámetros detallados de interpolación se presentan en la Tabla 3. La estrategia de interpolación se representa en la Figura 2.

Pcombinado = λlexi · Plexi + λchar · Personaje (1)

Donde 0 ≤ λlexi, λchar ≤ 1; y λlexi + λchar = 1. Las palabras sin base léxica tienen una probabilidad léxica extremadamente baja pero no nula. Presumiblemente, en caso de que una palabra esté ausente en ambas lenguas léxicas, se utiliza el modelo de caracteres para la implementación en lugar de la probabilidad léxica, incluso si λlexi = 1.

Nuestro método para desarrollar el modelo de personaje se basa en la cadena de Markov de n-gramas de caracteres de Dunning (1994). Esto se logra contando n-gramos al principio y al final de los tokens, respectivamente, para estimar las probabilidades inicial y de transición.

La comparación de rendimiento entre los modelos entrenados de 2 gramos y 4 gramos se muestra a continuación.

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

Las palabras iniciales y de transición de una probabilidad pueden multiplicarse para obtener la probabilidad de una palabra usando el modelo lingüístico (4).

P(〈w1w2w3〉) = Pinicial(〈w1w2) · Transición P (c3|〈w1w2) · Transición P(〉|w1w2w3) (4)

La lengua kokborok es muy rica en prefijos y sufijos y es una lengua morfológicamente aglutinante donde sufijos como "o", "do" y "no" se añaden a las palabras base. El 2-gramo ayuda a capturar eficazmente las transiciones morfológicas locales en los límites de los afixos, mientras que el 4-gramo puede capturar aquellas palabras de Kokborok que presentan dependencias ortográficas más largas en palabras raíz y compuestas como Phailaidido, Thanlainai y Mwchangkha.

Esto se aplica a un corpus grande, lo que aumenta la probabilidad de varios problemas de escasez de datos. Además, la combinación de caracteres puede no aparecer en todos los casos, lo que podría hacer que la probabilidad se reduzca a cero. El suavizado lambda se utiliza para resolver este tipo de problemas dando a cada n-gramo que contiene caracteres no vistos un valor pequeño con probabilidad distinta de cero. El valor de lambda se fija en 0,001.

figure-protocol-6  (5)

donde N = representa la cantidad de observaciones distintas en n-gramos.

figure-protocol-7   (6)

donde D= es el número de diferencias detectadas en n-gramos. Se asume que la probabilidad de que un n-gramo no se observe es la misma.

figure-protocol-8   (7)

donde C indica el tamaño del carácter.

Los valores iniciales de Pcount, λlexi y λchar se establecieron empíricamente mediante análisis de frecuencia de los corpus de Kokborok e inglés. Primero, inicializamos λlexi a 0,5 y ponderamos tanto las probabilidades léxicas como basadas en caracteres, haciendo que ambas contribuyeran por igual en la primera ejecución. Este nivel de inicialización nos permitió identificar el papel comparativo del léxico y el modelo de n-gramas de caracteres entre conjuntos de datos.

El parámetro de transición Pcount (continuando en el mismo idioma) se estableció en 0,6, basado en la proporción de las secuencias monolingües respecto a los puntos de cambio en el conjunto de datos marcado manualmente. Estos valores proporcionaban un buen punto de partida para la convergencia durante la sintonización. Después, se llevó a cabo el refinamiento de todos los parámetros mediante una serie de ensayos repetidos para maximizar el Coeficiente de Correlación de Matthews (MCC), detallado en la sección de Resultados.

Identificación contextual
El modelo contextual utiliza las probabilidades que ya se inicializaron (Pcount y Pswitch) durante la fase de identificación independiente y las refina mediante la decodificación de secuencias de Viterbi para reducir las inconsistencias en las transiciones y detectar el cambio de lenguaje de forma óptima.

La salida analítica del modelo de lenguaje depende del contexto y se obtiene principalmente combinando el token actual con el siguiente y utilizando tanto el token anterior como el presente. Dado que existe la posibilidad de que dos palabras con el mismo valor de frecuencia tengan significados similares y causen una clasificación errónea, se utilizó el enfoque dependiente del contexto para encontrar los términos de similitud presentes en ambos idiomas.

Ciertas palabras, como "no", "do", "o", "are", "da (día)", "go", "sa (decir)", "rose", "ring" y muchas más, son similares en ambos idiomas. Como resultado, puede ser bastante difícil identificar el lenguaje correcto cuando surge este tipo de ambigüedad, y ocasionalmente los idiomas se clasifican incorrectamente.

Para abordar estos problemas de identificación de lenguajes, presentamos un conjunto de modelos de lenguaje utilizando un Modelo de Markov Oculto discriminativo y aprendizaje automático supervisado. Se asume que la probabilidad de transición para ambos idiomas es la misma. Para el Pcount del mismo idioma, la probabilidad continua es el parámetro principal que debe declararse. A través de esto, podemos calcular la probabilidad de cambiar de idioma.

Interruptor P = 1 − Recuento P (8)

La clasificación contextual usando el camino de Viterbi se muestra en la Figura 3. El objetivo del algoritmo de Viterbi es determinar cuál de los lenguajes de las secuencias de tokens es el mejor según Pcount y Pswitch.

El algoritmo de Viterbi se aplica a la clasificación contextual. Pcount y Pswitch se usan para etiquetar aristas, y los nodos se etiquetan con la verosimilitud relativa asignada por el primer clasificador.

Debido a la mayor probabilidad de usar el idioma kokborok, se elegiría la ruta discontinua si el primer clasificador fuera el único que se usara y no hubiera información contextual disponible.

El impacto del ajuste basado en el contexto se visualiza en la Figura 4. Esto demuestra cómo, en ausencia de información contextual, la segunda, tercera y quinta palabra de la frase "Next week o phaisidi do" serían identificadas erróneamente como inglesas (en) (camino discontinuo). Aunque las probabilidades son ligeramente mayores para el inglés, los valores relativos son cercanos.

Se penalizarán dos cambios de lenguaje, y la probabilidad de la secuencia será menor que la ruta óptima del algoritmo de Viterbi si también se tienen en cuenta las probabilidades de transición. Por tanto, solo palabras que tienen más probabilidades de originarse en el otro idioma —en lugar de términos comunes en ambos— pueden desencadenar cambios lingüísticos en secuencias breves.

El coeficiente de correlación de Matthews fue seleccionado como métrica de evaluación porque, en comparación con otras métricas como precisión, recuerdo y exactitud, es significativamente más adecuado para tareas de clasificación binaria, ya que tiene en cuenta los verdaderos positivos y los verdaderos negativos, así como los falsos positivos y falsos negativos.

figure-protocol-9   (9)

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En la Tabla 4, hemos mostrado las puntuaciones MCC y los resultados de ajuste de parámetros para Ptrp que calcularon el sesgo inicial hacia secuencias iniciales con palabras de Kokborok y calculamos el Pcount, que es la probabilidad de continuar en el mismo idioma.

λ_lexPcount = 0,66Pcount = 0,70Pcount = 0,74Pcount = 0...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aunque el modelo sugerido demuestra una precisión del 93,15% a nivel de palabra, un análisis exhaustivo de los errores revela varios patrones recurrentes que ponen de manifiesto los desafíos de la identificación de lenguas mixtas inglés-Kokborok.

Uso de palabras prestadas y palabras ambiguas
Una parte significativa de los errores surge del uso de palabras inglesas prestadas, que se han vuelto comunes en el uso de Kokborok. ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de interés que declarar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Queremos agradecer a los hablantes nativos locales, grupos de WhatsApp, organizaciones, uniones estudiantiles y la Sociedad Bíblica de la India por ayudarnos a obtener el conjunto de datos en bruto de frases mixtas en código. También estamos agradecidos al Departamento de Informática e Ingeniería del Instituto Nacional de Tecnología de Arunachal Pradesh y a la Lovely Professional University por proporcionarnos la plataforma para examinar y probar nuestro conjunto de datos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Raspberry Pi 4Base de Base Raspberry PiRPI4-MODBP-4GBUtilizado para procesamiento de lenguajes de pocos recursos
Tarjeta MicroSD 64GBSanDiskSDSQUAR-064G-GN6MAPara almacenamiento de sistemas operativos y conjuntos de datos
Fuente de alimentación 5V/3ARaspberry Pi oficialSC0218Para alimentar la placa Pi
Micrófono USBBoyaBY-M1Para la entrada de audio en la recopilación de datos lingüísticos
Monitor (HDMI)LG22MK600MVisualización de salida durante las pruebas
Teclado y Combo de ratónLogitechMK270Control de interfaz
Dongle WiFi (si es Pi 3)TP-LinkTL-WN725NTransferencia inalámbrica de datos (si no hay WiFi a bordo)
IDE de Python (Thonny)Código abierto-IDE para programación
Conjunto de datos de léxicosConstruido a medida-Pareja de lenguas Kokborok-inglés
Conjunto de datos N-gramConstruido a medidaPareja lingüística inglés-kokborok
Mezclado y conmutado por códigosConstruido a medida10.000 condenasRecopilado de mensajes de texto en redes sociales, mensajes de WhatsApp, ONG, BIBLIA, etc

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Lenguas de bajos recursosidioma kokborokkokborok ingl sdetecci n a nivel de palabran grama de caracteresl xico de frecuenciast cnica de Viterbimodelo no supervisado
Video próximamente

Artículos relacionados