El objetivo del protocolo dado es identificar correctamente los idiomas a nivel de palabra dentro del texto mezclado en código inglés-Kokborok utilizando un modelo no supervisado que combina n-gramas de caracteres y diccionarios de frecuencia.
Artículo de investigación
El objetivo del protocolo dado es identificar correctamente los idiomas a nivel de palabra dentro del texto mezclado en código inglés-Kokborok utilizando un modelo no supervisado que combina n-gramas de caracteres y diccionarios de frecuencia.
Existe una necesidad creciente de un modelo para la detección automática de lenguas a nivel de palabra debido al uso creciente de texto multilingüe. Para identificar oraciones con cambio de código y mezcladas en el idioma kokborok y el inglés a nivel de palabra, proponemos un modelo no supervisado. Se han publicado numerosos estudios sobre texto mezclado en código, incluyendo para varias lenguas indias. Sin embargo, hasta donde sabemos, nuestro trabajo representa un esfuerzo pionero, siendo el primero en identificar idiomas para pares inglese-Kokborok de pocos recursos. Hemos empleado un método que fusiona datos de un diccionario de frecuencias con datos de un modelo de caracteres n-gramos. La técnica de Viterbi combina un modelo de Markov n-grama de caracteres con un léxico de frecuencia para ayudar en la identificación precisa del lenguaje a nivel de palabra. El método propuesto funcionó bien, con una precisión a nivel de palabra del 93,15%, lo que es mejor que el modelo BiLSTM-CRF del 88,5% y la línea base basada en reglas del 85,3%. Esto demuestra la eficacia de combinar el léxico y la metodología estadística para manejar lenguas de pocos recursos sin depender de grandes conjuntos de datos anotados.
En esta era digital, el rápido crecimiento de la comunicación multilingüe de code-mixing y code-switching en las plataformas de redes sociales se está convirtiendo en un elemento central para la comunicación global. La necesidad de una identificación precisa de los idiomas dentro del contenido textual es fundamental. Tras observar, descubrimos que muchas lenguas indias como el hindi, el bengalí y el telugu ya han sido exploradas en la identificación lingüística, y que otras lenguas indias de bajo recurso como el manipuri, bodo y asamés han sido parcialmente abordadas en la investigación de identificación lingüística. Sin embargo, todavía existe una importante laguna en la investigación en el desarrollo de modelos para el kokborok, una lengua de pocos recursos que es tanto lingüística como estructuralmente distinta.
A diferencia de las lenguas manipuri, asamás y bodo, de baja repercusión, el kokborok presenta un alto nivel de variación ortográfica y se escribe en alfabeto romano o bengalí, a menudo de forma intercambiable en la comunicación. Esto crea mucha ambigüedad en los límites de los tokens, la transliteración y la extracción de características a nivel de personaje, lo que presenta desafíos claros y rara vez se ha considerado en la literatura. Además, el kokborok es una lengua aglutinante, y su morfología incluye prefijos y sufijos ricos (por ejemplo, -o, -do, -no) y tonos fonémicos, lo que dificulta la aplicación de modelos existentes de identificación de lenguas codificadas desarrollados respecto a las lenguas indoarias.
Estos problemas se ven aún más agravados por las redes sociales. Los hablantes de kokborok suelen mezclar palabras en inglés en el texto, no solo para mezclar y cambiar de código, sino también para compensar la ausencia de elementos léxicos en la oración de Kokborok. Esto conduce a ortografías no estándar y al uso de palabras relacionado con el contexto, lo que supone un retroceso frente a sistemas basados en reglas o puramente léxicos.
En este estudio, estas lagunas se abordan proponiendo un modelo no supervisado que combina diccionarios de frecuencia y probabilidades de n-gramas de caracteres con un marco de decodificación de Viterbi. El método se centra especialmente en las complejidades ortográficas, morfológicas y contextuales del par inglés-Kokborok, por lo que es uno de los primeros intentos computacionales de tratar y detectar sistemáticamente las barreras lingüísticas a nivel de palabra en esta lengua de pocos recursos.
ANTECEDENTES DE KOKBOROK
Las palabras "Kok", que significa lenguaje, y "Borok", que implica humano, se combinan para formar la palabra compuesta "Kok-borok", que denota humano. El término "Kok-borok" se refiere a la lengua hablada por el pueblo Borok de Tripura, así como a los de los países vecinos de Bangladesh y Myanmar, y a los habitantes de Mizoram, Manipur y Assam. La lengua kokborok, hablada principalmente en tripura, se escribe tanto en alfabetos romano como bengalí. La escritura romana es preferida por la mayoría de los hablantes de Kokborok sobre la bengalí. En realidad, el subgrupo lingüístico sino-tibetano conocido como tibeto-birmano es donde se originó la lengua kokborok. La lengua kokborok y la lengua bodo son sutilmente similares. Las 36 variedades de la lengua kokborok presentan sutiles similitudes tanto con las lenguas bodo como con la kachari.
Koloma era conocida como la escritura original de Kokborok. El único estado en la India, Tripura, estuvo controlado por 184 personas antes de unirse en la Unión India el 15 de octubre de 1949. La escritura Koloma que se encuentra en el libro de Rajratnakar es la que se utilizó para escribir las narrativas históricas. Más tarde, en el siglo XIV, dos brahmanes llamados Sukreswar y Vaneswar tradujeron el idioma al sánscrito y luego de nuevo a la escritura bengalí. Existen homofonía de raíces, tono fonémico, morfología verbal, orden de palabras y sufijos derivacionales verbales producidos a partir de los verbos en la lengua kokborok.
Con el tiempo, Kokborok ha encontrado idiomas como el inglés, árabe, bengalí, persa, etc. En la lengua kokborok se pueden encontrar diferentes tipos de estructuras aglutinantes intrincadas. Las personas que hablan kokborok como lengua nativa en Tripura no pueden acceder fácilmente a la información porque la lengua aún no tiene una escritura ampliamente adoptada, pero esto se está trabajando en ello.
En Tripura se hablan varios dialectos del kokborok. En Tripura se hablan varios dialectos, incluyendo Tripura/Tripuri, Debbarma, Reang, Jamatia, Uchai, Noatia, Lusai, Kukis, Chaimal, Halam, Santal, Lepcha, Chakma, Khasia, Oranguán, Mog y Garos. Según el informe del censo de 2011, hay 1.011.294 hablantes de kokborok en India y más de 400.000 en Bangladés, una nación vecina.
REVISIÓN DE LA LITERATURA
Los autores describen su investigación en curso sobre la identificación automática de idiomas utilizando un nuevo conjunto de datos de publicaciones en Facebook con código en hindi, bengalí e inglés mezclado. Experimentan con diversas técnicas, como enfoques basados en diccionarios y clasificación supervisada, para la identificación lingüística a nivel de palabra, destacando la importancia de considerar las pistas contextuales para una identificación lingüística precisa en tales entornos.
El artículo presenta un conjunto de datos de tuits anotados con el propósito de identificar discursos de odio en plataformas de redes sociales con una mezcla de código hindi-inglés que utiliza técnicas basadas en léxicos, a nivel de carácter y a nivel depalabra 1. En el artículo se presenta un método de categorización de texto tolerante a errores basado en N-gramas. Primero, el sistema se utiliza para calcular perfiles utilizando datos de conjuntos de entrenamiento, como muestras de material o frases de grupos de noticias, que reflejan las distintas categorías. Después de eso, el sistema crea un perfil para el documento específico que debe categorizarse. Por último, el algoritmo calcula la medida de distancia entre cada perfil de categoría y el perfil del documento. La categoría cuyo perfil está más cerca del perfil del documento es elegida por el sistema2.
Se compararon varias técnicas de incrustación de palabras, incluyendo los modelos Continuous Bag of Words y Skip-Gram, para crear vectores de características. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine y Logistic Regression obtuvieron buenas puntuaciones de validacióncruzada 3. Un resumen de los enfoques previos se ofrece en la Tabla 1.
Utilizando clasificadores basados en léxicos, el estudio supera a los clasificadores existentes en tres emparejamientos lingüísticos evaluados en el estudio: español-inglés, neerlandés-inglés y alemán-turco con conjuntos de datos de redessociales 4. El enfoque del estudio muestra una mayor resiliencia del modelo en términos de convergencia y consistencia en el rendimiento de las pruebas, superando las técnicas actuales de análisis de sentimiento en textos codificados con un 3,31 por ciento de precisión5.
En su trabajo fundamental, la identificación estadística del lenguaje por parte de Dunning fue presentada por primera vez por el Computing Research Lab de la Universidad Estatal de Nuevo México en el InformeTécnico 6. Este artículo analiza diferentes tipos de aprendizaje supervisado utilizando el Modelo de Markov Oculto, el Método del Clasificador de Bosque Aleatorio, el Campo Aleatorio Condicional y el Clasificador Naive Bayes basándose en el par de lenguajes de datos mixtos en códigoinglés-telugu 7. El artículo se centra en lenguas indias, incluyendo inglés, bodo y asamés, mientras discute un enfoque novedoso para reconocer lenguas en material de redes sociales mezclado en código. Los investigadores utilizan la Memoria Bidireccional a Corto Plazo en un modelo de aprendizajeprofundo 8.
En este artículo, han utilizado un conjunto de datos considerable relacionado con la lengua gujarati, en la que la lengua gujarati se mezcla con inglés e hindi. Empleaban una variedad de clasificadores de aprendizaje automático. Entre ellos, el Clasificador de Vectores de Soporte ofreció la mejor precisión del 92 por ciento y9 por ciento.
En la fase de clasificación separada se utiliza un marco lingüístico para diferenciar entre cambio de código y préstamo de tuits en neerlandés-inglés. Utilizando LID basado en reglas, máquinas de vectores de soporte y clasificadores de árbol de decisión, aprenden que el DTC (micro F1 = 0,95) y el sistema LID basado en reglas (micro F1 = 0,95) rinden mejor10.
El rendimiento de su modelo fue evaluado utilizando el conjunto de datos TRAC-1 de detección de agresividad por cambio de código, el conjunto de datos Hinglish Offensive Tweet y el conjunto de datos de clasificación de humor11. Para mejorar la retención en la adquisición léxica adulta mediante la lectura, se propuso un enfoque probabilístico como metodología L2 para producir texto mezcladoen código 12. Se incorpora un módulo de diccionario que se utiliza para realizar pruebas en varios clasificadores supervisados con el fin de controlar la mezcla de códigoa nivel de palabra 13.
Utilizaron una variedad de métricas para analizar los patrones de conmutación de código y descubrieron que, tanto en español-inglés como en hindi-inglés, los modelos de redes neuronales tenían un rendimiento peor que el modelo de Campos Aleatorios Condicionales (CRF) por un margen de 2,5 y 3,5 puntos porcentuales, respectivamente14.
Utilizando un léxico bilingüe y un texto en inglés como entrada, el método construye un grafo de factores sobre menciones léxicas para producir un texto codificado que optimiza un parámetro dado de "aprendibilidad". En este artículo, buscan comprender mejor los conceptos de la caja de herramientas CanVEC basándose en los pares de lenguajes de datos conmutados en código hindi-inglés. Lograron con éxito una puntuación F1 del 87,99 por ciento y una precisiónde 15,16.
Los autores examinan primero la mezcla de código entre el gujarati y el inglés17, aplicando una tubería de tres etapas para identificar el idioma de cada token, normalizar la ortografía y transliterar los segmentos de nuevo a sus escrituras nativas. Luego se centran en un corpus18 hindi-inglés, donde introducen novedosos algoritmos de detección de sentimientos específicamente adaptados a estructuras de oraciones bilingües. Para apoyar la experimentación controlada, generan texto sintético mezclado mediante códigos entrenando modelos skip-gram en datos monolingües y mezclando las salidas19.
A continuación, un conjunto de datos de redessociales 20 en konkani-inglés se procesa mediante un método de identificación a nivel de palabra basado en reglas, logrando un rendimiento robusto sin necesidad de datos de entrenamiento anotadosmanualmente 21. Ampliando el alcance, un estudio utiliza un gran corpus transliterado de inglés, hindi, bengalí y asamés de plataformas como Facebook22 para evaluar una variedad de técnicas de etiquetado a nivel de palabra. A partir de esto, otro marco23 cambia dinámicamente entre idiomas para detectar frases incrustadas o prestadas con alta precisión. En el ámbito agrícola, los comentarios punjabí-inglés se clasifican usando varios modelos; entre ellos, un clasificador n-gram ofrece la mejor precisión24. Para el CMST cingalés-inglés, se comparan los aprendices en conjunto (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression), destacando Random Forest como el mejordesempeño 25, mientras que los embeddings a nivel de carácter combinados con SVMs logran buenos resultados en los pares tamil-inglés y malayalam-inglés26. Finalmente, el ProyectoCrúbadán 27 se presenta como un esfuerzo a gran escala para construir corpus lingüísticos con pocos recursos rastreando la web, sentando las bases para futuras investigaciones de mezcla de código.
| Conjunto de datos | Resultados clave | Precisión/F1-Puntuación/Precisión/Práctica/Recuperación |
| Conjunto de datos en hindi–bengalí–inglés extraído de publicaciones en Facebook | Se destacaron los desafíos de identificación lingüística en el texto de redes sociales a nivel de palabra | 89.30% |
| Artículos de prensa, documentos | Eficaz realizada usando N-gramas para la identificación del idioma | 0.99% |
| Conjuntos de datos indios mixtos en código | Demostrando la buena precisión en la identificación lingüística a nivel de palabra | No reportado (NR) |
| Conjuntos de datos basados en Wikipedia | Detección robusta de conmutadores de código a nivel de token | No reportado (NR) |
| Tuits en hindi–inglés | Rendimiento Mejorado en la clasificación de sentimiento de código mixto en hindi e inglés | 0.78% |
| Corpus multilingües | Marco fundamental establecido para la identificación lingüística | 78.00% |
| Code_mixed Datos inglés–telugu | El CRF logró su mejor rendimiento | 89.30% |
| Texto mezclado en inglés y bodo | Logró una alta precisión a nivel de palabra | 92.00% |
| Escrituras codificadas mixtas gujarati-hindi | La precisión de identificación lingüística a nivel de oración es ≈92% | 92.00% |
| Tuits neerlandés-inglés | Los modelos DTC y basados en reglas lograron la F1 ≈0,95 | 95.00% |
| Conjuntos de datos conmutados por código | Rendimiento competitivo entre modelos | No reportado (NR) |
| Texto mixto de código sintético | Mejora del aprendizaje léxico | No reportado (NR) |
| Texto mixto inglés–kannada | LID automático efectivo | No reportado (NR) |
| TRAC-1, conjuntos de datos hinglish | El CRF superó en modelos de redes neuronales | 91.00% |
| Datos en línea multilingües | Identificación precisa a nivel de palabra en Lnaguage | 88.00% |
| Redes sociales hindi–inglés | Alta precisión en la identificación lingüística del hindi-inglés | 0.93% |
| Código inglés–gujarati -Mixto | Procesamiento bilingüe efectivo | |
| Redes sociales Conjuntos de datos code-Mixed | Mejora en la detección de sentimientos | 0.90% |
| Datos sintéticos mezclados en código | Representaciones de incrustación fuertes | No reportado (NR) |
| Código mixto-código Konkani–Inglés Texto de redes sociales | Rendimiento robusto sin anotación | 0.89% |
| Conjunto de datos code-mixed de Twitter | Mejora en la detección de interruptores | 90.20% |
| Asamés–bengalí–hindi–inglés | Identificación precisa de lenguas multilingües | 91.00% |
| Redes sociales Código Texto mixto | Puntuación F1 ≈0,95 | 0.95% |
| Datos mixtos en inglés–punjabi | El modelo N-gram fue el que mejor rindió | 0.88% |
| Datos mixtos en código cingalés–inglés | RF alcanzó la máxima precisión | 0.92% |
| Comentarios mixtos en código de Facebook | LID mejorado a nivel de palabra | 0.93% |
| Crúbadán Corpus | Posibilitó la investigación lingüística con pocos recursos | No reportado (NR) |
| Conjuntos de datos mixtos de código | Buen rendimiento demostrado en la Identificación de Lengua a nivel de palabra | 0.94% |
Tabla 1: Resumen de la Literatura de Lenguas Mixtas en Código.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
El texto mezclado y modificado en inglés y Kokborok se recopiló manualmente a partir de conversaciones locales y publicaciones públicas en redes sociales. No se recopiló información personal identificable ni sensible. Todos los procedimientos seguían las directrices éticas institucionales.
3. Diseño e implementación
3.1 Algoritmo
3.1.1 Para cada ficha en la Oración (S):
un. Usando el diccionario de frecuencias, se calcula la probabilidad léxica Plexi .
b. Basado en el modelo N-grama, se calcula la probabilidad basada en caracteres Pchar
c. interpolación ponderada de ambos:
Pcombinado = λlexi Plexi + λchar Pchar
3.1.2. La combinación de probabilidad Pcombinada para cada token se ha almacenado como probabilidad de emisión.
3.1.3. Aplicar el algoritmo de Viterbi:
un. Dado inicialmente con probabilidades de idioma inicial.
b. Para cada ficha:
i. Calcular la transiciónP conteo de transición (continuación en el mismo idioma).
yP switch (probabilidad de cambio de idioma).
ii. Seleccionar el camino del idioma y maximizar la probabilidad de secuencia.
3.1.4. Producir la secuencia de lenguaje de máxima probabilidad L con mayor probabilidad global.
3.2 Entorno computacional
La implementación de todos los experimentos se realizó usando Python 3.10 en la plataforma Google Colab. El sistema utilizaba un conjunto de paquetes básicos en Python como NumPy, Pandas y Matplotlib para procesar y visualizar datos, y scikit-learn (v1.3) para hacer predicciones y análisis estadísticos. La integración del diccionario de frecuencias, el modelado n-grama de caracteres y la decodificación de Viterbi se implementaron con scripts personalizados en Python. El modelo fue entrenado y probado con un conjunto de datos de 10.000 frases, con una división 70/30 para entrenamiento y prueba.
3.3 Identificación lingüística
Una vez que una frase ha sido tokenizada, el módulo de identificación del idioma decide si cada ficha está en Kokborok o en inglés. La arquitectura completa del sistema se ilustra en la Figura 1. Esta asignación de idioma se utiliza para determinar qué módulos de transcripción son apropiados. Al fusionar datos de un modelo de n-gramos de caracteres y un diccionario de frecuencias, se determina el lenguaje de un token.
Debido a las significativas diferencias ortográficas entre los dos idiomas descritos anteriormente, un clasificador que utiliza solo información del propio token, sin características contextuales, ya funciona bien. Sin embargo, tras la asignación inicial, se aplica otro clasificador usando el algoritmo de Viterbi. Este segundo clasificador reduce la mala clasificación de homógrafos interlingüísticos y favorece agrupaciones de palabras que pertenecen a la misma lengua.

Figura 1: Patrones a nivel de palabra y cambios de lenguaje penalizantes usando el rithm algotérmico de Viterbi. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Figura 2: Método para la identificación lingüística en oraciones mezcladas en código. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Recogimos los datos del corpus27 de Crúbadán para el diccionario y el modelo de caracteres. Numerosas lenguas, incluidas muchas lenguas minoritarias como el kokborok, están presentes en este corpus.
Dado que el conjunto de datos del corpus de Crúbadán es insuficiente para nuestro propósito, probamos un nuevo conjunto de datos bíblico de Kokborok. En comparación con otros idiomas, hay relativamente pocas fuentes disponibles. En consecuencia, los datos de las frases mixtas de este artículo se recopilaron de grupos de WhatsApp de habla Kokborok como Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (UE), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung y Tripura Uchoi Youth Association (TUYA).
Un total de 10.000 frases mixtas en código en kokborok e inglés se recopilaron de estos grupos de WhatsApp entre agosto de 2021 y diciembre de 2023. Las fuentes y la distribución de dominios del conjunto de datos se enumeran en la Tabla 2.
| Nombre | Total de palabras contadas |
| Palabras bíblicas de Kokborok | 718883 |
| Oraciones mixtas en inglés y Kokborok | 68789 |
Tabla 2: Palabras totales de Kokborok.
| Idioma | Total de fichas |
| Kokborok (trp) | 711509 |
| Inglés (en) | 1767141 |
Tabla 3: Modelo de 2 gramos de personaje.
| Sl. No | Oraciones mixtas en código total utilizadas |
| 1 | 10,768 |
Tabla 4: Total de oraciones mixtas entrenadas.
El modelo de caracteres y el diccionario se tomaron del corpus27 de Crúbadán. Esta colección, accesible para una amplia variedad de idiomas, incluyendo numerosas lenguas minoritarias, se crea automáticamente buscando en internet materiales en el idioma objetivo. El corpus de Kokborok en particular es bastante pequeño porque el enfoque fue creado inicialmente para Kokborok.
Aunque también hay un corpus de Kokborok e inglés, se evitó deliberadamente debido a la falta de conjuntos de datos, especialmente en términos de mezcla y cambio de código. También hay varios términos en inglés en el corpus de Kokborok; algunas de estas palabras (incluyendo no, do y o) son más comunes que en el corpus inglés.
El diccionario y el modelo de lenguaje realizan la tarea de etiquetado independiente de cada palabra. Nuestra tarea es comparable a la de King et al.28.
Las probabilidades léxicas (lex), caracteres (ch) y etiquetas de palabra se utilizan para crear una interpolación lineal entre las frecuencias de los componentes léxico (ch) y léxico (lex). La probabilidad combinada (de peine) que resulta de esto se muestra en la ecuación (1) a continuación; los parámetros detallados de interpolación se presentan en la Tabla 3. La estrategia de interpolación se representa en la Figura 2.
Pcombinado = λlexi · Plexi + λchar · Personaje (1)
Donde 0 ≤ λlexi, λchar ≤ 1; y λlexi + λchar = 1. Las palabras sin base léxica tienen una probabilidad léxica extremadamente baja pero no nula. Presumiblemente, en caso de que una palabra esté ausente en ambas lenguas léxicas, se utiliza el modelo de caracteres para la implementación en lugar de la probabilidad léxica, incluso si λlexi = 1.
Nuestro método para desarrollar el modelo de personaje se basa en la cadena de Markov de n-gramas de caracteres de Dunning (1994). Esto se logra contando n-gramos al principio y al final de los tokens, respectivamente, para estimar las probabilidades inicial y de transición.
La comparación de rendimiento entre los modelos entrenados de 2 gramos y 4 gramos se muestra a continuación.
(2)
·
(3)
Las palabras iniciales y de transición de una probabilidad pueden multiplicarse para obtener la probabilidad de una palabra usando el modelo lingüístico (4).
P(〈w1w2w3〉) = Pinicial(〈w1w2) · Transición P (c3|〈w1w2) · Transición P(〉|w1w2w3) (4)
La lengua kokborok es muy rica en prefijos y sufijos y es una lengua morfológicamente aglutinante donde sufijos como "o", "do" y "no" se añaden a las palabras base. El 2-gramo ayuda a capturar eficazmente las transiciones morfológicas locales en los límites de los afixos, mientras que el 4-gramo puede capturar aquellas palabras de Kokborok que presentan dependencias ortográficas más largas en palabras raíz y compuestas como Phailaidido, Thanlainai y Mwchangkha.
Esto se aplica a un corpus grande, lo que aumenta la probabilidad de varios problemas de escasez de datos. Además, la combinación de caracteres puede no aparecer en todos los casos, lo que podría hacer que la probabilidad se reduzca a cero. El suavizado lambda se utiliza para resolver este tipo de problemas dando a cada n-gramo que contiene caracteres no vistos un valor pequeño con probabilidad distinta de cero. El valor de lambda se fija en 0,001.
(5)
donde N = representa la cantidad de observaciones distintas en n-gramos.
(6)
donde D= es el número de diferencias detectadas en n-gramos. Se asume que la probabilidad de que un n-gramo no se observe es la misma.
(7)
donde C indica el tamaño del carácter.
Los valores iniciales de Pcount, λlexi y λchar se establecieron empíricamente mediante análisis de frecuencia de los corpus de Kokborok e inglés. Primero, inicializamos λlexi a 0,5 y ponderamos tanto las probabilidades léxicas como basadas en caracteres, haciendo que ambas contribuyeran por igual en la primera ejecución. Este nivel de inicialización nos permitió identificar el papel comparativo del léxico y el modelo de n-gramas de caracteres entre conjuntos de datos.
El parámetro de transición Pcount (continuando en el mismo idioma) se estableció en 0,6, basado en la proporción de las secuencias monolingües respecto a los puntos de cambio en el conjunto de datos marcado manualmente. Estos valores proporcionaban un buen punto de partida para la convergencia durante la sintonización. Después, se llevó a cabo el refinamiento de todos los parámetros mediante una serie de ensayos repetidos para maximizar el Coeficiente de Correlación de Matthews (MCC), detallado en la sección de Resultados.
Identificación contextual
El modelo contextual utiliza las probabilidades que ya se inicializaron (Pcount y Pswitch) durante la fase de identificación independiente y las refina mediante la decodificación de secuencias de Viterbi para reducir las inconsistencias en las transiciones y detectar el cambio de lenguaje de forma óptima.
La salida analítica del modelo de lenguaje depende del contexto y se obtiene principalmente combinando el token actual con el siguiente y utilizando tanto el token anterior como el presente. Dado que existe la posibilidad de que dos palabras con el mismo valor de frecuencia tengan significados similares y causen una clasificación errónea, se utilizó el enfoque dependiente del contexto para encontrar los términos de similitud presentes en ambos idiomas.
Ciertas palabras, como "no", "do", "o", "are", "da (día)", "go", "sa (decir)", "rose", "ring" y muchas más, son similares en ambos idiomas. Como resultado, puede ser bastante difícil identificar el lenguaje correcto cuando surge este tipo de ambigüedad, y ocasionalmente los idiomas se clasifican incorrectamente.
Para abordar estos problemas de identificación de lenguajes, presentamos un conjunto de modelos de lenguaje utilizando un Modelo de Markov Oculto discriminativo y aprendizaje automático supervisado. Se asume que la probabilidad de transición para ambos idiomas es la misma. Para el Pcount del mismo idioma, la probabilidad continua es el parámetro principal que debe declararse. A través de esto, podemos calcular la probabilidad de cambiar de idioma.
Interruptor P = 1 − Recuento P (8)
La clasificación contextual usando el camino de Viterbi se muestra en la Figura 3. El objetivo del algoritmo de Viterbi es determinar cuál de los lenguajes de las secuencias de tokens es el mejor según Pcount y Pswitch.
El algoritmo de Viterbi se aplica a la clasificación contextual. Pcount y Pswitch se usan para etiquetar aristas, y los nodos se etiquetan con la verosimilitud relativa asignada por el primer clasificador.
Debido a la mayor probabilidad de usar el idioma kokborok, se elegiría la ruta discontinua si el primer clasificador fuera el único que se usara y no hubiera información contextual disponible.
El impacto del ajuste basado en el contexto se visualiza en la Figura 4. Esto demuestra cómo, en ausencia de información contextual, la segunda, tercera y quinta palabra de la frase "Next week o phaisidi do" serían identificadas erróneamente como inglesas (en) (camino discontinuo). Aunque las probabilidades son ligeramente mayores para el inglés, los valores relativos son cercanos.
Se penalizarán dos cambios de lenguaje, y la probabilidad de la secuencia será menor que la ruta óptima del algoritmo de Viterbi si también se tienen en cuenta las probabilidades de transición. Por tanto, solo palabras que tienen más probabilidades de originarse en el otro idioma —en lugar de términos comunes en ambos— pueden desencadenar cambios lingüísticos en secuencias breves.
El coeficiente de correlación de Matthews fue seleccionado como métrica de evaluación porque, en comparación con otras métricas como precisión, recuerdo y exactitud, es significativamente más adecuado para tareas de clasificación binaria, ya que tiene en cuenta los verdaderos positivos y los verdaderos negativos, así como los falsos positivos y falsos negativos.
(9)
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
En la Tabla 4, hemos mostrado las puntuaciones MCC y los resultados de ajuste de parámetros para Ptrp que calcularon el sesgo inicial hacia secuencias iniciales con palabras de Kokborok y calculamos el Pcount, que es la probabilidad de continuar en el mismo idioma.
| λ_lex | Pcount = 0,66 | Pcount = 0,70 | Pcount = 0,74 | Pcount = 0... |
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Aunque el modelo sugerido demuestra una precisión del 93,15% a nivel de palabra, un análisis exhaustivo de los errores revela varios patrones recurrentes que ponen de manifiesto los desafíos de la identificación de lenguas mixtas inglés-Kokborok.
Uso de palabras prestadas y palabras ambiguas
Una parte significativa de los errores surge del uso de palabras inglesas prestadas, que se han vuelto comunes en el uso de Kokborok. ...
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Los autores no tienen conflictos de interés que declarar.
Queremos agradecer a los hablantes nativos locales, grupos de WhatsApp, organizaciones, uniones estudiantiles y la Sociedad Bíblica de la India por ayudarnos a obtener el conjunto de datos en bruto de frases mixtas en código. También estamos agradecidos al Departamento de Informática e Ingeniería del Instituto Nacional de Tecnología de Arunachal Pradesh y a la Lovely Professional University por proporcionarnos la plataforma para examinar y probar nuestro conjunto de datos.
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
| Nombre | Empresa | Número de catálogo | Comentarios |
|---|---|---|---|
| Raspberry Pi 4 | Base de Base Raspberry Pi | RPI4-MODBP-4GB | Utilizado para procesamiento de lenguajes de pocos recursos |
| Tarjeta MicroSD 64GB | SanDisk | SDSQUAR-064G-GN6MA | Para almacenamiento de sistemas operativos y conjuntos de datos |
| Fuente de alimentación 5V/3A | Raspberry Pi oficial | SC0218 | Para alimentar la placa Pi |
| Micrófono USB | Boya | BY-M1 | Para la entrada de audio en la recopilación de datos lingüísticos |
| Monitor (HDMI) | LG | 22MK600M | Visualización de salida durante las pruebas |
| Teclado y Combo de ratón | Logitech | MK270 | Control de interfaz |
| Dongle WiFi (si es Pi 3) | TP-Link | TL-WN725N | Transferencia inalámbrica de datos (si no hay WiFi a bordo) |
| IDE de Python (Thonny) | Código abierto | - | IDE para programación |
| Conjunto de datos de léxicos | Construido a medida | - | Pareja de lenguas Kokborok-inglés |
| Conjunto de datos N-gram | Construido a medida | Pareja lingüística inglés-kokborok | |
| Mezclado y conmutado por códigos | Construido a medida | 10.000 condenas | Recopilado de mensajes de texto en redes sociales, mensajes de WhatsApp, ONG, BIBLIA, etc |
Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.
Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE
Solicitar permiso