연구 논문

영어와 코크보록 코드-혼합 문장의 저자원 언어 식별

DOI:

10.3791/69130

2026년 1월 2일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

주어진 프로토콜의 목적은 문자 n그램과 빈도 사전을 결합한 비지도 모델을 사용하여 영어-Kokborok 코드 혼합 텍스트 내에서 단어 수준 언어를 올바르게 식별하는 것입니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

다국어 텍스트의 사용이 증가함에 따라 자동 단어 수준 언어 감지 모델에 대한 수요가 커지고 있습니다. 코크보록어와 영어에서 단어 수준에서 코드 스위칭 및 코드 혼합 문장을 식별하기 위해, 우리는 비지도 모델을 제안합니다. 여러 인도 언어를 포함해 코드 혼합 텍스트에 관한 수많은 연구가 발표되었습니다. 그러나 우리가 아는 한, 우리의 연구는 저자원 영어-코크보록 언어 쌍을 위한 언어를 최초로 규명한 선구적인 노력입니다. 우리는 주파수 사전 데이터와 문자 n-그램 모델 데이터를 병합하는 방법을 사용했습니다. 비터비 기법은 문자 n-그램 마르코프 모델과 빈도 어휘를 결합하여 단어 수준에서 정확한 언어 식별을 돕습니다. 제안된 방법은 단어 단위 정확도 93.15%로 BiLSTM-CRF 모델의 88.5%와 규칙 기반 기준선 85.3%보다 우수한 성과를 냈습니다. 이는 방대한 주석 데이터셋에 의존하지 않고 저자원 언어를 다루는 데 어휘와 통계적 방법론을 결합하는 효과성을 보여줍니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 디지털 시대에 소셜 미디어 플랫폼에서 코드 믹싱과 코드 스위칭 다국어 커뮤니케이션의 급속한 성장은 전 세계 커뮤니케이션의 중심이 되고 있습니다. 텍스트 내용 내에서 언어를 정확히 식별하는 것이 매우 중요합니다. 관찰 결과, 힌디어, 벵골어, 텔루구어 등 많은 인도 언어가 이미 언어 식별에서 탐구되었고, 마니푸리어, 보도어, 아삼어 등 다른 인도 저자원 언어들도 언어 식별 연구에서 부분적으로 다뤄졌음을 발견했습니다. 그러나 자원이 적고 언어적으로나 구조적으로 구별되는 콕보록어에 대한 모델 개발에는 여전히 상당한 연구 공백이 존재한다.

마니푸리어, 아삼어, 보도어의 저자원 언어와 달리, 콕보록어는 철자 변형이 크고 로마 또는 벵골어 문자로 쓰여 종종 교용되어 사용됩니다. 이로 인해 토큰 경계, 음역, 문자 단위의 특징 추출에 많은 모호함이 생겨 독특한 도전 과제가 발생하며 문헌에서는 거의 고려되지 않았습니다. 더불어 콕보록어는 교착어로, 형태론에는 풍부한 접두사와 접미사(예: -o, -do, -no)와 음소 성조가 포함되어 있어, 인도-아리아어족에 대해 개발된 기존 코드 혼합 언어 식별 모델을 적용하기가 더 어렵다.

이러한 문제들은 소셜 미디어에 의해 더욱 심화됩니다. 콕보록어 화자들은 종종 영어 단어를 텍스트에 섞어 넣는 경향이 있는데, 이는 코드 혼합과 코드 스위칭뿐만 아니라 코크보록 문장에서 빠진 어휘 항목을 보완하기 위해서이기도 합니다. 이로 인해 비표준 철자법과 문맥 관련 단어 사용이 발생하는데, 이는 규칙 기반이거나 순수 어휘 체계에 대한 후퇴입니다.

본 연구에서는 빈도 사전과 문자 n-그램 확률을 비터비 디코딩 프레임워크와 결합한 비지도 모델을 제안함으로써 이러한 공백을 해결합니다. 이 방법은 특히 영어-Kokborok 쌍의 철자법, 형태학적, 맥락적 복잡성에 집중하며, 따라서 이 저자원 언어에서 단어 수준의 언어 장벽을 체계적으로 다루고 탐지하려는 최초의 계산 시도 중 하나입니다.

코크보록의 배경
언어를 의미하는 'Kok'과 인간을 의미하는 'Borok'이라는 단어가 결합되어 'Kok-borok'이라는 합성어가 형성되는데, 이는 인간을 의미합니다. "콕-보록"이라는 용어는 트리푸라의 보록족뿐만 아니라 인접한 방글라데시와 미얀마의 보록족, 그리고 미조람, 마니푸르, 아삼 주민들이 사용하는 언어를 가리킵니다. 주로 트리푸라에서 사용되는 콕보록어는 로마자와 벵골어 문자로 모두 쓰여 있습니다. 대부분의 콕보록 화자들은 로마자 문자를 벵골어 문자보다 선호합니다. 실제로, 티베트-버만어로 알려진 중국-티베트어 하위 그룹이 콕보록어의 기원입니다. 콕보록어와 보도어는 미묘하게 유사합니다. 콕보록어의 36가지 방언은 보도어와 카차리어와 미묘한 유사성을 지닙니다.

콜로마는 원래 코크보록 문자로 알려져 있습니다. 인도의 유일한 주인 트리푸라는 1949년 10월 15일 인도 연방으로 통합되기 전까지 184명이 통제하고 있었습니다. 라즈라트나카르 책에 수록된 콜로마 문자는 역사적 서술을 기록하는 데 사용된 문자입니다. 이후 14세기에 수크레스와르와 바네스와르라는 두 브라만이 이 언어를 산스크리트어로, 그리고 다시 벵골어 문자로 번역했다. 코크보록어에서는 동사에서 어간 동음이어, 음소 성조, 동사 형태론, 어순, 동사 파생 접미사 등이 생성됩니다.

시간이 흐르면서 콕보록은 영어, 아랍어, 벵골어, 페르시아어 등 다양한 언어를 접하게 되었습니다. 코크보록어에는 다양한 복잡한 응집 구조가 존재합니다. 트리푸라에서 코크보록어를 모국어로 사용하는 사람들은 아직 널리 채택된 문자가 없어 정보를 쉽게 접하기 어렵지만, 이 부분은 계속 개선 중입니다.

트리푸라에서는 여러 방언의 콕보록이 사용됩니다. 트리푸라에서는 트리푸라/트리푸리, 데바르마, 레앙, 자마티아, 우차이, 노아티아, 루사이, 쿠키스, 차이말, 할람, 산탈, 렙차, 착마, 카시아, 오랑, 모그, 가로스 등 다양한 방언이 사용됩니다. 2011년 인구조사 보고서에 따르면, 인도에는 1,011,294명의 콕보록어 화자가 있으며, 인접한 국가인 방글라데시에는 40만 명이 넘는다.

문헌 검토
저자들은 힌디어, 벵골어, 영어 코드를 혼합한 새로운 페이스북 게시물 데이터셋을 이용한 자동 언어 식별 연구를 설명한다. 그들은 단어 수준에서 언어 식별을 위해 사전 기반 접근법과 감독 분류 등 다양한 기법을 실험하며, 이러한 환경에서 정확한 언어 식별을 위해 맥락적 단서를 고려하는 것이 중요함을 강조합니다.

이 논문은 힌디어-영어 코드 혼합을 사용하여 어휘 기반, 문자 수준, 단어수준 기법을 사용하여 소셜 미디어 플랫폼에서 증오 발언을 식별하기 위한 주석 달린 트윗 데이터셋을 제시합니다. 논문에서는 N그램을 기반으로 한 오류 허용성 텍스트 분류 방법을 제시합니다. 첫째, 시스템은 뉴스그룹 자료나 구문 샘플과 같은 학습 세트 데이터를 사용하여 다양한 범주를 반영하는 프로필을 계산하는 데 사용됩니다. 그 후 시스템은 분류해야 할 특정 문서에 대한 프로필을 생성합니다. 마지막으로, 알고리즘은 각 카테고리 프로필과 문서의 프로필 사이의 거리 측정값을 계산합니다. 문서 프로필과 가장 가까운 범주는 시스템2에 의해 선택됩니다.

연속 단어 주머니(Continuous Bag of Words)와 스킵그램(Skip-Gram) 모델 등 여러 단어 임베딩 기법이 비교되어 특징 벡터를 생성하였습니다. Adaboost, 랜덤 포레스트, K-최근이웃, 가우스 나이브 베이즈, 서포트 벡터 머신, 로지스틱 회귀 모두 우수한 교차 검증 점수를 기록했습니다. 3. 이전 접근법에 대한 요약은 표 1에 제공되어 있습니다.

어휘 기반 분류기를 활용하여 연구에서 평가된 세 가지 언어 조합(스페인어-영어, 네덜란드어-영어, 독일어-터키어)에서 기존 분류기보다 우수한 성과를 내고 소셜 미디어 데이터셋을 활용했습니다. 연구의 접근법은 수렴성과 테스트 성능의 일관성 측면에서 모델 복원력이 향상되었으며, 코드-혼합 텍스트에서 감정 분석 기법보다 3.31% 정확도 향상됨을 보여줍니다.

더닝의 언어 통계적 식별은 그들의 기념비적인 연구에서 뉴멕시코 주립대학교 컴퓨팅 연구소의 기술 보고서6에서 처음 발표되었습니다. 본 논문은 영어-텔루구 코드-혼합 데이터 쌍을 기반으로 숨겨진 마르코프 모델, 무작위 숲 분류기, 조건부 무작위 장, 순진한 베이즈 분류기를 사용하여 다양한 유형의 감독 학습을 분석합니다7. 이 논문은 영어, 보도어, 아삼어 등 인도 언어에 초점을 맞추며, 코드믹스 소셜 미디어 자료에서 언어를 인식하는 새로운 접근법을 논의합니다. 연구진은 딥러닝 모델에서 양방향 장단기 기억(Bidirectional Long Short-Term Memory)을 사용합니다.

이 논문에서는 구자라트어와 영어, 힌디어가 혼합된 상당한 규모의 구자라트어 데이터셋을 사용했습니다. 그들은 다양한 기계 학습 분류기를 사용했습니다. 그중 지지 벡터 분류기는 92%의 정확도로 가장 높은 정확도를 보였습니다.

별도의 분류 단계에서는 코드 스위칭과 네덜란드어-영어 트윗의 차용을 구분하기 위해 언어학적 틀이 사용됩니다. 규칙 기반 LID, 지원 벡터 머신, 의사결정 트리 분류기를 사용하여 DTC(마이크로 F1 = .95)와 규칙 기반 LID 시스템(마이크로 F1 = .95)이 최선10을 수행함을 학습합니다.

그들의 모델 성능은 코드 스위치 공격성 탐지 TRAC-1 데이터셋, Hinglish Offensive Tweet 데이터셋, 그리고 유머 분류 데이터셋11을 사용해 평가되었다. 성인의 어휘 습득 향상을 위해 확률적 접근법이 코드믹스 텍스트 생성을 위한 L2 방법론으로 제안되었습니다12. 사전 모듈이 통합되어 단어 수준 코드 혼합을 제어하기 위해 다양한 감독 분류기에 대한 테스트를 수행하는 데 사용됩니다.13.

그들은 다양한 지표를 사용해 코드 전환 패턴을 분석했으며, 스페인어-영어와 힌디-영어 모두에서 신경망 모델이 조건부 무작위 장(CRF) 모델보다 각각 2.5%와 3.5%포인트 차이로 더 낮은 성과를 보였음을 발견했다.

이중 언어 어휘와 영어 텍스트를 입력으로 사용하여 어휘 언급에 팩터 그래프를 생성하여 주어진 "학습 가능성" 매개변수를 최적화하는 코드 스위칭 텍스트를 생성합니다. 이 논문에서는 힌디어-영어 코드 스위칭 데이터의 언어 쌍을 기반으로 CanVEC 툴박스의 개념을 더 잘 이해하고자 합니다. 이들은 87.99%의 정확도15.16의 F1 점수를 성공적으로 달성했습니다.

저자들은 먼저 구자라트어와 영어17 간의 코드 혼합을 살펴보며, 각 토큰의 언어를 식별하고 정규화한 후 구절을 원주민 문자로 다시 음역하는 3단계 파이프라인을 적용합니다. 그 후 힌디어-영어 코퍼스18로 초점을 옮겨, 이중언어 문장 구조에 특별히 맞춘 새로운 감정 감지 알고리즘을 소개합니다. 통제된 실험을 지원하기 위해, 이들은 단일언어 데이터를 기반으로 스킵그램 모델을 훈련하고 출력을 혼합하여 합성 코드 혼합 텍스트를 생성합니다19.

다음으로, 콘카니어-영어 소셜 미디어 데이터셋20은 규칙 기반의 단어 수준 식별 방법으로 처리되며, 수동 주석 훈련 데이터 없이도 견고한 성능을 달성합니다21. 범위를 확장하여, 한 연구는 Facebook22와 같은 플랫폼에서 영어, 힌디어, 벵골어, 아삼어의 방대한 음역된 말뭉치를 활용해 다양한 단어 수준 태깅 기법을 평가합니다. 이를 바탕으로 또 다른 프레임워크23은 언어 간 동적으로 전환하여 내장되거나 차용된 구문을 고정밀도로 감지합니다. 농업 분야에서는 펀자브어-영어 댓글이 여러 모델을 사용하여 분류되며, 그중 n그램 분류기가 가장 높은 정확도를 제공합니다24. 신할라-영어 CMST에서는 앙상블 학습자(무작위 숲, SVM, 순수한 베이즈, 결정 트리, 로지스틱 회귀)를 비교했으며, 무작위 숲이25 표에서 가장 우수한 성과를 냈고, 문자 수준 임베딩과 SVM을 결합한 것은 타밀-영어 및 말라얄람-영어 쌍에서26표에서 강한 결과를 보였습니다. 마지막으로, Crúbadán 프로젝트27은 웹 크롤링을 통해 자원이 부족한 언어 코퍼라를 구축하는 대규모 노력으로 제시되며, 향후 코드 믹싱 연구의 토대를 마련합니다.

데이터셋주요 결과정확도/F1-점수/정확도/경련/리콜
힌디어–벵골어–영어 데이터셋은 페이스북 게시물에서 가져옴단어 수준 소셜 미디어 텍스트에서 언어 식별의 어려움을 강조했습니다89.30%
뉴스 기사, 문서언어 식별을 위해 N-그램을 사용하여 효과적으로 수행0.99%
인디언 코드 혼합 데이터셋단어 수준 언어 식별의 높은 정확도 입증신고 미완료(NR)
위키백과 기반 데이터셋견고한 토큰 수준 코드 스위치 감지신고 미완료(NR)
힌디어-영어 트윗힌디어와 영어 코드믹스의 감정 분류 성능 향상0.78%
다국어 말뭉치기초 언어 식별 프레임워크 확립78.00%
Code_mixed 영어-텔루구 데이터CRF는 최고의 성능을 달성했습니다89.30%
영어-보도 코드 혼합 텍스트높은 단어 수준의 정확도를 달성했습니다92.00%
코드-혼합 구자라트-힌디어 문자문장 단위 언어 식별 정확도는 ≈92%입니다92.00%
네덜란드-영어 트윗DTC 및 규칙 기반 모델은 F1 ≈0.95를 달성했습니다95.00%
코드 스위칭 데이터셋모델 간 경쟁 성과신고 미완료(NR)
합성 코드-혼합 텍스트향상된 어휘 학습신고 미완료(NR)
영어-칸나다어 코드 혼합 텍스트효과적인 자동 LID신고 미완료(NR)
TRAC-1, 힝글리시 데이터셋CRF는 신경망 모델에서 더 뛰어난 성능을 보였습니다91.00%
다국어 온라인 데이터정확한 단어 수준 언어 식별88.00%
힌디어-영어 소셜 미디어힌디어-영어 언어 식별의 높은 정확도0.93%
영어-구자라트 코드 - 혼합효과적인 이중언어 처리
소셜 미디어 코드믹스 데이터셋향상된 감정 감지0.90%
코드 혼합 합성 데이터강한 임베딩 표현신고 미완료(NR)
콘카니어-영어 코드 혼합 소셜 미디어 텍스트주석 없는 견고한 성능0.89%
트위터의 코드 믹스 데이터셋스위치 감지 개선90.20%
아삼어-벵골어-힌디어-영어정확한 다국어 언어 식별91.00%
소셜 미디어 코드 혼합 텍스트F1 점수 ≈0.950.95%
영어-펀자브어 코드 혼합 데이터N-그램 모델이 가장 우수한 성능을 보였습니다0.88%
신할라어-영어 코드 혼합 데이터RF는 최고의 정확도를 달성했습니다0.92%
페이스북 코드믹스 댓글향상된 단어 수준 LID0.93%
크루바단 코퍼스저자원 언어 연구 가능함신고 미완료(NR)
코드믹스 데이터셋단어 수준 언어 식별에서 좋은 성과를 보였습니다0.94%

표 1: 코드 혼합 언어 문학 요약.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

영어와 콕보록어로 된 코드믹스 및 코드 스위칭 텍스트는 지역 대화와 소셜 미디어 플랫폼에 공개된 게시물에서 수동으로 수집되었습니다. 개인 식별 가능하거나 민감한 정보는 수집되지 않았습니다. 모든 절차는 기관의 윤리 지침을 따랐습니다.

3. 설계 및 구현

3.1 알고리즘
3.1.1 문장 (S)의 각 토큰에 대해:
a. 빈도 사전을 사용하여 어휘 확률 Plexi 를 계산합니다.
b. N-그램 모델을 기반으로 문자 기반 확률 P차를 계산합니다
c. 두 가지 모두의 가중 보간:
P결합 = λlexi Plexi + λchar Pchar
3.1.2. 각 토큰에대해 P가 결합 한 확률 조합은 방출 확률로 저장되었다.
3.1.3. 비터비 알고리즘 적용:
a. 초기 언어 확률과 함께 주어집니다.
b. 각 토큰에 대해:
i. 전이 Pcount 전이 계산(동일 언어 연속).
그리고 P스위치 (언어 전환 가능성)입니다.
ii. 언어 경로를 선택하고 시퀀스 확률을 최대화한다.
3.1.4. 전체 확률이 가장 높은 최대 확률 언어 시퀀스 L을 출력합니다.

3.2 계산 환경
모든 실험의 구현은 Google Colab 플랫폼에서 Python 3.10을 사용해 이루어졌습니다. 이 시스템은 NumPy, Pandas, Matplotlib 같은 기본 Python 패키지를 사용해 데이터를 처리하고 시각화했으며, scikit-learn(v1.3)을 사용해 통계적 예측과 분석을 수행했습니다. 주파수 사전 통합, 문자 n-그램 모델링, 비터비 디코딩은 맞춤형 Python 스크립트로 구현되었습니다. 모델은 10,000개의 문장 데이터셋에서 학습 및 테스트되었으며, 훈련과 테스트는 70대 30으로 나뉘었습니다.

3.3 언어 식별
문장이 토큰화되면, 언어 식별 모듈은 각 토큰이 Kokborok 또는 영어인지 결정합니다. 전체 시스템 아키텍처는 그림 1에 나와 있습니다. 이 언어 할당은 어떤 전사 모듈이 적합한지 결정하는 데 사용됩니다. 문자 n-그램 모델과 빈도 사전의 데이터를 병합하여 토큰의 언어를 결정합니다.

위에서 설명한 두 언어 간의 상당한 철자법 차이 때문에, 맥락적 특징 없이 토큰 자체의 정보만 사용하는 분류기는 이미 좋은 성능을 냅니다. 하지만 초기 할당 이후에는 비터비 알고리즘을 사용하는 또 다른 분류기가 적용됩니다. 이 두 번째 분류기는 중간어 동형이의어의 오분류를 줄이고 같은 언어에 속하는 단어 그룹을 선호합니다.

figure-protocol-1
그림 1: Viterbi 알고리즘리트를 사용한 단어 수준 패턴벌점 언어 전환. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요. 

figure-protocol-2
그림 2: 코드 혼합 문장 언어 식별 방법. 이 그림의 더 큰 버전을 보려면 여기를 클릭하세요.

우리는 사전과 캐릭터 모델에 Crúbadán corpus27의 데이터를 수집했습니다. 이 말뭉치에는 코크보록과 같은 소수 언어를 포함한 수많은 언어들이 포함되어 있습니다.

Crúbadán 코퍼스의 데이터셋이 목적에 부족하므로, 새로운 Kokborok 성경 데이터셋을 테스트했습니다. 다른 언어들과 비교했을 때, 이용 가능한 자료는 상대적으로 적습니다. 따라서 이 논문의 혼합 문장 데이터는 플래티넘 주빌리, 인플루션 그룹, 복원 국제 그룹, 쿠물뛽, 데파차라 침례교 협회, 유나이티드 티프라사 포럼(UTF), 데파차라 청소년 펠로우십, 크리슈나 나가르(EU), 우초이 크리스천 펠로우십(UCF), 티프라 크스랑 보돌, 부족 공학 협회, 국립기술원 학생 보록, 정보 야룽, 트리푸라 우초이 청년 협회(TUYA) 등 콕보록어를 사용하는 WhatsApp 그룹에서 수집되었습니다.

2021년 8월부터 2023년 12월까지 이 WhatsApp 그룹들에서 총 10,000개의 코드보록과 영어 혼합 문장이 수집되었습니다. 데이터셋의 출처와 도메인 분포는 표 2에 나열되어 있습니다.

이름총 단어 수
콕보록 성경 단어들718883
영어와 콕보록 코드 혼합 문장68789

2: 코크보록 단어.

언어총 토큰
콕보록 (TRP)711509
영어 (en)1767141

3: 문자 2그램 모델.

슬. 아니요총 코드-혼합 문장 사용
110,768

4: 혼합 문장 훈련.

캐릭터 모델과 사전은 Crúbadán corpus27에서 가져왔습니다. 이 컬렉션은 다양한 언어, 특히 여러 소수민족 언어에 접근할 수 있으며, 목표 언어로 된 자료를 인터넷에서 검색하여 자동으로 생성됩니다. 특히 콕보록 말뭉치는 비교적 작은데, 이는 처음에 코크보록을 위해 만들어진 접근법이기 때문입니다.

Kokborok과 영어 말뭉치도 있지만, 특히 코드 믹싱과 코드 플립 측면에서 데이터셋 부족으로 의도적으로 사용되지 않았습니다. 콕보록 말뭉치에는 여러 영어 용어도 있습니다; 이 중 일부 단어들( no, do, o 포함)은 영어 말뭉치보다 더 흔합니다.

사전과 언어 모델은 개별 단어 독립적 라벨링 작업을 수행합니다. 우리의 과제는 King 등과 비교할 수 있다.

어휘(lex), 문자(ch), 단어 라벨 확률을 활용하여 어휘(ch)와 어휘(렉스) 구성 요소의 주파수 사이에 선형적 보간을 만듭니다. 이로 인해 도출되는 결합된 (comb) 확률은 아래 식(1)에 나타난다; 상세한 보간 매개변수는 표 3에 제시되어 있습니다. 보간 전략은 그림 2에 나타난다.

P결합 = λ렉시 · Plexi + λchar · P문자 (1)

여기서 0 ≤ λlexi, λchar ≤ 1; 그리고 λlexi + λchar = 1. 어휘적 기반이 없는 단어는 매우 낮지만 0이 아닌 어휘 확률을 가진다. 아마도 두 어휘 언어 모두에서 단어가 빠진 경우, λlexi = 1이라도 어휘 확률 대신 문자 모델을 사용해 구현할 것입니다.

우리의 문자 모델 개발 방법은 Dunning의 문자 n-그램 마르코프 사슬(1994)을 기반으로 합니다. 이는 토큰의 시작과 끝에 각각 n-그램을 세어 초기 확률과 전이 확률을 추정함으로써 이루어집니다.

아래는 훈련된 2-gram과 4-gram 모델의 성능 비교입니다.

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

확률의 초기와 전이어를 곱하여 언어 모델을 사용하여 단어의 발생 가능성을 구할 수 있다(4).

P(〈w1w2w3〉) = P이니셜(〈w1w2) · P전이 (c3|〈w1w2) · P전이(〉|123) (4)

콕보록어는 접두사와 접미사가 매우 풍부하며, 기본 단어 뒤에 "o", "do", "no"와 같은 접미사가 붙는 형태학적으로 교착어입니다. 2그램은 접사 경계에서 국소적 형태학적 전환을 효과적으로 포착하는 데 도움을 주고, 4그램은 Phailaidido, Thanlainai, Mwchangkha와 같은 어근 및 복합어에서 더 긴 철자 의존성을 가진 Kokborok 단어들을 포착할 수 있습니다.

이는 대규모 말뭉치에 해당되며, 이는 여러 데이터 희소성 문제가 발생할 가능성을 높입니다. 또한, 모든 경우에 등장하지 않을 수 있어 확률이 0이 될 수 있습니다. 람다 스무딩은 보이지 않는 문자를 포함하는 각 n그램에 0이 아닌 확률로 작은 값을 부여함으로써 이러한 문제를 해결하는 데 사용됩니다. 람다의 값은 0.001로 설정되어 있습니다.

figure-protocol-6  (5)

여기서 N = 는 n-그램 단위의 서로 다른 관측값의 양을 나타냅니다.

figure-protocol-7   (6)

여기서 D=는 n그램 단위로 감지된 차이의 개수입니다. 관측되지 않은 n-그램의 확률이 동일하다고 가정한다.

figure-protocol-8   (7)

여기서 C는 문자 크기를 나타냅니다.

Pcount, λlexi, λchar의 초기 값은 Kokborok과 영어 말뭉치의 빈도 분석을 통해 경험적으로 설정되었습니다. 먼저, λlexi를 0.5로 초기화하고 어휘 및 문자 기반 확률 모두에 가중치를 부여하여 첫 번째 실행에서 두 확률이 동등하게 기여하도록 했습니다. 이 초기화 수준을 통해 데이터셋 간 어휘와 문자 n-그램 모델의 비교 역할을 식별할 수 있었습니다.

전이 매개변수 Pcount (동일 언어로 계속됨)는 수작업으로 표시된 데이터셋에서 단일 언어 시퀀스와 스위치 포인트의 비율을 바탕으로 0.6으로 설정되었습니다. 이 값들은 튜닝 중 수렴의 좋은 출발점을 제공했습니다. 그 후 매튜스 상관계수(MCC)를 최대화하기 위해 반복 시험을 통해 모든 매개변수를 정제했으며, 자세한 내용은 결과 섹션에 있습니다.

맥락적 식별
컨텍스트 모델은 독립 식별 단계에서 이미 초기화된 확률(PcountPswitch)을 사용하고, 비터비 수열 디코딩을 통해 이를 정제하여 전이 불일치를 줄이고 언어 전환을 최적으로 감지합니다.

언어 모델의 분석 출력은 문맥에 따라 다르며, 주로 현재 토큰과 후속 토큰을 결합하고 이전 및 현재 토큰을 모두 사용하여 얻습니다. 동일한 빈도 값을 가진 두 단어가 유사한 의미를 가질 가능성이 있어 오분류를 일으킬 가능성이 있으므로, 문맥 의존적 접근법을 사용하여 두 언어에 존재하는 유사 항을 찾았습니다.

"아니오", "도", "오", "아레", "다(날)", "가다", "사(말)", "장미", "링" 등 여러 단어가 두 언어에서 비슷합니다. 이로 인해 이러한 모호함이 발생할 때 올바른 언어를 식별하기 매우 어려울 수 있으며, 때때로 언어가 잘못 분류되기도 합니다.

이러한 언어 식별 문제를 해결하기 위해, 우리는 판별적 히든 마르코프 모델과 감독 기반 머신러닝을 사용한 언어 모델 세트를 제시했습니다. 두 언어의 전이 확률은 동일하다고 가정합니다. 동일 언어 Pcount의 경우, 지속 확률이 선언되어야 하는 주요 매개변수입니다. 이를 통해 언어 전환 가능성을 계산할 수 있습니다.

P스위치 = 1 − P카운트 (8)

비터비 경로를 이용한 맥락적 분류는 그림 3에 나와 있습니다. 비터비 알고리즘의 목적은 PcountPswitch에 따라 토큰 시퀀스의 언어 중 어떤 것이 가장 좋은지 결정하는 것입니다.

비터비 알고리즘은 맥락적 분류에 적용됩니다. PcountPswitch 는 간선에 라벨을 붙이고, 노드는 첫 번째 분류기에서 할당된 상대적 확률로 라벨링됩니다.

Kokborok 언어를 사용할 가능성이 높기 때문에, 첫 번째 분류기만 사용되고 맥락 정보가 없을 경우 점선 경로가 선택되었습니다.

맥락 기반 조정의 영향은 그림 4에 시각화되어 있습니다. 이는 문맥 정보가 없을 경우 "Next week o phaisidi do" 라는 구문의 두 번째, 세 번째, 다섯 번째 단어가 영어 (en)(점선 경로)로 잘못 식별될 수 있음을 보여줍니다. 영어의 경우 확률이 약간 더 높지만, 상대적 값은 비슷합니다.

두 개의 언어 이동은 페널티를 받으며, 전이 확률도 고려하면 수열의 확률은 비터비 알고리즘의 최적 경로보다 낮아집니다. 따라서 두 언어에 공통 용어가 나타나는 것보다 다른 언어에서 유래할 가능성이 훨씬 높은 단어만이 짧은 연속 언어 변화를 유발할 수 있습니다.

매튜스 상관계수는 정밀도, 회상, 정확성과 같은 다른 지표와 비교했을 때, 진양성, 진음성, 거짓양성과 거짓음성까지 모두 고려하여 이진 분류 과제에 훨씬 더 적합하기 때문에 평가 지표로 선택되었습니다.

figure-protocol-9   (9)

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

표 4에서는 Kokborok 단어로 시작하는 시퀀스에 대한 초기 편향을 계산하고, 동일 언어에서 계속 이어질 확률인 Pcount를 계산한 Ptrp의 MCC 점수와 매개변수 튜닝 결과를 보여드렸습니다.

...
λ_lexPcount = 0.66Pcount = 0.70Pcount = 0.74Pcount = 0.79Pcount = 0.82Pcount = 0.86Pcount = 0.90Pcount = 0.92Pcount = 0.94

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

제안된 모델은 단어 수준에서 93.15% 의 정확도를 보여주지만, 오류에 대한 철저한 분석을 통해 영어-코크보록 코드 혼합 언어 식별의 어려움을 강조하는 여러 반복되는 패턴이 드러납니다.

빌린 단어와 모호한 단어 사용
많은 오류는 코크보록어 사용에서 흔해진 영어 차용어의 사용에서 비롯됩니다. no, do, o, go, ring, rose, are 와 같은 단어들은 두 언어 모두에서 자주 등장하며, 동의어로 서로 교환 가능하다.

이 단어들은 유사한 철자 패턴과 높은 문맥 빈도로 인해 시스템에서 때때로 잘못 분류되기도 합니다. 예를 들어, Kokborok 접두사 do (명령문 표지)...

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 이해 상충을 선언할 필요가 없습니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

지역 원어민, WhatsApp 그룹, 단체, 학생회, 그리고 인도 성경공회에 대해 코드믹스 문장의 원시 데이터셋을 얻는 데 도움을 주셔서 감사드립니다. 또한 아루나찰프라데시 국립공과대학교 컴퓨터공학과와 러블리 프로페셔널 대학교가 우리 데이터셋을 검토하고 테스트할 수 있는 플랫폼을 제공해 주셔서 감사드립니다.

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
라즈베리 파이 4라즈베리 파이 재단RPI4-MODBP-4GB저자원 언어 처리에 사용됩니다
MicroSD 카드 64GB샌디스크SDSQUAR-064G-GN6MAOS 및 데이터셋 저장을 위해
전원 공급 5V/3A공식 라즈베리 파이SC0218파이 보드에 전력을 공급하기 위해
USB 마이크보야BY-M1언어 데이터 수집에 오디오 입력을 위한 자료
모니터 (HDMI)LG22MK600M테스트 중 출력 표시
키보드 & 마우스 콤보로지텍MK270인터페이스 제어
WiFi 동글 (파이 3 사용 시 )TP-링크TL-WN725N무선 데이터 전송 (온보드 WiFi가 없을 경우)
파이썬 IDE (Thonny)오픈 소스-프로그래밍용 IDE
렉시콘 데이터셋맞춤 제작-콕보록-영어 쌍
N-그램 데이터셋맞춤 제작영어-코크보록 언어 쌍
코드 혼합 및 코드 전환맞춤 제작10,000문장소셜 미디어 텍스트, 왓츠앱 글, NGO, 성경 등에서 수집했습니다

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

N
동영상 곧 제공

관련 논문