Araştırma makalesi

İngilizce ve Kokborok Kod Karışıklı Cümlelerin Düşük Kaynaklı Dil Tanımlaması

DOI:

10.3791/69130

2 Ocak 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Verilen protokolün amacı, İngilizce-Kokborok kod karışımı metin içinde kelime düzeyindeki dilleri doğru şekilde tanımlamak, n-gram karakter ve frekans sözlüklerini birleştiren denetimsiz bir model kullanmaktır.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Çok dilli metnin artan kullanımı nedeniyle otomatik kelime düzeyinde dil algılama modeline olan ihtiyaç giderek artmaktadır. Kokborok dilinde ve İngilizce'de kod değiştirilmiş ve kod karışımı cümleleri kelime seviyesinde tanımlamak için denetimsiz bir model öneriyoruz. Kod karışımı metin üzerine birçok çalışma yayımlanmıştır; bunlar arasında birkaç Hint dili de vardır. Ancak, bildiğimiz kadarıyla, çalışmamız öncü bir çabadır ve düşük kaynaklı İngilizce-Kokborok dil çiftleri için dilleri ilk olarak tanımlamaktadır. Frekans sözlüğünden veriyi karakter n-gram modelinden gelen verilerle birleştiren bir yöntem kullandık. Viterbi tekniği, kelime seviyesinde dil tanımlamasına yardımcı olmak için n-gram Markov karakter modelini frekans sözlüğü ile birleştirir. Önerilen yöntem iyi performans gösterdi; kelime düzeyinde doğruluk %93,15 oldu; bu, BiLSTM-CRF modelinin %88,5 ve kural tabanlı temel %85,3'ten daha iyiydi. Bu, sözlük ve istatistiksel metodolojinin birleştirildiğini, düşük kaynaklı dilleri büyük açıklamalı veri setlerine bağımlı olmadan işlemede etkinliğini gösterir.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu dijital çağda, sosyal medya platformlarında kod karıştırma ve kod değiştirme çok dilli iletişimin hızlı büyümesi, küresel iletişimin merkezi haline geliyor. Metin içeriği içinde dillerin doğru tanımlanmasına olan ihtiyaç çok önemlidir. Gözlemledikten sonra, Hintçe, Bengalce ve Telugu gibi birçok Hint dilinin dil tanımlamada zaten araştırıldığını, Manipuri, Bodo ve Assam gibi diğer Hint düşük kaynaklı dillerinin ise dil tanımlama araştırmalarında kısmen ele alındığını gördük. Ancak, hem dilsel hem de yapısal olarak farklı olan düşük kaynaklı bir dil olan Kokborok için modeller geliştirmede hâlâ önemli bir araştırma boşluğu vardır.

Manipuri, Assam ve Bodo düşük kaynaklı dillerin aksine, Kokborok yüksek düzeyde yazım varyasyonuna sahiptir ve Roma veya Bengal alfabesiyle yazılmıştır; iletişim genellikle birbirinin yerine kullanılır. Bu durum, sembol sınırlarında, transliterasyonda ve karakter düzeyinde özelliklerin çıkarılımında çok fazla belirsizlik yaratıyor; bu da belirgin zorluklar yaratıyor ve literatürde nadiren ele alınmıştır. Ayrıca, Kokborok aglütinatif bir dildir ve morfolojisi zengin ön ekler ve ekler (örneğin, -o, -do, -no) ile fonemik tonlar içerir; bu da Hint-Aryan dillerine göre geliştirilen mevcut kod karışık dil tanımlama modellerinin uygulanmasını zorlaştırır.

Bu sorunlar sosyal medya tarafından daha da güçleniyor. Kokborok konuşanlar, yalnızca kod karıştırma ve kod değiştirme için değil, aynı zamanda Kokborok cümlesindeki eksik sözcük öğelerini telafi etmek için İngilizce kelimeleri metne karıştırma eğilimindedir. Bu durum, standart olmayan yazımlara ve bağlamla ilgili kelimeler kullanımına yol açar; bu da kural temelli veya tamamen sözcük sistemlere karşı bir gerilemedir.

Bu çalışmada, bu boşluklar, frekans sözlüklerini ve karakter n-gram olasılıklarını Viterbi çözümleme çerçevesiyle birleştiren denetimsiz bir model önerilerek ele alınmıştır. Yöntem özellikle İngilizce-Kokborok çiftinin yazım, morfolojik ve bağlamsal karmaşıklıklarına odaklanmakta olup, bu düşük kaynaklı dilde kelime seviyesindeki dil bariyerlerini sistematik olarak ele alıp tespit etmeye yönelik ilk hesaplama girişimlerinden biridir.

KOKBOROK'UN ARKA PLANI
Dili simgeleyen "Kok" ve insan anlamına gelen "Borok" kelimeleri, insan anlamına gelen bileşik "Kok-borok" kelimesini oluşturur. "Kok-borok" terimi, Tripura Borok halkının ve komşu Bangladeş ile Myanmar'daki Borok halkının ve Mizoram, Manipur ve Assam sakinlerinin konuştuğu dili ifade eder. Kokborok dili, ağırlıklı olarak Tripura'da konuşulur ve hem Roma hem de Bengal alfabeleriyle yazılır. Kokborok konuşanların çoğu tarafından Bengal alfabesine göre Roma alfabesi tercih edilir. Aslında, Tibeto-Burman olarak bilinen Çin-Tibet dilsel alt grubu, Kokborok dilinin kökenli yeridir. Kokborok dili ile Bodo dili ince bir şekilde benzerdir. Kokborok dilinin 36 çeşidi, hem Bodo hem de Kachari dilleriyle ince benzerlikler taşır.

Koloma, orijinal Kokborok yazısı olarak biliniyordu. Hindistan'daki tek eyalet olan Tripura, 15 Ekim 1949'da Hint Birliği'ne katılmadan önce 184 kişi tarafından kontrol ediliyordu. Rajratnakar kitabında bulunan Koloma yazısı, tarihsel anlatıları yazmak için kullanılan yazıdır. Daha sonra, on dördüncü yüzyılda, Sukreswar ve Vaneswar adında iki Brahman dili Sanskritçeye, ardından tekrar Bengal alfabesine çevirdi. Kokborok dilinde fiillerden üretilen kök homofoni, fonemik ton, fiil morfolojisi, kelime sırası ve fiil türevi ekleri vardır.

Zaman geçtikçe Kokborok, İngilizce, Arapça, Bengalce, Farsça gibi dillerle karşılaşmıştır. Kokborok dilinde farklı karmaşık aglütinatif yapılar bulunabilir. Tripura'da Kokborok'u ana dil olarak konuşan kişiler, dilin henüz yaygın olarak benimsenen bir alfabesi olmadığı için bilgiye kolayca erişemiyor, ancak bu üzerinde çalışmalar devam ediyor.

Tripura'da Kokborok'un birkaç lehçesi konuşulmaktadır. Tripura'da çeşitli lehçeler konuşulur; bunlar arasında Tripura/Tripuri, Debbarma, Reang, Jamatia, Uchai, Noatia, Lusai, Kukis, Chaimal, Halam, Santal, Lepcha, Chakma, Khasia, Orang, Mog ve Garos bulunur. 2011 Nüfus Sayımı raporuna göre, Hindistan'da 1.011.294 Kokborok konuşan ve komşu ülke Bangladeş'te 400.000'den fazla kişi bulunmaktadır.

LITERATÜR TARAMASI
Yazarlar, Hintçe, Bengalce ve İngilizce kodlarının karıştırılmış yeni Facebook paylaşımları veri seti kullanılarak otomatik dil tanımlama üzerine devam eden araştırmalarını anlatıyor. Kelime düzeyinde dil tanımlama için sözlük tabanlı yaklaşımlar ve denetimli sınıflandırma gibi çeşitli tekniklerle deneyler yaparlar ve bu ortamlarda dil tanımlaması için bağlamsal ipuçlarının dikkate alınmasının önemini vurgularlar.

Makale, sosyal medya platformlarında nefret söylemini tanımlamak amacıyla açıklamalı tweetlerden oluşan bir veri setini, sözlük tabanlı, karakter düzeyi ve kelime düzeyindeki teknikler kullanan Hintçe-İngilizce kod karışımıylasunmaktadır 1. Makalede N-gramlara dayalı hata toleranslı metin kategorize etme yöntemi sunulmaktadır. İlk olarak, sistem, çeşitli kategorileri yansıtan haber grubu materyali veya ifadeler gibi eğitim seti verileri kullanılarak profilleri hesaplamak için kullanılır. Bundan sonra, sistem kategorize edilmesi gereken belirli belge için bir profil oluşturur. Son olarak, algoritma her kategori profili ile belgenin profili arasındaki mesafe ölçüsünü hesaplar. Profili belgenin profiline en yakın olan kategori sistem2 tarafından seçilir.

Sürekli Kelime Torbası ve Skip-Gram modelleri dahil olmak üzere birkaç kelime göme tekniği karşılaştırıldı ve özellik vektörleri oluşturuldu. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine ve Logistic Regression hepsi iyi çapraz doğrulamapuanları verdi 3. Önceki yaklaşımların özeti Tablo 1'de sunulmaktadır.

Sözlük tabanlı sınıflandırıcılar kullanarak, çalışmada değerlendirilen üç dil çiftinde mevcut sınıflandırıcıları geride bırakıyor: İspanyolca-İngilizce, Felemenkçe-İngilizce ve Almanca-Türkçe, sosyal medya verisetleriyle 4. Çalışmanın yaklaşımı, test performansında yakınsamama ve tutarlılık açısından model dayanıklılığının arttığını ve kod karışımı metinlerdeki mevcut duygu analizi tekniklerini yüzde 3,31 doğruluk oranında geridebıraktığını gösteriyor 5.

Dunning'in dil istatistiksel tanımlaması ilk olarak New Mexico State Üniversitesi Bilgisayar Araştırma Laboratuvarı tarafından TeknikRapor 6'da sunulmuştur. Bu makale, İngilizce-Telugu kod karışık veri çiftine dayanarak Gizli Markov Modeli, Rastgele Orman Sınıflandırıcı Yöntemi, Koşullu Rastgele Alan ve Naif Bayes Sınıflandırıcısı kullanılarak farklı denetimli öğrenme türlerinianaliz etmektedir 7. Makale, İngilizce, Bodo ve Assam gibi Hint dillerine odaklanmakta olup, kod karışımı sosyal medya materyallerinde dilleri tanıma için yeni bir yaklaşımı tartışmaktadır. Araştırmacılar, derin öğrenme modelinde İki Yönlü Uzun Kısa Süreli Hafızakullanıyorlar 8.

Bu makalede, Gujarati diline ilişkin geniş bir veri seti kullandılar - burada Gujarati dilinin İngilizce ve Hintçe ile karıştığı. Çeşitli makine öğrenimi sınıflandırıcıları kullandılar. Bunlar arasında, Destek Vektör Sınıflandırıcısı en iyi doğruluğu yüzde 92 doğruluk9 verdi.

Ayrı sınıflandırma aşamasında, kod değiştirme ile Hollandaca-İngilizce tweetlerin ödünç alınması arasındaki ayrımı yapmak için dilbilimsel bir çerçeve kullanılır. Kural tabanlı LID, Destek Vektör Makineleri ve Karar Ağacı Sınıflandırıcıları kullanarak, DTC (mikro F1 = .95) ve kural tabanlı LID sisteminin (mikro F1 = .95) eniyi 10 performansı gösterdiğini öğrenirler.

Modellerinin performansı, kod anahtarlı agresiflik algılama TRAC-1 veri seti, Hinglish Saldırgan Tweet veri seti ve mizah sınıflandırma veriseti 11 kullanılarak değerlendirildi. Yetişkin sözcük ediniminde okuma yoluyla tutumu artırmak için, kod karışımı metin12 üretmek için L2 metodolojisi olarak olasılıksal bir yaklaşım önerildi. Bir sözlük modülü dahil edilir ve kelime düzeyinde kod karıştırmayı kontrol etmek için çeşitli denetimli sınıflandırıcılarda testler yapmak için kullanılır13.

Kod değiştirme kalıplarını analiz etmek için çeşitli metrikler kullandılar ve hem İspanyolca-İngilizce hem de Hintçe-İngilizce için sinir ağı modellerinin Koşullu Rastgele Alanlar (CRF) modelinden sırasıyla 2,5 ve 3,5 puan farkla daha kötü performans gösterdiğini, yani14 puan fark ettiğini keşfettiler.

İki dilli bir sözlük ve İngilizce metin kullanarak girdi, yöntem sözcek mantıları üzerinde bir faktör grafiği oluşturur ve belirli bir "öğrenilebilirlik" parametresini optimize eden kod değiştirilmiş bir metin üretir. Bu makalede, Hintçe-İngilizce kod değiştirmeli veri çiftlerine dayalı CanVEC araç kutusunun kavramlarını daha iyi anlamaya çalışıyorlar. Başarıyla yüzde 87,99 doğrulukoranı 15,16 F1 puanı elde ettiler.

Yazarlar önce Gujarati ile İngilizce17 arasındaki kod karıştırmasını inceler; her tokenın dilini tanımlamak, yazımını normalleştirmek ve bölümleri ana alfabelerine dönüştürmek için üç aşamalı bir boru hattı uygularlar. Daha sonra odak noktalarını Hintçe-İngilizce korpus18'e kaydırıyorlar ve burada iki dilli cümle yapılarına özel olarak ayarlanmış yeni duygu algılama algoritmaları tanıtıyorlar. Kontrollü deneyleri desteklemek için, tek dilli verilerde atlama gram modellerini eğitip çıktıları karıştırarak sentetik kod karışımı metinüretirler 19.

Sonra, Konkani-İngilizce sosyal medya veriseti 20, kural bazlı, kelime düzeyinde bir tanımlama yöntemiyle işlenir ve manuel olarak açıklamalı eğitim verileri olmadan sağlam performans eldeedilir 21. Kapsamı genişleten bir çalışma, Facebook22 gibi platformlardan İngilizce, Hintçe, Bengalce ve Assamça içeren geniş bir transliterasyon koleksiyonunu kullanarak çeşitli kelime seviyesinde etiketleme tekniklerini değerlendiriyor. Bunun üzerine inşa edilen başka birframework, 23 diller arasında dinamik olarak geçiş yaparak gömülü veya ödünç alınmış ifadeleri yüksek hassasiyetle tespit eder. Tarım alanında, Pencapça-İngilizce yorumlar birkaç model kullanılarak sınıflandırılır—bunlar arasında, en iyi doğruluğu sağlayan n-gramsınıflandırıcı 24. Sinhala-İngilizce CMST için topluluk öğrenenler (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression) karşılaştırılır; Random Forest en iyiperformans gösteren 25 kişi olurken, karakter düzeyinde gömüler SVM'lerle birlikte Tamil-İngilizce ve Malayalam-İngilizceçiftlerinde güçlü sonuçlar elde eder 26. Son olarak, CrúbadánProjesi 27, web'de tarama yoluyla yetersiz kaynak olan dil korpusları oluşturmak için büyük ölçekli bir çaba olarak sunulmakta ve gelecekteki kod karıştırma araştırmalarının temelini oluşturuyor.

Veri setiÖnemli SonuçlarDoğruluk/F1-Puan/Doğruluk/Davranış/Hatırlama/Hafıza
Facebook paylaşımlarından alınan Hintçe–Bengalce–İngilizce veri setiKelime düzeyinde sosyal medya metininde Dil Tanımlama zorluklarını vurguladı89.30%
Haber makaleleri, belgelerDil tanımlaması için N-gramları kullanılarak etkin şekilde gerçekleştirilir0.99%
Hindistan kod karışık veri setleriKelime düzeyinde Dil Tanımlamasında iyi doğruluğu göstermekBildirilmedi (NR)
Wikipedia tabanlı veri setleriSağlam token düzeyinde kod anahtarlama tespitiBildirilmedi (NR)
Hintçe–İngilizce tweetlerHintçe ve İngilizce Kod Karışımı Duygusal Sınıflandırmada Performans Geliştirilmiş0.78%
Çok dilli korpuslarTemel Dil tanımlama çerçevesi78.00%
Code_mixed İngilizce–Telugu verileriCRF en iyi performansı elde etti89.30%
İngilizce–Bodo kod karışımı metinYüksek kelime doğruluğu elde edildi92.00%
Kod Karışımı Gujarati–Hintçe yazı yazılarıCümle düzeyinde dil tanımlama doğruluğu %92 ≈92'dir92.00%
Hollandaca–İngilizce tweetlerDTC ve kural tabanlı modeller F1 ≈0.95'e ulaştı95.00%
Kod anahtarlamalı veri setleriModeller arasında rekabetçi performansBildirilmedi (NR)
Sentetik Kod-Karışımı metinGeliştirilmiş sözcük öğrenmeBildirilmedi (NR)
İngilizce–Kannada Kod Karışımı metinEtkili otomatik LIDBildirilmedi (NR)
TRAC-1, Hinglish veri setleriCRF, Sinir Ağı modellerinde daha iyi performans gösterdi91.00%
Çok dilli çevrimiçi verilerDoğru kelime düzeyinde Lnaguage tanımlaması88.00%
Hintçe–İngilizce sosyal medyaHintçe-İngilizce dil tanımlamasında yüksek hassasiyet0.93%
İngilizce–Gujarati Kodu - KarışıkEtkili iki dilli işleme
Sosyal medya Kod-Karışımı veri setleriGeliştirilmiş duygu algılama0.90%
Kod Karışımı Sentetik VeriGüçlü gömülü temsillerBildirilmedi (NR)
Konkani–İngilizce Kod Karışımı Sosyal Medya MetniAçıklamasız sağlam performans0.89%
Twitter'dan Code-Mixed veri setiAnahtarların daha iyi algılanması90.20%
Assam–Bengalce–Hintçe–İngilizceDoğru çok dilli dil tanımlaması91.00%
Sosyal medya Kod-Karışımı metinF1 puanı ≈0.950.95%
İngilizce–Pencapça Kod-Karışımı verilerN-gram modeli en iyi performans gösterdi0.88%
Sinhala–İngilizce Kod-Karışımı verilerRF en iyi doğruluğu sağladı0.92%
Facebook Kod Karışımı YorumlarGeliştirilmiş kelime seviyesi LID0.93%
Crúbadán CorpusDüşük kaynaklı dil araştırmalarını etkinleştirdiBildirilmedi (NR)
Kod-Mixed veri setleriKelime düzeyindeki Dil Tanımlamasında gösterilen iyi performans0.94%

Tablo 1: Kod-Karışık Dil Edebiyatı Özeti.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

İngilizce ve Kokborok dilinde kod karıştırılmış ve kod değiştirilmiş metinler, yerel sohbetlerden ve sosyal medya platformlarındaki halka açık gönderilerden manuel olarak toplanmıştır. Kişisel olarak tanımlanabilir veya hassas bir bilgi toplanmadı. Tüm prosedürler kurumsal etik yönergelere uyardı.

3. Tasarım ve uygulama

3.1 Algoritma
3.1.1 Cümle (S)'deki her token için:
a. Frekans sözlüğü kullanılarak, sözcüksel olasılık Plexi hesaplanır.
b. N-gram modeline dayanarak, karakter tabanlı olasılık Pkarakteri hesaplanır
c. Her ikisinin ağırlıklı interpolasyonu:
Pbirleşimi = λlexi Plexi + λchar Pchar
3.1.2. Her token için P olasılıkkombinasyonu emisyon olasılığı olarak saklanmıştır.
3.1.3. Viterbi Algoritmasını Uygulayın:
a. Başlangıç dili olasılıkları ile başlangıç verildi.
b. Her jeton için:
i. Geçiş Psayısı geçişini hesaplayın (aynı dil devamı).
ve Panahtarı (dil değiştirme olasılığı).
ii. Dil yolunu seçin ve dizi olasılığını maksimize edin.
3.1.4. En yüksek genel olasılıkla en yüksek olasılıkla dil dizisi L'yi çıkarın.

3.2 Hesaplamalı ortam
Tüm deneylerin uygulanması Google Colab platformunda Python 3.10 kullanılarak gerçekleştirildi. Sistem, verileri işlemek ve görselleştirmek için NumPy, Pandas ve Matplotlib gibi temel Python paketlerini ve istatistiksel tahminler ve analizler yapmak için scikit-learn (v1.3) kullandı. Frekans sözlüğü entegrasyonu, karakter n-gram modelleme ve Viterbi kod çözme, özel Python betikleriyle uygulandı. Model, 10.000 cümleden oluşan bir veri seti üzerinde eğitildi ve test edildi, eğitim ve test için 70/30 bölünme sağlandı.

3.3 Dil Tanımlama
Bir cümle tokenize edildikten sonra, dil tanımlama modülü her belirteçin Kokborok mu yoksa İngilizce mi olduğuna karar verir. Tam sistem mimarisi Şekil 1'de gösterilmiştir. Bu dil ataması, hangi transkripsiyon modüllerinin uygun olduğunu belirlemek için kullanılır. Bir karakter n-gram modelinden veri ile frekans sözlüğünden veri birleştirilerek bir tokenın dili belirlenir.

Yukarıda açıklanan iki dil arasındaki önemli ortografik farklılıklar nedeniyle, yalnızca belirteçten gelen bilgileri kullanan ve bağlamsal özellikler olmadan bir sınıflandırıcı zaten iyi performans gösterir. Ancak, ilk atamadan sonra, Viterbi algoritmasını kullanan başka bir sınıflandırıcı uygulanır. Bu ikinci sınıflandırıcı, dillerarası homografların yanlış sınıflandırılmasını azaltır ve aynı dile ait kelime gruplarını destekler.

figure-protocol-1
Şekil 1: Viterbi algoritmirithm'i kullanarak kelime seviyesi kalıpları ve cezalandırıcı dil değiştirmeleri. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın. 

figure-protocol-2
Şekil 2: Kod karışımı cümleler dil tanımlama yöntemi. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Crúbadán corpus27'den sözlük ve karakter modeli için verileri topladık. Bu derstette Kokborok gibi birçok azınlık dili de dahil olmak üzere çok sayıda dil bulunmaktadır.

Crúbadán korpusundaki veri seti amacımız için yetersiz olduğundan, yeni bir Kokborok İncil veri setini test ettik. Diğer dillere kıyasla nispeten az sayıda mevcut kaynak vardır. Buna uygun olarak, bu makalenin karışık cümleleri için veriler, Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (EU), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung ve Tripura Uchoi Gençlik Derneği (TUYA) gibi Kokborok konuşan WhatsApp gruplarından toplanmıştır.

Ağustos 2021 ile Aralık 2023 arasında bu WhatsApp gruplarından Kokborok ve İngilizce olarak toplam 10.000 kod karışımı cümle toplandı. Veri setinin kaynakları ve alan dağılımı Tablo 2'de listelenmiştir.

İsimToplam kelime sayısı
Kokborok İncil kelimeleri718883
İngilizce ve Kokborok kod karışımı cümleler68789

Tablo 2: Toplam Kokborok kelimeleri.

DilToplam Jetonlar
Kokborok (trp)711509
İngilizce (eng)1767141

Tablo 3: Karakter 2-Gram Modeli.

Sl. HayırKullanılan Toplam Kod-Karışımı cümleler
110,768

Tablo 4: Toplam karma cümleler eğitimi.

Karakter modeli ve sözlük Crúbadánkorpusu 27'den alınmıştır. Bu koleksiyon, birçok azınlık dili de dahil olmak üzere çok çeşitli diller için erişilebilir olup, hedef dilde materyallerin internette aramasıyla otomatik olarak oluşturulur. Özellikle Kokborok korpusu oldukça küçüktür çünkü yaklaşım başlangıçta Kokborok için oluşturulmuştur.

Kokborok ve İngilizce korpusu da mevcut olsa da, veri setlerinin eksikliği nedeniyle, özellikle kod karıştırma ve kod çevirme açısından kasıtlı olarak kullanılmamıştır. Kokborok korpusunda birkaç İngilizce terim de vardır; Bu kelimelerin bazıları ( no, do ve o dahil) İngilizce korpusuna göre daha yaygındır.

Sözlük ve dil modeli, bireysel kelime bağımsız etiketleme görevini üstlenir. Görevimiz King ve ark.28'in görevine benzer.

Leksik (lex), karakter (ch) ve kelime etiketi olasılıkları, sözcek (ch) ve sözcük (lex) bileşenlerinin frekansları arasında doğrusal bir interpolasyon oluşturmak için kullanılır. Bunun sonucunda ortaya çıkan birleşik (tarak) olasılığı aşağıdaki denklem (1)'de gösterilmiştir; ayrıntılı enterpolasyon parametreleri Tablo 3'te sunulmaktadır. Terpolasyon stratejisi Şekil 2'de gösterilmiştir.

Pbirleşik = λlexi · Plexi + λchar · Pkarakteri (1)

Burada 0 ≤ λlexi, λchar ≤ 1; ve λlexi + λchar = 1. Sözcük temeli olmayan kelimelerin sözcüksel olasılığı son derece düşük ama sıfırdan farklı olur. Muhtemelen, her iki sözlük dilinde de bir kelime yoksa, λlexi = 1 olsa bile, sözcük olasılık yerine uygulama için karakter modeli kullanılır.

Karakter modelini geliştirme yöntemimiz, Dunning'in karakter n-gram Markov zincirine (1994) dayanmaktadır. Bu, tokenların başında ve sonunda sırasıyla n-gram sayarak başlangıç ve geçiş olasılıklarını tahmin ederek gerçekleştirilir.

Eğitilen 2 gram ve 4 gramlık modellerin performans karşılaştırması aşağıda gösterilmiştir.

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

Bir olasılığın başlangıç ve geçiş kelimeleri, dil modeli (4) kullanılarak bir kelimenin olasılığını elde etmek için çarpılabilir.

P(〈w1w2w3〉) = PBaşlangıç(〈w1w2) · P geçişi (c3|〈w1w2) · Pgeçişi(〉|w1w2w3) (4)

Kokborok dili, ön ekler ve ekler açısından oldukça zengindir ve morfolojik olarak aglütinatif bir dildir; temel kelimelere "o", "do" ve "no" gibi ekler eklenir. 2-gram, etfiks sınırlarında yerel morfolojik geçişleri etkili bir şekilde yakalamaya yardımcı olurken, 4-gram, Phailaidido, Thanlainai ve Mwchangkha gibi kök ve bileşik kelimelerde bulunan daha uzun ortografik bağımlılıkları olan Kokborok kelimelerini yakalayabilir.

Bu, büyük bir korpus için geçerlidir ve bu da birkaç veri seyrekliği sorununun olasılığını artırır. Ayrıca, karakter kombinasyonu her durumda görünmeyebilir ve bu da olasılığın sıfıra düşmesine neden olabilir. Lambda düzgünleştirme, bu tür sorunları çözmek için her görünmeyen karakter içeren n-grama sıfır olmayan olasılıkla küçük bir değer vererek kullanılır. Lambda'nın değeri 0.001 olarak belirlenmiştir.

figure-protocol-6  (5)

burada N =, farklı gözlemlerin miktarını n-gram cinsinden temsil eder.

figure-protocol-7   (6)

burada D=, n-gram cinsinden tespit edilen farkların sayısıdır. Gözlemlenmeyen bir n-gram olasılığının aynı olduğu varsayılır.

figure-protocol-8   (7)

burada C, karakter boyutunu gösterir.

Pcount, λlexi ve λchar'ın başlangıç değerleri, Kokborok ve İngilizce korpuslarının frekans analiziyle ampirik olarak belirlenmiştir. İlk olarak, λlexi'yi 0.5'e başlattık ve hem sözcüksel hem de karakter tabanlı olasılıkları ağırlıklandırdık, böylece her ikisi de ilk denemede eşit katkı sağladı. Bu başlatma seviyesi, veri setleri arasında sözlük ile karakter n-gram modelinin karşılaştırmalı rolünü tanımlamamıza olanak sağladı.

Geçiş parametresi Pcount (aynı dilde devam ediyor) manuel olarak işaretlenmiş veri setindeki tek dilli dizilerin anahtar noktalarına oranına göre 0.6 olarak ayarlandı. Bu değerler, akort sırasında yakınsamaya iyi bir başlangıç noktası sağladı. Daha sonra, Sonuçlar bölümünde detaylandırılan Matthews Korelasyon Katsayısı (MCC) maksimize etmek için tekrarlanan bir dizi denemeyle tüm parametrelerin incelenmesi gerçekleştirildi.

Bağlamsal tanımlama
Bağlamsal model, bağımsız tanımlama aşamasında zaten başlatılmış olasılıkları (Pcount ve Pswitch) kullanır ve bunları Viterbi dizisi çözme yöntemiyle iyileştirerek geçiş tutarsızlıklarını azaltır ve dil değiştirme en iyi şekilde tespit edilir.

Dil modelinin analitik çıktısı bağlama bağlıdır ve esas olarak mevcut token ile sonraki token birleştirilerek ve hem önceki hem de mevcut tokenların kullanılmasıyla elde edilir. Aynı frekans değerine sahip iki kelimenin benzer anlamlara sahip olup yanlış sınıflandırmaya yol açma ihtimali olduğundan, her iki dilde de bulunan benzerlik terimlerini bulmak için bağlama bağlı yaklaşım kullanılmıştır.

"Hayır", "do", "o", "are", "da (gün)", "go", "sa (say)", "rose", "ring" ve daha birçok kelime her iki dilde de benzerdir. Sonuç olarak, bu tür belirsizlikler ortaya çıktığında doğru dili belirlemek oldukça zor olabilir ve bazen diller yanlış sınıflandırılır.

Bu dil tanımlama sorunlarını ele almak için, ayrımcı bir Gizli Markov Modeli ve denetli makine öğrenimi kullanarak bir dizi dil modeli sunduk. Her iki dil için geçiş olasılığının aynı olduğu varsayılır. Aynı dilde Pcount için, devam eden olasılık ilan edilmesi gereken birincil parametredir. Bu sayede dilin değişme olasılığını hesaplayabiliriz.

Panahtarı = 1 − Psayısı (8)

Viterbi yolu kullanılarak bağlamsal sınıflandırma Şekil 3'te gösterilmiştir. Viterbi algoritmasının amacı, Pcount ve Pswitch'e göre token dizilerinden hangisinin en iyi diller olduğunu belirlemektir.

Viterbi algoritması bağlamsal sınıflandırmaya uygulanır. Pcount ve Pswitch , kenarları etiketlemek için kullanılır ve düğümler ilk sınıflandırıcı tarafından atanan göreceli olasılıkla etiketlenir.

Kokborok dilini kullanma olasılığı daha yüksek olduğundan, ilk sınıflandırıcı tek kullanılan ise ve bağlamsal bilgi yoksa kesikli yol seçilirdi.

Bağlam tabanlı ayarlamanın etkisi Şekil 4'te görselleştirilmiştir. Bu, bağlamsal bilgi olmadığında, "Next week o phaisidi do" ifadesindeki ikinci, üçüncü ve beşinci kelimelerin yanlış şekilde İngilizce (en) (kesikli yol) olarak tanımlanabileceğini gösterir. İngilizce için olasılıklar biraz daha yüksek olsa da, göreli değerler yakındır.

İki dil kayması cezalandırılır ve geçiş olasılıkları da dikkate alınırsa, dizinin olasılığı Viterbi algoritmasının optimal yolundan daha düşük olur. Dolayısıyla, yalnızca diğer dilden gelme olasılığı daha yüksek olan kelimeler—her ikisinde de yaygın terimler yerine—kısa dizilerde dil değişikliklerine yol açabilir.

Matthews'un Korelasyon Katsayısı, doğruluk, hatırlama ve doğruluk gibi diğer metriklerle karşılaştırıldığında, ikili sınıflandırma görevleri için önemli ölçüde daha uygundur; çünkü gerçek pozitifleri ve negatifleri ile yanlış pozitifleri ve yanlış negatifleri hesaba katmaktadır.

figure-protocol-9   (9)

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tablo 4'te, Kokborok kelimeleriyle dizilere başlangıç eğilimini hesaplayan ve aynı dilde devam etme olasılığı olan Pcount hesaplanan Ptrp için MCC puanlarını ve parametre ayar sonuçlarını gösterdik.

λ_lexPcount = 0.66Pcount = 0.70Pcount = 0.74Pcount = 0.79Pcount = 0.82Pcount = 0.86

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Önerilen model kelime düzeyinde %93,15 doğruluk gösterse de, hataların kapsamlı analizi İngilizce-Kokborok kod karışık dil tanımlamasının zorluklarını vurgulayan birkaç tekrarlayan desen ortaya koymaktadır.

Ödünç alınmış ve belirsiz kelimeler kullanmak
Hataların önemli bir kısmı, Kokborok kullanımında yaygın hale gelen ödünç alınmış İngilizce kelimelerin kullanımından kaynaklanmaktadır. No, do, o,...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların beyan edecek çıkar çatışmaları yoktur.

Teşekkürler

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yerel ana dili konuşanlara, WhatsApp gruplarına, organizasyonlara, öğrenci birliklerine ve Hindistan İncil Derneği'ne kod karışımı cümlelerin ham veri setini elde etmemize yardımcı oldukları için teşekkür etmek isteriz. Ayrıca, veri setimizi incelemek ve test etmek için bize platform sağlayan Arunachal Pradesh Ulusal Teknoloji Enstitüsü Bilgisayar Bilimleri ve Mühendisliği Bölümü'ne ve Lovely Professional Üniversitesi'ne minnettarız.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Raspberry Pi 4Raspberry Pi VakfıRPI4-MODBP-4GBDüşük kaynaklı dil işleme için kullanılır
MicroSD Kart 64GBSanDiskSDSQUAR-064G-GN6MAİşletim Sistemi ve veri seti depolama için
Güç Kaynağı 5V/3AResmi Raspberry PiSC0218Pi kartını güçlendirmek için
USB MikrofonBoyaBY-M1Dil veri toplamada ses girişi için
Monitör (HDMI)LG22MK600MTest sırasında çıkış göstergesi
Klavye & Fare KombosuLogitechMK270Arayüz kontrolü
WiFi Dongle (if Pi 3)TP-LinkTL-WN725NKablosuz veri aktarımı (eğer yerleşik WiFi yoksa)
Python IDE (Thonny)Açık Kaynak-Programlama için IDE
Lexicon Veri SetiÖzel Yapım-Kokborok-İngilizce dil çifti
N-gram Veri SetiÖzel Yapımİngilizce-Kokborok dil çifti
Kod Karışımı ve Kod DeğiştirilmişÖzel Yapım10.000 cümleSosyal Medya metinlerinden, Whatsapp raporlarından, STK'dan, KUTSAL Kitaptan vb.

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

D k Kaynakl DillerKokborok Dilingilizce KokborokKelime D zeyinde TespitKarakter N GramFrekans S zlViterbi Tekni iDenetimsiz Model
Video yakında

İlgili makaleler