Verilen protokolün amacı, İngilizce-Kokborok kod karışımı metin içinde kelime düzeyindeki dilleri doğru şekilde tanımlamak, n-gram karakter ve frekans sözlüklerini birleştiren denetimsiz bir model kullanmaktır.
Araştırma makalesi
Verilen protokolün amacı, İngilizce-Kokborok kod karışımı metin içinde kelime düzeyindeki dilleri doğru şekilde tanımlamak, n-gram karakter ve frekans sözlüklerini birleştiren denetimsiz bir model kullanmaktır.
Çok dilli metnin artan kullanımı nedeniyle otomatik kelime düzeyinde dil algılama modeline olan ihtiyaç giderek artmaktadır. Kokborok dilinde ve İngilizce'de kod değiştirilmiş ve kod karışımı cümleleri kelime seviyesinde tanımlamak için denetimsiz bir model öneriyoruz. Kod karışımı metin üzerine birçok çalışma yayımlanmıştır; bunlar arasında birkaç Hint dili de vardır. Ancak, bildiğimiz kadarıyla, çalışmamız öncü bir çabadır ve düşük kaynaklı İngilizce-Kokborok dil çiftleri için dilleri ilk olarak tanımlamaktadır. Frekans sözlüğünden veriyi karakter n-gram modelinden gelen verilerle birleştiren bir yöntem kullandık. Viterbi tekniği, kelime seviyesinde dil tanımlamasına yardımcı olmak için n-gram Markov karakter modelini frekans sözlüğü ile birleştirir. Önerilen yöntem iyi performans gösterdi; kelime düzeyinde doğruluk %93,15 oldu; bu, BiLSTM-CRF modelinin %88,5 ve kural tabanlı temel %85,3'ten daha iyiydi. Bu, sözlük ve istatistiksel metodolojinin birleştirildiğini, düşük kaynaklı dilleri büyük açıklamalı veri setlerine bağımlı olmadan işlemede etkinliğini gösterir.
Bu dijital çağda, sosyal medya platformlarında kod karıştırma ve kod değiştirme çok dilli iletişimin hızlı büyümesi, küresel iletişimin merkezi haline geliyor. Metin içeriği içinde dillerin doğru tanımlanmasına olan ihtiyaç çok önemlidir. Gözlemledikten sonra, Hintçe, Bengalce ve Telugu gibi birçok Hint dilinin dil tanımlamada zaten araştırıldığını, Manipuri, Bodo ve Assam gibi diğer Hint düşük kaynaklı dillerinin ise dil tanımlama araştırmalarında kısmen ele alındığını gördük. Ancak, hem dilsel hem de yapısal olarak farklı olan düşük kaynaklı bir dil olan Kokborok için modeller geliştirmede hâlâ önemli bir araştırma boşluğu vardır.
Manipuri, Assam ve Bodo düşük kaynaklı dillerin aksine, Kokborok yüksek düzeyde yazım varyasyonuna sahiptir ve Roma veya Bengal alfabesiyle yazılmıştır; iletişim genellikle birbirinin yerine kullanılır. Bu durum, sembol sınırlarında, transliterasyonda ve karakter düzeyinde özelliklerin çıkarılımında çok fazla belirsizlik yaratıyor; bu da belirgin zorluklar yaratıyor ve literatürde nadiren ele alınmıştır. Ayrıca, Kokborok aglütinatif bir dildir ve morfolojisi zengin ön ekler ve ekler (örneğin, -o, -do, -no) ile fonemik tonlar içerir; bu da Hint-Aryan dillerine göre geliştirilen mevcut kod karışık dil tanımlama modellerinin uygulanmasını zorlaştırır.
Bu sorunlar sosyal medya tarafından daha da güçleniyor. Kokborok konuşanlar, yalnızca kod karıştırma ve kod değiştirme için değil, aynı zamanda Kokborok cümlesindeki eksik sözcük öğelerini telafi etmek için İngilizce kelimeleri metne karıştırma eğilimindedir. Bu durum, standart olmayan yazımlara ve bağlamla ilgili kelimeler kullanımına yol açar; bu da kural temelli veya tamamen sözcük sistemlere karşı bir gerilemedir.
Bu çalışmada, bu boşluklar, frekans sözlüklerini ve karakter n-gram olasılıklarını Viterbi çözümleme çerçevesiyle birleştiren denetimsiz bir model önerilerek ele alınmıştır. Yöntem özellikle İngilizce-Kokborok çiftinin yazım, morfolojik ve bağlamsal karmaşıklıklarına odaklanmakta olup, bu düşük kaynaklı dilde kelime seviyesindeki dil bariyerlerini sistematik olarak ele alıp tespit etmeye yönelik ilk hesaplama girişimlerinden biridir.
KOKBOROK'UN ARKA PLANI
Dili simgeleyen "Kok" ve insan anlamına gelen "Borok" kelimeleri, insan anlamına gelen bileşik "Kok-borok" kelimesini oluşturur. "Kok-borok" terimi, Tripura Borok halkının ve komşu Bangladeş ile Myanmar'daki Borok halkının ve Mizoram, Manipur ve Assam sakinlerinin konuştuğu dili ifade eder. Kokborok dili, ağırlıklı olarak Tripura'da konuşulur ve hem Roma hem de Bengal alfabeleriyle yazılır. Kokborok konuşanların çoğu tarafından Bengal alfabesine göre Roma alfabesi tercih edilir. Aslında, Tibeto-Burman olarak bilinen Çin-Tibet dilsel alt grubu, Kokborok dilinin kökenli yeridir. Kokborok dili ile Bodo dili ince bir şekilde benzerdir. Kokborok dilinin 36 çeşidi, hem Bodo hem de Kachari dilleriyle ince benzerlikler taşır.
Koloma, orijinal Kokborok yazısı olarak biliniyordu. Hindistan'daki tek eyalet olan Tripura, 15 Ekim 1949'da Hint Birliği'ne katılmadan önce 184 kişi tarafından kontrol ediliyordu. Rajratnakar kitabında bulunan Koloma yazısı, tarihsel anlatıları yazmak için kullanılan yazıdır. Daha sonra, on dördüncü yüzyılda, Sukreswar ve Vaneswar adında iki Brahman dili Sanskritçeye, ardından tekrar Bengal alfabesine çevirdi. Kokborok dilinde fiillerden üretilen kök homofoni, fonemik ton, fiil morfolojisi, kelime sırası ve fiil türevi ekleri vardır.
Zaman geçtikçe Kokborok, İngilizce, Arapça, Bengalce, Farsça gibi dillerle karşılaşmıştır. Kokborok dilinde farklı karmaşık aglütinatif yapılar bulunabilir. Tripura'da Kokborok'u ana dil olarak konuşan kişiler, dilin henüz yaygın olarak benimsenen bir alfabesi olmadığı için bilgiye kolayca erişemiyor, ancak bu üzerinde çalışmalar devam ediyor.
Tripura'da Kokborok'un birkaç lehçesi konuşulmaktadır. Tripura'da çeşitli lehçeler konuşulur; bunlar arasında Tripura/Tripuri, Debbarma, Reang, Jamatia, Uchai, Noatia, Lusai, Kukis, Chaimal, Halam, Santal, Lepcha, Chakma, Khasia, Orang, Mog ve Garos bulunur. 2011 Nüfus Sayımı raporuna göre, Hindistan'da 1.011.294 Kokborok konuşan ve komşu ülke Bangladeş'te 400.000'den fazla kişi bulunmaktadır.
LITERATÜR TARAMASI
Yazarlar, Hintçe, Bengalce ve İngilizce kodlarının karıştırılmış yeni Facebook paylaşımları veri seti kullanılarak otomatik dil tanımlama üzerine devam eden araştırmalarını anlatıyor. Kelime düzeyinde dil tanımlama için sözlük tabanlı yaklaşımlar ve denetimli sınıflandırma gibi çeşitli tekniklerle deneyler yaparlar ve bu ortamlarda dil tanımlaması için bağlamsal ipuçlarının dikkate alınmasının önemini vurgularlar.
Makale, sosyal medya platformlarında nefret söylemini tanımlamak amacıyla açıklamalı tweetlerden oluşan bir veri setini, sözlük tabanlı, karakter düzeyi ve kelime düzeyindeki teknikler kullanan Hintçe-İngilizce kod karışımıylasunmaktadır 1. Makalede N-gramlara dayalı hata toleranslı metin kategorize etme yöntemi sunulmaktadır. İlk olarak, sistem, çeşitli kategorileri yansıtan haber grubu materyali veya ifadeler gibi eğitim seti verileri kullanılarak profilleri hesaplamak için kullanılır. Bundan sonra, sistem kategorize edilmesi gereken belirli belge için bir profil oluşturur. Son olarak, algoritma her kategori profili ile belgenin profili arasındaki mesafe ölçüsünü hesaplar. Profili belgenin profiline en yakın olan kategori sistem2 tarafından seçilir.
Sürekli Kelime Torbası ve Skip-Gram modelleri dahil olmak üzere birkaç kelime göme tekniği karşılaştırıldı ve özellik vektörleri oluşturuldu. Adaboost, Random Forest, K-Nearest Neighbors, Gauss Naive Bayes, Support Vector Machine ve Logistic Regression hepsi iyi çapraz doğrulamapuanları verdi 3. Önceki yaklaşımların özeti Tablo 1'de sunulmaktadır.
Sözlük tabanlı sınıflandırıcılar kullanarak, çalışmada değerlendirilen üç dil çiftinde mevcut sınıflandırıcıları geride bırakıyor: İspanyolca-İngilizce, Felemenkçe-İngilizce ve Almanca-Türkçe, sosyal medya verisetleriyle 4. Çalışmanın yaklaşımı, test performansında yakınsamama ve tutarlılık açısından model dayanıklılığının arttığını ve kod karışımı metinlerdeki mevcut duygu analizi tekniklerini yüzde 3,31 doğruluk oranında geridebıraktığını gösteriyor 5.
Dunning'in dil istatistiksel tanımlaması ilk olarak New Mexico State Üniversitesi Bilgisayar Araştırma Laboratuvarı tarafından TeknikRapor 6'da sunulmuştur. Bu makale, İngilizce-Telugu kod karışık veri çiftine dayanarak Gizli Markov Modeli, Rastgele Orman Sınıflandırıcı Yöntemi, Koşullu Rastgele Alan ve Naif Bayes Sınıflandırıcısı kullanılarak farklı denetimli öğrenme türlerinianaliz etmektedir 7. Makale, İngilizce, Bodo ve Assam gibi Hint dillerine odaklanmakta olup, kod karışımı sosyal medya materyallerinde dilleri tanıma için yeni bir yaklaşımı tartışmaktadır. Araştırmacılar, derin öğrenme modelinde İki Yönlü Uzun Kısa Süreli Hafızakullanıyorlar 8.
Bu makalede, Gujarati diline ilişkin geniş bir veri seti kullandılar - burada Gujarati dilinin İngilizce ve Hintçe ile karıştığı. Çeşitli makine öğrenimi sınıflandırıcıları kullandılar. Bunlar arasında, Destek Vektör Sınıflandırıcısı en iyi doğruluğu yüzde 92 doğruluk9 verdi.
Ayrı sınıflandırma aşamasında, kod değiştirme ile Hollandaca-İngilizce tweetlerin ödünç alınması arasındaki ayrımı yapmak için dilbilimsel bir çerçeve kullanılır. Kural tabanlı LID, Destek Vektör Makineleri ve Karar Ağacı Sınıflandırıcıları kullanarak, DTC (mikro F1 = .95) ve kural tabanlı LID sisteminin (mikro F1 = .95) eniyi 10 performansı gösterdiğini öğrenirler.
Modellerinin performansı, kod anahtarlı agresiflik algılama TRAC-1 veri seti, Hinglish Saldırgan Tweet veri seti ve mizah sınıflandırma veriseti 11 kullanılarak değerlendirildi. Yetişkin sözcük ediniminde okuma yoluyla tutumu artırmak için, kod karışımı metin12 üretmek için L2 metodolojisi olarak olasılıksal bir yaklaşım önerildi. Bir sözlük modülü dahil edilir ve kelime düzeyinde kod karıştırmayı kontrol etmek için çeşitli denetimli sınıflandırıcılarda testler yapmak için kullanılır13.
Kod değiştirme kalıplarını analiz etmek için çeşitli metrikler kullandılar ve hem İspanyolca-İngilizce hem de Hintçe-İngilizce için sinir ağı modellerinin Koşullu Rastgele Alanlar (CRF) modelinden sırasıyla 2,5 ve 3,5 puan farkla daha kötü performans gösterdiğini, yani14 puan fark ettiğini keşfettiler.
İki dilli bir sözlük ve İngilizce metin kullanarak girdi, yöntem sözcek mantıları üzerinde bir faktör grafiği oluşturur ve belirli bir "öğrenilebilirlik" parametresini optimize eden kod değiştirilmiş bir metin üretir. Bu makalede, Hintçe-İngilizce kod değiştirmeli veri çiftlerine dayalı CanVEC araç kutusunun kavramlarını daha iyi anlamaya çalışıyorlar. Başarıyla yüzde 87,99 doğrulukoranı 15,16 F1 puanı elde ettiler.
Yazarlar önce Gujarati ile İngilizce17 arasındaki kod karıştırmasını inceler; her tokenın dilini tanımlamak, yazımını normalleştirmek ve bölümleri ana alfabelerine dönüştürmek için üç aşamalı bir boru hattı uygularlar. Daha sonra odak noktalarını Hintçe-İngilizce korpus18'e kaydırıyorlar ve burada iki dilli cümle yapılarına özel olarak ayarlanmış yeni duygu algılama algoritmaları tanıtıyorlar. Kontrollü deneyleri desteklemek için, tek dilli verilerde atlama gram modellerini eğitip çıktıları karıştırarak sentetik kod karışımı metinüretirler 19.
Sonra, Konkani-İngilizce sosyal medya veriseti 20, kural bazlı, kelime düzeyinde bir tanımlama yöntemiyle işlenir ve manuel olarak açıklamalı eğitim verileri olmadan sağlam performans eldeedilir 21. Kapsamı genişleten bir çalışma, Facebook22 gibi platformlardan İngilizce, Hintçe, Bengalce ve Assamça içeren geniş bir transliterasyon koleksiyonunu kullanarak çeşitli kelime seviyesinde etiketleme tekniklerini değerlendiriyor. Bunun üzerine inşa edilen başka birframework, 23 diller arasında dinamik olarak geçiş yaparak gömülü veya ödünç alınmış ifadeleri yüksek hassasiyetle tespit eder. Tarım alanında, Pencapça-İngilizce yorumlar birkaç model kullanılarak sınıflandırılır—bunlar arasında, en iyi doğruluğu sağlayan n-gramsınıflandırıcı 24. Sinhala-İngilizce CMST için topluluk öğrenenler (Random Forest, SVM, Naive Bayes, Decision Tree, Logistic Regression) karşılaştırılır; Random Forest en iyiperformans gösteren 25 kişi olurken, karakter düzeyinde gömüler SVM'lerle birlikte Tamil-İngilizce ve Malayalam-İngilizceçiftlerinde güçlü sonuçlar elde eder 26. Son olarak, CrúbadánProjesi 27, web'de tarama yoluyla yetersiz kaynak olan dil korpusları oluşturmak için büyük ölçekli bir çaba olarak sunulmakta ve gelecekteki kod karıştırma araştırmalarının temelini oluşturuyor.
| Veri seti | Önemli Sonuçlar | Doğruluk/F1-Puan/Doğruluk/Davranış/Hatırlama/Hafıza |
| Facebook paylaşımlarından alınan Hintçe–Bengalce–İngilizce veri seti | Kelime düzeyinde sosyal medya metininde Dil Tanımlama zorluklarını vurguladı | 89.30% |
| Haber makaleleri, belgeler | Dil tanımlaması için N-gramları kullanılarak etkin şekilde gerçekleştirilir | 0.99% |
| Hindistan kod karışık veri setleri | Kelime düzeyinde Dil Tanımlamasında iyi doğruluğu göstermek | Bildirilmedi (NR) |
| Wikipedia tabanlı veri setleri | Sağlam token düzeyinde kod anahtarlama tespiti | Bildirilmedi (NR) |
| Hintçe–İngilizce tweetler | Hintçe ve İngilizce Kod Karışımı Duygusal Sınıflandırmada Performans Geliştirilmiş | 0.78% |
| Çok dilli korpuslar | Temel Dil tanımlama çerçevesi | 78.00% |
| Code_mixed İngilizce–Telugu verileri | CRF en iyi performansı elde etti | 89.30% |
| İngilizce–Bodo kod karışımı metin | Yüksek kelime doğruluğu elde edildi | 92.00% |
| Kod Karışımı Gujarati–Hintçe yazı yazıları | Cümle düzeyinde dil tanımlama doğruluğu %92 ≈92'dir | 92.00% |
| Hollandaca–İngilizce tweetler | DTC ve kural tabanlı modeller F1 ≈0.95'e ulaştı | 95.00% |
| Kod anahtarlamalı veri setleri | Modeller arasında rekabetçi performans | Bildirilmedi (NR) |
| Sentetik Kod-Karışımı metin | Geliştirilmiş sözcük öğrenme | Bildirilmedi (NR) |
| İngilizce–Kannada Kod Karışımı metin | Etkili otomatik LID | Bildirilmedi (NR) |
| TRAC-1, Hinglish veri setleri | CRF, Sinir Ağı modellerinde daha iyi performans gösterdi | 91.00% |
| Çok dilli çevrimiçi veriler | Doğru kelime düzeyinde Lnaguage tanımlaması | 88.00% |
| Hintçe–İngilizce sosyal medya | Hintçe-İngilizce dil tanımlamasında yüksek hassasiyet | 0.93% |
| İngilizce–Gujarati Kodu - Karışık | Etkili iki dilli işleme | |
| Sosyal medya Kod-Karışımı veri setleri | Geliştirilmiş duygu algılama | 0.90% |
| Kod Karışımı Sentetik Veri | Güçlü gömülü temsiller | Bildirilmedi (NR) |
| Konkani–İngilizce Kod Karışımı Sosyal Medya Metni | Açıklamasız sağlam performans | 0.89% |
| Twitter'dan Code-Mixed veri seti | Anahtarların daha iyi algılanması | 90.20% |
| Assam–Bengalce–Hintçe–İngilizce | Doğru çok dilli dil tanımlaması | 91.00% |
| Sosyal medya Kod-Karışımı metin | F1 puanı ≈0.95 | 0.95% |
| İngilizce–Pencapça Kod-Karışımı veriler | N-gram modeli en iyi performans gösterdi | 0.88% |
| Sinhala–İngilizce Kod-Karışımı veriler | RF en iyi doğruluğu sağladı | 0.92% |
| Facebook Kod Karışımı Yorumlar | Geliştirilmiş kelime seviyesi LID | 0.93% |
| Crúbadán Corpus | Düşük kaynaklı dil araştırmalarını etkinleştirdi | Bildirilmedi (NR) |
| Kod-Mixed veri setleri | Kelime düzeyindeki Dil Tanımlamasında gösterilen iyi performans | 0.94% |
Tablo 1: Kod-Karışık Dil Edebiyatı Özeti.
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
İngilizce ve Kokborok dilinde kod karıştırılmış ve kod değiştirilmiş metinler, yerel sohbetlerden ve sosyal medya platformlarındaki halka açık gönderilerden manuel olarak toplanmıştır. Kişisel olarak tanımlanabilir veya hassas bir bilgi toplanmadı. Tüm prosedürler kurumsal etik yönergelere uyardı.
3. Tasarım ve uygulama
3.1 Algoritma
3.1.1 Cümle (S)'deki her token için:
a. Frekans sözlüğü kullanılarak, sözcüksel olasılık Plexi hesaplanır.
b. N-gram modeline dayanarak, karakter tabanlı olasılık Pkarakteri hesaplanır
c. Her ikisinin ağırlıklı interpolasyonu:
Pbirleşimi = λlexi Plexi + λchar Pchar
3.1.2. Her token için P olasılıkkombinasyonu emisyon olasılığı olarak saklanmıştır.
3.1.3. Viterbi Algoritmasını Uygulayın:
a. Başlangıç dili olasılıkları ile başlangıç verildi.
b. Her jeton için:
i. Geçiş Psayısı geçişini hesaplayın (aynı dil devamı).
ve Panahtarı (dil değiştirme olasılığı).
ii. Dil yolunu seçin ve dizi olasılığını maksimize edin.
3.1.4. En yüksek genel olasılıkla en yüksek olasılıkla dil dizisi L'yi çıkarın.
3.2 Hesaplamalı ortam
Tüm deneylerin uygulanması Google Colab platformunda Python 3.10 kullanılarak gerçekleştirildi. Sistem, verileri işlemek ve görselleştirmek için NumPy, Pandas ve Matplotlib gibi temel Python paketlerini ve istatistiksel tahminler ve analizler yapmak için scikit-learn (v1.3) kullandı. Frekans sözlüğü entegrasyonu, karakter n-gram modelleme ve Viterbi kod çözme, özel Python betikleriyle uygulandı. Model, 10.000 cümleden oluşan bir veri seti üzerinde eğitildi ve test edildi, eğitim ve test için 70/30 bölünme sağlandı.
3.3 Dil Tanımlama
Bir cümle tokenize edildikten sonra, dil tanımlama modülü her belirteçin Kokborok mu yoksa İngilizce mi olduğuna karar verir. Tam sistem mimarisi Şekil 1'de gösterilmiştir. Bu dil ataması, hangi transkripsiyon modüllerinin uygun olduğunu belirlemek için kullanılır. Bir karakter n-gram modelinden veri ile frekans sözlüğünden veri birleştirilerek bir tokenın dili belirlenir.
Yukarıda açıklanan iki dil arasındaki önemli ortografik farklılıklar nedeniyle, yalnızca belirteçten gelen bilgileri kullanan ve bağlamsal özellikler olmadan bir sınıflandırıcı zaten iyi performans gösterir. Ancak, ilk atamadan sonra, Viterbi algoritmasını kullanan başka bir sınıflandırıcı uygulanır. Bu ikinci sınıflandırıcı, dillerarası homografların yanlış sınıflandırılmasını azaltır ve aynı dile ait kelime gruplarını destekler.

Şekil 1: Viterbi algoritmirithm'i kullanarak kelime seviyesi kalıpları ve cezalandırıcı dil değiştirmeleri. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.

Şekil 2: Kod karışımı cümleler dil tanımlama yöntemi. Bu şeklin daha büyük bir versiyonunu görmek için lütfen buraya tıklayın.
Crúbadán corpus27'den sözlük ve karakter modeli için verileri topladık. Bu derstette Kokborok gibi birçok azınlık dili de dahil olmak üzere çok sayıda dil bulunmaktadır.
Crúbadán korpusundaki veri seti amacımız için yetersiz olduğundan, yeni bir Kokborok İncil veri setini test ettik. Diğer dillere kıyasla nispeten az sayıda mevcut kaynak vardır. Buna uygun olarak, bu makalenin karışık cümleleri için veriler, Platinum Jubilee, Population Group, Restoration International Group, Khumulwng, Depachara Baptist Society, United Tiprasa Forum (UTF), Depachara Youth Fellowship, Krishna Nagar (EU), Uchoi Christian Fellowship (UCF), Tipra Kwsrang Bodol, Tribal Engineering Society, National Institute of Technology Students Borok, Information Yarung ve Tripura Uchoi Gençlik Derneği (TUYA) gibi Kokborok konuşan WhatsApp gruplarından toplanmıştır.
Ağustos 2021 ile Aralık 2023 arasında bu WhatsApp gruplarından Kokborok ve İngilizce olarak toplam 10.000 kod karışımı cümle toplandı. Veri setinin kaynakları ve alan dağılımı Tablo 2'de listelenmiştir.
| İsim | Toplam kelime sayısı |
| Kokborok İncil kelimeleri | 718883 |
| İngilizce ve Kokborok kod karışımı cümleler | 68789 |
Tablo 2: Toplam Kokborok kelimeleri.
| Dil | Toplam Jetonlar |
| Kokborok (trp) | 711509 |
| İngilizce (eng) | 1767141 |
Tablo 3: Karakter 2-Gram Modeli.
| Sl. Hayır | Kullanılan Toplam Kod-Karışımı cümleler |
| 1 | 10,768 |
Tablo 4: Toplam karma cümleler eğitimi.
Karakter modeli ve sözlük Crúbadánkorpusu 27'den alınmıştır. Bu koleksiyon, birçok azınlık dili de dahil olmak üzere çok çeşitli diller için erişilebilir olup, hedef dilde materyallerin internette aramasıyla otomatik olarak oluşturulur. Özellikle Kokborok korpusu oldukça küçüktür çünkü yaklaşım başlangıçta Kokborok için oluşturulmuştur.
Kokborok ve İngilizce korpusu da mevcut olsa da, veri setlerinin eksikliği nedeniyle, özellikle kod karıştırma ve kod çevirme açısından kasıtlı olarak kullanılmamıştır. Kokborok korpusunda birkaç İngilizce terim de vardır; Bu kelimelerin bazıları ( no, do ve o dahil) İngilizce korpusuna göre daha yaygındır.
Sözlük ve dil modeli, bireysel kelime bağımsız etiketleme görevini üstlenir. Görevimiz King ve ark.28'in görevine benzer.
Leksik (lex), karakter (ch) ve kelime etiketi olasılıkları, sözcek (ch) ve sözcük (lex) bileşenlerinin frekansları arasında doğrusal bir interpolasyon oluşturmak için kullanılır. Bunun sonucunda ortaya çıkan birleşik (tarak) olasılığı aşağıdaki denklem (1)'de gösterilmiştir; ayrıntılı enterpolasyon parametreleri Tablo 3'te sunulmaktadır. Terpolasyon stratejisi Şekil 2'de gösterilmiştir.
Pbirleşik = λlexi · Plexi + λchar · Pkarakteri (1)
Burada 0 ≤ λlexi, λchar ≤ 1; ve λlexi + λchar = 1. Sözcük temeli olmayan kelimelerin sözcüksel olasılığı son derece düşük ama sıfırdan farklı olur. Muhtemelen, her iki sözlük dilinde de bir kelime yoksa, λlexi = 1 olsa bile, sözcük olasılık yerine uygulama için karakter modeli kullanılır.
Karakter modelini geliştirme yöntemimiz, Dunning'in karakter n-gram Markov zincirine (1994) dayanmaktadır. Bu, tokenların başında ve sonunda sırasıyla n-gram sayarak başlangıç ve geçiş olasılıklarını tahmin ederek gerçekleştirilir.
Eğitilen 2 gram ve 4 gramlık modellerin performans karşılaştırması aşağıda gösterilmiştir.
(2)
·
(3)
Bir olasılığın başlangıç ve geçiş kelimeleri, dil modeli (4) kullanılarak bir kelimenin olasılığını elde etmek için çarpılabilir.
P(〈w1w2w3〉) = PBaşlangıç(〈w1w2) · P geçişi (c3|〈w1w2) · Pgeçişi(〉|w1w2w3) (4)
Kokborok dili, ön ekler ve ekler açısından oldukça zengindir ve morfolojik olarak aglütinatif bir dildir; temel kelimelere "o", "do" ve "no" gibi ekler eklenir. 2-gram, etfiks sınırlarında yerel morfolojik geçişleri etkili bir şekilde yakalamaya yardımcı olurken, 4-gram, Phailaidido, Thanlainai ve Mwchangkha gibi kök ve bileşik kelimelerde bulunan daha uzun ortografik bağımlılıkları olan Kokborok kelimelerini yakalayabilir.
Bu, büyük bir korpus için geçerlidir ve bu da birkaç veri seyrekliği sorununun olasılığını artırır. Ayrıca, karakter kombinasyonu her durumda görünmeyebilir ve bu da olasılığın sıfıra düşmesine neden olabilir. Lambda düzgünleştirme, bu tür sorunları çözmek için her görünmeyen karakter içeren n-grama sıfır olmayan olasılıkla küçük bir değer vererek kullanılır. Lambda'nın değeri 0.001 olarak belirlenmiştir.
(5)
burada N =, farklı gözlemlerin miktarını n-gram cinsinden temsil eder.
(6)
burada D=, n-gram cinsinden tespit edilen farkların sayısıdır. Gözlemlenmeyen bir n-gram olasılığının aynı olduğu varsayılır.
(7)
burada C, karakter boyutunu gösterir.
Pcount, λlexi ve λchar'ın başlangıç değerleri, Kokborok ve İngilizce korpuslarının frekans analiziyle ampirik olarak belirlenmiştir. İlk olarak, λlexi'yi 0.5'e başlattık ve hem sözcüksel hem de karakter tabanlı olasılıkları ağırlıklandırdık, böylece her ikisi de ilk denemede eşit katkı sağladı. Bu başlatma seviyesi, veri setleri arasında sözlük ile karakter n-gram modelinin karşılaştırmalı rolünü tanımlamamıza olanak sağladı.
Geçiş parametresi Pcount (aynı dilde devam ediyor) manuel olarak işaretlenmiş veri setindeki tek dilli dizilerin anahtar noktalarına oranına göre 0.6 olarak ayarlandı. Bu değerler, akort sırasında yakınsamaya iyi bir başlangıç noktası sağladı. Daha sonra, Sonuçlar bölümünde detaylandırılan Matthews Korelasyon Katsayısı (MCC) maksimize etmek için tekrarlanan bir dizi denemeyle tüm parametrelerin incelenmesi gerçekleştirildi.
Bağlamsal tanımlama
Bağlamsal model, bağımsız tanımlama aşamasında zaten başlatılmış olasılıkları (Pcount ve Pswitch) kullanır ve bunları Viterbi dizisi çözme yöntemiyle iyileştirerek geçiş tutarsızlıklarını azaltır ve dil değiştirme en iyi şekilde tespit edilir.
Dil modelinin analitik çıktısı bağlama bağlıdır ve esas olarak mevcut token ile sonraki token birleştirilerek ve hem önceki hem de mevcut tokenların kullanılmasıyla elde edilir. Aynı frekans değerine sahip iki kelimenin benzer anlamlara sahip olup yanlış sınıflandırmaya yol açma ihtimali olduğundan, her iki dilde de bulunan benzerlik terimlerini bulmak için bağlama bağlı yaklaşım kullanılmıştır.
"Hayır", "do", "o", "are", "da (gün)", "go", "sa (say)", "rose", "ring" ve daha birçok kelime her iki dilde de benzerdir. Sonuç olarak, bu tür belirsizlikler ortaya çıktığında doğru dili belirlemek oldukça zor olabilir ve bazen diller yanlış sınıflandırılır.
Bu dil tanımlama sorunlarını ele almak için, ayrımcı bir Gizli Markov Modeli ve denetli makine öğrenimi kullanarak bir dizi dil modeli sunduk. Her iki dil için geçiş olasılığının aynı olduğu varsayılır. Aynı dilde Pcount için, devam eden olasılık ilan edilmesi gereken birincil parametredir. Bu sayede dilin değişme olasılığını hesaplayabiliriz.
Panahtarı = 1 − Psayısı (8)
Viterbi yolu kullanılarak bağlamsal sınıflandırma Şekil 3'te gösterilmiştir. Viterbi algoritmasının amacı, Pcount ve Pswitch'e göre token dizilerinden hangisinin en iyi diller olduğunu belirlemektir.
Viterbi algoritması bağlamsal sınıflandırmaya uygulanır. Pcount ve Pswitch , kenarları etiketlemek için kullanılır ve düğümler ilk sınıflandırıcı tarafından atanan göreceli olasılıkla etiketlenir.
Kokborok dilini kullanma olasılığı daha yüksek olduğundan, ilk sınıflandırıcı tek kullanılan ise ve bağlamsal bilgi yoksa kesikli yol seçilirdi.
Bağlam tabanlı ayarlamanın etkisi Şekil 4'te görselleştirilmiştir. Bu, bağlamsal bilgi olmadığında, "Next week o phaisidi do" ifadesindeki ikinci, üçüncü ve beşinci kelimelerin yanlış şekilde İngilizce (en) (kesikli yol) olarak tanımlanabileceğini gösterir. İngilizce için olasılıklar biraz daha yüksek olsa da, göreli değerler yakındır.
İki dil kayması cezalandırılır ve geçiş olasılıkları da dikkate alınırsa, dizinin olasılığı Viterbi algoritmasının optimal yolundan daha düşük olur. Dolayısıyla, yalnızca diğer dilden gelme olasılığı daha yüksek olan kelimeler—her ikisinde de yaygın terimler yerine—kısa dizilerde dil değişikliklerine yol açabilir.
Matthews'un Korelasyon Katsayısı, doğruluk, hatırlama ve doğruluk gibi diğer metriklerle karşılaştırıldığında, ikili sınıflandırma görevleri için önemli ölçüde daha uygundur; çünkü gerçek pozitifleri ve negatifleri ile yanlış pozitifleri ve yanlış negatifleri hesaba katmaktadır.
(9)
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
Tablo 4'te, Kokborok kelimeleriyle dizilere başlangıç eğilimini hesaplayan ve aynı dilde devam etme olasılığı olan Pcount hesaplanan Ptrp için MCC puanlarını ve parametre ayar sonuçlarını gösterdik.
| λ_lex | Pcount = 0.66 | Pcount = 0.70 | Pcount = 0.74 | Pcount = 0.79 | Pcount = 0.82 | Pcount = 0.86 |
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
Önerilen model kelime düzeyinde %93,15 doğruluk gösterse de, hataların kapsamlı analizi İngilizce-Kokborok kod karışık dil tanımlamasının zorluklarını vurgulayan birkaç tekrarlayan desen ortaya koymaktadır.
Ödünç alınmış ve belirsiz kelimeler kullanmak
Hataların önemli bir kısmı, Kokborok kullanımında yaygın hale gelen ödünç alınmış İngilizce kelimelerin kullanımından kaynaklanmaktadır. No, do, o,...
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
Yazarların beyan edecek çıkar çatışmaları yoktur.
Yerel ana dili konuşanlara, WhatsApp gruplarına, organizasyonlara, öğrenci birliklerine ve Hindistan İncil Derneği'ne kod karışımı cümlelerin ham veri setini elde etmemize yardımcı oldukları için teşekkür etmek isteriz. Ayrıca, veri setimizi incelemek ve test etmek için bize platform sağlayan Arunachal Pradesh Ulusal Teknoloji Enstitüsü Bilgisayar Bilimleri ve Mühendisliği Bölümü'ne ve Lovely Professional Üniversitesi'ne minnettarız.
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
| Ad | Şirket | Katalog numarası | Yorumlar |
|---|---|---|---|
| Raspberry Pi 4 | Raspberry Pi Vakfı | RPI4-MODBP-4GB | Düşük kaynaklı dil işleme için kullanılır |
| MicroSD Kart 64GB | SanDisk | SDSQUAR-064G-GN6MA | İşletim Sistemi ve veri seti depolama için |
| Güç Kaynağı 5V/3A | Resmi Raspberry Pi | SC0218 | Pi kartını güçlendirmek için |
| USB Mikrofon | Boya | BY-M1 | Dil veri toplamada ses girişi için |
| Monitör (HDMI) | LG | 22MK600M | Test sırasında çıkış göstergesi |
| Klavye & Fare Kombosu | Logitech | MK270 | Arayüz kontrolü |
| WiFi Dongle (if Pi 3) | TP-Link | TL-WN725N | Kablosuz veri aktarımı (eğer yerleşik WiFi yoksa) |
| Python IDE (Thonny) | Açık Kaynak | - | Programlama için IDE |
| Lexicon Veri Seti | Özel Yapım | - | Kokborok-İngilizce dil çifti |
| N-gram Veri Seti | Özel Yapım | İngilizce-Kokborok dil çifti | |
| Kod Karışımı ve Kod Değiştirilmiş | Özel Yapım | 10.000 cümle | Sosyal Medya metinlerinden, Whatsapp raporlarından, STK'dan, KUTSAL Kitaptan vb. |
Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.
Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste
İzin iste