مقالة بحثية

تحديد اللغة منخفضة الموارد للجمل الإنجليزية والمختلطة بشفرة كوكبوروك

DOI:

10.3791/69130

يناير 2, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

الهدف من البروتوكول المعطى هو تحديد اللغات على مستوى الكلمات بشكل صحيح ضمن النص المختلط بين الشيفرة الإنجليزية وكوكبوروك باستخدام نموذج غير خاضع للإشراف يجمع بين الأحرف n-gram وقواميس التردد.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

هناك حاجة متزايدة لنموذج للكشف التلقائي عن اللغة على مستوى الكلمات بسبب الاستخدام المتزايد للنصوص متعددة اللغات. لتحديد الجمل المتبادلة بالشفرة والمختلطة بالشفرة بلغة كوكبورك والإنجليزية على مستوى الكلمات، نقترح نموذجا غير خاضع للإشراف. تم نشر العديد من الدراسات حول النصوص المختلطة بالشيفرة، بما في ذلك لعدة لغات هندية. ومع ذلك، حسب علمنا، يمثل عملنا جهدا رائدا، حيث كنا أول من حدد لغات أزواج اللغات الإنجليزية والكوكبوروك منخفضة الموارد. لقد استخدمنا طريقة تدمج بيانات من قاموس التردد مع بيانات من نموذج حرف n-غرام. تجمع تقنية فيتيربي بين نموذج ماركوف بحرف n-gram مع معجم تردد للمساعدة في تحديد اللغة بدقة على مستوى الكلمة. حققت الطريقة المقترحة أداء جيدا، بدقة على مستوى الكلمات بلغت 93.15٪، وهو أفضل من نموذج BiLSTM-CRF البالغ 88.5٪ وخط الأساس القائم على القواعد بنسبة 85.3٪. هذا يوضح فعالية الجمع بين المعجم والمنهجية الإحصائية في التعامل مع اللغات منخفضة الموارد دون الاعتماد على مجموعات بيانات مشروحة ضخمة.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

في هذا العصر الرقمي، أصبح النمو السريع لخلط الشفرات وتبادل الشفرات متعدد اللغات على منصات التواصل الاجتماعي محور التواصل العالمي. الحاجة إلى تحديد دقيق للغات ضمن المحتوى النصي أمر بالغ الأهمية. بعد الملاحظة، وجدنا أن العديد من اللغات الهندية مثل الهندية والبنغالية والتيلجو قد تم استكشافها بالفعل في تحديد اللغة، كما أن لغات هندية أخرى ذات موارد منخفضة مثل مانيبوري، بودو، وأسامية تم تناولها جزئيا في أبحاث تحديد اللغة. ومع ذلك، لا تزال هناك فجوة بحثية كبيرة في تطوير نماذج لغة كوكبوروك، وهي لغة منخفضة الموارد وتتميز لغويا وبنيويا على حد سواء.

على عكس لغات مانيبوري والأسامية والبودو منخفضة الموارد، تتمتع كوكبوروك بمستوى عال من التنوع الإملائي وتكتب بالخط الروماني أو البنغالي، وغالبا ما يكون بالتبادل في التواصل. هذا يخلق الكثير من الغموض في حدود الرموز والترجمة الصوتية واستخراج الميزات على مستوى الشخصية، مما يطرح تحديات واضحة ونادرا ما تم التفكير فيه في الأدبيات. علاوة على ذلك، كوكبورك هي لغة التصاق، وتشمل مورفولوجيتها بادئات غنية ولواحق (مثل -o، -do، -no) ونغمات صوتية، مما يجعل من الصعب تطبيق نماذج التعريف اللغوية المختلطة بالشيفرة التي تم تطويرها بالنسبة للغات الهندوآرية.

وتزداد هذه القضايا سوءا بفضل وسائل التواصل الاجتماعي. غالبا ما يميل متحدثي كوكبوروك إلى خلط الكلمات الإنجليزية في النص، ليس فقط لخلط الرموز وتبديل الشيفرات، بل أيضا لتعويض نقص العناصر المعجمية في جملة كوكبوروك. يؤدي ذلك إلى استخدام الكلمات غير القياسية واستخدام السياق، وهو انتكاسة للأنظمة القائمة على القواعد أو المعجمية البحتة.

في هذه الدراسة، يتم معالجة هذه الفجوات من خلال اقتراح نموذج غير مراقب يجمع بين قواميس التردد واحتمالات الأحرف n-gram مع إطار فك تشفير Viterbi. تركز الطريقة بشكل خاص على التعقيدات الإملائية والصرفية والسياقية لزوج الإنجليزية-كوكبوروك، ولذلك فهي واحدة من أولى المحاولات الحسابية لمعالجة واكتشاف حواجز اللغة على مستوى الكلمات بشكل منهجي في هذه اللغة منخفضة الموارد.

خلفية كوكبوروك
كلمتا "كوك" التي تعني اللغة، و"بوروك" التي تعني الإنسان تتحد لتشكيل الكلمة المركبة "كوك-بوروك" التي تعني الإنسان. مصطلح "كوك-بورك" يشير إلى اللغة التي يتحدث بها شعب البوروك في تريبورا، وكذلك أولئك في الدول المجاورة بنغلاديش وميانمار، وسكان ميزورام ومانيبور وآسام. لغة كوكبوروك، التي تتحدث بشكل رئيسي في تريبورا، مكتوبة بالخط الروماني والبنغالي. يفضل الخط الروماني على الخط البنغالي من قبل غالبية متحدثي الكوكبوروك. في الواقع، المجموعة الفرعية اللغوية الصينية-التبتية المعروفة باسم التبتية-البورمية هي مصدر نشأة لغة كوكبوروك. لغة كوكبورك ولغة بودو متشابهتان بشكل دقيق. تحمل الأنواع ال 36 من لغة كوكبوروك تشابهات دقيقة مع كل من لغتي بودو وكاشاري.

كان كولوما معروفا بأنه الخط الأصلي لكوكبوروك. كانت الولاية الوحيدة في الهند، تريبورا، تحت سيطرة 184 شخصا قبل أن تتم توحيدها في الاتحاد الهندي في 15 أكتوبر 1949. أما خط كولوما الموجود في كتاب راجراتناكار فهو الذي استخدم لكتابة السرديات التاريخية. لاحقا، في القرن الرابع عشر، قام اثنان من البراهمة يدعيان سوكريسوار وفانيسوار بترجمة اللغة إلى السنسكريتية ثم مرة أخرى إلى الأدب البنغالي. هناك تجانس الجذر الأساسي، ونغمة الفونيم، وصرفا للأفعال، وترتيب الكلمات، ولاحقات اشتقاق الأفعال من الأفعال في لغة كوكبوروك.

مع مرور الوقت، تعرف كوكبورك على لغات مثل الإنجليزية والعربية والبنغالية والفارسية وغيرها. يمكن العثور على أنواع مختلفة من الهياكل الالتصاقية المعقدة في لغة كوكبوروك. الأشخاص الذين يتحدثون كوكبوروك كلغة أصلية في تريبورا غير قادرين على الوصول بسهولة إلى المعلومات لأن اللغة لم تحظ بعد بخط معتمد على نطاق واسع، لكن هذا الأمر قيد التطوير.

هناك عدة لهجات من كوكبوروك تتحدث في تريبورا. في تريبورا، تتحدث لهجات مختلفة، منها تريبورا/تريبوري، ديبارما، ريانغ، جاماتيا، أوتشاي، نواتيا، لوساي، كوكيس، تشايمال، هالام، سانتال، ليبشا، تشاكما، خاسيا، أورانغ، موغ، وغاروس. وفقا لتقرير تعداد عام 2011، هناك 1,011,294 متحدثا بلغة كوكبوروك في الهند وأكثر من 400,000 في بنغلاديش، الدولة المجاورة.

مراجعة الأدبيات
يصف المؤلفون أبحاثهم المستمرة حول التعرف التلقائي على اللغة باستخدام مجموعة بيانات جديدة من منشورات فيسبوك مع شفرة هندية وبنغالية وإنجليزية مختلطة. يجربون تقنيات متنوعة، مثل الأساليب القائمة على القاموس والتصنيف الخاضع للإشراف، لتحديد اللغة على مستوى الكلمة، مما يبرز أهمية النظر في الأدلة السياقية لتحديد اللغة بدقة في مثل هذه البيئات.

تقدم الورقة مجموعة بيانات من التغريدات المشروحة بهدف تحديد خطاب الكراهية على منصات التواصل الاجتماعي بمزيج من الشيفرة الهندية-الإنجليزية يستخدم تقنيات قائمة على المعجم، ومستوى الحروف، والكلمات1. تم تقديم طريقة تصنيف نصية متسامحة للأخطاء تعتمد على N-gram في الورقة. أولا، يستخدم النظام لحساب الملفات الشخصية باستخدام بيانات مجموعة التدريب، مثل عينات من مواد أو عبارات مجموعات الأخبار، التي تعكس الفئات المختلفة. بعد ذلك، ينشئ النظام ملفا شخصيا للمستند المحدد الذي يجب تصنيفه. وأخيرا، تحسب الخوارزمية مقياس المسافة بين كل ملف تعريف للفئة وملف ملف المستند. يتم اختيار الفئة التي يكون ملفها التعريفي الأقرب إلى ملف المستند بواسطة النظام2.

تمت مقارنة عدة تقنيات تضمين كلمات، بما في ذلك كيس الكلمات المستمر ونماذج تخطي-جرام، لإنشاء متجهات الميزات. أدابوست، الغابة العشوائية، K-أقرب الجيران، غاوس نايف بايز، آلة الدعم المتجهة، والانحدار اللوجستي جميعها أنتجت درجات تصحيحية متقاطعةجيدة 3. تم تقديم ملخص للأساليب السابقة في الجدول 1.

باستخدام المصنفات القائمة على المعجم، تتفوق الدراسة على المصنفات الحالية في ثلاث أزواج لغوية تم تقييمها في الدراسة: الإسبانية-الإنجليزية، الهولندية-الإنجليزية، والألمانية-التركية باستخدام مجموعات بيانات وسائل التواصل الاجتماعي4. يظهر نهج الدراسة تحسنا في مرونة النماذج من حيث التقارب والاتساق في أداء الاختبار، متفوقا على التقنيات الحالية لتحليل المشاعر في النصوص المختلطة بالشيفرة بنسبة 3.31 بالمئة دقة5.

في عملهم الرائد، تم تقديم التعرف الإحصائي للغة لدانينغ لأول مرة من قبل مختبر أبحاث الحوسبة في جامعة ولاية نيو مكسيكو في التقرير التقنيالسادس. تحلل هذه الورقة أنواعا مختلفة من التعلم المراقب باستخدام نموذج ماركوف الخفي، وطريقة مصنف الغابة العشوائية، والحقل العشوائي المشروط، ومصنف بايز الساذج استنادا إلى زوج اللغة من البيانات المختلطة بين الشفرة الإنجليزية والتيلجو7. تركز الورقة على اللغات الهندية بما في ذلك الإنجليزية والبودو والأسامية مع مناقشة نهج جديد للتعرف على اللغات في مواد وسائل التواصل الاجتماعي المختلطة بالشيفرة. يستخدم الباحثون الذاكرة ثنائية الاتجاه طويلة الأجل قصيرة المدى في نموذج التعلم العميق8.

في هذه الورقة، استخدموا مجموعة بيانات كبيرة تتعلق باللغة الغوجاراتية - حيث يتم خلط اللغة الغوجاراتية مع الإنجليزية والهندية. استخدموا مجموعة متنوعة من مصنفات التعلم الآلي. من بينها، قدم مصنف متجه الدعم أفضل دقة بنسبة 92 بالمئة9.

يستخدم إطار لغوي في مرحلة التصنيف المنفصلة للتمييز بين تبديل الشيفرة واستعارة التغريدات الهولندية-الإنجليزية. باستخدام LID المعتمدة على القواعد، وآلات الدعم المتجهة، ومصنفات شجرة القرار، يتعلمون أن DTC (ميكرو F1 = .95) ونظام LID القائم على القواعد (ميكرو F1 = .95) يؤديان أفضل10.

تم تقييم أداء نموذجهم باستخدام مجموعة بيانات TRAC-1 لكشف العدوانية المتحول بالشيفرة، ومجموعة بيانات Hinglish Offensive Tweet، ومجموعة بيانات تصنيف الفكاهة11. لتحسين الاحتفاظ في اكتساب المعجمات لدى البالغين من خلال القراءة، تم اقتراح نهج احتمالي كمنهجية للغة الثانية لإنتاج نص مختلط بالشفرة12. يتم دمج وحدة القاموس وتستخدم لإجراء اختبارات على مصنفات مراقبة مختلفة للتحكم في خلط الشيفرة على مستوى الكلمات13.

استخدموا مجموعة متنوعة من المقاييس لتحليل أنماط تبديل الشيفرة واكتشفوا أن نماذج الشبكات العصبية لكل من الإسبانية-الإنجليزية والهندية-الإنجليزية أدت أداء أسوأ من نموذج الحقول العشوائية الشرطية (CRF) بفارق 2.5 و3.5 نقطة مئوية على التوالي،14.

باستخدام معجم ثنائي اللغة ونص إنجليزي كمدخل، تبني الطريقة رسم بياني عوامل فوق الإشارات المعجمية لإنتاج نص متحول بالشيفرة يحسن معامل "قابلية التعلم" المعين. في هذه الورقة، يسعون لفهم مفاهيم صندوق أدوات CanVEC بشكل أفضل بناء على أزواج اللغات من بيانات الشفرات المبدلة بالهندية والإنجليزية. حققوا بنجاح درجة F1 بنسبة 87.99 بالمئة، دقة 15.16.

يفحص المؤلفون أولا مزج الشيفرة بين الغوجاراتية والإنجليزية17، مطبقين خط أنابيب من ثلاث مراحل لتحديد لغة كل رمز، وتطبيع التهجئة، وإعادة نقل المقاطع إلى الخطوط الأصلية. ثم يحولون تركيزهم إلى مجموعة هندية-إنجليزية18، حيث يقدمون خوارزميات اكتشاف المشاعر الجديدة المصممة خصيصا لتناسب هياكل الجمل ثنائية اللغة. لدعم التجارب المضبوطة، يتم توليد نص مختلط بالشيفرة الاصطناعية عن طريق تدريب نماذج تخطي-جرام على بيانات أحادية اللغة ودمج المخرجات19.

بعد ذلك، تتم معالجة مجموعة بيانات وسائل التواصل الاجتماعي20 عبر طريقة تعريف قائمة على القواعد على مستوى الكلمة، مما يحقق أداء قويا دون الحاجة إلى بيانات تدريب مشروحة يدويا21. لتوسيع النطاق، استفادت إحدى الدراسات من مجموعة كبيرة من الإنجليزية والهندية والبنغالية والأسامية من منصات مثل Facebook22 لتقييم مجموعة من تقنيات الوسم على مستوى الكلمات. استنادا إلى ذلك، يقوم إطار عملآخر 23 بالتبديل الديناميكي بين اللغات لاكتشاف العبارات المدمجة أو المستعارة بدقة عالية. في المجال الزراعي، يتم تصنيف التعليقات بالبنجابية-الإنجليزية باستخدام عدة نماذج - من بينها، يوفر مصنف n-gram أفضل دقة24. بالنسبة لنظام CMST السنهالية-الإنجليزية، تتم مقارنة المتعلمين الجماعيين (الغابة العشوائية، SVM، بايز الساذج، شجرة القرار، الانحدار اللوجستي)، حيث تبرز الغابة العشوائية كأفضل أداء25، بينما تحقق التضمين على مستوى الشخصية مع SVMs نتائج قوية في الزوجين التاميليين-الإنجليزيين والمالايالام-الإنجليزية26. أخيرا، يقدم مشروع Crúbadán27 كجهد واسع النطاق لبناء مجموعات لغوية تعاني من نقص الموارد من خلال الزحف عبر الويب، مما يمهد الطريق لأبحاث مزج الشفرات المستقبلية.

مجموعة البياناتالنتائج الرئيسيةالدقة/النتيجة F1/الدقة/التقييم/الاستدعاء
مجموعة بيانات هندية-بنغالية-إنجليزية مأخوذة من منشورات فيسبوكتسليط الضوء على تحديات تحديد اللغة في نص وسائل التواصل الاجتماعي على مستوى الكلمة89.30%
مقالات إخبارية ووثائقتم تنفيذ ذلك بفعالية باستخدام N-grams لتحديد اللغة0.99%
مجموعات البيانات الهندية المختلطة بالرموزإظهار الدقة الجيدة في تحديد اللغة على مستوى الكلمةغير مبلغ (غير مبلغ)
مجموعات البيانات المستندة إلى ويكيبيديااكتشاف محول الرموز على مستوى الرمز قويغير مبلغ (غير مبلغ)
تغريدات هندية-إنجليزيةالأداء تحسنت في تصنيف المشاعر للهندية والإنجليزية المختلطة بالرموز0.78%
المجموعات متعددة اللغاتإطار تعريف اللغة الأساسي78.00%
Code_mixed بيانات الإنجليزية-التيلجوحقق CRF أفضل أداء89.30%
النص المختلط بين الإنجليزية والبودوحقق دقة عالية على مستوى الكلمات92.00%
الأبجوت المختلطة بين الغوجاراتية والهنديةدقة تحديد اللغة على مستوى الجملة هي ≈92٪92.00%
تغريدات هولندية-إنجليزيةحققت نماذج DTC والقواعد تصنيفا في الفورمولا 1 ≈0.9595.00%
مجموعات البيانات المبدلة بالشيفرةالأداء التنافسي عبر النماذجغير مبلغ (غير مبلغ)
نص مختلط بالشيفرة الاصطناعيةتحسين التعلم المعجميغير مبلغ (غير مبلغ)
النص المختلط بين الإنجليزية والكاناديةالتعريف التلقائي الفعالغير مبلغ (غير مبلغ)
TRAC-1، مجموعات بيانات هينغليشتفوق CRF في نماذج الشبكات العصبية91.00%
البيانات الإلكترونية متعددة اللغاتتحديد دقيق للغة على مستوى الكلمة88.00%
وسائل التواصل الاجتماعي الهندية-الإنجليزيةدقة عالية في تحديد اللغة الهندية-الإنجليزية0.93%
الشفرة الإنجليزية-الغوجاراتية - مختلطةالمعالجة الفعالة ثنائية اللغة
مجموعات بيانات مختلطة بالشيفرة على وسائل التواصل الاجتماعيتحسين اكتشاف المشاعر0.90%
البيانات التركيبية المختلطة بالشيفرةتمثيلات تضمين قويةغير مبلغ (غير مبلغ)
نص وسائل التواصل الاجتماعي المختلط بين الكونكانية والإنجليزيةأداء قوي بدون تعليقات توضيحية0.89%
مجموعة بيانات مختلطة بالشيفرة من تويترتحسين الكشف عن المفاتيح90.20%
الأسامية–البنغالية–الهندية–الإنجليزيةتحديد دقيق للغات متعددة اللغات91.00%
وسائل التواصل الاجتماعي - نص مختلط بالشيفرةتقييم F1 ≈0.950.95%
بيانات مختلطة بين الشفرة الإنجليزية والبنجابيةكان نموذج N-gram يؤدي بشكل أفضل0.88%
بيانات مختلطة بالشفرة السنهالية-الإنجليزيةحقق RF أفضل دقة0.92%
تعليقات على فيسبوك على الرموز المختلطةتحسين LID على مستوى الكلمة0.93%
مجموعة كروبادانتمكين البحث اللغوي منخفض المواردغير مبلغ (غير مبلغ)
مجموعات البيانات المختلطة بالشيفرةالأداء الجيد يظهر في تحديد اللغة على مستوى الكلمة0.94%

الجدول 1: ملخص الأدب المختلط باللغات الرمزية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم جمع النص المختلط والشفرات بالإنجليزية وكوكبوروك يدويا من المحادثات المحلية والمنشورات المتاحة للجمهور على منصات التواصل الاجتماعي. لم يتم جمع أي معلومات شخصية أو حساسة. اتبعت جميع الإجراءات إرشادات أخلاقية مؤسسية.

3. التصميم والتنفيذ

3.1 خوارزمية
3.1.1 لكل رمز في الجملة (S):
a. باستخدام قاموس التردد، يتم حساب احتمال المعجم Plexi .
b. استنادا إلى نموذج N-غرام، يتم حساب احتمال Pchar القائم على الحروف
ج. الاستيفاء الموزون لكليهما:
Pمجتمعة = λlexi Plexi + λchar Pchar
3.1.2. تم تخزين تركيبة الاحتمالية Pمجتمعة لكل رمز كاحتمال انبعاث.
3.1.3. تطبيق خوارزمية فيتيربي:
a. معطى الابتدائية مع احتمالات اللغة الابتدائية.
b. لكل رمز:
i. حساب انتقالعدد P (استمرار نفس اللغة).
وتحول P (احتمالية تبديل اللغة).
ii. اختر مسار اللغة وتعظيم احتمال التسلسل.
3.1.4. إخراج تسلسل اللغة L ذو الاحتمالات القصوى مع أعلى احتمال إجمالي.

3.2 البيئة الحاسوبية
تم تنفيذ جميع التجارب باستخدام بايثون 3.10 على منصة Google Colab. استخدم النظام مجموعة من حزم بايثون الأساسية مثل NumPy وPandas وMatplotlib لمعالجة وتصور البيانات، وscikit-learn (الإصدار 1.3) لإجراء التنبؤات والتحليلات الإحصائية. تم تنفيذ دمج قاموس التردد، ونمذجة n-gram الحرفي، وفك ترميز Viterbi باستخدام سكريبتات بايثون مخصصة. تم تدريب النموذج واختباره على مجموعة بيانات مكونة من 10,000 جملة، مع تقسيم 70/30 للتدريب والاختبار.

3.3 تحديد اللغة
بمجرد أن يتم تحويل جملة إلى رمز، تقرر وحدة تحديد اللغة ما إذا كان كل رمز مكتوبا بالكوكبوروك أو الإنجليزية. يتم توضيح البنية الكاملة للنظام في الشكل 1. ثم يستخدم هذا التعيين اللغوي لتحديد أي وحدات النسخ هي المناسبة. عن طريق دمج البيانات من نموذج الحرف n-gram وقاموس التردد، يتم تحديد لغة الرمز.

نظرا للفروق الإملائية الكبيرة بين اللغتين المذكورة أعلاه، فإن المصنف الذي يستخدم فقط معلومات من الرمز نفسه، دون أي ميزات سياقية، يؤدي أداء جيدا بالفعل. ومع ذلك، بعد التعيين الأولي، يتم تطبيق مصنف آخر يستخدم خوارزمية فيتيربي. يقلل هذا المصنف الثاني من سوء تصنيف التجانس بين اللغات ويفضل مجموعات الكلمات التي تنتمي إلى نفس اللغة.

figure-protocol-1
الشكل 1: أنماط على مستوى الكلمة ومعاقبة تغييرات اللغة باستخدام نظام الخوارزميات فيتيربي. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.  

figure-protocol-2
الشكل 2: طريقة تحديد الجمل المختلطة بالشفرة واللغة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

جمعنا البيانات من مجموعة Crúbadán27 للقاموس ونموذج الحروف. توجد العديد من اللغات، بما في ذلك العديد من اللغات الأقلية مثل كوكبوروك، في هذا المجموعة.

نظرا لأن مجموعة البيانات في مجموعة كروبادان غير كافية لهدفنا، فقد اختبرنا مجموعة بيانات جديدة من كوكبوروك للكتاب المقدس. مقارنة باللغات الأخرى، هناك عدد قليل نسبيا من المصادر المتاحة. وبناء عليه، تم جمع بيانات الجمل المختلطة في هذه الورقة من مجموعات واتساب الناطقة بكوكبوروك مثل اليوبيل البلاتيني، مجموعة السكان، مجموعة الاستعادة الدولية، خومولونغ، جمعية ديباتشارا المعمدانية، منتدى تيبراسا المتحدة (UTF)، زمالة ديباشارا للشباب، كريشنا ناغار (EU)، زمالة أوتشوي المسيحية (UCF)، تيبرا كوسرانغ بودول، جمعية الهندسة القبلية، المعهد الوطني للتكنولوجيا طلاب بوروك، Information Yarung، وجمعية شباب تريبورا أوتشوي (TUYA).

تم جمع ما مجموعه 10,000 جملة مختلطة بالشفرات باللغتين كوكبورك والإنجليزية من هذه المجموعات بين أغسطس 2021 وديسمبر 2023. مصادر وتوزيع نطاق مجموعة البيانات مدرجة في الجدول 2.

الاسمإجمالي عدد الكلمات
كلمات كوكبوروك من الكتاب المقدس718883
الجمل المختلطة بالشفرة الإنجليزية وكوكبوروك68789

الجدول 2: إجمالي كلمات كوكبوروك.

اللغةإجمالي الرموز
كوكبوروك (trp)711509
الإنجليزية (بالإنجليزية)1767141

الجدول 3: نموذج الشخصية بوزن 2 جرام.

لاإجمالي الجمل المختلطة بالشفرة المستخدمة
110,768

الجدول 4: إجمالي الجمل المختلطة التي تم تدريبها.

تم أخذ نموذج الحروف والقاموس من مجموعة Crúbadán27. هذه المجموعة، التي يمكن الوصول إليها لمجموعة واسعة من اللغات، بما في ذلك العديد من لغات الأقليات، يتم إنشاؤها تلقائيا من خلال البحث عبر الإنترنت عن المواد باللغة المستهدفة. مجموعة كوكبوروك على وجه الخصوص صغيرة نسبيا لأن النهج تم إنشاؤه في البداية لكوكبوروك.

بينما تتوفر أيضا مجموعة من Kokborok والإنجليزية، إلا أنها لم تستخدم عمدا بسبب نقص مجموعات البيانات، خصوصا فيما يتعلق بخلط الشيفرة وقلب الكود. هناك عدة مصطلحات إنجليزية في مجموعة كوكبوروك أيضا؛ بعض هذه الكلمات (بما في ذلك no، do، و o) أكثر شيوعا من الكلمات الإنجليزية.

يقوم القاموس ونموذج اللغة بمهمة التسمية المستقلة عن الكلمات. مهمتنا مشابهة لمهمة كينغ وآخرين.

تستخدم احتمالات المعجم (lex)، والشخصية (ch)، وتسمية الكلمة لإنشاء استيفاء خطي بين ترددات المكونات المعجمية (ch) والمفردية (lex). الاحتمال المجمع (المشط) الناتج عن ذلك موضح في المعادلة (1) أدناه؛ تعرض معلمات الاستيفاء التفصيلية في الجدول 3. يتم تصوير استراتيجية الاستيفاء في الشكل 2.

Pمجتمعة = λlexi · Plexi + λchar · Pchar (1)

حيث 0 ≤ λليكسي، λchar ≤ 1؛ و λlexi + λchar = 1. الكلمات التي لا أساس لها لغوي لها احتمال معجمي منخفض جدا لكنه غير صفري. من المفترض أنه في حال غياب كلمة من كلتا اللغتين، يستخدم نموذج الحرف للتنفيذ بدلا من الاحتمال المعجمي، حتى لو كان λlexi = 1.

طريقتنا في تطوير نموذج الشخصية تعتمد على سلسلة ماركوف الشخصية n-gram لدانينغ (1994). يتم ذلك عن طريق عد n-جرام في بداية ونهاية الرموز على التوالي، لتقدير احتمالات البداية والانتقال.

مقارنة الأداء بين النماذج المدربة 2 جرام و4 جرام موضحة أدناه.

figure-protocol-3   (2)

figure-protocol-4·

figure-protocol-5 (3)

يمكن ضرب الكلمات الأولى والانتقالية لاحتمالية للحصول على احتمال وجود كلمة باستخدام نموذج اللغة (4).

P(〈w1w2w3〉) = Pالحرف الأولي (〈w1w2) · انتقال P (c3|〈w1w2) · انتقال P (〉|الفوز1الفوز2الفوز3) (4)

لغة كوكبورك غنية جدا بالبادئات واللاحقات، وهي لغة ملتصقة صرفيا حيث تضاف لواحق مثل "o" و"do" و"no" إلى الكلمات الأساسية. يساعد الغرام 2 في التقاط الانتقالات الصرفية المحلية بفعالية عند حدود اللواحق، بينما يمكن ل4 جرام التقاط كلمات كوكبوروك التي لها تبعيات إملائية أطول في الكلمات الجذرية والمركبة مثل Phailaidido وThanlainai وMwchangkha.

ينطبق هذا على مجموعة بيانات كبيرة، مما يزيد من احتمال حدوث عدة مشاكل في نقص البيانات. بالإضافة إلى ذلك، قد لا تظهر تركيبة الأحرف في جميع الحالات، مما قد يؤدي إلى انخفاض الاحتمال إلى الصفر. يستخدم تنعيم لامبدا لحل هذه الأنواع من القضايا بإعطاء كل ngram يحتوي على أحرف غير مرئية قيمة صغيرة مع احتمال غير صفري. قيمة لامبدا محددة عند 0.001.

figure-protocol-6  (5)

حيث N = يمثل كمية الملاحظات المميزة ب n-جرام.

figure-protocol-7   (6)

حيث D= هو عدد الفروق المكتشفة في n-جرام. يفترض أن احتمال وجود n-جرام غير ملحوظ هو نفسه.

figure-protocol-8   (7)

حيث تشير C إلى حجم الحرف.

تم تحديد القيم الأولية ل Pcount وλlexi وλchar تجريبيا بواسطة تحليل التردد لمجموعات كوكبوروك والإنجليزية. أولا، قمنا بتهيئة λlexi إلى 0.5 ووزننا كل من الاحتمالات المعجمية والقائمة على الحروف، مما جعل كلاهما يساهم بنفس القدر في المحاولة الأولى. سمح لنا هذا المستوى من التهيئة بتحديد الدور المقارن للمعجم ونموذج الأحرف n-gram بين مجموعات البيانات.

تم تعيين معامل الانتقال Pcount (مستمر بنفس اللغة) إلى 0.6، بناء على نسبة التسلسلات أحادية اللغة إلى نقاط التبديل في مجموعة البيانات المحددة يدويا. وفرت هذه القيم نقطة انطلاق جيدة للتقارب أثناء الضبط. ثم تم تحسين جميع المعلمات من خلال سلسلة من التجارب المتكررة لتعظيم معامل ماثيوز (MCC)، وهو ما هو مفصل في قسم النتائج.

التعريف السياقي
يستخدم النموذج السياقي الاحتمالات التي تم تهيئتها بالفعل (Pcount و Pswitch) خلال مرحلة التعريف المستقل ويحسنها باستخدام فك ترميز تسلسل Viterbi بحيث تقل تناقضات الانتقال ويتم اكتشاف تبديل اللغة بشكل مثالي.

الناتج التحليلي لنموذج اللغة يعتمد على السياق ويتم الحصول عليه بشكل أساسي من خلال دمج الرمز الحالي مع الرمز التالي واستخدام كل من الرموز السابقة والحالية. نظرا لاحتمال أن تكون كلمتين لهما نفس قيمة التكرار لهما معان متشابهة وتسبب سوء تصنيف، فقد تم استخدام النهج المعتمد على السياق لإيجاد مصطلحات التشابه الموجودة في كلتا اللغتين.

بعض الكلمات مثل "لا"، "دو"، "أو"، "آر"، "دا (يوم)"، "غو"، "سا (يقول)"، "ورد"، "خاتم"، وغيرها الكثير، متشابهة في كلتا اللغتين. نتيجة لذلك، قد يكون من الصعب جدا تحديد اللغة الصحيحة عندما ينشأ هذا النوع من الغموض، وأحيانا يتم تصنيف اللغات بشكل خاطئ.

لمعالجة هذه المشكلات في تحديد اللغة، قدمنا مجموعة من نماذج اللغة باستخدام نموذج ماركوف مخفي تمييزي وتعلم آلي تحت الإشراف. يفترض أن احتمال الانتقال لكلتا اللغتين متساو. بالنسبة ل Pcount بنفس اللغة، فإن الاحتمال المستمر هو المعامل الأساسي الذي يجب إعلانه. من خلال ذلك، يمكننا حساب احتمالية تغيير اللغة.

مفتاح P = 1 − عدد P (8)

التصنيف السياقي باستخدام مسار فيتيربي موضح في الشكل 3. هدف خوارزمية فيتيربي هو تحديد أي من لغات تسلسلات الرموز هي الأفضل وفقا لحسابي Pcount وPswitch.

يتم تطبيق خوارزمية فيتيربي على التصنيف السياقي. يستخدم Pcount و Pswitch لتسمية الحواف، ويتم تصنيف العقد بالاحتمالية النسبية التي يمنحها المصنف الأول.

نظرا لاحتمالية استخدام لغة كوكبوروك الأعلى للمستقبل، سيتم اختيار المسار المتقطع إذا كان المصنف الأول هو الوحيد المستخدم ولم تتوفر معلومات سياقية.

يظهر تأثير التعديل القائم على السياق في الشكل 4. هذا يوضح كيف أنه، في غياب المعلومات السياقية، يمكن التعرف بشكل خاطئ على الكلمات الثانية والثالثة والخامسة في عبارة "الأسبوع القادم o phaisidi do" على أنها الإنجليزية (بالإنجليزية) (مسار متقطع). على الرغم من أن الاحتمالات أكبر قليلا بالنسبة للإنجليزية، إلا أن القيم النسبية متقاربة.

سيتم معاقبة تحولات اللغة، وسيكون احتمال التسلسل أقل من المسار الأمثل لخوارزمية فيتربي إذا أخذنا احتمالات الانتقال في الاعتبار. لذا، فقط الكلمات التي من المرجح أن تكون مصدرها من اللغة الأخرى - بدلا من المصطلحات الشائعة التي تظهر في كلتا اللغتين - يمكنها تحفيز تغييرات لغوية في تسلسلات قصيرة.

تم اختيار معامل الارتباط لماثيوز كمقياس للتقييم لأنه، مقارنة بمقاييس أخرى مثل الدقة والاسترجاع والدقة، فهو أكثر ملاءمة بشكل ملحوظ لمهام التصنيف الثنائية، حيث يأخذ في الاعتبار الإيجابيات الحقيقية والسلبية الحقيقية بالإضافة إلى الإيجابيات الكاذبة والسلبية الكاذبة.

figure-protocol-9   (9)

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

في الجدول 4، عرضنا نتائج MCC وضبط المعلمات ل Ptrp التي حسبت الانحياز الأولي نحو تسلسلات البداية باستخدام كلمات كوكبوروك وحسبت Pcount، وهو احتمال الاستمرار في نفس اللغة.

λ_lexPcount = 0.66العد الدقيقي = 0.70Pcount = 0.74Pcount = 0.79Pcount = 0.82Pcount = 0.86العدد الدقيقي = 0.90

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

بينما يظهر النموذج المقترح دقة تبلغ 93.15٪ على مستوى الكلمات، يكشف التحليل الدقيق للأخطاء عن عدة أنماط متكررة تبرز تحديات التعرف على اللغات المختلطة بين الإنجليزية والكوكبوروك.

باستخدام كلمات مستعارة وكلمات غامضة
جزء كبير من الأخطاء يأتي من استخدام كلمات إنجليزية مستعارة، والتي أصبحت شائعة في استخدام كوكبوروك. كلمات مثل no، do، o، go، ring، rose، و وتظهر كثيرا ف...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المؤلفون لا يفرضون أي تضارب مصالح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

نود أن نشكر المتحدثين المحليين الأصليين، ومجموعات واتساب، والمنظمات، واتحادات الطلاب، وجمعية الكتاب المقدس في الهند لمساعدتنا في الحصول على مجموعة البيانات الخام للجمل المختلطة بالشيفرة. نحن أيضا ممتنون لقسم علوم وهندسة الحاسوب في المعهد الوطني للتكنولوجيا في أروناشال براديش، وجامعة لوفلي المهنية لتوفير المنصة لنا لفحص واختبار مجموعة بياناتنا.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
راسبيري باي 4مؤسسة راسبيري بايRPI4-MODBP-4GBيستخدم لمعالجة اللغة منخفضة الموارد
بطاقة MicroSD بحجم 64GBسانديسكSDSQUAR-064G-GN6MAلتخزين أنظمة التشغيل ومجموعات البيانات
مزود الطاقة 5V/3Aالرسوب باي الرسميSC0218لتشغيل لوحة Pi
ميكروفون USBبوياBY-M1لإدخال الصوت في جمع بيانات اللغة
الشاشة (HDMI)إل جي22MK600Mعرض الإخراج أثناء الاختبار
لوحة مفاتيح و تركيبة الفأرلوجيتكMK270التحكم في الواجهة
دونجل الواي فاي (إذا كان Pi 3)TP-LinkTL-WN725Nنقل البيانات اللاسلكي (إذا لم يكن هناك واي فاي مدمج)
بيئة تطوير بايثون (Thonny)المصدر المفتوح-بيئة تطوير البرمجة
مجموعة بيانات المعجمبناء مخصص-زوج كوكبوروك-الإنجليزية
مجموعة بيانات N-gramبناء مخصصزوج لغة الإنجليزية-كوكبوروك
المختلط بالشيفرة والتبديل بالشيفرةبناء مخصص10,000 حكمتم جمعها من نصوص وسائل التواصل الاجتماعي، واتساب، مجموعات من الواتساب، المنظمات غير الحكومية، الكتاب المقدس، وغيرها

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Code mixing: a challenge for language identification in the language of social media. Barman, U., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).
  2. N-gram-based text categorization. Cavnar, W. B., Trenkle, J. M. Proc SDAIR-94 3rd Annu Symp Document Anal Inf Retr, 161175, 14(1994).
  3. Word level language identification in code-mixed data using word embedding methods for Indian languages. Inumella, C., et al. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2018).
  4. Claeser, D., Felske, D., Kent, S. Token level code-switching detection using Wikipedia as a lexical resource. Proc Int Conf German Soc Comput Linguist Lang Technol, , Springer. (2017).
  5. Dahiya, A., et al. Curriculum learning strategies for Hindi-English code-mixed sentiment analysis. Proc Int Joint Conf Artif Intell, , Springer. (2019).
  6. Dunning, T. Statistical identification of languages-Technical Report MCCS 94-273, Algorithms-computer science. , Computing Res Lab. (1994).
  7. Gundapu, S., Mamidi, R. Word level language identification in English Telugu code-mixed data. arXiv preprint. , (2020).
  8. Word level language identification on code-mixed English-Bodo text. Kalita, N. J., Agarwala, A. G., Das, J. IOP Conf Ser: Mater Sci Eng, 1020 (1), (2021).
  9. Sentence level language identification in Gujarati-Hindi code-mixed scripts. Kazi, M., Mehta, H., Bharti, S. Proc IEEE Int Symp Sustain Energy Signal Process Cyber Secur (iSSSC), , IEEE. (2020).
  10. Incorporating code-switching and borrowing in Dutch-English automatic language detection on Twitter. Kent, S., Claeser, D. Proc Future Technol Conf, , Springer. (2018).
  11. Machine learning based language modelling of code switched data. Kumar, V., et al. Proc Int Conf Electron Sustain Commun Syst (ICESC), , IEEE. (2020).
  12. Generating code-switched text for lexical learning. Labutov, I., Lipson, H. Proc 52nd Annu Meet Assoc Comput Linguist, , (2014).
  13. An automatic language identification system for code-mixed English-Kannada social media text. Sowmya, B. S. L., Shambhavi, B. R. Proc 2nd Int Conf Comput Syst Inf Technol Sustain Solut (CSITSS), , IEEE. (2017).
  14. Language identification and analysis of code-switched social media text. Mave, D., Maharjan, S., Solorio, T. Proc 3rd Workshop Comput Approaches Linguist Code-Switch, , (2018).
  15. Word level language identification in online multilingual communication. Nguyen, D., Dogruöz, A. S. Proc Conf Empir Methods Nat Lang Process (EMNLP), , Assoc Comput Linguist. (2013).
  16. Li, N., et al. Automatic language identification in code-switched Hindi-English social media text. J Open Humanit Data. 7, (2021).
  17. Language identification and translation of English and Gujarati code-mixed data. Patel, D., Parikh, R. Proc Int Conf Emerg Trends Inf Technol Eng (ic-ETITE), , IEEE. (2020).
  18. Domain-specific sentiment analysis approaches for code-mixed social network data. Pravalika, A., et al. Proc 8th Int Conf Comput Commun Netw Technol (ICCCNT), , IEEE. (2017).
  19. Word embeddings for code-mixed language processing. Pratapa, A., Choudhury, M., Sitaram, S. Proc Conf Empir Methods Nat Lang Process, , (2018).
  20. Word level language identification system for Konkani-English code-mixed social media text (CMST). Phadte, A., Wagh, R. Proc 10th Annu ACM India Compute Conf, , (2017).
  21. Estimating code-switching on Twitter with a novel generalized word-level language detection technique. Rijhwani, S., et al. Proc 55th Annu Meet Assoc Comput Linguist, , (2017).
  22. Word level language identification in Assamese-Bengali-Hindi-English code-mixed social media text. Sarma, N., Singh, S. R., Goswami, D. Proc Int Conf Asian Lang Process (IALP), , IEEE. (2018).
  23. Sarma, N., Singh, R. S., Goswami, D. SwitchNet: Learning to switch for word-level language identification in code-mixed social media text. Nat Lang Eng. 28 (3), 337-359 (2022).
  24. Sentiment analysis of English-Punjabi code mixed social media content for agriculture domain. Singh, M., Goyal, V., Raj, S. Proc Int Conf Inf Syst Comput Netw (ISCON), , IEEE. (2019).
  25. Language identification at word level in Sinhala-English code-mixed social media text. Shanmugalingam, K., Sumathipala, S. Proc Int Res Conf Smart Comput Syst Eng (SCSE), , IEEE. (2019).
  26. An effective way of word-level language identification for code-mixed Facebook comments using word-embedding via character-embedding. Veena, P. V., Kumar, M. A., Soman, K. P. Proc Int Conf Adv Comput Commun Informatics (ICACCI), , IEEE. (2017).
  27. The Crúbadán Project: Corpus building for. Scannell, K. P. Proc Web Corpora Workshop (WAC3-2007), , Presses Univ Louvain. (2007).
  28. The IUCL+ system: Word-level language identification via extended Markov models. King, L., et al. Proc 1st Workshop Comput Approaches Code Switch, , (2014).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

الفيديو قريباً

مقالات ذات صلة