الهدف من البروتوكول المعطى هو تحديد اللغات على مستوى الكلمات بشكل صحيح ضمن النص المختلط بين الشيفرة الإنجليزية وكوكبوروك باستخدام نموذج غير خاضع للإشراف يجمع بين الأحرف n-gram وقواميس التردد.
مقالة بحثية
الهدف من البروتوكول المعطى هو تحديد اللغات على مستوى الكلمات بشكل صحيح ضمن النص المختلط بين الشيفرة الإنجليزية وكوكبوروك باستخدام نموذج غير خاضع للإشراف يجمع بين الأحرف n-gram وقواميس التردد.
هناك حاجة متزايدة لنموذج للكشف التلقائي عن اللغة على مستوى الكلمات بسبب الاستخدام المتزايد للنصوص متعددة اللغات. لتحديد الجمل المتبادلة بالشفرة والمختلطة بالشفرة بلغة كوكبورك والإنجليزية على مستوى الكلمات، نقترح نموذجا غير خاضع للإشراف. تم نشر العديد من الدراسات حول النصوص المختلطة بالشيفرة، بما في ذلك لعدة لغات هندية. ومع ذلك، حسب علمنا، يمثل عملنا جهدا رائدا، حيث كنا أول من حدد لغات أزواج اللغات الإنجليزية والكوكبوروك منخفضة الموارد. لقد استخدمنا طريقة تدمج بيانات من قاموس التردد مع بيانات من نموذج حرف n-غرام. تجمع تقنية فيتيربي بين نموذج ماركوف بحرف n-gram مع معجم تردد للمساعدة في تحديد اللغة بدقة على مستوى الكلمة. حققت الطريقة المقترحة أداء جيدا، بدقة على مستوى الكلمات بلغت 93.15٪، وهو أفضل من نموذج BiLSTM-CRF البالغ 88.5٪ وخط الأساس القائم على القواعد بنسبة 85.3٪. هذا يوضح فعالية الجمع بين المعجم والمنهجية الإحصائية في التعامل مع اللغات منخفضة الموارد دون الاعتماد على مجموعات بيانات مشروحة ضخمة.
في هذا العصر الرقمي، أصبح النمو السريع لخلط الشفرات وتبادل الشفرات متعدد اللغات على منصات التواصل الاجتماعي محور التواصل العالمي. الحاجة إلى تحديد دقيق للغات ضمن المحتوى النصي أمر بالغ الأهمية. بعد الملاحظة، وجدنا أن العديد من اللغات الهندية مثل الهندية والبنغالية والتيلجو قد تم استكشافها بالفعل في تحديد اللغة، كما أن لغات هندية أخرى ذات موارد منخفضة مثل مانيبوري، بودو، وأسامية تم تناولها جزئيا في أبحاث تحديد اللغة. ومع ذلك، لا تزال هناك فجوة بحثية كبيرة في تطوير نماذج لغة كوكبوروك، وهي لغة منخفضة الموارد وتتميز لغويا وبنيويا على حد سواء.
على عكس لغات مانيبوري والأسامية والبودو منخفضة الموارد، تتمتع كوكبوروك بمستوى عال من التنوع الإملائي وتكتب بالخط الروماني أو البنغالي، وغالبا ما يكون بالتبادل في التواصل. هذا يخلق الكثير من الغموض في حدود الرموز والترجمة الصوتية واستخراج الميزات على مستوى الشخصية، مما يطرح تحديات واضحة ونادرا ما تم التفكير فيه في الأدبيات. علاوة على ذلك، كوكبورك هي لغة التصاق، وتشمل مورفولوجيتها بادئات غنية ولواحق (مثل -o، -do، -no) ونغمات صوتية، مما يجعل من الصعب تطبيق نماذج التعريف اللغوية المختلطة بالشيفرة التي تم تطويرها بالنسبة للغات الهندوآرية.
وتزداد هذه القضايا سوءا بفضل وسائل التواصل الاجتماعي. غالبا ما يميل متحدثي كوكبوروك إلى خلط الكلمات الإنجليزية في النص، ليس فقط لخلط الرموز وتبديل الشيفرات، بل أيضا لتعويض نقص العناصر المعجمية في جملة كوكبوروك. يؤدي ذلك إلى استخدام الكلمات غير القياسية واستخدام السياق، وهو انتكاسة للأنظمة القائمة على القواعد أو المعجمية البحتة.
في هذه الدراسة، يتم معالجة هذه الفجوات من خلال اقتراح نموذج غير مراقب يجمع بين قواميس التردد واحتمالات الأحرف n-gram مع إطار فك تشفير Viterbi. تركز الطريقة بشكل خاص على التعقيدات الإملائية والصرفية والسياقية لزوج الإنجليزية-كوكبوروك، ولذلك فهي واحدة من أولى المحاولات الحسابية لمعالجة واكتشاف حواجز اللغة على مستوى الكلمات بشكل منهجي في هذه اللغة منخفضة الموارد.
خلفية كوكبوروك
كلمتا "كوك" التي تعني اللغة، و"بوروك" التي تعني الإنسان تتحد لتشكيل الكلمة المركبة "كوك-بوروك" التي تعني الإنسان. مصطلح "كوك-بورك" يشير إلى اللغة التي يتحدث بها شعب البوروك في تريبورا، وكذلك أولئك في الدول المجاورة بنغلاديش وميانمار، وسكان ميزورام ومانيبور وآسام. لغة كوكبوروك، التي تتحدث بشكل رئيسي في تريبورا، مكتوبة بالخط الروماني والبنغالي. يفضل الخط الروماني على الخط البنغالي من قبل غالبية متحدثي الكوكبوروك. في الواقع، المجموعة الفرعية اللغوية الصينية-التبتية المعروفة باسم التبتية-البورمية هي مصدر نشأة لغة كوكبوروك. لغة كوكبورك ولغة بودو متشابهتان بشكل دقيق. تحمل الأنواع ال 36 من لغة كوكبوروك تشابهات دقيقة مع كل من لغتي بودو وكاشاري.
كان كولوما معروفا بأنه الخط الأصلي لكوكبوروك. كانت الولاية الوحيدة في الهند، تريبورا، تحت سيطرة 184 شخصا قبل أن تتم توحيدها في الاتحاد الهندي في 15 أكتوبر 1949. أما خط كولوما الموجود في كتاب راجراتناكار فهو الذي استخدم لكتابة السرديات التاريخية. لاحقا، في القرن الرابع عشر، قام اثنان من البراهمة يدعيان سوكريسوار وفانيسوار بترجمة اللغة إلى السنسكريتية ثم مرة أخرى إلى الأدب البنغالي. هناك تجانس الجذر الأساسي، ونغمة الفونيم، وصرفا للأفعال، وترتيب الكلمات، ولاحقات اشتقاق الأفعال من الأفعال في لغة كوكبوروك.
مع مرور الوقت، تعرف كوكبورك على لغات مثل الإنجليزية والعربية والبنغالية والفارسية وغيرها. يمكن العثور على أنواع مختلفة من الهياكل الالتصاقية المعقدة في لغة كوكبوروك. الأشخاص الذين يتحدثون كوكبوروك كلغة أصلية في تريبورا غير قادرين على الوصول بسهولة إلى المعلومات لأن اللغة لم تحظ بعد بخط معتمد على نطاق واسع، لكن هذا الأمر قيد التطوير.
هناك عدة لهجات من كوكبوروك تتحدث في تريبورا. في تريبورا، تتحدث لهجات مختلفة، منها تريبورا/تريبوري، ديبارما، ريانغ، جاماتيا، أوتشاي، نواتيا، لوساي، كوكيس، تشايمال، هالام، سانتال، ليبشا، تشاكما، خاسيا، أورانغ، موغ، وغاروس. وفقا لتقرير تعداد عام 2011، هناك 1,011,294 متحدثا بلغة كوكبوروك في الهند وأكثر من 400,000 في بنغلاديش، الدولة المجاورة.
مراجعة الأدبيات
يصف المؤلفون أبحاثهم المستمرة حول التعرف التلقائي على اللغة باستخدام مجموعة بيانات جديدة من منشورات فيسبوك مع شفرة هندية وبنغالية وإنجليزية مختلطة. يجربون تقنيات متنوعة، مثل الأساليب القائمة على القاموس والتصنيف الخاضع للإشراف، لتحديد اللغة على مستوى الكلمة، مما يبرز أهمية النظر في الأدلة السياقية لتحديد اللغة بدقة في مثل هذه البيئات.
تقدم الورقة مجموعة بيانات من التغريدات المشروحة بهدف تحديد خطاب الكراهية على منصات التواصل الاجتماعي بمزيج من الشيفرة الهندية-الإنجليزية يستخدم تقنيات قائمة على المعجم، ومستوى الحروف، والكلمات1. تم تقديم طريقة تصنيف نصية متسامحة للأخطاء تعتمد على N-gram في الورقة. أولا، يستخدم النظام لحساب الملفات الشخصية باستخدام بيانات مجموعة التدريب، مثل عينات من مواد أو عبارات مجموعات الأخبار، التي تعكس الفئات المختلفة. بعد ذلك، ينشئ النظام ملفا شخصيا للمستند المحدد الذي يجب تصنيفه. وأخيرا، تحسب الخوارزمية مقياس المسافة بين كل ملف تعريف للفئة وملف ملف المستند. يتم اختيار الفئة التي يكون ملفها التعريفي الأقرب إلى ملف المستند بواسطة النظام2.
تمت مقارنة عدة تقنيات تضمين كلمات، بما في ذلك كيس الكلمات المستمر ونماذج تخطي-جرام، لإنشاء متجهات الميزات. أدابوست، الغابة العشوائية، K-أقرب الجيران، غاوس نايف بايز، آلة الدعم المتجهة، والانحدار اللوجستي جميعها أنتجت درجات تصحيحية متقاطعةجيدة 3. تم تقديم ملخص للأساليب السابقة في الجدول 1.
باستخدام المصنفات القائمة على المعجم، تتفوق الدراسة على المصنفات الحالية في ثلاث أزواج لغوية تم تقييمها في الدراسة: الإسبانية-الإنجليزية، الهولندية-الإنجليزية، والألمانية-التركية باستخدام مجموعات بيانات وسائل التواصل الاجتماعي4. يظهر نهج الدراسة تحسنا في مرونة النماذج من حيث التقارب والاتساق في أداء الاختبار، متفوقا على التقنيات الحالية لتحليل المشاعر في النصوص المختلطة بالشيفرة بنسبة 3.31 بالمئة دقة5.
في عملهم الرائد، تم تقديم التعرف الإحصائي للغة لدانينغ لأول مرة من قبل مختبر أبحاث الحوسبة في جامعة ولاية نيو مكسيكو في التقرير التقنيالسادس. تحلل هذه الورقة أنواعا مختلفة من التعلم المراقب باستخدام نموذج ماركوف الخفي، وطريقة مصنف الغابة العشوائية، والحقل العشوائي المشروط، ومصنف بايز الساذج استنادا إلى زوج اللغة من البيانات المختلطة بين الشفرة الإنجليزية والتيلجو7. تركز الورقة على اللغات الهندية بما في ذلك الإنجليزية والبودو والأسامية مع مناقشة نهج جديد للتعرف على اللغات في مواد وسائل التواصل الاجتماعي المختلطة بالشيفرة. يستخدم الباحثون الذاكرة ثنائية الاتجاه طويلة الأجل قصيرة المدى في نموذج التعلم العميق8.
في هذه الورقة، استخدموا مجموعة بيانات كبيرة تتعلق باللغة الغوجاراتية - حيث يتم خلط اللغة الغوجاراتية مع الإنجليزية والهندية. استخدموا مجموعة متنوعة من مصنفات التعلم الآلي. من بينها، قدم مصنف متجه الدعم أفضل دقة بنسبة 92 بالمئة9.
يستخدم إطار لغوي في مرحلة التصنيف المنفصلة للتمييز بين تبديل الشيفرة واستعارة التغريدات الهولندية-الإنجليزية. باستخدام LID المعتمدة على القواعد، وآلات الدعم المتجهة، ومصنفات شجرة القرار، يتعلمون أن DTC (ميكرو F1 = .95) ونظام LID القائم على القواعد (ميكرو F1 = .95) يؤديان أفضل10.
تم تقييم أداء نموذجهم باستخدام مجموعة بيانات TRAC-1 لكشف العدوانية المتحول بالشيفرة، ومجموعة بيانات Hinglish Offensive Tweet، ومجموعة بيانات تصنيف الفكاهة11. لتحسين الاحتفاظ في اكتساب المعجمات لدى البالغين من خلال القراءة، تم اقتراح نهج احتمالي كمنهجية للغة الثانية لإنتاج نص مختلط بالشفرة12. يتم دمج وحدة القاموس وتستخدم لإجراء اختبارات على مصنفات مراقبة مختلفة للتحكم في خلط الشيفرة على مستوى الكلمات13.
استخدموا مجموعة متنوعة من المقاييس لتحليل أنماط تبديل الشيفرة واكتشفوا أن نماذج الشبكات العصبية لكل من الإسبانية-الإنجليزية والهندية-الإنجليزية أدت أداء أسوأ من نموذج الحقول العشوائية الشرطية (CRF) بفارق 2.5 و3.5 نقطة مئوية على التوالي،14.
باستخدام معجم ثنائي اللغة ونص إنجليزي كمدخل، تبني الطريقة رسم بياني عوامل فوق الإشارات المعجمية لإنتاج نص متحول بالشيفرة يحسن معامل "قابلية التعلم" المعين. في هذه الورقة، يسعون لفهم مفاهيم صندوق أدوات CanVEC بشكل أفضل بناء على أزواج اللغات من بيانات الشفرات المبدلة بالهندية والإنجليزية. حققوا بنجاح درجة F1 بنسبة 87.99 بالمئة، دقة 15.16.
يفحص المؤلفون أولا مزج الشيفرة بين الغوجاراتية والإنجليزية17، مطبقين خط أنابيب من ثلاث مراحل لتحديد لغة كل رمز، وتطبيع التهجئة، وإعادة نقل المقاطع إلى الخطوط الأصلية. ثم يحولون تركيزهم إلى مجموعة هندية-إنجليزية18، حيث يقدمون خوارزميات اكتشاف المشاعر الجديدة المصممة خصيصا لتناسب هياكل الجمل ثنائية اللغة. لدعم التجارب المضبوطة، يتم توليد نص مختلط بالشيفرة الاصطناعية عن طريق تدريب نماذج تخطي-جرام على بيانات أحادية اللغة ودمج المخرجات19.
بعد ذلك، تتم معالجة مجموعة بيانات وسائل التواصل الاجتماعي20 عبر طريقة تعريف قائمة على القواعد على مستوى الكلمة، مما يحقق أداء قويا دون الحاجة إلى بيانات تدريب مشروحة يدويا21. لتوسيع النطاق، استفادت إحدى الدراسات من مجموعة كبيرة من الإنجليزية والهندية والبنغالية والأسامية من منصات مثل Facebook22 لتقييم مجموعة من تقنيات الوسم على مستوى الكلمات. استنادا إلى ذلك، يقوم إطار عملآخر 23 بالتبديل الديناميكي بين اللغات لاكتشاف العبارات المدمجة أو المستعارة بدقة عالية. في المجال الزراعي، يتم تصنيف التعليقات بالبنجابية-الإنجليزية باستخدام عدة نماذج - من بينها، يوفر مصنف n-gram أفضل دقة24. بالنسبة لنظام CMST السنهالية-الإنجليزية، تتم مقارنة المتعلمين الجماعيين (الغابة العشوائية، SVM، بايز الساذج، شجرة القرار، الانحدار اللوجستي)، حيث تبرز الغابة العشوائية كأفضل أداء25، بينما تحقق التضمين على مستوى الشخصية مع SVMs نتائج قوية في الزوجين التاميليين-الإنجليزيين والمالايالام-الإنجليزية26. أخيرا، يقدم مشروع Crúbadán27 كجهد واسع النطاق لبناء مجموعات لغوية تعاني من نقص الموارد من خلال الزحف عبر الويب، مما يمهد الطريق لأبحاث مزج الشفرات المستقبلية.
| مجموعة البيانات | النتائج الرئيسية | الدقة/النتيجة F1/الدقة/التقييم/الاستدعاء |
| مجموعة بيانات هندية-بنغالية-إنجليزية مأخوذة من منشورات فيسبوك | تسليط الضوء على تحديات تحديد اللغة في نص وسائل التواصل الاجتماعي على مستوى الكلمة | 89.30% |
| مقالات إخبارية ووثائق | تم تنفيذ ذلك بفعالية باستخدام N-grams لتحديد اللغة | 0.99% |
| مجموعات البيانات الهندية المختلطة بالرموز | إظهار الدقة الجيدة في تحديد اللغة على مستوى الكلمة | غير مبلغ (غير مبلغ) |
| مجموعات البيانات المستندة إلى ويكيبيديا | اكتشاف محول الرموز على مستوى الرمز قوي | غير مبلغ (غير مبلغ) |
| تغريدات هندية-إنجليزية | الأداء تحسنت في تصنيف المشاعر للهندية والإنجليزية المختلطة بالرموز | 0.78% |
| المجموعات متعددة اللغات | إطار تعريف اللغة الأساسي | 78.00% |
| Code_mixed بيانات الإنجليزية-التيلجو | حقق CRF أفضل أداء | 89.30% |
| النص المختلط بين الإنجليزية والبودو | حقق دقة عالية على مستوى الكلمات | 92.00% |
| الأبجوت المختلطة بين الغوجاراتية والهندية | دقة تحديد اللغة على مستوى الجملة هي ≈92٪ | 92.00% |
| تغريدات هولندية-إنجليزية | حققت نماذج DTC والقواعد تصنيفا في الفورمولا 1 ≈0.95 | 95.00% |
| مجموعات البيانات المبدلة بالشيفرة | الأداء التنافسي عبر النماذج | غير مبلغ (غير مبلغ) |
| نص مختلط بالشيفرة الاصطناعية | تحسين التعلم المعجمي | غير مبلغ (غير مبلغ) |
| النص المختلط بين الإنجليزية والكانادية | التعريف التلقائي الفعال | غير مبلغ (غير مبلغ) |
| TRAC-1، مجموعات بيانات هينغليش | تفوق CRF في نماذج الشبكات العصبية | 91.00% |
| البيانات الإلكترونية متعددة اللغات | تحديد دقيق للغة على مستوى الكلمة | 88.00% |
| وسائل التواصل الاجتماعي الهندية-الإنجليزية | دقة عالية في تحديد اللغة الهندية-الإنجليزية | 0.93% |
| الشفرة الإنجليزية-الغوجاراتية - مختلطة | المعالجة الفعالة ثنائية اللغة | |
| مجموعات بيانات مختلطة بالشيفرة على وسائل التواصل الاجتماعي | تحسين اكتشاف المشاعر | 0.90% |
| البيانات التركيبية المختلطة بالشيفرة | تمثيلات تضمين قوية | غير مبلغ (غير مبلغ) |
| نص وسائل التواصل الاجتماعي المختلط بين الكونكانية والإنجليزية | أداء قوي بدون تعليقات توضيحية | 0.89% |
| مجموعة بيانات مختلطة بالشيفرة من تويتر | تحسين الكشف عن المفاتيح | 90.20% |
| الأسامية–البنغالية–الهندية–الإنجليزية | تحديد دقيق للغات متعددة اللغات | 91.00% |
| وسائل التواصل الاجتماعي - نص مختلط بالشيفرة | تقييم F1 ≈0.95 | 0.95% |
| بيانات مختلطة بين الشفرة الإنجليزية والبنجابية | كان نموذج N-gram يؤدي بشكل أفضل | 0.88% |
| بيانات مختلطة بالشفرة السنهالية-الإنجليزية | حقق RF أفضل دقة | 0.92% |
| تعليقات على فيسبوك على الرموز المختلطة | تحسين LID على مستوى الكلمة | 0.93% |
| مجموعة كروبادان | تمكين البحث اللغوي منخفض الموارد | غير مبلغ (غير مبلغ) |
| مجموعات البيانات المختلطة بالشيفرة | الأداء الجيد يظهر في تحديد اللغة على مستوى الكلمة | 0.94% |
الجدول 1: ملخص الأدب المختلط باللغات الرمزية.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تم جمع النص المختلط والشفرات بالإنجليزية وكوكبوروك يدويا من المحادثات المحلية والمنشورات المتاحة للجمهور على منصات التواصل الاجتماعي. لم يتم جمع أي معلومات شخصية أو حساسة. اتبعت جميع الإجراءات إرشادات أخلاقية مؤسسية.
3. التصميم والتنفيذ
3.1 خوارزمية
3.1.1 لكل رمز في الجملة (S):
a. باستخدام قاموس التردد، يتم حساب احتمال المعجم Plexi .
b. استنادا إلى نموذج N-غرام، يتم حساب احتمال Pchar القائم على الحروف
ج. الاستيفاء الموزون لكليهما:
Pمجتمعة = λlexi Plexi + λchar Pchar
3.1.2. تم تخزين تركيبة الاحتمالية Pمجتمعة لكل رمز كاحتمال انبعاث.
3.1.3. تطبيق خوارزمية فيتيربي:
a. معطى الابتدائية مع احتمالات اللغة الابتدائية.
b. لكل رمز:
i. حساب انتقالعدد P (استمرار نفس اللغة).
وتحول P (احتمالية تبديل اللغة).
ii. اختر مسار اللغة وتعظيم احتمال التسلسل.
3.1.4. إخراج تسلسل اللغة L ذو الاحتمالات القصوى مع أعلى احتمال إجمالي.
3.2 البيئة الحاسوبية
تم تنفيذ جميع التجارب باستخدام بايثون 3.10 على منصة Google Colab. استخدم النظام مجموعة من حزم بايثون الأساسية مثل NumPy وPandas وMatplotlib لمعالجة وتصور البيانات، وscikit-learn (الإصدار 1.3) لإجراء التنبؤات والتحليلات الإحصائية. تم تنفيذ دمج قاموس التردد، ونمذجة n-gram الحرفي، وفك ترميز Viterbi باستخدام سكريبتات بايثون مخصصة. تم تدريب النموذج واختباره على مجموعة بيانات مكونة من 10,000 جملة، مع تقسيم 70/30 للتدريب والاختبار.
3.3 تحديد اللغة
بمجرد أن يتم تحويل جملة إلى رمز، تقرر وحدة تحديد اللغة ما إذا كان كل رمز مكتوبا بالكوكبوروك أو الإنجليزية. يتم توضيح البنية الكاملة للنظام في الشكل 1. ثم يستخدم هذا التعيين اللغوي لتحديد أي وحدات النسخ هي المناسبة. عن طريق دمج البيانات من نموذج الحرف n-gram وقاموس التردد، يتم تحديد لغة الرمز.
نظرا للفروق الإملائية الكبيرة بين اللغتين المذكورة أعلاه، فإن المصنف الذي يستخدم فقط معلومات من الرمز نفسه، دون أي ميزات سياقية، يؤدي أداء جيدا بالفعل. ومع ذلك، بعد التعيين الأولي، يتم تطبيق مصنف آخر يستخدم خوارزمية فيتيربي. يقلل هذا المصنف الثاني من سوء تصنيف التجانس بين اللغات ويفضل مجموعات الكلمات التي تنتمي إلى نفس اللغة.

الشكل 1: أنماط على مستوى الكلمة ومعاقبة تغييرات اللغة باستخدام نظام الخوارزميات فيتيربي. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: طريقة تحديد الجمل المختلطة بالشفرة واللغة. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
جمعنا البيانات من مجموعة Crúbadán27 للقاموس ونموذج الحروف. توجد العديد من اللغات، بما في ذلك العديد من اللغات الأقلية مثل كوكبوروك، في هذا المجموعة.
نظرا لأن مجموعة البيانات في مجموعة كروبادان غير كافية لهدفنا، فقد اختبرنا مجموعة بيانات جديدة من كوكبوروك للكتاب المقدس. مقارنة باللغات الأخرى، هناك عدد قليل نسبيا من المصادر المتاحة. وبناء عليه، تم جمع بيانات الجمل المختلطة في هذه الورقة من مجموعات واتساب الناطقة بكوكبوروك مثل اليوبيل البلاتيني، مجموعة السكان، مجموعة الاستعادة الدولية، خومولونغ، جمعية ديباتشارا المعمدانية، منتدى تيبراسا المتحدة (UTF)، زمالة ديباشارا للشباب، كريشنا ناغار (EU)، زمالة أوتشوي المسيحية (UCF)، تيبرا كوسرانغ بودول، جمعية الهندسة القبلية، المعهد الوطني للتكنولوجيا طلاب بوروك، Information Yarung، وجمعية شباب تريبورا أوتشوي (TUYA).
تم جمع ما مجموعه 10,000 جملة مختلطة بالشفرات باللغتين كوكبورك والإنجليزية من هذه المجموعات بين أغسطس 2021 وديسمبر 2023. مصادر وتوزيع نطاق مجموعة البيانات مدرجة في الجدول 2.
| الاسم | إجمالي عدد الكلمات |
| كلمات كوكبوروك من الكتاب المقدس | 718883 |
| الجمل المختلطة بالشفرة الإنجليزية وكوكبوروك | 68789 |
الجدول 2: إجمالي كلمات كوكبوروك.
| اللغة | إجمالي الرموز |
| كوكبوروك (trp) | 711509 |
| الإنجليزية (بالإنجليزية) | 1767141 |
الجدول 3: نموذج الشخصية بوزن 2 جرام.
| لا | إجمالي الجمل المختلطة بالشفرة المستخدمة |
| 1 | 10,768 |
الجدول 4: إجمالي الجمل المختلطة التي تم تدريبها.
تم أخذ نموذج الحروف والقاموس من مجموعة Crúbadán27. هذه المجموعة، التي يمكن الوصول إليها لمجموعة واسعة من اللغات، بما في ذلك العديد من لغات الأقليات، يتم إنشاؤها تلقائيا من خلال البحث عبر الإنترنت عن المواد باللغة المستهدفة. مجموعة كوكبوروك على وجه الخصوص صغيرة نسبيا لأن النهج تم إنشاؤه في البداية لكوكبوروك.
بينما تتوفر أيضا مجموعة من Kokborok والإنجليزية، إلا أنها لم تستخدم عمدا بسبب نقص مجموعات البيانات، خصوصا فيما يتعلق بخلط الشيفرة وقلب الكود. هناك عدة مصطلحات إنجليزية في مجموعة كوكبوروك أيضا؛ بعض هذه الكلمات (بما في ذلك no، do، و o) أكثر شيوعا من الكلمات الإنجليزية.
يقوم القاموس ونموذج اللغة بمهمة التسمية المستقلة عن الكلمات. مهمتنا مشابهة لمهمة كينغ وآخرين.
تستخدم احتمالات المعجم (lex)، والشخصية (ch)، وتسمية الكلمة لإنشاء استيفاء خطي بين ترددات المكونات المعجمية (ch) والمفردية (lex). الاحتمال المجمع (المشط) الناتج عن ذلك موضح في المعادلة (1) أدناه؛ تعرض معلمات الاستيفاء التفصيلية في الجدول 3. يتم تصوير استراتيجية الاستيفاء في الشكل 2.
Pمجتمعة = λlexi · Plexi + λchar · Pchar (1)
حيث 0 ≤ λليكسي، λchar ≤ 1؛ و λlexi + λchar = 1. الكلمات التي لا أساس لها لغوي لها احتمال معجمي منخفض جدا لكنه غير صفري. من المفترض أنه في حال غياب كلمة من كلتا اللغتين، يستخدم نموذج الحرف للتنفيذ بدلا من الاحتمال المعجمي، حتى لو كان λlexi = 1.
طريقتنا في تطوير نموذج الشخصية تعتمد على سلسلة ماركوف الشخصية n-gram لدانينغ (1994). يتم ذلك عن طريق عد n-جرام في بداية ونهاية الرموز على التوالي، لتقدير احتمالات البداية والانتقال.
مقارنة الأداء بين النماذج المدربة 2 جرام و4 جرام موضحة أدناه.
(2)
·
(3)
يمكن ضرب الكلمات الأولى والانتقالية لاحتمالية للحصول على احتمال وجود كلمة باستخدام نموذج اللغة (4).
P(〈w1w2w3〉) = Pالحرف الأولي (〈w1w2) · انتقال P (c3|〈w1w2) · انتقال P (〉|الفوز1الفوز2الفوز3) (4)
لغة كوكبورك غنية جدا بالبادئات واللاحقات، وهي لغة ملتصقة صرفيا حيث تضاف لواحق مثل "o" و"do" و"no" إلى الكلمات الأساسية. يساعد الغرام 2 في التقاط الانتقالات الصرفية المحلية بفعالية عند حدود اللواحق، بينما يمكن ل4 جرام التقاط كلمات كوكبوروك التي لها تبعيات إملائية أطول في الكلمات الجذرية والمركبة مثل Phailaidido وThanlainai وMwchangkha.
ينطبق هذا على مجموعة بيانات كبيرة، مما يزيد من احتمال حدوث عدة مشاكل في نقص البيانات. بالإضافة إلى ذلك، قد لا تظهر تركيبة الأحرف في جميع الحالات، مما قد يؤدي إلى انخفاض الاحتمال إلى الصفر. يستخدم تنعيم لامبدا لحل هذه الأنواع من القضايا بإعطاء كل ngram يحتوي على أحرف غير مرئية قيمة صغيرة مع احتمال غير صفري. قيمة لامبدا محددة عند 0.001.
(5)
حيث N = يمثل كمية الملاحظات المميزة ب n-جرام.
(6)
حيث D= هو عدد الفروق المكتشفة في n-جرام. يفترض أن احتمال وجود n-جرام غير ملحوظ هو نفسه.
(7)
حيث تشير C إلى حجم الحرف.
تم تحديد القيم الأولية ل Pcount وλlexi وλchar تجريبيا بواسطة تحليل التردد لمجموعات كوكبوروك والإنجليزية. أولا، قمنا بتهيئة λlexi إلى 0.5 ووزننا كل من الاحتمالات المعجمية والقائمة على الحروف، مما جعل كلاهما يساهم بنفس القدر في المحاولة الأولى. سمح لنا هذا المستوى من التهيئة بتحديد الدور المقارن للمعجم ونموذج الأحرف n-gram بين مجموعات البيانات.
تم تعيين معامل الانتقال Pcount (مستمر بنفس اللغة) إلى 0.6، بناء على نسبة التسلسلات أحادية اللغة إلى نقاط التبديل في مجموعة البيانات المحددة يدويا. وفرت هذه القيم نقطة انطلاق جيدة للتقارب أثناء الضبط. ثم تم تحسين جميع المعلمات من خلال سلسلة من التجارب المتكررة لتعظيم معامل ماثيوز (MCC)، وهو ما هو مفصل في قسم النتائج.
التعريف السياقي
يستخدم النموذج السياقي الاحتمالات التي تم تهيئتها بالفعل (Pcount و Pswitch) خلال مرحلة التعريف المستقل ويحسنها باستخدام فك ترميز تسلسل Viterbi بحيث تقل تناقضات الانتقال ويتم اكتشاف تبديل اللغة بشكل مثالي.
الناتج التحليلي لنموذج اللغة يعتمد على السياق ويتم الحصول عليه بشكل أساسي من خلال دمج الرمز الحالي مع الرمز التالي واستخدام كل من الرموز السابقة والحالية. نظرا لاحتمال أن تكون كلمتين لهما نفس قيمة التكرار لهما معان متشابهة وتسبب سوء تصنيف، فقد تم استخدام النهج المعتمد على السياق لإيجاد مصطلحات التشابه الموجودة في كلتا اللغتين.
بعض الكلمات مثل "لا"، "دو"، "أو"، "آر"، "دا (يوم)"، "غو"، "سا (يقول)"، "ورد"، "خاتم"، وغيرها الكثير، متشابهة في كلتا اللغتين. نتيجة لذلك، قد يكون من الصعب جدا تحديد اللغة الصحيحة عندما ينشأ هذا النوع من الغموض، وأحيانا يتم تصنيف اللغات بشكل خاطئ.
لمعالجة هذه المشكلات في تحديد اللغة، قدمنا مجموعة من نماذج اللغة باستخدام نموذج ماركوف مخفي تمييزي وتعلم آلي تحت الإشراف. يفترض أن احتمال الانتقال لكلتا اللغتين متساو. بالنسبة ل Pcount بنفس اللغة، فإن الاحتمال المستمر هو المعامل الأساسي الذي يجب إعلانه. من خلال ذلك، يمكننا حساب احتمالية تغيير اللغة.
مفتاح P = 1 − عدد P (8)
التصنيف السياقي باستخدام مسار فيتيربي موضح في الشكل 3. هدف خوارزمية فيتيربي هو تحديد أي من لغات تسلسلات الرموز هي الأفضل وفقا لحسابي Pcount وPswitch.
يتم تطبيق خوارزمية فيتيربي على التصنيف السياقي. يستخدم Pcount و Pswitch لتسمية الحواف، ويتم تصنيف العقد بالاحتمالية النسبية التي يمنحها المصنف الأول.
نظرا لاحتمالية استخدام لغة كوكبوروك الأعلى للمستقبل، سيتم اختيار المسار المتقطع إذا كان المصنف الأول هو الوحيد المستخدم ولم تتوفر معلومات سياقية.
يظهر تأثير التعديل القائم على السياق في الشكل 4. هذا يوضح كيف أنه، في غياب المعلومات السياقية، يمكن التعرف بشكل خاطئ على الكلمات الثانية والثالثة والخامسة في عبارة "الأسبوع القادم o phaisidi do" على أنها الإنجليزية (بالإنجليزية) (مسار متقطع). على الرغم من أن الاحتمالات أكبر قليلا بالنسبة للإنجليزية، إلا أن القيم النسبية متقاربة.
سيتم معاقبة تحولات اللغة، وسيكون احتمال التسلسل أقل من المسار الأمثل لخوارزمية فيتربي إذا أخذنا احتمالات الانتقال في الاعتبار. لذا، فقط الكلمات التي من المرجح أن تكون مصدرها من اللغة الأخرى - بدلا من المصطلحات الشائعة التي تظهر في كلتا اللغتين - يمكنها تحفيز تغييرات لغوية في تسلسلات قصيرة.
تم اختيار معامل الارتباط لماثيوز كمقياس للتقييم لأنه، مقارنة بمقاييس أخرى مثل الدقة والاسترجاع والدقة، فهو أكثر ملاءمة بشكل ملحوظ لمهام التصنيف الثنائية، حيث يأخذ في الاعتبار الإيجابيات الحقيقية والسلبية الحقيقية بالإضافة إلى الإيجابيات الكاذبة والسلبية الكاذبة.
(9)
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
في الجدول 4، عرضنا نتائج MCC وضبط المعلمات ل Ptrp التي حسبت الانحياز الأولي نحو تسلسلات البداية باستخدام كلمات كوكبوروك وحسبت Pcount، وهو احتمال الاستمرار في نفس اللغة.
| λ_lex | Pcount = 0.66 | العد الدقيقي = 0.70 | Pcount = 0.74 | Pcount = 0.79 | Pcount = 0.82 | Pcount = 0.86 | العدد الدقيقي = 0.90 |
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
بينما يظهر النموذج المقترح دقة تبلغ 93.15٪ على مستوى الكلمات، يكشف التحليل الدقيق للأخطاء عن عدة أنماط متكررة تبرز تحديات التعرف على اللغات المختلطة بين الإنجليزية والكوكبوروك.
باستخدام كلمات مستعارة وكلمات غامضة
جزء كبير من الأخطاء يأتي من استخدام كلمات إنجليزية مستعارة، والتي أصبحت شائعة في استخدام كوكبوروك. كلمات مثل no، do، o، go، ring، rose، و وتظهر كثيرا ف...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
المؤلفون لا يفرضون أي تضارب مصالح.
نود أن نشكر المتحدثين المحليين الأصليين، ومجموعات واتساب، والمنظمات، واتحادات الطلاب، وجمعية الكتاب المقدس في الهند لمساعدتنا في الحصول على مجموعة البيانات الخام للجمل المختلطة بالشيفرة. نحن أيضا ممتنون لقسم علوم وهندسة الحاسوب في المعهد الوطني للتكنولوجيا في أروناشال براديش، وجامعة لوفلي المهنية لتوفير المنصة لنا لفحص واختبار مجموعة بياناتنا.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| راسبيري باي 4 | مؤسسة راسبيري باي | RPI4-MODBP-4GB | يستخدم لمعالجة اللغة منخفضة الموارد |
| بطاقة MicroSD بحجم 64GB | سانديسك | SDSQUAR-064G-GN6MA | لتخزين أنظمة التشغيل ومجموعات البيانات |
| مزود الطاقة 5V/3A | الرسوب باي الرسمي | SC0218 | لتشغيل لوحة Pi |
| ميكروفون USB | بويا | BY-M1 | لإدخال الصوت في جمع بيانات اللغة |
| الشاشة (HDMI) | إل جي | 22MK600M | عرض الإخراج أثناء الاختبار |
| لوحة مفاتيح و تركيبة الفأر | لوجيتك | MK270 | التحكم في الواجهة |
| دونجل الواي فاي (إذا كان Pi 3) | TP-Link | TL-WN725N | نقل البيانات اللاسلكي (إذا لم يكن هناك واي فاي مدمج) |
| بيئة تطوير بايثون (Thonny) | المصدر المفتوح | - | بيئة تطوير البرمجة |
| مجموعة بيانات المعجم | بناء مخصص | - | زوج كوكبوروك-الإنجليزية |
| مجموعة بيانات N-gram | بناء مخصص | زوج لغة الإنجليزية-كوكبوروك | |
| المختلط بالشيفرة والتبديل بالشيفرة | بناء مخصص | 10,000 حكم | تم جمعها من نصوص وسائل التواصل الاجتماعي، واتساب، مجموعات من الواتساب، المنظمات غير الحكومية، الكتاب المقدس، وغيرها |
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن