مقالة منهجية

تحديد اللهجة الأجنبية ومكبر الصوت الشرعي في تشكيلات الصوت: تأثير الميزات الصوتية القائمة على العروض

1.5K مشاهدة

DOI:

10.3791/66313

سبتمبر 27, 2024

في هذه المقالة

ملخص

يهدف هذا البحث إلى إجراء مقارنة بين L1-L2-English و L1-L2 البرتغالية للتحقق من مدى تأثير اللهجة الأجنبية في حساب كل من المقاييس والمعلمات الصوتية العروضية ، وكذلك لاختيار الصوت المستهدف في تشكيلة الصوت.

الملخص

يهدف هذا البحث إلى فحص كل من السمات الصوتية العروضية والارتباطات الإدراكية للغة الإنجليزية ذات اللهجة الأجنبية والبرتغالية البرازيلية ذات اللهجة الأجنبية والتحقق من كيفية ارتباط إنتاج المتحدثين لللكنات الأجنبية والأصلية بتصور المستمعين. في المنهجية ، أجرينا إجراء إنتاج الكلام مع مجموعة من المتحدثين الأمريكيين باللغة البرتغالية البرازيلية L2 ومجموعة من المتحدثين البرازيليين باللغة الإنجليزية L2 ، وإجراء إدراك الكلام الذي أجرينا فيه مجموعات صوتية لكلتا اللغتين. بالنسبة للتحليل الإحصائي لإنتاج الكلام ، قمنا بتشغيل نماذج مضافة معممة لتقييم تأثير مجموعات اللغات على كل فئة (متري أو صوتي عرودي) من الميزات التي يتم التحكم فيها من أجل تأثير التنعيم للمتغيرات (المتغيرات المساعدة) من الفئة المقابلة. بالنسبة للتحليل الإحصائي لإدراك الكلام ، أجرينا اختبار Kruskal-Wallis واختبار Dunn اللاحق لتقييم تأثير أصوات التشكيلات على الدرجات التي يحكم عليها المستمعون. ومع ذلك ، أجرينا اختبارات التشابه الصوتي (الصوتي) بناء على مسافات جيب التمام والإقليدس. أظهرت النتائج اختلافات صوتية معنوية بين المجموعات اللغوية من حيث تباين f0 والمدة وجودة الصوت. بالنسبة للتشكيلات ، أشارت النتائج إلى أن السمات العروضية ل f0 والشدة وجودة الصوت مرتبطة بأحكام المستمعين المتصورة.

المقدمة

اللهجة هي جانب بارز وديناميكي للتواصل والطلاقة ، سواء في اللغة الأم (L1) أو في لغة أجنبية (L2) < sup class = "xref" >1. تمثل اللكنة الأجنبية السمات الصوتية L2 للغة المستهدفة ، ويمكن أن تتغير (بمرور الوقت) استجابة لتجربة المتحدث L2 ، وأسلوب التحدث ، وجودة الإدخال ، والعرض ، من بين متغيرات أخرى. يمكن قياس اللهجة الأجنبية على أنها درجة (عددية) من الاختلاف بين الكلام L2 الذي ينتجه متحدث أجنبي واللهجة المحلية أو المرجعية للغة المستهدفة< sup class = "xref" >2,3,4,5.

يهدف هذا البحث إلى فحص كل من السمات الصوتية العروضية والارتباطات الإدراكية للغة الإنجليزية ذات اللهجة الأجنبية والبرتغالية البرازيلية ذات اللهجة الأجنبية (BP) ، وكذلك التحقق من مدى ارتباط إنتاج المتحدثين لللكنات الأجنبية والأصلية بتصور المستمعين. أظهرت الأبحاث السابقة في مجال الطب الشرعي متانة حروف العلة والحروف الساكنة في تحديد اللهجة الأجنبية على أنها إما مستقرة لتحليل طويل الأمد للفرد (The Lo Case6) أو تشير إلى دقة الهوية العالية للمتحدث (The Lindbergh Case7). ومع ذلك ، فإن استكشاف الميزات الصوتية العروضية بناء على المدة والتردد الأساسي (f0 ، أي الارتباط الصوتي للنغمة) والشدة وجودة الصوت (VQ) قد اكتسب اهتماما متزايدا< فئة الدعم = "xref" >8،< sup class = "xref">9. وبالتالي ، فإن اختيار الميزات الصوتية العروضية في هذه الدراسة يمثل وسيلة واعدة في مجال صوتيات الطب الشرعي< sup class = "xref" >8،10،11،12,13.

البحث الحالي مدعوم بدراسات مخصصة لللكنات الأجنبية كشكل من أشكال التنكر الصوتي في قضايا الطب الشرعي< sup class = "xref" >14,15 ، وكذلك في إعداد التشكيلات الصوتية للتعرف على المتحدث< فئة sup = "xref">16,17. على سبيل المثال ، لعب معدل الكلام دورا مهما في تحديد المتحدثين الألماني والإيطالي والياباني والبرازيلي للغة الإنجليزية < sup class = "xref" > 18 ، < sup class = "xref" > 19 ، < sup class = "xref" > 20 ، < sup class = "xref" > 21 ، < sup class = "xref" > 22. إلى جانب معدل الكلام ، تتحدى الميزات الطيفية و f0 طويلة المدى المتحدثين البارعين في L2 مع الإلمام باللغة المستهدفة لأن الدماغ والقواعد المعرفية تعاني من عجز في الذاكرة والانتباه والعاطفة ، مما ينعكس في الأداء الصوتي للمتحدث أثناء المنعطفات الطويلة للكلام < فئة sup = "xref" >23. وجهة نظر اللهجات الأجنبية في مجال الطب الشرعي هي أن تعريف ما يبدو حقا وكأنه لهجة أجنبية يعتمد إلى حد كبير على عدم إلمام المستمع بدلا من الحصول على درجة لا تتجاوز إلى أقصى حد من الكلام بلكنة أجنبية < sup class = "xref" >24.

في المجال الإدراكي ، فإن أداة الطب الشرعي الشائعة المستخدمة منذ منتصف التسعينيات للتعرف على المجرمين هي تشكيلة الصوت (التعرف السمعي) ، والتي تشبه التعرف البصري المستخدم لتحديد الجاني في مسرح الجريمة < فئة الدعم = "xref">16,< sup class = "xref">25. في تشكيلة صوتية ، يتم تقديم صوت المشتبه به جنبا إلى جنب مع الأصوات المماثلة في الجوانب اللغوية الاجتماعية مثل العمر والجنس والموقع الجغرافي واللهجة والحالة الثقافية - لتحديد هويتها من قبل شاهد الأذن. يعتمد نجاح أو فشل تشكيلة الصوت على عدد عينات الصوت ومدة العينة25,26. علاوة على ذلك ، بالنسبة لعينات العالم الحقيقي ، يعتبر أن جودة الصوت تؤثر باستمرار على دقة التعرف على الصوت. يمكن أن تؤدي جودة الصوت الرديئة إلى تشويه الخصائص الفريدة لفئة الصوت 27. في حالة تشابه الصوت ، يمكن أن تربك التفاصيل الصوتية الدقيقة القائمة على f0 المستمع أثناء التعرف على الصوت < sup class = "xref" >28,29. تمتد هذه الميزات الصوتية إلى ما هو أبعد من f0 وتشمل عناصر المدة ، والسمات الطيفية للكثافة و VQ30. تعد هذه النظرة للميزات العروضية المتعددة أمرا بالغ الأهمية في سياق مقارنة صوت الطب الشرعي لضمان تحديد دقيق لمكبر الصوت < sup class = "xref" >9 ، < sup class = "xref" > 14 ، < sup class = "xref" > 15 ، < sup class = "xref" > 29 ، < sup class = "xref" >31.

باختصار ، أظهرت الدراسات في علم الصوتيات الشرعي بعض الاختلاف فيما يتعلق بتحديد اللهجة الأجنبية على مدى العقود الماضية. من ناحية أخرى ، لا يبدو أن اللهجة الأجنبية تؤثر على عملية تحديد المتحدث < sup class = "xref" >32,33 (خاصة إذا كان المتحدث غير معتاد على اللهجة الأجنبية المستهدفة< sup class = "xref">34). من ناحية أخرى ، هناك نتائج في الاتجاه المعاكس< sup class = "xref" > 12 ، < sup class = "xref" > 34 ، < up class = "xref" > 35.

البروتوكول

نال هذا العمل موافقة لجنة أخلاقيات البحوث البشرية. علاوة على ذلك، تم الحصول على موافقة مستنيرة من جميع المشاركين في هذه الدراسة لاستخدام بياناتهم ونشرها.

1. إنتاج الكلام

ملاحظة: قمنا بجمع كلام من مهمة قراءة لـ "اللغة الأولى: الإنجليزية-اللغة الثانية: البنجابية" أنتجها من قبل المجموعة 1الـ أمورنيومأمريكي هـالإنجليزية (من الولايات المتحدة الأمريكية) Sالمتحدثين (الإنجليزية الأمريكية - الجنوب)، وباللغتين "اللغة الأولى بنغالية-اللغة الثانية إنجليزية" التي أنتجها المجموعة 2الـ حمالة صدربرازيلي Sمكبرات الصوت (Bra-S). انظر الشكل 1 لمخطط تدفقي لإنتاج الكلام.

figure-protocol-1
الشكل 1: مخطط انسيابي تخطيطي لعملية إنتاج الكلام. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

  1. المشاركون
    1. تحديد الـ عدد المشاركين، الـ اللغة (اللغة الأولى إنجليزية، اللغة الثانية برتغالية؛ اللغة الأولى برتغالية، اللغة الثانية إنجليزية)، الـ الجنس (أنثى أو ذكر)، الـ العمر (المتوسط، الانحراف المعياري)، الـ خصائص المجموعة (المتخصصون أو طلاب المرحلة الجامعية)، و الـ مستوى كفاءة اللغة الثانية (متقدم أو متقدم جداً) لكل مجموعة.
      ملحوظة: في البحث الحالي، اعتبر كل من AmE-S وBra-S متقنين للغة الثانية (حيث صُنفت كلتا المجموعتين ضمن المستوى B2-C1).36كانت مجموعة AmE-S قد عاشت لمدة عامين في البرازيل عند إجراء التجارب، بينما عاشت مجموعة Bra-S لأكثر من عامين في الولايات المتحدة الأمريكية عند إجراء التجارب. وخلال فترة إقامتهما في الخارج، اعتادت المجموعتان على التحدث بلغتيهما الثانية (L2) لأغراض الدراسة والعمل لمدة 6 أيام في الأسبوع على الأقل، وبمعدل يتراوح بين 4 إلى 5 ساعات يومياً تقريباً.
    2. يتم توزيع المشاركين على غرفة هادئة ومريحة، وتقديم مواد القراءة المخصصة لكل مجموعة.
  2. جمع البيانات
    ملاحظة: يجب جمع بيانات الكلام من مهمة قراءة باللغات التالية: اللغة الأولى الإنجليزية واللغة الثانية البرتغالية البرازيلية؛ واللغة الأولى البرتغالية البرازيلية واللغة الثانية الإنجليزية. اسمح للمشاركين بقراءة النصوص مسبقاً إذا لزم الأمر.
    1. إجراءات التسجيل
      1. سجل بيانات الكلام في مكان هادئ تتوفر فيه الظروف الصوتية المناسبة.
      2. استخدم جهاز تسجيل صوتي رقمي (انظر إلى الـ جدول المواد)37 وميكروفون قلبي أحادي الاتجاه ومعزول كهرومغناطيسيًا (انظر إلى الـ جدول المواد)38.
      3. سجل البيانات الصوتية في '.wavنموذج.
      4. اضبط معدل أخذ العينات عند 48 كيلوهرتز ومعدل التكميم عند 16 بت.
        ملاحظة: يتم تطبيق تنسيق الصوت وإعدادات معدلات أخذ العينات والكمية الموصوفة في الخطوتين 1.2.1.3 و1.2.1.4 لضمان الجودة العالية وتقليل الضوضاء للحفاظ على السمات الطيفية المستخدمة في التحليل الصوتي اللاحق.
  3. التحليل الصوتي
    ملاحظة: قسّم إجراءات التحليل الصوتي إلى ثلاث خطوات: المحاذاة القسرية، وإعادة المحاذاة، واستخلاص السمات الصوتية.
    1. اكتب النسخ اللغوي (في ملف '.يرجى تزويدي بالنص الإنجليزي الذي ترغب في ترجمته. أنا جاهز للبدء في تحويل المحتوى العلمي والتعليمي الخاص بـ JoVE إلى اللغة العربية بدقة أكاديمية وبما يتوافق مع المعايير المهنية المذكورة.ملف) لكل ملف صوتي.
    2. قم بتمييز الزوج من 'يرجى تقديم النص المصدر المراد ترجمته.'/'.wavملفات تحمل الاسم ذاته (على سبيل المثال، 'my_file.موجة صوتية'/ 'my_file.يرجى تقديم النص المراد ترجمته.').
      ملاحظة: لتعزيز أداء الإجراء الموضح في القسم 1.3.7، يُوصى بشدة بأن تمثل الأحرف الثلاثة الأولى من علامات ملفات ".txt/.wav" الـ اللغة, لهجة، أو نبرة الصوتبينما تشير الرموز من الرابع إلى السادس إلى الجنس (على سبيل المثال، EL1FEM لـ هـالإنجليزية المستوى ١ أنثىبيرة). بدءاً من الحرف السابع فصاعداً، يجب على المستخدم تحديد رقم المتحدث (على سبيل المثال، 001 (للمتحدث الأول). وبناءً على ذلك، يكون الزوج الأول من ملفات ‘.txt/.wav’ هو EL1FEM001.
    3. أنشئ مجلداً لكل زوج لغوي L1-L2.
      ملاحظة: مجلد للغة الإنجليزية L1-L2 ومجلد للغة البرازيلية BP L1-L2.
    4. تحقق من أن جميع أزواج الملفات التي تتبع نفس اللغة موجودة في المجلد ذاته.
    5. إجراء المحاذاة القسرية.
      1. قم بالدخول إلى واجهة الويب الخاصة بأداة المحاذاة القسرية Munich Automatic Segmentation (MAUS) (الويبفئران (MAUS)39 في https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. اسحب وأفلِت كل زوج من .ملف صوتي بتنسيق wav / .يرجى تقديم النص الذي ترغب في ترجمته. الملفات من الـ المجلد إلى المستطيل المتقطع في ملفات (أو انقر داخل المستطيل، الشكل 2أ).
      3. انقر على رفع زر لتحميل الملفات في برنامج المحاذاة (انظر السهم الأحمر في الشكل 2أ).
      4. حدد الخيارات التالية في الـ خيارات الخدمة القائمة (الشكل 2ب): G2P-MAUS-PHO2SYL لـ اسم مسار العمل؛ الإنجليزية (الولايات المتحدة) (لـ اللغة(إذا بيانات اللغة الإنجليزية L1-L2; الإيطالية (IT) (لـ اللغةإذا كانت بيانات ضغط الدم L1-L2.
        ملاحظة: اخترنا اللغة "الإيطالية" لبيانات البرتغالية البرازيلية (BP) لأن webMAUS لا يوفر نماذج صوتية مسبقة التدريب للمحاذاة القسرية للغة البرتغالية البرازيلية. وتفترض الدراسات الصوتية أن الفونولوجيا الإيطالية تمتلك مخزوناً متماثلاً إلى حد ما يتكون من سبعة أصوات متحركة، تماماً مثل اللغة البرتغالية البرازيلية.40وكذلك التشابهات الصوتية الصامتة41,42.
      5. احتفظ بالخيارات الافتراضية لـ "تنسيق المخرجات" و"الاحتفاظ بكل شيء".
      6. تحقق من تشغيل مربع خيار للموافقة على شروط الاستخدام (انظر السهم الأخضر في الشكل 2ج).
      7. انقر فوق تشغيل خدمة الويب زر لتشغيل الملفات المرفوعة في برنامج المحاذاة.
        ملاحظة: بالنسبة لكل ملف صوتي، يُرجع برنامج المواءمة القسري MAUS ملف Praat TextGrid كائن (ملف '.txt' بتنسيق Praat مسبق الإعداد، يحتوي على تعليقات توضيحية للكلمات، والمقاطع الصوتية الفونولوجية، والفونيمات، بناءً على النسخ اللغوي المستخرج من ملف '.txt' الموصوف في الخطوة 1.3.1).
      8. انقر فوق تنزيل كملف ZIP زر لتحميل ملفات TextGrid كملف مضغوط (الشكل 2 ج).
        ملاحظة: تأكد من تحميل ملفات TextGrid المضغوطة في المجلد نفسه الذي توجد به الملفات الصوتية.
      9. استخرج ملفات TextGrid لإعادة المحاذاة لاحقاً في برنامج التحليل الصوتي43.
    6. إجراء إعادة المحاذاة.
      1. قم بالوصول إلى نص Praat VVUnitAligner البرمجي وتنزيله.44 من https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat.
      2. تحقق من أن جميع أزواج الملفات من اللغة نفسها وVVUnitAligneيرجى تقديم النص الذي ترغب في ترجمته. توجد النصوص البرمجية في المجلد ذاته.
        ملاحظة: مجلد للملفات الإنجليزية L1-L2 وبرنامج VVunitAligner، ومجلد لملفات BP L1-L2 وبرنامج VVunitAligner.
      3. افتح برنامج التحليل الصوتي.
      4. انقر Praat | فتح نص Praat البرمجي… لاستدعاء البرنامج النصي من الـ نافذة الكائن.
      5. انقر على تشغيل اضغط على الزر مرة واحدة.
        ملاحظة: نموذج يسمى محاذاة المقاطع الصوتية ستظهر على الشاشة نافذة تحتوي على إعدادات استخدام السكربت (الشكل 3A).
      6. انقر فوق اللغة زر للاختيار من بين لغات 'الإنجليزية (الولايات المتحدة)'، أو 'البرتغالية (البرازيل)'، أو 'الفرنسية (فرنسا)'، أو 'الإسبانية (إسبانيا)'.
      7. انقر على تقسيم القطع زر للاختيار من بين إجراءات التجزئة: "تلقائي"، أو "قسري (يدوي)"، أو "بلا".
      8. تحقق من حفظ ملفات TextGrid خيار حفظ ملفات TextGrid الجديدة تلقائياً.
      9. انقر موافق | تشغيل أزرار لإعادة محاذاة الوحدات الصوتية من الخطوة 1.3.5.7.
        ملحوظة: بالنسبة لكل ملف صوتي، سيقوم برنامج VVUnitAligner بإنشاء ملف TextGrid جديد للقسم 1.3.7 (الشكل 3B).
    7. قم بإجراء الاستخراج التلقائي للميزات الصوتية.
      1. قم بالوصول إلى نص SpeechRhythmExtractor البرمجي وتنزيله45 من استخدام الرابط https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat للاستخراج التلقائي للسمات الصوتية-العروضية.
      2. قم بإنشاء مجلد جديد وضع فيه برنامج SpeechRhythmExtractor إلى جانب جميع أزواج ملفات الصوت/TextGrid لجميع اللغات.
      3. افتح برنامج التحليل الصوتي.
      4. انقر Praat | فتح نص برمجي في Praat… لاستدعاء السكربت من الـ نافذة الكائن.
      5. انقر على تشغيل اضغط على الزر مرة واحدة فقط.
        ملاحظة: ستظهر على الشاشة نافذة تحتوي على إعدادات البرنامج النصي. في مربعات أسماء ملفات المخرجات بصيغة '.txt'، قم بتغيير أسماء الملفات وفقاً لذلك أو اترك الأسماء الافتراضية.
      6. تحقق من معايير جودة الصوت خيار حفظ الـ ملف المخرجات VQ لجودة الصوت (الشكل 3ج).
        ملاحظة: ملف المخرجات الثاني هذا (الـ ملف المخرجات VQ) تحتوي على معالم الفرق بين الـ 1يرجى تزويدي بالنص المراد ترجمته. و ٢nd التوافقيات (H1-H2) وذروة البروز السيبسترالي (CPP)9.
      7. تحقق من الهدف اللغوي خيار للاختيار من بين التسميات 'اللغة'، أو 'اللهجة'، أو 'اللكنة' (الشكل 3ج).
      8. تحقق من وحدة خيار لاختيار ميزات التردد الأساسي (f0) بالهرتز أو بأنصاف التون (Semitones)الشكل 3ج).
      9. قم بضبط القيم لـ عتبة F0، والحدود الدنيا والقصوى لـ f0 (الشكل 3ج).
        ملاحظة: ما لم يكن للبحث أغراض محددة أو ميزات صوتية محددة مسبقاً، يُوصى بشدة بترك معلمات الخطوة 1.3.7.9 بالقيم الافتراضية.
      10. انقر موافق | تشغيل للاستخلاص التلقائي للميزات الصوتية.
        ملاحظة: النص مستخرج إيقاع الكلام (SpeechRhythmExtractor) يُنتِج ملف '.txt' مفصولاً بعلامات جدولة (ملف المخرجات/ ملف المخرجات VQ) التي تحتوي على السمات الصوتية المستخرجة من المتحدثين.
  4. التحليل الإحصائي
    1. قم بتحميل جدول البيانات الذي يحتوي على السمات الصوتية إلى برنامج R46 البيئة (أو أي برنامج/بيئة إحصائية مختارة).
    2. إجراء الإحصاءات غير المعلمية باستخدام النماذج المضافة العامة (GAMs).
      1. إجراء النماذج المضافة العامة (GAMs) في برنامج R.
      2. اكتب الأوامر التالية ثم اضغط على إدخال.
        library(mgcv)
        model = gam(the ميزة مقياسية/صوتية عروضية في التحليل ~ الـ اللغة + (المختار الميزة المتريةبواسطة الـ اللغة) + أخرى السمات المترية/الصوتية العروضية، البيانات = الـ إطار البيانات)
        ملاحظة: لقد قررنا إجراء الإحصاءات الاختبارية للبروتوكول باستخدام لغة البرمجة R نظراً لشعبيتها المتزايدة بين علماء الصوتيات (واللغويين) في المجتمع الأكاديمي؛ حيث استُخدمت R على نطاق واسع في أبحاث العمل الميداني الصوتي.47ضع في اعتبارك أن الخطوة 1.4.2.2 تحتوي على رمز برمجي زائف (pseudo-code). اكتب الكود وفقاً لمتغيرات البحث.

figure-protocol-2
الشكل 2: لقطة شاشة للمحاذاة الصوتية باستخدام أداة المحاذاة القسرية MAUS. (A) المستطيل المتقطع مخصص لسحب وإفلات ملفات 'my_file.wav'/' my_file.txt' أو النقر بداخله للبحث عن هذه الملفات من المجلد؛ ويشير السهم الأحمر إلى زر الرفع. (B) الملفات المرفوعة من اللوحة A (انظر السهم الأزرق)، ومسار المعالجة المراد استخدامه، ولغة أزواج الملفات، وتنسيق الملف المطلوب استرجاعه، وزر 'true/false' للاحتفاظ بجميع الملفات. (C) مربع اختيار شروط الاستخدام (انظر السهم الأخضر)، وزر Run Web Services، والنتائج (ملفات TextGrid التي سيتم تنزيلها). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-protocol-3
الشكل 3لقطة شاشة لإجراء إعادة المحاذاة. (A(نموذج إعدادات الإدخال لإجراء إعادة المحاذاة.)Bشكل موجي جزئي، ومخطط طيفي عريض النطاق مع كنتور التردد الأساسي f0 (باللون الأزرق)، وست مستويات مقسمة (ومصنفة) كـ المستوى الأولوحدات بداية الحرف المتحرك إلى بداية الحرف المتحرك التالي (V_to_V)؛ بداية الحرف المتحرك (V_to_V)؛ المستوى الثانيوحدات الحروف المصوتة (V)، والحروف الساكنة (C)، والوقف (#)؛ المستوى 3تمثيلات صوتية V_to_V؛ المستوى 4بعض الكلمات من النص؛ المستوى 5: بعض قطع (CH) الكلام من النص؛ المستوى 6: المستوى النغمي الذي يحتوي على أعلى (H) وأدنى (L) نغمة لكل قطعة كلام أنتجتها أنثى متحدثة بالإنجليزية الأمريكية القياسية (AmE-S).سيإعدادات الإدخال للاستخراج التلقائي للسمات الصوتية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

2. إدراك الكلام

ملاحظة: أجرينا أربعة اختبارات لعرض الأصوات باللغة الإنجليزية مع مستمعين أمريكيين وأربعة اختبارات باللغة البرتغالية البرازيلية (BP) مع مستمعين برازيليين. راجع الشكل 4 للاطلاع على مخطط تدفقي لإدراك الكلام.

figure-protocol-4
الشكل 4مخطط تدفقي تخطيطي للإدراك الكلامي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

  1. المشاركون
    1. اختر مشاركين مختلفين لكل مجموعة من بين أولئك الذين شاركوا في بروتوكول إنتاج الكلام.
      ملاحظة: تم اختيار مجموعتين من المشاركين لهذا الجزء من البروتوكول: المجموعة 1الـ أناأمريكي هـالإنجليزية (من الولايات المتحدة الأمريكية) لـالمستمعين (الإنجليزية الأمريكية- ل)، و المجموعة 2الـ صدرةزيليان لـالمستمعين (Bra-L). وفي البحث الحالي، اعتبر كل من AmE-L وBra-L متقنين للغة الثانية (حيث تم تصنيف كلتا المجموعتين ضمن المستوى B2-C1)36 كان أفراد مجموعة (AmE-L) قد عاشوا لمدة عامين في البرازيل عند إجراء هذه الإجراءات. أما أفراد مجموعة (Bra-L) فقد عاشوا لأكثر من عامين في الولايات المتحدة الأمريكية عند إجراء هذه الإجراءات. وخلال فترة إقامتهم في الخارج، اعتادت كلتا المجموعتين التحدث بلغتهم الثانية لأغراض الدراسة والعمل (ستة أيام في الأسبوع على الأقل، لمدة تتراوح بين 4 إلى 5 ساعات يومياً تقريباً).
    2. تحديد الـ عدد المشاركين، الـ اللغة (اللغة الأولى الإنجليزية، اللغة الثانية البرتغالية البرازيلية؛ اللغة الأولى البرتغالية البرازيلية، اللغة الثانية الإنجليزية)، الـ الجنس (أنثى أو ذكر)، الـ العمر (المتوسط، الانحراف المعياري)، الـ خصائص المجموعة (المتخصصون أو طلاب المرحلة الجامعية) و الـ مستوى إتقان اللغة الثانية لكل مجموعة.
  2. التشكيلات الصوتية
    ملاحظة: قسم إجراءات صفوف التعرف الصوتية إلى خطوتين مختلفتين: تحضير صفوف التعرف الصوتية وتشغيلها.
    1. قم بإعداد أربع مجموعات صوتية للغة الإنجليزية وأربع مجموعات للغة البرتغالية البرازيلية (BP).
      1. احصل على الملفات الصوتية من المتحدثين في القسم 1: إنتاج الكلام.
      2. تحقق من أن الملفات الصوتية لكل عامل لغوي موجودة في مجلدات منفصلة.
      3. اختر عشوائياً ست قطع صوتية باللغة الإنجليزية كلغة أولى أو باللغة البرتغالية البرازيلية كلغة أولى.
        ملاحظة: تمثل الأصوات الستة في التشكيلة صوت مستهدف واحد و خمس رقائق.
      4. اختر مقطعاً صوتياً باللغة الإنجليزية كلغة ثانية (L2 English) أو باللغة البرتغالية البرازيلية كلغة ثانية (L2 BP) من أحد المتحدثين المدرجين في الخطوة 2.2.1.3.
        ملاحظة: المقطع الصوتي في الخطوة 2.2.1.4 هو الـ الصوت المرجعي٨. يجب أن تكون المقاطع بطول ٢٠ ثانية تقريبًا.
      5. قم بالوصول إلى نص "Praat CreateLineup" البرمجي وتنزيله48 من https://github.com/pabarbosa/prosody-scripts-CreateLineUp
      6. تحقق من وجود الصوت المرجعي للغة الثانية (L2)، والمشتتات للغة الأولى (L1)، والصوت المستهدف للغة الأولى (L1) في المجلد ذاته قبل تشغيل نص CreateLineup البرمجي (الشكل 5).
      7. افتح برنامج التحليل الصوتي.
      8. من الـ نافذة الكائنانقر Praat | فتح نص برمجِيّ في Praat… لاستدعاء السكريبت.
      9. انقر تشغيل | تشغيل.
        ملاحظة: يُرجع البرنامج ملفاً بالترتيب التالي: (صوت المرجع للغة الثانية L2) + (صوت اللغة المستهدفة الأولى L1 والمشتتات موزعة عشوائياً)الشكل 5).
    2. تشغيل عروض مقارنة الأصوات
      1. أنشئ مساحة إلكترونية لاستضافة قوائم الترتيب على أي منصة من اختيارك (على سبيل المثال SurveyMonkey. انظر إلى الـ جدول المواد) لإجراء تشكيلات التعرف على الصوت عن بُعد.
      2. الدخول إلى رابط المساحة الإلكترونية.
      3. قم بتحميل الملفات الناتجة عن نص (CreateLineup) البرمجي إلى المنصة.
      4. قم بتنفيذ الإجراء أمام المشاركين لاختبار كل خطوة.
        ملاحظة: يُوصى بالدخول إلى الرابط مسبقاً وتشغيل مجموعات الاختبار للتحقق من أن كل شيء يعمل بشكل طبيعي.
  3. التحليل الإحصائي
    1. قم برفع جدول البيانات الذي يحتوي على درجات أحكام المستمعين إلى بيئة R (أو أي برنامج/بيئة إحصائية أخرى من اختيارك).
      1. إجراء اختبار كروكسال-واليس (Kruskal-Wallis test) في برنامج R.
      2. اكتب الأوامر التالية ثم اضغط على دخول.
        ​model = kruskal.test(أحكام لكل واحد مجموعة مقارنة الأصوات، البيانات = الـ إطار البيانات)
    2. أجرِ اختبار دان (Dunn's test) للمقارنات البعدية.
      1. إجراء اختبار دان (Dunn's test) في برنامج R.
      2. اكتب الأوامر التالية ثم اضغط على إدخال.
        library(FSA)
        model = dunnTest(أحكام ~ لكل منها مجموعة مقارنة الأصوات، البيانات = data، الطريقة = "بونفيروني")
        ملاحظة: الأكواد الواردة في الخطوتين 2.3.1.2 و 2.3.2.2 هي أكواد وصفية (انظر الملاحظة 1.4.2.2).
  4. تحليل التشابه الصوتي
    1. اختر المجموعات (راجع الملاحظة في الخطوة 2.2.1.3) التي أظهرت فروقاً غير دالة إحصائياً بين الهدف وأي من المشتتات.
    2. كرر الإجراءات الواردة في الخطوات من 1.3.1 إلى 1.3.7.5، والخطوات من 1.3.7.8 إلى 1.3.7.10.
    3. قم بالوصول إلى نص Python البرمجي وتنزيله49, التشابه_الصوتي_جيب_التمام_إقليدس50 من https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      ملاحظة: يُرجع البرنامج النصي ثلاث مصفوفات (بصيغتي '.txt' و '.csv'): إحداها لتشابه جيب التمام (Cosine similarity)51,52، وواحدة للمسافة الإقليدية52,53، وأخرى لقيم مسافة إقليدس المُحوَّلة، بالإضافة إلى مقارنة زوجية بين الصوت المستهدف وكل صوت تضليلي.
    4. تأكد من أن البرنامج النصي قد تم تنزيله في المجلد نفسه الذي يحتوي على مجموعة بيانات التشكيلة (lineup dataset).
    5. انقر على فتح الملف… زر لاستدعاء البرمجية.
    6. انقر تشغيل | التشغيل بدون تصحيح الأخطاء أزرار.
      ملاحظة: الثاني تشغيل قد يتم وسم الزر كـ تشغيل أو تشغيل بدون تصحيح الأخطاء أو تشغيل البرنامج النصي. جميعها تنفذ الأوامر ذاتها، ويعتمد الأمر ببساطة على بيئة Python المستخدمة.
    7. إجراء اختبارات تشابه الصوت استنادًا إلى الخصائص الصوتية.
      ​ملاحظة: تشابه جيب التمام (أو مسافة جيب التمام) هي تقنية تُطبق في الذكاء الاصطناعي (AI)، ولا سيما في تعلم الآلة ضمن أنظمة التعرف التلقائي على الكلام (ASR). وهي مقياس للتشابه يتراوح بين الصفر والواحد؛ حيث يشير تشابه جيب التمام القريب من الواحد إلى أن هناك احتمالية كبيرة بأن يكون الصوتان متشابهين، بينما يشير تشابه جيب التمام القريب من الصفر إلى أن هناك احتمالية كبيرة بأن يكون الصوتان غير متشابهين.52تُستخدم المسافة الإقليدية، والتي يُشار إليها غالباً بالتشابه الإقليدي، على نطاق واسع أيضاً في الذكاء الاصطناعي، وتعلم الآلة، والتعرف التلقائي على الكلام (ASR). وهي تمثل المسافة في خط مستقيم بين نقطتين في الفضاء الإقليدي.53أي أن النقاط كلما كانت أكثر تقارباً (قيم مسافة أقصر)، كانت الأصوات أكثر تشابهاً. ولتحقيق فهم أوضح للنتائج المسجلة لكلتا التقنيتين، قمنا بإجراء تحويل للدرجات الخام للمسافة الإقليدية إلى قيم تتراوح من صفر (تشابه صوتي أقل) إلى واحد (تشابه صوتي أكبر).54.

figure-protocol-5
الشكل 5: إعداد الدليل الخاص بإدراك الكلام. مجلدات التشكيلة. يحتوي كل مجلد على ستة أصوات L1، وصوت L2 المستهدف، وسكربت "CreateLineup"، وملف صوت تشكيلة الأصوات (الذي يتم استرجاعه بعد تشغيل السكربت). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

النتائج

نتائج إنتاج الكلام
في هذا القسم، وصفنا أداء السمات الصوتية-النبرية والمقاييس الإيقاعية ذات الدلالة الإحصائية. تمثلت هذه السمات النبرية في معدلات الكلام، والنطق، والتوقف، وهي مرتبطة بالمدة الزمنية، بالإضافة إلى الارتجاف (shimmer) المرتبط بجودة الصوت. أما المقاييس الإيقاعية فكانت الانحراف المعياري (SD) لمدة المقطع اللفظي، والانحراف المعياري للصامت، والانحراف المعياري للمدة الصوتية أو الصامتة، ومعامل التباين لمدة المقطع اللفظي (راجع الجدول التكميلي S1).

الـ معدل الكلام (الشكل 6Aينخفض بمعدل أسرع في حالة اللغة الإنجليزية كلغة ثانية (L1-L2 English) مقارنة باللغة البرتغالية البرازيلية كلغة ثانية (L1-L2 BP)، رغم أن المعدل يكون أدنى في كلتا اللغتين الثانية (L2s). معدل الكلام يرتبط بثلاثة مقاييس - الانحراف المعياري لـمدة المقطع اللفظي (SD-S)، والانحراف المعياري للحروف المصوتة (SD-V)، ومعامل التباين المقطعي (فاركو-إس (Varco-S)ومن المهم أيضاً وضع الاعتبار بأن كلا المجموعتين، AmE-S وBra-S، تتقنان لغتيهما الثانية (L2). ويبدو أن هذا المعدل يتأثر بالقيم الأعلى لمدة المقطع اللفظي والتباين الأقل الذي أنتجه متحدثو اللغة الأولى واللغة الثانية (L1-L2 BP)، مما يؤدي إلى منحدرات أقل انحداراً.

يرتبط معدل النطق (الشكل 6D) بكل من SD-S وVarco-S، بالإضافة إلى نسبة الإيقاع المقطعي (RR-S)؛ حيث تمثل الأخيرة النسبة بين المقاطع القصيرة والطويلة. ويبدو أن هذه المقاييس تؤثر على معدل النطق تماماً كما يتأثر معدل الكلام بطول الجملة والتباين في المدة الزمنية، مما يؤدي إلى زيادة تخطيط الكلام باللغة الثانية (L2)، وزيادة العبء المعرفي باللغة الثانية9,23,54. وقد يتطلب الأمر حملاً معرفياً لغوياً أعلى في نطاق طول الجملة بطريقة تؤثر على المعايير الصوتية العروضية55.

فيما يتعلق بالسمات الصوتية-العروضية لـ معدلات الكلام ومعدلات النطق، تشير نتائجنا إلى أنه كلما زاد تنويع المتحدث في مدة المقاطع (والحروف المصوتة)، انخفضت هذه المعدلات. نفترض أن إدراك الكلام لكل من اللغة البرازيلية البرتغالية (BP) كـ L1 وL2 يبدو أبطأ نوعاً ما من اللغة الإنجليزية كـ L1 وL2، وأن اللغة الإنجليزية كـ L1 تبدو أسرع من جميع مستويات اللغات الأخرى. قد تكون هذه الحقيقة مرتبطة بإيقاع الكلام والفرضية القائلة بأنه بينما تميل لغة BP (L1-L2) نحو قطب التوقيت المقطعي (syllable-timed) في متصل الإيقاع، تتحرك اللغة الإنجليزية (L1-L2) نحو قطب التوقيت النبري (stress-timed)21,22.

الـ الوميض المحلي, الشكل 6B، يتأثر بـ SD-S و Varco-Sبالنسبة لـ الوميض الموضعييُظهر كل من إنتاجات Bra-S وL1-BP وL2-English مساراً رتيباً إلى حد ما مع زيادة تباين مدة المقطع اللفظي (SD وVarco، انظر الجدول التكميلي S1قد يكون إدراك الجهد الصوتي واضحاً عند الاستماع إلى إنتاجات Bra-S نظراً لوجود تباين منخفض يتراوح بين 8.5 و9 ديسيبل. يتأثر كلام Bra-S بالعبء الصوتي. كما يتأثر L1-BP بشدة بطول الجملة، بينما يكون أقل حساسية للتباينات العالية في مدة المقطع اللفظي (يظهر النمط الإيقاعي لـ BP تبايناً مقطعياً أقل).22,56).

يوضح معدل التوقف (الشكل 6C) أن المتحدثين بالإنجليزية كلغة ثانية ينتجون توقفات أطول (من 200 ms إلى 375 ms) مقارنة بالمتحدثين بالإنجليزية كلغة أولى، والبرتغالية البرازيلية كلغة أولى، والبرتغالية البرازيلية كلغة ثانية (بمتوسط 30 ms للإنجليزية كلغة أولى، و50 ms للبرتغالية البرازيلية كلغة أولى، و100 ms للبرتغالية البرازيلية كلغة ثانية). وقد يكون تخطيط الكلام، في هذه الحالة، قد أثر على إنتاج اللغة الإنجليزية كلغة ثانية بسبب زيادة نشاط الدماغ54,57. ومن المتوقع أن تؤدي الكفاءة اللغوية الأعلى إلى زيادة سرعة القراءة ومدى الاستيعاب54؛ ومع ذلك، فحتى بالنسبة للمتحدثين المتقنين للغة الثانية، تطلبت مهام القراءة جهداً أكبر في الجوانب المعرفية العليا للكلام الأجنبي وفي المعالجة اللغوية54,57. وتظهر نتائجنا، على أساس أولي على الأقل، أن المتحدثين بالبرتغالية البرازيلية كلغة ثانية قد يكونون أقل تأثراً بالتوقفات مقارنة بالمتحدثين بالإنجليزية كلغة ثانية، وذلك بسبب الاختلافات في النمط الإيقاعي لكلتا اللغتين.

figure-results-1
الشكل 6: النماذج الجمعية المعممة (GAMs) للميزات الصوتية العروضية. يمثل المحور Y المتغير الاستجابي (الميزات الصوتية المراد نمذجتها)؛ ويمثل المحور X المتغيرات التنبؤية (عامل "اللغة" والمتغيرات المصاحبة في النماذج الجمعية التي ستحدد شكل ومسارات المنحنيات (أي تأثيرات التنعيم: 'Language + covariates')، وحاصل ضرب "اللغة" وميزة قياسية ستوفر إسقاطاً أكثر دقة للمتغير الاستجابي (أي تفاعلات التنعيم والعامل: 'covariate:Language')). الاختصارات: GAMs = النماذج الجمعية المعممة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

فيما يتعلق بمقاييس الإيقاع، وبالنسبة لـ SD-S (الشكل 7A)، تكشف نتائجنا أنه كلما زاد تنويع المتحدث لمنحنى f0 وزاد معدل الكلام، انخفض SD-S لجميع مستويات اللغة (وهو تأثير مرآتي لـ الشكل 6A). وفي حالة الانحراف المعياري للصوامت (SD-C، الشكل 7C)، أظهر المتحدثون بـ L1-BP، على عكس متحدثي L1 English، تنويعاً منخفضاً مع زيادة معدل الكلام أو مدة التوقف. ويُتوقع اتجاه SD هذا نظراً لأن تباين مدة المقطع اللفظي لدى L1-English أعلى (إحصائياً) وبشكل ملحوظ من L1-BP44,58. ويبدو أن Varco-S (الشكل 7B و الجدول التكميلي S1) مرتبط إلى حد ما بـ L1 و L2 لنفس المجموعة اللغوية. فمع زيادة تباين f0 ومعدل الكلام، ينخفض Varco-S لـ L1-BP ويبدو أنه ينخفض ويضمحل لـ L2-BP. أما بالنسبة للنطق باللغة الإنجليزية، فبينما يزداد تباين f0 ومعدل الكلام، يزداد Varco-S ويضمحل لكل من L1-English و L2-English.

فيما يتعلق بالانحراف المعياري للحروف المصوتة أو الساكنة (SD-V_C، الشكل 7D والجدول التكميلي S1)، تظهر نتائجنا بعض التشابهات مع أداء Varco-S (الشكل 7B). على سبيل المثال، فإن ارتفاع معدل الكلام، ومدة التوقف، وتغير f0 يعزز مسار الانخفاض ثم الارتفاع لـ SD-V_C بالنسبة لـ L1-BP، وكذلك لـ L2-BP. أما في النطق باللغة الإنجليزية، فبينما تكون هذه السمات العروضية أعلى، ينخفض SD-V_C قليلاً، ويخمد بالنسبة لـ L1-English، ويزداد قليلاً ثم يخمد بالنسبة لـ L2-English. قد يُفسر الارتباط بين Varco-S وSD-V_C بالنسبة لمجموعات L1-L2 من نفس اللغات جزئياً بـ "تأثير لومبارد" (Lombard Effect)، والذي يشير إلى تغير المعايير الصوتية في الكلام نتيجة للضوضاء الخلفية59.

في الكلام بلغة أجنبية، وبناءً على تعقيد المهمة (على سبيل المثال، الكلام المقروء)، استخدم المتحدثون استراتيجيات صوتية مماثلة في كل من اللغة الأولى L1 واللغة الثانية L259,60. فمن ناحية، وجد Marcoux وErnestus أن مقاييس f0 (المدى والوسيط) في كلام لومبارد باللغة الثانية L2 تشير إلى أن المتحدثين بالإنجليزية كلغة ثانية L2 قد تأثروا بلغتهم الهولندية الأولى L161,62. ومن ناحية أخرى، تقترح نتائج حديثة أنه على الرغم من التوقعات باختلاف كلام لومبارد باللغة الثانية L2 عن كلام لومبارد باللغة الأولى L1 بسبب زيادة الحمل المعرفي عند التحدث باللغة الثانية L2، إلا أن المتحدثين بالإنجليزية كلغة ثانية L2 قد أنتجوا كلام لومبارد في نفس اتجاه المتحدثين بالإنجليزية كلغة أولى L163. ولا يزال مدى توافق نتائجنا مع Marcoux وErnestus63 واختلافها عن Waaning59، وVillegas وآخرون60، وMarcoux وErnestus61,62 بحاجة إلى مزيد من الاستقصاء.

figure-results-2
الشكل 7: النماذج المضافة المعممة للميزات المترية. على محور Y، متغير الاستجابة (الميزات المترية المراد نمذجتها)؛ وعلى محور X، المتغيرات التنبؤية (عامل "اللغة" والمتغيرات المصاحبة في النماذج المضافة التي ستحدد شكل ومسارات المنحنيات (أي تأثيرات التمهيد: "اللغة + المتغيرات المصاحبة")، وحاصل ضرب "اللغة" وميزة مترية لتوفير إسقاط أكثر دقة لمتغير الاستجابة (أي التفاعلات بين العامل والتمهيد: "المتغير المصاحب:اللغة"). الاختصار: GAMs = النماذج المضافة المعممة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

نتائج إدراك الكلام
فيما يتعلق بمجموعات مقارنة الأصوات BP، في المجموعة رقم 1 (الشكل 8A)، تم تقييم الصوت المضلل رقم 3 على أنه الصوت المستهدف. وفي الواقع، كان الصوت المستهدف هو الصوت رقم 4. وتظهر النتائج عدم وجود فرق ذو دلالة إحصائية (راجع الجدول التكميلي S1) بين الصوت المضلل رقم 3 (83%) والصوت المستهدف رقم 4 (71%). وفي المجموعة رقم 2 (الشكل 8B)، أظهرت المقارنة بين الصوت المستهدف رقم 3 (40%) والصوت المضلل رقم 4 (20%) أيضاً عدم وجود فرق ذو دلالة إحصائية (راجع الجدول التكميلي S1) لمجموعات الأصوات الإنجليزية. وفي المجموعة رقم 1 (الشكل 9A)، لم يكن هناك فرق معنوي (راجع الجدول التكميلي S1) بين الصوت المضلل رقم 2 (26%) والصوت المستهدف رقم 4 (54%).

في تحليل تشابه الصوت، أظهر كل من تشابه جيب التمام (CoSim) والمسافة الإقليدية (EucDist, [EucDist transformed]54) ارتباطاً متسقاً بين العينة المضللة رقم 3 والعينة المستهدفة في مجموعة مقارنة BP رقم 1 (CoSim = 0.99; EucDist = 77.4, [0.93]). وكان الارتباط بين العينة المضللة رقم 4 والعينة المستهدفة قوياً بالمثل في مجموعة مقارنة BP رقم 2 (CoSim = 0.99, EucDist = 76.3, [0.93]). أما في مجموعة مقارنة اللغة الإنجليزية رقم 1، فقد كان الارتباط متسقاً بالنسبة لـ CoSim (0.83)، ولكنه تراوح بين الضعيف والمقبول بالنسبة لـ EucDist (213.0, [0.47]. وبشكل عام، كانت كل من CoSim و EucDist تقنيتين مرضيتين في تحديد تشابه الصوت. بالإضافة إلى ذلك، كان أداء CoSim أكثر فعالية بقليل، كما أشار Gahman و Elangovan52(انظر الجدول التكميلي S1).

فيما يتعلق بالتشابه، ما الذي قد يكون أدى إلى زيادة الإنذارات الكاذبة؟ أظهرت السمات العروضية-الصوتية أدلة على أنه، على الرغم من أن الأصوات المضللة والأصوات المستهدفة قد أدت (إحصائياً) بشكل مختلف بشكل ملحوظ - باستثناء التشكيلات المعروضة في الشكل 8A،B و الشكل 9A - فإن خيارات المستمعين قد تنوعت نوعاً ما عبر مختلف الأصوات المضللة في التشكيلات الأخرى (الشكل 8C،D، و الشكل 9B-D). ويبدو أن مثل هذا الحكم يعتمد بشكل أكبر على سمة صوتية محددة واحدة (أو ربما أكثر) يشترك فيها المتحدثون، بدلاً من الاعتماد على فئة كاملة من السمات العروضية-الصوتية. على سبيل المثال، قدمت دراستنا عدة سمات تتباين (أو تتغير بشكل مشترك) بين الإنتاجات؛ ومع ذلك، تظهر النتائج الإدراكية تفضيلات الأحكام لصوت مضلل معين ليتطابق مع الصوت المستهدف8,35,64,65. وهناك حاجة إلى إجراء تحليلات إضافية في الأعمال المستقبلية.

من الجدير بالذكر النظر في اختيار مصفوفة بارامترية متعددة الأبعاد للتشابه الصوتي66 مثل تلك المعروضة في هذه الدراسة. وتتماشى نتائجنا مع الدراسات السابقة التي استخدمت سمات صوتية تعتمد على f0 وVQ والشدة9,35. وتُقترح هذه السمات بشكل ملحوظ لمهام مقارنة المتحدثين في المجال الجنائي9,66. ومع ذلك، من المهم تسليط الضوء على أنه في البحث الحالي، لم يتم التنبؤ بأن أيًا من العينات المضللة (foils) مشابهة للصوت المستهدف، على الرغم من أننا استخدمنا نسخة معدلة من إرشادات McFarlane16,17 في إعداد مجموعات الأصوات للتعرف على المتحدثين ذوي اللكنات الأجنبية. علاوة على ذلك، يجب أن نؤكد أن إجراء مجموعة الأصوات لدينا يتضمن اختلافات جوهرية عن إرشادات McFarlane، بما في ذلك طول المثير، وعدد الأصوات، واختيار العينات المضللة (والتي كانت عشوائية هنا)، وأسلوب الكلام.

إن مدى ارتباط السمات الصوتية-العروضية للتردد الأساسي f0، وجودة الصوت، والشدة بإدراك المستمعين يعتمد بشكل كبير على أسلوب التحدث المستخدم في البحث. وقد استخدمنا هنا مقاطع مقروءة. وتفضل غالبية دراسات شهود السمع استخدام محفزات (شبه) تلقائية كحل متوازن-مثل مجموعة DyVis corpus67-والتي استُخدمت على نطاق واسع في تحقيقات شهود السمع المعاصرة28,68. والسبب الذي دفعنا لاختيار مهام القراءة هو أن مجموعتنا، في وقت صياغة هذه المخطوطة، كانت تتكون حصرياً من بيانات تم الحصول عليها من مهام القراءة. ومع ذلك، من المهم الإقرار بأن عملية تجميع مجموعة بيانات (شبه) تلقائية جارية بالفعل. علاوة على ذلك، فإن عملية قراءة قصة يمكن أن تولد مستوىً موثوقاً من التوحيد والتباين، سواء على مستوى المتحدث الواحد أو بين المتحدثين المختلفين. وهذا يسهل التركيز على الخصائص العروضية أو الصوتية-سواء كانت فردية أو لهجية-في الحالات التي تتضمن مقارنة الأصوات. ويصبح هذا ملحوظاً بشكل خاص في حالات العبء الصوتي أثناء إنتاج لكنة أجنبية، حتى بين المتحدثين المتقنين 8,9,23,54.

figure-results-3
الشكل 8مخططات شريطية تحتوي على النتائج الخاصة بالمجموعات الأربع التي أجراها المستمعون البرازيليون. (A,B(فرق غير جوهري بين الصوت المستهدف (باللون الأزرق) وصوت تضليلي (باللون الأزرق الفاتح). (سي,د) فروق ذات دلالة إحصائية عن المشتتات، والصوت المستهدف. الاختصار: NS = غير دال إحصائياً. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-4
الشكل 9: مخططات أعمدة تحتوي على النتائج لأربع مجموعات مقارنة أجراها المستمعون الأمريكيون. (A) فرق غير جوهري بين الصوت المستهدف (باللون الأحمر) والصوت المضلل (باللون الوردي). (B,C,D) فروق جوهرية عن الأصوات المضللة والصوت المستهدف. الاختصار: NS = غير جوهري. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الجدول التكميلي S1: إحصائيات إنتاج الكلام - النماذج الجمعية العامة (GAMs): إحصائيات F (درجات الحرية)، وقيمة R2 المعدلة لكل سمة صوتية-صوتية ذات دلالة إحصائية (الشكل 6)، ومقياس الإيقاع (الشكل 7) لكل مستوى لغوي، بالإضافة إلى القيم الفردية لكل حد سلس (المتغيرات المصاحبة). إحصائيات إدراك الكلام: إحصائيات χ2 لاختبار كرسكال-واليس (درجات الحرية)، وقيم p، وقيمة η2 المعدلة، بالإضافة إلى اختبار دن (Dunn's test) البعدي للمقارنة الزوجية (الشكل 8 والشكل 9) لكل فرق غير دال إحصائياً بين أزواج أصوات الهدف والمضلل (الشكل 8A،B والشكل 9A). مصفوفات التشابه الصوتي لمسافة جيب التمام والمسافة الإقليدية لكل مجموعة مقارنة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

المناقشة

يقدم البروتوكول الحالي حداثة في مجال الصوتيات (الطب الشرعي). وهي مقسمة إلى مرحلتين: واحدة تعتمد على الإنتاج (التحليل الصوتي) والأخرى على أساس الإدراك (تحليل الحكم). تشتمل مرحلة تحليل الإنتاج على إعداد البيانات والمحاذاة القسرية وإعادة التنظيم والاستخراج التلقائي للميزات الصوتية العروضية إلى جانب الإحصائيات. يربط هذا البروتوكول مرحلة جمع البيانات بتحليل البيانات بطريقة أسرع وأكثر كفاءة من البروتوكولات التقليدية القائمة على التجزئة اليدوية في الغالب.

ومع ذلك ، فإن عملية إعادة المحاذاة ، الموضحة في خطوات البروتوكول من 1.3.6 إلى 1.3.6.9 ، تعمل بشكل أساسي على وحدات الهاتف والكلمات التي تم إنشاؤها في خطوات البروتوكول من 1.3.1 إلى 1.3.4. تكمن حداثة عملية إعادة المحاذاة في أنها تنشئ TextGrid جديدا يحتوي على ثلاثة مستويات نصية جديدة: طبقة مقطعية ، وطبقة مقطع كلام يمكن إنشاؤها تلقائيا أو يدويا بناء على الكلمات ، وطبقة نغمة يمكن أن تكون مفيدة جدا لحساب مقاييس f0. تم استخدام إرشادات إعادة التنظيم المقترحة لهذا البروتوكول سابقا في دراسات إيقاع الكلام L221،69،70 ، ودراسات للكشف عن درجة اللهجة الأجنبية باستخدام تقنيات التعلم الآلي22 ، ودراسات في مجال الطب الشرعي9.

يولد الاستخراج التلقائي للسمات العروضية ، المقدم في خطوات البروتوكول من 1.3.7 إلى 1.3.7.10 ، مصفوفة متعددة الأبعاد من السمات الصوتية العروضية كما يمكن أن يشهد في البحث الحالي. تشمل هذه الميزات ميزات الكلام اللحني والطول والطيفي (جودة الصوت وكثافته)71. عدد كبير من هذه الميزات الصوتية أقل حساسية وقوة إلى حد ما للتسجيلات الصوتية الصاخبة التي يتم جمعها في النهاية في الطب الشرعي أو أي سيناريوهات أخرى72. علاوة على ذلك ، يمكن تطبيق المصفوفة متعددة الأبعاد على أنظمة التعرف على الكلام عبر العديد من تقنيات الذكاء الاصطناعي (العمل قيد التقدم). لا يزال من الممكن أن يكون مفيدا جدا في تدريس الجوانب العروضية في فصول النطق L221 (العمل قيد التقدم).

يمثل التحليل الإحصائي لهذا الجزء من البروتوكول استخدام طريقة GAM لأننا تعاملنا مع علاقة معقدة بين ميزة صوتية معينة ومتحدثين متعددين لعوامل اللغة. لنمذجة ميزة صوتية معينة ، على سبيل المثال ، كان من الضروري التحقق من كيفية أداء الميزات الصوتية الأخرى من المصفوفة (المصطلحات السلسة) حتى نتمكن من وصف ما كان يحدث أثناء إنتاج الكلام بشكل أكثر دقة.

فيما يتعلق بتحليل الإدراك ، تم تشكيل البروتوكول الحالي من خلال إعداد وتنفيذ تشكيلات الصوت والتحليل الإحصائي وتحليل التشابه الصوتي. لإعداد التسيارات، استخدمنا البرنامج النصي CreateLineup ل Praat، والذي يقوم تلقائيا بإنشاء ملف صوتي لكل تشكيلة تحتوي على رقائق متسلسلة عشوائيا وصوت مستهدف كما هو موضح في خطوات البروتوكول من 2.2 إلى 2.2.1.9.

للتحليل الإحصائي لهذا البروتوكول ، أجرينا اختبار Kruskal-Wallis غير البارامتري لأن بياناتنا لم تفي بافتراضات تحليل التباين (ANOVA). بمجرد أن يكون لدينا علاقة بين درجات الحكم التي تم تقييمها من قبل المستمعين والتحكم في الصوت المستهدف والرقائق ، اخترنا استخدام إحصائيات النموذج الخطي.

لتحليل التشابه الصوتي ، استخدمنا البرنامج النصي AcousticSmilarity_cosine_euclidean ل Python. ينبثق البرنامج شجرة دليل الكمبيوتر ويطلب من المستخدم اختيار الملف الذي يحتوي على الميزات الصوتية العروضية للرقائق والصوت المستهدف الذي يتكون من التشكيلة في التحليل. بنقرة زر واحدة ، يولد البرنامج النصي ثلاث مصفوفات تشابه: جيب التمام ، والإقليدي ، والإقليدي المحول (من صفر إلى واحد) ، على كل من الملفات ".txt" (المحددة بعلامات الجدولة) و ".csv". لا يزال يتعين علينا أن نضع في اعتبارنا أن كل مجموعة بيانات (ملف ".txt" يحتوي على الميزات الصوتية العروضية للرقائق والهدف) يجب أن تكون في المجلد الأصلي للتشكيلة ، ويجب أن يحتوي كل مجلد تشكيلة على نسخة من البرنامج النصي AcousticSmilarity_cosine_euclidean .

باختصار ، يتقدم البروتوكول الحالي في أبحاث الصوتيات (الطب الشرعي). يتألف من مراحل متميزة - تحليلات الإنتاج والإدراك ، بالإضافة إلى التشابه الصوتي - وهو يسد الفجوة بين جمع البيانات وتحليل الميزات الصوتية متعدد الأبعاد. يمكن للباحثين الاستفادة من منظور شامل ، واستكشاف كل من جوانب الإنتاج والإدراك. علاوة على ذلك ، يضمن هذا البروتوكول قابلية تكرار البحث ، مما يسمح للآخرين بالبناء على إرشادات هذا العمل.

القيود والاتجاهات المستقبلية
لا يزال يتعين علينا أن نضع في اعتبارنا أن كل شيء سينجح إذا اتبع إعداد البيانات الإرشادات المقترحة في خطوات البروتوكول 1.3.1 إلى 1.3.4. إلى جانب ذلك ، في إجراءات المحاذاة القسرية ، يجب أن ندرك أن التقويم القسري الخارجي المدرب مسبقا المستخدم في العمل الحالي - عرضة لأخطاء التجزئة ، خاصة في البيانات المحركة الأجنبية غير المدربة مسبقا أو حتى في التقويم المدرب مسبقا ، سواء كان الصوت لا يتمتع بجودة جيدة أو أن التقويم لا يحتوي على لغة الصوت (هذه الحقيقة ستجعل عمل الخبير أكثر صعوبة ويستغرق وقتا طويلا). يواجه النسخ الشرعي ، وخاصة الملفات الصوتية الأطول ، صعوبات فيما يتعلق بالتمثيل الدقيق والموثوق للتسجيلات المنطوقة72.

هناك أيضا العديد من التحديات في نسخ ومحاذاة الملفات الصوتية الأطول. يتأثر أداء التقويم بأسلوب التحدث والبيئة الصوتية، بالإضافة إلى العوامل الخاصة باللهجة. على الرغم من وجود اختلافات خاصة بالتقويم ، إلا أن أدائها متشابه بشكل عام ويولد تجزئات تقارن جيدا بالمحاذاة اليدوية بشكل عام73. بالإضافة إلى ذلك ، تم تشغيل إنتاج اللغة الإنجليزية L1 و L2 بنموذج صوتي مدرب مسبقا للغة الإنجليزية الأمريكية بسبب عدم توفر نماذج الكلام الأجنبي في MAUS. علاوة على ذلك ، لا توجد نماذج صوتية مدربة مسبقا لضغط الدم في MAUS. بالنسبة لبيانات BP ، تم استخدام النماذج الصوتية الموجودة مسبقا للإيطالية (انظر NOTE ، خطوة البروتوكول 1.3.5.7).

في العمل المستقبلي (قيد التقدم) ، سنستخدم التقويم القسري في مونتريال (MFA) 74 كجزء من البروتوكول. تتمثل إحدى المزايا الرائعة للمصادقة متعددة العوامل في توافر النماذج الصوتية المدربة مسبقا ونماذج الجرافيم إلى الصوت لمجموعة متنوعة من اللغات (بما في ذلك BP) ، بالإضافة إلى القدرة على تدريب نماذج صوتية ورسم إلى صوت جديدة لأي مجموعة بيانات جديدة (أي مجموعة الكلام ذات اللهجة الأجنبية) 75.

الإفصاحات

ليس لدى أصحاب البلاغ تضارب في المصالح للإعلان.

شكر وتقدير

تم دعم هذه الدراسة من قبل المجلس القومي للتنمية العلمية والتكنولوجية - CNPq، المنحة رقم 307010/2022-8 للمؤلف الأول، ومنحة رقم 302194/2019-3 للمؤلف الثاني. يود المؤلفون أن يعربوا عن خالص امتنانهم للمشاركين في هذا البحث على تعاونهم السخي ومساهماتهم التي لا تقدر بثمن.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
CreateLineupPersonalcollection#Script for praat لإعداد التشكيلات الصوتية
Dell I3 (مع محرك أقراص الحالة الصلبة - SSD) ديل#كمبيوتر محمول
براتبول بورسما & ديفيد وينينك#برنامج للتحليل الصوتي
Python 3Python Software Foundation#Interpreted, عالية المستوى, لغة برمجة للأغراض العامة 
Rمشروع R للحوسبة الإحصائية#لغة البرمجة للحوسبة الإحصائية
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorالمجموعة الشخصية#Script for praat للاستخراج التلقائي للميزات الصوتية
SurveyMonkeySurveyMonkey Inc.#تجميع الاستطلاعات المجانية القابلة للتخصيص ، بالإضافة إلى مجموعة من البرامج الخلفية التي تتضمن تحليل البيانات واختيار العينات والتحيز وتمثيل البيانات.
Tascam DR-100 MKIITascam#مسجل الصوت الرقمي
نظام التجزئة التلقائي في ميونيخ MAUSجامعة ميونيخ#محاذاة قسرية للصوت (.wav) والمعلومات اللغوية (.txt) ملفات
VVUnitAlignerالمجموعة الشخصية#Script for praat لإعادة التنظيم التلقائي والمعالجة اللاحقة للوحدات الصوتية

المراجع

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

إعادة الطباعة والأذونات

الوسوم

السمات العروضيةإدراك الكلامجودة الصوتالتردد الأساسيالتعرف على المتحدثالتشابه الصوتي