يهدف هذا البحث إلى إجراء مقارنة بين L1-L2-English و L1-L2 البرتغالية للتحقق من مدى تأثير اللهجة الأجنبية في حساب كل من المقاييس والمعلمات الصوتية العروضية ، وكذلك لاختيار الصوت المستهدف في تشكيلة الصوت.
مقالة منهجية
يهدف هذا البحث إلى إجراء مقارنة بين L1-L2-English و L1-L2 البرتغالية للتحقق من مدى تأثير اللهجة الأجنبية في حساب كل من المقاييس والمعلمات الصوتية العروضية ، وكذلك لاختيار الصوت المستهدف في تشكيلة الصوت.
يهدف هذا البحث إلى فحص كل من السمات الصوتية العروضية والارتباطات الإدراكية للغة الإنجليزية ذات اللهجة الأجنبية والبرتغالية البرازيلية ذات اللهجة الأجنبية والتحقق من كيفية ارتباط إنتاج المتحدثين لللكنات الأجنبية والأصلية بتصور المستمعين. في المنهجية ، أجرينا إجراء إنتاج الكلام مع مجموعة من المتحدثين الأمريكيين باللغة البرتغالية البرازيلية L2 ومجموعة من المتحدثين البرازيليين باللغة الإنجليزية L2 ، وإجراء إدراك الكلام الذي أجرينا فيه مجموعات صوتية لكلتا اللغتين. بالنسبة للتحليل الإحصائي لإنتاج الكلام ، قمنا بتشغيل نماذج مضافة معممة لتقييم تأثير مجموعات اللغات على كل فئة (متري أو صوتي عرودي) من الميزات التي يتم التحكم فيها من أجل تأثير التنعيم للمتغيرات (المتغيرات المساعدة) من الفئة المقابلة. بالنسبة للتحليل الإحصائي لإدراك الكلام ، أجرينا اختبار Kruskal-Wallis واختبار Dunn اللاحق لتقييم تأثير أصوات التشكيلات على الدرجات التي يحكم عليها المستمعون. ومع ذلك ، أجرينا اختبارات التشابه الصوتي (الصوتي) بناء على مسافات جيب التمام والإقليدس. أظهرت النتائج اختلافات صوتية معنوية بين المجموعات اللغوية من حيث تباين f0 والمدة وجودة الصوت. بالنسبة للتشكيلات ، أشارت النتائج إلى أن السمات العروضية ل f0 والشدة وجودة الصوت مرتبطة بأحكام المستمعين المتصورة.
اللهجة هي جانب بارز وديناميكي للتواصل والطلاقة ، سواء في اللغة الأم (L1) أو في لغة أجنبية (L2) < sup class = "xref" >1. تمثل اللكنة الأجنبية السمات الصوتية L2 للغة المستهدفة ، ويمكن أن تتغير (بمرور الوقت) استجابة لتجربة المتحدث L2 ، وأسلوب التحدث ، وجودة الإدخال ، والعرض ، من بين متغيرات أخرى. يمكن قياس اللهجة الأجنبية على أنها درجة (عددية) من الاختلاف بين الكلام L2 الذي ينتجه متحدث أجنبي واللهجة المحلية أو المرجعية للغة المستهدفة< sup class = "xref" >2,3,4,5.
يهدف هذا البحث إلى فحص كل من السمات الصوتية العروضية والارتباطات الإدراكية للغة الإنجليزية ذات اللهجة الأجنبية والبرتغالية البرازيلية ذات اللهجة الأجنبية (BP) ، وكذلك التحقق من مدى ارتباط إنتاج المتحدثين لللكنات الأجنبية والأصلية بتصور المستمعين. أظهرت الأبحاث السابقة في مجال الطب الشرعي متانة حروف العلة والحروف الساكنة في تحديد اللهجة الأجنبية على أنها إما مستقرة لتحليل طويل الأمد للفرد (The Lo Case6) أو تشير إلى دقة الهوية العالية للمتحدث (The Lindbergh Case7). ومع ذلك ، فإن استكشاف الميزات الصوتية العروضية بناء على المدة والتردد الأساسي (f0 ، أي الارتباط الصوتي للنغمة) والشدة وجودة الصوت (VQ) قد اكتسب اهتماما متزايدا< فئة الدعم = "xref" >8،< sup class = "xref">9. وبالتالي ، فإن اختيار الميزات الصوتية العروضية في هذه الدراسة يمثل وسيلة واعدة في مجال صوتيات الطب الشرعي< sup class = "xref" >8،10،11،12,13.
البحث الحالي مدعوم بدراسات مخصصة لللكنات الأجنبية كشكل من أشكال التنكر الصوتي في قضايا الطب الشرعي< sup class = "xref" >14,15 ، وكذلك في إعداد التشكيلات الصوتية للتعرف على المتحدث< فئة sup = "xref">16,17. على سبيل المثال ، لعب معدل الكلام دورا مهما في تحديد المتحدثين الألماني والإيطالي والياباني والبرازيلي للغة الإنجليزية < sup class = "xref" > 18 ، < sup class = "xref" > 19 ، < sup class = "xref" > 20 ، < sup class = "xref" > 21 ، < sup class = "xref" > 22. إلى جانب معدل الكلام ، تتحدى الميزات الطيفية و f0 طويلة المدى المتحدثين البارعين في L2 مع الإلمام باللغة المستهدفة لأن الدماغ والقواعد المعرفية تعاني من عجز في الذاكرة والانتباه والعاطفة ، مما ينعكس في الأداء الصوتي للمتحدث أثناء المنعطفات الطويلة للكلام < فئة sup = "xref" >23. وجهة نظر اللهجات الأجنبية في مجال الطب الشرعي هي أن تعريف ما يبدو حقا وكأنه لهجة أجنبية يعتمد إلى حد كبير على عدم إلمام المستمع بدلا من الحصول على درجة لا تتجاوز إلى أقصى حد من الكلام بلكنة أجنبية < sup class = "xref" >24.
في المجال الإدراكي ، فإن أداة الطب الشرعي الشائعة المستخدمة منذ منتصف التسعينيات للتعرف على المجرمين هي تشكيلة الصوت (التعرف السمعي) ، والتي تشبه التعرف البصري المستخدم لتحديد الجاني في مسرح الجريمة < فئة الدعم = "xref">16,< sup class = "xref">25. في تشكيلة صوتية ، يتم تقديم صوت المشتبه به جنبا إلى جنب مع الأصوات المماثلة في الجوانب اللغوية الاجتماعية مثل العمر والجنس والموقع الجغرافي واللهجة والحالة الثقافية - لتحديد هويتها من قبل شاهد الأذن. يعتمد نجاح أو فشل تشكيلة الصوت على عدد عينات الصوت ومدة العينة25,26. علاوة على ذلك ، بالنسبة لعينات العالم الحقيقي ، يعتبر أن جودة الصوت تؤثر باستمرار على دقة التعرف على الصوت. يمكن أن تؤدي جودة الصوت الرديئة إلى تشويه الخصائص الفريدة لفئة الصوت 27. في حالة تشابه الصوت ، يمكن أن تربك التفاصيل الصوتية الدقيقة القائمة على f0 المستمع أثناء التعرف على الصوت < sup class = "xref" >28,29. تمتد هذه الميزات الصوتية إلى ما هو أبعد من f0 وتشمل عناصر المدة ، والسمات الطيفية للكثافة و VQ30. تعد هذه النظرة للميزات العروضية المتعددة أمرا بالغ الأهمية في سياق مقارنة صوت الطب الشرعي لضمان تحديد دقيق لمكبر الصوت < sup class = "xref" >9 ، < sup class = "xref" > 14 ، < sup class = "xref" > 15 ، < sup class = "xref" > 29 ، < sup class = "xref" >31.
باختصار ، أظهرت الدراسات في علم الصوتيات الشرعي بعض الاختلاف فيما يتعلق بتحديد اللهجة الأجنبية على مدى العقود الماضية. من ناحية أخرى ، لا يبدو أن اللهجة الأجنبية تؤثر على عملية تحديد المتحدث < sup class = "xref" >32,33 (خاصة إذا كان المتحدث غير معتاد على اللهجة الأجنبية المستهدفة< sup class = "xref">34). من ناحية أخرى ، هناك نتائج في الاتجاه المعاكس< sup class = "xref" > 12 ، < sup class = "xref" > 34 ، < up class = "xref" > 35.
حصل هذا العمل على موافقة لجنة أخلاقيات البحث البشري. علاوة على ذلك ، تم الحصول على موافقة مستنيرة من جميع المشاركين في هذه الدراسة لاستخدام بياناتهم ونشرها.
< p class = "jove_title" >1. إنتاج الكلامملاحظة: قمنا بجمع الكلام من مهمة قراءة على كل من "L1 English-L2 BP" التي تنتجها المجموعة 1: The American English (من الولايات المتحدة الأمريكية) Speakers (AmE-S) ، وعلى كل من "L1 BP-L2 English" التي تنتجها المجموعة 2: The Brazilian Speakers (Bra-S). انظر الشكل 1 للحصول على مخطط انسيابي لإنتاج الكلام.

<فئة قوية = "xfig" >الشكل 1: مخطط انسيابي تخطيطي لإنتاج الكلام. الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: لقطة شاشة من المحاذاة الصوتية باستخدام التقويم القسري MAUS. (أ) المستطيل المتقطع مخصص لسحب وإسقاط ملفات "my_file.wav" /" my_file.txt" أو النقر في الداخل للبحث عن هذه الملفات من المجلد ؛ يشار إلى زر التحميل بالسهم الأحمر. (ب) الملفات التي تم تحميلها من اللوحة A (انظر السهم الأزرق) ، وخط الأنابيب المراد استخدامه ، ولغة أزواج الملفات ، وتنسيق الملف المراد إرجاعه ، وزر "صواب / خطأ" للاحتفاظ بجميع الملفات. (ج) شروط استخدام خانة الاختيار (انظر السهم الأخضر) ، والزر تشغيل خدمات الويب ، والنتائج (ملفات TextGrid المراد تنزيلها). الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

<فئة قوية = "xfig">الشكل 3: لقطة شاشة لإجراء إعادة المحاذاة. (أ) نموذج إعدادات الإدخال لإجراء إعادة المحاذاة. (ب) شكل الموجة الجزئي ، ومطياف النطاق العريض مع محيط f0 (أزرق) ، وستة طبقات مجزأة (ومصنفة) على أنها المستوى 1: وحدات بداية حرف العلة إلى بداية الحرف المتحرك التالي (V_to_V) ؛ بداية حرف العلة (V_to_V) ؛ المستوى 2: وحدات حرف العلة (V) والحرف الساكن (C) والإيقاف المؤقت (#) ؛ المستوى 3: التمثيلات الصوتية V_to_V ؛ المستوى 4: بعض الكلمات من النص ؛ المستوى 5: بعض الأجزاء (CH) من الكلام من النص ؛ المستوى 6: طبقة الدرجة اللونية التي تحتوي على أعلى (H) وأدنى نغمة (L) لكل جزء كلام تنتجه أنثى AmE-S. (ج) إعدادات الإدخال للاستخراج التلقائي للميزات الصوتية. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
ملاحظة: قمنا بإجراء أربع تشكيلات صوتية باللغة الإنجليزية مع مستمعين أمريكيين وأربع تشكيلات في BP مع مستمعين برازيليين. انظر الشكل 4 للحصول على مخطط انسيابي لإدراك الكلام.
< p class = "jove_content biglegend" fo: keep-together.within-page = "1" >

نتائج إنتاج الكلام
في هذا القسم ، وصفنا أداء الميزات الصوتية العروضية ذات الدلالة الإحصائية ومقاييس الإيقاع. كانت هذه السمات العروضية هي معدلات الكلام والتعبير والإيقاف المؤقت ، والتي ترتبط بالمدة ، والوميض ، الذي يرتبط بجودة الصوت. كانت مقاييس الإيقاع هي الانحراف المعياري (SD) لمدة المقطع اللفظي ، و SD للحرف الساكن ، و SD لمدة الصوت أو الساكن ، ومعامل التباين في مدة المقطع (انظر الجدول التكميلي S1).
ينخفض معدل الكلام (< الفئة القوية = "xfig" >الشكل 6 أ) بسرعة أكبر بالنسبة للغة الإنجليزية L1-L2 مقارنة ب L1-L2 BP ، على الرغم من أن المعدل أقل لكل من L2s. يرتبط معدل الكلام بثلاثة مقاييس - SD لمدة المقطع (SD-S) ، SD للحروف المتحركة (SD-V) ، ومعامل التباين المقطعي (Varco-S). من المهم أيضا أن تضع في اعتبارك أن كلا من AmE-S و Bra-S تتقن مجموعة L2 الخاصة بهم. يبدو أن هذا المعدل يتأثر بالقيم الأعلى لمدة المقطع اللفظي والتباين المنخفض الناتج عن L1-L2 BP ، مما يتسبب في منحدرات أقل انحدارا.
< p class = "jove_content" >يرتبط معدل النطق (<فئة قوية = "xfig" >الشكل 6 د) ب SD-S و Varco-S ، بالإضافة إلى نسبة الإيقاع المقطعي (RR-S) ؛ يمثل الأخير النسبة بين المقاطع الأقصر والأطول. يبدو أن هذه المقاييس تؤثر على معدل النطق تماما مثل معدل الكلام المتأثر بسبب طول الجملة والاختلاف في المدة مما يؤدي إلى ارتفاع تخطيط الكلام L2 ، و L2 الحمل المعرفي < فئة sup = "xref" >9 ، < sup class = "xref" >23 ، < sup class = "xref">54. قد تكون هناك حاجة إلى عبء معرفي لغوي أعلى في مجال طول الجملة بطريقة تتأثر بها المعلمات الصوتية العرضية< فئة الدعم = "xref">55.فيما يتعلق بالسمات العروضية الصوتية لمعدلات الكلام والنطق ، تشير النتائج التي توصلنا إليها إلى أنه كلما زاد اختلاف المتحدث في مدة المقاطع (وحروف العلة) ، انخفضت هذه المعدلات. نفترض أن إدراك الكلام لكل من L1 و L2 BP يبدو أبطأ إلى حد ما من L1 و L2-English ، وأن L1-English يبدو أسرع من جميع مستويات اللغة الأخرى. قد تكون هذه الحقيقة مرتبطة بإيقاع الكلام والفرضية القائلة بأنه بينما يميل L1-L2 BP نحو القطب الموقوت للمقطع اللفظي لسلسلة الإيقاع ، فإن اللغة الإنجليزية L1-L2 تتحرك نحو القطب الموقوت بتوقيت الإجهاد < فئة الدعم = "xref">21،< sup class = "xref">22.
يتأثر الوميض المحلي ، <الفئة القوية = "xfig" >الشكل 6B ، ب SD-S و Varco-S. بالنسبة للوميض المحلي ، يقدم كلا إنتاجي Bra-S و L1-BP و L2-English مسارا رتيبا إلى حد ما مع زيادة تباين مدة المقطع (SD و Varco ، انظر الجدول التكميلي S1). قد يكون تصور الجهد الصوتي واضحا عند الاستماع إلى إنتاجات Bra-S بسبب التباين المنخفض الذي يتراوح بين 8.5 و 9 ديسيبل. يتأثر كلام Bra-S بالحمل الصوتي. يتأثر L1-BP بشدة بكون طول الجملة أقل حساسية للاختلافات العالية في مدة المقطع (يظهر النمط الإيقاعي BP تباينا مقطعيا أقل < فئة الدعم = "xref" >22 ، < فئة الدعم = "xref" >56).
< p class = "jove_content" >يوضح معدل الإيقاف المؤقت (< الفئة القوية = "xfig" >الشكل 6C) أن المتحدثين باللغة الإنجليزية L2 ينتجون فترات توقف أطول (من 200 مللي ثانية إلى 375 مللي ثانية) من L1-English و L1-BP و L2-BP (متوسط 30 مللي ثانية ل L1-English و 50 مللي ثانية ل L1-BP و 100 مللي ثانية ل L2-BP). قد يكون تخطيط الكلام ، في هذه الحالة ، قد أثر على إنتاج اللغة الإنجليزية L2 بسبب زيادة نشاط الدماغ< فئة الدعم = "xref">54،57. من المتوقع أن تؤدي إتقان اللغة الأعلى إلى زيادة سرعة القراءة ومدى < sup class = "xref" >54 ؛ ومع ذلك ، حتى بالنسبة للمتحدثين البارعين في L2 ، قدمت مهام القراءة مزيدا من الجهد في الجوانب المعرفية ذات الترتيب الأعلى للكلام الأجنبي وفي معالجة اللغة < فئة الاشتراك = "xref" >54 ، < SUP Class = "XREF" >57. تظهر النتائج التي توصلنا إليها ، على الأقل على أساس أولي ، أن المتحدثين L2-BP قد يكونون أقل تأثرا بالتوقف المؤقت من اللغة الإنجليزية L2 بسبب الاختلافات في النمط الإيقاعي لكلتا اللغتين. < p class = "jove_content biglegend" fo: keep-together.within-page = "1" >
فيما يتعلق بمقاييس الإيقاع ، بالنسبة ل SD-S (<فئة قوية = "xfig">الشكل 7 أ) ، تكشف النتائج التي توصلنا إليها أنه كلما زاد تغيير المتحدث في منحنى f0 وزيادة معدل الكلام ، زاد انخفاض SD-S لجميع مستويات اللغة (تأثير معكوسة ل <فئة قوية = "xfig" >الشكل 6 أ). في حالة SD للحروف الساكنة (SD-C ، <فئة قوية = "xfig">الشكل 7C) ، فإن L1-BP ، على عكس اللغة الإنجليزية L1 ، يؤدي تباينا منخفضا مع زيادة معدل الكلام أو مدة الإيقاف المؤقت. يتم التنبؤ باتجاه SD هذا نظرا لأن تباين L1-English في مدة المقطع (إحصائيا) أعلى بكثير من L1-BP44,58. يبدو أن Varco-S (<فئة قوية = "xfig" >الشكل 7B والجدول التكميلي S1) مرتبطة إلى حد ما ب L1 و L2 من نفس المجموعة اللغوية. مع زيادة تباين f0 ومعدل الكلام ، ينخفض Varco-S ل L1-BP ويبدو أنه ينخفض ويخفف ل L2-BP. للإنتاج إنجليزية ، بينما زيادة تباين F0 والكلام معدل ، يزيد Varco-S ويخفف ل L1-English و L2-English.
< p class = "jove_content">فيما يتعلق ب SD للحروف المتحركة أو الحروف الساكنة (SD-V_C ، <فئة قوية = "xfig" >الشكل 7D والجدول التكميلي S1) ، تظهر نتائجنا بعض أوجه التشابه مع أداء Varco-S (<فئة قوية = "xfig" >الشكل 7 ب). على سبيل المثال ، يعزز معدل الكلام الأعلى ومدة الإيقاف المؤقت وتباين f0 مسار السقوط والارتفاع ل SD-V_C ل L1-BP ، وL2-BP. في الإنتاج الإنجليزي ، في حين أن هذه الميزات العروضية أعلى ، فإن SD-V_C ينخفض قليلا ، ويخفف من L1-English ، ويزيد قليلا ، ثم يخفف ل L2-English. يمكن تفسير ارتباط Varco-S و SD-V_C ب L1-L2 لنفس المجموعات اللغوية جزئيا من خلال التأثير اللومباردي ، والذي يشير إلى تغيير المعلمات الصوتية في الكلام بسبب ضوضاء الخلفية < فئة sup = "xref">59.في الكلام الأجنبي ، اعتمادا على مدى تعقيد المهمة (على سبيل المثال ، قراءة الكلام) ، استخدم المتحدثون استراتيجيات صوتية مماثلة في كل من L1 و L2 < sup class = "xref" > 59 ، < up class = "xref" >60. من ناحية أخرى ، وجد ماركو وإرنستوس أن مقاييس f0 (النطاق والمتوسط) في خطاب L2 Lombard تشير إلى أن المتحدثين باللغة الإنجليزية L2 قد تأثروا بفئة L1 الهولندية < sup = "xref" >61،< sup class = "xref">62. من ناحية أخرى ، تشير النتائج الحديثة إلى أنه على الرغم من أنه من المتوقع أن يختلف الكلام اللومباردي L2 عن الكلام اللومباردي L1 بسبب الحمل المعرفي العالي عند التحدث باللغة L2 ، إلا أن المتحدثين باللغة الإنجليزية L2 أنتجوا خطابا لومبارديا في نفس اتجاه المتحدثين باللغة الإنجليزية L1< sup class = "xref">63. إلى أي مدى تتماشى النتائج التي توصلنا إليها مع Marcoux and Ernestus63 وتتباعد عن Waaning59 و Villegas et al.60 و Marcoux and Ernestus61,62 بحاجة إلى مزيد من التحقيق.

<فئة قوية = "xfig" > الشكل 7: النماذج المضافة المعممة للميزات القياسية. على المحور Y ، متغير الاستجابة (الميزات المترية المراد نمذجتها) ؛ على المحور X ، متغيرات التنبؤ (العامل "اللغة" والمتغيرات المشتركة في النماذج المضافة التي ستوفر شكل ومسارات المنحنيات (أي تأثيرات التنعيم: "اللغة + المتغيرات المشتركة") ، ومنتج "اللغة" وميزة القياس التي ستوفر إسقاطا أكثر دقة لمتغير الاستجابة (على سبيل المثال ، التفاعلات السلسة للعامل: "المتغير المشترك: اللغة"). الاختصار: GAMs = نماذج الإضافة المعممة. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
نتائج إدراك الكلام
فيما يتعلق بتشكيلات صوت BP ، في التشكيلة # 1 (<فئة قوية = "xfig" >الشكل 8 أ) ، تم الحكم على صوت الرقائق # 3 على أنه الصوت المستهدف. في الواقع ، كان الصوت المستهدف هو الصوت # 4. تظهر النتائج عدم وجود فرق ذي دلالة إحصائية (انظر الجدول التكميلي S1) بين الرقاقة # 3 (83٪) والصوت المستهدف # 4 (71٪). في التشكيلة # 2 (< الفئة القوية = "xfig">الشكل 8 ب) ، أظهرت المقارنة بين الصوت المستهدف # 3 (40٪) والرقائق # 4 (20٪) أيضا عدم وجود فرق ذي دلالة إحصائية (انظر الجدول التكميلي S1) لتشكيلات الصوت الإنجليزية. في التشكيلة # 1 (<الفئة القوية = "xfig">الشكل 9 أ) ، لم يكن هناك فرق كبير (انظر الجدول التكميلي S1) بين الرقاقة # 2 (26٪) والصوت المستهدف # 4 (54٪).
من حيث التشابه ، ما الذي يمكن أن يؤدي إلى زيادة الإنذارات الكاذبة؟ أظهرت السمات الصوتية العرضية دليلا على أنه على الرغم من أن أداء الرقائق والأصوات المستهدفة (إحصائيا) بشكل مختلف بشكل كبير - باستثناء التشكيلات المعروضة في <فئة قوية = "xfig" >الشكل 8 أ ، ب و <فئة قوية = "xfig" > الشكل 9 أ - خيارات المستمعين متنوعة إلى حد ما على طول رقائق مختلفة في التشكيلات الأخرى (<فئة قوية = "xfig" >الشكل 8 ج ، د ، و <فئة قوية = "xfig" >الشكل 9 ب-د). يبدو أن مثل هذا الحكم يعتمد على ميزة صوتية محددة (أو ربما أكثر) تشترك فيها مكبرات الصوت أكثر من فئة كاملة من الميزات الصوتية العروضية. على سبيل المثال ، قدمت دراستنا العديد من الميزات (المشتركة) متفاوتة بين الإنتاج. ومع ذلك ، تظهر النتائج الإدراكية تفضيلات الأحكام لرقائق معين لتتناسب مع Target Voice< SUP class = "XREF" >8,< SUP Class = "XREF" >35,< SUP Class = "XREF" >64,< sup class = "xref">65. ومن الضروري إجراء مزيد من التحليلات في العمل المقبل.
من الجدير بالذكر النظر في اختيار مصفوفة بارامترية متعددة الأبعاد للتشابه الصوتي< فئة sup = "xref" >66 كخيار معروض في هذه الدراسة. تتماشى النتائج التي توصلنا إليها مع الدراسات السابقة التي استخدمت الميزات الصوتية بناء على f0 و VQ و Intensity9,35. يتم اقتراح هذه الميزات بشكل ملحوظ لمهام مقارنة المتحدثين في مجال الطب الشرعي< sup class = "xref">9,66. ومع ذلك ، من المهم تسليط الضوء على أنه في البحث الحالي ، لم يكن من المتوقع أن يكون أي من الرقائق مشابها للصوت المستهدف ، على الرغم من أننا استخدمنا نوعا مختلفا من إرشادات McFarlane16،17 في إعداد التشكيلات الصوتية للتعرف على المتحدثين بلكنة أجنبية. علاوة على ذلك ، يجب أن نؤكد أن إجراء تشكيلة الصوت لدينا يحتوي على اختلافات مهمة عن إرشادات McFarlane ، بما في ذلك طول التحفيز وعدد الأصوات واختيار الرقائق (عشوائية هنا) وأسلوب الكلام.
إلى أي مدى ترتبط السمات الصوتية العروضية ل f0 وجودة الصوت والشدة بإدراك المستمعين ستعتمد بشكل كبير على أسلوب التحدث المستخدم في البحث. هنا ، استخدمنا مقاطع القراءة. تختار غالبية دراسات شهود الأذن المحفزات العفوية (شبه) كحل متوازن - على سبيل المثال ، فئة DyVis corpus67 - والتي تم استخدامها على نطاق واسع في تحقيقات شهود الأذن المعاصرة < فئة الدعم = "xref">28 ، < فئة الدعم = "xref">68. السبب الذي دفعنا إلى اختيار مهام القراءة هو أن مجموعتنا ، في وقت تكوين هذه المخطوطة ، كانت تتكون حصريا من البيانات التي تم الحصول عليها من مهام القراءة. ومع ذلك ، من المهم الاعتراف بأن عملية تجميع مجموعة عفوية (شبه) جارية بالفعل. علاوة على ذلك ، يمكن أن يولد فعل قراءة القصة مستوى يمكن الاعتماد عليه من التوحيد والاختلاف ، سواء داخل المتحدث أو بين المتحدثين. هذا يسهل التركيز على الخصائص العروضية أو الصوتية - الفردية أو اللهجة - في المواقف التي تنطوي على مقارنة الصوت. يصبح هذا ملحوظا بشكل خاص في حالات الحمل الصوتي أثناء إنتاج لهجة أجنبية ، حتى بين المتحدثين البارعين 8,9,23,54.
< p class = "jove_content biglegend" fo: keep-together.within-page = "1" >

<فئة قوية = "xfig">الشكل 9: مخططات شريطية تحتوي على نتائج التشكيلات الأربعة التي نفذها المستمعون الأمريكيون. (أ) فرق غير معتد به بين الصوت المستهدف (باللون الأحمر) والرقائق (باللون الوردي). (ب ، ج ، د) اختلافات كبيرة عن الرقائق والصوت المستهدف. الاختصار: NS = غير مهم. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
الجدول التكميلي S1: إحصائيات إنتاج الكلام - النماذج المضافة المعممة (GAMs): إحصائيات F (درجات الحرية) ، R2 المعدلة لكل ميزة صوتية عروضية ذات دلالة إحصائية (<فئة قوية = "xfig" >الشكل 6) ، ومقياس الإيقاع (<فئة قوية = "xfig" >الشكل 7) لكل مستوى لغة، بالإضافة إلى القيم الفردية لكل مصطلح سلس (المتغيرات المشتركة). إحصائيات إدراك الكلام: إحصائيات Kruskall-Wallis χ2 (درجات الحرية) ، والقيم p ، و η المعدلة2 ، بالإضافة إلى اختبار Dunn اللاحق للمقارنة الزوجية (<فئة قوية = "xfig" >الشكل 8 و <فئة قوية = "xfig" >الشكل 9) لكل اختلاف غير ذي دلالة إحصائية بين أزواج أصوات الرقائق المستهدفة (<فئة قوية = "xfig" >الشكل 8 أ ، ب و <فئة قوية = "xfig" >الشكل 9 أ). مصفوفات التشابه الصوتي لمسافة جيب التمام والإقليدية لكل تشكيلة. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.
يقدم البروتوكول الحالي حداثة في مجال الصوتيات (الطب الشرعي). وهي مقسمة إلى مرحلتين: واحدة تعتمد على الإنتاج (التحليل الصوتي) والأخرى على أساس الإدراك (تحليل الحكم). تشتمل مرحلة تحليل الإنتاج على إعداد البيانات والمحاذاة القسرية وإعادة التنظيم والاستخراج التلقائي للميزات الصوتية العروضية إلى جانب الإحصائيات. يربط هذا البروتوكول مرحلة جمع البيانات بتحليل البيانات بطريقة أسرع وأكثر كفاءة من البروتوكولات التقليدية القائمة على التجزئة اليدوية في الغالب.
ومع ذلك ، فإن عملية إعادة المحاذاة ، الموضحة في خطوات البروتوكول من 1.3.6 إلى 1.3.6.9 ، تعمل بشكل أساسي على وحدات الهاتف والكلمات التي تم إنشاؤها في خطوات البروتوكول من 1.3.1 إلى 1.3.4. تكمن حداثة عملية إعادة المحاذاة في أنها تنشئ TextGrid جديدا يحتوي على ثلاثة مستويات نصية جديدة: طبقة مقطعية ، وطبقة مقطع كلام يمكن إنشاؤها تلقائيا أو يدويا بناء على الكلمات ، وطبقة نغمة يمكن أن تكون مفيدة جدا لحساب مقاييس f0. تم استخدام إرشادات إعادة التنظيم المقترحة لهذا البروتوكول سابقا في دراسات إيقاع الكلام L221،69،70 ، ودراسات للكشف عن درجة اللهجة الأجنبية باستخدام تقنيات التعلم الآلي22 ، ودراسات في مجال الطب الشرعي9.
يولد الاستخراج التلقائي للسمات العروضية ، المقدم في خطوات البروتوكول من 1.3.7 إلى 1.3.7.10 ، مصفوفة متعددة الأبعاد من السمات الصوتية العروضية كما يمكن أن يشهد في البحث الحالي. تشمل هذه الميزات ميزات الكلام اللحني والطول والطيفي (جودة الصوت وكثافته)71. عدد كبير من هذه الميزات الصوتية أقل حساسية وقوة إلى حد ما للتسجيلات الصوتية الصاخبة التي يتم جمعها في النهاية في الطب الشرعي أو أي سيناريوهات أخرى72. علاوة على ذلك ، يمكن تطبيق المصفوفة متعددة الأبعاد على أنظمة التعرف على الكلام عبر العديد من تقنيات الذكاء الاصطناعي (العمل قيد التقدم). لا يزال من الممكن أن يكون مفيدا جدا في تدريس الجوانب العروضية في فصول النطق L221 (العمل قيد التقدم).
يمثل التحليل الإحصائي لهذا الجزء من البروتوكول استخدام طريقة GAM لأننا تعاملنا مع علاقة معقدة بين ميزة صوتية معينة ومتحدثين متعددين لعوامل اللغة. لنمذجة ميزة صوتية معينة ، على سبيل المثال ، كان من الضروري التحقق من كيفية أداء الميزات الصوتية الأخرى من المصفوفة (المصطلحات السلسة) حتى نتمكن من وصف ما كان يحدث أثناء إنتاج الكلام بشكل أكثر دقة.
فيما يتعلق بتحليل الإدراك ، تم تشكيل البروتوكول الحالي من خلال إعداد وتنفيذ تشكيلات الصوت والتحليل الإحصائي وتحليل التشابه الصوتي. لإعداد التسيارات، استخدمنا البرنامج النصي CreateLineup ل Praat، والذي يقوم تلقائيا بإنشاء ملف صوتي لكل تشكيلة تحتوي على رقائق متسلسلة عشوائيا وصوت مستهدف كما هو موضح في خطوات البروتوكول من 2.2 إلى 2.2.1.9.
للتحليل الإحصائي لهذا البروتوكول ، أجرينا اختبار Kruskal-Wallis غير البارامتري لأن بياناتنا لم تفي بافتراضات تحليل التباين (ANOVA). بمجرد أن يكون لدينا علاقة بين درجات الحكم التي تم تقييمها من قبل المستمعين والتحكم في الصوت المستهدف والرقائق ، اخترنا استخدام إحصائيات النموذج الخطي.
لتحليل التشابه الصوتي ، استخدمنا البرنامج النصي AcousticSmilarity_cosine_euclidean ل Python. ينبثق البرنامج شجرة دليل الكمبيوتر ويطلب من المستخدم اختيار الملف الذي يحتوي على الميزات الصوتية العروضية للرقائق والصوت المستهدف الذي يتكون من التشكيلة في التحليل. بنقرة زر واحدة ، يولد البرنامج النصي ثلاث مصفوفات تشابه: جيب التمام ، والإقليدي ، والإقليدي المحول (من صفر إلى واحد) ، على كل من الملفات ".txt" (المحددة بعلامات الجدولة) و ".csv". لا يزال يتعين علينا أن نضع في اعتبارنا أن كل مجموعة بيانات (ملف ".txt" يحتوي على الميزات الصوتية العروضية للرقائق والهدف) يجب أن تكون في المجلد الأصلي للتشكيلة ، ويجب أن يحتوي كل مجلد تشكيلة على نسخة من البرنامج النصي AcousticSmilarity_cosine_euclidean .
باختصار ، يتقدم البروتوكول الحالي في أبحاث الصوتيات (الطب الشرعي). يتألف من مراحل متميزة - تحليلات الإنتاج والإدراك ، بالإضافة إلى التشابه الصوتي - وهو يسد الفجوة بين جمع البيانات وتحليل الميزات الصوتية متعدد الأبعاد. يمكن للباحثين الاستفادة من منظور شامل ، واستكشاف كل من جوانب الإنتاج والإدراك. علاوة على ذلك ، يضمن هذا البروتوكول قابلية تكرار البحث ، مما يسمح للآخرين بالبناء على إرشادات هذا العمل.
القيود والاتجاهات المستقبلية
لا يزال يتعين علينا أن نضع في اعتبارنا أن كل شيء سينجح إذا اتبع إعداد البيانات الإرشادات المقترحة في خطوات البروتوكول 1.3.1 إلى 1.3.4. إلى جانب ذلك ، في إجراءات المحاذاة القسرية ، يجب أن ندرك أن التقويم القسري الخارجي المدرب مسبقا المستخدم في العمل الحالي - عرضة لأخطاء التجزئة ، خاصة في البيانات المحركة الأجنبية غير المدربة مسبقا أو حتى في التقويم المدرب مسبقا ، سواء كان الصوت لا يتمتع بجودة جيدة أو أن التقويم لا يحتوي على لغة الصوت (هذه الحقيقة ستجعل عمل الخبير أكثر صعوبة ويستغرق وقتا طويلا). يواجه النسخ الشرعي ، وخاصة الملفات الصوتية الأطول ، صعوبات فيما يتعلق بالتمثيل الدقيق والموثوق للتسجيلات المنطوقة72.
هناك أيضا العديد من التحديات في نسخ ومحاذاة الملفات الصوتية الأطول. يتأثر أداء التقويم بأسلوب التحدث والبيئة الصوتية، بالإضافة إلى العوامل الخاصة باللهجة. على الرغم من وجود اختلافات خاصة بالتقويم ، إلا أن أدائها متشابه بشكل عام ويولد تجزئات تقارن جيدا بالمحاذاة اليدوية بشكل عام73. بالإضافة إلى ذلك ، تم تشغيل إنتاج اللغة الإنجليزية L1 و L2 بنموذج صوتي مدرب مسبقا للغة الإنجليزية الأمريكية بسبب عدم توفر نماذج الكلام الأجنبي في MAUS. علاوة على ذلك ، لا توجد نماذج صوتية مدربة مسبقا لضغط الدم في MAUS. بالنسبة لبيانات BP ، تم استخدام النماذج الصوتية الموجودة مسبقا للإيطالية (انظر NOTE ، خطوة البروتوكول 1.3.5.7).
في العمل المستقبلي (قيد التقدم) ، سنستخدم التقويم القسري في مونتريال (MFA) 74 كجزء من البروتوكول. تتمثل إحدى المزايا الرائعة للمصادقة متعددة العوامل في توافر النماذج الصوتية المدربة مسبقا ونماذج الجرافيم إلى الصوت لمجموعة متنوعة من اللغات (بما في ذلك BP) ، بالإضافة إلى القدرة على تدريب نماذج صوتية ورسم إلى صوت جديدة لأي مجموعة بيانات جديدة (أي مجموعة الكلام ذات اللهجة الأجنبية) 75.
ليس لدى أصحاب البلاغ تضارب في المصالح للإعلان.
تم دعم هذه الدراسة من قبل المجلس القومي للتنمية العلمية والتكنولوجية - CNPq، المنحة رقم 307010/2022-8 للمؤلف الأول، ومنحة رقم 302194/2019-3 للمؤلف الثاني. يود المؤلفون أن يعربوا عن خالص امتنانهم للمشاركين في هذا البحث على تعاونهم السخي ومساهماتهم التي لا تقدر بثمن.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| CreateLineup | Personal | collection# | Script for praat لإعداد التشكيلات الصوتية |
| Dell I3 (مع محرك أقراص الحالة الصلبة - SSD) | ديل | # | كمبيوتر محمول |
| برات | بول بورسما & ديفيد وينينك | # | برنامج للتحليل الصوتي |
| Python 3 | Python Software Foundation | # | Interpreted, عالية المستوى, لغة برمجة للأغراض العامة |
| R | مشروع R للحوسبة الإحصائية | # | لغة البرمجة للحوسبة الإحصائية |
| Shure Beta SM7B | Shure | # | Microphone |
| SpeechRhythmExtractor | المجموعة الشخصية | # | Script for praat للاستخراج التلقائي للميزات الصوتية |
| SurveyMonkey | SurveyMonkey Inc. | # | تجميع الاستطلاعات المجانية القابلة للتخصيص ، بالإضافة إلى مجموعة من البرامج الخلفية التي تتضمن تحليل البيانات واختيار العينات والتحيز وتمثيل البيانات. |
| Tascam DR-100 MKII | Tascam | # | مسجل الصوت الرقمي |
| نظام التجزئة التلقائي في ميونيخ MAUS | جامعة ميونيخ | # | محاذاة قسرية للصوت (.wav) والمعلومات اللغوية (.txt) ملفات |
| VVUnitAligner | المجموعة الشخصية | # | Script for praat لإعادة التنظيم التلقائي والمعالجة اللاحقة للوحدات الصوتية |
طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه
طلب إذن