يهدف هذا البحث إلى إجراء مقارنة بين L1-L2-English و L1-L2 البرتغالية للتحقق من مدى تأثير اللهجة الأجنبية في حساب كل من المقاييس والمعلمات الصوتية العروضية ، وكذلك لاختيار الصوت المستهدف في تشكيلة الصوت.
مقالة منهجية
يهدف هذا البحث إلى إجراء مقارنة بين L1-L2-English و L1-L2 البرتغالية للتحقق من مدى تأثير اللهجة الأجنبية في حساب كل من المقاييس والمعلمات الصوتية العروضية ، وكذلك لاختيار الصوت المستهدف في تشكيلة الصوت.
يهدف هذا البحث إلى فحص كل من السمات الصوتية العروضية والارتباطات الإدراكية للغة الإنجليزية ذات اللهجة الأجنبية والبرتغالية البرازيلية ذات اللهجة الأجنبية والتحقق من كيفية ارتباط إنتاج المتحدثين لللكنات الأجنبية والأصلية بتصور المستمعين. في المنهجية ، أجرينا إجراء إنتاج الكلام مع مجموعة من المتحدثين الأمريكيين باللغة البرتغالية البرازيلية L2 ومجموعة من المتحدثين البرازيليين باللغة الإنجليزية L2 ، وإجراء إدراك الكلام الذي أجرينا فيه مجموعات صوتية لكلتا اللغتين. بالنسبة للتحليل الإحصائي لإنتاج الكلام ، قمنا بتشغيل نماذج مضافة معممة لتقييم تأثير مجموعات اللغات على كل فئة (متري أو صوتي عرودي) من الميزات التي يتم التحكم فيها من أجل تأثير التنعيم للمتغيرات (المتغيرات المساعدة) من الفئة المقابلة. بالنسبة للتحليل الإحصائي لإدراك الكلام ، أجرينا اختبار Kruskal-Wallis واختبار Dunn اللاحق لتقييم تأثير أصوات التشكيلات على الدرجات التي يحكم عليها المستمعون. ومع ذلك ، أجرينا اختبارات التشابه الصوتي (الصوتي) بناء على مسافات جيب التمام والإقليدس. أظهرت النتائج اختلافات صوتية معنوية بين المجموعات اللغوية من حيث تباين f0 والمدة وجودة الصوت. بالنسبة للتشكيلات ، أشارت النتائج إلى أن السمات العروضية ل f0 والشدة وجودة الصوت مرتبطة بأحكام المستمعين المتصورة.
اللهجة هي جانب بارز وديناميكي للتواصل والطلاقة ، سواء في اللغة الأم (L1) أو في لغة أجنبية (L2) < sup class = "xref" >1. تمثل اللكنة الأجنبية السمات الصوتية L2 للغة المستهدفة ، ويمكن أن تتغير (بمرور الوقت) استجابة لتجربة المتحدث L2 ، وأسلوب التحدث ، وجودة الإدخال ، والعرض ، من بين متغيرات أخرى. يمكن قياس اللهجة الأجنبية على أنها درجة (عددية) من الاختلاف بين الكلام L2 الذي ينتجه متحدث أجنبي واللهجة المحلية أو المرجعية للغة المستهدفة< sup class = "xref" >2,3,4,5.
يهدف هذا البحث إلى فحص كل من السمات الصوتية العروضية والارتباطات الإدراكية للغة الإنجليزية ذات اللهجة الأجنبية والبرتغالية البرازيلية ذات اللهجة الأجنبية (BP) ، وكذلك التحقق من مدى ارتباط إنتاج المتحدثين لللكنات الأجنبية والأصلية بتصور المستمعين. أظهرت الأبحاث السابقة في مجال الطب الشرعي متانة حروف العلة والحروف الساكنة في تحديد اللهجة الأجنبية على أنها إما مستقرة لتحليل طويل الأمد للفرد (The Lo Case6) أو تشير إلى دقة الهوية العالية للمتحدث (The Lindbergh Case7). ومع ذلك ، فإن استكشاف الميزات الصوتية العروضية بناء على المدة والتردد الأساسي (f0 ، أي الارتباط الصوتي للنغمة) والشدة وجودة الصوت (VQ) قد اكتسب اهتماما متزايدا< فئة الدعم = "xref" >8،< sup class = "xref">9. وبالتالي ، فإن اختيار الميزات الصوتية العروضية في هذه الدراسة يمثل وسيلة واعدة في مجال صوتيات الطب الشرعي< sup class = "xref" >8،10،11،12,13.
البحث الحالي مدعوم بدراسات مخصصة لللكنات الأجنبية كشكل من أشكال التنكر الصوتي في قضايا الطب الشرعي< sup class = "xref" >14,15 ، وكذلك في إعداد التشكيلات الصوتية للتعرف على المتحدث< فئة sup = "xref">16,17. على سبيل المثال ، لعب معدل الكلام دورا مهما في تحديد المتحدثين الألماني والإيطالي والياباني والبرازيلي للغة الإنجليزية < sup class = "xref" > 18 ، < sup class = "xref" > 19 ، < sup class = "xref" > 20 ، < sup class = "xref" > 21 ، < sup class = "xref" > 22. إلى جانب معدل الكلام ، تتحدى الميزات الطيفية و f0 طويلة المدى المتحدثين البارعين في L2 مع الإلمام باللغة المستهدفة لأن الدماغ والقواعد المعرفية تعاني من عجز في الذاكرة والانتباه والعاطفة ، مما ينعكس في الأداء الصوتي للمتحدث أثناء المنعطفات الطويلة للكلام < فئة sup = "xref" >23. وجهة نظر اللهجات الأجنبية في مجال الطب الشرعي هي أن تعريف ما يبدو حقا وكأنه لهجة أجنبية يعتمد إلى حد كبير على عدم إلمام المستمع بدلا من الحصول على درجة لا تتجاوز إلى أقصى حد من الكلام بلكنة أجنبية < sup class = "xref" >24.
في المجال الإدراكي ، فإن أداة الطب الشرعي الشائعة المستخدمة منذ منتصف التسعينيات للتعرف على المجرمين هي تشكيلة الصوت (التعرف السمعي) ، والتي تشبه التعرف البصري المستخدم لتحديد الجاني في مسرح الجريمة < فئة الدعم = "xref">16,< sup class = "xref">25. في تشكيلة صوتية ، يتم تقديم صوت المشتبه به جنبا إلى جنب مع الأصوات المماثلة في الجوانب اللغوية الاجتماعية مثل العمر والجنس والموقع الجغرافي واللهجة والحالة الثقافية - لتحديد هويتها من قبل شاهد الأذن. يعتمد نجاح أو فشل تشكيلة الصوت على عدد عينات الصوت ومدة العينة25,26. علاوة على ذلك ، بالنسبة لعينات العالم الحقيقي ، يعتبر أن جودة الصوت تؤثر باستمرار على دقة التعرف على الصوت. يمكن أن تؤدي جودة الصوت الرديئة إلى تشويه الخصائص الفريدة لفئة الصوت 27. في حالة تشابه الصوت ، يمكن أن تربك التفاصيل الصوتية الدقيقة القائمة على f0 المستمع أثناء التعرف على الصوت < sup class = "xref" >28,29. تمتد هذه الميزات الصوتية إلى ما هو أبعد من f0 وتشمل عناصر المدة ، والسمات الطيفية للكثافة و VQ30. تعد هذه النظرة للميزات العروضية المتعددة أمرا بالغ الأهمية في سياق مقارنة صوت الطب الشرعي لضمان تحديد دقيق لمكبر الصوت < sup class = "xref" >9 ، < sup class = "xref" > 14 ، < sup class = "xref" > 15 ، < sup class = "xref" > 29 ، < sup class = "xref" >31.
باختصار ، أظهرت الدراسات في علم الصوتيات الشرعي بعض الاختلاف فيما يتعلق بتحديد اللهجة الأجنبية على مدى العقود الماضية. من ناحية أخرى ، لا يبدو أن اللهجة الأجنبية تؤثر على عملية تحديد المتحدث < sup class = "xref" >32,33 (خاصة إذا كان المتحدث غير معتاد على اللهجة الأجنبية المستهدفة< sup class = "xref">34). من ناحية أخرى ، هناك نتائج في الاتجاه المعاكس< sup class = "xref" > 12 ، < sup class = "xref" > 34 ، < up class = "xref" > 35.
نال هذا العمل موافقة لجنة أخلاقيات البحوث البشرية. علاوة على ذلك، تم الحصول على موافقة مستنيرة من جميع المشاركين في هذه الدراسة لاستخدام بياناتهم ونشرها.
1. إنتاج الكلام
ملاحظة: قمنا بجمع كلام من مهمة قراءة لـ "اللغة الأولى: الإنجليزية-اللغة الثانية: البنجابية" أنتجها من قبل المجموعة 1الـ أمورنيومأمريكي هـالإنجليزية (من الولايات المتحدة الأمريكية) Sالمتحدثين (الإنجليزية الأمريكية - الجنوب)، وباللغتين "اللغة الأولى بنغالية-اللغة الثانية إنجليزية" التي أنتجها المجموعة 2الـ حمالة صدربرازيلي Sمكبرات الصوت (Bra-S). انظر الشكل 1 لمخطط تدفقي لإنتاج الكلام.

الشكل 1: مخطط انسيابي تخطيطي لعملية إنتاج الكلام. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: لقطة شاشة للمحاذاة الصوتية باستخدام أداة المحاذاة القسرية MAUS. (A) المستطيل المتقطع مخصص لسحب وإفلات ملفات 'my_file.wav'/' my_file.txt' أو النقر بداخله للبحث عن هذه الملفات من المجلد؛ ويشير السهم الأحمر إلى زر الرفع. (B) الملفات المرفوعة من اللوحة A (انظر السهم الأزرق)، ومسار المعالجة المراد استخدامه، ولغة أزواج الملفات، وتنسيق الملف المطلوب استرجاعه، وزر 'true/false' للاحتفاظ بجميع الملفات. (C) مربع اختيار شروط الاستخدام (انظر السهم الأخضر)، وزر Run Web Services، والنتائج (ملفات TextGrid التي سيتم تنزيلها). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3لقطة شاشة لإجراء إعادة المحاذاة. (A(نموذج إعدادات الإدخال لإجراء إعادة المحاذاة.)Bشكل موجي جزئي، ومخطط طيفي عريض النطاق مع كنتور التردد الأساسي f0 (باللون الأزرق)، وست مستويات مقسمة (ومصنفة) كـ المستوى الأولوحدات بداية الحرف المتحرك إلى بداية الحرف المتحرك التالي (V_to_V)؛ بداية الحرف المتحرك (V_to_V)؛ المستوى الثانيوحدات الحروف المصوتة (V)، والحروف الساكنة (C)، والوقف (#)؛ المستوى 3تمثيلات صوتية V_to_V؛ المستوى 4بعض الكلمات من النص؛ المستوى 5: بعض قطع (CH) الكلام من النص؛ المستوى 6: المستوى النغمي الذي يحتوي على أعلى (H) وأدنى (L) نغمة لكل قطعة كلام أنتجتها أنثى متحدثة بالإنجليزية الأمريكية القياسية (AmE-S).سيإعدادات الإدخال للاستخراج التلقائي للسمات الصوتية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
2. إدراك الكلام
ملاحظة: أجرينا أربعة اختبارات لعرض الأصوات باللغة الإنجليزية مع مستمعين أمريكيين وأربعة اختبارات باللغة البرتغالية البرازيلية (BP) مع مستمعين برازيليين. راجع الشكل 4 للاطلاع على مخطط تدفقي لإدراك الكلام.

الشكل 4مخطط تدفقي تخطيطي للإدراك الكلامي. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 5: إعداد الدليل الخاص بإدراك الكلام. مجلدات التشكيلة. يحتوي كل مجلد على ستة أصوات L1، وصوت L2 المستهدف، وسكربت "CreateLineup"، وملف صوت تشكيلة الأصوات (الذي يتم استرجاعه بعد تشغيل السكربت). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
نتائج إنتاج الكلام
في هذا القسم، وصفنا أداء السمات الصوتية-النبرية والمقاييس الإيقاعية ذات الدلالة الإحصائية. تمثلت هذه السمات النبرية في معدلات الكلام، والنطق، والتوقف، وهي مرتبطة بالمدة الزمنية، بالإضافة إلى الارتجاف (shimmer) المرتبط بجودة الصوت. أما المقاييس الإيقاعية فكانت الانحراف المعياري (SD) لمدة المقطع اللفظي، والانحراف المعياري للصامت، والانحراف المعياري للمدة الصوتية أو الصامتة، ومعامل التباين لمدة المقطع اللفظي (راجع الجدول التكميلي S1).
الـ معدل الكلام (الشكل 6Aينخفض بمعدل أسرع في حالة اللغة الإنجليزية كلغة ثانية (L1-L2 English) مقارنة باللغة البرتغالية البرازيلية كلغة ثانية (L1-L2 BP)، رغم أن المعدل يكون أدنى في كلتا اللغتين الثانية (L2s). معدل الكلام يرتبط بثلاثة مقاييس - الانحراف المعياري لـمدة المقطع اللفظي (SD-S)، والانحراف المعياري للحروف المصوتة (SD-V)، ومعامل التباين المقطعي (فاركو-إس (Varco-S)ومن المهم أيضاً وضع الاعتبار بأن كلا المجموعتين، AmE-S وBra-S، تتقنان لغتيهما الثانية (L2). ويبدو أن هذا المعدل يتأثر بالقيم الأعلى لمدة المقطع اللفظي والتباين الأقل الذي أنتجه متحدثو اللغة الأولى واللغة الثانية (L1-L2 BP)، مما يؤدي إلى منحدرات أقل انحداراً.
يرتبط معدل النطق (الشكل 6D) بكل من SD-S وVarco-S، بالإضافة إلى نسبة الإيقاع المقطعي (RR-S)؛ حيث تمثل الأخيرة النسبة بين المقاطع القصيرة والطويلة. ويبدو أن هذه المقاييس تؤثر على معدل النطق تماماً كما يتأثر معدل الكلام بطول الجملة والتباين في المدة الزمنية، مما يؤدي إلى زيادة تخطيط الكلام باللغة الثانية (L2)، وزيادة العبء المعرفي باللغة الثانية9,23,54. وقد يتطلب الأمر حملاً معرفياً لغوياً أعلى في نطاق طول الجملة بطريقة تؤثر على المعايير الصوتية العروضية55.
فيما يتعلق بالسمات الصوتية-العروضية لـ معدلات الكلام ومعدلات النطق، تشير نتائجنا إلى أنه كلما زاد تنويع المتحدث في مدة المقاطع (والحروف المصوتة)، انخفضت هذه المعدلات. نفترض أن إدراك الكلام لكل من اللغة البرازيلية البرتغالية (BP) كـ L1 وL2 يبدو أبطأ نوعاً ما من اللغة الإنجليزية كـ L1 وL2، وأن اللغة الإنجليزية كـ L1 تبدو أسرع من جميع مستويات اللغات الأخرى. قد تكون هذه الحقيقة مرتبطة بإيقاع الكلام والفرضية القائلة بأنه بينما تميل لغة BP (L1-L2) نحو قطب التوقيت المقطعي (syllable-timed) في متصل الإيقاع، تتحرك اللغة الإنجليزية (L1-L2) نحو قطب التوقيت النبري (stress-timed)21,22.
الـ الوميض المحلي, الشكل 6B، يتأثر بـ SD-S و Varco-Sبالنسبة لـ الوميض الموضعييُظهر كل من إنتاجات Bra-S وL1-BP وL2-English مساراً رتيباً إلى حد ما مع زيادة تباين مدة المقطع اللفظي (SD وVarco، انظر الجدول التكميلي S1قد يكون إدراك الجهد الصوتي واضحاً عند الاستماع إلى إنتاجات Bra-S نظراً لوجود تباين منخفض يتراوح بين 8.5 و9 ديسيبل. يتأثر كلام Bra-S بالعبء الصوتي. كما يتأثر L1-BP بشدة بطول الجملة، بينما يكون أقل حساسية للتباينات العالية في مدة المقطع اللفظي (يظهر النمط الإيقاعي لـ BP تبايناً مقطعياً أقل).22,56).
يوضح معدل التوقف (الشكل 6C) أن المتحدثين بالإنجليزية كلغة ثانية ينتجون توقفات أطول (من 200 ms إلى 375 ms) مقارنة بالمتحدثين بالإنجليزية كلغة أولى، والبرتغالية البرازيلية كلغة أولى، والبرتغالية البرازيلية كلغة ثانية (بمتوسط 30 ms للإنجليزية كلغة أولى، و50 ms للبرتغالية البرازيلية كلغة أولى، و100 ms للبرتغالية البرازيلية كلغة ثانية). وقد يكون تخطيط الكلام، في هذه الحالة، قد أثر على إنتاج اللغة الإنجليزية كلغة ثانية بسبب زيادة نشاط الدماغ54,57. ومن المتوقع أن تؤدي الكفاءة اللغوية الأعلى إلى زيادة سرعة القراءة ومدى الاستيعاب54؛ ومع ذلك، فحتى بالنسبة للمتحدثين المتقنين للغة الثانية، تطلبت مهام القراءة جهداً أكبر في الجوانب المعرفية العليا للكلام الأجنبي وفي المعالجة اللغوية54,57. وتظهر نتائجنا، على أساس أولي على الأقل، أن المتحدثين بالبرتغالية البرازيلية كلغة ثانية قد يكونون أقل تأثراً بالتوقفات مقارنة بالمتحدثين بالإنجليزية كلغة ثانية، وذلك بسبب الاختلافات في النمط الإيقاعي لكلتا اللغتين.

الشكل 6: النماذج الجمعية المعممة (GAMs) للميزات الصوتية العروضية. يمثل المحور Y المتغير الاستجابي (الميزات الصوتية المراد نمذجتها)؛ ويمثل المحور X المتغيرات التنبؤية (عامل "اللغة" والمتغيرات المصاحبة في النماذج الجمعية التي ستحدد شكل ومسارات المنحنيات (أي تأثيرات التنعيم: 'Language + covariates')، وحاصل ضرب "اللغة" وميزة قياسية ستوفر إسقاطاً أكثر دقة للمتغير الاستجابي (أي تفاعلات التنعيم والعامل: 'covariate:Language')). الاختصارات: GAMs = النماذج الجمعية المعممة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
فيما يتعلق بمقاييس الإيقاع، وبالنسبة لـ SD-S (الشكل 7A)، تكشف نتائجنا أنه كلما زاد تنويع المتحدث لمنحنى f0 وزاد معدل الكلام، انخفض SD-S لجميع مستويات اللغة (وهو تأثير مرآتي لـ الشكل 6A). وفي حالة الانحراف المعياري للصوامت (SD-C، الشكل 7C)، أظهر المتحدثون بـ L1-BP، على عكس متحدثي L1 English، تنويعاً منخفضاً مع زيادة معدل الكلام أو مدة التوقف. ويُتوقع اتجاه SD هذا نظراً لأن تباين مدة المقطع اللفظي لدى L1-English أعلى (إحصائياً) وبشكل ملحوظ من L1-BP44,58. ويبدو أن Varco-S (الشكل 7B و الجدول التكميلي S1) مرتبط إلى حد ما بـ L1 و L2 لنفس المجموعة اللغوية. فمع زيادة تباين f0 ومعدل الكلام، ينخفض Varco-S لـ L1-BP ويبدو أنه ينخفض ويضمحل لـ L2-BP. أما بالنسبة للنطق باللغة الإنجليزية، فبينما يزداد تباين f0 ومعدل الكلام، يزداد Varco-S ويضمحل لكل من L1-English و L2-English.
فيما يتعلق بالانحراف المعياري للحروف المصوتة أو الساكنة (SD-V_C، الشكل 7D والجدول التكميلي S1)، تظهر نتائجنا بعض التشابهات مع أداء Varco-S (الشكل 7B). على سبيل المثال، فإن ارتفاع معدل الكلام، ومدة التوقف، وتغير f0 يعزز مسار الانخفاض ثم الارتفاع لـ SD-V_C بالنسبة لـ L1-BP، وكذلك لـ L2-BP. أما في النطق باللغة الإنجليزية، فبينما تكون هذه السمات العروضية أعلى، ينخفض SD-V_C قليلاً، ويخمد بالنسبة لـ L1-English، ويزداد قليلاً ثم يخمد بالنسبة لـ L2-English. قد يُفسر الارتباط بين Varco-S وSD-V_C بالنسبة لمجموعات L1-L2 من نفس اللغات جزئياً بـ "تأثير لومبارد" (Lombard Effect)، والذي يشير إلى تغير المعايير الصوتية في الكلام نتيجة للضوضاء الخلفية59.
في الكلام بلغة أجنبية، وبناءً على تعقيد المهمة (على سبيل المثال، الكلام المقروء)، استخدم المتحدثون استراتيجيات صوتية مماثلة في كل من اللغة الأولى L1 واللغة الثانية L259,60. فمن ناحية، وجد Marcoux وErnestus أن مقاييس f0 (المدى والوسيط) في كلام لومبارد باللغة الثانية L2 تشير إلى أن المتحدثين بالإنجليزية كلغة ثانية L2 قد تأثروا بلغتهم الهولندية الأولى L161,62. ومن ناحية أخرى، تقترح نتائج حديثة أنه على الرغم من التوقعات باختلاف كلام لومبارد باللغة الثانية L2 عن كلام لومبارد باللغة الأولى L1 بسبب زيادة الحمل المعرفي عند التحدث باللغة الثانية L2، إلا أن المتحدثين بالإنجليزية كلغة ثانية L2 قد أنتجوا كلام لومبارد في نفس اتجاه المتحدثين بالإنجليزية كلغة أولى L163. ولا يزال مدى توافق نتائجنا مع Marcoux وErnestus63 واختلافها عن Waaning59، وVillegas وآخرون60، وMarcoux وErnestus61,62 بحاجة إلى مزيد من الاستقصاء.

الشكل 7: النماذج المضافة المعممة للميزات المترية. على محور Y، متغير الاستجابة (الميزات المترية المراد نمذجتها)؛ وعلى محور X، المتغيرات التنبؤية (عامل "اللغة" والمتغيرات المصاحبة في النماذج المضافة التي ستحدد شكل ومسارات المنحنيات (أي تأثيرات التمهيد: "اللغة + المتغيرات المصاحبة")، وحاصل ضرب "اللغة" وميزة مترية لتوفير إسقاط أكثر دقة لمتغير الاستجابة (أي التفاعلات بين العامل والتمهيد: "المتغير المصاحب:اللغة"). الاختصار: GAMs = النماذج المضافة المعممة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
نتائج إدراك الكلام
فيما يتعلق بمجموعات مقارنة الأصوات BP، في المجموعة رقم 1 (الشكل 8A)، تم تقييم الصوت المضلل رقم 3 على أنه الصوت المستهدف. وفي الواقع، كان الصوت المستهدف هو الصوت رقم 4. وتظهر النتائج عدم وجود فرق ذو دلالة إحصائية (راجع الجدول التكميلي S1) بين الصوت المضلل رقم 3 (83%) والصوت المستهدف رقم 4 (71%). وفي المجموعة رقم 2 (الشكل 8B)، أظهرت المقارنة بين الصوت المستهدف رقم 3 (40%) والصوت المضلل رقم 4 (20%) أيضاً عدم وجود فرق ذو دلالة إحصائية (راجع الجدول التكميلي S1) لمجموعات الأصوات الإنجليزية. وفي المجموعة رقم 1 (الشكل 9A)، لم يكن هناك فرق معنوي (راجع الجدول التكميلي S1) بين الصوت المضلل رقم 2 (26%) والصوت المستهدف رقم 4 (54%).
في تحليل تشابه الصوت، أظهر كل من تشابه جيب التمام (CoSim) والمسافة الإقليدية (EucDist, [EucDist transformed]54) ارتباطاً متسقاً بين العينة المضللة رقم 3 والعينة المستهدفة في مجموعة مقارنة BP رقم 1 (CoSim = 0.99; EucDist = 77.4, [0.93]). وكان الارتباط بين العينة المضللة رقم 4 والعينة المستهدفة قوياً بالمثل في مجموعة مقارنة BP رقم 2 (CoSim = 0.99, EucDist = 76.3, [0.93]). أما في مجموعة مقارنة اللغة الإنجليزية رقم 1، فقد كان الارتباط متسقاً بالنسبة لـ CoSim (0.83)، ولكنه تراوح بين الضعيف والمقبول بالنسبة لـ EucDist (213.0, [0.47]. وبشكل عام، كانت كل من CoSim و EucDist تقنيتين مرضيتين في تحديد تشابه الصوت. بالإضافة إلى ذلك، كان أداء CoSim أكثر فعالية بقليل، كما أشار Gahman و Elangovan52(انظر الجدول التكميلي S1).
فيما يتعلق بالتشابه، ما الذي قد يكون أدى إلى زيادة الإنذارات الكاذبة؟ أظهرت السمات العروضية-الصوتية أدلة على أنه، على الرغم من أن الأصوات المضللة والأصوات المستهدفة قد أدت (إحصائياً) بشكل مختلف بشكل ملحوظ - باستثناء التشكيلات المعروضة في الشكل 8A،B و الشكل 9A - فإن خيارات المستمعين قد تنوعت نوعاً ما عبر مختلف الأصوات المضللة في التشكيلات الأخرى (الشكل 8C،D، و الشكل 9B-D). ويبدو أن مثل هذا الحكم يعتمد بشكل أكبر على سمة صوتية محددة واحدة (أو ربما أكثر) يشترك فيها المتحدثون، بدلاً من الاعتماد على فئة كاملة من السمات العروضية-الصوتية. على سبيل المثال، قدمت دراستنا عدة سمات تتباين (أو تتغير بشكل مشترك) بين الإنتاجات؛ ومع ذلك، تظهر النتائج الإدراكية تفضيلات الأحكام لصوت مضلل معين ليتطابق مع الصوت المستهدف8,35,64,65. وهناك حاجة إلى إجراء تحليلات إضافية في الأعمال المستقبلية.
من الجدير بالذكر النظر في اختيار مصفوفة بارامترية متعددة الأبعاد للتشابه الصوتي66 مثل تلك المعروضة في هذه الدراسة. وتتماشى نتائجنا مع الدراسات السابقة التي استخدمت سمات صوتية تعتمد على f0 وVQ والشدة9,35. وتُقترح هذه السمات بشكل ملحوظ لمهام مقارنة المتحدثين في المجال الجنائي9,66. ومع ذلك، من المهم تسليط الضوء على أنه في البحث الحالي، لم يتم التنبؤ بأن أيًا من العينات المضللة (foils) مشابهة للصوت المستهدف، على الرغم من أننا استخدمنا نسخة معدلة من إرشادات McFarlane16,17 في إعداد مجموعات الأصوات للتعرف على المتحدثين ذوي اللكنات الأجنبية. علاوة على ذلك، يجب أن نؤكد أن إجراء مجموعة الأصوات لدينا يتضمن اختلافات جوهرية عن إرشادات McFarlane، بما في ذلك طول المثير، وعدد الأصوات، واختيار العينات المضللة (والتي كانت عشوائية هنا)، وأسلوب الكلام.
إن مدى ارتباط السمات الصوتية-العروضية للتردد الأساسي f0، وجودة الصوت، والشدة بإدراك المستمعين يعتمد بشكل كبير على أسلوب التحدث المستخدم في البحث. وقد استخدمنا هنا مقاطع مقروءة. وتفضل غالبية دراسات شهود السمع استخدام محفزات (شبه) تلقائية كحل متوازن-مثل مجموعة DyVis corpus67-والتي استُخدمت على نطاق واسع في تحقيقات شهود السمع المعاصرة28,68. والسبب الذي دفعنا لاختيار مهام القراءة هو أن مجموعتنا، في وقت صياغة هذه المخطوطة، كانت تتكون حصرياً من بيانات تم الحصول عليها من مهام القراءة. ومع ذلك، من المهم الإقرار بأن عملية تجميع مجموعة بيانات (شبه) تلقائية جارية بالفعل. علاوة على ذلك، فإن عملية قراءة قصة يمكن أن تولد مستوىً موثوقاً من التوحيد والتباين، سواء على مستوى المتحدث الواحد أو بين المتحدثين المختلفين. وهذا يسهل التركيز على الخصائص العروضية أو الصوتية-سواء كانت فردية أو لهجية-في الحالات التي تتضمن مقارنة الأصوات. ويصبح هذا ملحوظاً بشكل خاص في حالات العبء الصوتي أثناء إنتاج لكنة أجنبية، حتى بين المتحدثين المتقنين 8,9,23,54.

الشكل 8مخططات شريطية تحتوي على النتائج الخاصة بالمجموعات الأربع التي أجراها المستمعون البرازيليون. (A,B(فرق غير جوهري بين الصوت المستهدف (باللون الأزرق) وصوت تضليلي (باللون الأزرق الفاتح). (سي,د) فروق ذات دلالة إحصائية عن المشتتات، والصوت المستهدف. الاختصار: NS = غير دال إحصائياً. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 9: مخططات أعمدة تحتوي على النتائج لأربع مجموعات مقارنة أجراها المستمعون الأمريكيون. (A) فرق غير جوهري بين الصوت المستهدف (باللون الأحمر) والصوت المضلل (باللون الوردي). (B,C,D) فروق جوهرية عن الأصوات المضللة والصوت المستهدف. الاختصار: NS = غير جوهري. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.
الجدول التكميلي S1: إحصائيات إنتاج الكلام - النماذج الجمعية العامة (GAMs): إحصائيات F (درجات الحرية)، وقيمة R2 المعدلة لكل سمة صوتية-صوتية ذات دلالة إحصائية (الشكل 6)، ومقياس الإيقاع (الشكل 7) لكل مستوى لغوي، بالإضافة إلى القيم الفردية لكل حد سلس (المتغيرات المصاحبة). إحصائيات إدراك الكلام: إحصائيات χ2 لاختبار كرسكال-واليس (درجات الحرية)، وقيم p، وقيمة η2 المعدلة، بالإضافة إلى اختبار دن (Dunn's test) البعدي للمقارنة الزوجية (الشكل 8 والشكل 9) لكل فرق غير دال إحصائياً بين أزواج أصوات الهدف والمضلل (الشكل 8A،B والشكل 9A). مصفوفات التشابه الصوتي لمسافة جيب التمام والمسافة الإقليدية لكل مجموعة مقارنة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
يقدم البروتوكول الحالي حداثة في مجال الصوتيات (الطب الشرعي). وهي مقسمة إلى مرحلتين: واحدة تعتمد على الإنتاج (التحليل الصوتي) والأخرى على أساس الإدراك (تحليل الحكم). تشتمل مرحلة تحليل الإنتاج على إعداد البيانات والمحاذاة القسرية وإعادة التنظيم والاستخراج التلقائي للميزات الصوتية العروضية إلى جانب الإحصائيات. يربط هذا البروتوكول مرحلة جمع البيانات بتحليل البيانات بطريقة أسرع وأكثر كفاءة من البروتوكولات التقليدية القائمة على التجزئة اليدوية في الغالب.
ومع ذلك ، فإن عملية إعادة المحاذاة ، الموضحة في خطوات البروتوكول من 1.3.6 إلى 1.3.6.9 ، تعمل بشكل أساسي على وحدات الهاتف والكلمات التي تم إنشاؤها في خطوات البروتوكول من 1.3.1 إلى 1.3.4. تكمن حداثة عملية إعادة المحاذاة في أنها تنشئ TextGrid جديدا يحتوي على ثلاثة مستويات نصية جديدة: طبقة مقطعية ، وطبقة مقطع كلام يمكن إنشاؤها تلقائيا أو يدويا بناء على الكلمات ، وطبقة نغمة يمكن أن تكون مفيدة جدا لحساب مقاييس f0. تم استخدام إرشادات إعادة التنظيم المقترحة لهذا البروتوكول سابقا في دراسات إيقاع الكلام L221،69،70 ، ودراسات للكشف عن درجة اللهجة الأجنبية باستخدام تقنيات التعلم الآلي22 ، ودراسات في مجال الطب الشرعي9.
يولد الاستخراج التلقائي للسمات العروضية ، المقدم في خطوات البروتوكول من 1.3.7 إلى 1.3.7.10 ، مصفوفة متعددة الأبعاد من السمات الصوتية العروضية كما يمكن أن يشهد في البحث الحالي. تشمل هذه الميزات ميزات الكلام اللحني والطول والطيفي (جودة الصوت وكثافته)71. عدد كبير من هذه الميزات الصوتية أقل حساسية وقوة إلى حد ما للتسجيلات الصوتية الصاخبة التي يتم جمعها في النهاية في الطب الشرعي أو أي سيناريوهات أخرى72. علاوة على ذلك ، يمكن تطبيق المصفوفة متعددة الأبعاد على أنظمة التعرف على الكلام عبر العديد من تقنيات الذكاء الاصطناعي (العمل قيد التقدم). لا يزال من الممكن أن يكون مفيدا جدا في تدريس الجوانب العروضية في فصول النطق L221 (العمل قيد التقدم).
يمثل التحليل الإحصائي لهذا الجزء من البروتوكول استخدام طريقة GAM لأننا تعاملنا مع علاقة معقدة بين ميزة صوتية معينة ومتحدثين متعددين لعوامل اللغة. لنمذجة ميزة صوتية معينة ، على سبيل المثال ، كان من الضروري التحقق من كيفية أداء الميزات الصوتية الأخرى من المصفوفة (المصطلحات السلسة) حتى نتمكن من وصف ما كان يحدث أثناء إنتاج الكلام بشكل أكثر دقة.
فيما يتعلق بتحليل الإدراك ، تم تشكيل البروتوكول الحالي من خلال إعداد وتنفيذ تشكيلات الصوت والتحليل الإحصائي وتحليل التشابه الصوتي. لإعداد التسيارات، استخدمنا البرنامج النصي CreateLineup ل Praat، والذي يقوم تلقائيا بإنشاء ملف صوتي لكل تشكيلة تحتوي على رقائق متسلسلة عشوائيا وصوت مستهدف كما هو موضح في خطوات البروتوكول من 2.2 إلى 2.2.1.9.
للتحليل الإحصائي لهذا البروتوكول ، أجرينا اختبار Kruskal-Wallis غير البارامتري لأن بياناتنا لم تفي بافتراضات تحليل التباين (ANOVA). بمجرد أن يكون لدينا علاقة بين درجات الحكم التي تم تقييمها من قبل المستمعين والتحكم في الصوت المستهدف والرقائق ، اخترنا استخدام إحصائيات النموذج الخطي.
لتحليل التشابه الصوتي ، استخدمنا البرنامج النصي AcousticSmilarity_cosine_euclidean ل Python. ينبثق البرنامج شجرة دليل الكمبيوتر ويطلب من المستخدم اختيار الملف الذي يحتوي على الميزات الصوتية العروضية للرقائق والصوت المستهدف الذي يتكون من التشكيلة في التحليل. بنقرة زر واحدة ، يولد البرنامج النصي ثلاث مصفوفات تشابه: جيب التمام ، والإقليدي ، والإقليدي المحول (من صفر إلى واحد) ، على كل من الملفات ".txt" (المحددة بعلامات الجدولة) و ".csv". لا يزال يتعين علينا أن نضع في اعتبارنا أن كل مجموعة بيانات (ملف ".txt" يحتوي على الميزات الصوتية العروضية للرقائق والهدف) يجب أن تكون في المجلد الأصلي للتشكيلة ، ويجب أن يحتوي كل مجلد تشكيلة على نسخة من البرنامج النصي AcousticSmilarity_cosine_euclidean .
باختصار ، يتقدم البروتوكول الحالي في أبحاث الصوتيات (الطب الشرعي). يتألف من مراحل متميزة - تحليلات الإنتاج والإدراك ، بالإضافة إلى التشابه الصوتي - وهو يسد الفجوة بين جمع البيانات وتحليل الميزات الصوتية متعدد الأبعاد. يمكن للباحثين الاستفادة من منظور شامل ، واستكشاف كل من جوانب الإنتاج والإدراك. علاوة على ذلك ، يضمن هذا البروتوكول قابلية تكرار البحث ، مما يسمح للآخرين بالبناء على إرشادات هذا العمل.
القيود والاتجاهات المستقبلية
لا يزال يتعين علينا أن نضع في اعتبارنا أن كل شيء سينجح إذا اتبع إعداد البيانات الإرشادات المقترحة في خطوات البروتوكول 1.3.1 إلى 1.3.4. إلى جانب ذلك ، في إجراءات المحاذاة القسرية ، يجب أن ندرك أن التقويم القسري الخارجي المدرب مسبقا المستخدم في العمل الحالي - عرضة لأخطاء التجزئة ، خاصة في البيانات المحركة الأجنبية غير المدربة مسبقا أو حتى في التقويم المدرب مسبقا ، سواء كان الصوت لا يتمتع بجودة جيدة أو أن التقويم لا يحتوي على لغة الصوت (هذه الحقيقة ستجعل عمل الخبير أكثر صعوبة ويستغرق وقتا طويلا). يواجه النسخ الشرعي ، وخاصة الملفات الصوتية الأطول ، صعوبات فيما يتعلق بالتمثيل الدقيق والموثوق للتسجيلات المنطوقة72.
هناك أيضا العديد من التحديات في نسخ ومحاذاة الملفات الصوتية الأطول. يتأثر أداء التقويم بأسلوب التحدث والبيئة الصوتية، بالإضافة إلى العوامل الخاصة باللهجة. على الرغم من وجود اختلافات خاصة بالتقويم ، إلا أن أدائها متشابه بشكل عام ويولد تجزئات تقارن جيدا بالمحاذاة اليدوية بشكل عام73. بالإضافة إلى ذلك ، تم تشغيل إنتاج اللغة الإنجليزية L1 و L2 بنموذج صوتي مدرب مسبقا للغة الإنجليزية الأمريكية بسبب عدم توفر نماذج الكلام الأجنبي في MAUS. علاوة على ذلك ، لا توجد نماذج صوتية مدربة مسبقا لضغط الدم في MAUS. بالنسبة لبيانات BP ، تم استخدام النماذج الصوتية الموجودة مسبقا للإيطالية (انظر NOTE ، خطوة البروتوكول 1.3.5.7).
في العمل المستقبلي (قيد التقدم) ، سنستخدم التقويم القسري في مونتريال (MFA) 74 كجزء من البروتوكول. تتمثل إحدى المزايا الرائعة للمصادقة متعددة العوامل في توافر النماذج الصوتية المدربة مسبقا ونماذج الجرافيم إلى الصوت لمجموعة متنوعة من اللغات (بما في ذلك BP) ، بالإضافة إلى القدرة على تدريب نماذج صوتية ورسم إلى صوت جديدة لأي مجموعة بيانات جديدة (أي مجموعة الكلام ذات اللهجة الأجنبية) 75.
ليس لدى أصحاب البلاغ تضارب في المصالح للإعلان.
تم دعم هذه الدراسة من قبل المجلس القومي للتنمية العلمية والتكنولوجية - CNPq، المنحة رقم 307010/2022-8 للمؤلف الأول، ومنحة رقم 302194/2019-3 للمؤلف الثاني. يود المؤلفون أن يعربوا عن خالص امتنانهم للمشاركين في هذا البحث على تعاونهم السخي ومساهماتهم التي لا تقدر بثمن.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| CreateLineup | Personal | collection# | Script for praat لإعداد التشكيلات الصوتية |
| Dell I3 (مع محرك أقراص الحالة الصلبة - SSD) | ديل | # | كمبيوتر محمول |
| برات | بول بورسما & ديفيد وينينك | # | برنامج للتحليل الصوتي |
| Python 3 | Python Software Foundation | # | Interpreted, عالية المستوى, لغة برمجة للأغراض العامة |
| R | مشروع R للحوسبة الإحصائية | # | لغة البرمجة للحوسبة الإحصائية |
| Shure Beta SM7B | Shure | # | Microphone |
| SpeechRhythmExtractor | المجموعة الشخصية | # | Script for praat للاستخراج التلقائي للميزات الصوتية |
| SurveyMonkey | SurveyMonkey Inc. | # | تجميع الاستطلاعات المجانية القابلة للتخصيص ، بالإضافة إلى مجموعة من البرامج الخلفية التي تتضمن تحليل البيانات واختيار العينات والتحيز وتمثيل البيانات. |
| Tascam DR-100 MKII | Tascam | # | مسجل الصوت الرقمي |
| نظام التجزئة التلقائي في ميونيخ MAUS | جامعة ميونيخ | # | محاذاة قسرية للصوت (.wav) والمعلومات اللغوية (.txt) ملفات |
| VVUnitAligner | المجموعة الشخصية | # | Script for praat لإعادة التنظيم التلقائي والمعالجة اللاحقة للوحدات الصوتية |