مقالة منهجية

تحديد اللهجة الأجنبية ومكبر الصوت الشرعي في تشكيلات الصوت: تأثير الميزات الصوتية القائمة على العروض

DOI:

10.3791/66313

سبتمبر 27, 2024

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يهدف هذا البحث إلى إجراء مقارنة بين L1-L2-English و L1-L2 البرتغالية للتحقق من مدى تأثير اللهجة الأجنبية في حساب كل من المقاييس والمعلمات الصوتية العروضية ، وكذلك لاختيار الصوت المستهدف في تشكيلة الصوت.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يهدف هذا البحث إلى فحص كل من السمات الصوتية العروضية والارتباطات الإدراكية للغة الإنجليزية ذات اللهجة الأجنبية والبرتغالية البرازيلية ذات اللهجة الأجنبية والتحقق من كيفية ارتباط إنتاج المتحدثين لللكنات الأجنبية والأصلية بتصور المستمعين. في المنهجية ، أجرينا إجراء إنتاج الكلام مع مجموعة من المتحدثين الأمريكيين باللغة البرتغالية البرازيلية L2 ومجموعة من المتحدثين البرازيليين باللغة الإنجليزية L2 ، وإجراء إدراك الكلام الذي أجرينا فيه مجموعات صوتية لكلتا اللغتين. بالنسبة للتحليل الإحصائي لإنتاج الكلام ، قمنا بتشغيل نماذج مضافة معممة لتقييم تأثير مجموعات اللغات على كل فئة (متري أو صوتي عرودي) من الميزات التي يتم التحكم فيها من أجل تأثير التنعيم للمتغيرات (المتغيرات المساعدة) من الفئة المقابلة. بالنسبة للتحليل الإحصائي لإدراك الكلام ، أجرينا اختبار Kruskal-Wallis واختبار Dunn اللاحق لتقييم تأثير أصوات التشكيلات على الدرجات التي يحكم عليها المستمعون. ومع ذلك ، أجرينا اختبارات التشابه الصوتي (الصوتي) بناء على مسافات جيب التمام والإقليدس. أظهرت النتائج اختلافات صوتية معنوية بين المجموعات اللغوية من حيث تباين f0 والمدة وجودة الصوت. بالنسبة للتشكيلات ، أشارت النتائج إلى أن السمات العروضية ل f0 والشدة وجودة الصوت مرتبطة بأحكام المستمعين المتصورة.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

اللهجة هي جانب بارز وديناميكي للتواصل والطلاقة ، سواء في اللغة الأم (L1) أو في لغة أجنبية (L2) < sup class = "xref" >1. تمثل اللكنة الأجنبية السمات الصوتية L2 للغة المستهدفة ، ويمكن أن تتغير (بمرور الوقت) استجابة لتجربة المتحدث L2 ، وأسلوب التحدث ، وجودة الإدخال ، والعرض ، من بين متغيرات أخرى. يمكن قياس اللهجة الأجنبية على أنها درجة (عددية) من الاختلاف بين الكلام L2 الذي ينتجه متحدث أجنبي واللهجة المحلية أو المرجعية للغة المستهدفة< sup class = "xref" >2,3,4,5.

يهدف هذا البحث إلى فحص كل من السمات الصوتية العروضية والارتباطات الإدراكية للغة الإنجليزية ذات اللهجة الأجنبية والبرتغالية البرازيلية ذات اللهجة الأجنبية (BP) ، وكذلك التحقق من مدى ارتباط إنتاج المتحدثين لللكنات الأجنبية والأصلية بتصور المستمعين. أظهرت الأبحاث السابقة في مجال الطب الشرعي متانة حروف العلة والحروف الساكنة في تحديد اللهجة الأجنبية على أنها إما مستقرة لتحليل طويل الأمد للفرد (The Lo Case6) أو تشير إلى دقة الهوية العالية للمتحدث (The Lindbergh Case7). ومع ذلك ، فإن استكشاف الميزات الصوتية العروضية بناء على المدة والتردد الأساسي (f0 ، أي الارتباط الصوتي للنغمة) والشدة وجودة الصوت (VQ) قد اكتسب اهتماما متزايدا< فئة الدعم = "xref" >8،< sup class = "xref">9. وبالتالي ، فإن اختيار الميزات الصوتية العروضية في هذه الدراسة يمثل وسيلة واعدة في مجال صوتيات الطب الشرعي< sup class = "xref" >8،10،11،12,13.

البحث الحالي مدعوم بدراسات مخصصة لللكنات الأجنبية كشكل من أشكال التنكر الصوتي في قضايا الطب الشرعي< sup class = "xref" >14,15 ، وكذلك في إعداد التشكيلات الصوتية للتعرف على المتحدث< فئة sup = "xref">16,17. على سبيل المثال ، لعب معدل الكلام دورا مهما في تحديد المتحدثين الألماني والإيطالي والياباني والبرازيلي للغة الإنجليزية < sup class = "xref" > 18 ، < sup class = "xref" > 19 ، < sup class = "xref" > 20 ، < sup class = "xref" > 21 ، < sup class = "xref" > 22. إلى جانب معدل الكلام ، تتحدى الميزات الطيفية و f0 طويلة المدى المتحدثين البارعين في L2 مع الإلمام باللغة المستهدفة لأن الدماغ والقواعد المعرفية تعاني من عجز في الذاكرة والانتباه والعاطفة ، مما ينعكس في الأداء الصوتي للمتحدث أثناء المنعطفات الطويلة للكلام < فئة sup = "xref" >23. وجهة نظر اللهجات الأجنبية في مجال الطب الشرعي هي أن تعريف ما يبدو حقا وكأنه لهجة أجنبية يعتمد إلى حد كبير على عدم إلمام المستمع بدلا من الحصول على درجة لا تتجاوز إلى أقصى حد من الكلام بلكنة أجنبية < sup class = "xref" >24.

في المجال الإدراكي ، فإن أداة الطب الشرعي الشائعة المستخدمة منذ منتصف التسعينيات للتعرف على المجرمين هي تشكيلة الصوت (التعرف السمعي) ، والتي تشبه التعرف البصري المستخدم لتحديد الجاني في مسرح الجريمة < فئة الدعم = "xref">16,< sup class = "xref">25. في تشكيلة صوتية ، يتم تقديم صوت المشتبه به جنبا إلى جنب مع الأصوات المماثلة في الجوانب اللغوية الاجتماعية مثل العمر والجنس والموقع الجغرافي واللهجة والحالة الثقافية - لتحديد هويتها من قبل شاهد الأذن. يعتمد نجاح أو فشل تشكيلة الصوت على عدد عينات الصوت ومدة العينة25,26. علاوة على ذلك ، بالنسبة لعينات العالم الحقيقي ، يعتبر أن جودة الصوت تؤثر باستمرار على دقة التعرف على الصوت. يمكن أن تؤدي جودة الصوت الرديئة إلى تشويه الخصائص الفريدة لفئة الصوت 27. في حالة تشابه الصوت ، يمكن أن تربك التفاصيل الصوتية الدقيقة القائمة على f0 المستمع أثناء التعرف على الصوت < sup class = "xref" >28,29. تمتد هذه الميزات الصوتية إلى ما هو أبعد من f0 وتشمل عناصر المدة ، والسمات الطيفية للكثافة و VQ30. تعد هذه النظرة للميزات العروضية المتعددة أمرا بالغ الأهمية في سياق مقارنة صوت الطب الشرعي لضمان تحديد دقيق لمكبر الصوت < sup class = "xref" >9 ، < sup class = "xref" > 14 ، < sup class = "xref" > 15 ، < sup class = "xref" > 29 ، < sup class = "xref" >31.

باختصار ، أظهرت الدراسات في علم الصوتيات الشرعي بعض الاختلاف فيما يتعلق بتحديد اللهجة الأجنبية على مدى العقود الماضية. من ناحية أخرى ، لا يبدو أن اللهجة الأجنبية تؤثر على عملية تحديد المتحدث < sup class = "xref" >32,33 (خاصة إذا كان المتحدث غير معتاد على اللهجة الأجنبية المستهدفة< sup class = "xref">34). من ناحية أخرى ، هناك نتائج في الاتجاه المعاكس< sup class = "xref" > 12 ، < sup class = "xref" > 34 ، < up class = "xref" > 35.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

حصل هذا العمل على موافقة لجنة أخلاقيات البحث البشري. علاوة على ذلك ، تم الحصول على موافقة مستنيرة من جميع المشاركين في هذه الدراسة لاستخدام بياناتهم ونشرها.

< p class = "jove_title" >1. إنتاج الكلام

ملاحظة: قمنا بجمع الكلام من مهمة قراءة على كل من "L1 English-L2 BP" التي تنتجها المجموعة 1: The American English (من الولايات المتحدة الأمريكية) Speakers (AmE-S) ، وعلى كل من "L1 BP-L2 English" التي تنتجها المجموعة 2: The Brazilian Speakers (Bra-S). انظر الشكل 1 للحصول على مخطط انسيابي لإنتاج الكلام.

figure-protocol-1
<فئة قوية = "xfig" >الشكل 1: مخطط انسيابي تخطيطي لإنتاج الكلام. الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.

  1. المشاركون
    1. تحديد عدد المشاركين واللغة (L1 English و L2 BP ؛ L1 BP ، L2 الإنجليزية) ، والجنس (أنثى أو ذكر) ، والعمر (المتوسط ، الانحراف المعياري) ، وخصائص المجموعة (المهنيين أو الطلاب الجامعيين) ، ومستوى الكفاءة L2 (متقدم أو متقدم) لكل مجموعة.
      ملاحظة: بالنسبة للبحث الحالي ، تم اعتبار كل من AmE-S و Bra-S بارعين في L2 (تم تأهيل كلتا المجموعتين على أنهما B2-C1 < sup class = "xref" >36). عاشت AME-S لمدة عامين في البرازيل عندما تم إجراء الإجراءات. عاشت Bra-S أكثر من عامين في الولايات المتحدة الأمريكية عندما تم إجراء الإجراءات. أثناء إقامتهم في الخارج ، اعتادت كلتا المجموعتين على التحدث باللغة L2 لأغراض الدراسة والعمل على الأقل 6 أيام في الأسبوع لمدة ~ 4-5 ساعات في اليوم.
    2. خصص المشاركين في غرفة مريحة وهادئة وقدم مواد القراءة لكل مجموعة.
  2. جمع البيانات
    ملاحظة: يجب جمع بيانات الكلام من مهمة قراءة باللغات التالية: L1-English و L2-BP; L1-BP و L2-English. دع المشاركين يقرؤون النصوص مسبقا إذا لزم الأمر.
    1. إجراءات التسجيل
      1. سجل بيانات الكلام في مكان هادئ بظروف صوتية مناسبة.
      2. استخدم مسجل صوت رقمي (انظر جدول المواد) < sup class = "xref" > 37 وميكروفون قلبي معزول كهرومغناطيسي أحادي الاتجاه (انظر جدول المواد) < sup class = "xref" > 38.
      3. سجل البيانات الصوتية في شكل ".wav".
      4. قم بإعداد معدل أخذ العينات عند kHz 48 ومعدل التكميم عند 16 بت.
        ملاحظة: يطبق النسق السمعي والتشكيلة لمعدلات أخذ العينات والتكميم الموصوفة في الخطوتين 3.1.1.2.1 و1.2.4 لضمان جودة عالية وتقليل الضوضاء للحفاظ على السمات الطيفية المستعملة في التحليل الصوتي اللاحق.
  3. التحليل الصوتي
    ملاحظة: قسم إجراءات التحليل الصوتي إلى ثلاث خطوات: المحاذاة القسرية وإعادة التنظيم واستخراج الميزة الصوتية.
    1. اكتب النسخ اللغوي (في أ '.txt') لكل ملف صوتي.
    2. ضع علامة على زوج الملفات ".txt" / ".wav" بنفس الاسم (على سبيل المثال ، "my_file.wav'/ 'my_file. txt').
      ملاحظة: لتحسين أداء الإجراء الموضح في القسم 1.3.7 ، يوصى بشدة بأن تمثل الأحرف الثلاثة الأولى من علامات الملف ".txt / .wav" اللغة أو اللهجة أو اللهجة ، بينما تشير الأحرف الرابعة إلى السادسة إلى الجنس (على سبيل المثال ، EL1FEM ل English L1 Femالبيرة). من الحرف السابع فصاعدا ، يجب على المستخدم الإشارة إلى رقم المتحدث (على سبيل المثال ، 001 للمتحدث الأول). وبالتالي ، فإن أول زوج ".txt / .wav" هو EL1FEM001.
    3. قم بإنشاء مجلد لكل لغة L1-L2.
      ملاحظة: مجلد للغة الإنجليزية L1-L2 ومجلد ل L1-L2 BP.
    4. قم بالتحقق من أن جميع أزواج الملفات من نفس اللغة موجودة في نفس المجلد.
    5. إجراء المحاذاة القسرية.
      1. قم بالوصول إلى واجهة الويب الخاصة ب ميونيخ التجزئة التلقائية (MAUS) التقويم القسري (الويبMAUS) < sup class = "xref" > 39 في https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. اسحب وأفلت كل زوج من . wav / . txt من المجلد إلى المستطيل المتقطع في الملفات (أو انقر داخل المستطيل ، الشكل 2 أ).
      3. انقر فوق تحميل زر لتحميل الملفات في التقويم (انظر السهم الأحمر في <الفئة القوية = "xfig">الشكل 2 أ).
      4. حدد الخيارات التالية في قائمة خيارات الخدمة (<فئة قوية="xfig">الشكل 2 ب): G2P-MAUS-PHO2SYL لاسم خط الأنابيب؛ الإنجليزية (الولايات المتحدة) (للغة) إذا كانت بيانات اللغة الإنجليزية L1-L2 ؛ الإيطالية (IT) (للغة) إذا كانت L1-L2 BP data.
        ملاحظة: اخترنا "الإيطالية" لبيانات BP لأن webMAUS لا يوفر نماذج صوتية مدربة مسبقا للمحاذاة القسرية ل BP. يفترض الأدب الصوتي أن علم الأصوات الإيطالي لديه مخزون متماثل من سبعة أحرف متحركة قابل للمقارنة إلى حد ما ، تماما مثل BP40 ، بالإضافة إلى أوجه التشابه الصوتية الساكنة < فئة الدعم = "xref" >41،< sup class = "xref">42.
      5. احتفظ بالخيارات الافتراضية ل "تنسيق الإخراج" و "الاحتفاظ بكل شيء".
      6. حدد مربع خيار التشغيل لقبول شروط الاستخدام (انظر السهم الأخضر في <الفئة القوية = "xfig">الشكل 2C).
      7. انقر فوق الزر تشغيل خدمة الويب لتشغيل الملفات التي تم تحميلها في التقويم.
        ملاحظة: لكل ملف صوتي ، يقوم المحاذاة القسرية MAUS بإرجاع كائن Praat TextGrid (ملف ".txt" منسق مسبقا من Praat يحتوي على تعليق توضيحي للكلمات والمقاطع الصوتية والهواتف بناء على النسخ اللغوي المستخرج من ملف ".txt" الموضح في الخطوة 1.3.1).
      8. انقر على تنزيل كملف مضغوط زر لتنزيل ملفات TextGrid كملف مضغوط (<فئة قوية = "xfig" >الشكل 2C).
        ملاحظة: تأكد من تنزيل ملفات TextGrid المضغوطة في نفس المجلد مثل الملفات الصوتية.
      9. استخرج ملفات TextGrid لإعادة المحاذاة لاحقا في برنامج التحليل الصوتي43.
    6. إجراء إعادة التنظيم.
      1. قم بالوصول إلى البرنامج النصي ل Praat VVUnitAligner < sup class = "xref" >44 وتنزيله من https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat.
      2. قم بالإقرار بأن جميع أزواج الملفات من نفس اللغة والبرنامج النصي VVUnitAligner موجودة في نفس المجلد.
        ملاحظة: مجلد لملفات اللغة الإنجليزية L1-L2 و VVunitAligner ، ومجلد لملفات L1-L2 BP و VVunitAligner.
      3. افتح برنامج التحليل الصوتي.
      4. انقر فوق Praat | افتح البرنامج النصي Praat لاستدعاء البرنامج النصي من نافذة الكائن.
      5. انقر فوق الزر "تشغيل" مرة واحدة.
        ملاحظة: سيظهر على الشاشة نموذج يسمى محاذاة المقطع الصوتي يحتوي على إعدادات استخدام البرنامج النصي (< الفئة القوية = "xfig">الشكل 3 أ).
      6. انقر فوق الزر "اللغة" للاختيار من بين اللغات "الإنجليزية (الولايات المتحدة)" أو "البرتغالية (BR)" أو "الفرنسية (FR)" أو "الإسبانية (ES)".
      7. انقر على زر تقسيم الأجزاء للاختيار من بين إجراء التقسيم "تلقائي" أو "إجباري (يدوي)" أو "لا شيء".
      8. حدد خيار حفظ ملفات TextGrid لحفظ ملفات TextGrid الجديدة تلقائيا.
      9. انقر فوق موافق | تشغيل الأزرار لإعادة محاذاة الوحدات الصوتية من الخطوة 1.3.5.7 .
        ملاحظة: لكل ملف صوتي ، سيقوم VVUnitAligner بإنشاء ملف TextGrid جديد للقسم 1.3.7 (<فئة قوية = "xfig" > الشكل 3 ب).
    7. إجراء الاستخراج التلقائي للميزات الصوتية.
      1. قم بالوصول إلى البرنامج النصي SpeechRhythmExtractor45 وتنزيله من https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat للاستخراج التلقائي للميزات الصوتية العرضية.
      2. قم بإنشاء مجلد جديد وضع SpeechRhythmExtractor مع جميع أزواج ملفات الصوت / TextGrid من جميع اللغات.
      3. افتح برنامج التحليل الصوتي.
      4. انقر فوق Praat | افتح البرنامج النصي Praat لاستدعاء البرنامج النصي من نافذة الكائن.
      5. انقر فوق الزر "تشغيل" مرة واحدة فقط.
        ملاحظة: سيظهر نموذج يحتوي على إعدادات البرنامج النصي على الشاشة. في مربعات أسماء ملفات الإخراج ".txt" ، أعد تسمية الملفات وفقا لذلك أو اترك الأسماء الافتراضية.
      6. تحقق من خيار معلمات جودة الصوت لحفظ ملف الإخراج VQ لجودة الصوت (<فئة قوية = "xfig" >الشكل 3C).
        ملاحظة: يحتوي ملف الإخراج الثاني هذا (ملف الإخراج VQ) على معلمات الفرق بين التوافقيات 1و 2nd (H1-H2) وذروة البروز Cepstral (CPP) < sup class = "xref" >9.
      7. تحقق من خيار الهدف اللغوي للاختيار من بين التسميات "اللغة" أو "اللهجة" أو "اللهجة" (<فئة قوية = "xfig" >الشكل 3 ج).
      8. حدد خيار الوحدة لاختيار ميزات f0 باللون هرتز أو في Semitones (الشكل 3C).
      9. قم بإعداد قيم عتبة F0 ، الحد الأدنى والحد الأقصى للعتبات f0 (< الفئة القوية = "xfig" >الشكل 3C).
        ملاحظة: ما لم يكن للبحث أغراض محددة أو ميزات سمعية محددة محددة مسبقا، يوصى بشدة بترك معلمات الخطوة 1.3.7.9 مع القيم الافتراضية.
      10. انقر فوق موافق | قم بتشغيل الاستخراج التلقائي للميزات الصوتية .
        ملاحظة: يقوم البرنامج النصي SpeechRhythmExtractor بإرجاع ملف ".txt" محدد بعلامات جدولة (ملف الإخراج / ملف الإخراج VQ) يحتوي على الميزات الصوتية المستخرجة من مكبرات الصوت.
  4. التحليل الإحصائي
    1. قم بتحميل جدول البيانات الذي يحتوي على الميزات الصوتية في بيئة R46 (أو أي برنامج إحصائي / بيئة من اختيارها).
    2. إجراء إحصائيات غير معلمية للنماذج المضافة المعممة (GAMs).
      1. أداء GAMs في R.
      2. اكتب الأوامر التالية واضغط على Enter.
        المكتبة (MGCV)
        النموذج = gam (الميزة المترية / العروضية الصوتية في التحليل ~ اللغة + s (ميزة المقياس المختارة ، بواسطة = اللغة) + ميزات مترية / عروضية صوتية أخرى ، البيانات = إطار البيانات)
        ملاحظة: قررنا إجراء إحصائيات اختبار البروتوكول بلغة البرمجة R بسبب شعبيته المتزايدة بين علماء الصوتيات (واللغويين) في المجتمع الأكاديمي. تم استخدام R إلى حد كبير في أبحاث العمل الميداني الصوتي< فئة الدعم = "xref">47. ضع في اعتبارك أن الخطوة 1.4.2.2 تحتوي على رمز زائف. كتابة الكود وفقا لمتغيرات البحث.

figure-protocol-2
الشكل 2: لقطة شاشة من المحاذاة الصوتية باستخدام التقويم القسري MAUS. (أ) المستطيل المتقطع مخصص لسحب وإسقاط ملفات "my_file.wav" /" my_file.txt" أو النقر في الداخل للبحث عن هذه الملفات من المجلد ؛ يشار إلى زر التحميل بالسهم الأحمر. (ب) الملفات التي تم تحميلها من اللوحة A (انظر السهم الأزرق) ، وخط الأنابيب المراد استخدامه ، ولغة أزواج الملفات ، وتنسيق الملف المراد إرجاعه ، وزر "صواب / خطأ" للاحتفاظ بجميع الملفات. (ج) شروط استخدام خانة الاختيار (انظر السهم الأخضر) ، والزر تشغيل خدمات الويب ، والنتائج (ملفات TextGrid المراد تنزيلها). الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-protocol-3
<فئة قوية = "xfig">الشكل 3: لقطة شاشة لإجراء إعادة المحاذاة. (أ) نموذج إعدادات الإدخال لإجراء إعادة المحاذاة. (ب) شكل الموجة الجزئي ، ومطياف النطاق العريض مع محيط f0 (أزرق) ، وستة طبقات مجزأة (ومصنفة) على أنها المستوى 1: وحدات بداية حرف العلة إلى بداية الحرف المتحرك التالي (V_to_V) ؛ بداية حرف العلة (V_to_V) ؛ المستوى 2: وحدات حرف العلة (V) والحرف الساكن (C) والإيقاف المؤقت (#) ؛ المستوى 3: التمثيلات الصوتية V_to_V ؛ المستوى 4: بعض الكلمات من النص ؛ المستوى 5: بعض الأجزاء (CH) من الكلام من النص ؛ المستوى 6: طبقة الدرجة اللونية التي تحتوي على أعلى (H) وأدنى نغمة (L) لكل جزء كلام تنتجه أنثى AmE-S. (ج) إعدادات الإدخال للاستخراج التلقائي للميزات الصوتية. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

< p class = "jove_title" >2. إدراك الكلام

ملاحظة: قمنا بإجراء أربع تشكيلات صوتية باللغة الإنجليزية مع مستمعين أمريكيين وأربع تشكيلات في BP مع مستمعين برازيليين. انظر الشكل 4 للحصول على مخطط انسيابي لإدراك الكلام.

< p class = "jove_content biglegend" fo: keep-together.within-page = "1" >figure-protocol-4
<فئة قوية = "xfig" >الشكل 4: مخطط انسيابي تخطيطي لإدراك الكلام. الرجاء النقر هنا لعرض نسخة أكبر من هذا الشكل.
  1. المشاركون
    1. اختر مشاركين مختلفين لكل مجموعة من المشاركين الذين شاركوا في بروتوكول إنتاج الكلام.
      ملاحظة: تم اختيار مجموعتين من المشاركين لهذا الجزء من البروتوكول: المجموعة 1: The American English (من الولايات المتحدة الأمريكية) Listeners (AmE-L) ، والمجموعة 2: The Brazilian Listeners (Bra-L). بالنسبة للبحث الحالي ، تم اعتبار كل من AmE-L و Bra-L بارعين في L2 (تم تأهيل كلتا المجموعتين على أنهما B2-C136 عاش AmE-L عامين في البرازيل عندما تم إجراء الإجراءات. عاشت Bra-L أكثر من عامين في الولايات المتحدة الأمريكية عندما تم إجراء الإجراءات. أثناء إقامتهما في الخارج ، اعتادت كلتا المجموعتين على التحدث باللغة الثانية لأغراض الدراسة والعمل (ستة أيام على الأقل في الأسبوع لمدة 4 إلى 5 ساعات في اليوم).
    2. تحديد عدد المشاركين واللغة (L1 English و L2 BP ؛ L1 BP ، L2 الإنجليزية) ، والجنس (أنثى أو ذكر) ، والعمر (المتوسط ، الانحراف المعياري) ، وخصائص المجموعة (المهنيين أو الطلاب الجامعيين) ومستوى الكفاءة L2 لكل مجموعة.
  2. التشكيلات الصوتية
    ملاحظة: قسم إجراءات التشكيلات الصوتية إلى خطوتين مختلفتين: إعداد وتشغيل التشكيلات الصوتية.
    1. قم بإعداد أربع مجموعات صوتية للغة الإنجليزية وأربعة للغة الإنجليزية.
      1. احصل على ملفات صوتية من مكبرات الصوت في القسم 1: إنتاج الكلام.
      2. قم بالتحقق من أن الملفات الصوتية لكل عامل لغة موجودة في مجلدات منفصلة.
      3. اختر عشوائيا ستة أجزاء صوتية باللغة الإنجليزية L1 أو L1 BP.
        ملاحظة: ستة أصوات في التشكيلة تمثل صوتا مستهدفا واحدا وخمسة رقائق.
      4. اختر جزءا صوتيا باللغة الإنجليزية L2 أو L2 BP من أحد مكبرات الصوت المضمنة في الخطوة 2.2.1.3.
        ملاحظة: الجزء الصوتي في الخطوة 2.2.1.4 هو الصوت المرجعي. يجب أن يكون طول القطع حوالي 20 ثانية.8.
      5. قم بالوصول إلى البرنامج النصي ل Praat CreateLineup48 وتنزيله من https://github.com/pabarbosa/prosody-scripts-CreateLineUp.
      6. قم بالتحقق من أن الصوت المرجعي L2 ، ورقائق L1 ، والصوت المستهدف L1 موجودون في نفس المجلد قبل تشغيل البرنامج النصي CreateLineup (< الفئة القوية = "xfig">الشكل 5).
      7. افتح برنامج التحليل الصوتي.
      8. من نافذة الكائن، انقر على Praat | افتح نص Praat لاستدعاء البرنامج النصي.
      9. انقر فوق تشغيل | تشغيل
        ملاحظة: يقوم البرنامج النصي بإرجاع ملف بالترتيب التالي: (الصوت المرجعي L2) + (الصوت المستهدف L1 والرقائق الموزعة عشوائيا) (<فئة قوية = "xfig">الشكل 5).
    2. تشغيل التشكيلات الصوتية
      1. قم بإنشاء مساحة عبر الإنترنت لاستضافة التشكيلات على أي منصة من اختيارها (على سبيل المثال ، SurveyMonkey. انظر جدول المواد) لإجراء التشكيلات الصوتية عن بعد.
      2. الوصول إلى رابط الفضاء عبر الإنترنت.
      3. قم بتحميل الملفات التي تم إرجاعها من البرنامج النصي CreateLineup إلى النظام الأساسي.
      4. قم بتشغيل الإجراء قبل المشاركين لاختبار كل خطوة.
        ملاحظة: يوصى بالوصول مسبقا إلى الرابط وتشغيل التشكيلات للتحقق مما إذا كان كل شيء يعمل بشكل طبيعي.
  3. التحليل الإحصائي
    1. قم بتحميل جدول البيانات الذي يحتوي على درجات أحكام المستمعين في بيئة R (أو أي برنامج إحصائي / بيئة مختارة).
      1. قم بإجراء اختبار Kruskal-Wallis في R.
      2. اكتب الأوامر التالية واضغط على Enter.
        النموذج = kruskal.test (الأحكام ~ كل تشكيلة صوتية ، البيانات = إطار البيانات)
    2. قم بإجراء اختبار Dunn اللاحق.
      1. قم بإجراء اختبار Dunn في R.
      2. اكتب الأوامر التالية واضغط على Enter.
        المكتبة (FSA)
        النموذج = dunnTest (الأحكام ~ كل تشكيلة صوتية ، البيانات = البيانات ، الطريقة = "bonferroni")
        ملاحظة: الرموز الواردة في الخطوتين 2.1.3.2 و2.3.2.2.2 هي رموز زائفة (انظر الملاحظة 1.4.2.2).
  4. تحليل التشابه الصوتي
    1. حدد التشكيلات (راجع ملاحظة في الخطوة 2.2.1.3) التي قدمت اختلافات غير ذات دلالة إحصائية بين الهدف وأي من الرقائق.
    2. تكرار إجراءات الخطوات 1.3.1 إلى 1.3.7.5 والخطوات 1.3.7.8 إلى 1.3.7.10.
    3. قم بالوصول إلى البرنامج النصي ل Python49 وتنزيله ، AcousticSimilarity_cosine_euclidean< sup class = "xref" >50 من https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      ملاحظة: يرجع البرنامج النصي ثلاث مصفوفات (في ".txt" و ".csv"): واحدة لتشابه جيب التمام < فئة sup = "xref" >51 ، < sup class = "xref" >52 ، واحدة للمسافة الإقليدية < sup class = "xref" >52 ، < sup class = "xref" >53 ، وواحدة لقيم المسافة الإقليدية المحولة ، بالإضافة إلى مقارنة زوجية بين الصوت المستهدف وكل رقائق معدنية.
    4. قم بالإقرار بأن البرنامج النصي قد تم تنزيله في نفس المجلد من مجموعة بيانات التشكيلة.
    5. انقر فوق الزر "فتح ملف" لاستدعاء البرنامج النصي.
    6. انقر فوق تشغيل | تشغيل بدون تصحيح الأزرار.
      ملاحظة: قد يتم تمييز زر التشغيل الثاني على أنه تشغيل أو تشغيل بدون تصحيح أخطاء أو تشغيل البرنامج النصي. كلهم ينفذون نفس الأوامر. يعتمد الأمر ببساطة على بيئة Python المستخدمة.
    7. قم بإجراء اختبارات تشابه الصوت بناء على الميزات الصوتية.
      ملاحظة: تشابه جيب التمام (أو مسافة جيب التمام) هي تقنية مطبقة في الذكاء الاصطناعي (الذكاء الاصطناعي) ، لا سيما في التعلم الآلي في أنظمة التعرف التلقائي على الكلام (ASR). إنه مقياس للتشابه بين صفر وواحد. يعني تشابه جيب تمام التمام القريب من واحد أنه من المحتمل جدا أن يكون صوتان متشابهين. يعني تشابه جيب التمام القريب من الصفر أنه من المحتمل جدا أن تكون الأصوات مختلفة < فئة sup = "xref">52. تستخدم المسافة الإقليدية ، التي يشار إليها غالبا باسم التشابه الإقليدي ، على نطاق واسع في الذكاء الاصطناعي والتعلم الآلي و ASR. إنه يمثل مسافة الخط المستقيم بين نقطتين في الفضاء الإقليدي < sup class = "xref" > 53 ، أي أنه كلما اقتربت النقاط (قيم أقصر للمسافة) ، زادت تشابهة الأصوات. لفهم أوضح للنتائج المبلغ عنها لكلتا التقنيتين ، أجرينا تحويلا للدرجات الأولية للمسافة الإقليدية إلى قيم من صفر (تشابه صوت أقل) إلى واحد (تشابه صوتي أكثر) < فئة sup = "xref" >54.
< p class = "jove_content biglegend" fo: keep-together.within-page = "1" >figure-protocol-5
<فئة قوية = "xfig">الشكل 5: إعداد الدليل لإدراك الكلام. مجلدات التشكيلة. يحتوي كل مجلد على ستة أصوات L1 ، والصوت المستهدف L2 ، والبرنامج النصي "CreateLineup" ، والملف الصوتي لتشكيلة الصوت (يتم إرجاعه بعد تشغيل البرنامج النصي). الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

نتائج إنتاج الكلام
في هذا القسم ، وصفنا أداء الميزات الصوتية العروضية ذات الدلالة الإحصائية ومقاييس الإيقاع. كانت هذه السمات العروضية هي معدلات الكلام والتعبير والإيقاف المؤقت ، والتي ترتبط بالمدة ، والوميض ، الذي يرتبط بجودة الصوت. كانت مقاييس الإيقاع هي الانحراف المعياري (SD) لمدة المقطع اللفظي ، و SD للحرف الساكن ، و SD لمدة الصوت أو الساكن ، ومعامل التباين في مدة المقطع (انظر الجدول التكميلي S1).

ينخفض معدل الكلام (< الفئة القوية = "xfig" >الشكل 6 أ) بسرعة أكبر بالنسبة للغة الإنجليزية L1-L2 مقارنة ب L1-L2 BP ، على الرغم من أن المعدل أقل لكل من L2s. يرتبط معدل الكلام بثلاثة مقاييس - SD لمدة المقطع (SD-S) ، SD للحروف المتحركة (SD-V) ، ومعامل التباين المقطعي (Varco-S). من المهم أيضا أن تضع في اعتبارك أن كلا من AmE-S و Bra-S تتقن مجموعة L2 الخاصة بهم. يبدو أن هذا المعدل يتأثر بالقيم الأعلى لمدة المقطع اللفظي والتباين المنخفض الناتج عن L1-L2 BP ، مما يتسبب في منحدرات أقل انحدارا.

< p class = "jove_content" >يرتبط معدل النطق (<فئة قوية = "xfig" >الشكل 6 د) ب SD-S و Varco-S ، بالإضافة إلى نسبة الإيقاع المقطعي (RR-S) ؛ يمثل الأخير النسبة بين المقاطع الأقصر والأطول. يبدو أن هذه المقاييس تؤثر على معدل النطق تماما مثل معدل الكلام المتأثر بسبب طول الجملة والاختلاف في المدة مما يؤدي إلى ارتفاع تخطيط الكلام L2 ، و L2 الحمل المعرفي < فئة sup = "xref" >9 ، < sup class = "xref" >23 ، < sup class = "xref">54. قد تكون هناك حاجة إلى عبء معرفي لغوي أعلى في مجال طول الجملة بطريقة تتأثر بها المعلمات الصوتية العرضية< فئة الدعم = "xref">55.

فيما يتعلق بالسمات العروضية الصوتية لمعدلات الكلام والنطق ، تشير النتائج التي توصلنا إليها إلى أنه كلما زاد اختلاف المتحدث في مدة المقاطع (وحروف العلة) ، انخفضت هذه المعدلات. نفترض أن إدراك الكلام لكل من L1 و L2 BP يبدو أبطأ إلى حد ما من L1 و L2-English ، وأن L1-English يبدو أسرع من جميع مستويات اللغة الأخرى. قد تكون هذه الحقيقة مرتبطة بإيقاع الكلام والفرضية القائلة بأنه بينما يميل L1-L2 BP نحو القطب الموقوت للمقطع اللفظي لسلسلة الإيقاع ، فإن اللغة الإنجليزية L1-L2 تتحرك نحو القطب الموقوت بتوقيت الإجهاد < فئة الدعم = "xref">21،< sup class = "xref">22.

يتأثر الوميض المحلي ، <الفئة القوية = "xfig" >الشكل 6B ، ب SD-S و Varco-S. بالنسبة للوميض المحلي ، يقدم كلا إنتاجي Bra-S و L1-BP و L2-English مسارا رتيبا إلى حد ما مع زيادة تباين مدة المقطع (SD و Varco ، انظر الجدول التكميلي S1). قد يكون تصور الجهد الصوتي واضحا عند الاستماع إلى إنتاجات Bra-S بسبب التباين المنخفض الذي يتراوح بين 8.5 و 9 ديسيبل. يتأثر كلام Bra-S بالحمل الصوتي. يتأثر L1-BP بشدة بكون طول الجملة أقل حساسية للاختلافات العالية في مدة المقطع (يظهر النمط الإيقاعي BP تباينا مقطعيا أقل < فئة الدعم = "xref" >22 ، < فئة الدعم = "xref" >56).

< p class = "jove_content" >يوضح معدل الإيقاف المؤقت (< الفئة القوية = "xfig" >الشكل 6C) أن المتحدثين باللغة الإنجليزية L2 ينتجون فترات توقف أطول (من 200 مللي ثانية إلى 375 مللي ثانية) من L1-English و L1-BP و L2-BP (متوسط 30 مللي ثانية ل L1-English و 50 مللي ثانية ل L1-BP و 100 مللي ثانية ل L2-BP). قد يكون تخطيط الكلام ، في هذه الحالة ، قد أثر على إنتاج اللغة الإنجليزية L2 بسبب زيادة نشاط الدماغ< فئة الدعم = "xref">54،57. من المتوقع أن تؤدي إتقان اللغة الأعلى إلى زيادة سرعة القراءة ومدى < sup class = "xref" >54 ؛ ومع ذلك ، حتى بالنسبة للمتحدثين البارعين في L2 ، قدمت مهام القراءة مزيدا من الجهد في الجوانب المعرفية ذات الترتيب الأعلى للكلام الأجنبي وفي معالجة اللغة < فئة الاشتراك = "xref" >54 ، < SUP Class = "XREF" >57. تظهر النتائج التي توصلنا إليها ، على الأقل على أساس أولي ، أن المتحدثين L2-BP قد يكونون أقل تأثرا بالتوقف المؤقت من اللغة الإنجليزية L2 بسبب الاختلافات في النمط الإيقاعي لكلتا اللغتين. < p class = "jove_content biglegend" fo: keep-together.within-page = "1" >figure-results-1
<فئة قوية = "xfig">الشكل 6: نماذج مضافة معممة للميزات الصوتية العرضية. على المحور Y ، متغير الاستجابة (الميزات الصوتية المراد نمذجتها) ؛ على المحور X ، متغيرات التنبؤ (العامل "اللغة" والمتغيرات المشتركة في النماذج المضافة التي ستوفر شكل ومسارات المنحنيات (أي تأثيرات التنعيم: "اللغة + المتغيرات المشتركة") ، ومنتج "اللغة" وميزة القياس التي ستوفر إسقاطا أكثر دقة لمتغير الاستجابة (على سبيل المثال ، التفاعلات السلسة للعامل: "المتغير المشترك: اللغة"). الاختصار: GAMs = نماذج الإضافة المعممة. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

فيما يتعلق بمقاييس الإيقاع ، بالنسبة ل SD-S (<فئة قوية = "xfig">الشكل 7 أ) ، تكشف النتائج التي توصلنا إليها أنه كلما زاد تغيير المتحدث في منحنى f0 وزيادة معدل الكلام ، زاد انخفاض SD-S لجميع مستويات اللغة (تأثير معكوسة ل <فئة قوية = "xfig" >الشكل 6 أ). في حالة SD للحروف الساكنة (SD-C ، <فئة قوية = "xfig">الشكل 7C) ، فإن L1-BP ، على عكس اللغة الإنجليزية L1 ، يؤدي تباينا منخفضا مع زيادة معدل الكلام أو مدة الإيقاف المؤقت. يتم التنبؤ باتجاه SD هذا نظرا لأن تباين L1-English في مدة المقطع (إحصائيا) أعلى بكثير من L1-BP44,58. يبدو أن Varco-S (<فئة قوية = "xfig" >الشكل 7B والجدول التكميلي S1) مرتبطة إلى حد ما ب L1 و L2 من نفس المجموعة اللغوية. مع زيادة تباين f0 ومعدل الكلام ، ينخفض Varco-S ل L1-BP ويبدو أنه ينخفض ويخفف ل L2-BP. للإنتاج إنجليزية ، بينما زيادة تباين F0 والكلام معدل ، يزيد Varco-S ويخفف ل L1-English و L2-English.

< p class = "jove_content">فيما يتعلق ب SD للحروف المتحركة أو الحروف الساكنة (SD-V_C ، <فئة قوية = "xfig" >الشكل 7D والجدول التكميلي S1) ، تظهر نتائجنا بعض أوجه التشابه مع أداء Varco-S (<فئة قوية = "xfig" >الشكل 7 ب). على سبيل المثال ، يعزز معدل الكلام الأعلى ومدة الإيقاف المؤقت وتباين f0 مسار السقوط والارتفاع ل SD-V_C ل L1-BP ، وL2-BP. في الإنتاج الإنجليزي ، في حين أن هذه الميزات العروضية أعلى ، فإن SD-V_C ينخفض قليلا ، ويخفف من L1-English ، ويزيد قليلا ، ثم يخفف ل L2-English. يمكن تفسير ارتباط Varco-S و SD-V_C ب L1-L2 لنفس المجموعات اللغوية جزئيا من خلال التأثير اللومباردي ، والذي يشير إلى تغيير المعلمات الصوتية في الكلام بسبب ضوضاء الخلفية < فئة sup = "xref">59.

في الكلام الأجنبي ، اعتمادا على مدى تعقيد المهمة (على سبيل المثال ، قراءة الكلام) ، استخدم المتحدثون استراتيجيات صوتية مماثلة في كل من L1 و L2 < sup class = "xref" > 59 ، < up class = "xref" >60. من ناحية أخرى ، وجد ماركو وإرنستوس أن مقاييس f0 (النطاق والمتوسط) في خطاب L2 Lombard تشير إلى أن المتحدثين باللغة الإنجليزية L2 قد تأثروا بفئة L1 الهولندية < sup = "xref" >61،< sup class = "xref">62. من ناحية أخرى ، تشير النتائج الحديثة إلى أنه على الرغم من أنه من المتوقع أن يختلف الكلام اللومباردي L2 عن الكلام اللومباردي L1 بسبب الحمل المعرفي العالي عند التحدث باللغة L2 ، إلا أن المتحدثين باللغة الإنجليزية L2 أنتجوا خطابا لومبارديا في نفس اتجاه المتحدثين باللغة الإنجليزية L1< sup class = "xref">63. إلى أي مدى تتماشى النتائج التي توصلنا إليها مع Marcoux and Ernestus63 وتتباعد عن Waaning59 و Villegas et al.60 و Marcoux and Ernestus61,62 بحاجة إلى مزيد من التحقيق.

figure-results-2
<فئة قوية = "xfig" > الشكل 7: النماذج المضافة المعممة للميزات القياسية. على المحور Y ، متغير الاستجابة (الميزات المترية المراد نمذجتها) ؛ على المحور X ، متغيرات التنبؤ (العامل "اللغة" والمتغيرات المشتركة في النماذج المضافة التي ستوفر شكل ومسارات المنحنيات (أي تأثيرات التنعيم: "اللغة + المتغيرات المشتركة") ، ومنتج "اللغة" وميزة القياس التي ستوفر إسقاطا أكثر دقة لمتغير الاستجابة (على سبيل المثال ، التفاعلات السلسة للعامل: "المتغير المشترك: اللغة"). الاختصار: GAMs = نماذج الإضافة المعممة. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

نتائج إدراك الكلام
فيما يتعلق بتشكيلات صوت BP ، في التشكيلة # 1 (<فئة قوية = "xfig" >الشكل 8 أ) ، تم الحكم على صوت الرقائق # 3 على أنه الصوت المستهدف. في الواقع ، كان الصوت المستهدف هو الصوت # 4. تظهر النتائج عدم وجود فرق ذي دلالة إحصائية (انظر الجدول التكميلي S1) بين الرقاقة # 3 (83٪) والصوت المستهدف # 4 (71٪). في التشكيلة # 2 (< الفئة القوية = "xfig">الشكل 8 ب) ، أظهرت المقارنة بين الصوت المستهدف # 3 (40٪) والرقائق # 4 (20٪) أيضا عدم وجود فرق ذي دلالة إحصائية (انظر الجدول التكميلي S1) لتشكيلات الصوت الإنجليزية. في التشكيلة # 1 (<الفئة القوية = "xfig">الشكل 9 أ) ، لم يكن هناك فرق كبير (انظر الجدول التكميلي S1) بين الرقاقة # 2 (26٪) والصوت المستهدف # 4 (54٪).

< p class = "jove_content">في تحليل تشابه الصوت ، أظهر كل من تشابه جيب تمام التمام (CoSim) والمسافة الإقليدية (EucDist ، [EucDist transformed] < sup class = "xref" >54) ارتباطا ثابتا بين الرقائق # 3 والهدف لتشكيلة BP # 1 (CoSim = 0.99 ؛ EucDist = 77.4 ، [0.93]). كان الارتباط بين الرقائق # 4 والهدف قويا بالمثل في تشكيلة BP # 2 (CoSim = 0.99 ، EucDist = 76.3 ، [0.93]). في التشكيلة الإنجليزية # 1 ، كان الارتباط متسقا مع CoSim (0.83 (، ولكن ضعيفا إلى مرضيا ل EucDist (213.0 ، [0.47]. بشكل عام ، كان كل من CoSim و EucDist تقنيتين مرضيات في تحديد تشابه الصوت. بالإضافة إلى ذلك ، كان أداء CoSim أكثر فعالية قليلا ، كما تناوله Gahman و Elangovan < sup class = "xref" > 52 (انظر الجدول التكميلي S1).

من حيث التشابه ، ما الذي يمكن أن يؤدي إلى زيادة الإنذارات الكاذبة؟ أظهرت السمات الصوتية العرضية دليلا على أنه على الرغم من أن أداء الرقائق والأصوات المستهدفة (إحصائيا) بشكل مختلف بشكل كبير - باستثناء التشكيلات المعروضة في <فئة قوية = "xfig" >الشكل 8 أ ، ب و <فئة قوية = "xfig" > الشكل 9 أ - خيارات المستمعين متنوعة إلى حد ما على طول رقائق مختلفة في التشكيلات الأخرى (<فئة قوية = "xfig" >الشكل 8 ج ، د ، و <فئة قوية = "xfig" >الشكل 9 ب). يبدو أن مثل هذا الحكم يعتمد على ميزة صوتية محددة (أو ربما أكثر) تشترك فيها مكبرات الصوت أكثر من فئة كاملة من الميزات الصوتية العروضية. على سبيل المثال ، قدمت دراستنا العديد من الميزات (المشتركة) متفاوتة بين الإنتاج. ومع ذلك ، تظهر النتائج الإدراكية تفضيلات الأحكام لرقائق معين لتتناسب مع Target Voice< SUP class = "XREF" >8,< SUP Class = "XREF" >35,< SUP Class = "XREF" >64,< sup class = "xref">65. ومن الضروري إجراء مزيد من التحليلات في العمل المقبل.

من الجدير بالذكر النظر في اختيار مصفوفة بارامترية متعددة الأبعاد للتشابه الصوتي< فئة sup = "xref" >66 كخيار معروض في هذه الدراسة. تتماشى النتائج التي توصلنا إليها مع الدراسات السابقة التي استخدمت الميزات الصوتية بناء على f0 و VQ و Intensity9,35. يتم اقتراح هذه الميزات بشكل ملحوظ لمهام مقارنة المتحدثين في مجال الطب الشرعي< sup class = "xref">9,66. ومع ذلك ، من المهم تسليط الضوء على أنه في البحث الحالي ، لم يكن من المتوقع أن يكون أي من الرقائق مشابها للصوت المستهدف ، على الرغم من أننا استخدمنا نوعا مختلفا من إرشادات McFarlane16،17 في إعداد التشكيلات الصوتية للتعرف على المتحدثين بلكنة أجنبية. علاوة على ذلك ، يجب أن نؤكد أن إجراء تشكيلة الصوت لدينا يحتوي على اختلافات مهمة عن إرشادات McFarlane ، بما في ذلك طول التحفيز وعدد الأصوات واختيار الرقائق (عشوائية هنا) وأسلوب الكلام.

إلى أي مدى ترتبط السمات الصوتية العروضية ل f0 وجودة الصوت والشدة بإدراك المستمعين ستعتمد بشكل كبير على أسلوب التحدث المستخدم في البحث. هنا ، استخدمنا مقاطع القراءة. تختار غالبية دراسات شهود الأذن المحفزات العفوية (شبه) كحل متوازن - على سبيل المثال ، فئة DyVis corpus67 - والتي تم استخدامها على نطاق واسع في تحقيقات شهود الأذن المعاصرة < فئة الدعم = "xref">28 ، < فئة الدعم = "xref">68. السبب الذي دفعنا إلى اختيار مهام القراءة هو أن مجموعتنا ، في وقت تكوين هذه المخطوطة ، كانت تتكون حصريا من البيانات التي تم الحصول عليها من مهام القراءة. ومع ذلك ، من المهم الاعتراف بأن عملية تجميع مجموعة عفوية (شبه) جارية بالفعل. علاوة على ذلك ، يمكن أن يولد فعل قراءة القصة مستوى يمكن الاعتماد عليه من التوحيد والاختلاف ، سواء داخل المتحدث أو بين المتحدثين. هذا يسهل التركيز على الخصائص العروضية أو الصوتية - الفردية أو اللهجة - في المواقف التي تنطوي على مقارنة الصوت. يصبح هذا ملحوظا بشكل خاص في حالات الحمل الصوتي أثناء إنتاج لهجة أجنبية ، حتى بين المتحدثين البارعين 8,9,23,54.

< p class = "jove_content biglegend" fo: keep-together.within-page = "1" >figure-results-3
<فئة قوية = "xfig">الشكل 8: مخططات شريط تحتوي على نتائج التشكيلات الأربعة التي نفذها المستمعون البرازيليون. (أ ، ب) فرق غير كبير بين الصوت المستهدف (باللون الأزرق) والرقائق (باللون الأزرق الفاتح). (C ، D) اختلافات كبيرة عن الرقائق والصوت المستهدف. الاختصار: NS = غير مهم. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

figure-results-4
<فئة قوية = "xfig">الشكل 9: مخططات شريطية تحتوي على نتائج التشكيلات الأربعة التي نفذها المستمعون الأمريكيون. (أ) فرق غير معتد به بين الصوت المستهدف (باللون الأحمر) والرقائق (باللون الوردي). (ب ، ج ، د) اختلافات كبيرة عن الرقائق والصوت المستهدف. الاختصار: NS = غير مهم. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

الجدول التكميلي S1: إحصائيات إنتاج الكلام - النماذج المضافة المعممة (GAMs): إحصائيات F (درجات الحرية) ، R2 المعدلة لكل ميزة صوتية عروضية ذات دلالة إحصائية (<فئة قوية = "xfig" >الشكل 6) ، ومقياس الإيقاع (<فئة قوية = "xfig" >الشكل 7) لكل مستوى لغة، بالإضافة إلى القيم الفردية لكل مصطلح سلس (المتغيرات المشتركة). إحصائيات إدراك الكلام: إحصائيات Kruskall-Wallis χ2 (درجات الحرية) ، والقيم p ، و η المعدلة2 ، بالإضافة إلى اختبار Dunn اللاحق للمقارنة الزوجية (<فئة قوية = "xfig" >الشكل 8 و <فئة قوية = "xfig" >الشكل 9) لكل اختلاف غير ذي دلالة إحصائية بين أزواج أصوات الرقائق المستهدفة (<فئة قوية = "xfig" >الشكل 8 أ ، ب و <فئة قوية = "xfig" >الشكل 9 أ). مصفوفات التشابه الصوتي لمسافة جيب التمام والإقليدية لكل تشكيلة. الرجاء النقر هنا لعرض نسخة أكبر من هذا الرقم.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقدم البروتوكول الحالي حداثة في مجال الصوتيات (الطب الشرعي). وهي مقسمة إلى مرحلتين: واحدة تعتمد على الإنتاج (التحليل الصوتي) والأخرى على أساس الإدراك (تحليل الحكم). تشتمل مرحلة تحليل الإنتاج على إعداد البيانات والمحاذاة القسرية وإعادة التنظيم والاستخراج التلقائي للميزات الصوتية العروضية إلى جانب الإحصائيات. يربط هذا البروتوكول مرحلة جمع البيانات بتحليل البيانات بطريقة أسرع وأكثر كفاءة من البروتوكولات التقليدية القائمة على التجزئة اليدوية في الغالب.

ومع ذلك ، فإن عملية إعادة المحاذاة ، الموضحة في خطوات البروتوكول من 1.3.6 إلى 1.3.6.9 ، تعمل بشكل أساسي على وحدات الهاتف والكلمات التي تم إنشاؤها في خطوات البروتوكول من 1.3.1 إلى 1.3.4. تكمن حداثة عملية إعادة المحاذاة في أنها تنشئ TextGrid جديدا يحتوي على ثلاثة مستويات نصية جديدة: طبقة مقطعية ، وطبقة مقطع كلام يمكن إنشاؤها تلقائيا أو يدويا بناء على الكلمات ، وطبقة نغمة يمكن أن تكون مفيدة جدا لحساب مقاييس f0. تم استخدام إرشادات إعادة التنظيم المقترحة لهذا البروتوكول سابقا في دراسات إيقاع الكلام L221،69،70 ، ودراسات للكشف عن درجة اللهجة الأجنبية باستخدام تقنيات التعلم الآلي22 ، ودراسات في مجال الطب الشرعي9.

يولد الاستخراج التلقائي للسمات العروضية ، المقدم في خطوات البروتوكول من 1.3.7 إلى 1.3.7.10 ، مصفوفة متعددة الأبعاد من السمات الصوتية العروضية كما يمكن أن يشهد في البحث الحالي. تشمل هذه الميزات ميزات الكلام اللحني والطول والطيفي (جودة الصوت وكثافته)71. عدد كبير من هذه الميزات الصوتية أقل حساسية وقوة إلى حد ما للتسجيلات الصوتية الصاخبة التي يتم جمعها في النهاية في الطب الشرعي أو أي سيناريوهات أخرى72. علاوة على ذلك ، يمكن تطبيق المصفوفة متعددة الأبعاد على أنظمة التعرف على الكلام عبر العديد من تقنيات الذكاء الاصطناعي (العمل قيد التقدم). لا يزال من الممكن أن يكون مفيدا جدا في تدريس الجوانب العروضية في فصول النطق L221 (العمل قيد التقدم).

يمثل التحليل الإحصائي لهذا الجزء من البروتوكول استخدام طريقة GAM لأننا تعاملنا مع علاقة معقدة بين ميزة صوتية معينة ومتحدثين متعددين لعوامل اللغة. لنمذجة ميزة صوتية معينة ، على سبيل المثال ، كان من الضروري التحقق من كيفية أداء الميزات الصوتية الأخرى من المصفوفة (المصطلحات السلسة) حتى نتمكن من وصف ما كان يحدث أثناء إنتاج الكلام بشكل أكثر دقة.

فيما يتعلق بتحليل الإدراك ، تم تشكيل البروتوكول الحالي من خلال إعداد وتنفيذ تشكيلات الصوت والتحليل الإحصائي وتحليل التشابه الصوتي. لإعداد التسيارات، استخدمنا البرنامج النصي CreateLineup ل Praat، والذي يقوم تلقائيا بإنشاء ملف صوتي لكل تشكيلة تحتوي على رقائق متسلسلة عشوائيا وصوت مستهدف كما هو موضح في خطوات البروتوكول من 2.2 إلى 2.2.1.9.

للتحليل الإحصائي لهذا البروتوكول ، أجرينا اختبار Kruskal-Wallis غير البارامتري لأن بياناتنا لم تفي بافتراضات تحليل التباين (ANOVA). بمجرد أن يكون لدينا علاقة بين درجات الحكم التي تم تقييمها من قبل المستمعين والتحكم في الصوت المستهدف والرقائق ، اخترنا استخدام إحصائيات النموذج الخطي.

لتحليل التشابه الصوتي ، استخدمنا البرنامج النصي AcousticSmilarity_cosine_euclidean ل Python. ينبثق البرنامج شجرة دليل الكمبيوتر ويطلب من المستخدم اختيار الملف الذي يحتوي على الميزات الصوتية العروضية للرقائق والصوت المستهدف الذي يتكون من التشكيلة في التحليل. بنقرة زر واحدة ، يولد البرنامج النصي ثلاث مصفوفات تشابه: جيب التمام ، والإقليدي ، والإقليدي المحول (من صفر إلى واحد) ، على كل من الملفات ".txt" (المحددة بعلامات الجدولة) و ".csv". لا يزال يتعين علينا أن نضع في اعتبارنا أن كل مجموعة بيانات (ملف ".txt" يحتوي على الميزات الصوتية العروضية للرقائق والهدف) يجب أن تكون في المجلد الأصلي للتشكيلة ، ويجب أن يحتوي كل مجلد تشكيلة على نسخة من البرنامج النصي AcousticSmilarity_cosine_euclidean .

باختصار ، يتقدم البروتوكول الحالي في أبحاث الصوتيات (الطب الشرعي). يتألف من مراحل متميزة - تحليلات الإنتاج والإدراك ، بالإضافة إلى التشابه الصوتي - وهو يسد الفجوة بين جمع البيانات وتحليل الميزات الصوتية متعدد الأبعاد. يمكن للباحثين الاستفادة من منظور شامل ، واستكشاف كل من جوانب الإنتاج والإدراك. علاوة على ذلك ، يضمن هذا البروتوكول قابلية تكرار البحث ، مما يسمح للآخرين بالبناء على إرشادات هذا العمل.

القيود والاتجاهات المستقبلية
لا يزال يتعين علينا أن نضع في اعتبارنا أن كل شيء سينجح إذا اتبع إعداد البيانات الإرشادات المقترحة في خطوات البروتوكول 1.3.1 إلى 1.3.4. إلى جانب ذلك ، في إجراءات المحاذاة القسرية ، يجب أن ندرك أن التقويم القسري الخارجي المدرب مسبقا المستخدم في العمل الحالي - عرضة لأخطاء التجزئة ، خاصة في البيانات المحركة الأجنبية غير المدربة مسبقا أو حتى في التقويم المدرب مسبقا ، سواء كان الصوت لا يتمتع بجودة جيدة أو أن التقويم لا يحتوي على لغة الصوت (هذه الحقيقة ستجعل عمل الخبير أكثر صعوبة ويستغرق وقتا طويلا). يواجه النسخ الشرعي ، وخاصة الملفات الصوتية الأطول ، صعوبات فيما يتعلق بالتمثيل الدقيق والموثوق للتسجيلات المنطوقة72.

هناك أيضا العديد من التحديات في نسخ ومحاذاة الملفات الصوتية الأطول. يتأثر أداء التقويم بأسلوب التحدث والبيئة الصوتية، بالإضافة إلى العوامل الخاصة باللهجة. على الرغم من وجود اختلافات خاصة بالتقويم ، إلا أن أدائها متشابه بشكل عام ويولد تجزئات تقارن جيدا بالمحاذاة اليدوية بشكل عام73. بالإضافة إلى ذلك ، تم تشغيل إنتاج اللغة الإنجليزية L1 و L2 بنموذج صوتي مدرب مسبقا للغة الإنجليزية الأمريكية بسبب عدم توفر نماذج الكلام الأجنبي في MAUS. علاوة على ذلك ، لا توجد نماذج صوتية مدربة مسبقا لضغط الدم في MAUS. بالنسبة لبيانات BP ، تم استخدام النماذج الصوتية الموجودة مسبقا للإيطالية (انظر NOTE ، خطوة البروتوكول 1.3.5.7).

في العمل المستقبلي (قيد التقدم) ، سنستخدم التقويم القسري في مونتريال (MFA) 74 كجزء من البروتوكول. تتمثل إحدى المزايا الرائعة للمصادقة متعددة العوامل في توافر النماذج الصوتية المدربة مسبقا ونماذج الجرافيم إلى الصوت لمجموعة متنوعة من اللغات (بما في ذلك BP) ، بالإضافة إلى القدرة على تدريب نماذج صوتية ورسم إلى صوت جديدة لأي مجموعة بيانات جديدة (أي مجموعة الكلام ذات اللهجة الأجنبية) 75.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ليس لدى أصحاب البلاغ تضارب في المصالح للإعلان.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم دعم هذه الدراسة من قبل المجلس القومي للتنمية العلمية والتكنولوجية - CNPq، المنحة رقم 307010/2022-8 للمؤلف الأول، ومنحة رقم 302194/2019-3 للمؤلف الثاني. يود المؤلفون أن يعربوا عن خالص امتنانهم للمشاركين في هذا البحث على تعاونهم السخي ومساهماتهم التي لا تقدر بثمن.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
CreateLineupPersonalcollection#Script for praat لإعداد التشكيلات الصوتية
Dell I3 (مع محرك أقراص الحالة الصلبة - SSD) ديل#كمبيوتر محمول
براتبول بورسما & ديفيد وينينك#برنامج للتحليل الصوتي
Python 3Python Software Foundation#Interpreted, عالية المستوى, لغة برمجة للأغراض العامة 
Rمشروع R للحوسبة الإحصائية#لغة البرمجة للحوسبة الإحصائية
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorالمجموعة الشخصية#Script for praat للاستخراج التلقائي للميزات الصوتية
SurveyMonkeySurveyMonkey Inc.#تجميع الاستطلاعات المجانية القابلة للتخصيص ، بالإضافة إلى مجموعة من البرامج الخلفية التي تتضمن تحليل البيانات واختيار العينات والتحيز وتمثيل البيانات.
Tascam DR-100 MKIITascam#مسجل الصوت الرقمي
نظام التجزئة التلقائي في ميونيخ MAUSجامعة ميونيخ#محاذاة قسرية للصوت (.wav) والمعلومات اللغوية (.txt) ملفات
VVUnitAlignerالمجموعة الشخصية#Script for praat لإعادة التنظيم التلقائي والمعالجة اللاحقة للوحدات الصوتية

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

مقالات ذات صلة