מחקר זה נועד לערוך השוואה בין L1-L2-אנגלית ל-L1-L2 פורטוגזית כדי לבדוק עד כמה ההשפעה של מבטא זר אחראית הן למדדים והן לפרמטרים פרוזודיים-אקוסטיים, כמו גם לבחירת קול היעד במערך הקול.
מאמר שיטה
מחקר זה נועד לערוך השוואה בין L1-L2-אנגלית ל-L1-L2 פורטוגזית כדי לבדוק עד כמה ההשפעה של מבטא זר אחראית הן למדדים והן לפרמטרים פרוזודיים-אקוסטיים, כמו גם לבחירת קול היעד במערך הקול.
מחקר זה נועד לבחון הן את המאפיינים הפרוזודיים-אקוסטיים והן את המתאמים התפיסתיים של אנגלית במבטא זר ופורטוגזית ברזילאית במבטא זר ולבדוק כיצד הפקות המבטא הזר והמקומי של הדוברים קשורות לתפיסת המאזינים. במתודולוגיה ביצענו הליך הפקת דיבור עם קבוצה של דוברי פורטוגזית ברזילאית L2 וקבוצה של דוברי אנגלית ברזילאית L2, והליך תפיסת דיבור בו ביצענו מערכים קוליים לשתי השפות. עבור הניתוח הסטטיסטי של הפקת הדיבור, הרצנו מודלים תוספים כלליים כדי להעריך את ההשפעה של קבוצות השפה על כל מחלקה (מטרית או פרוזודית-אקוסטית) של תכונות הנשלטות לאפקט ההחלקה של המשתנים של המחלקה הנגדית. לצורך הניתוח הסטטיסטי של תפיסת הדיבור, הרצנו מבחן קרוסקאל-וואליס ומבחן דאן פוסט-הוק כדי להעריך את השפעת הקולות של ההרכבים על הציונים שנשפטו על ידי המאזינים. עם זאת, ערכנו מבחני דמיון אקוסטיים (קוליים) המבוססים על מרחקים קוסינוסיים ואוקלידיים. התוצאות הראו הבדלים אקוסטיים משמעותיים בין קבוצות השפה מבחינת שונות ה-f0, משך הזמן ואיכות הקול. עבור ההרכבים, התוצאות הצביעו על כך שמאפיינים פרוזודיים של f0, עוצמה ואיכות קול היו בקורלציה לשיפוט הנתפס של המאזינים.
המבטא הוא היבט בולט ודינמי של תקשורת ושטף, הן בשפת האם (L1) והן בשפה זרה (L2)1. מבטא זר מייצג את המאפיינים הפונטיים של L2 של שפת יעד, והוא יכול להשתנות (עם הזמן) בתגובה לחוויית ה-L2 של הדובר, סגנון הדיבור, איכות הקלט, האקספוזיציה, בין משתנים אחרים. ניתן לכמת מבטא זר כדרגה (סקלרית) של הבדל בין דיבור L2 המופק על ידי דובר זר לבין מבטא מקומי או ייחוס של שפת היעד2,3,4,5.
מחקר זה נועד לבחון הן את המאפיינים הפרוזודיים-אקוסטיים והן את המתאמים התפיסתיים של אנגלית במבטא זר ופורטוגזית ברזילאית במבטא זר (BP), כמו גם לבדוק באיזו מידה הפקות המבטא הזר והמקומי של הדוברים קשורות לתפיסת המאזינים. מחקר קודם בתחום הפורנזי הוכיח את החוסן של תנועות ועיצורים בזיהוי מבטא זר כיציב לניתוח ארוך טווח של אדם (The Lo Case6) או מתייחס לדיוק הזיהוי הגבוה של דובר (The Lindbergh Case7). עם זאת, חקירת מאפיינים פרוזודיים-אקוסטיים המבוססים על משך, תדר בסיסי (f0, כלומר, המתאם האקוסטי של גובה הצליל), עוצמה ואיכות קול (VQ) זכתה לתשומת לב הולכת וגוברת8,9. לפיכך, הבחירה בתכונות פרוזודיות-אקוסטיות במחקר זה מייצגת אפיק מבטיח בתחום הפונטיקה המשפטית8,10,11,12,13.
המחקר הנוכחי נתמך על ידי מחקרים המוקדשים למבטאים זרים כצורה של הסוואת קול במקרים משפטיים14,15, כמו גם בהכנת מערכי קול לזיהוי דוברים16,17. לדוגמה, קצב הדיבור שיחק תפקיד חשוב בזיהוי דוברי גרמנית, איטלקית, יפנית וברזילאית של אנגלית18,19,20,21,22. מלבד קצב הדיבור, תכונות ספקטרליות ו-f0 לטווח ארוך מאתגרות דוברי L2 מיומנים בהיכרות עם שפת היעד מכיוון שהמוח והבסיסים הקוגניטיביים סובלים ממחסור בזיכרון, קשב ורגש, המשתקף בביצועים הפונטיים של הדובר במהלך תורי דיבור ארוכים23. ההשקפה של מבטאים זרים בתחום הזיהוי הפלילי היא שההגדרה של מה באמת נשמע כמו מבטא זר תלויה במידה רבה בחוסר ההיכרות של המאזין ולא בדרגה לא קיצונית של דיבור24.
בתחום התפיסתי, כלי פורנזי נפוץ ששימש מאז אמצע שנות ה-90 לזיהוי פושעים הוא ה-Voice Lineup (זיהוי שמיעתי), המקביל לזיהוי חזותי המשמש לזיהוי פושע בזירת פשע16,25. במערך קולות, קולו של החשוד מוצג לצד רדידים - קולות דומים בהיבטים סוציולינגוויסטיים כגון גיל, מין, מיקום גיאוגרפי, ניב ומעמד תרבותי - לזיהוי על ידי עד שמיעה. ההצלחה או הכישלון של מערך קולי יהיו תלויים במספר דגימות הקול ומשך הדגימה25,26. יתר על כן, עבור דגימות מהעולם האמיתי, נחשב שאיכות השמע משפיעה באופן עקבי על דיוק הזיהוי הקולי. איכות שמע ירודה עלולה לעוות את המאפיינים הייחודיים של קול27. במקרה של דמיון קולי, פירוט פונטי עדין המבוסס על f0 יכול לבלבל את המאזין במהלך זיהוי קולי28,29. תכונות אקוסטיות כאלה משתרעות מעבר ל-f0 וכוללות אלמנטים של משך, ותכונות ספקטרליות של עוצמה ו-VQ30. השקפה זו של מאפיינים פרוזודיים מרובים היא חיונית בהקשר של השוואת קול משפטית כדי להבטיח זיהוי מדויק של דובר9,14,15,29,31.
לסיכום, מחקרים בפונטיקה משפטית הראו שונות מסוימת בנוגע לזיהוי מבטא זר במהלך העשורים האחרונים. מצד אחד, נראה כי מבטא זר אינו משפיע על תהליך זיהוי הדובר32,33 (במיוחד אם הדובר אינו מכיר את המבטא הזר היעד34). מצד שני, ישנם ממצאים בכיוון ההפוך12,34,35.
עבודה זו קיבלה אישור מוועדת אתיקה של מחקר בבני אדם. יתר על כן, הושגה הסכמה מדעת מכל המשתתפים המעורבים במחקר זה להשתמש בנתונים שלהם ולפרסם אותם.
1. הפקת דיבור
הערה: אספנו דיבור ממטלת קריאה הן על 'L1 English-L2 BP' שהופקה על ידי קבוצה 1: The American English (מארה"ב) S peakers(AmE-S), ועל שני 'L1 BP-L2 English' שהופקו על ידי קבוצה 2: The Brazilian Speakers (Bra-S). ראה איור 1 לתרשים זרימה להפקת דיבור.

איור 1: תרשים זרימה סכמטי להפקת דיבור. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 2: צילום מסך מיישור פונטי באמצעות מיישר מאולץ MAUS. (A) המלבן המקווקו מיועד לגרירה ושחרור של קבצי 'my_file.wav'/' my_file.txt' או לחיצה פנימה לחיפוש קבצים כאלה מהתיקייה; כפתור העלאה מסומן על ידי החץ האדום. (B) הקבצים שהועלו מפאנל A (ראו חץ כחול), הצינור שבו יש להשתמש, השפה של זוגות הקבצים, פורמט הקובץ שיש להחזיר, וכפתור 'true/false' לשמירת כל הקבצים. (ג) תנאי השימוש בתיבת הסימון (ראה חץ ירוק), כפתור הפעל שירותי אינטרנט והתוצאות (קבצי TextGrid להורדה). אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.

איור 3: צילום מסך של הליך היישור מחדש. (A) טופס הגדרות קלט עבור הליך היישור מחדש. (B) צורת גל חלקית, ספקטרוגרמה בפס רחב עם קווי מתאר f0 (כחול), ושש שכבות מפולחות (ומסומנות) כשכבה 1: יחידות של תחילת תנועה לתחילת התנועה הבאה (V_to_V); התחלת תנועה (V_to_V); דרגה 2: יחידות של תנועה (V), עיצור (C) והפסקה (#); שכבה 3: ייצוגים פוניים V_to_V; דרגה 4: כמה מילים מהטקסט; דרגה 5: כמה קטעי דיבור (CH) מהטקסט; דרגה 6: שכבה טונאלית המכילה את הצליל הגבוה ביותר (H) והנמוך ביותר (L) של כל קטע דיבור המופק על ידי נקבת AmE-S. (ג) הגדרות קלט לחילוץ אוטומטי של המאפיינים האקוסטיים. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
2. תפיסת דיבור
הערה: ביצענו ארבעה הרכבים קוליים באנגלית עם מאזינים אמריקאים וארבעה הרכבים ב-BP עם מאזינים ברזילאים. ראו איור 4 לתרשים זרימה לתפיסת דיבור.

איור 4: תרשים זרימה סכמטי לתפיסת דיבור. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 5: הגדרת ספרייה לתפיסת דיבור. תיקיות מערך. כל תיקיה מכילה שישה קולות L1, קול היעד L2, התסריט "CreateLineup" וקובץ השמע של מערך הקול (מוחזר לאחר הפעלת התסריט). אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
תוצאות להפקת דיבור
בחלק זה, תיארנו את הביצועים של המאפיינים הפרוזודיים-אקוסטיים המובהקים סטטיסטית ומדדי הקצב. מאפיינים פרוזודיים כאלה היו שיעורי דיבור, ביטוי והפסקה, הקשורים למשך הזמן, ושימר, הקשור לאיכות הקול. מדדי הקצב היו סטיית תקן (SD) של משך ההברה, SD של עיצור, SD של משך קול או עיצור, ומקדם השונות של משך ההברה (ראה טבלה משלימה S1).
קצב הדיבור (איור 6A) יורד מהר יותר עבור אנגלית L1-L2 מאשר עבור L1-L2 BP, אם כי הקצב נמוך יותר עבור שני ה-L2. קצב הדיבור קשור לשלושה מדדים - SD של משך ההברה (SD-S), SD של תנועות (SD-V) ומקדם השונות ההברה (Varco-S). חשוב גם לזכור שגם AmE-S וגם קבוצת Bra-S בקיאים ב-L2 שלהם. נראה כי קצב כזה מושפע מהערכים הגבוהים יותר של משך ההברה ומהשונות הנמוכה יותר המיוצרת על ידי L1-L2 BP, מה שגורם לשיפועים פחות תלולים.
קצב הביטוי (איור 6D) קשור ל-SD-S, Varco-S, כמו גם ליחס הקצב ההברה (RR-S); האחרון מייצג את היחס בין הברות קצרות וארוכות יותר. נראה כי מדדים כאלה משפיעים על קצב הביטוי בדיוק כמו קצב הדיבור המושפע עקב אורך המשפט והשונות במשך, מה שמוביל לתכנון דיבור גבוה יותר ב-L2, ו-L2 עומס9,23,54. ייתכן שיידרש עומס קוגניטיבי-לשוני גבוה יותר בתחום אורך המשפט באופן שפרמטרים פרוזודיים-אקוסטיים מושפעים55.
באשר למאפיינים הפרוזודיים-אקוסטיים של שיעורי הדיבור והביטוי, הממצאים שלנו מצביעים על כך שככל שהדובר משנה יותר את משך ההברות (והתנועות), כך שיעורים כאלה נמוכים יותר. אנו משערים שתפיסת הדיבור של L1 ו-L2 נשמעת מעט איטית יותר מ-L1 ו-L2-אנגלית, וכי L1-אנגלית נשמעת מהירה יותר מכל רמות השפה האחרות. עובדה זו עשויה להיות קשורה לקצב הדיבור ולהשערה שבעוד ש-L1-L2 BP נוטה לכיוון הקוטב המתוזמן להברה של רצף הקצב, אנגלית L1-L2 נעה לעבר הקוטב21,22.
השימר המקומי, איור 6B, מושפע מ-SD-S ו-Varco-S. עבור השימר המקומי, שתי ההפקות של Bra-S, L1-BP ו-L2-English מציגות מסלול מונוטוני במקצת ככל שהשונות של משך ההברה גדלה (SD ו-Varco, ראה טבלה משלימה S1). תפיסת המאמץ הקולי עשויה להיות ברורה בעת האזנה להפקות של Bra-S עקב וריאציה נמוכה שנעה בין 8.5 ל-9 dB. דיבור Bra-S מושפע מעומס קול. L1-BP מושפע מאוד מכך שאורך המשפט פחות רגיש לווריאציות גבוהות של משך ההברה (דפוס ריתמי BP מראה פחות שונות הברתית22,56).
קצב ההשהיה (איור 6C) מראה שדוברי L2-אנגלית מייצרים הפסקות ארוכות יותר (מ-200 אלפיות השנייה עד 375 אלפיות השנייה) מאשר דוברי L1-אנגלית, L1-BP ו-L2-BP (ממוצע של 30 אלפיות השנייה עבור L1-אנגלית, 50 אלפיות השנייה עבור L1-BP ו-100 אלפיות השנייה עבור L2-BP). תכנון דיבור, במקרה זה, עשוי להשפיע על ייצור L2-English עקב פעילות מוחית מוגברת54,57. צפוי כי מיומנות גבוהה יותר בשפה תביא למהירות קריאה גבוהה יותר ו-span54; עם זאת, אפילו עבור דוברי L2 מיומנים, מטלות קריאה הציגו מאמץ רב יותר בהיבטים קוגניטיביים מסדר גבוה יותר של דיבור זר ובעיבוד שפה54,57. הממצאים שלנו מראים, לפחות על בסיס ראשוני, שדוברי L2-BP עשויים להיות מושפעים פחות מהפסקות מאשר L2-English בשל הבדלים בדפוס הריתמי של שתי השפות.

איור 6: מודלים תוספים מוכללים עבור המאפיינים הפרוזודיים-אקוסטיים. על ציר ה-Y, משתנה התגובה (התכונות האקוסטיות שיש לדגמן); על ציר ה-X, המשתנים המנבאים (הגורם 'שפה' והמשתנים המשותפים במודלים התוספים שיספקו את הצורה ואת מסלולי העקומות (כלומר, השפעות ההחלקה: 'שפה + משתנים משותפים'), והמכפלה של 'שפה' ותכונה מטרית שתספק השלכה מדויקת יותר של משתנה התגובה (כלומר, אינטראקציות חלקות גורם: 'משתנה:שפה'). קיצור: GAMs = מודלים תוספים כלליים. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
ביחס למדדי הקצב, עבור SD-S (<מחלקה חזקה="xfig">איור 7A), הממצאים שלנו מראים שככל שדובר משנה את עקומת f0 ומגביר את קצב הדיבור, כך SD-S יורד יותר עבור כל רמות השפה (אפקט מראה של איור 6A). במקרה של ה-SD עבור עיצורים (SD-C, איור 7C), L1-BP, בניגוד לאנגלית L1, מבצע שונות נמוכה ככל שקצב הדיבור או משך ההשהיה גדלים. כיוון SD כזה צפוי מכיוון ששונות L1-אנגלית של משך ההברה גבוהה (סטטיסטית) באופן מובהק מ-L1-BP44,58. נראה כי ה-Varco-S (<מחלקה חזקה="xfig">איור 7B וטבלה משלימה S1) נמצא בקורלציה מסוימת ל-L1 ול-L2 של אותה קבוצת שפות. ככל שהשונות f0 וקצב הדיבור עולים, ה-Varco-S יורד עבור L1-BP ונראה שהוא יורד ונחלש עבור L2-BP. עבור ההפקות באנגלית, בעוד ששונות f0 וקצב הדיבור עולים, Varco-S עולה ונחלש עבור L1-אנגלית ו-L2-English.
לגבי ה-SD עבור תנועות או עיצורים (SD-V_C, <מחלקה חזקה="xfig">איור 7D וטבלה משלימה S1), התוצאות שלנו מראות כמה קווי דמיון עם ביצועי Varco-S (<מחלקה חזקה="xfig">איור 7B). לדוגמה, קצב דיבור גבוה יותר, משך השהיה ושונות f0 מקדמים מסלול נפילה-עלייה של ה-SD-V_C עבור L1-BP ועבור L2-BP. בהפקות באנגלית, בעוד שתכונות פרוזודיות כאלה גבוהות יותר, SD-V_C יורד מעט, נחלש עבור L1-אנגלית, עולה מעט, ולאחר מכן נחלש עבור L2-English. ניתן להסביר חלקית את המתאם Varco-S ו-SD-V_C ל-L1-L2 של אותן קבוצות שפות על ידי אפקט לומברד, המתייחס לשינוי של פרמטרים אקוסטיים בדיבור עקב רעשי רקע59.
בדיבור זר, בהתאם למורכבות המשימה (למשל, קריאת דיבור), הדוברים השתמשו באסטרטגיות אקוסטיות דומות הן ב-L1 והן ב-L259,60. מצד אחד, מרקו וארנסטוס מצאו שמדידות f0 (טווח וחציון) בדיבור לומברדית L2 מצביעות על כך שדוברי אנגלית L2 הושפעו מ-L1 Dutch61,62. מצד שני, ממצאים עדכניים יותר מצביעים על כך שלמרות שהדיבור הלומברדי L2 צפוי להיות שונה מהדיבור הלומברדי L1 בשל העומס הקוגניטיבי הגבוה יותר בעת דיבור L2, דוברי אנגלית L2 הפיקו דיבור לומברדית באותו כיוון כמו דוברי האנגלית L163. המידה שבה הממצאים שלנו מיושרים עם מרקו וארנסטוס63 ומתפצלים מ-Waaning59, Villegas et al.60, ו-Marcoux and Ernestus61,62 זקוקה למחקר נוסף.

איור 7: מודלים תוספים כלליים עבור התכונות המטריות. על ציר ה-Y, משתנה התגובה (התכונות המטריות שיש לדגמן); על ציר ה-X, המשתנים המנבאים (הגורם 'שפה' והמשתנים המשותפים במודלים התוספים שיספקו את הצורה ואת מסלולי העקומות (כלומר, השפעות ההחלקה: 'שפה + משתנים משותפים'), והמכפלה של 'שפה' ותכונה מטרית שתספק השלכה מדויקת יותר של משתנה התגובה (כלומר, אינטראקציות חלקות גורם: 'משתנה:שפה'). קיצור: GAMs = מודלים תוספים כלליים. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.
תוצאות לתפיסת דיבור
ביחס להרכבי הקול של BP, בהרכב #1 (איור 8A), קול הרדיד #3 נשפט כקול המטרה. למעשה, קול המטרה היה הקול #4. התוצאות לא מראות הבדל מובהק סטטיסטית (ראה טבלה משלימה S1) בין רדיד #3 (83%) לקול המטרה #4 (71%). במערך #2 (איור 8B), השוואה בין קול היעד #3 (40%) לבין ה-foil #4 (20%) גם לא הראתה הבדל מובהק סטטיסטית (ראו טבלה משלימה S1) עבור הרכבי הקול באנגלית. במערך #1 (איור 9A), לא היה הבדל משמעותי (ראו טבלה משלימה S1) בין נייר הכסף #2 (26%) לבין קול המטרה #4 (54%).
בניתוח הדמיון הקולי, הן הדמיון הקוסינוסי (CoSim) והן המרחק האוקלידי (EucDist, [EucDist transformed]54) הראו מתאם עקבי בין רדיד #3 לבין היעד עבור מערך BP #1 (CoSim = 0.99; EucDist = 77.4, [0.93]). המתאם בין רדיד #4 ליעד היה חזק באופן דומה במערך BP #2 (CoSim = 0.99, EucDist = 76.3, [0.93]). בהרכב האנגלי #1, המתאם היה עקבי עבור CoSim (0.83(, אך חלש עד משביע רצון עבור EucDist (213.0, [0.47]. בסך הכל, גם CoSim וגם EucDist היו טכניקות משביעות רצון בקביעת דמיון קול. בנוסף, CoSim ביצע ביצועים מעט יותר יעילים, כפי שהתייחסו Gahman ו-Elangovan52 (ראה טבלה משלימה S1).
מבחינת הדמיון, מה יכול היה להוביל לעלייה באזעקות שווא? מאפיינים פרוזודיים-אקוסטיים הראו ראיות לכך שלמרות שהרדידים וקולות המטרה תפקדו (סטטיסטית) באופן שונה באופן משמעותי - למעט ההרכבים שהוצגו באיור 8A,B ו-איור 9A, הבחירות של המאזינים היו מגוונות במקצת לאורך רדידים שונים בהרכבים האחרים (איור 8C,D, ו-איור 9B-D). נראה ששיפוט כזה תלוי יותר בתכונה אקוסטית ספציפית אחת (או אולי יותר) שהדוברים חולקים מאשר בקבוצה שלמה של תכונות פרוזודיות-אקוסטיות. לדוגמה, המחקר שלנו הציג מספר מאפיינים (משותפים) המשתנים בין הפקות; עם זאת, תוצאות תפיסתיות מראות את העדפות השיפוט עבור רדיד ספציפי שיתאים לקול היעד8,35,64,65. יש צורך בניתוחים נוספים בעבודה עתידית.
ראוי לציין את הבחירה במטריצה פרמטרית רב-ממדית לדמיון אקוסטי66 כזו שהוצגה במחקר זה. הממצאים שלנו תואמים למחקרים קודמים שהשתמשו בתכונות אקוסטיות המבוססות על f0, VQ ו-intensity9,35. תכונות כאלה מוצעות להפליא עבור משימות השוואת דוברים בתחום הפורנזי9,66. עם זאת, חשוב להדגיש כי במחקר הנוכחי, אף אחד מהרדידים לא נחזה להיות דומה לקול היעד, אם כי השתמשנו בגרסה של הקווים המנחים של מקפרלן16,17 בהכנת מערכי הקול לזיהוי דוברים במבטא זר. יתר על כן, עלינו להדגיש כי נוהל מערך הקולות שלנו מכיל הבדלים חשובים מההנחיות של מקפרלן, כולל אורך הגירוי, מספר הקולות, בחירת הרדידים (אקראי כאן) וסגנון הדיבור.
באיזו מידה נראה שהמאפיינים הפרוזודיים-אקוסטיים של f0, איכות הקול והעוצמה קשורים לתפיסת המאזינים תלויה מאוד בסגנון הדיבור ששימש במחקר. כאן, השתמשנו בקטעי קריאה. רוב מחקרי עדי השמיעה בוחרים בגירויים ספונטניים (למחצה) כפתרון מאוזן - למשל, DyVis corpus67 - שנעשה בו שימוש נרחב בחקירות עדי שמיעה עכשוויות28,68. הסיבה שהובילה אותנו לבחור במטלות הקריאה היא שהקורפוס שלנו, בזמן כתיבת כתב היד הזה, היה מורכב אך ורק מנתונים שהתקבלו ממטלות קריאה. עם זאת, חשוב להכיר בכך שתהליך הרכבת קורפוס ספונטני (למחצה) כבר בעיצומו. יתר על כן, פעולת קריאת הסיפור יכולה ליצור רמה מהימנה של אחידות וגיוון, הן בתוך הדובר והן בין הדוברים. זה מקל על הדגש על מאפיינים פרוזודיים או פונטיים - אינדיבידואליים או דיאלקטיים - במצבים הכוללים השוואה קולית. זה בולט במיוחד במקרים של עומס קולי במהלך הפקת מבטא זר, אפילו בקרב דוברים מיומנים 8,9,23,54.

איור 8: תרשימי עמודות המכילים את התוצאות של ארבעת ההרכבים שבוצעו על ידי המאזינים הברזילאים. (א,ב) הבדל לא מובהק בין קול המטרה (בכחול) לבין נייר כסף (בכחול בהיר). (C,D) הבדלים משמעותיים מהרדידים, וקול המטרה. קיצור: NS = לא משמעותי. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

איור 9: תרשימי עמודות שמכילות את התוצאות עבור ארבעת ההרכבים שבוצעו על ידי המאזינים האמריקאים. (A) הבדל לא מובהק בין קול המטרה (באדום) לבין רדיד (בוורוד). (ב,ג,ד) הבדלים משמעותיים מהרדידים וקול המטרה. קיצור: NS = לא משמעותי. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
טבלה משלימה S1: סטטיסטיקות הפקת דיבור - מודלים תוספים כלליים (GAMs): סטטיסטיקת F (דרגות חופש), ה-Rהמתואם של כל תכונה פרוזודית-אקוסטית מובהקת סטטיסטית (איור 6), ומדד הקצב (איור 7) לרמת שפה, כמו גם הערכים הבודדים של כל מונח חלק (המשתנים). סטטיסטיקה של תפיסת דיבור: סטטיסטיקת Kruskall-Wallis χ2 (דרגות חופש), ערכי p ו-η2 המותאם, כמו גם מבחן דאן פוסט-הוק להשוואה זוגית (איור 8 ו-איור 9) של כל הבדל לא מובהק סטטיסטית בין זוגות קולות רדיד המטרה (איור 8A,B ו-איור 9A). מטריצות דמיון אקוסטי למרחק קוסינוסי ואוקלידיאני של כל מערך. אנא לחץ כאן לצפייה בגרסה גדולה יותר של איור זה.
הפרוטוקול הנוכחי מציג חידוש בתחום הפונטיקה (המשפטית). הוא מחולק לשני שלבים: אחד מבוסס על ייצור (ניתוח אקוסטי) ואחד מבוסס על תפיסה (ניתוח שיפוט). שלב ניתוח הייצור כולל את הכנת הנתונים ויישור מאולץ, יישור מחדש וחילוץ אוטומטי של תכונות פרוזודיות-אקוסטיות מלבד הסטטיסטיקה. פרוטוקול זה מחבר את שלב איסוף הנתונים לניתוח הנתונים בצורה מהירה ויעילה יותר מהפרוטוקולים המסורתיים המבוססים על פילוח ידני בעיקר.
עם זאת, תהליך היישור מחדש, המוצג בשלבי הפרוטוקול 1.3.6 עד 1.3.6.9, עובד בעצם על יחידות הטלפון והמילים שנוצרו בשלבי הפרוטוקול 1.3.1 עד 1.3.4. החידוש בתהליך היישור מחדש הוא שהוא יוצר TextGrid חדש המכיל שלוש שכבות טקסט חדשות: שכבה הברתית, שכבת נתח דיבור שניתן ליצור באופן אוטומטי או ידני על סמך מילים, ושכבת טון שיכולה להיות שימושית למדי לחישוב מדדי f0. הנחיות ההיערכות מחדש שהוצעו לפרוטוקול זה שימשו בעבר במחקרים של קצב דיבור L2 21,69,70, מחקרים לזיהוי דרגת מבטא זר באמצעות טכניקות למידת מכונה22, ומחקרים בתחום הפורנזי 9.
החילוץ האוטומטי של תכונות פרוזודיות, המוצג בשלבי הפרוטוקול 1.3.7 עד 1.3.7.10, יוצר מטריצה רב-ממדית של תכונות פרוזודיות-אקוסטיות כפי שניתן להעיד במחקר הנוכחי. תכונות כאלה כוללות תכונות דיבור מלודיות, מתמשכות וספקטרליות (איכות ועוצמת קול)71. חלק ניכר מהמאפיינים האקוסטיים הללו פחות רגישים וחזקים במידה מסוימת להקלטות אודיו רועשות שנאספו בסופו של דבר בזיהוי פלילי או בכל תרחיש אחר72. יתר על כן, ניתן ליישם את המטריצה הרב-ממדית על מערכות זיהוי דיבור באמצעות מספר טכניקות AI (עבודה בתהליך). זה עדיין יכול להיות שימושי למדי בהוראת היבטים פרוזודיים בשיעורי הגייה L221 (עבודה בתהליך).
הניתוח הסטטיסטי של חלק זה של הפרוטוקול מייצג את השימוש בשיטת GAM מכיוון שעסקנו בקשר מורכב בין תכונה אקוסטית ספציפית לבין דוברי גורם שפה מרובים. כדי למדל תכונה אקוסטית ספציפית, למשל, היה צורך לבדוק כיצד תכונות אקוסטיות אחרות מהמטריצה (המונחים החלקים) יתפקדו כדי שנוכל לתאר בצורה מדויקת יותר את מה שקורה במהלך הפקת הדיבור.
לגבי ניתוח התפיסה, הפרוטוקול הנוכחי נוצר על ידי הכנה ויישום של מערכי הקול, ניתוח סטטיסטי וניתוח דמיון אקוסטי. כדי להכין את ההרכבים, השתמשנו בסקריפט CreateLineup עבור Praat, שמייצר אוטומטית קובץ אודיו עבור כל מערך המכיל רדידים ברצף אקראי וקול יעד כמתואר בשלבי פרוטוקול 2.2 עד 2.2.1.9.
לצורך הניתוח הסטטיסטי של פרוטוקול זה, הרצנו את המבחן הלא פרמטרי של Kruskal-Wallis מכיוון שהנתונים שלנו לא עמדו בהנחות ניתוח השונות (ANOVA). ברגע שהיה לנו קשר בין ציוני השיפוט שהוערכו על ידי המאזינים ונשלטו עבור קול היעד והרדידים, בחרנו להשתמש בסטטיסטיקה של המודל הליניארי.
לניתוח הדמיון האקוסטי, השתמשנו בסקריפט AcousticSmilarity_cosine_euclidean עבור Python. התוכנה קופצת את עץ הספריות של המחשב ומבקשת מהמשתמש לבחור את הקובץ המכיל את התכונות הפרוזודיות-אקוסטיות של הרדידים ואת קול היעד המרכיב את ההרכב בניתוח. בלחיצת כפתור, הסקריפט מייצר שלוש מטריצות דמיון: קוסינוס, אוקלידי, ואוקלידית מותמרת (אפס לאחד), הן בקבצים '.txt' (מופרד באמצעות טאבים) והן בקבצים '.csv'. עדיין עלינו לזכור שכל מערך נתונים (קובץ ה-'.txt' המכיל את התכונות הפרוזודיות-אקוסטיות של הרדידים והמטרה) חייב להיות בתיקייה המקורית של ההרכב, ובכל תיקיית מערך חייב להיות עותק של סקריפט AcousticSmilarity_cosine_euclidean .
לסיכום, הפרוטוקול הנוכחי מתקדם במחקר פונטי (משפטי). מורכב משלבים מובחנים - ניתוחי ייצור ותפיסה, כמו גם דמיון אקוסטי - הוא מגשר על הפער בין איסוף נתונים לניתוח תכונות אקוסטיות רב-ממדיות. חוקרים יכולים להפיק תועלת מנקודת מבט הוליסטית, לחקור הן את היבטי הייצור והן את היבטי התפיסה. יתר על כן, פרוטוקול זה מבטיח שחזור מחקר, ומאפשר לאחרים להתבסס על הקווים המנחים של עבודה זו.
מגבלות וכיוונים עתידיים
עדיין עלינו לזכור שהכל יסתדר בהצלחה אם הכנת הנתונים תעקוב אחר ההנחיות המוצעות בשלבי הפרוטוקול 1.3.1 עד 1.3.4. חוץ מזה, בהליכי היישור הכפוי, עלינו להיות מודעים לכך שמיישור מאולץ חיצוני מאומן מראש - דמוי MAUS המשמש בעבודה הנוכחית - רגיש לשגיאות סגמנטציה, במיוחד בנתונים עם מבטא זר לא מאומן מראש או אפילו ביישורי יישור מאומנים מראש, בין אם לשמע אין איכות טובה או שהקשתיות אינן מכילות את שפת השמע (עובדה זו תהפוך את עבודת המומחה לקשה יותר וגוזלת זמן). תמלול משפטי, במיוחד של קבצי אודיו ארוכים יותר, נתקל בקשיים ביחס לייצוג מדויק ואמין של הקלטות מדוברות72.
ישנם גם מספר אתגרים בתמלול ויישור קבצי אודיו ארוכים יותר. ביצועי קשתיות היישור מושפעים מסגנון הדיבור והסביבה הפונטית, כמו גם מגורמים ספציפיים לדיאלקט. למרות שיש הבדלים ספציפיים ליישור, באופן כללי, הביצועים שלהם דומים ומייצרים פילוחים שמשווים היטב ליישור ידני בסך הכל73. בנוסף, הפקת אנגלית L1 ו-L2 הופעלה עם מודל אקוסטי מאומן מראש של אנגלית אמריקאית עקב חוסר זמינות של מודלים של דיבור זר ב-MAUS. יתר על כן, אין מודלים אקוסטיים מאומנים מראש ללחץ דם ב-MAUS. עבור נתוני BP, נעשה שימוש במודלים האקוסטיים הקיימים של איטלקית (ראה הערה, שלב פרוטוקול 1.3.5.7).
בעבודה עתידית (בתהליך), נשתמש ב-Montreal Forced Aligner (MFA)74 כחלק מהפרוטוקול. יתרון גדול של MFA הוא הזמינות של מודלים אקוסטיים מאומנים מראש ומודלים של גרפם לפונמה עבור מגוון רחב של שפות (כולל BP), כמו גם היכולת לאמן מודלים אקוסטיים וגרפים לפונמה חדשים לכל מערך נתונים חדש (כלומר, קורפוס הדיבור שלנו במבטא זר)75.
למחברים אין ניגודי אינטרסים להצהיר עליהם.
מחקר זה נתמך על ידי המועצה הלאומית לפיתוח מדעי וטכנולוגי - CNPq, מענק מס' 307010/2022-8 למחבר הראשון, ומענק מס' 302194/2019-3 למחבר השני. המחברים מבקשים להביע את תודתם הכנה למשתתפי מחקר זה על שיתוף הפעולה הנדיב ותרומתם שלא תסולא בפז.
| שם | חברה | מספר קטלוג | הערות |
|---|---|---|---|
| CreateLineup | אוסף אישי | # | סקריפט לפראט להכנת מערכי קול |
| I3 של Dell (עם כונן Solid-State - SSD) | Dell | # | מחשב נייד |
| Praat | Paul Boersma & דיוויד וינינק | # | תוכנה לניתוח פונטי |
| Python 3 | Python Software Foundation | # | שפת תכנות מתורגמת, ברמה גבוהה, לשימוש כללי |
| R | פרויקט R למחשוב סטטיסטי | שפת תכנות לחישוב סטטיסטי | |
| Shure Beta SM7B | Shure | # | Microphone |
| SpeechRhythmExtractor | אוסף אישי | # | סקריפט לפראט לחילוץ אוטומטי של תכונות אקוסטיות |
| SurveyMonkey | SurveyMonkey Inc. | # | הרכיבו סקרים חינמיים הניתנים להתאמה אישית, כמו גם חבילה של תוכניות עורפיות הכוללות ניתוח נתונים, בחירת מדגם, הטיה וייצוג נתונים. |
| Tascam DR-100 MKII | Tascam | # | מקליט קול דיגיטלי |
| מערכת הפילוח האוטומטית של מינכן MAUS | אוניברסיטת מינכן | # | יישור מאולץ של קבצי אודיו (.wav) ומידע לשוני (.txt) |
| VVUnitAligner | אוסף אישי | # | סקריפט לפראט ליישור מחדש אוטומטי ועיבוד לאחר של יחידות פונטיות |
בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה
בקש הרשאה