Ergebnisse zur Sprachproduktion
In diesem Abschnitt beschrieben wir die Leistung der statistisch signifikanten prosodisch-akustischen Merkmale und Rhythmusmetriken. Zu diesen prosodischen Merkmalen gehörten Sprech-, Artikulations- und Pausenrate, die sich auf Dauer beziehen, sowie das Jitter, das mit der Stimmqualität zusammenhängt. Die Rhythmusmetriken umfassten die Standardabweichung (SD) der Silbendauer, die SD der Konsonantendauer, die SD der vokalischen oder konsonantischen Dauer sowie den Variationskoeffizienten der Silbendauer (siehe Ergänzende Tabelle S1).
Die Sprechgeschwindigkeit (Abbildung 6A) nimmt bei L1-L2-Englisch stärker ab als bei L1-L2-BP, obwohl die Geschwindigkeit für beide Zweitsprachen niedriger ist. Die Sprechgeschwindigkeit hängt mit drei Metriken zusammen – der Standardabweichung der Silbendauer (SD-S), der Standardabweichung der Vokale (SD-V) und dem Variationskoeffizienten der Silben (Varco-S). Es ist außerdem wichtig zu beachten, dass sowohl die AmE-S- als auch die Bra-S-Gruppe in ihren Zweitsprachen sprachlich kompetent sind. Anscheinend wird diese Geschwindigkeit durch die höheren Werte der Silbendauer und die geringere Variabilität beeinflusst, die von L1-L2-BP erzeugt werden, was zu flacheren Anstiegen führt.
Die Sprechgeschwindigkeit (Abbildung 6D) hängt mit SD-S, Varco-S sowie dem Silbenrhythmus-Verhältnis (RR-S) zusammen; letzteres stellt das Verhältnis zwischen kürzeren und längeren Silben dar. Solche Kenngrößen scheinen die Sprechgeschwindigkeit ebenso zu beeinflussen wie die betroffene Sprechtempo-Rate, bedingt durch Satzlänge und Variation der Dauer, was zu einer höheren Planungsleistung bei der Zweitsprache (L2) und einer erhöhten kognitiven Belastung bei L2 führt9,23,54. Im Bereich der Satzlänge könnte eine höhere kognitiv-linguistische Belastung erforderlich sein, wodurch prosodisch-akustische Parameter beeinflusst werden55.
Hinsichtlich der prosodisch-akustischen Merkmale von Sprache und Artikulationsgeschwindigkeit legen unsere Ergebnisse nahe, dass je stärker ein Sprecher die Dauer von Silben (und Vokalen) variiert, desto niedriger solche Raten sind. Wir vermuten, dass die Sprachwahrnehmung sowohl von BP als Erst- als auch als Zweitsprache etwas langsamer erscheint als von Englisch als Erst- und Zweitsprache und dass Englisch als Muttersprache schneller klingt als alle anderen Sprachebenen. Diese Tatsache könnte mit dem Sprachrhythmus zusammenhängen und mit der Hypothese, dass BP als Erst- und Zweitsprache eher dem silbengetakteten Pol der Rhythmuskontinuums zuneigt, während Englisch als Erst- und Zweitsprache eher zum akzentgetakteten Pol tendiert21,22.
Das Lokale Flimmern, Abbildung 6B, wird von SD-S und Varco-S beeinflusst. Für das lokale Flimmern zeigen sowohl die Produktionen von Bra-S als auch von L1-BP und L2-Englisch eine gewisse monotone Verlaufskurve, während die Variabilität der Silbendauer zunimmt (SD und Varco, siehe Ergänzende Tabelle S1). Die Wahrnehmung von stimmlicher Anstrengung könnte beim Hören der Produktionen von Bra-S erkennbar sein, da eine geringe Variation im Bereich von 8,5 bis 9 dB vorliegt. Die Sprache von Bra-S ist von der stimmlichen Belastung betroffen. L1-BP wird stark durch die Satzlänge beeinflusst und ist weniger empfindlich gegenüber hohen Variationen der Silbendauer (das BP-rhythmische Muster weist eine geringere silbische Variation auf22,56).
Die Pausenrate (Abbildung 6C) zeigt, dass Sprecher mit L2-Englisch längere Pausen (von 200 ms bis 375 ms) produzieren als die Sprecher mit L1-Englisch, L1-BP und L2-BP (Mittelwerte: 30 ms für L1-Englisch, 50 ms für L1-BP und 100 ms für L2-BP). Die Sprachplanung könnte in diesem Fall die L2-Englisch-Produktion aufgrund erhöhter Gehirnaktivität beeinträchtigt haben54,57. Es wird erwartet, dass eine höhere Sprachkompetenz zu einer größeren Lesegeschwindigkeit und einem größeren Leseumfang führt54; dennoch erforderten Lesetasks auch bei sprachlich versierten L2-Sprechern mehr Anstrengung in Bezug auf kognitive Aspekte höherer Ordnung bei der Fremdsprachverarbeitung und Sprachverarbeitung insgesamt54,57. Unsere Ergebnisse zeigen zumindest vorläufig, dass L2-BP-Sprecher durch Pausen möglicherweise weniger beeinträchtigt sind als L2-Englisch-Sprecher, was auf Unterschiede im rhythmischen Muster beider Sprachen zurückzuführen sein könnte.

Abbildung 6: Verallgemeinerte additive Modelle für die prosodisch-akustischen Merkmale. Auf der Y-Achse die abhängige Variable (die zu modellierenden akustischen Merkmale); auf der X-Achse die Prädiktorvariablen (der Faktor „Sprache“ und die Kovariaten in den additiven Modellen, die die Form und die Trajektorien der Kurven liefern (d. h. die Glättungseffekte: „Sprache + Kovariaten“) sowie das Produkt aus dem Faktor „Sprache“ und einer metrischen Variablen, das eine genauere Projektion der abhängigen Variable ermöglicht (d. h. Faktor-Glättungs-Interaktionen: „Kovariate:Sprache“). Abkürzung: GAMs = Verallgemeinerte additive Modelle. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Im Hinblick auf die Rhythmusmetriken zeigen unsere Ergebnisse für SD-S (Abbildung 7A), dass je stärker ein Sprecher die f0-Kurve variiert und die Sprechgeschwindigkeit erhöht, desto stärker nimmt SD-S auf allen Sprachebenen ab (ein Spiegeleffekt zu Abbildung 6A). Im Fall der Standardabweichung für Konsonanten (SD-C, Abbildung 7C) weist L1-BP im Gegensatz zu L1-Englisch eine geringe Variation auf, wenn die Sprechgeschwindigkeit oder die Pausendauer zunehmen. Diese Richtung der SD lässt sich vorhersagen, da die Variabilität der Silbendauer im Englischen als Erstsprache (statistisch) signifikant höher ist als im brasilianischen Portugiesisch als Erstsprache44,58. Die Varco-S (Abbildung 7B und Ergänzende Tabelle S1) scheint teilweise mit der jeweiligen Erst- und Zweitsprache innerhalb derselben Sprachgruppe korreliert zu sein. Mit zunehmender f0-Variabilität und Sprechgeschwindigkeit nimmt die Varco-S bei L1-BP ab und scheint bei L2-BP abzunehmen und sich abzuschwächen. Bei den englischen Äußerungen nimmt die Varco-S hingegen mit steigender f0-Variabilität und Sprechgeschwindigkeit für L1-Englisch und L2-Englisch zu und schwächt sich ab.
Hinsichtlich der SD für Vokale oder Konsonanten (SD-V_C, Abbildung 7D und Ergänzungstabelle S1) zeigen unsere Ergebnisse einige Gemeinsamkeiten mit der Leistung von Varco-S (Abbildung 7B). Beispielsweise fördern eine höhere Sprechgeschwindigkeit, Pausendauer und f0-Variabilität eine fallende und anschließend ansteigende Trajektorie der SD-V_C bei L1-BP sowie bei L2-BP. Bei englischen Äußerungen nimmt die SD-V_C leicht ab, wenn solche prosodischen Merkmale stärker ausgeprägt sind, nimmt bei L1-Englisch leicht ab und schwächt sich ab, nimmt bei L2-Englisch leicht zu und schwächt sich anschließend ebenfalls ab. Die Korrelation zwischen Varco-S und SD-V_C innerhalb der L1-L2-Gruppen derselben Sprachgruppen könnte teilweise durch den Lombard-Effekt erklärt werden, der auf die Veränderung akustischer Parameter in der Sprache aufgrund von Hintergrundgeräuschen verweist59.
Bei fremdsprachlicher Sprache haben Sprecher je nach Komplexität der Aufgabe (z. B. gelesene Sprache) ähnliche akustische Strategien in L1 und L2 verwendet59,60. Einerseits zeigten Marcoux und Ernestus, dass f0-Maße (Bereich und Median) in der L2-Lombard-Sprache darauf hindeuten, dass Sprecher mit L2 Englisch von ihrer L1 Niederländisch beeinflusst wurden61,62. Andererseits legen neuere Befunde nahe, dass, obwohl erwartet wird, dass sich die L2-Lombard-Sprache aufgrund der höheren kognitiven Belastung beim Sprechen der L2 von der L1-Lombard-Sprache unterscheidet, Sprecher mit L2 Englisch Lombard-Sprache in dieselbe Richtung wie Sprecher mit L1 Englisch produzierten63. Inwieweit unsere Ergebnisse mit denen von Marcoux und Ernestus63 übereinstimmen und von Waaning59, Villegas et al.60 sowie Marcoux und Ernestus61,62 abweichen, bedarf weiterer Untersuchung.

Abbildung 7: Verallgemeinerte additive Modelle für die metrischen Merkmale. Auf der Y-Achse die abhängige Variable (die zu modellierenden metrischen Merkmale); auf der X-Achse die Prädiktorvariablen (der Faktor „Sprache“ und die Kovariaten in den additiven Modellen, die die Form und die Verläufe der Kurven liefern (d. h. die Glättungseffekte: „Sprache + Kovariaten“) sowie das Produkt aus „Sprache“ und einem metrischen Merkmal, das eine genauere Projektion der abhängigen Variable ermöglicht (d. h. Faktor-Glättungs-Interaktionen: „Kovariate:Sprache“). Abkürzung: GAMs = Verallgemeinerte additive Modelle. Bitte klicken Sie hier, um eine vergrößerte Darstellung dieser Abbildung anzusehen.
Ergebnisse zur Sprachwahrnehmung
Im Zusammenhang mit den BP-Stimmenaufstellungen wurde in Aufstellung #1 (Abbildung 8A) die Stimme #3 als die gesuchte Stimme eingestuft. Tatsächlich war die gesuchte Stimme jedoch Stimme #4. Die Ergebnisse zeigen keinen statistisch signifikanten Unterschied (siehe ergänzende Tabelle S1) zwischen der falschen Stimme #3 (83 %) und der gesuchten Stimme #4 (71 %). In Aufstellung #2 (Abbildung 8B) zeigte ein Vergleich zwischen der gesuchten Stimme #3 (40 %) und der falschen Stimme #4 (20 %) ebenfalls keinen statistisch signifikanten Unterschied (siehe ergänzende Tabelle S1) bei den englischen Stimmenaufstellungen. In Aufstellung #1 (Abbildung 9A) bestand kein signifikanter Unterschied (siehe ergänzende Tabelle S1) zwischen der falschen Stimme #2 (26 %) und der gesuchten Stimme #4 (54 %).
Bei der Analyse der Stimmähnlichkeit zeigten sowohl die Kosinus-Ähnlichkeit (CoSim) als auch der euklidische Abstand (EucDist, [EucDist transformed]54) eine durchgängige Korrelation zwischen Falschstimme Nr. 3 und dem Ziel in der BP-Gruppe Nr. 1 (CoSim = 0,99; EucDist = 77,4, [0,93]). Die Korrelation zwischen Falschstimme Nr. 4 und dem Ziel war in der BP-Gruppe Nr. 2 ähnlich stark (CoSim = 0,99, EucDist = 76,3, [0,93]). In der englischen Gruppe Nr. 1 war die Korrelation für CoSim konsistent (0,83), jedoch schwach bis zufriedenstellend für EucDist (213,0, [0,47]). Insgesamt erwiesen sich sowohl CoSim als auch EucDist als zufriedenstellende Verfahren zur Bestimmung der Stimmähnlichkeit. Außerdem zeigte CoSim eine leicht höhere Effektivität, wie von Gahman und Elangovan52 erörtert (siehe Ergänzende Tabelle S1).
Hinsichtlich der Ähnlichkeit: Was könnte zu einer Zunahme falscher Alarme geführt haben? Prosodisch-akustische Merkmale zeigten Hinweise darauf, dass, obwohl die Stimmen der Distraktoren und die Zielpersonen (statistisch) signifikant unterschiedlich abschnitten – mit Ausnahme der in Abbildung 8A,B und Abbildung 9A dargestellten Reihen – die Auswahl der Hörer in den übrigen Reihen etwas stärker zwischen verschiedenen Distraktoren variierte (Abbildung 8C,D und Abbildung 9B-D). Eine solche Beurteilung scheint stärker von einem (oder möglicherweise mehreren) spezifischen akustischen Merkmal abzuhängen, das Sprecher gemeinsam haben, als von einer ganzen Klasse prosodisch-akustischer Merkmale. Beispielsweise wiesen unsere Daten mehrere (ko)variierende Merkmale zwischen den Äußerungen auf; dennoch zeigen die wahrnehmungsbasierten Ergebnisse eine Bevorzugung bestimmter Distraktoren, die der Stimme der Zielperson entsprechen8,35,64,65. Weitere Analysen sind in zukünftigen Arbeiten erforderlich.
Es ist bemerkenswert, die Wahl einer mehrdimensionalen parametrischen Matrix für die akustische Ähnlichkeit66, wie sie in dieser Studie vorgestellt wird, zu berücksichtigen. Unsere Ergebnisse stimmen mit früheren Studien überein, die akustische Merkmale basierend auf f0, VQ und Intensität verwendeten9,35. Solche Merkmale werden besonders für Sprechervergleichsaufgaben im forensischen Bereich empfohlen9,66. Es ist jedoch wichtig hervorzuheben, dass in der vorliegenden Untersuchung keiner der Foils als dem Zielstimme ähnlich vorhergesagt wurde, obwohl wir eine Variante der McFarlane-Richtlinien16,17 bei der Erstellung der Stimm-Listen für die Erkennung akzentuierter Sprecher angewandt haben. Darüber hinaus betonen wir, dass unser Verfahren zur Erstellung von Stimm-Listen wesentliche Unterschiede zu den McFarlane-Richtlinien aufweist, einschließlich der Stimuluslänge, der Anzahl der Stimmen, der Auswahl der Foils (hier randomisiert) und des Sprechstils.
Inwieweit prosodisch-akustische Merkmale von f0, Stimmqualität und Intensität mit der Wahrnehmung durch Hörer verbunden erscheinen, hängt stark von der im Forschungskontext verwendeten Sprechweise ab. Hier verwendeten wir Leseabschnitte. Die Mehrheit der Hörzeugenstudien entscheidet sich für (halb-)spontane Stimuli als ausgewogene Lösung – beispielsweise das DyVis-Korpus67 –, das in zahlreichen aktuellen Untersuchungen zu Hörzeugen ausführlich eingesetzt wurde28,68. Der Grund, warum wir uns für Lesetasks entschieden haben, liegt darin, dass unser Korpus zum Zeitpunkt der Abfassung dieses Manuskripts ausschließlich aus Daten bestand, die aus Lesetasks stammten. Es ist jedoch wichtig anzuerkennen, dass der Prozess der Zusammenstellung eines (halb-)spontanen Korpus bereits im Gange ist. Außerdem kann das Vorlesen einer Geschichte ein verlässliches Maß an Uniformität und Variation sowohl innerhalb als auch zwischen Sprechern erzeugen. Dies erleichtert die Betonung prosodischer oder phonetischer Merkmale – individueller oder dialektaler Art – in Situationen, in denen Stimmen verglichen werden. Dies zeigt sich besonders deutlich bei Belastungserscheinungen der Stimme während der Produktion eines Fremdakzents, selbst bei sprachlich versierten Sprechern 8,9,23,54.

Abbildung 8: Balkendiagramme mit den Ergebnissen der vier Lineups, die von brasilianischen Zuhörern durchgeführt wurden. (A,B) Kein signifikanter Unterschied zwischen der Zielperson (in blau) und einer Fehlperson (in hellblau). (C,D) Signifikante Unterschiede gegenüber den Fehlpersonen und der Zielperson. Abkürzung: NS = nicht signifikant. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 9: Balkendiagramme mit den Ergebnissen der vier Reihenfolgen, die von den amerikanischen Zuhörern durchgeführt wurden. (A) Nicht signifikanter Unterschied zwischen der Zielperson (in rot) und einer Fehlperson (in rosa). (B,C,D) Signifikante Unterschiede zwischen den Fehlpersonen und der Zielperson. Abkürzung: NS = nicht signifikant. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Ergänzungstabelle S1: Statistiken zur Sprachproduktion – Verallgemeinerte additive Modelle (GAMs): Die F-Statistiken (Freiheitsgrade), das adjustierte R2 jeder statistisch signifikanten prosodisch-akustischen Kenngröße (Abbildung 6) und Rhythmusmetrik (Abbildung 7) je Sprachebene sowie die individuellen Werte jedes Smooth-Terms (der Kovariaten). Statistiken zur Sprachwahrnehmung: Die Kruskall-Wallis-χ2-Statistiken (Freiheitsgrade), die p-Werte und das adjustierte η2 sowie ein post-hoc-Dunn-Test für paarweise Vergleiche (Abbildung 8 und Abbildung 9) jeder statistisch nicht signifikanten Differenz zwischen den Paaren von Ziel- und Foil-Stimmen (Abbildung 8A,B und Abbildung 9A). Akustische Ähnlichkeitsmatrizen für Kosinus- und euklidischen Abstand jeder Stichprobe. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.