Resultaten voor spraakproductie
In deze sectie hebben we de prestaties van de statistisch significante prosodisch-akoestische kenmerken en ritmiekmetrieken beschreven. Dergelijke prosodische kenmerken waren de spraak-, articulatie- en pauzesnelheden, die gerelateerd zijn aan duur, en shimmer, wat gerelateerd is aan stemkwaliteit. De ritmiekmetrieken waren de standaarddeviatie (SD) van de lettergreepduur, de SD van de consonant, de SD van de vocalische of consonantische duur, en de variatiecoëfficiënt van de lettergreepduur (zie de Aanvullende Tabel S1).
De spreeksnelheid (Figuur 6A) neemt sneller af voor L1-L2 Engels dan voor L1-L2 BP, hoewel de snelheid voor beide L2's lager is. De spreeksnelheid is gerelateerd aan drie metrieken - de SD van de syllabeduur (SD-S), de SD van klinkers (SD-V) en de syllabische variatiecoëfficiënt (Varco-S). Het is daarnaast belangrijk om in gedachten te houden dat zowel de AmE-S- als de Bra-S-groep vaardig zijn in hun L2's. Het lijkt erop dat deze snelheid wordt beïnvloed door de hogere waarden van de syllabeduur en de lagere variabiliteit geproduceerd door L1-L2 BP, wat resulteert in minder steile hellingen.
De articulatiesnelheid (Figuur 6D) is gerelateerd aan SD-S, Varco-S, alsook de syllabische ritmeverhouding (RR-S); dat laatste stelt de verhouding tussen kortere en langere lettergrepen voor. Dergelijke metrieken lijken de articulatiesnelheid te beïnvloeden, net zoals de beïnvloede spreeksnelheid als gevolg van zinslengte en variatie in duur, wat leidt tot een hogere L2-spraakplanning en L2-cognitieve belasting9,23,54. Een hogere cognitief-linguïstische belasting kan vereist zijn in het domein van de zinslengte, op een wijze waarbij prosodisch-akoestische parameters worden beïnvloed55.
Met betrekking tot de prosodisch-akoestische kenmerken van spreek- en articulatiesnelheden suggereren onze bevindingen dat hoe meer een spreker de duur van lettergrepen (en klinkers) varieert, hoe lager deze snelheden zijn. Wij stellen hypothetisch dat de spraakwaarneming van zowel L1- als L2-BP iets langzamer klinkt dan L1- en L2-Engels, en dat L1-Engels sneller klinkt dan alle andere taalniveaus. Dit feit kan gekoppeld zijn aan het spraakritme en de hypothese dat terwijl L1-L2 BP neigt naar de lettergreep-getimede pool van het ritmecontinuüm, L1-L2 Engels beweegt naar de klemtoon-getimede pool21,22.
De lokale shimmer, Figuur 6B, wordt beïnvloed door SD-S en Varco-S. Voor de lokale shimmer vertonen zowel de producties van Bra-S, L1-BP als L2-Engels een enigszins monotone trajectory naarmate de variabiliteit van de syllabeduur toeneemt (SD en Varco, zie Aanvullende Tabel S1). De perceptie van vocale inspanning kan duidelijk zijn bij het beluisteren van de producties van Bra-S vanwege een lage variatie die varieert tussen 8,5 en 9 dB. Bra-S spraak wordt beïnvloed door vocale belasting. L1-BP wordt sterk beïnvloed door de zinslengte en is minder gevoelig voor hoge variaties in de syllabeduur (het BP ritmische patroon vertoont minder syllabische variatie22,56).
De pauzesnelheid (Figuur 6C) laat zien dat L2-Engelstaligen langere pauzes produceren (van 200 ms tot 375 ms) dan de L1-Engelstaligen, L1-BP en L2-BP sprekers (gemiddelde van 30 ms voor L1-Engels, 50 ms voor L1-BP en 100 ms voor L2-BP). Spraakplanning zou in dit geval de L2-Engelse productie hebben beïnvloed als gevolg van verhoogde hersenactiviteit54,57. Er wordt verwacht dat een hogere taalbeheersing zou leiden tot een grotere leessnelheid en een grotere span54; desondanks vereisten leestaken, zelfs voor vaardige L2-sprekers, meer inspanning op het gebied van hogere cognitieve aspecten van vreemde spraak en taalverwerking54,57. Onze bevindingen tonen, ten minste op voorlopige basis, aan dat L2-BP sprekers minder beïnvloed kunnen worden door pauzes dan L2-Engels vanwege verschillen in het ritmische patroon van beide talen.

Figuur 6: Generalized Additive Models voor de prosodisch-akoestische kenmerken. Op de Y-as staat de responsvariabele (de te modelleren akoestische kenmerken); op de X-as staan de predictoren (de factor 'Language' en de covariabelen in de additieve modellen die de vorm en de trajecten van de curven bepalen (d.w.z. de smoothing-effecten: 'Language + covariates'), en het product van 'Language' en een metrische feature die een nauwkeurigere projectie van de responsvariabele geeft (d.w.z. factor-smooth interacties: 'covariate:Language')). Afkorting: GAMs = Generalized Additive Models. Klik hier om een grotere versie van deze figuur te bekijken.
Met betrekking tot de ritmemetrieken, voor SD-S (Figuur 7A), onze bevindingen onthullen dat hoe meer een spreker de f0-curve varieert en de spreeksnelheid verhoogt, des te meer SD-S neemt af voor alle taalniveaus (een spiegeleffect van Figuur 6A). In het geval van de standaardafwijking (SD) voor medeklinkers (SD-C, Figuur 7C), L1-BP vertoont, in tegenstelling tot L1-Engels, een lage variatie naarmate de spreeksnelheid of pauzeduur toeneemt. Een dergelijke richting van de standaarddeviatie (SD) is voorspelbaar, aangezien de variabiliteit van de lettergreepduur bij L1-Engels (statistisch) significant hoger is dan bij L1-BP44,58De Varco-S (Figuur 7B en Aanvullende tabel S1) lijkt enigszins gecorreleerd aan de L1 en de L2 van dezelfde taalgroep. Naarmate de f0-variabiliteit en het spreektempo toenemen, neemt de Varco-S af voor L1-BP en lijkt deze af te nemen en te attenueren voor L2-BP. Voor de Engelse uitingen, terwijl de f0-variabiliteit en Spreeksnelheid toename, Varco-S neemt toe en vlakt af voor L1-Engels en L2-Engels.
Wat betreft de SD voor klinkers of medeklinkers (SD-V_C, Afbeelding 7D en Aanvullende Tabel S1), tonen onze resultaten enkele overeenkomsten met de Varco-S-prestaties (Afbeelding 7B). Zo bevorderen een hogere spreeksnelheid, pauzeduur en f0-variabiliteit een dalend-stijgend traject van de SD-V_C voor L1-BP en voor L2-BP. In Engelse producties, hoewel dergelijke prosodische kenmerken hoger zijn, neemt de SD-V_C licht af, vlakt deze af voor L1-Engels, neemt deze licht toe en vlakt deze vervolgens af voor L2-Engels. De correlatie tussen Varco-S en SD-V_C met de L1-L2 van dezelfde taalgroepen kan gedeeltelijk worden verklaard door het Lombard-effect, wat verwijst naar de wijziging van akoestische parameters in spraak als gevolg van achtergrondruis59.
Bij spraak in een vreemde taal hebben sprekers, afhankelijk van de complexiteit van de taak (bijv. voorgelezen spraak), soortgelijke akoestische strategieën gebruikt voor zowel L1 als L259,60. Enerzijds stelden Marcoux en Ernestus vast dat f0-metingen (bereik en mediaan) in L2 Lombard-spraak suggereren dat L2-Engelstaligen beïnvloed werden door hun L1-Nederlands61,62. Anderzijds suggereren recentere bevindingen dat, hoewel er van L2 Lombard-spraak wordt verwacht dat deze verschilt van L1 Lombard-spraak vanwege de hogere cognitieve belasting bij het spreken van de L2, L2-Engelstaligen Lombard-spraak produceerden in dezelfde richting als L1-Engelstaligen63. De mate waarin onze bevindingen overeenstemmen met Marcoux en Ernestus63 en afwijken van Waaning59, Villegas et al.60 en Marcoux en Ernestus61,62 behoeft verder onderzoek.

Figuur 7: Generalized Additive Models voor de metrische kenmerken. Op de Y-as staat de responsvariabele (de te modelleren metrische kenmerken); op de X-as staan de predictoren (de factor 'Language' en de covariabelen in de additieve modellen die de vorm en het verloop van de curven bepalen (d.w.z. de smoothing-effecten: 'Language + covariates'), en het product van de 'Language' en een metrisch kenmerk dat een nauwkeurigere projectie van de responsvariabele oplevert (d.w.z. factor-smooth interacties: 'covariate:Language'). Afkorting: GAMs = Generalized Additive Models. Klik hier om een grotere versie van deze figuur te bekijken.
Resultaten voor spraakperceptie
In relatie tot de BP-stemline-ups werd in line-up #1 (Figuur 8A) de afleidingsstem #3 beoordeeld als de doelstem. In werkelijkheid was de doelstem stem #4. De resultaten tonen geen statistisch significant verschil (zie Aanvullende Tabel S1) tussen de afleiding #3 (83%) en de doelstem #4 (71%). In line-up #2 (Figuur 8B) vertoonde een vergelijking tussen de doelstem #3 (40%) en de afleiding #4 (20%) eveneens geen statistisch significant verschil (zie Aanvullende Tabel S1) voor de Engelse stemline-ups. In line-up #1 (Figuur 9A) was er geen significant verschil (zie Aanvullende Tabel S1) tussen de afleiding #2 (26%) en de doelstem #4 (54%).
Bij de analyse van stemovereenkomst vertoonden zowel de cosinusovereenkomst (CoSim) als de Euclidische afstand (EucDist, [EucDist getransformeerd]54) een consistente correlatie tussen foil #3 en het doelwit voor de BP-lineup #1 (CoSim = 0,99; EucDist = 77,4, [0,93]). De correlatie tussen foil #4 en het doelwit was vergelijkbaar sterk in de BP-lineup #2 (CoSim = 0,99, EucDist = 76,3, [0,93]). In de Engelse lineup #1 was de correlatie consistent voor CoSim (0,83), maar zwak tot bevredigend voor EucDist (213,0, [0,47]). Over het algemeen waren zowel CoSim als EucDist bevredigende technieken voor het bepalen van stemovereenkomst. Daarnaast presteerde CoSim iets effectiever, zoals beschreven door Gahman en Elangovan52(zie Aanvullende Tabel S1).
Wat betreft de gelijkenis, wat zou kunnen hebben geleid tot een toename van het aantal foutieve alarmen? Prosodisch-akoestische kenmerken toonden aan dat, hoewel foils en doelstemmen (statistisch) significant verschillend presteerden — met uitzondering van de lineups gepresenteerd in Figuur 8A,B en Figuur 9A — de keuzes van luisteraars enigszins varieerden over verschillende foils in de overige lineups (Figuur 8C,D en Figuur 9B-D). Een dergelijk oordeel lijkt meer afhankelijk te zijn van één (of wellicht meer) specifiek akoestisch kenmerk dat sprekers delen, dan van een hele klasse prosodisch-akoestische kenmerken. Onze studie presenteerde bijvoorbeeld verschillende kenmerken die (co)varieerden tussen producties; niettemin tonen de perceptuele resultaten een voorkeur in de oordelen voor een specifieke foil om overeen te komen met de doelstem8,35,64,65. Verdere analyses zijn noodzakelijk in toekomstig werk.
Het is opmerkelijk om de keuze voor een multidimensionale parametrische matrix voor akoestische gelijkenis66, zoals gepresenteerd in deze studie, te overwegen. Onze bevindingen komen overeen met eerdere studies waarin akoestische kenmerken gebaseerd op f0, VQ en intensiteit werden gebruikt9,35. Dergelijke kenmerken worden sterk aanbevolen voor sprekervergelijkingstaken in het forensisch veld9,66. Het is echter belangrijk om te benadrukken dat in het huidige onderzoek geen van de afleidingsstemmen (foils) als gelijkaardig aan de doelstem werden voorspeld, hoewel we een variant van de richtlijnen van McFarlane16,17 hebben gebruikt bij het opstellen van de stem-lineups voor de herkenning van sprekers met een buitenlands accent. Bovendien moeten we benadrukken dat onze procedure voor de stem-lineup belangrijke verschillen vertoont met de richtlijnen van McFarlane, waaronder de lengte van de stimulus, het aantal stemmen, de selectie van de afleidingsstemmen (hier gerandomiseerd) en de spreekstijl.
In hoeverre prosodisch-akoestische kenmerken van f0, stemkwaliteit en intensiteit gerelateerd lijken te zijn aan de perceptie van luisteraars, hangt sterk af van de spreekstijl die in het onderzoek wordt gebruikt. Hier hebben wij gebruikgemaakt van voorleesteksten. De meerderheid van de studies naar getuigenverklaringen op basis van stemherkenning kiest voor (semi-)spontane stimuli als een gebalanceerde oplossing — bijvoorbeeld het DyVis corpus67 — dat uitgebreid is ingezet in hedendaagse onderzoeken naar stemherkenning28,68. De reden waarom wij voor de voorleestaken hebben gekozen, is dat ons corpus op het moment van het schrijven van dit manuscript uitsluitend bestond uit gegevens verkregen uit voorleestaken. Het is echter belangrijk te vermelden dat het proces van het samenstellen van een (semi-)spontaan corpus reeds in gang is gezet. Bovendien kan het voorlezen van een verhaal een betrouwbaar niveau van uniformiteit en variatie genereren, zowel intra-spreker als inter-spreker. Dit vergemakkelijkt de nadruk op prosodische of fonetische kenmerken — individueel of dialectisch — in situaties waarbij sprake is van stemvergelijking. Dit wordt bijzonder merkbaar in gevallen van vocale belasting tijdens de productie van een vreemd accent, zelfs bij vaardige sprekers 8,9,23,54.

Figuur 8: Staafdiagrammen met de resultaten van de vier lineups uitgevoerd door de Braziliaanse luisteraars. (A,B) Geen significant verschil tussen de doelstem (in het blauw) en een foil (in lichtblauw). (C,D) Significante verschillen ten opzichte van de foils en de doelstem. Afkorting: NS = niet significant. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 9: Staafdiagrammen met de resultaten van de vier lineups uitgevoerd door de Amerikaanse luisteraars. (A) Geen significant verschil tussen de doelstem (in rood) en een afleider (in roze). (B,C,D) Significante verschillen tussen de afleiders en de doelstem. Afkorting: NS = niet significant. Klik hier om een grotere versie van deze figuur te bekijken.
Aanvullende Tabel S1: Statistieken van spraakproductie - Generalized Additive Models (GAMs): De F-statistieken (vrijheidsgraden), de gecorrigeerde R2 van elk statistisch significant prosodisch-akoestisch kenmerk (Figuur 6) en ritmetriek (Figuur 7) per taalniveau, evenals de individuele waarden van elke smooth term (de covariabelen). Statistieken van spraakperceptie: De Kruskall-Wallis χ2 statistieken (vrijheidsgraden), de p-waarden en de gecorrigeerde η2, evenals een post-hoc Dunn-test voor paarsgewijze vergelijking (Figuur 8 en Figuur 9) van elk statistisch niet-significant verschil tussen de paren van target-foil stemmen (Figuur 8A,B en Figuur 9A). Akoestische similariteitsmatrices voor Cosinus- en Euclidische afstand van elke lineup. Klik hier om een grotere versie van deze figuur te bekijken.