Risultati per la produzione del linguaggio
In questa sezione, abbiamo descritto l'andamento delle caratteristiche prosodiche-acustiche e delle metriche ritmiche statisticamente significative. Tali caratteristiche prosodiche includevano le velocità di parlato, articolazione e pause, correlate alla durata, e lo shimmer, correlato alla qualità vocale. Le metriche ritmiche comprendevano la deviazione standard (DS) della durata sillabica, la DS della durata consonantica, la DS della durata vocalica o consonantica e il coefficiente di variazione della durata sillabica (si veda la Tabella S1 Supplementare).
La velocità di parlata (Figura 6A) diminuisce più rapidamente per l'inglese L1-L2 rispetto al BP L1-L2, anche se la velocità è inferiore per entrambe le L2. La velocità di parlata è correlata a tre metriche: deviazione standard della durata sillabica (SD-S), deviazione standard delle vocali (SD-V) e coefficiente di variazione sillabico (Varco-S). È inoltre importante tenere presente che entrambi i gruppi AmE-S e Bra-S sono proficienti nelle rispettive L2. Sembra che tale velocità sia influenzata dai valori più elevati della durata sillabica e dalla minore variabilità prodotta dai parlanti BP L1-L2, determinando pendenze meno ripide.
Il tasso di articolazione (Figura 6D) è correlato a SD-S, Varco-S e al rapporto ritmico sillabico (RR-S); quest'ultimo rappresenta il rapporto tra sillabe più brevi e più lunghe. Queste metriche sembrano influenzare il tasso di articolazione proprio come il tasso di parlata risente della lunghezza della frase e delle variazioni di durata, portando a una maggiore pianificazione del parlato in L2 e a un maggiore carico cognitivo in L29,23,54. Un carico cognitivo-linguistico maggiore potrebbe essere richiesto nel dominio della lunghezza della frase, in modo tale da influenzare i parametri prosodici-acustici55.
Per quanto riguarda le caratteristiche prosodico-acustiche della velocità di parlato e della velocità di articolazione, i nostri risultati indicano che maggiore è la variazione della durata delle sillabe (e delle vocali) da parte di un parlante, minore sarà tale velocità. Ipotesizziamo che la percezione del parlato sia più lenta sia per i suoni BP L1 che L2 rispetto all'inglese L1 e L2, e che l'inglese L1 risulti più veloce rispetto a tutti gli altri livelli linguistici. Questo fenomeno potrebbe essere collegato al ritmo del parlato e all'ipotesi secondo cui, mentre il BP L1-L2 si avvicina al polo sillabico della scala ritmica, l'inglese L1-L2 tende verso il polo accentuale21,22.
Lo scintillio locale, Figura 6B, è influenzato da SD-S e Varco-S. Per quanto riguarda lo scintillio locale, le produzioni di Bra-S, L1-BP e L2-inglese presentano un andamento leggermente monotono all'aumentare della variabilità della durata sillabica (SD e Varco, vedi Tabella S1 Supplementare). La percezione dello sforzo vocale potrebbe risultare evidente nell'ascolto delle produzioni di Bra-S a causa di una bassa variazione compresa tra 8,5 e 9 dB. Il parlato di Bra-S è influenzato dal carico vocale. L1-BP è fortemente influenzato dalla lunghezza della frase ed è meno sensibile alle elevate variazioni della durata sillabica (il modello ritmico del BP mostra una minore variazione sillabica22,56).
Il tasso di pausa (Figura 6C) mostra che i parlanti di inglese L2 producono pause più lunghe (da 200 ms a 375 ms) rispetto ai parlanti di inglese L1, di portoghese brasiliano L1 e di portoghese brasiliano L2 (media di 30 ms per l’inglese L1, 50 ms per il portoghese brasiliano L1 e 100 ms per il portoghese brasiliano L2). La pianificazione del discorso, in questo caso, potrebbe aver influito sulla produzione in inglese L2 a causa di un aumento dell’attività cerebrale54,57. Si prevede che una maggiore competenza linguistica si traduca in una velocità e ampiezza di lettura maggiori54; tuttavia, anche per i parlanti esperti di una seconda lingua, i compiti di lettura hanno mostrato un maggiore sforzo negli aspetti cognitivi di ordine superiore del discorso straniero e nell’elaborazione linguistica54,57. I nostri risultati indicano, almeno su base preliminare, che i parlanti di portoghese brasiliano L2 potrebbero essere meno influenzati dalle pause rispetto ai parlanti di inglese L2, a causa delle differenze nel pattern ritmico delle due lingue.

Figura 6: Modelli Additivi Generalizzati per le caratteristiche prosodiche-acustiche. Sull'asse Y, la variabile risposta (le caratteristiche acustiche da modellare); sull'asse X, le variabili predittive (il fattore 'Lingua' e le covariate nei modelli additivi che determineranno la forma e le traiettorie delle curve (cioè gli effetti di smoothing: 'Lingua + covariate') e il prodotto tra 'Lingua' e una caratteristica metrica che fornirà una proiezione più accurata della variabile risposta (cioè interazioni fattore-smoothing: 'covariate:Lingua'). Abbreviazione: GAMs = Modelli Additivi Generalizzati. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Per quanto riguarda le metriche ritmiche, per SD-S (Figura 7A), i nostri risultati mostrano che più un parlante varia la curva di f0 e aumenta la velocità di parlata, più SD-S diminuisce a tutti i livelli linguistici (un effetto speculare rispetto alla Figura 6A). Nel caso della SD per le consonanti (SD-C, Figura 7C), l'L1-BP, al contrario dell'L1 inglese, presenta una bassa variazione all'aumentare della velocità di parlata o della durata delle pause. Tale andamento della SD è previsto, poiché la variabilità della durata della sillaba nell'L1 inglese è statisticamente significativamente maggiore rispetto all'L1-BP44,58. Il Varco-S (Figura 7B e Tabella Supplementare S1) sembra essere in una certa misura correlato all'L1 e all'L2 dello stesso gruppo linguistico. All'aumentare della variabilità di f0 e della velocità di parlata, il Varco-S diminuisce per l'L1-BP e sembra diminuire e attenuarsi per l'L2-BP. Per le produzioni in inglese, mentre la variabilità di f0 e la velocità di parlata aumentano, il Varco-S aumenta e si attenua per l'L1-inglese e l'L2-inglese.
Per quanto riguarda la DS per vocali o consonanti (SD-V_C, Figura 7D e Tabella Supplementare S1), i nostri risultati mostrano alcune somiglianze con l'andamento di Varco-S (Figura 7B). Ad esempio, un aumento della velocità di parlata, della durata delle pause e della variabilità di f0 favorisce un andamento ascendente-discendente della SD-V_C per il L1-BP e per il L2-BP. Nelle produzioni in inglese, mentre tali caratteristiche prosodiche sono più elevate, la SD-V_C diminuisce leggermente, attenuandosi per il L1-inglese, aumenta leggermente e poi si attenua per il L2-inglese. La correlazione tra Varco-S e SD-V_C nei gruppi linguistici L1-L2 della stessa lingua potrebbe essere parzialmente spiegata dall'effetto Lombard, che si riferisce alla modifica dei parametri acustici del parlato in presenza di rumore di fondo59.
Nel parlato straniero, a seconda della complessità del compito (ad esempio, parlato letto), i parlanti hanno utilizzato strategie acustiche simili sia nell'L1 che nell'L259,60. Da un lato, Marcoux ed Ernestus hanno scoperto che le misure di f0 (intervallo e mediana) nel parlato Lombardo L2 suggeriscono che i parlanti Inglesi L2 sono stati influenzati dal loro Olandese L161,62. Dall'altro lato, scoperte più recenti propongono che, sebbene ci si aspetti che il parlato Lombardo L2 differisca dal parlato Lombardo L1 a causa del carico cognitivo maggiore nel parlare l'L2, i parlanti Inglesi L2 hanno prodotto il parlato Lombardo nella stessa direzione dei parlanti Inglesi L163. L'entità in cui i nostri risultati sono allineati con Marcoux ed Ernestus63 e divergono da Waaning59, Villegas et al.60 e Marcoux ed Ernestus61,62 richiede ulteriori indagini.

Figura 7: Modelli Additivi Generalizzati per le caratteristiche metriche. Sull'asse Y, la variabile risposta (le caratteristiche metriche da modellare); sull'asse X, le variabili predittive (il fattore 'Lingua' e le covariate nei modelli additivi che determineranno la forma e le traiettorie delle curve (cioè gli effetti di smoothing: 'Lingua + covariate') e il prodotto tra 'Lingua' e una caratteristica metrica che fornirà una proiezione più accurata della variabile risposta (cioè interazioni fattore-smoothing: 'covariata:Lingua'). Abbreviazione: GAMs = Modelli Additivi Generalizzati. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Risultati per la percezione del parlato
Riguardo le sequenze vocali BP, nella sequenza n. 1 (Figura 8A), la voce di controllo n. 3 è stata giudicata come la voce obiettivo. In realtà, la voce obiettivo era la voce n. 4. I risultati non mostrano una differenza statisticamente significativa (vedi Tabella Supplementare S1) tra la voce di controllo n. 3 (83%) e la voce obiettivo n. 4 (71%). Nella sequenza n. 2 (Figura 8B), il confronto tra la voce obiettivo n. 3 (40%) e la voce di controllo n. 4 (20%) non ha evidenziato alcuna differenza statisticamente significativa (vedi Tabella Supplementare S1) per le sequenze vocali in inglese. Nella sequenza n. 1 (Figura 9A), non vi è stata alcuna differenza significativa (vedi Tabella Supplementare S1) tra la voce di controllo n. 2 (26%) e la voce obiettivo n. 4 (54%).
Nell'analisi della somiglianza vocale, sia la similarità del coseno (CoSim) sia la distanza euclidea (EucDist, [EucDist trasformata]54) hanno mostrato una correlazione costante tra il campione #3 e l'obiettivo nella serie BP #1 (CoSim = 0,99; EucDist = 77,4, [0,93]). La correlazione tra il campione #4 e l'obiettivo è stata simile e altrettanto forte nella serie BP #2 (CoSim = 0,99, EucDist = 76,3, [0,93]). Nella serie in lingua inglese #1, la correlazione è risultata costante per CoSim (0,83), ma debole fino a soddisfacente per EucDist (213,0, [0,47]). Nel complesso, entrambe le tecniche, CoSim ed EucDist, si sono rivelate soddisfacenti per determinare la somiglianza vocale. Inoltre, CoSim ha mostrato prestazioni leggermente migliori, come indicato da Gahman ed Elangovan52 (vedere Tabella Supplementare S1).
Per quanto riguarda la somiglianza, cosa potrebbe aver causato un aumento di falsi allarmi? Le caratteristiche prosodico-acustiche hanno mostrato evidenze che, sebbene le voci di controllo e le voci bersaglio si comportassero in modo significativamente diverso (statisticamente) – con l'eccezione delle sequenze presentate in Figure 8A,B e Figure 9A – le scelte degli ascoltatori si sono in parte diversificate tra diverse voci di controllo nelle altre sequenze (Figure 8C,D e Figure 9B-D). Tale giudizio sembra dipendere più da una (o forse più di una) specifica caratteristica acustica condivisa tra i parlanti, piuttosto che da un'intera classe di caratteristiche prosodico-acustiche. Ad esempio, il nostro studio ha presentato diverse caratteristiche che (co)variavano tra le produzioni; tuttavia, i risultati percettivi mostrano una preferenza nei giudizi per una specifica voce di controllo corrispondente alla voce bersaglio8,35,64,65. Saranno necessarie ulteriori analisi nei futuri lavori.
È degno di nota considerare la scelta di una matrice parametrica multidimensionale per la similarità acustica66 come quella presentata in questo studio. I nostri risultati sono in linea con studi precedenti che hanno utilizzato caratteristiche acustiche basate su f0, VQ e intensità9,35. Tali caratteristiche sono particolarmente raccomandate per compiti di confronto tra parlanti nel campo forense9,66. È tuttavia importante sottolineare che nella presente ricerca nessuno dei parlanti di disturbo è stato previsto come simile alla voce bersaglio, anche se abbiamo utilizzato una variante delle linee guida di McFarlane16,17 nella preparazione delle sequenze vocali per il riconoscimento di parlanti con accento straniero. Inoltre, dobbiamo evidenziare che la nostra procedura di composizione delle sequenze vocali presenta differenze significative rispetto alle linee guida di McFarlane, incluse la durata degli stimoli, il numero di voci, la selezione dei parlanti di disturbo (qui randomizzata) e lo stile di parlato.
In quale misura le caratteristiche prosodico-acustiche di f0, qualità della voce e intensità risultino correlate alla percezione dei soggetti ascoltatori dipende fortemente dallo stile di parlato utilizzato nella ricerca. In questo studio abbiamo utilizzato brani da lettura. La maggior parte degli studi condotti su testimoni uditivi sceglie stimoli (semi-)spontanei come soluzione equilibrata, ad esempio il corpus DyVis67, ampiamente impiegato nelle indagini odierne sui testimoni uditivi28,68. La ragione che ci ha portato a selezionare compiti di lettura è che, al momento della stesura del presente manoscritto, il nostro corpus era costituito esclusivamente da dati ottenuti mediante compiti di lettura. È tuttavia importante riconoscere che è già in corso il processo di compilazione di un corpus (semi-)spontaneo. Inoltre, l’atto di leggere una storia può generare un livello affidabile di uniformità e variazione, sia intra-parlante che inter-parlante. Ciò facilita l’evidenziazione di caratteristiche prosodiche o fonetiche—individuali o dialettali—nei casi di confronto vocale. Tale aspetto risulta particolarmente evidente nelle situazioni di carico vocale durante la produzione di un accento straniero, anche tra parlanti esperti8,9,23,54.

Figura 8: Grafici a barre contenenti i risultati delle quattro sequenze presentate agli ascoltatori brasiliani. (A,B) Differenza non significativa tra la voce bersaglio (in blu) e una voce di controllo (in celeste). (C,D) Differenze significative rispetto alle voci di controllo e alla voce bersaglio. Abbreviazione: NS = non significativo. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 9: Grafici a barre contenenti i risultati delle quattro sequenze presentate agli ascoltatori americani. (A) Differenza non significativa tra la voce obiettivo (in rosso) e una voce di controllo (in rosa). (B,C,D) Differenze significative tra le voci di controllo e la voce obiettivo. Abbreviazione: NS = non significativo. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Tabella Suppl. S1: Statistiche della produzione del linguaggio - Modelli Additivi Generalizzati (GAM): le statistiche F (gradi di libertà), l'R2 aggiustato per ciascuna caratteristica prosodico-acustica statisticamente significativa (Figura 6) e per ciascuna metrica ritmica (Figura 7) per livello linguistico, oltre ai valori individuali di ciascun termine smooth (le covariate). Statistiche della percezione del linguaggio: statistiche di Kruskall-Wallis χ2 (gradi di libertà), valori p e η2 aggiustato, nonché un test post-hoc di Dunn per il confronto a coppie (Figura 8 e Figura 9) delle differenze statisticamente non significative tra le coppie di voci target-foil (Figura 8A,B e Figura 9A). Matrici di similarità acustica per le distanze coseno ed euclidea di ciascun lineup. Cliccare qui per visualizzare una versione ingrandita di questa figura.