Articolo metodologico

Accento straniero e identificazione forense del parlante nelle formazioni vocali: l'influenza delle caratteristiche acustiche basate sulla prosodia

1.5K visualizzazioni

DOI:

10.3791/66313

27 settembre 2024

In questo articolo

Sommario

Questa ricerca mirava a fare un confronto tra L1-L2-Inglese e L1-L2 Portoghese per verificare quanto l'effetto di un accento straniero tenga conto sia per le metriche che per i parametri prosodici-acustici, nonché per la scelta della voce target in una formazione vocale.

Abstract

Questa ricerca mira a esaminare sia le caratteristiche prosodico-acustiche che i correlati percettivi dell'inglese con accento straniero e del portoghese brasiliano con accento straniero e verificare come le produzioni di accenti stranieri e nativi dei parlanti siano correlate alla percezione degli ascoltatori. Nella Metodologia, abbiamo condotto una procedura di produzione del parlato con un gruppo di parlanti americani di portoghese brasiliano L2 e un gruppo di parlanti brasiliani di inglese L2, e una procedura di percezione del parlato in cui abbiamo eseguito formazioni vocali per entrambe le lingue. Per l'analisi statistica della produzione vocale, abbiamo eseguito Modelli Additivi Generalizzati per valutare l'effetto dei gruppi linguistici su ciascuna classe (metrica o prosodico-acustica) di caratteristiche controllate per l'effetto di smoothing della/e covariata/e della classe opposta. Per l'analisi statistica della percezione del parlato, abbiamo eseguito un test di Kruskal-Wallis e un test di Dunn post-hoc per valutare l'effetto delle voci delle formazioni sui punteggi giudicati dagli ascoltatori. Abbiamo comunque condotto test di somiglianza acustica (voce) basati sulle distanze del coseno e dell'euclideo. I risultati hanno mostrato differenze acustiche significative tra i gruppi linguistici in termini di variabilità dell'f0, durata e qualità della voce. Per le scale, i risultati hanno indicato che le caratteristiche prosodiche di f0, intensità e qualità della voce erano correlate ai giudizi percepiti dagli ascoltatori.

Introduzione

L'accento è un aspetto saliente e dinamico della comunicazione e della fluidità, sia nella lingua madre (L1) che in una lingua straniera (L2)1. L'accento straniero rappresenta le caratteristiche fonetiche L2 di una lingua di destinazione e può cambiare (nel tempo) in risposta all'esperienza L2 del parlante, allo stile di conversazione, alla qualità dell'input, all'esposizione, tra le altre variabili. Un accento straniero può essere quantificato come un grado (scalare) di differenza tra il parlato L2 prodotto da un parlante straniero e un accento locale o di riferimento della lingua di destinazione2,3,4,5.

Questa ricerca mira a esaminare sia le caratteristiche prosodico-acustiche che i correlati percettivi dell'inglese con accento straniero e del portoghese brasiliano con accento straniero (BP), nonché a verificare in che misura le produzioni di accenti stranieri e nativi da parte dei parlanti siano correlate alla percezione degli ascoltatori. Ricerche precedenti nel campo forense hanno dimostrato che la robustezza delle vocali e delle consonanti nell'identificazione dell'accento straniero è stabile per un'analisi a lungo termine di un individuo (The Lo Case6) o si riferisce all'elevata accuratezza dell'ID di un parlante (The Lindbergh Case7). Tuttavia, l'esplorazione delle caratteristiche prosodico-acustiche basate sulla durata, la frequenza fondamentale (f0, cioè il correlato acustico dell'altezza), l'intensità e la qualità della voce (VQ) ha guadagnato sempre più attenzione8,9. Pertanto, la scelta delle caratteristiche prosodico-acustiche in questo studio rappresenta una strada promettente nel campo della fonetica forense8,10,11,12,13.

La presente ricerca è supportata da studi dedicati agli accenti stranieri come forma di travestimento vocale nei casi forensi14,15, così come nella preparazione di formazioni vocali per il riconoscimento del parlante16,17. Ad esempio, la velocità del parlato ha svolto un ruolo importante nell'identificazione dei parlanti tedesco, italiano, giapponese e brasiliano di inglese18,19,20,21,22. Oltre alla velocità del parlato, le caratteristiche spettrali e f0 a lungo termine sfidano i parlanti esperti in L2 con familiarità con la lingua target perché il cervello e le basi cognitive soffrono di un deficit di memoria, attenzione ed emozione, che si riflette nelle prestazioni fonetiche del parlante durante lunghi turni di discorso23. Il punto di vista degli accenti stranieri nel campo forense è che la definizione di ciò che suona davvero come un accento straniero dipende molto dalla non familiarità dell'ascoltatore piuttosto che avere un grado non estremo di parlato con accento straniero24.

Nel dominio percettivo, uno strumento forense comune utilizzato dalla metà degli anni '90 per il riconoscimento dei criminali è il Voice Lineup (riconoscimento uditivo), che è analogo al riconoscimento visivo utilizzato per identificare un autore in una scena del crimine16,25. In una scaletta vocale, la voce del sospetto viene presentata insieme a voci simili per aspetti sociolinguistici come età, sesso, posizione geografica, dialetto e stato culturale, per l'identificazione da parte di un testimone oculare. Il successo o il fallimento di una formazione vocale dipenderà dal numero di campioni vocali e dalla durata dei campioni25,26. Inoltre, per i campioni del mondo reale, si ritiene che la qualità audio influisca costantemente sull'accuratezza del riconoscimento vocale. Una scarsa qualità audio può distorcere le caratteristiche uniche di una voce27. Nel caso della somiglianza vocale, i dettagli fonetici precisi basati su f0 possono confondere l'ascoltatore durante il riconoscimento vocale28,29. Tali caratteristiche acustiche si estendono oltre f0 e comprendono elementi di durata e caratteristiche spettrali di intensità e VQ30. Questa visione di più caratteristiche prosodiche è fondamentale nel contesto del confronto vocale forense per garantire un'identificazione accurata del parlante9,14,15,29,31.

In sintesi, gli studi di fonetica forense hanno mostrato alcune variazioni per quanto riguarda l'identificazione dell'accento straniero negli ultimi decenni. Da un lato, un accento straniero non sembra influenzare il processo di identificazione di un parlante32,33 (specialmente se il parlante non ha familiarità con l'accento straniero di destinazione34). D'altra parte, ci sono risultati nella direzione opposta12,34,35.

Protocollo

Questo studio è stato approvato da un comitato etico per la ricerca sull'uomo. Inoltre, è stato ottenuto il consenso informato da tutti i partecipanti allo studio per l'utilizzo e la pubblicazione dei loro dati.

1. Produzione del linguaggio

NOTA: Abbiamo raccolto il parlato da un compito di lettura su entrambi gli 'L1 inglese-L2 BP' prodotti da Gruppo 1: Il American Einglese (dagli Stati Uniti d'America) Saltoparlanti (americano), e su entrambi i 'L1 BP-L2 inglese' prodotti da Gruppo 2: Il Brazilian Sdiffusori (Bra-S). Vedi Figura 1 per un diagramma di flusso per la produzione del linguaggio.

figure-protocol-1
Figura 1: Diagramma schemático del flusso di produzione del parlato. Cliccare qui per visualizzare una versione ingrandita di questa figura.

  1. Partecipanti
    1. Determinare il numero di partecipanti, il lingua (L1 inglese, L2 BP; L1 BP, L2 inglese), il sesso (femmina o maschio), il età (media, deviazione standard), il caratteristiche del gruppo (professionisti o studenti universitari), e il Livello di competenza L2 (avanzato o ben avanzato) per ogni gruppo.
      NOTA: Per la presente ricerca, sia l'AmE-S che il Bra-S sono stati considerati di livello di competenza L2 (entrambi i gruppi sono stati qualificati come B2-C1)36). L'AmE-S aveva vissuto per due anni in Brasile al momento dell'esecuzione delle procedure. Il Bra-S aveva vissuto negli Stati Uniti per più di due anni al momento dell'esecuzione delle procedure. Durante il soggiorno all'estero, entrambi i gruppi usavano parlare la loro L2 a fini di studio e di lavoro almeno 6 giorni alla settimana per circa 4-5 ore al giorno.
    2. Assegnare i partecipanti a una stanza comoda e tranquilla e consegnare il materiale di lettura a ciascun gruppo.
  2. Raccolta dei dati
    NOTA: I dati linguistici devono essere raccolti mediante un compito di lettura nelle seguenti lingue: L1-inglese e L2-BP; L1-BP e L2-inglese. Far leggere ai partecipanti i testi in anticipo, se necessario.
    1. Procedure di registrazione
      1. Registrare i dati vocali in un luogo silenzioso con condizioni acustiche adeguate.
      2. Utilizzare un registratore vocale digitale (vedere il Tabella dei materiali)37 e un microfono cardioide unidirezionale con isolamento elettromagnetico (vedere il Tabella dei materiali)38.
      3. Registrare i dati audio in '.wavforma.
      4. Impostare la frequenza di campionamento a 48 kHz e la quantizzazione a 16 bit.
        NOTA: Il formato audio e la configurazione delle frequenze di campionamento e quantizzazione descritte ai punti 1.2.1.3 e 1.2.1.4 vengono applicati per garantire un'elevata qualità e una riduzione del rumore, al fine di preservare le caratteristiche spettrali utilizzate per l'analisi acustica successiva.
  3. Analisi acustica
    NOTA: Dividere le procedure di analisi acustica in tre passaggi: allineamento forzato, riallineamento e estrazione delle caratteristiche acustiche.
    1. Scrivere la trascrizione linguistica (in un '.txt' file) per ogni file audio.
    2. Etichettare la coppia di '.txt'/'.wavfile con lo stesso nome (ad es., 'my_file.wav'/ 'my_file.txt').
      NOTA: Per migliorare le prestazioni della procedura descritta nella sezione 1.3.7, si raccomanda vivamente che i primi tre caratteri dei tag dei file ‘.txt/.wav’ rappresentino il Lingua, Dialetto, oppure Accento, mentre i caratteri dal quarto al sesto indicano il Sesso (ad esempio, EL1FEM per Einglese L1 Femminaale). A partire dal settimo carattere, l'utente deve indicare il numero del parlante (ad es. 001 per il primo oratore). Di conseguenza, la prima coppia «.txt/.wav» è EL1FEM001.
    3. Creare una cartella per ciascuna lingua L1-L2.
      NOTA: Una cartella per L1-L2 inglese e una cartella per L1-L2 BP.
    4. Verificare che tutte le coppie di file della stessa lingua siano nella stessa cartella.
    5. Eseguire l'allineamento forzato.
      1. Accedi all'interfaccia web del sistema di allineamento forzato Munich Automatic Segmentation (MAUS)webMAUS39 a https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline
      2. Trascina e rilascia ogni coppia di .onda / .txt file da cartella al rettangolo tratteggiato in File (o fare clic all'interno del rettangolo, Figura 2A).
      3. Fare clic sul Caricamento pulsante per caricare i file nell'allineatore (vedi freccia rossa in Figura 2A).
      4. Selezionare le seguenti opzioni nella Opzioni di servizio menuFigura 2B): G2P-MAUS-PHO2SYL per Nome della procedura; Italiano (IT) (per Lingua) se Dati L1-L2 in inglese; Italiano (IT) (per Lingua) se Dati BP L1-L2.
        NOTA: Abbiamo scelto l'italiano per i dati del portoghese brasiliano (BP) perché webMAUS non fornisce modelli acustici preaddestrati per l'allineamento forzato del BP. La letteratura fonetica sostiene che la fonologia italiana presenta un inventario di sette vocali simmetrico, paragonabile a quello del BP40, nonché similitudini acustiche consonantali41,42.
      5. Mantenere le opzioni predefinite per 'Formato di output' e 'Mantieni tutto'.
      6. Verificare il Eseguire casella delle opzioni per accettare i termini di utilizzo (vedere la freccia verde in Figura 2C).
      7. Fare clic sul pulsante Servizio Web di esecuzione pulsante per eseguire i file caricati nell'allineatore.
        NOTA: Per ogni file audio, l'allineatore MAUS restituisce un file Praat TextGrid oggetto (un file '.txt' preformattato di Praat contenente l'annotazione di parole, sillabe fonologiche e fonemi basata sulla trascrizione linguistica estratta dal file '.txt' descritto al punto 1.3.1)
      8. Fare clic su Scarica come file ZIP pulsante per scaricare i file TextGrid come file compressoFigura 2C).
        NOTA: Assicurarsi che i file TextGrid compressi in formato zip vengano scaricati nella stessa cartella dei file audio.
      9. Estrarre i file TextGrid per un successivo realineamento nel software di analisi fonetica43.
    6. Eseguire il riallineamento.
      1. Accedi e scarica lo script per Praat VVUnitAligner44 da https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat
      2. Verificare che tutte le coppie di file della stessa lingua e la VVUnitAligner gli script si trovano nella stessa cartella.
        NOTA: Una cartella per i file L1-L2 in inglese e per il VVunitAligner, e una cartella per i file L1-L2 in BP e per il VVunitAligner.
      3. Aprire il software di analisi fonetica.
      4. Cliccare Praat | Apri script Praat… per richiamare lo script dal finestra dell'oggetto.
      5. Fare clic sul pulsante Eseguire pulsante una volta.
        NOTA: Un modulo chiamato Allineamento sillabico fonetico contenente le impostazioni per l'utilizzo dello script apparirà sullo schermo (Figura 3A).
      6. Fare clic sul pulsante Lingua pulsante per scegliere tra le lingue 'inglese (USA)', 'portoghese (BR)', 'francese (FR)' o 'spagnolo (ES)'
      7. Fare clic sul pulsante Segmentazione dei blocchi pulsante per scegliere tra la procedura di segmentazione 'Automatica', 'Forzata (manuale)' o 'Nessuna'.
      8. Verificare il Salvare i file TextGrid opzione per salvare automaticamente i nuovi file TextGrid.
      9. Cliccare Ok | Esegui pulsanti per un'allineamento nuovo delle unità fonetiche dal passaggio 1.3.5.7
        NOTA: Per ogni file audio, VVUnitAligner genererà un nuovo file TextGrid per la sezione 1.3.7Figura 3B).
    7. Effettuare l'estrazione automatica delle caratteristiche acustiche.
      1. Accedi e scarica lo script SpeechRhythmExtractor45 da https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat per l'estrazione automatica delle caratteristiche prosodico-acustiche.
      2. Crea una nuova cartella e inserisci SpeechRhythmExtractor insieme a tutte le coppie di file audio/TextGrid di tutte le lingue.
      3. Aprire il software di analisi fonetica.
      4. Cliccare Praat | Apri script di Praat… per richiamare lo script dal finestra dell'oggetto.
      5. Fare clic su Eseguire premere il pulsante una sola volta
        NOTA: Sullo schermo apparirà un modulo contenente le impostazioni dello script. Nei campi relativi ai nomi dei file di output in formato '.txt', rinominare i file di conseguenza oppure mantenere i nomi predefiniti.
      6. Verificare il parametri della qualità della voce opzione per salvare il File di output VQ per la qualità della voce (Figura 3C).
        NOTA: Questo secondo file di output (il File di output VQ) contiene i parametri della differenza tra il 1st e il 2nd armoniche (H1-H2) e il picco di prominenza cepstrale (CPP)9.
      7. Verificare il Obiettivo linguistico opzione di scegliere tra i contrassegni 'Lingua', 'Dialetto' o 'Accento' (Figura 3C).
      8. Verificare il Unità opzione per scegliere le caratteristiche di f0 in Hz o in semitoni (Figura 3C).
      9. Impostare i valori per soglia F0, le soglie minima e massima di f0 (Figura 3C).
        NOTA: A meno che la ricerca non abbia scopi specifici o non preveda caratteristiche audio predefinite, si raccomanda vivamente di mantenere i parametri del passaggio 1.3.7.9 ai valori predefiniti.
      10. Cliccare Ok | Esegui per l'estrazione automatica delle caratteristiche acustiche.
        NOTA: Lo script SpeechRhythmExtractor restituisce un file '.txt' delimitato da tabulazioni (File di output/ File di output VQ) contenente le caratteristiche acustiche estratte dai parlanti.
  4. Analisi statistica
    1. Caricare il foglio di calcolo contenente le caratteristiche acustiche in R46 ambiente (o qualsiasi software/ambiente statistico a scelta).
    2. Eseguire analisi statistiche non parametriche mediante modelli additivi generalizzati (GAM).
      1. Eseguire GAM in R.
      2. Digitare i seguenti comandi e premere Inserire.
        library(mgcv)
        modello = gam(il caratteristica metrica/prosodica-acustica nell'analisi ~ il Lingua + s(la scelta caratteristica metrica, da = il Lingua) + altro caratteristiche metrico/prosodiche-acustiche, dati = il frame di dati)
        NOTA: Abbiamo deciso di eseguire le analisi statistiche del protocollo nel linguaggio di programmazione R a causa della crescente popolarità di questo strumento tra i fonetici (e i linguisti) nella comunità accademica. R è ampiamente utilizzato nella ricerca fonetica sul campo47. Tener presente che il passaggio 1.4.2.2 contiene un codice pseudocodice. Scrivere il codice in base alle variabili di ricerca.

figure-protocol-2
Figura 2: Schermata dell'allineamento fonetico mediante l'allineatore forzato MAUS. (A) Il rettangolo tratteggiato serve per trascinare e rilasciare i file 'my_file.wav'/'my_file.txt' oppure per fare clic al suo interno per cercare tali file all'interno della cartella; il pulsante di caricamento è indicato dalla freccia rossa. (B) I file caricati dal pannello A (vedi freccia blu), la pipeline da utilizzare, la lingua per le coppie di file, il formato del file da restituire e un pulsante 'vero/falso' per mantenere tutti i file. (C) Le condizioni d'uso con casella di controllo (vedi freccia verde), il pulsante Esegui servizi web e i risultati (file TextGrid da scaricare). Cliccare qui per visualizzare una versione ingrandita di questa figura.

figure-protocol-3
Figura 3: Schermata della procedura di riallineamento. (A) Modulo di inserimento delle impostazioni per la procedura di riallineamento. (B) Forma d'onda parziale, spettrogramma a banda larga con contorno di f0 (blu) e sei tracce segmentate (e etichettate) come segue: traccia 1: unità da inizio vocale all'inizio vocale successivo (V_to_V); inizio vocale (V_to_V); traccia 2: unità di vocale (V), consonante (C) e pausa (#); traccia 3: rappresentazioni foniche V_to_V; traccia 4: alcune parole del testo; traccia 5: alcuni segmenti (CH) del parlato tratti dal testo; traccia 6: traccia tonale contenente il tono più alto (H) e il tono più basso (L) di ciascun segmento di parlato prodotto da una parlante di inglese americano. (C) Impostazioni di ingresso per l'estrazione automatica delle caratteristiche acustiche. Cliccare qui per visualizzare una versione ingrandita di questa figura.

2. Percezione del linguaggio

NOTA: abbiamo effettuato quattro identificazioni vocali in inglese con ascoltatori americani e quattro identificazioni in PB con ascoltatori brasiliani. Vedere Figura 4 per un diagramma di flusso della percezione del parlato.

figure-protocol-4
Figura 4: Diagramma di flusso schematizzato per la percezione del linguaggio. Cliccare qui per visualizzare una versione ingrandita di questa figura.

  1. Partecipanti
    1. Selezionare partecipanti diversi per ciascun gruppo rispetto a quelli che hanno partecipato al protocollo di produzione del linguaggio.
      NOTA: Per questa parte del protocollo sono stati selezionati due gruppi di partecipanti: Gruppo 1: Il American Einglese (dagli Stati Uniti d'America) Lascoltatori (AmE-L), e Gruppo 2: Il Brazilian Lascoltatori (Bra-L). Per la presente ricerca, sia gli AmE-L che i Bra-L sono stati considerati di livello di competenza L2 (entrambi i gruppi sono stati classificati come B2-C1)36 L'AmE-L aveva vissuto due anni in Brasile al momento dell'esecuzione delle procedure. Il Bra-L aveva vissuto negli Stati Uniti per più di due anni al momento dell'esecuzione delle procedure. Durante il soggiorno all'estero, entrambi i gruppi avevano l'abitudine di parlare la propria L2 per scopi di studio e di lavoro (almeno sei giorni alla settimana per circa 4-5 ore al giorno).
    2. Determinare il numero di partecipanti, il lingua (L1 inglese, L2 BP; L1 BP, L2 inglese), il sesso (femmina o maschio), il età (media, deviazione standard), il caratteristiche del gruppo (professionisti o studenti universitari) e il Livello di competenza L2 per ogni gruppo.
  2. I confronti vocali
    NOTA: Dividere le procedure delle sequenze vocali in due passaggi distinti: preparazione ed esecuzione delle sequenze vocali.
    1. Preparare quattro lineup vocali in inglese e quattro in BP.
      1. Ottenere i file audio dai parlanti della sezione 1: Produzione del linguaggio.
      2. Verificare che i file audio di ciascun fattore linguistico siano in cartelle separate.
      3. Scegliere casualmente sei segmenti vocali in inglese L1 o in BP L1.
        NOTA: Sei voci nella selezione rappresentano una voce bersaglio e cinque foglietti.
      4. Scegliere un frammento vocale in inglese L2 o in portoghese brasiliano L2 da uno dei parlanti inclusi al passaggio 2.2.1.3.
        NOTA: Il frammento vocale al punto 2.2.1.4 è il voce di riferimento. I frammenti devono essere di circa 20 s.
      5. Accedi e scarica lo script per Praat CreateLineup48 da https://github.com/pabarbosa/prosody-scripts-CreateLineUp
      6. Verificare che la voce di riferimento L2, le voci alterative L1 e la voce target L1 siano nella stessa cartella prima di eseguire lo script CreateLineup (Figura 5).
      7. Aprire il software di analisi fonetica.
      8. Dal finestra dell'oggetto, fare clic Praat | Apri script Praat… per richiamare lo script.
      9. Cliccare Esegui | Esegui.
        NOTA: Lo script restituisce un file nel seguente ordine: (la voce di riferimento L2) + (la voce target L1 e i foil distribuiti in modo casuale)Figura 5).
    2. Esecuzione dei confronti vocali
      1. Creare uno spazio online per ospitare le selezioni su una qualsiasi piattaforma a scelta (ad esempio, SurveyMonkey. Vedere il Tabella dei materiali) per condurre a distanza i confronti vocali.
      2. Accedi al link dello spazio online.
      3. Caricare i file restituiti dallo script CreateLineup sulla piattaforma.
      4. Eseguire la procedura prima dei partecipanti per verificare ogni passaggio.
        NOTA: Si raccomanda di accedere precedentemente al link ed eseguire le simulazioni per verificare che tutto funzioni correttamente.
  3. Analisi statistica
    1. Caricare il foglio di calcolo contenente i punteggi dei giudizi degli ascoltatori nell'ambiente R (o in qualsiasi altro software/ambiente statistico a scelta).
      1. Eseguire il test di Kruskal-Wallis in R.
      2. Digitare i seguenti comandi e premere Inserire.
        ​modello = kruskal.test(giudizi ~ ciascuno sequenza vocale, dati = il frame di dati)
    2. Eseguire un test post-hoc di Dunn.
      1. Eseguire il test di Dunn in R.
      2. Digitare i seguenti comandi e premere Inserire.
        library(FSA)
        modello = dunnTest(giudizi ~ ciascuno allineamento vocale, dati = dati, metodo = "bonferroni")
        NOTA: I codici nei passaggi 2.3.1.2 e 2.3.2.2 sono pseudocodici (vedere NOTA 1.4.2.2).
  4. Analisi della similarità acustica
    1. Selezionare le sequenze (cfr. NOTA al punto 2.2.1.3) che hanno mostrato differenze non significative tra il bersaglio e uno qualsiasi dei campioni di controllo.
    2. Ripetere le procedure dei punti da 1.3.1 a 1.3.7.5 e dai punti 1.3.7.8 a 1.3.7.10.
    3. Accedi e scarica lo script per Python49, Similarità acustica - coseno - euclidea50 da https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py
      NOTA: Lo script restituisce tre matrici (in formato '.txt' e '.csv'): una per la similarità del coseno51,52, uno per la distanza euclidea52,53e uno per i valori di distanza euclidea trasformata, nonché un confronto a coppie tra la voce bersaglio e ciascuna voce di controllo.
    4. Verificare che lo script sia scaricato nella stessa cartella del dataset di lineup.
    5. Fare clic su Apri file… pulsante per richiamare lo script.
    6. Cliccare Esegui | Esegui senza debug pulsanti.
      NOTA: Il secondo Eseguire il pulsante può essere contrassegnato come Esegui o Esegui senza debug o Eseguire lo script. Eseguono tutti gli stessi comandi. Dipende semplicemente dall'ambiente Python utilizzato.
    7. Eseguire test di somiglianza vocale basati su caratteristiche acustiche.
      ​NOTA: La similarità del coseno (o distanza del coseno) è una tecnica applicata nell'intelligenza artificiale (AI), in particolare nell'apprendimento automatico nei sistemi di riconoscimento vocale automatico (ASR). È una misura della similarità compresa tra zero e uno. Un valore di similarità del coseno vicino a uno indica che due voci sono molto probabilmente simili. Un valore di similarità del coseno vicino a zero indica che le voci sono molto probabilmente dissimili.52La distanza euclidea, spesso indicata come similarità euclidea, è ampiamente utilizzata anche in intelligenza artificiale, apprendimento automatico e riconoscimento automatico del parlato. Essa rappresenta la distanza in linea retta tra due punti nello spazio euclideo.53, cioè più i punti sono vicini (valori più bassi della distanza), più le voci sono simili. Per una comprensione più chiara dei risultati riportati da entrambe le tecniche, abbiamo effettuato una trasformazione dei punteggi grezzi della distanza euclidea in valori compresi tra zero (minore somiglianza vocale) e uno (maggiore somiglianza vocale)54.

figure-protocol-5
Figura 5: Configurazione della directory per la percezione del parlato. Cartelle lineup. Ogni cartella contiene sei voci L1, la voce bersaglio L2, lo script "CreateLineup" e il file audio del lineup vocale (restituito dopo l'esecuzione dello script). Cliccare qui per visualizzare una versione ingrandita di questa figura.

Risultati

Risultati per la produzione del linguaggio
In questa sezione, abbiamo descritto l'andamento delle caratteristiche prosodiche-acustiche e delle metriche ritmiche statisticamente significative. Tali caratteristiche prosodiche includevano le velocità di parlato, articolazione e pause, correlate alla durata, e lo shimmer, correlato alla qualità vocale. Le metriche ritmiche comprendevano la deviazione standard (DS) della durata sillabica, la DS della durata consonantica, la DS della durata vocalica o consonantica e il coefficiente di variazione della durata sillabica (si veda la Tabella S1 Supplementare).

La velocità di parlata (Figura 6A) diminuisce più rapidamente per l'inglese L1-L2 rispetto al BP L1-L2, anche se la velocità è inferiore per entrambe le L2. La velocità di parlata è correlata a tre metriche: deviazione standard della durata sillabica (SD-S), deviazione standard delle vocali (SD-V) e coefficiente di variazione sillabico (Varco-S). È inoltre importante tenere presente che entrambi i gruppi AmE-S e Bra-S sono proficienti nelle rispettive L2. Sembra che tale velocità sia influenzata dai valori più elevati della durata sillabica e dalla minore variabilità prodotta dai parlanti BP L1-L2, determinando pendenze meno ripide.

Il tasso di articolazione (Figura 6D) è correlato a SD-S, Varco-S e al rapporto ritmico sillabico (RR-S); quest'ultimo rappresenta il rapporto tra sillabe più brevi e più lunghe. Queste metriche sembrano influenzare il tasso di articolazione proprio come il tasso di parlata risente della lunghezza della frase e delle variazioni di durata, portando a una maggiore pianificazione del parlato in L2 e a un maggiore carico cognitivo in L29,23,54. Un carico cognitivo-linguistico maggiore potrebbe essere richiesto nel dominio della lunghezza della frase, in modo tale da influenzare i parametri prosodici-acustici55.

Per quanto riguarda le caratteristiche prosodico-acustiche della velocità di parlato e della velocità di articolazione, i nostri risultati indicano che maggiore è la variazione della durata delle sillabe (e delle vocali) da parte di un parlante, minore sarà tale velocità. Ipotesizziamo che la percezione del parlato sia più lenta sia per i suoni BP L1 che L2 rispetto all'inglese L1 e L2, e che l'inglese L1 risulti più veloce rispetto a tutti gli altri livelli linguistici. Questo fenomeno potrebbe essere collegato al ritmo del parlato e all'ipotesi secondo cui, mentre il BP L1-L2 si avvicina al polo sillabico della scala ritmica, l'inglese L1-L2 tende verso il polo accentuale21,22.

Lo scintillio locale, Figura 6B, è influenzato da SD-S e Varco-S. Per quanto riguarda lo scintillio locale, le produzioni di Bra-S, L1-BP e L2-inglese presentano un andamento leggermente monotono all'aumentare della variabilità della durata sillabica (SD e Varco, vedi Tabella S1 Supplementare). La percezione dello sforzo vocale potrebbe risultare evidente nell'ascolto delle produzioni di Bra-S a causa di una bassa variazione compresa tra 8,5 e 9 dB. Il parlato di Bra-S è influenzato dal carico vocale. L1-BP è fortemente influenzato dalla lunghezza della frase ed è meno sensibile alle elevate variazioni della durata sillabica (il modello ritmico del BP mostra una minore variazione sillabica22,56).

Il tasso di pausa (Figura 6C) mostra che i parlanti di inglese L2 producono pause più lunghe (da 200 ms a 375 ms) rispetto ai parlanti di inglese L1, di portoghese brasiliano L1 e di portoghese brasiliano L2 (media di 30 ms per l’inglese L1, 50 ms per il portoghese brasiliano L1 e 100 ms per il portoghese brasiliano L2). La pianificazione del discorso, in questo caso, potrebbe aver influito sulla produzione in inglese L2 a causa di un aumento dell’attività cerebrale54,57. Si prevede che una maggiore competenza linguistica si traduca in una velocità e ampiezza di lettura maggiori54; tuttavia, anche per i parlanti esperti di una seconda lingua, i compiti di lettura hanno mostrato un maggiore sforzo negli aspetti cognitivi di ordine superiore del discorso straniero e nell’elaborazione linguistica54,57. I nostri risultati indicano, almeno su base preliminare, che i parlanti di portoghese brasiliano L2 potrebbero essere meno influenzati dalle pause rispetto ai parlanti di inglese L2, a causa delle differenze nel pattern ritmico delle due lingue.

figure-results-1
Figura 6: Modelli Additivi Generalizzati per le caratteristiche prosodiche-acustiche. Sull'asse Y, la variabile risposta (le caratteristiche acustiche da modellare); sull'asse X, le variabili predittive (il fattore 'Lingua' e le covariate nei modelli additivi che determineranno la forma e le traiettorie delle curve (cioè gli effetti di smoothing: 'Lingua + covariate') e il prodotto tra 'Lingua' e una caratteristica metrica che fornirà una proiezione più accurata della variabile risposta (cioè interazioni fattore-smoothing: 'covariate:Lingua'). Abbreviazione: GAMs = Modelli Additivi Generalizzati. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Per quanto riguarda le metriche ritmiche, per SD-S (Figura 7A), i nostri risultati mostrano che più un parlante varia la curva di f0 e aumenta la velocità di parlata, più SD-S diminuisce a tutti i livelli linguistici (un effetto speculare rispetto alla Figura 6A). Nel caso della SD per le consonanti (SD-C, Figura 7C), l'L1-BP, al contrario dell'L1 inglese, presenta una bassa variazione all'aumentare della velocità di parlata o della durata delle pause. Tale andamento della SD è previsto, poiché la variabilità della durata della sillaba nell'L1 inglese è statisticamente significativamente maggiore rispetto all'L1-BP44,58. Il Varco-S (Figura 7B e Tabella Supplementare S1) sembra essere in una certa misura correlato all'L1 e all'L2 dello stesso gruppo linguistico. All'aumentare della variabilità di f0 e della velocità di parlata, il Varco-S diminuisce per l'L1-BP e sembra diminuire e attenuarsi per l'L2-BP. Per le produzioni in inglese, mentre la variabilità di f0 e la velocità di parlata aumentano, il Varco-S aumenta e si attenua per l'L1-inglese e l'L2-inglese.

Per quanto riguarda la DS per vocali o consonanti (SD-V_C, Figura 7D e Tabella Supplementare S1), i nostri risultati mostrano alcune somiglianze con l'andamento di Varco-S (Figura 7B). Ad esempio, un aumento della velocità di parlata, della durata delle pause e della variabilità di f0 favorisce un andamento ascendente-discendente della SD-V_C per il L1-BP e per il L2-BP. Nelle produzioni in inglese, mentre tali caratteristiche prosodiche sono più elevate, la SD-V_C diminuisce leggermente, attenuandosi per il L1-inglese, aumenta leggermente e poi si attenua per il L2-inglese. La correlazione tra Varco-S e SD-V_C nei gruppi linguistici L1-L2 della stessa lingua potrebbe essere parzialmente spiegata dall'effetto Lombard, che si riferisce alla modifica dei parametri acustici del parlato in presenza di rumore di fondo59.

Nel parlato straniero, a seconda della complessità del compito (ad esempio, parlato letto), i parlanti hanno utilizzato strategie acustiche simili sia nell'L1 che nell'L259,60. Da un lato, Marcoux ed Ernestus hanno scoperto che le misure di f0 (intervallo e mediana) nel parlato Lombardo L2 suggeriscono che i parlanti Inglesi L2 sono stati influenzati dal loro Olandese L161,62. Dall'altro lato, scoperte più recenti propongono che, sebbene ci si aspetti che il parlato Lombardo L2 differisca dal parlato Lombardo L1 a causa del carico cognitivo maggiore nel parlare l'L2, i parlanti Inglesi L2 hanno prodotto il parlato Lombardo nella stessa direzione dei parlanti Inglesi L163. L'entità in cui i nostri risultati sono allineati con Marcoux ed Ernestus63 e divergono da Waaning59, Villegas et al.60 e Marcoux ed Ernestus61,62 richiede ulteriori indagini.

figure-results-2
Figura 7: Modelli Additivi Generalizzati per le caratteristiche metriche. Sull'asse Y, la variabile risposta (le caratteristiche metriche da modellare); sull'asse X, le variabili predittive (il fattore 'Lingua' e le covariate nei modelli additivi che determineranno la forma e le traiettorie delle curve (cioè gli effetti di smoothing: 'Lingua + covariate') e il prodotto tra 'Lingua' e una caratteristica metrica che fornirà una proiezione più accurata della variabile risposta (cioè interazioni fattore-smoothing: 'covariata:Lingua'). Abbreviazione: GAMs = Modelli Additivi Generalizzati. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Risultati per la percezione del parlato
Riguardo le sequenze vocali BP, nella sequenza n. 1 (Figura 8A), la voce di controllo n. 3 è stata giudicata come la voce obiettivo. In realtà, la voce obiettivo era la voce n. 4. I risultati non mostrano una differenza statisticamente significativa (vedi Tabella Supplementare S1) tra la voce di controllo n. 3 (83%) e la voce obiettivo n. 4 (71%). Nella sequenza n. 2 (Figura 8B), il confronto tra la voce obiettivo n. 3 (40%) e la voce di controllo n. 4 (20%) non ha evidenziato alcuna differenza statisticamente significativa (vedi Tabella Supplementare S1) per le sequenze vocali in inglese. Nella sequenza n. 1 (Figura 9A), non vi è stata alcuna differenza significativa (vedi Tabella Supplementare S1) tra la voce di controllo n. 2 (26%) e la voce obiettivo n. 4 (54%).

Nell'analisi della somiglianza vocale, sia la similarità del coseno (CoSim) sia la distanza euclidea (EucDist, [EucDist trasformata]54) hanno mostrato una correlazione costante tra il campione #3 e l'obiettivo nella serie BP #1 (CoSim = 0,99; EucDist = 77,4, [0,93]). La correlazione tra il campione #4 e l'obiettivo è stata simile e altrettanto forte nella serie BP #2 (CoSim = 0,99, EucDist = 76,3, [0,93]). Nella serie in lingua inglese #1, la correlazione è risultata costante per CoSim (0,83), ma debole fino a soddisfacente per EucDist (213,0, [0,47]). Nel complesso, entrambe le tecniche, CoSim ed EucDist, si sono rivelate soddisfacenti per determinare la somiglianza vocale. Inoltre, CoSim ha mostrato prestazioni leggermente migliori, come indicato da Gahman ed Elangovan52 (vedere Tabella Supplementare S1).

Per quanto riguarda la somiglianza, cosa potrebbe aver causato un aumento di falsi allarmi? Le caratteristiche prosodico-acustiche hanno mostrato evidenze che, sebbene le voci di controllo e le voci bersaglio si comportassero in modo significativamente diverso (statisticamente) – con l'eccezione delle sequenze presentate in Figure 8A,B e Figure 9A – le scelte degli ascoltatori si sono in parte diversificate tra diverse voci di controllo nelle altre sequenze (Figure 8C,D e Figure 9B-D). Tale giudizio sembra dipendere più da una (o forse più di una) specifica caratteristica acustica condivisa tra i parlanti, piuttosto che da un'intera classe di caratteristiche prosodico-acustiche. Ad esempio, il nostro studio ha presentato diverse caratteristiche che (co)variavano tra le produzioni; tuttavia, i risultati percettivi mostrano una preferenza nei giudizi per una specifica voce di controllo corrispondente alla voce bersaglio8,35,64,65. Saranno necessarie ulteriori analisi nei futuri lavori.

È degno di nota considerare la scelta di una matrice parametrica multidimensionale per la similarità acustica66 come quella presentata in questo studio. I nostri risultati sono in linea con studi precedenti che hanno utilizzato caratteristiche acustiche basate su f0, VQ e intensità9,35. Tali caratteristiche sono particolarmente raccomandate per compiti di confronto tra parlanti nel campo forense9,66. È tuttavia importante sottolineare che nella presente ricerca nessuno dei parlanti di disturbo è stato previsto come simile alla voce bersaglio, anche se abbiamo utilizzato una variante delle linee guida di McFarlane16,17 nella preparazione delle sequenze vocali per il riconoscimento di parlanti con accento straniero. Inoltre, dobbiamo evidenziare che la nostra procedura di composizione delle sequenze vocali presenta differenze significative rispetto alle linee guida di McFarlane, incluse la durata degli stimoli, il numero di voci, la selezione dei parlanti di disturbo (qui randomizzata) e lo stile di parlato.

In quale misura le caratteristiche prosodico-acustiche di f0, qualità della voce e intensità risultino correlate alla percezione dei soggetti ascoltatori dipende fortemente dallo stile di parlato utilizzato nella ricerca. In questo studio abbiamo utilizzato brani da lettura. La maggior parte degli studi condotti su testimoni uditivi sceglie stimoli (semi-)spontanei come soluzione equilibrata, ad esempio il corpus DyVis67, ampiamente impiegato nelle indagini odierne sui testimoni uditivi28,68. La ragione che ci ha portato a selezionare compiti di lettura è che, al momento della stesura del presente manoscritto, il nostro corpus era costituito esclusivamente da dati ottenuti mediante compiti di lettura. È tuttavia importante riconoscere che è già in corso il processo di compilazione di un corpus (semi-)spontaneo. Inoltre, l’atto di leggere una storia può generare un livello affidabile di uniformità e variazione, sia intra-parlante che inter-parlante. Ciò facilita l’evidenziazione di caratteristiche prosodiche o fonetiche—individuali o dialettali—nei casi di confronto vocale. Tale aspetto risulta particolarmente evidente nelle situazioni di carico vocale durante la produzione di un accento straniero, anche tra parlanti esperti8,9,23,54.

figure-results-3
Figura 8: Grafici a barre contenenti i risultati delle quattro sequenze presentate agli ascoltatori brasiliani. (A,B) Differenza non significativa tra la voce bersaglio (in blu) e una voce di controllo (in celeste). (C,D) Differenze significative rispetto alle voci di controllo e alla voce bersaglio. Abbreviazione: NS = non significativo. Cliccare qui per visualizzare una versione ingrandita di questa figura.

figure-results-4
Figura 9: Grafici a barre contenenti i risultati delle quattro sequenze presentate agli ascoltatori americani. (A) Differenza non significativa tra la voce obiettivo (in rosso) e una voce di controllo (in rosa). (B,C,D) Differenze significative tra le voci di controllo e la voce obiettivo. Abbreviazione: NS = non significativo. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Tabella Suppl. S1: Statistiche della produzione del linguaggio - Modelli Additivi Generalizzati (GAM): le statistiche F (gradi di libertà), l'R2 aggiustato per ciascuna caratteristica prosodico-acustica statisticamente significativa (Figura 6) e per ciascuna metrica ritmica (Figura 7) per livello linguistico, oltre ai valori individuali di ciascun termine smooth (le covariate). Statistiche della percezione del linguaggio: statistiche di Kruskall-Wallis χ2 (gradi di libertà), valori p e η2 aggiustato, nonché un test post-hoc di Dunn per il confronto a coppie (Figura 8 e Figura 9) delle differenze statisticamente non significative tra le coppie di voci target-foil (Figura 8A,B e Figura 9A). Matrici di similarità acustica per le distanze coseno ed euclidea di ciascun lineup. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Discussione

L'attuale protocollo rappresenta una novità nel campo della fonetica (forense). Si divide in due fasi: una basata sulla produzione (analisi acustica) e una basata sulla percezione (analisi del giudizio). La fase di analisi della produzione comprende la preparazione dei dati e l'allineamento forzato, il riallineamento e l'estrazione automatica delle caratteristiche prosodico-acustiche oltre alle statistiche. Questo protocollo collega la fase di raccolta dei dati all'analisi dei dati in modo più rapido ed efficiente rispetto ai protocolli tradizionali basati su una segmentazione prevalentemente manuale.

Tuttavia, il processo di riallineamento, illustrato nei passaggi del protocollo da 1.3.6 a 1.3.6.9, funziona fondamentalmente sulle unità telefoniche e di parole generate nei passaggi del protocollo da 1.3.1 a 1.3.4. La novità del processo di riallineamento consiste nel generare un nuovo oggetto TextGrid contenente tre nuovi livelli di testo: un livello sillabico, un livello di blocco del discorso che può essere generato automaticamente o manualmente in base alle parole e un livello di tono che può essere molto utile per il calcolo delle misure f0. Le linee guida di riallineamento proposte per questo protocollo sono state precedentemente utilizzate in studi sul ritmo del linguaggio L2 21,69,70, studi per il rilevamento del grado di accento straniero utilizzando tecniche di apprendimento automatico22 e studi nel dominio forense 9.

L'estrazione automatica delle caratteristiche prosodiche, presentata nelle fasi del protocollo da 1.3.7 a 1.3.7.10, genera una matrice multidimensionale di caratteristiche prosodico-acusiche, come potrebbe essere testimoniato nella presente ricerca. Tali caratteristiche includono le funzioni vocali melodiche, durative e spettrali (qualità e intensità della voce)71. Un numero considerevole di queste caratteristiche acustiche sono meno sensibili e in qualche modo robuste alle registrazioni audio rumorose eventualmente raccolte nella medicina legale o in qualsiasi altro scenario72. Inoltre, la matrice multidimensionale può essere applicata ai sistemi di riconoscimento vocale tramite diverse tecniche di intelligenza artificiale (work in progress). Può ancora essere molto utile nell'insegnamento degli aspetti prosodici nelle classi di pronuncia L221 (work in progress).

L'analisi statistica di questa parte del protocollo rappresenta l'uso del metodo GAM poiché abbiamo affrontato una relazione complessa tra una specifica caratteristica acustica e più parlanti con fattore linguistico. Per modellare una specifica caratteristica acustica, ad esempio, è stato necessario verificare come si sarebbero comportate le altre caratteristiche acustiche della matrice (i termini uniformi) in modo da poter descrivere in modo più accurato ciò che stava accadendo durante la produzione del parlato.

Per quanto riguarda l'analisi della percezione, il protocollo attuale è stato costituito dalla preparazione e implementazione delle formazioni vocali, dall'analisi statistica e dall'analisi della somiglianza acustica. Per preparare le formazioni, abbiamo utilizzato lo script CreateLineup per Praat, che genera automaticamente un file audio per ogni lineup contenente lamine e voce di destinazione in sequenza casuale, come descritto nei passaggi del protocollo da 2.2 a 2.2.1.9.

Per l'analisi statistica di questo protocollo, abbiamo eseguito il test non parametrico di Kruskal-Wallis poiché i nostri dati non soddisfacevano le ipotesi di analisi della varianza (ANOVA). Una volta ottenuta una relazione tra i punteggi di giudizio valutati dagli ascoltatori e controllati per la voce target e i foil, abbiamo optato per l'utilizzo delle statistiche del modello lineare.

Per l'analisi della somiglianza acustica, abbiamo utilizzato lo script AcousticSmilarity_cosine_euclidean per Python. Il programma fa apparire l'albero delle directory del computer e chiede all'utente di scegliere il file contenente le caratteristiche prosodico-acustiche delle lamine e la voce di destinazione che compone la scaletta in analisi. Con un clic di un pulsante, lo script genera tre matrici di somiglianza: un coseno, un euclideo e un euclideo trasformato (da zero a uno), sia su file '.txt' (delimitati da tabulazioni) che su file '.csv'. Dobbiamo comunque tenere a mente che ogni dataset (il file '.txt' contenente le caratteristiche prosodico-acustiche delle lamine e del target) deve trovarsi nella cartella originale della lineup, e ogni cartella della lineup deve avere una copia del copione AcousticSmilarity_cosine_euclidean .

In sintesi, l'attuale protocollo avanza nella ricerca fonetica (forense). Comprendendo fasi distinte - analisi della produzione e della percezione, nonché somiglianza acustica - colma il divario tra la raccolta dei dati e l'analisi multidimensionale delle caratteristiche acustiche. I ricercatori possono beneficiare di una prospettiva olistica, esplorando sia gli aspetti della produzione che quelli della percezione. Inoltre, questo protocollo garantisce la riproducibilità della ricerca, consentendo ad altri di basarsi sulle linee guida di questo lavoro.

Limitazioni e direzioni future
Dobbiamo ancora tenere presente che tutto funzionerà con successo se la preparazione dei dati seguirà le linee guida proposte nei passaggi del protocollo da 1.3.1 a 1.3.4. Inoltre, nelle procedure di allineamento forzato, dobbiamo essere consapevoli che un allineatore forzato esterno pre-addestrato, come MAUS utilizzato nel lavoro attuale, è suscettibile di errori di segmentazione, specialmente in dati accentati estranei non pre-addestrati o anche in allineatori pre-addestrati, indipendentemente dal fatto che l'audio non abbia una buona qualità o che l'allineatore non contenga il linguaggio audio (questo fatto renderebbe il lavoro dell'esperto più difficile e dispendioso in termini di tempo). La trascrizione forense, in particolare di file audio più lunghi, incontra difficoltà per quanto riguarda la rappresentazione accurata e affidabile delle registrazioni parlate72.

Ci sono anche diverse sfide nella trascrizione e nell'allineamento di file audio più lunghi. Le prestazioni dell'allineatore sono influenzate dallo stile di conversazione e dall'ambiente fonetico, nonché da fattori specifici del dialetto. Sebbene esistano differenze specifiche per gli allineatori, in generale, le loro prestazioni sono simili e generano segmentazioni che si confrontano bene con l'allineamento manuale complessivo73. Inoltre, la produzione di inglese L1 e L2 è stata eseguita con un modello acustico pre-addestrato di inglese americano a causa dell'indisponibilità di modelli vocali stranieri in MAUS. Inoltre, non esistono modelli acustici pre-addestrati per la BP in MAUS. Per i dati BP sono stati utilizzati i modelli acustici preesistenti di lingua italiana (vedi NOTA, fase di protocollo 1.3.5.7).

Nei lavori futuri (in corso), utilizzeremo il Montreal Forced Aligner (MFA)74 come parte del protocollo. Un grande vantaggio dell'MFA è la disponibilità di modelli acustici pre-addestrati e di modelli grafema-fonema per un'ampia varietà di lingue (incluso BP), nonché la capacità di addestrare nuovi modelli acustici e grafema-fonema su qualsiasi nuovo set di dati (ad esempio, il nostro corpus vocale con accento straniero)75.

Dichiarazioni

Gli autori non hanno conflitti di interesse da dichiarare.

Ringraziamenti

Questo studio è stato sostenuto dal Consiglio Nazionale per lo Sviluppo Scientifico e Tecnologico - CNPq, sovvenzione n. 307010/2022-8 per il primo autore e sovvenzione n. 302194/2019-3 per il secondo autore. Gli autori desiderano esprimere la loro sincera gratitudine ai partecipanti a questa ricerca per la loro generosa collaborazione e il loro prezioso contributo.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
CreateLineupPersonal collection#Script per praat per la preparazione delle lineup vocali
Dell I3 (con unità a stato solido - SSD) Dell#Computer portatile
PraatPaul Boersma & David Weenink#Software per l'analisi fonetica
Python 3Python Software Foundation#Linguaggio di programmazione interpretato, di alto livello e generico 
RThe R Project for Statistical Computing#Linguaggio di programmazione per il calcolo statistico
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorPersonal collection#Script per praat per l'estrazione automatica di funzioni acustiche
SurveyMonkeySurveyMonkey Inc.#Assembla sondaggi personalizzabili gratuiti, nonché una suite di programmi di back-end che includono analisi dei dati, selezione dei campioni, debiasing e rappresentazione dei dati.
Tascam DR-100 MKIITascam#Registratore vocale digitale
Il sistema di segmentazione automatica di Monaco di Baviera MAUSUniversità di Monaco di Baviera#Allineamento forzato di file audio (.wav) e di informazioni linguistiche (.txt)
VVUnitAlignerCollezione personale#Script per praat per il riallineamento automatico e la post-elaborazione delle unità fonetiche

Riferimenti

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Ristampe e permessi

Tag

Caratteristiche prosodichepercezione del parlatoqualità della vocefrequenza fondamentalericonoscimento del parlantesimilarità acustica