Methodenartikel

Buitenlands accent en forensische sprekersidentificatie in stemmenopstellingen: de invloed van akoestische kenmerken op basis van prosodie

1.5K weergaven

DOI:

10.3791/66313

27 september 2024

In dit artikel

Samenvatting

Dit onderzoek had tot doel een vergelijking te maken tussen L1-L2-Engels en L1-L2 Portugees om te controleren hoeveel de invloed van een buitenlands accent verantwoordelijk is voor beide metrische en prosodische-akoestische parameters, evenals voor de keuze van de doelstem in een stemmenopstelling.

Samenvatting

Dit onderzoek heeft tot doel zowel de prosodisch-akoestische kenmerken als de perceptuele correlaten van Engels met een vreemde accent en Braziliaans-Portugees met een vreemde accent te onderzoeken en te controleren hoe de producties van de sprekers van vreemde en moedertalige accenten gecorreleerd zijn met de perceptie van de luisteraars. In de methodologie hebben we een spraakproductieprocedure uitgevoerd met een groep Amerikaanse sprekers van Braziliaans-Portugees als tweede taal en een groep Braziliaanse sprekers van Engels als tweede taal, en een spraakperceptieprocedure waarbij we stemmenlijnen voor beide talen uitvoerden.Voor de statistische analyse van de spraakproductie hebben we Generalized Additive Models gebruikt om het effect van de taalgroep op elke klasse (metriek of prosodisch-akoestisch) van kenmerken te evalueren, gecontroleerd voor het verzachtende effect van de covariant(en) van de tegengestelde klasse. Voor de statistische analyse van de spraakperceptie hebben we een Kruskal-Wallis test en een post-hoc Dunn's test uitgevoerd om het effect van de stemmen van de lineups op de scores beoordeeld door de luisteraars te evalueren. Toch hebben we akoestische (stem) gelijkenistests uitgevoerd op basis van cosinus- en euclidische afstanden. De resultaten toonden significante akoestische verschillen tussen de taalgroep in termen van variabiliteit van de f0, duur en stemkwaliteit. Voor de lineups gaven de resultaten aan dat prosodisch kenmerken van f0, intensiteit en stemkwaliteit correleerden met de waargenomen beoordelingen van de luisteraars.

Inleiding

De accent is een opvallend en dynamisch aspect van communicatie en vloeiendheid, zowel in de moedertaal (L1) als in een vreemde taal (L2)1. Vreemde accent vertegenwoordigt de L2 fonetische kenmerken van een doeltaal en kan (na verloop van tijd) veranderen als reactie op de L2-ervaring van de spreker, spreekstijl, inputkwaliteit, expositie, onder andere variabelen. Een vreemd accent kan worden gekwantificeerd als een (scalaire) graad van verschil tussen L2-spraak geproduceerd door een buitenlandse spreker en een lokale of referentie-accent van de doeltaal2,3,4,5.

Dit onderzoek beoogt zowel de prosodische-akoestische kenmerken als de perceptuele correlaten van Engels met een buitenlands accent en Braziliaans Portugees (BP) met een buitenlands accent te onderzoeken, evenals te controleren in welke mate de producties van buitenlandse en moedertalige accenten van de sprekers gecorreleerd zijn met de perceptie van de luisteraars. Eerder onderzoek op het gebied van forensische wetenschappen heeft de robuustheid van klinkers en medeklinkers aangetoond bij de identificatie van een vreemd accent, hetzij als stabiel voor een langetermijnanalyse van een individu (The Lo Case6) of verwijzend naar de hoge ID-nauwkeurigheid van een spreker (The Lindbergh Case7). Echter, de verkenning van prosodische-akoestische kenmerken op basis van duur, fundamentele frequentie (f0, d.w.z. het akoestische equivalent van toonhoogte), intensiteit en stemkwaliteit (VQ) heeft steeds meer aandacht gekregen8,9. Daarom vertegenwoordigt de keuze voor prosodische-akoestische kenmerken in dit onderzoek een veelbelovende weg op het gebied van forensische fonetica8,10,11,12,13.

Het huidige onderzoek wordt ondersteund door studies die zich richten op vreemde accenten als een vorm van stemvermomming in forensische gevallen14,15, evenals in de voorbereiding van stemlijnen voor sprekerherkenning16,17. Bijvoorbeeld, spraaktempo speelde een belangrijke rol bij de identificatie van Duitse, Italiaanse, Japanse en Braziliaanse sprekers van Engels18,19,20,21,22. Naast spraaktempo, langetermijn spectrale en f0 kenmerken dagen L2-bekwame sprekers met bekendheid met de doeltaal uit omdat de hersenen en cognitieve basissen een tekort lijden in geheugen, aandacht en emotie, wat zich weerspiegelt in de fonetische prestaties van de spreker tijdens lange spraakturns23. Het standpunt van vreemde accenten in de forensische wetenschap is dat de definitie van wat echt klinkt als een vreemd accent veel afhankelijk is van de onbekendheid van de luisteraar in plaats van een niet-tot-extreme graad van spraak met een buitenlands accent24.

In het perceptuele domein is een veelgebruikt forensisch hulpmiddel sinds het midden van de jaren negentig voor de herkenning van criminelen de Stemlijn (auditieve herkenning), die analoog is aan visuele herkenning die wordt gebruikt om een dader op een misdaadplek te identificeren16,25. In een stemlijn wordt de stem van de verdachte gepresenteerd naast foils-stemmen die vergelijkbaar zijn in sociaal-linguïstische aspecten zoals leeftijd, geslacht, geografische locatie, dialect en culturele status-voor identificatie door een oorgetuige. Het succes of falen van een stemlijn hangt af van het aantal stemmonsters en de duur van de monsters25,26. Bovendien wordt voor real-world samples beschouwd dat de audiokwaliteit de nauwkeurigheid van stemherkenning consequent beïnvloedt. Slechte audiokwaliteit kan de unieke kenmerken van een stem vervormen27. In het geval van stemgelijkenis kunnen fijne fonetische details gebaseerd op f0 de luisteraar verwarren tijdens stemherkenning28,29. Dergelijke akoestische kenmerken gaan verder dan f0 en omvatten elementen van duur en spectrale kenmerken van intensiteit en VQ30. Dit beeld van meerdere prosodische kenmerken is cruciaal in de context van forensische stemvergelijking om nauwkeurige sprekeridentificatie te garanderen9,14,15,29,31.

Kortom, studies in forensische fonetica hebben enige variatie laten zien met betrekking tot de identificatie van een vreemd accent in de afgelopen decennia. Aan de ene kant lijkt een vreemd accent het proces van het identificeren van een spreker niet te beïnvloeden32,33 (vooral als de spreker onbekend is met het beoogde vreemde accent34). Aan de andere kant zijn er bevindingen in de tegenovergestelde richting12,34,35.

Protocol

Dit werk is goedgekeurd door een ethische commissie voor mensonderzoek. Bovendien is van alle deelnemers aan deze studie geïnformeerde toestemming verkregen voor het gebruik en de publicatie van hun gegevens.

1. Spraakproductie

OPMERKING: We hebben spraak verzameld uit een leestaak voor zowel 'L1 Engels-L2 BP' geproduceerd door Groep 1: de Americaanse Engelse Sprekers (AmE-S, uit de V.S.A.), als voor 'L1 BP-L2 Engels' geproduceerd door Groep 2: de Braziliaanse Sprekers (Bra-S). Zie Figuur 1 voor een stroomschema van de spraakproductie.

figure-protocol-1
Figuur 1: Schematisch stroomschema voor spraakproductie. Klik hier om een grotere versie van deze figuur te bekijken.

  1. Deelnemers
    1. Bepaal de aantal deelnemers, de taal (L1 Engels, L2 BP; L1 BP, L2 Engels), de geslacht (vrouwelijk of mannelijk), de leeftijd (gemiddelde, standaarddeviatie), de groepskenmerken (professionals of studenten in de bachelorfase), en de L2-vaardigheidsniveau (gevorderd of vergevorderd) voor elke groep.
      OPMERKING: Voor het huidige onderzoek werden zowel AmE-S als Bra-S beschouwd als bekwaam in de L2 (beide groepen waren gekwalificeerd als B2-C1)36). De AmE-S woonden twee jaar in Brazilië toen de procedures werden uitgevoerd. De Bra-S woonden meer dan twee jaar in de V.S. toen de procedures werden uitgevoerd. Tijdens hun verblijf in het buitenland spraken beide groepen hun L2 voor studie- en werkdoeleinden ten minste 6 dagen per week gedurende ongeveer 4-5 uur per dag.
    2. Plaats de deelnemers in een comfortabele en rustige ruimte en presenteer het leesmateriaal voor elke groep.
  2. Gegevensverzameling
    OPMERKING: Spraakgegevens moeten worden verzameld uit een leestaak in de volgende talen: L1-Engels en L2-BP; L1-BP en L2-Engels. Laat de deelnemers de teksten vooraf lezen indien nodig.
    1. Opnameprocedures
      1. Neem de spraakgegevens op op een rustige plek met passende akoestische omstandigheden.
      2. Gebruik een digitale voicerecorder (zie de Tabel met materialen)37 en een unidirectionele, elektromagnetisch geïsoleerde cardioïde microfoon (zie de Tabel met materialen)38.
      3. Neem de audiogegevens op in '.wavformulier
      4. Stel de bemonsteringsfrequentie in op 48 kHz en de kwantiseringsresolutie op 16 bits.
        OPMERKING: Het audioformaat en de configuratie voor de bemonsterings- en kwantiseringssnelheden beschreven in stappen 1.2.1.3 en 1.2.1.4 worden toegepast om een hoge kwaliteit en ruisonderdrukking te garanderen, zodat de spectrale kenmerken die worden gebruikt voor latere akoestische analyse behouden blijven.
  3. Akoestische analyse
    OPMERKING: Verdeel de procedures voor akoestische analyse in drie stappen: geforceerde uitlijning (forced-alignment), heruitlijning en extractie van akoestische kenmerken.
    1. Schrijf de linguïstische transcriptie (in een '.Kies de juiste set pipetpunten voor het volume dat u wilt overbrengen. Sluit de pipetpunt stevig aan op de pipet. Stel de pipet in op het gewenste volume. Druk de zuiger in tot de eerste stop, steek de tip in de vloeistof en laat de zuiger langzaam los om het volume op te zuigen. Haal de tip uit de vloeistof en breng deze over naar de ontvangende buis. Druk de zuiger in tot de eerste stop en druk vervolgens door tot de tweede stop om alle vloeistof volledig uit de tip te verwijderen. Verwijder de gebruikte pipetpunt in de daarvoor bestemde afvalbak.bestand) voor elk audiobestand.
    2. Markeer het paar van 'U heeft geen brontekst verstrekt om te vertalen. Upload aub het .txt-bestand of plak de tekst die u vertaald wilt hebben, zodat ik kan beginnen met de vertaling naar het Nederlands volgens de opgegeven richtlijnen.'/'.wavbestanden met dezelfde naam (bijv. 'my_file.wav'/ 'mijn_bestand.Kies een monster met een geschikte concentratie aan cellen. Centrifugeer de cellen bij 300 x g gedurende 5 minuten. Verwijder het supernatant en was de celpellet twee keer met koud PBS. Het is essentieel om de cellen gedurende het hele proces op ijs te houden om proteasedegradatie te minimaliseren en de integriteit van de eiwitten te behouden. Gebruik een lysisbuffer die is geoptimaliseerd voor het specifieke eiwit van interesse, inclusief proteaseremmers om endogene enzymen te blokkeren. Voeg de lysisbuffer toe aan de celpellet en resuspendeer de cellen door middel van vortexen of door gebruik te maken van een homogenisator. Incubeer het lysaat op ijs gedurende 30 minuten. Centrifugeer het mengsel vervolgens bij 12.000 x g gedurende 15 minuten bij 4 °C om het celdebris te pelletteren. Verzamel de supernatant, waarin de solubele eiwitten zich bevinden, en breng deze over naar een nieuwe, gekoelde centrifugebuis. Bepaal de eiwitconcentratie van het lysaat met behulp van een standaard assay, zoals de BCA-eiwitassay of de Bradford-assay, voordat u doorgaat naar de volgende stap van het experiment.').
      OPMERKING: Om de prestaties van de procedure beschreven in sectie 1.3.7 te verbeteren, wordt ten zeerste aanbevolen dat de eerste drie tekens van de labels van de '.txt/.wav'-bestanden de Taal, Dialect, of Accent, terwijl het vierde tot en met het zesde teken staan voor de Geslacht (bijv., EL1FEM voor EEngels L1 Vrouwelijkale). Vanaf het zevende teken moet de gebruiker het sprekerstype aangeven (bijv. 001 voor de eerste spreker). Bijgevolg is het eerste '.txt/.wav'-paar EL1FEM001.
    3. Maak voor elke L1-L2-taalcombinatie een map aan.
      OPMERKING: Een map voor L1-L2 Engels en een map voor L1-L2 BP.
    4. Bevestig dat alle bestandsparen in dezelfde taal zich in dezelfde map bevinden.
    5. Voer de geforceerde uitlijning uit.
      1. Open de webinterface van de Munich Automatic Segmentation (MAUS) forced aligner (webmuis)39 op https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Sleep en laat elk paar van .wav / .Kies uit de dropdown-lijst de gewenste optie. bestanden van de map naar de gestippelde rechthoek in Bestanden (of klik binnen het rechthoek)* Figuur 2A).
      3. Klik op de Uploaden knop om de bestanden naar de aligner te uploaden (zie rode pijl in Figuur 2A).
      4. Selecteer de volgende opties in de Serviceopties menu (Figuur 2B): G2P-MAUS-PHO2SYL voor Pijplijznaam; Engels (VS) (voor Taal) indien L1-L2 Engelse gegevens; Italiaans (IT) (voor Taal) indien L1-L2 BP-gegevens.
        OPMERKING: Wij hebben 'Italiaans' gekozen voor de BP-gegevens omdat webMAUS geen voorgetrainde akoestische modellen biedt voor de geforceerde uitlijning (forced alignment) van BP. In de fonetische literatuur wordt gesteld dat de Italiaanse fonologie een enigszins vergelijkbare symmetrische inventaris van zeven klinkers heeft, net als BP.40alsovolgens consonantische akoestische gelijkenissen41,42.
      5. Behoud de standaardopties voor 'Uitvoerformaat' en 'Alles behouden'.
      6. Controleer de Uitvoeren selectievakje voor het accepteren van de gebruiksvoorwaarden (zie groene pijl in Figuur 2C).
      7. Klik op de Webservice uitvoeren knop om de geüploade bestanden in de aligner uit te voeren.
        OPMERKING: Voor elk audiobestand geeft de MAUS forced aligner een Praat-bestand terug TextGrid object (een vooraf geformatteerd Praat '.txt'-bestand met de annotatie van woorden, fonologische lettergrepen en fonemen, gebaseerd op de linguïstische transcriptie die is geëxtraheerd uit het '.txt'-bestand beschreven in stap 1.3.1).
      8. Klik op de Download als ZIP-bestand knop om de TextGrid-bestanden als een gezipt bestand te downloaden (Figuur 2C).
        OPMERKING: Zorg ervoor dat de gecomprimeerde TextGrid-bestanden in dezelfde map worden gedownload als de audiobestanden.
      9. Extraheer de TextGrid-bestanden voor latere heruitlijning in de software voor fonetische analyse43.
    6. Voer de heruitlijning uit.
      1. Open en download het script voor Praat VVUnitAligner44 van https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat.
      2. Bevestig dat alle bestandsparen van dezelfde taal en de VVUnitAligner de scripts bevinden zich in dezelfde map.
        OPMERKING: Een map voor de L1-L2 Engelse bestanden en de VVunitAligner, en een map voor de L1-L2 BP-bestanden en de VVunitAligner.
      3. Open de software voor fonetische analyse.
      4. Klik Praat | Open Praat-script… om het script aan te roepen vanuit de objectvenster.
      5. Klik op de Uitvoeren druk één keer op de knop.
        OPMERKING: Een formulier genaamd Fonetische syllabe-uitlijning waarin de instellingen voor het gebruik van het script staan, verschijnt op het scherm (Figuur 3A).
      6. Klik op de Taal knop om te kiezen uit de talen 'Engels (US)', 'Portugees (BR)', 'Frans (FR)' of 'Spaans (ES)'.
      7. Klik op de Chunksegmentatie knop om te kiezen uit de segmentatieprocedure 'Automatisch', 'Geforceerd (handmatig)' of 'Geen'.
      8. Controleer de Sla TextGrid-bestanden op optie om de nieuwe TextGrid-bestanden automatisch op te slaan.
      9. Klik Ok | Start knoppen voor een heruitlijning van de fonetische eenheden uit stap 1.3.5.7.
        OPMERKING: Voor elk audiobestand zal VVUnitAligner een nieuw TextGrid-bestand genereren voor sectie 1.3.7 (Figuur 3B).
    7. Voer de automatische extractie van de akoestische kenmerken uit.
      1. Open en download het script SpeechRhythmExtractor45 van https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat voor de automatische extractie van prosodisch-akoestische kenmerken.
      2. Maak een nieuwe map aan en plaats SpeechRhythmExtractor samen met alle paren audio-/TextGrid-bestanden van alle talen hierin.
      3. Open de software voor fonetische analyse.
      4. Klik Praat | Open Praat-script… om het script aan te roepen vanuit de objectvenster.
      5. Klik op de Uitvoeren druk slechts één keer op de knop.
        OPMERKING: Er verschijnt een formulier op het scherm met de scriptinstellingen. Geef in de vakken voor de bestandsnamen van de '.txt'-outputbestanden de juiste namen op of behoud de standaardnamen.
      6. Controleer de stemkwaliteitsparameters optie om de ... op te slaan Uitvoerbestand VQ voor stemkwaliteit (Figuur 3C).
        OPMERKING: Dit tweede uitvoerbestand (de Uitvoerbestand VQ) bevat de parameters van het verschil tussen de 1st en de 2en harmonischen (H1-H2) en de Cepstral Prominence Peak (CPP)9.
      7. Controleer de Taalkundig doelwit optie om te kiezen uit de labels 'Taal', 'Dialect' of 'Accent' (Figuur 3C).
      8. Controleer de Eenheid optie om de f0-kenmerken te kiezen in Hz of in halve tonen (Figuur 3C).
      9. Stel de waarden in voor F0-drempelwaarde, de minimale en maximale f0-drempelwaarden (Figuur 3C).
        OPMERKING: Tenzij het onderzoek specifieke doelen heeft of vooraf vastgestelde specifieke audiofuncties, wordt ten zeerste aanbevolen om de parameters van stap 1.3.7.9 op de standaardwaarden te laten staan.
      10. Klik Ok | Uitvoeren voor de automatische extractie van de akoestische kenmerken.
        OPMERKING: Het script SpeechRhythmExtractor geeft een tabgescheiden '.txt'-bestand terug (Uitvoerbestand/ Uitvoerbestand VQ) met de uit de sprekers geëxtraheerde akoestische kenmerken.
  4. Statistische analyse
    1. Upload het spreadsheet met de akoestische kenmerken in R46 omgeving (of elke statistische software/omgeving naar keuze).
    2. Voer niet-parametrische statistiek uit met gegeneraliseerde additieve modellen (GAM's).
      1. Voer GAMs uit in R.
      2. Typ de volgende commando's in en druk op Voer in.
        library(mgcv)
        model = gam(the metrische/prosodisch-akoestische kenmerk bij de analyse ~ de Taal + s(de gekozen metrische eigenschapdoor de Taal) + overig metrische/prosodisch-akoestische kenmerken, data = de data frame)
        OPMERKING: We hebben besloten de toetsingsstatistieken van het protocol uit te voeren in de programmeertaal R, vanwege de toenemende populariteit ervan onder fonetici (en linguïsten) binnen de academische gemeenschap. R is op grote schaal gebruikt in fonetisch veldonderzoek.47Houd er rekening mee dat stap 1.4.2.2 pseudocode bevat. Schrijf de code volgens de onderzoeksvariabelen.

figure-protocol-2
Figuur 2: Screenshot van fonetische uitlijning met behulp van de MAUS forced aligner. (A) De gestreepte rechthoek is bedoeld voor het slepen en neerzetten van 'my_file.wav'/' my_file.txt' bestanden of om binnen het vlak te klikken om dergelijke bestanden in de map te zoeken; de uploadknop wordt aangegeven door de rode pijl. (B) De geüploade bestanden uit paneel A (zie blauwe pijl), de te gebruiken pipeline, de taal voor de paren bestanden, het bestandsformaat dat moet worden teruggegeven, en een 'true/false'-knop om alle bestanden te behouden. (C) Het selectievakje voor de gebruiksvoorwaarden (zie groene pijl), de knop Run Web Services en de resultaten (te downloaden TextGrid-bestanden). Klik hier om een grotere versie van deze figuur te bekijken.

figure-protocol-3
Figuur 3: Screenshot van de heruitlijningsprocedure. (A) Formulier met instellingen voor de heruitlijningsprocedure. (B) Gedeeltelijke golfvorm, breedband spectrogram met f0 (blauw) contour, en zes gesegmenteerde (en gelabelde) niveaus: tier 1: eenheden van klinker-onset tot de volgende klinker-onset (V_to_V); klinker-onset (V_to_V); tier 2: eenheden van klinker (V), consonant (C) en pauze (#); tier 3: fonische representaties V_to_V; tier 4: enkele woorden uit de tekst; tier 5: enkele spraakfragmenten (CH) uit de tekst; tier 6: tonale laag met de hoogste (H) en de laagste (L) toon van elk spraakfragment geproduceerd door een vrouwelijke AmE-S. (C) Instellingen voor de automatische extractie van de akoestische kenmerken. Klik hier om een grotere versie van deze figuur te bekijken.

2. Spraakperceptie

OPMERKING: We hebben vier stemidentificaties in het Engels uitgevoerd met Amerikaanse luisteraars en vier identificaties in het BP met Braziliaanse luisteraars. Zie Figuur 4 voor een stroomschema van de spraakperceptie.

figure-protocol-4
Figuur 4: Schematisch stroomdiagram voor spraakperceptie. Klik hier om een grotere versie van deze figuur te bekijken.

  1. Deelnemers
    1. Kies voor elke groep verschillende deelnemers uit degenen die hebben deelgenomen aan het spraakproductieprotocol.
      OPMERKING: Twee groepen deelnemers werden geselecteerd voor dit deel van het protocol: Groep 1: de Amerikaanse Engelse (uit de V.S.A.) Luisteraars (AmE-L), en Groep 2: de Braziliaanse Luisteraars (Bra-L). Voor het huidige onderzoek werden zowel AmE-L als Bra-L beschouwd als bekwaam in de L2 (beide groepen waren gekwalificeerd als B2-C136). De AmE-L hadden twee jaar in Brazilië gewoond toen de procedures werden uitgevoerd. De Bra-L hadden meer dan twee jaar in de V.S.A. gewoond toen de procedures werden uitgevoerd. Tijdens hun verblijf in het buitenland spraken beide groepen hun L2 voor studie- en werkdoeleinden (minstens zes dagen per week, ongeveer 4 tot 5 uur per dag).
    2. Bepaal voor elke groep het aantal deelnemers, de taal (L1 Engels, L2 BP; L1 BP, L2 Engels), het geslacht (vrouwelijk of mannelijk), de leeftijd (gemiddelde, standaarddeviatie), de groepskenmerken (professionals of bachelorstudenten) en het L2-bekwaamheidsniveau.
  2. De stemopstellingen
    OPMERKING: Verdeel de procedures voor de stemopstellingen in twee verschillende stappen: het voorbereiden en het uitvoeren van de stemopstellingen.
    1. Bereid vier stemopstellingen voor voor het Engels en vier voor het BP.
      1. Verkrijg audiobestanden van de sprekers uit sectie 1: Spraakproductie.
      2. Controleer of de audiobestanden van elke taalfactor in afzonderlijke mappen staan.
      3. Kies willekeurig zes stemfragmenten in L1 Engels of L1 BP.
        OPMERKING: Zes stemmen in de opstelling vertegenwoordigen één doelstem en vijf afleiders.
      4. Kies een stemfragment in L2 Engels of L2 BP van een van de sprekers die in stap 2.2.1.3 zijn opgenomen.
        OPMERKING: Het stemfragment in stap 2.2.1.4 is de referentiestem. Fragmenten moeten ongeveer 20 s lang zijn.8.
      5. Open en download het script voor Praat CreateLineup48 van https://github.com/pabarbosa/prosody-scripts-CreateLineUp.
      6. Controleer of de L2-referentiestem, de L1-afleiders en de L1-doelstem in dezelfde map staan voordat het CreateLineup-script wordt uitgevoerd (Afbeelding 5).
      7. Open de software voor fonetische analyse.
      8. Klik in het objectvenster op Praat | Open Praat script… om het script aan te roepen.
      9. Klik op Run | Run.
        OPMERKING: Het script genereert een bestand in de volgende volgorde: (de L2-referentiestem) + (de L1-doelstem en de willekeurig verdeelde afleiders) (Afbeelding 5).
    2. Het uitvoeren van de stemopstellingen
      1. Creëer een online ruimte om de opstellingen te hosten op een platform naar keuze (bijv. SurveyMonkey. Zie de Materialentabel) om de stemopstellingen op afstand uit te voeren.
      2. Open de link naar de online ruimte.
      3. Upload de bestanden die door het CreateLineup-script zijn gegenereerd naar het platform.
      4. Voer de procedure vooraf uit om elke stap te testen.
        OPMERKING: Het wordt aanbevolen om vooraf op de link te klikken en de opstellingen uit te voeren om te controleren of alles normaal verloopt.
  3. Statistische analyse
    1. Upload het spreadsheet met de scores van de oordelen van de luisteraars in de R-omgeving (of een andere statistische software/omgeving naar keuze).
      1. Voer de Kruskal-Wallis toets uit in R.
      2. Typ de volgende commando's en druk op Enter.
        ​model = kruskal.test(judgments ~ elke voice lineup, data = de data frame)
    2. Voer een post-hoc Dunn-toets uit.
      1. Voer de Dunn-toets uit in R.
      2. Typ de volgende commando's en druk op Enter.
        library(FSA)
        model = dunnTest(judgements ~ elke voice lineup, data = data, method = "bonferroni")
        OPMERKING: De codes in stappen 2.3.1.2 en 2.3.2.2 zijn pseudocodes (zie OPMERKING 1.4.2.2).
  4. Akoestische gelijkenheidsanalyse
    1. Selecteer de opstellingen (zie OPMERKING in stap 2.2.1.3) die niet-significante verschillen vertoonden tussen de doelstem en een van de afleiders.
    2. Herhaal de procedures van stappen 1.3.1 tot 1.3.7.5, en stappen 1.3.7.8 tot 1.3.7.10.
    3. Open en download het script voor Python49, AcousticSimilarity_cosine_euclidean50 van https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      OPMERKING: Het script genereert drie matrices (in '.txt' en '.csv'): één voor Cosinus-gelijkenis51,52, één voor Euclidische afstand52,53, en één voor getransformeerde Euclidische afstandswaarden, evenals een paarsgewijze vergelijking tussen de doelstem en elke afleider.
    4. Controleer of het script is gedownload in dezelfde map als de dataset van de opstelling.
    5. Klik op de knop Open file… om het script aan te roepen.
    6. Klik op de knoppen Run | Run Without Debugging.
      OPMERKING: De tweede Run-knop kan zijn aangeduid als Run or Run Without Debugging of Run Script. Deze voeren allemaal dezelfde commando's uit. Dit hangt enkel af van de gebruikte Python-omgeving.
    7. Voer stemgelijkenheidstesten uit op basis van akoestische kenmerken.
      ​OPMERKING: Cosinus-gelijkenis (of cosinusafstand) is een techniek die wordt toegepast in Kunstmatige Intelligentie (KI), in het bijzonder in machine learning in systemen voor automatische spraakherkenning (ASR). Het is een maatstaf voor gelijkenis tussen nul en één. Een cosinus-gelijkenis dicht bij één betekent dat twee stemmen waarschijnlijk sterk op elkaar lijken. Een cosinus-gelijkenis dicht bij nul betekent dat de stemmen waarschijnlijk erg verschillend zijn52. De Euclidische afstand, vaak aangeduid als Euclidische gelijkenis, wordt ook veel gebruikt in KI, machine learning en ASR. Het vertegenwoordigt de rechte lijnafstand tussen twee punten in de Euclidische ruimte53; d.w.z. hoe dichter de punten bij elkaar liggen (lagere afstandswaarden), hoe meer de stemmen op elkaar lijken. Voor een duidelijker begrip van de gerapporteerde resultaten van beide technieken hebben we een transformatie uitgevoerd van de ruwe scores van de Euclidische afstand naar waarden van nul (minder stemgelijkenis) tot één (meer stemgelijkenis)54.

figure-protocol-5
Figuur 5: Mappenstructuur voor spraakperceptie. Mappen met line-ups. Elke map bevat zes L1-stemmen, de L2-doelstem, het "CreateLineup"-script en het audiobestand van de stemline-up (gegenereerd na het uitvoeren van het script). Klik hier om een grotere versie van deze figuur te bekijken.

Resultaten

Resultaten voor spraakproductie
In deze sectie hebben we de prestaties van de statistisch significante prosodisch-akoestische kenmerken en ritmiekmetrieken beschreven. Dergelijke prosodische kenmerken waren de spraak-, articulatie- en pauzesnelheden, die gerelateerd zijn aan duur, en shimmer, wat gerelateerd is aan stemkwaliteit. De ritmiekmetrieken waren de standaarddeviatie (SD) van de lettergreepduur, de SD van de consonant, de SD van de vocalische of consonantische duur, en de variatiecoëfficiënt van de lettergreepduur (zie de Aanvullende Tabel S1).

De spreeksnelheid (Figuur 6A) neemt sneller af voor L1-L2 Engels dan voor L1-L2 BP, hoewel de snelheid voor beide L2's lager is. De spreeksnelheid is gerelateerd aan drie metrieken - de SD van de syllabeduur (SD-S), de SD van klinkers (SD-V) en de syllabische variatiecoëfficiënt (Varco-S). Het is daarnaast belangrijk om in gedachten te houden dat zowel de AmE-S- als de Bra-S-groep vaardig zijn in hun L2's. Het lijkt erop dat deze snelheid wordt beïnvloed door de hogere waarden van de syllabeduur en de lagere variabiliteit geproduceerd door L1-L2 BP, wat resulteert in minder steile hellingen.

De articulatiesnelheid (Figuur 6D) is gerelateerd aan SD-S, Varco-S, alsook de syllabische ritmeverhouding (RR-S); dat laatste stelt de verhouding tussen kortere en langere lettergrepen voor. Dergelijke metrieken lijken de articulatiesnelheid te beïnvloeden, net zoals de beïnvloede spreeksnelheid als gevolg van zinslengte en variatie in duur, wat leidt tot een hogere L2-spraakplanning en L2-cognitieve belasting9,23,54. Een hogere cognitief-linguïstische belasting kan vereist zijn in het domein van de zinslengte, op een wijze waarbij prosodisch-akoestische parameters worden beïnvloed55.

Met betrekking tot de prosodisch-akoestische kenmerken van spreek- en articulatiesnelheden suggereren onze bevindingen dat hoe meer een spreker de duur van lettergrepen (en klinkers) varieert, hoe lager deze snelheden zijn. Wij stellen hypothetisch dat de spraakwaarneming van zowel L1- als L2-BP iets langzamer klinkt dan L1- en L2-Engels, en dat L1-Engels sneller klinkt dan alle andere taalniveaus. Dit feit kan gekoppeld zijn aan het spraakritme en de hypothese dat terwijl L1-L2 BP neigt naar de lettergreep-getimede pool van het ritmecontinuüm, L1-L2 Engels beweegt naar de klemtoon-getimede pool21,22.

De lokale shimmer, Figuur 6B, wordt beïnvloed door SD-S en Varco-S. Voor de lokale shimmer vertonen zowel de producties van Bra-S, L1-BP als L2-Engels een enigszins monotone trajectory naarmate de variabiliteit van de syllabeduur toeneemt (SD en Varco, zie Aanvullende Tabel S1). De perceptie van vocale inspanning kan duidelijk zijn bij het beluisteren van de producties van Bra-S vanwege een lage variatie die varieert tussen 8,5 en 9 dB. Bra-S spraak wordt beïnvloed door vocale belasting. L1-BP wordt sterk beïnvloed door de zinslengte en is minder gevoelig voor hoge variaties in de syllabeduur (het BP ritmische patroon vertoont minder syllabische variatie22,56).

De pauzesnelheid (Figuur 6C) laat zien dat L2-Engelstaligen langere pauzes produceren (van 200 ms tot 375 ms) dan de L1-Engelstaligen, L1-BP en L2-BP sprekers (gemiddelde van 30 ms voor L1-Engels, 50 ms voor L1-BP en 100 ms voor L2-BP). Spraakplanning zou in dit geval de L2-Engelse productie hebben beïnvloed als gevolg van verhoogde hersenactiviteit54,57. Er wordt verwacht dat een hogere taalbeheersing zou leiden tot een grotere leessnelheid en een grotere span54; desondanks vereisten leestaken, zelfs voor vaardige L2-sprekers, meer inspanning op het gebied van hogere cognitieve aspecten van vreemde spraak en taalverwerking54,57. Onze bevindingen tonen, ten minste op voorlopige basis, aan dat L2-BP sprekers minder beïnvloed kunnen worden door pauzes dan L2-Engels vanwege verschillen in het ritmische patroon van beide talen.

figure-results-1
Figuur 6: Generalized Additive Models voor de prosodisch-akoestische kenmerken. Op de Y-as staat de responsvariabele (de te modelleren akoestische kenmerken); op de X-as staan de predictoren (de factor 'Language' en de covariabelen in de additieve modellen die de vorm en de trajecten van de curven bepalen (d.w.z. de smoothing-effecten: 'Language + covariates'), en het product van 'Language' en een metrische feature die een nauwkeurigere projectie van de responsvariabele geeft (d.w.z. factor-smooth interacties: 'covariate:Language')). Afkorting: GAMs = Generalized Additive Models. Klik hier om een grotere versie van deze figuur te bekijken.

Met betrekking tot de ritmemetrieken, voor SD-S (Figuur 7A), onze bevindingen onthullen dat hoe meer een spreker de f0-curve varieert en de spreeksnelheid verhoogt, des te meer SD-S neemt af voor alle taalniveaus (een spiegeleffect van Figuur 6A). In het geval van de standaardafwijking (SD) voor medeklinkers (SD-C, Figuur 7C), L1-BP vertoont, in tegenstelling tot L1-Engels, een lage variatie naarmate de spreeksnelheid of pauzeduur toeneemt. Een dergelijke richting van de standaarddeviatie (SD) is voorspelbaar, aangezien de variabiliteit van de lettergreepduur bij L1-Engels (statistisch) significant hoger is dan bij L1-BP44,58De Varco-S (Figuur 7B en Aanvullende tabel S1) lijkt enigszins gecorreleerd aan de L1 en de L2 van dezelfde taalgroep. Naarmate de f0-variabiliteit en het spreektempo toenemen, neemt de Varco-S af voor L1-BP en lijkt deze af te nemen en te attenueren voor L2-BP. Voor de Engelse uitingen, terwijl de f0-variabiliteit en Spreeksnelheid toename, Varco-S neemt toe en vlakt af voor L1-Engels en L2-Engels.

Wat betreft de SD voor klinkers of medeklinkers (SD-V_C, Afbeelding 7D en Aanvullende Tabel S1), tonen onze resultaten enkele overeenkomsten met de Varco-S-prestaties (Afbeelding 7B). Zo bevorderen een hogere spreeksnelheid, pauzeduur en f0-variabiliteit een dalend-stijgend traject van de SD-V_C voor L1-BP en voor L2-BP. In Engelse producties, hoewel dergelijke prosodische kenmerken hoger zijn, neemt de SD-V_C licht af, vlakt deze af voor L1-Engels, neemt deze licht toe en vlakt deze vervolgens af voor L2-Engels. De correlatie tussen Varco-S en SD-V_C met de L1-L2 van dezelfde taalgroepen kan gedeeltelijk worden verklaard door het Lombard-effect, wat verwijst naar de wijziging van akoestische parameters in spraak als gevolg van achtergrondruis59.

Bij spraak in een vreemde taal hebben sprekers, afhankelijk van de complexiteit van de taak (bijv. voorgelezen spraak), soortgelijke akoestische strategieën gebruikt voor zowel L1 als L259,60. Enerzijds stelden Marcoux en Ernestus vast dat f0-metingen (bereik en mediaan) in L2 Lombard-spraak suggereren dat L2-Engelstaligen beïnvloed werden door hun L1-Nederlands61,62. Anderzijds suggereren recentere bevindingen dat, hoewel er van L2 Lombard-spraak wordt verwacht dat deze verschilt van L1 Lombard-spraak vanwege de hogere cognitieve belasting bij het spreken van de L2, L2-Engelstaligen Lombard-spraak produceerden in dezelfde richting als L1-Engelstaligen63. De mate waarin onze bevindingen overeenstemmen met Marcoux en Ernestus63 en afwijken van Waaning59, Villegas et al.60 en Marcoux en Ernestus61,62 behoeft verder onderzoek.

figure-results-2
Figuur 7: Generalized Additive Models voor de metrische kenmerken. Op de Y-as staat de responsvariabele (de te modelleren metrische kenmerken); op de X-as staan de predictoren (de factor 'Language' en de covariabelen in de additieve modellen die de vorm en het verloop van de curven bepalen (d.w.z. de smoothing-effecten: 'Language + covariates'), en het product van de 'Language' en een metrisch kenmerk dat een nauwkeurigere projectie van de responsvariabele oplevert (d.w.z. factor-smooth interacties: 'covariate:Language'). Afkorting: GAMs = Generalized Additive Models. Klik hier om een grotere versie van deze figuur te bekijken.

Resultaten voor spraakperceptie
In relatie tot de BP-stemline-ups werd in line-up #1 (Figuur 8A) de afleidingsstem #3 beoordeeld als de doelstem. In werkelijkheid was de doelstem stem #4. De resultaten tonen geen statistisch significant verschil (zie Aanvullende Tabel S1) tussen de afleiding #3 (83%) en de doelstem #4 (71%). In line-up #2 (Figuur 8B) vertoonde een vergelijking tussen de doelstem #3 (40%) en de afleiding #4 (20%) eveneens geen statistisch significant verschil (zie Aanvullende Tabel S1) voor de Engelse stemline-ups. In line-up #1 (Figuur 9A) was er geen significant verschil (zie Aanvullende Tabel S1) tussen de afleiding #2 (26%) en de doelstem #4 (54%).

Bij de analyse van stemovereenkomst vertoonden zowel de cosinusovereenkomst (CoSim) als de Euclidische afstand (EucDist, [EucDist getransformeerd]54) een consistente correlatie tussen foil #3 en het doelwit voor de BP-lineup #1 (CoSim = 0,99; EucDist = 77,4, [0,93]). De correlatie tussen foil #4 en het doelwit was vergelijkbaar sterk in de BP-lineup #2 (CoSim = 0,99, EucDist = 76,3, [0,93]). In de Engelse lineup #1 was de correlatie consistent voor CoSim (0,83), maar zwak tot bevredigend voor EucDist (213,0, [0,47]). Over het algemeen waren zowel CoSim als EucDist bevredigende technieken voor het bepalen van stemovereenkomst. Daarnaast presteerde CoSim iets effectiever, zoals beschreven door Gahman en Elangovan52(zie Aanvullende Tabel S1).

Wat betreft de gelijkenis, wat zou kunnen hebben geleid tot een toename van het aantal foutieve alarmen? Prosodisch-akoestische kenmerken toonden aan dat, hoewel foils en doelstemmen (statistisch) significant verschillend presteerden — met uitzondering van de lineups gepresenteerd in Figuur 8A,B en Figuur 9A — de keuzes van luisteraars enigszins varieerden over verschillende foils in de overige lineups (Figuur 8C,D en Figuur 9B-D). Een dergelijk oordeel lijkt meer afhankelijk te zijn van één (of wellicht meer) specifiek akoestisch kenmerk dat sprekers delen, dan van een hele klasse prosodisch-akoestische kenmerken. Onze studie presenteerde bijvoorbeeld verschillende kenmerken die (co)varieerden tussen producties; niettemin tonen de perceptuele resultaten een voorkeur in de oordelen voor een specifieke foil om overeen te komen met de doelstem8,35,64,65. Verdere analyses zijn noodzakelijk in toekomstig werk.

Het is opmerkelijk om de keuze voor een multidimensionale parametrische matrix voor akoestische gelijkenis66, zoals gepresenteerd in deze studie, te overwegen. Onze bevindingen komen overeen met eerdere studies waarin akoestische kenmerken gebaseerd op f0, VQ en intensiteit werden gebruikt9,35. Dergelijke kenmerken worden sterk aanbevolen voor sprekervergelijkingstaken in het forensisch veld9,66. Het is echter belangrijk om te benadrukken dat in het huidige onderzoek geen van de afleidingsstemmen (foils) als gelijkaardig aan de doelstem werden voorspeld, hoewel we een variant van de richtlijnen van McFarlane16,17 hebben gebruikt bij het opstellen van de stem-lineups voor de herkenning van sprekers met een buitenlands accent. Bovendien moeten we benadrukken dat onze procedure voor de stem-lineup belangrijke verschillen vertoont met de richtlijnen van McFarlane, waaronder de lengte van de stimulus, het aantal stemmen, de selectie van de afleidingsstemmen (hier gerandomiseerd) en de spreekstijl.

In hoeverre prosodisch-akoestische kenmerken van f0, stemkwaliteit en intensiteit gerelateerd lijken te zijn aan de perceptie van luisteraars, hangt sterk af van de spreekstijl die in het onderzoek wordt gebruikt. Hier hebben wij gebruikgemaakt van voorleesteksten. De meerderheid van de studies naar getuigenverklaringen op basis van stemherkenning kiest voor (semi-)spontane stimuli als een gebalanceerde oplossing — bijvoorbeeld het DyVis corpus67 — dat uitgebreid is ingezet in hedendaagse onderzoeken naar stemherkenning28,68. De reden waarom wij voor de voorleestaken hebben gekozen, is dat ons corpus op het moment van het schrijven van dit manuscript uitsluitend bestond uit gegevens verkregen uit voorleestaken. Het is echter belangrijk te vermelden dat het proces van het samenstellen van een (semi-)spontaan corpus reeds in gang is gezet. Bovendien kan het voorlezen van een verhaal een betrouwbaar niveau van uniformiteit en variatie genereren, zowel intra-spreker als inter-spreker. Dit vergemakkelijkt de nadruk op prosodische of fonetische kenmerken — individueel of dialectisch — in situaties waarbij sprake is van stemvergelijking. Dit wordt bijzonder merkbaar in gevallen van vocale belasting tijdens de productie van een vreemd accent, zelfs bij vaardige sprekers 8,9,23,54.

figure-results-3
Figuur 8: Staafdiagrammen met de resultaten van de vier lineups uitgevoerd door de Braziliaanse luisteraars. (A,B) Geen significant verschil tussen de doelstem (in het blauw) en een foil (in lichtblauw). (C,D) Significante verschillen ten opzichte van de foils en de doelstem. Afkorting: NS = niet significant. Klik hier om een grotere versie van deze figuur te bekijken.

figure-results-4
Figuur 9: Staafdiagrammen met de resultaten van de vier lineups uitgevoerd door de Amerikaanse luisteraars. (A) Geen significant verschil tussen de doelstem (in rood) en een afleider (in roze). (B,C,D) Significante verschillen tussen de afleiders en de doelstem. Afkorting: NS = niet significant. Klik hier om een grotere versie van deze figuur te bekijken.

Aanvullende Tabel S1: Statistieken van spraakproductie - Generalized Additive Models (GAMs): De F-statistieken (vrijheidsgraden), de gecorrigeerde R2 van elk statistisch significant prosodisch-akoestisch kenmerk (Figuur 6) en ritmetriek (Figuur 7) per taalniveau, evenals de individuele waarden van elke smooth term (de covariabelen). Statistieken van spraakperceptie: De Kruskall-Wallis χ2 statistieken (vrijheidsgraden), de p-waarden en de gecorrigeerde η2, evenals een post-hoc Dunn-test voor paarsgewijze vergelijking (Figuur 8 en Figuur 9) van elk statistisch niet-significant verschil tussen de paren van target-foil stemmen (Figuur 8A,B en Figuur 9A). Akoestische similariteitsmatrices voor Cosinus- en Euclidische afstand van elke lineup. Klik hier om een grotere versie van deze figuur te bekijken.

Discussie

Het huidige protocol presenteert een nieuwigheid op het gebied van (forensische) fonetica. Het is verdeeld in twee fasen: een gebaseerd op productie (akoestische analyse) en een gebaseerd op perceptie (beoordelingsanalyse). De productieanalysefase omvat de gegevensvoorbereiding en geforceerde uitlijning, heruitlijning en automatische extractie van prosodische-akoestische kenmerken naast de statistieken. Dit protocol verbindt de fase van gegevensverzameling met de gegevensanalyse op een snellere en efficiëntere manier dan de traditionele protocollen die voornamelijk gebaseerd zijn op handmatige segmentatie.

De heruitlijningsprocedure, getoond in protocolstappen 1.3.6 tot 1.3.6.9, werkt echter fundamenteel op de fone- en woodeenheden die zijn gegenereerd in protocolstappen 1.3.1 tot 1.3.4. De nieuwigheid van het heruitlijningsproces is dat het een nieuw TextGrid genereert met drie nieuwe tekstlagen: een syllabische laag, een spraakstukslaag die automatisch of handmatig kan worden gegenereerd op basis van woorden, en een toonlaag die heel nuttig kan zijn voor het berekenen van f0-maatregelen. De voor dit protocol voorgestelde heruitlijningsrichtlijnen werden eerder gebruikt in studies van L2 spraakritme21,69,70, studies voor de detectie van de mate van buitenlands accent met behulp van machine learning-technieken22, en studies in het forensische domein9.

De automatische extractie van prosodische kenmerken, gepresenteerd in protocolstappen 1.3.7 tot 1.3.7.10, genereert een multidimensionale matrix van prosodische-akoestische kenmerken zoals kan worden getest in het huidige onderzoek. Dergelijke kenmerken omvatten melodische, duur-, en spectrale (stemkwaliteit en intensiteit) spraakfuncties71. Een aanzienlijk aantal van deze akoestische kenmerken is minder gevoelig en enigszins robuust voor lawaaierige audio-opnamen die uiteindelijk in forensische of andere scenario's worden verzameld72. Bovendien kan de multidimensionale matrix worden toegepast op spraakherkenningssystemen via verschillende AI-technieken (in uitvoering). Het kan nog steeds heel nuttig zijn in het onderwijzen van prosodische aspecten in L2 uitspraakklassen21 (in uitvoering).

De statistische analyse van dit deel van het protocol vertegenwoordigt het gebruik van de GAM-methode, aangezien we te maken hadden met een complexe relatie tussen een specifiek akoestisch kenmerk en meerdere sprekers van taalfactoren. Om een specifiek akoestisch kenmerk te modelleren, was het bijvoorbeeld noodzakelijk om te controleren hoe andere akoestische kenmerken uit de matrix (de vlotte termen) zouden presteren, zodat we nauwkeuriger konden beschrijven wat er gebeurde tijdens spraakproductie.

Met betrekking tot de perceptieanalyse bestond het huidige protocol uit het voorbereiden en implementeren van de voice lineups, statistische analyse en akoestische gelijkenisanalyse. Om de lineups voor te bereiden, gebruikten we het CreateLineup-script voor Praat, dat automatisch een audiobestand genereert voor elke lineup met willekeurig gesequencede foils en doelstem zoals beschreven in protocolstappen 2.2 tot 2.2.1.9.

Voor de statistische analyse van dit protocol hebben we de Kruskal-Wallis niet-parametrische test uitgevoerd, aangezien onze gegevens niet voldeden aan de veronderstellingen van de analyse van variantie (ANOVA). Zodra we een relatie hadden tussen de beoordelingsscores beoordeeld door de luisteraars en gecontroleerd voor de doelstem en de foils, kozen we ervoor om de lineaire modelstatistieken te gebruiken.

Voor de akoestische gelijkenisanalyse gebruikten we het AcousticSmilarity_cosine_euclidean script voor Python. Het programma toont de directoryboom van de computer en vraagt de gebruiker om het bestand te kiezen dat de prosodische-akoestische kenmerken van de foils en de doelstem bevat die de lineup in analyse vormen. Met een klik op een knop genereert het script drie gelijkenismatrices: een cosinus-, een euclidische en een getransformeerde ( zero-to-one ) euclidische, op zowel '.txt' (tab-gescheiden) als '.csv' bestanden. We moeten nog steeds in gedachten houden dat elke dataset (het '.txt' bestand dat de prosodische-akoestische kenmerken van de foils en de doelstem bevat) in de originele folder van de lineup moet staan en elke lineup folder een kopie van het AcousticSmilarity_cosine_euclidean script moet hebben.

Kortom, het huidige protocol maakt vorderingen in het onderzoek naar (forensische) fonetica. Bestaande uit verschillende fasen - productie- en perceptieanalyses, evenals akoestische gelijkenis - overbrugt het de kloof tussen gegevensverzameling en multidimensionale akoestische-kenmerkanalyse. Onderzoekers kunnen profiteren van een holistische perspectief door zowel productie- als perceptieaspecten te verkennen. Bovendien zorgt dit protocol voor reproduceerbaarheid van onderzoek, waardoor anderen kunnen voortbouwen op de richtlijnen van dit werk.

Beperkingen en toekomstige richtingen
We moeten nog steeds in gedachten houden dat alles succesvol zal verlopen als de gegevensvoorbereiding de richtlijnen volgt die worden voorgesteld in protocolstappen 1.3.1 tot 1.3.4. Bovendien moeten we in de procedures voor geforceerde uitlijning bewust zijn dat een externe vooraf getrainde geforceerde uitlijner, zoals MAUS die in het huidige werk wordt gebruikt, vatbaar is voor segmentatiefouten, vooral bij niet-vooraf getrainde buitenlandse geaccentueerde gegevens of zelfs bij vooraf getrainde uitlijners, of het geluid geen goede kwaliteit heeft of de uitlijner de geluidstaal niet bevat (dit feit zou het werk van de expert moeilijker en tijdrovender maken). Forensische transcriptie, vooral van langere audiobestanden, stuit op moeilijkheden met betrekking tot de nauwkeurige en betrouwbare weergave van gesproken opnamen72.

Er zijn ook verschill

Openbaarmakingen

De auteurs hebben geen belangenconflicten te verklaren.

Dankbetuigingen

Deze studie werd ondersteund door de Nationale Raad voor Wetenschappelijke en Technologische Ontwikkeling - CNPq, subsidie nr. 307010/2022-8 voor de eerste auteur, en subsidie nr. 302194/2019-3 voor de tweede auteur. De auteurs willen hun oprechte dank uiten aan de deelnemers van dit onderzoek voor hun genereuze medewerking en onschatbare bijdragen.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
CreateLineupPersoonlijke verzameling#Script voor praat voor de voorbereiding van stemopstellingen
Dell I3 (met solid-state drive - SSD) Dell#Laptopcomputer
PraatPaul Boersma & David Weenink#Software voor fonetische analyse
Python 3Python Software Foundation#Geïnterpreteerde, hoogwaardige, algemene programmeertaal 
RThe R Project for Statistical Computing#Programmeertaal voor statistische berekeningen
Shure Beta SM7BShure#Microfoon
SpeechRhythmExtractorPersoonlijke verzameling#Script voor praat voor automatische extractie van akoestische kenmerken
SurveyMonkeySurveyMonkey Inc.#Verzameling gratis aanpasbare enquêtes, evenals een reeks back-end programma's die gegevensanalyse, steekproefselectie, debiasing en gegevensrepresentatie omvatten.
Tascam DR-100 MKIITascam#Digitale spraakrecorder
The Munich Automatic Segmentation System MAUSUniversity of Munich#Gedwongen-aligner van audio (.wav) en taalkundige informatie (.txt) bestanden
VVUnitAlignerPersoonlijke verzameling#Script voor praat voor automatische heralignering en nabewerking van fonetische eenheden

Referenties

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Herprints en machtigingen

Tags

Prosodische kenmerkenspraakperceptiestemkwaliteitgrondfrequentiesprekerherkenningakoestische gelijkenis