27 september 2024
Dit onderzoek had tot doel een vergelijking te maken tussen L1-L2-Engels en L1-L2 Portugees om te controleren hoeveel de invloed van een buitenlands accent verantwoordelijk is voor beide metrische en prosodische-akoestische parameters, evenals voor de keuze van de doelstem in een stemmenopstelling.
Ons onderzoek onderzoekt hoe een buitenlands accent de identificatie van de spreker beïnvloedde. We richten ons op prosodische kenmerken op basis van de fundamentele frequentie, namelijk de toonhoogte, duur en stemkwaliteit van de stem. Ons doel is om te begrijpen hoe deze functies van invloed zijn op het oordeel van luisteraars in stemopstellingen.
Er is steeds meer aandacht voor en onderzoek naar de prestaties van automatische sprekerherkenning, die automatisering toepast op de workflow van forensische sprekervergelijking. De informatie is echter als een zwarte doos voor forensische wetenschappers om te rapporteren aan de politie, rechters en juryleden. Automatische luidsprekerherkenningssystemen op basis van klassieke technieken zoals GMM, UBM-modellen en live acteurs.
Er is ook neuraal onderzoek op basis van kunstmatige intelligentie. We stellen een geautomatiseerde stroom voor die de taalkundige informatie bewaart die door de automatische spraakherkenningssystemen wordt gemist. Ons protocol maakt gebruik van een gecombineerde auditieve en akoestische benadering voor forensische spraakvergelijking, terwijl we landen vaststellen waar de wetenschap is ontwikkeld, maar met behulp van geautomatiseerde tools voor het extraheren van een breed scala aan akoestische kenmerken en voor het uitvoeren van akoestische gelijkenisprocedures.
Schrijf om te beginnen de taalkundige transcriptie voor elk audiobestand in een TXT-bestandsindeling. Tag het paar TXT- en WAV-bestanden met dezelfde naam. Maak een map voor elke L1- en L2-taal.
Zorg ervoor dat alle bestandsparen van dezelfde taal zich in dezelfde map bevinden. Ga naar de webinterface van Munich Automatic Segmentation forced aligner, sleep en zet elk paar WAV- en TXT-bestanden neer van de map naar de gestippelde rechthoek in bestanden. Klik op de uploadknop om de bestanden naar de aligner te uploaden.
Selecteer in het menu met serviceopties voor L1 L2 Engelse gegevens grafeem naar foneem naar muis naar telefoon naar lettergreep voor pijplijnnaam en Engels-US voor taal. Behoud de standaardopties voor het uitvoerformaat en bewaar alles. Vink het vakje voor de uitvoeroptie aan om de gebruiksvoorwaarden te accepteren.
Klik op de knop Webservice uitvoeren om de geüploade bestanden in de aligner uit te voeren. Nadat de bestanden zijn verwerkt, klikt u op de knop Downloaden als zip-bestand om de tekstrasterbestanden te downloaden. Pak de tekstrasterbestanden uit om ze later opnieuw uit te lijnen in fonetische analysesoftware.
Open en download het script voor PRAAT VVUnitAligner. Zorg ervoor dat alle bestandsparen van dezelfde taal en het VVUnitAligner-script zich in dezelfde map bevinden. Open de software voor fonetische analyse.
Klik in het objectvenster op Praat en open het Praat-script om het script te laden. Klik op de knop Uitvoeren en selecteer vervolgens de taal als Engels-VS. Selecteer nu in de segmentatieknop Automatisch.
Schakel de optie tekstrasterbestanden opslaan in om de nieuw gegenereerde tekstrasterbestanden automatisch op te slaan. Klik op de knoppen OK en Uitvoeren voor het opnieuw uitlijnen van de fonetische eenheden. Download vanaf de gegeven site het script voor het extraheren van spraakritmes voor automatische extractie van prosodische akoestische kenmerken.
Maak een nieuwe map en voeg het script voor het extractor van spraakritme toe, samen met alle audio-tekstrasterbestanden van alle talen. Open de software voor fonetische analyse. Klik in het objectvenster op Praat en open het Praat-script om het script te laden.
Klik vervolgens eenmaal op de knop Uitvoeren. Controleer de optie voor spraakkwaliteitsparameters om het uitvoerbestand VQ op te slaan voor spraakkwaliteit. Vink nu de taaldoeloptie aan om de taal te kiezen.
Vink vervolgens de eenheidsoptie aan om de F0-functies in halve tonen te kiezen. Stel de waarden voor de F0-drempel in, inclusief minimum- en maximumdrempels. Klik op OK, gevolgd door Uitvoeren voor de automatische extractie van akoestische functies.
Om gegeneraliseerde additieve modellen, niet-parametrische statistische analyse uit te voeren, typt u de aangegeven opdracht en uploadt u de spreadsheet met de geëxtraheerde akoestische kenmerken naar de R-omgeving. Druk ten slotte op enter om uit te voeren. De spreekfrequentie nam sneller af voor L1 L2 Engels in vergelijking met L1 L2 BP, die minder steile hellingen had vanwege een hogere lettergreepduur en lagere variabiliteit.
Lokale glans bleef relatief stabiel voor Braziliaanssprekenden, L1 BP en L2 Engels, ondanks toenemende variabiliteit van de lettergreepduur. Het pauzepercentage was hoger voor L2 BP-sprekers, met langere pauzes in vergelijking met L1-Engels-, L1-BP- en L2-Engelstaligen. De articulatiesnelheid werd op dezelfde manier beïnvloed als de spraaksnelheid, met lagere percentages geassocieerd met een hogere cognitieve taalbelasting en lettergreepvariatie.
De standaarddeviatie van de lettergreepduur nam af naarmate de spreeksnelheid op alle taalniveaus toenam. Varco van lettergrepen nam af voor L1 BP en L2 BP met toenemende F0-variabiliteit en spraaksnelheid, terwijl het toenam voor L1 Engels en L2 Engels. De standaarddeviatie van medeklinkers vertoonde een lagere variabiliteit in L1 BP naarmate de spreeksnelheid of pauzeduur toenam in vergelijking met L1 Engels.
De standaarddeviatie voor klinkers en medeklinkers volgde een dalingspatroon voor L1 BP en L2 BP, met toenemende prosodische kenmerken, terwijl deze afnam en vervolgens verzwakte voor L1 Engels en L2 Engels. Nadat je vier spraakopstellingen hebt voorbereid, elk voor Engels en BP, haal je de audiobestanden van de geselecteerde luidsprekers op en rangschik je ze in taalspecifieke mappen. Selecteer willekeurig zes stembrokken in L1 Engels of L1 BP. Kies vervolgens een stemchunk in L2 Engels of L2 BP uit een van de zes stemchunks.
Open en download het script voor Praat Create Lineup. Voordat u het script uitvoert, moet u ervoor zorgen dat de L2-referentiestem, L1-folies en L1-doelstem in dezelfde map worden geplaatst. Open de software voor fonetische analyse.
Klik in het objectvenster op Praat en open het Praat-script om het script te laden. Klik vervolgens op uitvoeren om het script voor het maken van een line-up uit te voeren. Typ in de R-omgeving de aangegeven opdracht om de Kruskal-Wallace-test uit te voeren.
Upload vervolgens de spreadsheet met de scores van de oordelen van de luisteraars en druk op enter. Typ vervolgens voor de post-hoc Dunn-test de volgende opdracht en druk op enter. Open en download het Python-script, Acoustic Similarity Cosine Euclidean.
Zorg ervoor dat het gedownloade script is opgeslagen in dezelfde map als de dataset voor spraakopstellingen. Klik op de knop Bestand openen om het script aan te roepen, klik vervolgens op Uitvoeren en Uitvoeren zonder foutopsporingsknoppen om het script uit te voeren. Voer ten slotte stemgelijkenistests uit op basis van akoestische kenmerken.
In BP-stemopstelling één werd foliestem drie beoordeeld als de doelstem, zonder significant verschil tussen folie drie en doelstem vier. In BP voice line-up twee werd geen significant verschil gevonden tussen target voice drie en foil vier. Zowel de cosinusovereenkomst als de Euclidische afstand vertoonden een sterke correlatie tussen folie drie en de doelstem in BP-opstelling één.
In BP line-up twee correleerden beide gelijkenisstatistieken sterk tussen folie vier en het doelwit.
Dit onderzoek bestudeert hoe een vreemd accent de sprekeridentificatie beïnvloedt, met de nadruk op prosodische kenmerken zoals stemtoonhoogte, duur en kwaliteit. De studie beoogt te begrijpen hoe deze kenmerken de oordelen van luisteraars in stemopstellingen beïnvloeden.
Kwantitatieve analyse van prosodisch-akoestische kenmerken in spraak met een buitenlands accent maakt een objectieve beoordeling van de identiteit van de spreker mogelijk, ter ondersteuning van R&D-pipelines voor forensisch onderzoek en beveiliging. De integratie van statistische modellering en metrieken voor akoestische gelijkenis verhoogt het voorspellingsvertrouwen bij stemgebaseerde identificatie, waardoor ambiguïteit bij kritieke beslismomenten wordt verminderd. Deze mogelijkheden zijn essentieel voor zakelijke workflows waarbij een robuuste, reproduceerbare vergelijking van sprekers ten grondslag ligt aan risicogestuurde portfoliobeslissingen.
Dit protocol integreert alles vanaf de vroege ontdekking van akoestische markers tot aan statistische validatie en screening, ter ondersteuning van workflows van hypothese-testen tot preklinische systeemevaluatie.