Methodenartikel

Fremdakzent und forensische Sprecheridentifikation in der Stimmenaufstellung: Der Einfluss akustischer Merkmale auf der Grundlage der Prosodie

1.5K Aufrufe

DOI:

10.3791/66313

27. September 2024

In diesem Artikel

Zusammenfassung

Diese Studie zielte darauf ab, einen Vergleich zwischen L1-L2-Englisch und L1-L2-Portugiesisch durchzuführen, um zu überprüfen, wie sehr der Effekt eines fremden Akzents sowohl für Metriken als auch für prosodisch-akustische Parameter sowie für die Wahl der Zielstimme in einer Stimmenaufstellung verantwortlich ist.

Zusammenfassung

Diese Forschung zielt darauf ab, sowohl die prosodisch-akustischen Merkmale als auch die Wahrnehmungskorrelate von Englisch mit ausländischem Akzent und brasilianischem Portugiesisch mit ausländischem Akzent zu untersuchen und zu überprüfen, wie die Produktion von ausländischen und einheimischen Akzenten durch die Sprecher mit der Wahrnehmung der Zuhörer korreliert. In der Methodik führten wir ein Sprachproduktionsverfahren mit einer Gruppe amerikanischer Sprecher des brasilianischen Portugiesisch L2 und einer Gruppe von brasilianischen Sprechern des L2-Englisch durch, sowie ein Sprachwahrnehmungsverfahren, bei dem wir Stimmaufstellungen für beide Sprachen durchführten. Für die statistische Analyse der Sprachproduktion führten wir generalisierte additive Modelle durch, um die Wirkung der Sprachgruppen auf jede Klasse (metrisch oder prosodisch-akustisch) von Merkmalen zu bewerten, die für den Glättungseffekt der Kovariate(n) der entgegengesetzten Klasse gesteuert wurden. Für die statistische Analyse der Sprachwahrnehmung führten wir einen Kruskal-Wallis-Test und einen Post-hoc-Dunn-Test durch, um den Einfluss der Stimmen der Aufstellungen auf die von den Zuhörern beurteilten Punktzahlen zu bewerten. Nichtsdestotrotz führten wir akustische (Stimm-)Ähnlichkeitstests auf der Grundlage von Kosinus- und euklidischen Abständen durch. Die Ergebnisse zeigten signifikante akustische Unterschiede zwischen den Sprachgruppen in Bezug auf die Variabilität des f0, die Dauer und die Stimmqualität. Für die Aufstellungen zeigten die Ergebnisse, dass prosodische Merkmale von f0, Intensität und Sprachqualität mit den wahrgenommenen Urteilen der Zuhörer korrelierten.

Einleitung

Der Akzent ist ein hervorstechender und dynamischer Aspekt der Kommunikation und Geläufigkeit, sowohl in der Muttersprache (L1) als auch in einer Fremdsprache (L2)1. Der fremde Akzent repräsentiert die phonetischen L2-Merkmale einer Zielsprache und kann sich (im Laufe der Zeit) als Reaktion auf die L2-Erfahrung des Sprechers, den Sprechstil, die Eingabequalität, die Exposition und andere Variablen ändern. Ein fremder Akzent kann als (skalare) Differenzgrad zwischen der von einem Fremdsprecher produzierten L2-Sprache und einem lokalen oder Referenzakzent der Zielsprache quantifiziert werden2,3,4,5.

Diese Arbeit zielt darauf ab, sowohl die prosodisch-akustischen Merkmale als auch die Wahrnehmungskorrelate von Englisch mit ausländischem Akzent und brasilianischem Portugiesisch mit ausländischem Akzent (BP) zu untersuchen, sowie zu überprüfen, inwiefern die Produktion von fremden und muttersprachlichen Akzenten durch die Sprecher mit der Wahrnehmung der Zuhörer korreliert. Frühere Forschungen im forensischen Bereich haben gezeigt, dass Vokale und Konsonanten bei der Identifizierung fremder Akzente entweder für eine Langzeitanalyse eines Individuums stabil sind (The Lo Case6) oder sich auf die hohe ID-Genauigkeit eines Sprechers beziehen (The Lindbergh Case7). Die Erforschung prosodisch-akustischer Merkmale auf der Grundlage von Dauer, Grundfrequenz (f0, d.h. dem akustischen Korrelat der Tonhöhe), Intensität und Stimmqualität (VQ) hat jedoch zunehmend an Aufmerksamkeit gewonnen8,9. Daher stellt die Wahl prosodisch-akustischer Merkmale in dieser Studie einen vielversprechenden Weg im Bereich der forensischen Phonetik dar8,10,11,12,13.

Die vorliegende Forschung wird durch Studien unterstützt, die sich mit fremden Akzenten als eine Form der Stimmverkleidung in forensischen Fällen befassen14,15, sowie bei der Vorbereitung von Stimmaufstellungen für die Sprechererkennung16,17. Zum Beispiel spielte die Sprechgeschwindigkeit eine wichtige Rolle bei der Identifizierung von Deutsch-, Italienisch-, Japanisch- und Brasilianisch-Sprechern des Englischen18,19,20,21,22. Neben der Sprechgeschwindigkeit fordern langfristige spektrale und f0-Merkmale L2-kompetente Sprecher mit der Vertrautheit mit der Zielsprache heraus, da das Gehirn und die kognitiven Grundlagen ein Defizit an Gedächtnis, Aufmerksamkeit und Emotionen aufweisen, was sich in der phonetischen Leistung des Sprechers während langer Sprechumdrehungen widerspiegelt23. Die Ansicht über ausländische Akzente im forensischen Bereich ist, dass die Definition dessen, was wirklich wie ein ausländischer Akzent klingt, stark von der Unvertrautheit des Zuhörers abhängt und nicht von einem nicht bis extremen Grad an Sprache mit fremdem Akzent24.

Im Wahrnehmungsbereich ist ein gängiges forensisches Werkzeug, das seit Mitte der 1990er Jahre zur Erkennung von Verbrechern verwendet wird, die Voice Lineup (auditive Erkennung), die analog zur visuellen Erkennung ist, die zur Identifizierung eines Täters an einem Tatort verwendet wird16,25. In einer Stimmenaufstellung wird die Stimme des Verdächtigen neben Folienstimmen präsentiert - Stimmen, die in soziolinguistischen Aspekten wie Alter, Geschlecht, geografischer Lage, Dialekt und kulturellem Status ähnlich sind - zur Identifizierung durch einen Ohrenzeugen. Der Erfolg oder Misserfolg einer Stimmenaufstellung hängt von der Anzahl der Stimmbeispiele und der Stichprobendauer ab25,26. Darüber hinaus wird bei realen Samples davon ausgegangen, dass sich die Audioqualität konsistent auf die Genauigkeit der Spracherkennung auswirkt. Eine schlechte Audioqualität kann die einzigartigen Eigenschaften einer Stimme verzerren27. Im Falle der Ähnlichkeit der Stimme können feine phonetische Details, die auf f0 basieren, den Zuhörer während der Spracherkennung verwirren28,29. Solche akustischen Merkmale gehen über f0 hinaus und umfassen Elemente der Dauer sowie spektrale Merkmale der Intensität und VQ30. Diese Betrachtung mehrerer prosodischer Merkmale ist im Zusammenhang mit dem forensischen Sprachvergleich von entscheidender Bedeutung, um eine genaue Sprecheridentifikation zu gewährleisten9,14,15,29,31.

Zusammenfassend lässt sich sagen, dass Studien in der forensischen Phonetik in den letzten Jahrzehnten einige Unterschiede in Bezug auf die Identifizierung ausländischer Akzente gezeigt haben. Einerseits scheint ein fremder Akzent den Prozess der Identifizierung eines Sprechers nicht zu beeinflussen32,33 (insbesondere, wenn der Sprecher mit dem ausländischen Zielakzent nicht vertraut ist34). Auf der anderen Seite gibt es Befunde in die entgegengesetzte Richtung12,34,35.

Protokoll

Diese Arbeit erhielt die Genehmigung eines Ethikkomitees für Humorforschung. Darüber hinaus wurde von allen an dieser Studie beteiligten Teilnehmern eine informierte Einwilligung zur Nutzung und Veröffentlichung ihrer Daten eingeholt.

1. Sprachproduktion

HINWEIS: Wir haben Sprache aus einer Lesetaufgabe sowohl von „L1 Englisch-L2 BP“, das von Gruppe 1 produziert wurde: den Amerikanischen Englisch-Sprechern (aus den USA) (AmE-S), als auch von „L1 BP-L2 Englisch“, das von Gruppe 2 produziert wurde: den Brasilianischen Sprechern (Bra-S), aufgezeichnet. Siehe Abbildung 1 für ein Flussdiagramm der Sprachproduktion.

figure-protocol-1
Abbildung 1: Schematischer Ablaufplan der Sprachproduktion. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

  1. Teilnehmer
    1. Bestimmen Sie die Anzahl der Teilnehmer, die Sprache (L1 Englisch, L2 BP; L1 BP, L2 Englisch), die Geschlecht (weiblich oder männlich), die Alter (Mittelwert, Standardabweichung), die Gruppeneigenschaften (Fachkräfte oder Studierende), und die L2-Profizienzniveau (fortgeschritten oder weit fortgeschritten) für jede Gruppe.
      HINWEIS: Für die vorliegende Studie wurden sowohl AmE-S als auch Bra-S als L2-begabt eingestuft (beide Gruppen wurden als B2-C1 qualifiziert)36). Die AmE-S hatten zwei Jahre lang in Brasilien gelebt, als die Untersuchungen durchgeführt wurden. Die Bra-S hatten mehr als zwei Jahre lang in den USA gelebt, als die Untersuchungen durchgeführt wurden. Während ihres Auslandsaufenthalts hatten beide Gruppen ihre Zweitsprache mindestens sechs Tage pro Woche für etwa 4–5 Stunden täglich zum Lernen und Arbeiten verwendet.
    2. Teilen Sie die Teilnehmer in einen ruhigen und komfortablen Raum ein und geben Sie den jeweiligen Gruppen das Lese material.
  2. Datenerfassung
    HINWEIS: Sprachdaten müssen mittels einer Leseaufgabe in den folgenden Sprachen erhoben werden: L1-Englisch und L2-BP; L1-BP und L2-Englisch. Lassen Sie die Teilnehmer die Texte gegebenenfalls vorab lesen.
    1. Aufnahmeverfahren
      1. Nehmen Sie die Sprachdaten an einem ruhigen Ort mit geeigneten akustischen Bedingungen auf.
      2. Verwenden Sie einen digitalen Diktiergerät (siehe das Tabelle der Materialien)37 und ein ungerichteter, elektromagnetisch isolierter Niere-Mikrofon (siehe die Materialienübersicht)38.
      3. Nehmen Sie die Audiodaten in '.wavForm.
      4. Stellen Sie die Abtastrate auf 48 kHz und die Quantisierungsrate auf 16 Bit ein.
        HINWEIS: Das Audioformat sowie die Konfiguration der Abtastraten und Quantisierungsraten, die in den Schritten 1.2.1.3 und 1.2.1.4 beschrieben sind, werden angewendet, um eine hohe Qualität und Rauschunterdrückung sicherzustellen und die spektralen Merkmale für die spätere akustische Analyse zu bewahren.
  3. Akustische Analyse
    HINWEIS: Teilen Sie die akustischen Analyseverfahren in drei Schritte ein: Forced Alignment, Neuausrichtung und Extraktion akustischer Merkmale.
    1. Schreiben Sie die sprachliche Transkription (in einer '.txt' Datei) für jede Audiodatei.
    2. Markieren Sie das Paar von '.txt'/'.wavDateien mit dem gleichen Namen (z. B. »my_file.wav'/ 'my_file.txt').
      HINWEIS: Um die Leistung des in Abschnitt 1.3.7 beschriebenen Verfahrens zu verbessern, wird dringend empfohlen, dass die ersten drei Zeichen der „.txt/.wav“-Datei-Tags die Sprache, Dialektoder Akzent, während die vierten bis sechsten Zeichen die Geschlecht (z. B., EL1FEM für EEnglisch L1 Weiblichale). Ab dem siebten Zeichen sollte der Benutzer die Sprechernummer angeben (z. B. 001 für den ersten Sprecher). Folglich ist das erste „.txt/.wav“-Paar EL1FEM001.
    3. Erstellen Sie einen Ordner für jede L1-L2-Sprache.
      HINWEIS: Ein Ordner für L1-L2 Englisch und ein Ordner für L1-L2 BP.
    4. Stellen Sie sicher, dass alle Dateipaare in derselben Sprache im selben Ordner enthalten sind.
    5. Führen Sie die erzwungene Ausrichtung durch.
      1. Greifen Sie auf die Web-Schnittstelle des Munich Automatic Segmentation (MAUS)-Forced-Aligners zu (WebMAUS39 bei https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Ziehen und legen Sie jedes Paar von .Welle / .txt Dateien aus dem Ordner auf das gestrichelte Rechteck in Dateien (oder klicken Sie innerhalb des Rechtecks, Abbildung 2A).
      3. Klicken Sie auf die Hochladen Schaltfläche, um die Dateien in den Aligner hochzuladen (siehe roter Pfeil in Abbildung 2A).
      4. Wählen Sie die folgenden Optionen in der Dienstleistungsoptionen Menü (Abbildung 2B): G2P-MAUS-PHO2SYL für Name der Pipeline; Englisch (US) (für Sprache) falls L1-L2-Englischdaten; Italienisch (IT) (für Sprache) falls L1-L2 BP-Daten.
        HINWEIS: Wir wählten „Italienisch“ für die BP-Daten, da webMAUS keine vortrainierten akustischen Modelle für die BP-Forced Alignment bereitstellt. Die phonetische Literatur zeigt, dass die italienische Phonologie ein vergleichbares, symmetrisches Sieben-Vokal-Inventar aufweist, ähnlich wie BP40sowie konsonantische akustische Ähnlichkeiten41,42.
      5. Belassen Sie die Standardoptionen für „Ausgabeformat“ und „Alles beibehalten“.
      6. Überprüfen Sie die Durchführen Optionsfeld zur Annahme der Nutzungsbedingungen (siehe grüner Pfeil in Abbildung 2C).
      7. Klicken Sie auf die Webdienst ausführen Schaltfläche, um die hochgeladenen Dateien im Aligner auszuführen.
        HINWEIS: Für jede Audiodatei liefert der MAUS-Forced-Aligner ein Praat TextGrid Objekt (eine Praat-vorformatierte „.txt“-Datei, die die Annotation von Wörtern, phonologischen Silben und Lauten basierend auf der linguistischen Transkription enthält, extrahiert aus der in Schritt 1.3.1 beschriebenen „.txt“-Datei).
      8. Klicken Sie auf die Herunterladen als ZIP-Datei Schaltfläche zum Herunterladen der TextGrid-Dateien als ZIP-Datei (Abbildung 2C).
        HINWEIS: Stellen Sie sicher, dass die komprimierten TextGrid-Dateien im selben Ordner wie die Audiodateien heruntergeladen werden.
      9. Extrahieren Sie die TextGrid-Dateien für eine spätere Neuausrichtung in der phonetischen Analyse-Software43.
    6. Führen Sie die Neuausrichtung durch.
      1. Zugriff auf und Herunterladen des Skripts für Praat VVUnitAligner44 aus https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat
      2. Bestätigen Sie, dass alle Dateipaare derselben Sprache und die VVUnitAligner Skript befinden sich im selben Ordner.
        HINWEIS: Ein Ordner für die L1-L2-Englisch-Dateien und den VVunitAligner sowie ein Ordner für die L1-L2-BP-Dateien und den VVunitAligner.
      3. Öffnen Sie die Software zur phonetischen Analyse.
      4. Klicken Sie Praat | Praat-Skript öffnen… um das Skript von der Objektfenster.
      5. Klicken Sie auf die Laufen einen Knopfdruck
        HINWEIS: Ein Formular namens Phonetische Silbenzuordnung in dem die Einstellungen zur Verwendung des Skripts angezeigt werden, erscheint auf dem Bildschirm (Abbildung 3A).
      6. Klicken Sie auf die Sprache Schaltfläche, um aus den Sprachen „Englisch (US)“, „Portugiesisch (BR)“, „Französisch (FR)“ oder „Spanisch (ES)“ zu wählen.
      7. Klicken Sie auf die Chunk-Segmentierung Schaltfläche, um zwischen den Segmentierungsverfahren „Automatisch“, „Erzwungen (manuell)“ oder „Keine“ zu wählen.
      8. Überprüfen Sie die TextGrid-Dateien speichern Option zum automatischen Speichern der neuen TextGrid-Dateien.
      9. Klicken Sie OK | Ausführen Schaltflächen zur Neuausrichtung der phonetischen Einheiten aus Schritt 1.3.5.7.
        HINWEIS: Für jede Audiodatei erstellt VVUnitAligner eine neue TextGrid-Datei für Abschnitt 1.3.7.Abbildung 3B).
    7. Führen Sie die automatische Extraktion der akustischen Merkmale durch.
      1. Zugriff auf das Skript SpeechRhythmExtractor und Herunterladen45 aus https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat zur automatischen Extraktion der prosodisch-akustischen Merkmale.
      2. Erstellen Sie einen neuen Ordner und fügen Sie SpeechRhythmExtractor zusammen mit allen Paaren von Audio- und TextGrid-Dateien aller Sprachen hinzu.
      3. Öffnen Sie die Software für die phonetische Analyse.
      4. Klicken Sie Praat | Praat-Skript öffnen… um das Skript von der Objektfenster.
      5. Klicken Sie auf die Durchführen Drücken Sie die Taste nur einmal.
        HINWEIS: Ein Formular mit den Skripteinstellungen wird auf dem Bildschirm angezeigt. Benennen Sie in den Feldern für die Namen der Ausgabedateien im Format '.txt' die Dateien entsprechend um oder belassen Sie die Standardnamen.
      6. Überprüfen Sie die Parameter der Stimmqualität Möglichkeit zum Speichern des Ausgabedatei VQ für die Stimmqualität (Abbildung 3C).
        HINWEIS: Diese zweite Ausgabedatei (die Ausgabedatei VQ) enthält die Parameter der Differenz zwischen der 1st und die 2nd Harmonische (H1-H2) und der zepstrale Prominenzpeak (CPP)9.
      7. Überprüfen Sie die Sprachliches Ziel Option, aus den Bezeichnungen „Sprache“, „Dialekt“ oder „Akzent“ auszuwählen (Abbildung 3C).
      8. Überprüfen Sie die Einheit Möglichkeit, die f0-Merkmale in Hz oder in Halbtönen auszuwählen (Abbildung 3C).
      9. Stellen Sie die Werte ein für F0-Schwellenwert, die minimalen und maximalen f0-Schwellenwerte (Abbildung 3C).
        HINWEIS: Sofern die Studie keine spezifischen Ziele verfolgt oder bestimmte Audioeigenschaften vorgibt, wird dringend empfohlen, die Parameter aus Schritt 1.3.7.9 bei den Standardwerten zu belassen.
      10. Klicken Sie Ok | Ausführen für die automatische Extraktion der akustischen Merkmale.
        HINWEIS: Das Skript SpeechRhythmExtractor gibt eine tabulatorgetrennte „.txt“-Datei aus (Ausgabedatei / Ausgabedatei VQ) die die aus den Sprachmustern der Sprecher extrahierten akustischen Merkmale enthalten.
  4. Statistische Analyse
    1. Laden Sie die Tabellenkalkulation mit den akustischen Merkmalen in das R hoch46 Umfeld (oder eine beliebige statistische Software/ein beliebiges statistisches Umfeld nach Wahl).
    2. Generalisierte additive Modelle (GAMs) mit nichtparametrischer Statistik durchführen.
      1. Führen Sie GAMs in R durch.
      2. Geben Sie die folgenden Befehle ein und drücken Sie Eingabe.
        library(mgcv)
        Modell = gam(the metrische/prosodisch-akustische Merkmale bei der Analyse ~ das Sprache + s(die ausgewählte metrisches Merkmal, durch = die Sprache) + andere metrische/prosodisch-akustische Merkmale, Daten = die Datenrahmen)
        HINWEIS: Wir haben uns entschieden, die statistischen Tests des Protokolls in der Programmiersprache R durchzuführen, da diese aufgrund ihrer wachsenden Beliebtheit bei Phonetikern (und Linguisten) in der akademischen Gemeinschaft zunehmend verwendet wird. R kommt in der phonetischen Feldforschung bereits weitgehend zum Einsatz.47. Beachten Sie, dass Schritt 1.4.2.2 einen Pseudocode enthält. Schreiben Sie den Code entsprechend den Forschungsvariablen.

figure-protocol-2
Abbildung 2: Bildschirmfoto der phonetischen Alignierung mit dem MAUS-Forced-Aligner. (A) Das gestrichelte Rechteck dient zum Ziehen und Ablegen von Dateien „my_file.wav“/„my_file.txt“ oder zum Anklicken, um solche Dateien aus dem Ordner zu suchen; der Upload-Button ist durch den roten Pfeil markiert. (B) Die hochgeladenen Dateien aus Panel A (siehe blauer Pfeil), die zu verwendende Pipeline, die Sprache für die Dateipaare, das gewünschte Rückgabeformat der Datei sowie ein „true/false“-Button zum Beibehalten aller Dateien. (C) Die Checkbox mit den Nutzungsbedingungen (siehe grüner Pfeil), die Schaltfläche Run Web Services und die Ergebnisse (herunterzuladende TextGrid-Dateien). Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

figure-protocol-3
Abbildung 3: Bildschirmfoto des Neuausrichtungsverfahrens. (A) Eingabeeinstellungsformular für das Neuausrichtungsverfahren. (B) Partielle Wellenform, Breitbandspektrogramm mit f0 (blau) Kontur und sechs segmentierten (und beschrifteten) Ebenen: Ebene 1: Einheiten von Vokalanfang bis zum nächsten Vokalanfang (V_to_V); Vokalanfang (V_to_V); Ebene 2: Einheiten von Vokal (V), Konsonant (C) und Pause (#); Ebene 3: phonische Darstellungen von V_to_V; Ebene 4: einige Wörter aus dem Text; Ebene 5: einige Sprachsegmente (CH) aus dem Text; Ebene 6: Tonhöhen-Ebene mit den höchsten (H) und tiefsten (L) Tönen jedes Sprachsegments, produziert von einer weiblichen AmE-S. (C) Eingabeeinstellungen für die automatische Extraktion der akustischen Merkmale. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

2. Sprachwahrnehmung

HINWEIS: Wir führten vier Sprach-Reihenvergleiche auf Englisch mit amerikanischen Hörern und vier Reihenvergleiche auf Portugiesisch (BP) mit brasilianischen Hörern durch. Siehe Abbildung 4 für ein Flussdiagramm zur Sprachwahrnehmung.

figure-protocol-4
Abbildung 4: Schematischer Ablaufplan zur Sprachwahrnehmung. Klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

  1. Teilnehmer
    1. Wählen Sie für jede Gruppe andere Teilnehmer als diejenigen aus, die am Sprachproduktionsprotokoll teilgenommen haben.
      HINWEIS: Für diesen Teil des Protokolls wurden zwei Gruppen von Teilnehmern ausgewählt: Gruppe 1: Der AmAmerikaner EEnglisch (aus den USA) LZuhörer (AmE-L) und Gruppe 2: Die Brazilian LHörer (Bra-L). Für die vorliegende Studie wurden sowohl AmE-L als auch Bra-L als L2-befähigt betrachtet (beide Gruppen verfügten über ein Niveau von B2-C1).36 Die AmE-L hatten zwei Jahre lang in Brasilien gelebt, als die Untersuchungen durchgeführt wurden. Die Bra-L hatten mehr als zwei Jahre lang in den USA gelebt, als die Untersuchungen durchgeführt wurden. Während ihres Auslandsaufenthalts hatten beide Gruppen ihre Zweitsprache (L2) zum Lernen und Arbeiten verwendet (mindestens sechs Tage pro Woche, etwa vier bis fünf Stunden täglich).
    2. Bestimmen Sie die Anzahl der Teilnehmer, die Sprache (L1 Englisch, L2 BP; L1 BP, L2 Englisch), das Geschlecht (weiblich oder männlich), die Alter (Mittelwert, Standardabweichung), das Gruppeneigenschaften (Fachkräfte oder Studierende) und die L2-Profizienzstufe für jede Gruppe
  2. Die Stimmvergleichslisten
    HINWEIS: Teilen Sie die Verfahren für Sprachmuster in zwei verschiedene Schritte auf: Vorbereitung und Durchführung der Sprachmuster.
    1. Bereiten Sie vier Stimmproben für Englisch und vier für BP vor.
      1. Holen Sie Audiodateien von den Sprechern aus Abschnitt 1: Sprachproduktion.
      2. Stellen Sie sicher, dass die Audiodateien jedes Sprachfaktors in separaten Ordnern vorliegen.
      3. Wählen Sie zufällig sechs Sprachabschnitte in L1 Englisch oder L1 BP aus.
        HINWEIS: Sechs Stimmen in der Aufstellung repräsentieren eine Zielstimme und fünf Folien.
      4. Wählen Sie einen Sprachabschnitt in L2-Englisch oder L2-BP von einem der in Schritt 2.2.1.3 enthaltenen Sprecher aus.
        HINWEIS: Der Sprachabschnitt in Schritt 2.2.1.4 ist der Referenzstimme. Die Abschnitte müssen ungefähr 20 s lang sein.8.
      5. Zugriff auf und Herunterladen des Skripts für Praat CreateLineup48 aus https://github.com/pabarbosa/prosody-scripts-CreateLineUp
      6. Stellen Sie sicher, dass die L2-Referenzstimme, die L1-Ablenkungsstimmen und die L1-Zielstimme im selben Ordner befinden, bevor Sie das Skript „CreateLineup“ ausführen.Abbildung 5).
      7. Öffnen Sie die Software für die phonetische Analyse.
      8. Aus dem Objektfenster, klicken Sie Praat | Praat-Skript öffnen… um das Skript aufzurufen.
      9. Klicken Sie Laufen | Laufen.
        HINWEIS: Das Skript gibt eine Datei in der folgenden Reihenfolge aus: (die L2-Referenzstimme) + (die L1-Zielstimme und die Foils in zufälliger Reihenfolge verteilt)Abbildung 5).
    2. Durchführung der Stimmaufnahmen
      1. Erstellen Sie einen Online-Bereich, um die Aufstellungen auf einer beliebigen Plattform Ihrer Wahl zu hosten (z. B. SurveyMonkey. Siehe das Tabelle der Materialien) zur Durchführung der Stimmenvergleiche aus der Ferne.
      2. Greifen Sie auf den Online-Space-Link zu.
      3. Laden Sie die von dem CreateLineup-Skript zurückgegebenen Dateien auf die Plattform hoch.
      4. Führen Sie das Verfahren vor den Teilnehmern durch, um jeden Schritt zu testen.
        HINWEIS: Es wird empfohlen, den Link vorab aufzurufen und die Line-ups auszuführen, um zu überprüfen, ob alles ordnungsgemäß funktioniert.
  3. Statistische Analyse
    1. Laden Sie die Tabellenkalkulation mit den Bewertungsergebnissen der Hörerurteile in die R-Umgebung (oder eine andere statistische Software/-Umgebung Ihrer Wahl) hoch.
      1. Führen Sie den Kruskal-Wallis-Test in R durch.
      2. Geben Sie die folgenden Befehle ein und drücken Sie Eingabe.
        ​model = kruskal.test(Urteile ~ jeweils Stimmenidentifikationsreihe, Daten = die Datenrahmen)
    2. Führen Sie einen post-hoc-Dunn-Test durch.
      1. Führen Sie den Dunn-Test in R durch.
      2. Geben Sie die folgenden Befehle ein und drücken Sie Eingabe.
        library(FSA)
        Modell = dunnTest(Urteile ~ jeweils Stimmenauswahl, Daten = Daten, Methode = "Bonferroni")
        HINWEIS: Die Codes in den Schritten 2.3.1.2 und 2.3.2.2 sind Pseudocodes (siehe HINWEIS 1.4.2.2).
  4. Akustische Ähnlichkeitsanalyse
    1. Wählen Sie die Lineups aus (vgl. HINWEIS in Schritt 2.2.1.3), die keine signifikanten Unterschiede zwischen dem Ziel und einer der Foils aufwiesen.
    2. Wiederholen Sie die Verfahren der Schritte 1.3.1 bis 1.3.7.5 sowie der Schritte 1.3.7.8 bis 1.3.7.10.
    3. Zugriff auf das Skript für Python und dessen Herunterladen49, AkustischeÄhnlichkeit_Kosinus_Euklidisch50 aus https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py
      HINWEIS: Das Skript gibt drei Matrizen (im '.txt'- und '.csv'-Format) zurück: eine für die Kosinus-Ähnlichkeit51,52, einer für die euklidische Distanz52,53und eine für transformierte euklidische Distanzwerte sowie einen paarweisen Vergleich zwischen der Zielstimme und jeder Irrelevanzstimme.
    4. Stellen Sie sicher, dass das Skript im selben Ordner wie der Lineup-Datensatz heruntergeladen wurde.
    5. Klicken Sie auf Datei öffnen… Schaltfläche, um das Skript aufzurufen.
    6. Klicken Sie Ausführen | Ausführen ohne Debuggen Knöpfe.
      HINWEIS: Der zweite Laufen Die Schaltfläche kann als Ausführen oder Ausführen ohne Debuggen oder Skript ausführen. Sie führen alle die gleichen Befehle aus. Es hängt einfach von der verwendeten Python-Umgebung ab.
    7. Führen Sie Tests zur Stimmähnlichkeit basierend auf akustischen Merkmalen durch.
      ​HINWEIS: Die Kosinus-Ähnlichkeit (oder der Kosinus-Abstand) ist eine in der Künstlichen Intelligenz (KI), insbesondere im maschinellen Lernen von Systemen zur automatischen Spracherkennung (ASR), angewandte Technik. Sie ist ein Maß für die Ähnlichkeit im Bereich von null bis eins. Eine Kosinus-Ähnlichkeit nahe bei eins bedeutet, dass zwei Stimmen wahrscheinlich ähnlich sind. Eine Kosinus-Ähnlichkeit nahe bei null bedeutet, dass die Stimmen wahrscheinlich unähnlich sind.52Die euklidische Distanz, oft auch als euklidische Ähnlichkeit bezeichnet, wird ebenfalls häufig in der künstlichen Intelligenz, im maschinellen Lernen und in der automatischen Spracherkennung (ASR) verwendet. Sie stellt die geradlinige Distanz zwischen zwei Punkten im euklidischen Raum dar.53, d. h., je näher die Punkte beieinander liegen (kürzere Distanzwerte), desto ähnlicher sind die Stimmen. Zur besseren Veranschaulichung der berichteten Ergebnisse beider Verfahren transformierten wir die Rohwerte der euklidischen Distanz in Werte von null (geringere Stimmähnlichkeit) bis eins (höhere Stimmähnlichkeit).54.

figure-protocol-5
Abbildung 5: Verzeichniseinrichtung für die Sprachwahrnehmung. Ordneranordnung. Jeder Ordner enthält sechs L1-Stimmen, die L2-Zielstimme, das „CreateLineup“-Skript und die Audiodatei mit der Stimmengruppe (wird nach Ausführung des Skripts zurückgegeben). Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Ergebnisse

Ergebnisse zur Sprachproduktion
In diesem Abschnitt beschrieben wir die Leistung der statistisch signifikanten prosodisch-akustischen Merkmale und Rhythmusmetriken. Zu diesen prosodischen Merkmalen gehörten Sprech-, Artikulations- und Pausenrate, die sich auf Dauer beziehen, sowie das Jitter, das mit der Stimmqualität zusammenhängt. Die Rhythmusmetriken umfassten die Standardabweichung (SD) der Silbendauer, die SD der Konsonantendauer, die SD der vokalischen oder konsonantischen Dauer sowie den Variationskoeffizienten der Silbendauer (siehe Ergänzende Tabelle S1).

Die Sprechgeschwindigkeit (Abbildung 6A) nimmt bei L1-L2-Englisch stärker ab als bei L1-L2-BP, obwohl die Geschwindigkeit für beide Zweitsprachen niedriger ist. Die Sprechgeschwindigkeit hängt mit drei Metriken zusammen – der Standardabweichung der Silbendauer (SD-S), der Standardabweichung der Vokale (SD-V) und dem Variationskoeffizienten der Silben (Varco-S). Es ist außerdem wichtig zu beachten, dass sowohl die AmE-S- als auch die Bra-S-Gruppe in ihren Zweitsprachen sprachlich kompetent sind. Anscheinend wird diese Geschwindigkeit durch die höheren Werte der Silbendauer und die geringere Variabilität beeinflusst, die von L1-L2-BP erzeugt werden, was zu flacheren Anstiegen führt.

Die Sprechgeschwindigkeit (Abbildung 6D) hängt mit SD-S, Varco-S sowie dem Silbenrhythmus-Verhältnis (RR-S) zusammen; letzteres stellt das Verhältnis zwischen kürzeren und längeren Silben dar. Solche Kenngrößen scheinen die Sprechgeschwindigkeit ebenso zu beeinflussen wie die betroffene Sprechtempo-Rate, bedingt durch Satzlänge und Variation der Dauer, was zu einer höheren Planungsleistung bei der Zweitsprache (L2) und einer erhöhten kognitiven Belastung bei L2 führt9,23,54. Im Bereich der Satzlänge könnte eine höhere kognitiv-linguistische Belastung erforderlich sein, wodurch prosodisch-akustische Parameter beeinflusst werden55.

Hinsichtlich der prosodisch-akustischen Merkmale von Sprache und Artikulationsgeschwindigkeit legen unsere Ergebnisse nahe, dass je stärker ein Sprecher die Dauer von Silben (und Vokalen) variiert, desto niedriger solche Raten sind. Wir vermuten, dass die Sprachwahrnehmung sowohl von BP als Erst- als auch als Zweitsprache etwas langsamer erscheint als von Englisch als Erst- und Zweitsprache und dass Englisch als Muttersprache schneller klingt als alle anderen Sprachebenen. Diese Tatsache könnte mit dem Sprachrhythmus zusammenhängen und mit der Hypothese, dass BP als Erst- und Zweitsprache eher dem silbengetakteten Pol der Rhythmuskontinuums zuneigt, während Englisch als Erst- und Zweitsprache eher zum akzentgetakteten Pol tendiert21,22.

Das Lokale Flimmern, Abbildung 6B, wird von SD-S und Varco-S beeinflusst. Für das lokale Flimmern zeigen sowohl die Produktionen von Bra-S als auch von L1-BP und L2-Englisch eine gewisse monotone Verlaufskurve, während die Variabilität der Silbendauer zunimmt (SD und Varco, siehe Ergänzende Tabelle S1). Die Wahrnehmung von stimmlicher Anstrengung könnte beim Hören der Produktionen von Bra-S erkennbar sein, da eine geringe Variation im Bereich von 8,5 bis 9 dB vorliegt. Die Sprache von Bra-S ist von der stimmlichen Belastung betroffen. L1-BP wird stark durch die Satzlänge beeinflusst und ist weniger empfindlich gegenüber hohen Variationen der Silbendauer (das BP-rhythmische Muster weist eine geringere silbische Variation auf22,56).

Die Pausenrate (Abbildung 6C) zeigt, dass Sprecher mit L2-Englisch längere Pausen (von 200 ms bis 375 ms) produzieren als die Sprecher mit L1-Englisch, L1-BP und L2-BP (Mittelwerte: 30 ms für L1-Englisch, 50 ms für L1-BP und 100 ms für L2-BP). Die Sprachplanung könnte in diesem Fall die L2-Englisch-Produktion aufgrund erhöhter Gehirnaktivität beeinträchtigt haben54,57. Es wird erwartet, dass eine höhere Sprachkompetenz zu einer größeren Lesegeschwindigkeit und einem größeren Leseumfang führt54; dennoch erforderten Lesetasks auch bei sprachlich versierten L2-Sprechern mehr Anstrengung in Bezug auf kognitive Aspekte höherer Ordnung bei der Fremdsprachverarbeitung und Sprachverarbeitung insgesamt54,57. Unsere Ergebnisse zeigen zumindest vorläufig, dass L2-BP-Sprecher durch Pausen möglicherweise weniger beeinträchtigt sind als L2-Englisch-Sprecher, was auf Unterschiede im rhythmischen Muster beider Sprachen zurückzuführen sein könnte.

figure-results-1
Abbildung 6: Verallgemeinerte additive Modelle für die prosodisch-akustischen Merkmale. Auf der Y-Achse die abhängige Variable (die zu modellierenden akustischen Merkmale); auf der X-Achse die Prädiktorvariablen (der Faktor „Sprache“ und die Kovariaten in den additiven Modellen, die die Form und die Trajektorien der Kurven liefern (d. h. die Glättungseffekte: „Sprache + Kovariaten“) sowie das Produkt aus dem Faktor „Sprache“ und einer metrischen Variablen, das eine genauere Projektion der abhängigen Variable ermöglicht (d. h. Faktor-Glättungs-Interaktionen: „Kovariate:Sprache“). Abkürzung: GAMs = Verallgemeinerte additive Modelle. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Im Hinblick auf die Rhythmusmetriken zeigen unsere Ergebnisse für SD-S (Abbildung 7A), dass je stärker ein Sprecher die f0-Kurve variiert und die Sprechgeschwindigkeit erhöht, desto stärker nimmt SD-S auf allen Sprachebenen ab (ein Spiegeleffekt zu Abbildung 6A). Im Fall der Standardabweichung für Konsonanten (SD-C, Abbildung 7C) weist L1-BP im Gegensatz zu L1-Englisch eine geringe Variation auf, wenn die Sprechgeschwindigkeit oder die Pausendauer zunehmen. Diese Richtung der SD lässt sich vorhersagen, da die Variabilität der Silbendauer im Englischen als Erstsprache (statistisch) signifikant höher ist als im brasilianischen Portugiesisch als Erstsprache44,58. Die Varco-S (Abbildung 7B und Ergänzende Tabelle S1) scheint teilweise mit der jeweiligen Erst- und Zweitsprache innerhalb derselben Sprachgruppe korreliert zu sein. Mit zunehmender f0-Variabilität und Sprechgeschwindigkeit nimmt die Varco-S bei L1-BP ab und scheint bei L2-BP abzunehmen und sich abzuschwächen. Bei den englischen Äußerungen nimmt die Varco-S hingegen mit steigender f0-Variabilität und Sprechgeschwindigkeit für L1-Englisch und L2-Englisch zu und schwächt sich ab.

Hinsichtlich der SD für Vokale oder Konsonanten (SD-V_C, Abbildung 7D und Ergänzungstabelle S1) zeigen unsere Ergebnisse einige Gemeinsamkeiten mit der Leistung von Varco-S (Abbildung 7B). Beispielsweise fördern eine höhere Sprechgeschwindigkeit, Pausendauer und f0-Variabilität eine fallende und anschließend ansteigende Trajektorie der SD-V_C bei L1-BP sowie bei L2-BP. Bei englischen Äußerungen nimmt die SD-V_C leicht ab, wenn solche prosodischen Merkmale stärker ausgeprägt sind, nimmt bei L1-Englisch leicht ab und schwächt sich ab, nimmt bei L2-Englisch leicht zu und schwächt sich anschließend ebenfalls ab. Die Korrelation zwischen Varco-S und SD-V_C innerhalb der L1-L2-Gruppen derselben Sprachgruppen könnte teilweise durch den Lombard-Effekt erklärt werden, der auf die Veränderung akustischer Parameter in der Sprache aufgrund von Hintergrundgeräuschen verweist59.

Bei fremdsprachlicher Sprache haben Sprecher je nach Komplexität der Aufgabe (z. B. gelesene Sprache) ähnliche akustische Strategien in L1 und L2 verwendet59,60. Einerseits zeigten Marcoux und Ernestus, dass f0-Maße (Bereich und Median) in der L2-Lombard-Sprache darauf hindeuten, dass Sprecher mit L2 Englisch von ihrer L1 Niederländisch beeinflusst wurden61,62. Andererseits legen neuere Befunde nahe, dass, obwohl erwartet wird, dass sich die L2-Lombard-Sprache aufgrund der höheren kognitiven Belastung beim Sprechen der L2 von der L1-Lombard-Sprache unterscheidet, Sprecher mit L2 Englisch Lombard-Sprache in dieselbe Richtung wie Sprecher mit L1 Englisch produzierten63. Inwieweit unsere Ergebnisse mit denen von Marcoux und Ernestus63 übereinstimmen und von Waaning59, Villegas et al.60 sowie Marcoux und Ernestus61,62 abweichen, bedarf weiterer Untersuchung.

figure-results-2
Abbildung 7: Verallgemeinerte additive Modelle für die metrischen Merkmale. Auf der Y-Achse die abhängige Variable (die zu modellierenden metrischen Merkmale); auf der X-Achse die Prädiktorvariablen (der Faktor „Sprache“ und die Kovariaten in den additiven Modellen, die die Form und die Verläufe der Kurven liefern (d. h. die Glättungseffekte: „Sprache + Kovariaten“) sowie das Produkt aus „Sprache“ und einem metrischen Merkmal, das eine genauere Projektion der abhängigen Variable ermöglicht (d. h. Faktor-Glättungs-Interaktionen: „Kovariate:Sprache“). Abkürzung: GAMs = Verallgemeinerte additive Modelle. Bitte klicken Sie hier, um eine vergrößerte Darstellung dieser Abbildung anzusehen.

Ergebnisse zur Sprachwahrnehmung
Im Zusammenhang mit den BP-Stimmenaufstellungen wurde in Aufstellung #1 (Abbildung 8A) die Stimme #3 als die gesuchte Stimme eingestuft. Tatsächlich war die gesuchte Stimme jedoch Stimme #4. Die Ergebnisse zeigen keinen statistisch signifikanten Unterschied (siehe ergänzende Tabelle S1) zwischen der falschen Stimme #3 (83 %) und der gesuchten Stimme #4 (71 %). In Aufstellung #2 (Abbildung 8B) zeigte ein Vergleich zwischen der gesuchten Stimme #3 (40 %) und der falschen Stimme #4 (20 %) ebenfalls keinen statistisch signifikanten Unterschied (siehe ergänzende Tabelle S1) bei den englischen Stimmenaufstellungen. In Aufstellung #1 (Abbildung 9A) bestand kein signifikanter Unterschied (siehe ergänzende Tabelle S1) zwischen der falschen Stimme #2 (26 %) und der gesuchten Stimme #4 (54 %).

Bei der Analyse der Stimmähnlichkeit zeigten sowohl die Kosinus-Ähnlichkeit (CoSim) als auch der euklidische Abstand (EucDist, [EucDist transformed]54) eine durchgängige Korrelation zwischen Falschstimme Nr. 3 und dem Ziel in der BP-Gruppe Nr. 1 (CoSim = 0,99; EucDist = 77,4, [0,93]). Die Korrelation zwischen Falschstimme Nr. 4 und dem Ziel war in der BP-Gruppe Nr. 2 ähnlich stark (CoSim = 0,99, EucDist = 76,3, [0,93]). In der englischen Gruppe Nr. 1 war die Korrelation für CoSim konsistent (0,83), jedoch schwach bis zufriedenstellend für EucDist (213,0, [0,47]). Insgesamt erwiesen sich sowohl CoSim als auch EucDist als zufriedenstellende Verfahren zur Bestimmung der Stimmähnlichkeit. Außerdem zeigte CoSim eine leicht höhere Effektivität, wie von Gahman und Elangovan52 erörtert (siehe Ergänzende Tabelle S1).

Hinsichtlich der Ähnlichkeit: Was könnte zu einer Zunahme falscher Alarme geführt haben? Prosodisch-akustische Merkmale zeigten Hinweise darauf, dass, obwohl die Stimmen der Distraktoren und die Zielpersonen (statistisch) signifikant unterschiedlich abschnitten – mit Ausnahme der in Abbildung 8A,B und Abbildung 9A dargestellten Reihen – die Auswahl der Hörer in den übrigen Reihen etwas stärker zwischen verschiedenen Distraktoren variierte (Abbildung 8C,D und Abbildung 9B-D). Eine solche Beurteilung scheint stärker von einem (oder möglicherweise mehreren) spezifischen akustischen Merkmal abzuhängen, das Sprecher gemeinsam haben, als von einer ganzen Klasse prosodisch-akustischer Merkmale. Beispielsweise wiesen unsere Daten mehrere (ko)variierende Merkmale zwischen den Äußerungen auf; dennoch zeigen die wahrnehmungsbasierten Ergebnisse eine Bevorzugung bestimmter Distraktoren, die der Stimme der Zielperson entsprechen8,35,64,65. Weitere Analysen sind in zukünftigen Arbeiten erforderlich.

Es ist bemerkenswert, die Wahl einer mehrdimensionalen parametrischen Matrix für die akustische Ähnlichkeit66, wie sie in dieser Studie vorgestellt wird, zu berücksichtigen. Unsere Ergebnisse stimmen mit früheren Studien überein, die akustische Merkmale basierend auf f0, VQ und Intensität verwendeten9,35. Solche Merkmale werden besonders für Sprechervergleichsaufgaben im forensischen Bereich empfohlen9,66. Es ist jedoch wichtig hervorzuheben, dass in der vorliegenden Untersuchung keiner der Foils als dem Zielstimme ähnlich vorhergesagt wurde, obwohl wir eine Variante der McFarlane-Richtlinien16,17 bei der Erstellung der Stimm-Listen für die Erkennung akzentuierter Sprecher angewandt haben. Darüber hinaus betonen wir, dass unser Verfahren zur Erstellung von Stimm-Listen wesentliche Unterschiede zu den McFarlane-Richtlinien aufweist, einschließlich der Stimuluslänge, der Anzahl der Stimmen, der Auswahl der Foils (hier randomisiert) und des Sprechstils.

Inwieweit prosodisch-akustische Merkmale von f0, Stimmqualität und Intensität mit der Wahrnehmung durch Hörer verbunden erscheinen, hängt stark von der im Forschungskontext verwendeten Sprechweise ab. Hier verwendeten wir Leseabschnitte. Die Mehrheit der Hörzeugenstudien entscheidet sich für (halb-)spontane Stimuli als ausgewogene Lösung – beispielsweise das DyVis-Korpus67 –, das in zahlreichen aktuellen Untersuchungen zu Hörzeugen ausführlich eingesetzt wurde28,68. Der Grund, warum wir uns für Lesetasks entschieden haben, liegt darin, dass unser Korpus zum Zeitpunkt der Abfassung dieses Manuskripts ausschließlich aus Daten bestand, die aus Lesetasks stammten. Es ist jedoch wichtig anzuerkennen, dass der Prozess der Zusammenstellung eines (halb-)spontanen Korpus bereits im Gange ist. Außerdem kann das Vorlesen einer Geschichte ein verlässliches Maß an Uniformität und Variation sowohl innerhalb als auch zwischen Sprechern erzeugen. Dies erleichtert die Betonung prosodischer oder phonetischer Merkmale – individueller oder dialektaler Art – in Situationen, in denen Stimmen verglichen werden. Dies zeigt sich besonders deutlich bei Belastungserscheinungen der Stimme während der Produktion eines Fremdakzents, selbst bei sprachlich versierten Sprechern 8,9,23,54.

figure-results-3
Abbildung 8: Balkendiagramme mit den Ergebnissen der vier Lineups, die von brasilianischen Zuhörern durchgeführt wurden. (A,B) Kein signifikanter Unterschied zwischen der Zielperson (in blau) und einer Fehlperson (in hellblau). (C,D) Signifikante Unterschiede gegenüber den Fehlpersonen und der Zielperson. Abkürzung: NS = nicht signifikant. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

figure-results-4
Abbildung 9: Balkendiagramme mit den Ergebnissen der vier Reihenfolgen, die von den amerikanischen Zuhörern durchgeführt wurden. (A) Nicht signifikanter Unterschied zwischen der Zielperson (in rot) und einer Fehlperson (in rosa). (B,C,D) Signifikante Unterschiede zwischen den Fehlpersonen und der Zielperson. Abkürzung: NS = nicht signifikant. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Ergänzungstabelle S1: Statistiken zur Sprachproduktion – Verallgemeinerte additive Modelle (GAMs): Die F-Statistiken (Freiheitsgrade), das adjustierte R2 jeder statistisch signifikanten prosodisch-akustischen Kenngröße (Abbildung 6) und Rhythmusmetrik (Abbildung 7) je Sprachebene sowie die individuellen Werte jedes Smooth-Terms (der Kovariaten). Statistiken zur Sprachwahrnehmung: Die Kruskall-Wallis-χ2-Statistiken (Freiheitsgrade), die p-Werte und das adjustierte η2 sowie ein post-hoc-Dunn-Test für paarweise Vergleiche (Abbildung 8 und Abbildung 9) jeder statistisch nicht signifikanten Differenz zwischen den Paaren von Ziel- und Foil-Stimmen (Abbildung 8A,B und Abbildung 9A). Akustische Ähnlichkeitsmatrizen für Kosinus- und euklidischen Abstand jeder Stichprobe. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Diskussion

Das aktuelle Protokoll stellt ein Novum auf dem Gebiet der (forensischen) Phonetik dar. Sie gliedert sich in zwei Phasen: eine auf der Produktion (akustische Analyse) und eine auf der Wahrnehmung basierende (Beurteilungsanalyse). Die Phase der Produktionsanalyse umfasst neben den Statistiken auch die Datenaufbereitung und die erzwungene Ausrichtung, die Neuausrichtung und die automatische Extraktion von prosodisch-akustischen Merkmalen. Dieses Protokoll verbindet die Phase der Datenerfassung schneller und effizienter mit der Datenanalyse als die traditionellen Protokolle, die auf einer überwiegend manuellen Segmentierung basieren.

Der in den Protokollschritten 1.3.6 bis 1.3.6.9 gezeigte Neuausrichtungsprozess funktioniert jedoch grundsätzlich mit den in den Protokollschritten 1.3.1 bis 1.3.4 generierten Telefon- und Word-Einheiten. Das Neue an der Neuausrichtung besteht darin, dass ein neues TextGrid generiert wird, das drei neue Textebenen enthält: eine Silbenebene, eine Sprachblockebene, die automatisch oder manuell auf der Grundlage von Wörtern generiert werden kann, und eine Tonebene, die für die Berechnung von f0-Maßen sehr nützlich sein kann. Die für dieses Protokoll vorgeschlagenen Neuausrichtungsrichtlinien wurden zuvor in Studien zum L2-Sprachrhythmus 21,69,70, Studien zur Erkennung des Fremdakzentgrades unter Verwendung von Techniken des maschinellen Lernens22 und Studien im forensischen Bereich 9 verwendet.

Die automatische Extraktion prosodischer Merkmale, die in den Protokollschritten 1.3.7 bis 1.3.7.10 vorgestellt wurde, erzeugt eine mehrdimensionale Matrix prosodisch-akustischer Merkmale, wie in der aktuellen Forschung nachgewiesen werden konnte. Zu diesen Merkmalen gehören melodische, dauerhafte und spektrale (Sprachqualität und -intensität) Sprachmerkmale71. Eine beträchtliche Anzahl dieser akustischen Merkmale ist weniger empfindlich und einigermaßen robust gegenüber verrauschten Audioaufnahmen, die schließlich in der Forensik oder in anderen Szenarien gesammelt werden72. Darüber hinaus kann die mehrdimensionale Matrix über verschiedene KI-Techniken auf Spracherkennungssysteme angewendet werden (work in progress). Es kann immer noch sehr nützlich sein, wenn es darum geht, prosodische Aspekte in den L2-Ausspracheklassen21 (in Arbeit) zu unterrichten.

Die statistische Analyse dieses Teils des Protokolls stellt die Verwendung der GAM-Methode dar, da wir uns mit einer komplexen Beziehung zwischen einem spezifischen akustischen Merkmal und mehreren Sprachfaktor-Sprechern befasst haben. Um beispielsweise ein bestimmtes akustisches Merkmal zu modellieren, war es notwendig, zu überprüfen, wie sich andere akustische Merkmale aus der Matrix (die glatten Terme) verhalten würden, damit wir genauer beschreiben konnten, was während der Sprachproduktion passierte.

Was die Wahrnehmungsanalyse betrifft, so wurde das aktuelle Protokoll durch die Vorbereitung und Implementierung der Stimmenaufstellungen, die statistische Analyse und die akustische Ähnlichkeitsanalyse erstellt. Um die Aufstellungen vorzubereiten, haben wir das CreateLineup-Skript für Praat verwendet, das automatisch eine Audiodatei für jede Aufstellung generiert, die zufällig sequenzierte Folien und Zielstimme enthält, wie in den Protokollschritten 2.2 bis 2.2.1.9 beschrieben.

Für die statistische Analyse dieses Protokolls haben wir den nicht-parametrischen Kruskal-Wallis-Test durchgeführt, da unsere Daten nicht den Annahmen der Varianzanalyse (ANOVA) entsprachen. Sobald wir eine Beziehung zwischen den von den Zuhörern bewerteten und kontrollierten Beurteilungswerten für die Zielstimme und die Foils hatten, entschieden wir uns für die Verwendung der linearen Modellstatistik.

Für die akustische Ähnlichkeitsanalyse haben wir das Skript AcousticSmilarity_cosine_euclidean für Python verwendet. Das Programm öffnet den Verzeichnisbaum des Computers und fordert den Benutzer auf, die Datei auszuwählen, die die prosodisch-akustischen Merkmale der Folien und die Zielstimme enthält, aus der sich die Aufstellung in der Analyse zusammensetzt. Mit einem Klick auf eine Schaltfläche generiert das Skript drei Ähnlichkeitsmatrizen: einen Kosinus, eine euklidische und eine transformierte (null zu eins) euklidische Matrize, sowohl für '.txt' (tabulatorgetrennte) als auch für '.csv'-Dateien. Wir müssen immer noch im Hinterkopf behalten, dass jeder Datensatz (die '.txt'-Datei mit den prosodisch-akustischen Merkmalen der Foils und des Ziels) sich im Originalordner der Aufstellung befinden muss, und jeder Aufstellungsordner muss eine Kopie des AcousticSmilarity_cosine_euclidean Skripts enthalten.

Zusammenfassend lässt sich sagen, dass das aktuelle Protokoll in der (forensischen) Phonetikforschung Fortschritte macht. Es besteht aus unterschiedlichen Phasen - Produktions- und Wahrnehmungsanalysen sowie akustischer Ähnlichkeit - und schließt die Lücke zwischen Datenerfassung und mehrdimensionaler akustischer Merkmalsanalyse. Forschende können von einer ganzheitlichen Perspektive profitieren, die sowohl Produktions- als auch Wahrnehmungsaspekte untersucht. Darüber hinaus gewährleistet dieses Protokoll die Reproduzierbarkeit der Forschung, so dass andere auf den Richtlinien dieser Arbeit aufbauen können.

Grenzen und zukünftige Richtungen
Wir müssen uns immer noch vor Augen halten, dass alles erfolgreich funktionieren wird, wenn die Datenaufbereitung den Richtlinien folgt, die in den Protokollschritten 1.3.1 bis 1.3.4 vorgeschlagen wurden. Außerdem müssen wir uns bei den Verfahren zur erzwungenen Ausrichtung darüber im Klaren sein, dass ein externer, vortrainierter Zwangs-Aligner, wie MAUS, der in der aktuellen Arbeit verwendet wird, anfällig für Segmentierungsfehler ist, insbesondere bei nicht vortrainierten Daten mit fremdem Akzent oder sogar bei vortrainierten Alignern, unabhängig davon, ob der Ton keine gute Qualität hat oder der Aligner die Audiosprache nicht enthält (diese Tatsache würde die Arbeit des Experten schwieriger und zeitaufwändiger machen). Die forensische Transkription, insbesondere von längeren Audiodateien, stößt auf Schwierigkeiten bei der genauen und zuverlässigen Wiedergabe von gesprochenen Aufzeichnungen72.

Es gibt auch einige Herausforderungen beim Transkribieren und Ausrichten längerer Audiodateien. Die Leistung der Aligner wird durch den Sprechstil und die phonetische Umgebung sowie durch dialektspezifische Faktoren beeinflusst. Obwohl es Aligner-spezifische Unterschiede gibt, ist ihre Leistung im Allgemeinen ähnlich und führt zu Segmentierungen, die sich gut mit der manuellen Ausrichtung insgesamt vergleichenlassen 73. Darüber hinaus wurden die englischen L1- und L2-Produktionen mit einem vortrainierten akustischen Modell des amerikanischen Englisch durchgeführt, da in MAUS keine ausländischen Sprachmodelle verfügbar waren. Darüber hinaus gibt es in MAUS keine vortrainierten akustischen Modelle für BP. Für die BP-Daten wurden die bereits vorhandenen akustischen Modelle des Italienischen verwendet (siehe ANMERKUNG, Protokollschritt 1.3.5.7).

In zukünftigen Arbeiten (in Arbeit) werden wir den Montreal Forced Aligner (MFA)74 als Teil des Protokolls verwenden. Ein großer Vorteil der MFA ist die Verfügbarkeit von vortrainierten akustischen Modellen und Graphem-zu-Phonem-Modellen für eine Vielzahl von Sprachen (einschließlich BP) sowie die Möglichkeit, neue akustische und Graphem-zu-Phonem-Modelle auf jeden neuen Datensatz (d. h. unser Sprachkorpus mit fremdem Akzent) zu trainieren75.

Offenlegungen

Die Autoren haben keine Interessenkonflikte anzugeben.

Danksagungen

Diese Studie wurde vom Nationalen Rat für wissenschaftliche und technologische Entwicklung - CNPq, Fördernummer 307010/2022-8 für den Erstautor und Fördernummer 302194/2019-3 für den Zweitautor unterstützt. Die Autoren möchten den Teilnehmern dieser Studie ihren aufrichtigen Dank für ihre großzügige Zusammenarbeit und ihre unschätzbaren Beiträge aussprechen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
CreateLineupPersonal collection#Skript für Praat zur Vorbereitung von Sprachaufstellungen
Dell I3 (mit Solid-State-Laufwerk - SSD) Dell#Laptop-Computer
PraatPaul Boersma & David Weenink#Software für phonetische Analyse
Python 3Python Software Foundation#Interpretierte, universelle Programmiersprache auf hohem Niveau 
RDas R-Projekt für statistisches Rechnen#Programmiersprache für stattistisches Rechnen
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorPersönliche Sammlung#Skript für Praat zur automatischen Extraktion von akustischen Merkmalen
SurveyMonkeySurveyMonkey Inc.#Zusammenstellung von kostenlosen, anpassbaren Umfragen sowie einer Suite von Backend-Programmen, die Datenanalyse, Stichprobenauswahl, Debiasing und Datendarstellung umfassen.
Tascam DR-100 MKIITascam#Digitaler Diktiergerät
Das automatische Segmentierungssystem München MAUSUniversität München#Forced-Aligner von Audio- (.wav) und linguistischen Informationsdateien (.txt)
VVUnitAlignerPersönliche Sammlung#Skript für Praat zur automatischen Neuausrichtung und Nachbearbeitung phonetischer Einheiten

Referenzen

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Nachdrucke und Genehmigungen

Tags

Prosodische MerkmaleSprachwahrnehmungStimmqualitätGrundfrequenzSprechererkennungakustische Ähnlichkeit