Article de méthode

Accent étranger et identification du locuteur médico-légal dans les alignements vocaux : l’influence des caractéristiques acoustiques basées sur la prosodie

1.5K vues

DOI :

10.3791/66313

27 septembre 2024

Dans cet article

Résumé

Cette recherche visait à faire une comparaison entre L1-L2-anglais et L1-L2 portugais afin de vérifier dans quelle mesure l’effet d’un accent étranger compte à la fois pour les métriques et les paramètres prosodiques-acoustiques, ainsi que pour le choix de la voix cible dans une gamme de voix.

Résumé

Cette recherche vise à examiner à la fois les caractéristiques prosodiques-acoustiques et les corrélats perceptifs de l'anglais avec un accent étranger et du portugais brésilien avec un accent étranger, et à vérifier comment les productions d'accents étrangers et natifs des locuteurs sont corrélées à la perception des auditeurs. Dans la méthodologie, nous avons mené une procédure de production de parole avec un groupe de locuteurs américains de portugais brésilien L2 et un groupe de locuteurs brésiliens de l’anglais L2, ainsi qu’une procédure de perception de la parole dans laquelle nous avons effectué des alignements vocaux pour les deux langues. Pour l’analyse statistique de la production de la parole, nous avons exécuté des modèles additifs généralisés pour évaluer l’effet des groupes de langues sur chaque classe (métrique ou prosodique-acoustique) des caractéristiques contrôlées pour l’effet de lissage de la ou des covariables de la classe opposée. Pour l'analyse statistique de la perception de la parole, nous avons effectué un test de Kruskal-Wallis et un test de Dunn post-hoc pour évaluer l'effet des voix des alignements sur les scores jugés par les auditeurs. Nous avons néanmoins effectué des tests de similarité acoustique (voix) basés sur les distances cosinus et euclidienne. Les résultats ont montré des différences acoustiques significatives entre les groupes linguistiques en termes de variabilité du f0, de durée et de qualité de la voix. Pour les alignements, les résultats ont indiqué que les caractéristiques prosodiques de f0, d'intensité et de qualité de la voix étaient corrélées aux jugements perçus par les auditeurs.

Introduction

L’accent est un aspect saillant et dynamique de la communication et de la fluidité, à la fois dans la langue maternelle (L1) et dans une langue étrangère (L2)1. L’accent étranger représente les caractéristiques phonétiques L2 d’une langue cible, et il peut changer (au fil du temps) en réponse à l’expérience L2 du locuteur, au style de parole, à la qualité de l’entrée, à l’exposition, entre autres variables. Un accent étranger peut être quantifié comme un degré (scalaire) de différence entre le discours L2 produit par un locuteur étranger et un accent local ou de référence de la langue cible2,3,4,5.

Cette recherche vise à examiner à la fois les caractéristiques prosodiques-acoustiques et les corrélats perceptifs de l'anglais avec un accent étranger et du portugais brésilien (BP) avec un accent étranger, ainsi qu'à vérifier dans quelle mesure les productions d'accents étrangers et natifs des locuteurs sont corrélées à la perception des auditeurs. Des recherches antérieures dans le domaine médico-légal ont démontré que la robustesse des voyelles et des consonnes dans l’identification des accents étrangers est soit stable pour une analyse à long terme d’un individu (The Lo Case6), soit se référant à la grande précision d’identification d’un locuteur (The Lindbergh Case7). Cependant, l’exploration des caractéristiques acoustiques prosodiques basées sur la durée, la fréquence fondamentale (f0, c’est-à-dire le corrélat acoustique de la hauteur), l’intensité et la qualité de la voix (VQ) a suscité de plus en plus d’attention 8,9. Ainsi, le choix des caractéristiques prosodiques-acoustiques dans cette étude représente une piste prometteuse dans le domaine de la phonétique médico-légale 8,10,11,12,13.

La présente recherche est soutenue par des études consacrées aux accents étrangers comme forme de déguisement de la voix dans les cas médico-légaux14,15, ainsi que dans la préparation des alignements vocaux pour la reconnaissance des locuteurs16,17. Par exemple, le débit de parole a joué un rôle important dans l’identification des locuteurs allemands, italiens, japonais et brésiliens de l’anglais18,19,20,21,22. Outre le débit de parole, les caractéristiques spectrales à long terme et f0 mettent au défi les locuteurs compétents en L2 avec la familiarité avec la langue cible, car le cerveau et les bases cognitives souffrent d'un déficit de mémoire, d'attention et d'émotion, ce qui se reflète dans les performances phonétiques du locuteur pendant les longs tours de parole23. Le point de vue sur les accents étrangers dans le domaine médico-légal est que la définition de ce qui ressemble vraiment à un accent étranger dépend beaucoup de la méconnaissance de l'auditeur plutôt que d'avoir un degré de discours avec accent étranger24.

Dans le domaine perceptuel, un outil médico-légal couramment utilisé depuis le milieu des années 1990 pour la reconnaissance des criminels est la Voice Lineup (reconnaissance auditive), qui est analogue à la reconnaissance visuelle utilisée pour identifier un auteur sur une scène de crime16,25. Dans une séance d'identification, la voix du suspect est présentée à côté de faire-valoir - des voix similaires sur le plan sociolinguistique tels que l'âge, le sexe, l'emplacement géographique, le dialecte et le statut culturel - pour être identifiée par un témoin auditif. Le succès ou l’échec d’une composition vocale dépend du nombre d’échantillons de voix et de la durée des échantillons25,26. De plus, pour les échantillons du monde réel, on considère que la qualité audio a un impact constant sur la précision de la reconnaissance vocale. Une mauvaise qualité audio peut déformer les caractéristiques uniques d’une voix27. Dans le cas d’une similitude vocale, des détails phonétiques fins basés sur f0 peuvent dérouter l’auditeur lors de la reconnaissance vocale 28,29. Ces caractéristiques acoustiques s’étendent au-delà de f0 et englobent des éléments de durée, ainsi que des caractéristiques spectrales d’intensité et de VQ30. Cette vue de plusieurs caractéristiques prosodiques est cruciale dans le contexte de la comparaison de voix médico-légales pour garantir une identification précise du locuteur 9,14,15,29,31.

En résumé, les études en phonétique médico-légale ont montré certaines variations concernant l’identification des accents étrangers au cours des dernières décennies. D’une part, un accent étranger ne semble pas affecter le processus d’identification d’un locuteur32,33 (surtout si le locuteur n’est pas familier avec l’accent étranger cible34). D’un autre côté, il y a des résultats dans la direction opposée 12,34,35.

Protocole

Ce travail a reçu l'approbation d'un comité d'éthique de la recherche sur les êtres humains. En outre, un consentement éclairé a été obtenu de la part de tous les participants à cette étude pour l'utilisation et la publication de leurs données.

1. Production de la parole

REMARQUE : Nous avons recueilli des échantillons de parole lors d'une tâche de lecture portant à la fois sur le « L1 anglais - L2 PB » produits par Groupe 1: Le Amaméricain Efrançais (des États-Unis d'Amérique) Shaut-parleurs (AmE-S), et sur les deux productions de « L1 BP-L2 anglais » réalisées par Groupe 2: Le Brazilian Shaut-parleurs (Bra-S). Voir Figure 1 pour un organigramme de la production du langage.

figure-protocol-1
Figure 1 : Organigramme schématique de la production du langage parlé. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

  1. Participants
    1. Déterminer le nombre de participants, le langue (L1 anglais, L2 BP ; L1 BP, L2 anglais), le sexe (femelle ou mâle), le âge (moyenne, écart type), le caractéristiques du groupe (professionnels ou étudiants universitaires), et le Niveau de compétence L2 (avancé ou très avancé) pour chaque groupe.
      REMARQUE : Pour la présente recherche, l'anglais américain (AmE-S) et le portugais brésilien (Bra-S) étaient considérés comme des langues secondes maîtrisées (les deux groupes ont été classés au niveau B2-C1).36). L'AmE-S avait vécu deux ans au Brésil au moment de la réalisation des procédures. Le Bra-S avait vécu plus de deux ans aux États-Unis au moment de la réalisation des procédures. Pendant leur séjour à l'étranger, les deux groupes parlaient leur L2 au moins 6 jours par semaine pendant environ 4 à 5 heures par jour, dans un but d'étude ou de travail.
    2. Répartir les participants dans une pièce confortable et calme et présenter le matériel de lecture pour chaque groupe.
  2. Collecte des données
    REMARQUE : Les données de parole doivent être collectées à partir d'une tâche de lecture dans les langues suivantes : L1-anglais et L2-BP ; L1-BP et L2-anglais. Permettez aux participants de lire les textes au préalable si nécessaire.
    1. Procédures d'enregistrement
      1. Enregistrez les données de parole dans un endroit calme présentant des conditions acoustiques appropriées.
      2. Utilisez un magnétophone numérique (voir le Table des matériels)37 et un microphone cardioïde unidirectionnel à isolation électromagnétique (voir le Table des matériels)38.
      3. Enregistrer les données audio dans '.wavforme.
      4. Configurer la fréquence d'échantillonnage à 48 kHz et la quantification à 16 bits.
        REMARQUE : Le format audio ainsi que la configuration des taux d'échantillonnage et de quantification décrits aux étapes 1.2.1.3 et 1.2.1.4 sont appliqués afin d'assurer une haute qualité et une réduction du bruit, préservant ainsi les caractéristiques spectrales utilisées lors de l'analyse acoustique ultérieure.
  3. Analyse acoustique
    REMARQUE : Diviser les procédures d'analyse acoustique en trois étapes : alignement forcé, réalignement et extraction des caractéristiques acoustiques.
    1. Rédigez la transcription linguistique (dans un 'txt' fichier) pour chaque fichier audio.
    2. Étiqueter la paire de '.txt'/'.wavdes fichiers portant le même nom (c'est-à-dire « my_file.onde'/ 'mon_fichier.txt').
      REMARQUE : Pour améliorer les performances de la procédure décrite à la section 1.3.7, il est fortement recommandé que les trois premiers caractères des balises de fichiers « .txt/.wav » représentent le Langue, Dialecte, ou Accent, tandis que les quatrième à sixième caractères indiquent le Sexe (par exemple, EL1FEM pour Eanglais L1 Femelleale). À partir du septième caractère, l'utilisateur doit indiquer le numéro du locuteur (par exemple, 001 pour le premier intervenant). Par conséquent, la première paire « .txt/.wav » est EL1FEM001.
    3. Créez un dossier pour chaque langue L1-L2.
      REMARQUE : Un dossier pour l'anglais L1-L2 et un dossier pour le BP L1-L2.
    4. Vérifiez que toutes les paires de fichiers de la même langue se trouvent dans le même dossier.
    5. Effectuez l'alignement forcé.
      1. Accéder à l'interface web du système d'alignement forcé Munich Automatic Segmentation (MAUS)webMAUS39 à https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Glissez et déposez chaque paire de .onde / .txt fichiers à partir du dossier au rectangle en pointillés dans Fichiers (ou cliquez à l'intérieur du rectangle, Figure 2A).
      3. Cliquez sur le bouton Téléverser bouton pour téléverser les fichiers dans l'aligneur (voir flèche rouge dans Figure 2A).
      4. Sélectionnez les options suivantes dans le Options de service menu (Figure 2B): G2P-MAUS-PHO2SYL pour Nom du pipeline ; anglais (États-Unis) (pour Langue) si Données L1-L2 en anglais; Italien (IT) (pour Langue) si Données de pression artérielle L1-L2.
        REMARQUE : Nous avons choisi l'« italien » pour les données du portugais brésilien (BP) car webMAUS ne propose pas de modèles acoustiques préentraînés pour l'alignement forcé du BP. La littérature phonétique indique que la phonologie de l'italien possède un inventaire de sept voyelles relativement symétrique, comparable à celui du BP.40, ainsi que des similitudes acoustiques consonantiques41,42.
      5. Conserver les options par défaut pour « Format de sortie » et « Conserver tout ».
      6. Vérifiez le Exécuter zone de sélection pour accepter les conditions d'utilisation (voir la flèche verte dans Figure 2C).
      7. Cliquez sur le bouton Service Web d'exécution bouton pour exécuter les fichiers téléchargés dans l'aligneur.
        REMARQUE : Pour chaque fichier audio, l'aligneur MAUS renvoie un fichier Praat TextGrid objet (un fichier « .txt » préformaté pour Praat contenant l'annotation des mots, des syllabes phonologiques et des phonèmes, basée sur la transcription linguistique extraite du fichier « .txt » décrit à l'étape 1.3.1).
      8. Cliquez sur le Télécharger en tant que fichier ZIP bouton pour télécharger les fichiers TextGrid sous forme de fichier compresséFigure 2C).
        REMARQUE : Veillez à télécharger les fichiers TextGrid compressés dans le même dossier que les fichiers audio.
      9. Extraire les fichiers TextGrid pour un réalignement ultérieur dans le logiciel d'analyse phonétique43.
    6. Effectuez la réalignement.
      1. Accéder au script et le télécharger pour Praat VVUnitAligner44 de https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat
      2. Certifiez que toutes les paires de fichiers de la même langue et le VVUnitAligner les scripts se trouvent dans le même dossier.
        REMARQUE : Un dossier pour les fichiers anglais L1-L2 et le VVunitAligner, et un dossier pour les fichiers L1-L2 BP et le VVunitAligner.
      3. Ouvrir le logiciel d'analyse phonétique.
      4. Cliquez Praat | Ouvrir le script Praat… appeler le script à partir du fenêtre de l'objet.
      5. Cliquez sur le bouton Exécuter appuyez une fois sur le bouton.
        REMARQUE : Un formulaire appelé Alignement phonétique des syllabes contenant les paramètres pour utiliser le script apparaîtra à l'écran (Figure 3A).
      6. Cliquez sur le bouton Langue bouton pour choisir parmi les langues « anglais (États-Unis) », « portugais (BR) », « français (FR) » ou « espagnol (ES) ».
      7. Cliquez sur le bouton Segmentation en morceaux bouton pour choisir entre les procédures de segmentation « Automatique », « Forcée (manuelle) » ou « Aucune ».
      8. Vérifiez le Enregistrer les fichiers TextGrid option d'enregistrer automatiquement les nouveaux fichiers TextGrid.
      9. Cliquez Ok | Exécuter boutons pour une réalignement des unités phonétiques de l'étape 1.3.5.7
        REMARQUE : Pour chaque fichier audio, VVUnitAligner générera un nouveau fichier TextGrid pour la section 1.3.7Figure 3B).
    7. Effectuer l'extraction automatique des caractéristiques acoustiques.
      1. Accéder au script SpeechRhythmExtractor et le télécharger45 de https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat pour l'extraction automatique des caractéristiques prosodiques-acoustiques.
      2. Créez un nouveau dossier et placez-y SpeechRhythmExtractor ainsi que toutes les paires de fichiers audio/TextGrid de toutes les langues.
      3. Ouvrez le logiciel d'analyse phonétique.
      4. Cliquez Praat | Ouvrir le script Praat… appeler le script à partir du fenêtre de l'objet.
      5. Cliquez sur le bouton Exécuter appuyer sur le bouton une seule fois
        REMARQUE : Un formulaire contenant les paramètres du script apparaîtra à l'écran. Dans les champs correspondant aux noms de fichiers de sortie '.txt', renommez les fichiers en conséquence ou conservez les noms par défaut.
      6. Vérifiez le paramètres de qualité vocale option d'enregistrer le Fichier de sortie VQ pour la qualité vocale (Figure 3C).
        REMARQUE : Ce deuxième fichier de sortie (le Fichier de sortie VQ) contient les paramètres de la différence entre le 1st et le 2nd harmoniques (H1-H2) et le pic de prominente cepstrale (CPP)9.
      7. Vérifiez le Cible linguistique option de choisir parmi les libellés « Langue », « Dialecte » ou « Accent » (Figure 3C).
      8. Vérifiez le Unité option de choisir les caractéristiques de f0 en Hz ou en demi-tons (Figure 3C).
      9. Configurer les valeurs pour seuil F0, les seuils minimum et maximum de f0Figure 3C).
        REMARQUE : Sauf si la recherche a des objectifs spécifiques ou des caractéristiques audio prédéfinies, il est fortement recommandé de conserver les paramètres de l'étape 1.3.7.9 aux valeurs par défaut.
      10. Cliquez Ok | Exécuter pour l'extraction automatique des caractéristiques acoustiques.
        REMARQUE : Le script SpeechRhythmExtractor renvoie un fichier '.txt' délimité par des tabulations (Fichier de sortie / Fichier de sortie VQ) contenant les caractéristiques acoustiques extraites des locuteurs.
  4. Analyse statistique
    1. Téléversez le tableur contenant les caractéristiques acoustiques dans R46 environnement (ou tout autre logiciel/environnement statistique au choix).
    2. Effectuer des analyses statistiques non paramétriques à l'aide de modèles additifs généralisés (GAM).
      1. Effectuer des GAMs dans R.
      2. Saisissez les commandes suivantes et appuyez sur Entrer.
        library(mgcv)
        modèle = gam(le caractéristique métrique/prosodique-acoustique dans l'analyse ~ le Langue + s(le choix effectué caractéristique métrique, par = le Langue) + autres caractéristiques métriques/prosodiques-acoustiques, données = le trame de données)
        REMARQUE : Nous avons choisi d'effectuer les analyses statistiques du protocole en langage de programmation R en raison de sa popularité croissante parmi les phonéticiens (et les linguistes) dans la communauté universitaire. R est largement utilisé dans la recherche en phonétique sur le terrain47. Garder à l'esprit que l'étape 1.4.2.2 contient un pseudo-code. Écrire le code en fonction des variables de recherche.

figure-protocol-2
Figure 2 : Capture d'écran de l'alignement phonétique à l'aide de l'aligneur forcé MAUS. (A) Le rectangle en pointillés sert à glisser-déposer les fichiers 'my_file.wav'/'my_file.txt' ou à cliquer à l'intérieur pour rechercher ces fichiers dans le dossier ; le bouton de téléchargement est indiqué par la flèche rouge. (B) Les fichiers téléchargés depuis le panneau A (voir flèche bleue), le pipeline à utiliser, la langue des paires de fichiers, le format de fichier à renvoyer, et un bouton « vrai/faux » pour conserver tous les fichiers. (C) Les conditions d'utilisation sous forme de cases à cocher (voir flèche verte), le bouton Exécuter les services web, et les résultats (fichiers TextGrid à télécharger). Veuillez cliquer ici pour afficher une version agrandie de cette figure.

figure-protocol-3
Figure 3 : Capture d'écran de la procédure de réalignement. (A) Formulaire des paramètres d'entrée pour la procédure de réalignement. (B) Forme d'onde partielle, spectrogramme large bande avec contour de f0 (en bleu) et six niveaux segmentés (et étiquetés) comme suit : tier 1 : unités allant du début d'une voyelle au début de la voyelle suivante (V_to_V) ; début de voyelle (V_to_V) ; tier 2 : unités de voyelle (V), de consonne (C) et de pause (#) ; tier 3 : représentations phoniques V_to_V ; tier 4 : certains mots extraits du texte ; tier 5 : certains groupes (CH) d'énoncés extraits du texte ; tier 6 : niveau tonal contenant le ton le plus élevé (H) et le ton le plus bas (L) de chaque groupe d'énoncé produit par une locutrice anglophone américaine. (C) Paramètres d'entrée pour l'extraction automatique des caractéristiques acoustiques. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

2. Perception de la parole

REMARQUE : Nous avons réalisé quatre séries d'identification vocale en anglais avec des auditeurs américains et quatre séries en portugais brésilien (BP) avec des auditeurs brésiliens. Voir Figure 4 pour un organigramme de la perception de la parole.

figure-protocol-4
Figure 4 : Organigramme schématique de la perception de la parole. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

  1. Participants
    1. Choisir des participants différents pour chaque groupe par rapport à ceux qui ont participé au protocole de production de la parole.
      REMARQUE : Deux groupes de participants ont été sélectionnés pour cette partie du protocole : Groupe 1: Le Amaméricain Eanglais (des États-Unis d'Amérique) Lécouteurs (AmE-L), et Groupe 2: Le Brazilian Lauditeurs (Bra-L). Pour la présente recherche, les AmE-L et les Bra-L ont tous deux été considérés comme des locuteurs compétents en L2 (les deux groupes ont été classés au niveau B2-C1)36 L'AmE-L avait vécu deux ans au Brésil au moment de la réalisation des procédures. Le Bra-L avait vécu plus de deux ans aux États-Unis au moment de la réalisation des procédures. Pendant leur séjour à l'étranger, les deux groupes utilisaient couramment leur L2 à des fins d'étude et de travail (au moins six jours par semaine, environ 4 à 5 heures par jour).
    2. Déterminer le nombre de participants, le langue (L1 anglais, L2 BP ; L1 BP, L2 anglais), le sexe (femelle ou mâle), le âge (moyenne, écart type), le caractéristiques du groupe (professionnels ou étudiants de premier cycle) et les Niveau de compétence L2 pour chaque groupe.
  2. Les séries vocales
    REMARQUE : Diviser les procédures des séries vocales en deux étapes distinctes : la préparation et la réalisation des séries vocales.
    1. Préparez quatre séries vocales en anglais et quatre en BP.
      1. Obtenir les fichiers audio des locuteurs de la section 1 : Production de la parole.
      2. Vérifiez que les fichiers audio de chaque facteur linguistique se trouvent dans des dossiers séparés.
      3. Choisir au hasard six extraits vocaux en anglais langue maternelle ou en portugais brésilien langue maternelle.
        REMARQUE : Six voix dans la séquence représentent une voix cible et cinq feuilles métalliques.
      4. Sélectionnez un segment vocal en anglais L2 ou en portugais brésilien L2 parmi les locuteurs inclus à l'étape 2.2.1.3.
        REMARQUE : Le fragment vocal de l'étape 2.2.1.4 est le voix de référence. Les fragments doivent avoir une durée d'environ 20 s.
      5. Accéder et télécharger le script pour Praat CreateLineup48 de https://github.com/pabarbosa/prosody-scripts-CreateLineUp
      6. Vérifiez que la voix de référence L2, les voix distractrices L1 et la voix cible L1 se trouvent dans le même dossier avant d'exécuter le script CreateLineup (Figure 5).
      7. Ouvrir le logiciel d'analyse phonétique.
      8. À partir de fenêtre de l'objet, cliquer Praat | Ouvrir le script Praat… pour appeler le script.
      9. Cliquez Exécuter | Exécuter.
        REMARQUE : Le script renvoie un fichier dans l'ordre suivant : (la voix de référence L2) + (la voix cible L1 et les voix distractrices réparties aléatoirement)Figure 5).
    2. Exécution des alignements vocaux
      1. Créer un espace en ligne pour héberger les listes sur la plateforme de son choix (par exemple, SurveyMonkey. Voir le Table des matériels) pour la réalisation à distance des confrontations auditives.
      2. Accédez au lien de l'espace en ligne.
      3. Téléversez les fichiers renvoyés par le script CreateLineup sur la plateforme.
      4. Exécuter la procédure devant les participants afin de tester chaque étape.
        REMARQUE : Il est recommandé d'accéder préalablement au lien et d'exécuter les séquences pour vérifier que tout fonctionne normalement.
  3. Analyse statistique
    1. Téléversez le classeur contenant les scores des évaluations des auditeurs dans l'environnement R (ou tout autre logiciel/environnement statistique de votre choix).
      1. Effectuer le test de Kruskal-Wallis dans R.
      2. Saisissez les commandes suivantes et appuyez sur Entrer.
        ​model = kruskal.test(jugements ~ chacun alignement vocal, données = le trame de données)
    2. Effectuer un test post-hoc de Dunn.
      1. Effectuer le test de Dunn dans R.
      2. Saisissez les commandes suivantes et appuyez sur Entrer.
        library(FSA)
        model = dunnTest(jugements ~ chacun alignement vocal, données = données, méthode = "bonferroni")
        REMARQUE : Les codes aux étapes 2.3.1.2 et 2.3.2.2 sont des pseudo-codes (voir REMARQUE 1.4.2.2).
  4. Analyse de la similarité acoustique
    1. Sélectionner les alignements (cf. NOTE à l'étape 2.2.1.3) qui présentaient des différences non significatives entre la cible et l'un des témoins.
    2. Répéter les procédures des étapes 1.3.1 à 1.3.7.5, ainsi que des étapes 1.3.7.8 à 1.3.7.10.
    3. Accéder au script et le télécharger pour Python49, Similarité_acoustique_cosinus_euclidienne50 de https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py
      REMARQUE : Le script renvoie trois matrices (au format « .txt » et « .csv ») : une pour la similarité cosinus51,52, une pour la distance euclidienne52,53, et une pour les valeurs de distance euclidienne transformée, ainsi qu'une comparaison par paires entre la voix cible et chaque voix distrayante.
    4. Vérifiez que le script est téléchargé dans le même dossier que le jeu de données d'alignement.
    5. Cliquez sur Ouvrir le fichier… bouton pour appeler le script.
    6. Cliquez Exécuter | Exécuter sans débogage boutons
      REMARQUE : Le deuxième Exécuter le bouton peut être marqué comme Exécuter ou exécuter sans débogage ou Exécuter le script. Ils exécutent tous les mêmes commandes. Cela dépend simplement de l'environnement Python utilisé.
    7. Effectuer des tests de similarité vocale fondés sur des caractéristiques acoustiques.
      ​REMARQUE : La similarité cosinus (ou distance cosinus) est une technique appliquée en intelligence artificielle (IA), particulièrement dans l'apprentissage automatique des systèmes de reconnaissance automatique de la parole (ASR). Il s'agit d'une mesure de similarité comprise entre zéro et un. Une similarité cosinus proche de un indique que deux voix sont très probablement similaires. Une similarité cosinus proche de zéro indique que les voix sont très probablement dissemblables.52La distance euclidienne, souvent appelée similarité euclidienne, est également largement utilisée en intelligence artificielle, en apprentissage automatique et en reconnaissance automatique de la parole (ASR). Elle représente la distance en ligne droite entre deux points dans un espace euclidien.53, c'est-à-dire que plus les points sont proches (valeurs de distance plus faibles), plus les voix sont similaires. Pour une compréhension plus claire des résultats rapportés par les deux techniques, nous avons transformé les scores bruts de distance euclidienne en valeurs allant de zéro (moindre similarité des voix) à un (plus grande similarité des voix)54.

figure-protocol-5
Figure 5 : Configuration du répertoire pour la perception de la parole. Dossiers des séries vocales. Chaque dossier contient six voix en langue maternelle (L1), la voix cible en langue seconde (L2), le script « CreateLineup », et le fichier audio de la série vocale (généré après l'exécution du script). Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Résultats

Résultats pour la production de la parole
Dans cette section, nous avons décrit la performance des caractéristiques prosodiques-acoustiques et des métriques rythmiques statistiquement significatives. Ces caractéristiques prosodiques comprenaient les débits de parole, d'articulation et de pauses, qui sont liés à la durée, ainsi que le scintillement (shimmer), qui est lié à la qualité vocale. Les métriques rythmiques étaient l'écart type (SD) de la durée des syllabes, l'écart type des consonnes, l'écart type de la durée vocale ou consonantique, et le coefficient de variation de la durée des syllabes (voir le Tableau supplémentaire S1).

Le rythme de parole (Figure 6A) diminue plus rapidement pour le passage de l'anglais L1 à l'anglais L2 que pour le passage du portugais L1 au portugais L2, bien que le rythme soit inférieur pour les deux L2. Le rythme de parole est lié à trois paramètres — l'écart type de la durée des syllabes (SD-S), l'écart type des voyelles (SD-V) et le coefficient de variation syllabique (Varco-S). Il est également important de noter que les groupes AmE-S et Bra-S maîtrisent tous deux leur L2. Il semble que ce rythme soit influencé par les valeurs plus élevées de la durée des syllabes et la variabilité plus faible produite par les locuteurs de L1-L2 BP, entraînant des pentes moins accentuées.

Le t aux d'articulation (Figure 6D) est lié au SD-S, au Varco-S, ainsi qu'au rapport de rythme syllabique (RR-S) ; ce dernier représente le rapport entre les syllabes plus courtes et plus longues. Ces métriques semblent influencer le taux d'articulation de la même manière que le taux de parole est affecté par la longueur des phrases et les variations de durée, entraînant une planification accrue de la parole en L2 et une charge cognitive en L29,23,54. Une charge cognitivo-linguistique plus élevée peut être requise dans le domaine de la longueur des phrases, de sorte que les paramètres prosodiques et acoustiques sont affectés55.

En ce qui concerne les caractéristiques prosodiques et acoustiques de la parole et des vitesses d'articulation, nos résultats indiquent que plus un locuteur fait varier la durée des syllabes (et des voyelles), plus ces vitesses sont faibles. Nous émettons l'hypothèse que la perception de la parole, tant en BP L1 qu'en BP L2, semble quelque peu plus lente qu'en anglais L1 et L2, et que l'anglais L1 paraît plus rapide que tous les autres niveaux linguistiques. Ce phénomène pourrait être lié au rythme de la parole et à l'hypothèse selon laquelle, tandis que le BP L1-L2 s'oriente vers le pôle syllabique du continuum rythmique, l'anglais L1-L2 évolue vers le pôle accentué21,22.

Le scintillement local, Figure 6B, est influencé par le SD-S et le Varco-S. Pour le scintillement local, les productions en Bra-S, en L1-BP et en L2-anglais présentent toutes une trajectoire quelque peu monotone à mesure que la variabilité de la durée des syllabes augmente (SD et Varco, voir Tableau supplémentaire S1). La perception de l'effort vocal peut être perceptible à l'écoute des productions en Bra-S, en raison d'une faible variation comprise entre 8,5 et 9 dB. La parole en Bra-S est affectée par la charge vocale. Le L1-BP est fortement influencé par la longueur de la phrase et est moins sensible aux fortes variations de la durée syllabique (le schéma rythmique du BP montre une moindre variation syllabique22,56).

Le t aux de pauses (Figure 6C) montre que les locuteurs anglophones L2 produisent des pauses plus longues (de 200 ms à 375 ms) que les locuteurs anglophones L1, les locuteurs brésilien-portugais L1 et les locuteurs brésilien-portugais L2 (moyenne de 30 ms pour les anglophones L1, 50 ms pour les brésilien-portugais L1 et 100 ms pour les brésilien-portugais L2). Dans ce cas, la planification de la parole pourrait avoir affecté la production en anglais L2 en raison d'une activité cérébrale accrue54,57. On s'attend à ce qu'un niveau de compétence linguistique plus élevé entraîne une vitesse et une portée de lecture plus grandes54 ; néanmoins, même pour les locuteurs L2 compétents, les tâches de lecture impliquent davantage d'efforts dans les aspects cognitifs de haut niveau liés à la parole étrangère et au traitement linguistique54,57. Nos résultats montrent, du moins de manière préliminaire, que les locuteurs brésilien-portugais L2 pourraient être moins affectés par les pauses que les locuteurs anglais L2, en raison de différences dans le schéma rythmique des deux langues.

figure-results-1
Figure 6 : Modèles additifs généralisés pour les caractéristiques prosodiques et acoustiques. Sur l'axe des ordonnées, la variable réponse (les caractéristiques acoustiques à modéliser) ; sur l'axe des abscisses, les variables explicatives (le facteur « Langue » et les covariables dans les modèles additifs qui détermineront la forme et les trajectoires des courbes (c’est-à-dire les effets de lissage : « Langue + covariables »), ainsi que le produit du facteur « Langue » et d’une caractéristique métrique qui permettra une projection plus précise de la variable réponse (c’est-à-dire les interactions facteur-lissage : « covariable:Langue »). Abréviation : GAMs = Modèles additifs généralisés. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

En ce qui concerne les métriques du rythme, pour SD-S (Figure 7A), nos résultats révèlent que plus un locuteur fait varier la courbe de F0 et augmente la vitesse de parole, plus SD-S diminutions pour tous les niveaux linguistiques (un effet miroir de Figure 6A). Dans le cas de l'écart type (SD) pour les consonnes (SD-C, Figure 7C), le L1-BP, contrairement au L1 anglais, présente une faible variation lorsque le débit vocal ou la durée des pauses augmente. Ce sens de la variation standardisée est prédit, puisque la variabilité de la durée des syllabes en L1 anglais est (statistiquement) significativement plus élevée qu'en L1-BP.44,58. Le Varco-S (Figure 7B et Tableau supplémentaire S1) semble être quelque peu corrélée aux L1 et L2 du même groupe linguistique. Lorsque la variabilité de la fréquence fondamentale (f0) et la vitesse de parole augmentent, le Varco-S diminue pour le L1-BP et semble diminuer et s'atténuer pour le L2-BP. Pour les productions en anglais, tandis que la variabilité de la fréquence fondamentale (f0) et la vitesse de parole augmentent, Vitesse de parole augmente, Varco-S augmente et atténue pour L1-anglais et L2-anglais.

Concernant l'ÉT pour les voyelles ou les consonnes (SD-V_C, Figure 7D et Tableau supplémentaire S1), nos résultats montrent certaines similitudes avec les Varco-S performanceFigure 7B). Par exemple, des valeurs plus élevées Vitesse de parole, Durée de pause, et variabilité de f0 favoriser une trajectoire de chute puis de remontée de la SD-V_C pour L1-BP et pour L2-BP. Dans les productions en anglais, bien que ces caractéristiques prosodiques soient plus marquées, SD-V_C diminue légèrement, s'atténue pour l'anglais L1, augmente légèrement, puis s'atténue pour l'anglais L2. Le Varco-S et le SD-V_C la corrélation avec le L1-L2 des mêmes groupes linguistiques pourrait être partiellement expliquée par l'effet Lombard, qui désigne l'altération des paramètres acoustiques de la parole en raison du bruit de fond59.

Dans la parole étrangère, selon la complexité de la tâche (par exemple, parole lue), les locuteurs ont utilisé des stratégies acoustiques similaires en L1 et en L259,60. D’un côté, Marcoux et Ernestus ont constaté que les mesures de f0 (plage et médiane) dans la parole Lombard en L2 suggèrent que les locuteurs anglophones en L2 étaient influencés par leur néerlandais en L161,62. D’un autre côté, des découvertes plus récentes proposent que, bien que la parole Lombard en L2 doive différer de la parole Lombard en L1 en raison de la charge cognitive plus élevée lors de l’utilisation de la L2, les locuteurs anglophones en L2 produisent une parole Lombard dans la même direction que les locuteurs anglophones en L163. Dans quelle mesure nos résultats concordent avec ceux de Marcoux et Ernestus63 et s’écartent de Waaning59, Villegas et al.60, et Marcoux et Ernestus61,62 nécessite des recherches supplémentaires.

figure-results-2
Figure 7 : Modèles additifs généralisés pour les caractéristiques métriques. Sur l’axe des ordonnées, la variable réponse (les caractéristiques métriques à modéliser) ; sur l’axe des abscisses, les variables explicatives (le facteur « Langue » et les covariables dans les modèles additifs qui détermineront la forme et les trajectoires des courbes (c’est-à-dire les effets de lissage : « Langue + covariables »), ainsi que le produit du facteur « Langue » et d’une caractéristique métrique, qui permettra une projection plus précise de la variable réponse (c’est-à-dire les interactions facteur-lissage : « covariable:Langue »). Abréviation : GAMs = Modèles additifs généralisés. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Résultats concernant la perception de la parole
En ce qui concerne les séries vocales BP, dans la série n°1 (Figure 8A), la voix parasite n°3 a été jugée comme étant la voix cible. En réalité, la voix cible était la voix n°4. Les résultats ne montrent aucune différence statistiquement significative (voir Tableau supplémentaire S1) entre la voix parasite n°3 (83 %) et la voix cible n°4 (71 %). Dans la série n°2 (Figure 8B), une comparaison entre la voix cible n°3 (40 %) et la voix parasite n°4 (20 %) n’a également révélé aucune différence statistiquement significative (voir Tableau supplémentaire S1) pour les séries vocales anglaises. Dans la série n°1 (Figure 9A), aucune différence significative (voir Tableau supplémentaire S1) n’a été observée entre la voix parasite n°2 (26 %) et la voix cible n°4 (54 %).

Dans l'analyse de la similarité vocale, la similarité cosinus (CoSim) et la distance euclidienne (EucDist, [EucDist transformée]54) ont montré une corrélation constante entre le témoin n°3 et la cible pour le groupe d'identification BP n°1 (CoSim = 0,99 ; EucDist = 77,4, [0,93]). La corrélation entre le témoin n°4 et la cible était tout aussi forte dans le groupe d'identification BP n°2 (CoSim = 0,99 ; EucDist = 76,3, [0,93]). Dans le groupe d'identification anglais n°1, la corrélation était constante pour CoSim (0,83), mais faible à satisfaisante pour EucDist (213,0, [0,47]). Dans l'ensemble, les deux techniques, CoSim et EucDist, se sont révélées satisfaisantes pour déterminer la similarité vocale. En outre, CoSim s'est avérée légèrement plus efficace, comme indiqué par Gahman et Elangovan52 (voir Tableau supplémentaire S1).

En ce qui concerne la similarité, qu'est-ce qui aurait pu entraîner une augmentation des fausses alarmes ? Les caractéristiques prosodiques et acoustiques ont montré que, bien que les voix distractrices et les voix cibles se comportent de manière significativement différente (sur le plan statistique) — à l'exception des séries présentées dans la Figure 8A,B et la Figure 9A — les choix des auditeurs se sont quelque peu diversifiés selon les différentes voix distractrices dans les autres séries (Figure 8C,D et Figure 9B-D). Ce type de jugement semble dépendre davantage d'une (ou peut-être plusieurs) caractéristique acoustique spécifique partagée par les locuteurs, plutôt qu'un ensemble complet de caractéristiques prosodiques et acoustiques. Par exemple, notre étude a mis en évidence plusieurs caractéristiques variant (ou covariant) entre les productions ; néanmoins, les résultats perceptifs montrent une préférence dans les jugements pour une voix distracter spécifique correspondant à la voix cible8,35,64,65. Des analyses supplémentaires seront nécessaires dans des travaux futurs.

Il est important de considérer le choix d'une matrice paramétrique multidimensionnelle pour la similarité acoustique66, telle que celle présentée dans cette étude. Nos résultats concordent avec des études antérieures ayant utilisé des caractéristiques acoustiques fondées sur le f0, la VQ et l'intensité9,35. Ces caractéristiques sont fortement recommandées pour les tâches de comparaison de locuteurs dans le domaine médico-légal9,66. Il est toutefois essentiel de souligner que, dans la présente recherche, aucun des locuteurs distracteurs n'a été prédit comme étant similaire à la voix cible, bien que nous ayons utilisé une variante des recommandations de McFarlane16,17 lors de la préparation des séries vocales pour la reconnaissance de locuteurs présentant un accent étranger. En outre, nous devons insister sur le fait que notre procédure de présentation de séries vocales comporte des différences importantes par rapport aux recommandations de McFarlane, notamment en ce qui concerne la durée des stimuli, le nombre de voix, la sélection des distracteurs (ici aléatoire) et le style de parole.

Dans quelle mesure les caractéristiques prosodiques et acoustiques de la fréquence fondamentale (f0), de la qualité vocale et de l'intensité semblent-elles liées à la perception des auditeurs dépend fortement du style de parole utilisé dans la recherche. Ici, nous avons utilisé des textes lus. La majorité des études en témoignage auditif optent pour des stimuli (semi-)spontanés comme solution équilibrée — par exemple, le corpus DyVis67 — qui a été largement utilisé dans les enquêtes contemporaines sur le témoignage auditif28,68. La raison pour laquelle nous avons choisi des tâches de lecture est que notre corpus, au moment de la rédaction de cet article, se composait exclusivement de données issues de tâches de lecture. Il est toutefois important de noter que le processus de constitution d'un corpus (semi-)spontané est déjà en cours. En outre, le fait de lire une histoire peut générer un niveau fiable d'uniformité et de variation, tant intra- qu'inter-locuteur. Cela facilite la mise en évidence de caractéristiques prosodiques ou phonétiques — individuelles ou dialectales — dans les situations de comparaison vocale. Ce phénomène devient particulièrement évident dans les cas de charge vocale lors de la production d'un accent étranger, même parmi des locuteurs compétents 8,9,23,54.

figure-results-3
Figure 8 : Graphiques en barres présentant les résultats des quatre séries d'identification réalisées par les auditeurs brésiliens. (A,B) Différence non significative entre la voix cible (en bleu) et une voix distrayante (en bleu clair). (C,D) Différences significatives par rapport aux voix distrayantes et à la voix cible. Abréviation : NS = non significatif. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

figure-results-4
Figure 9 : Graphiques en barres présentant les résultats des quatre séries d'identification réalisées par les auditeurs américains. (A) Différence non significative entre la voix cible (en rouge) et une voix distrayante (en rose). (B,C,D) Différences significatives entre les voix distrayantes et la voix cible. Abréviation : NS = non significatif. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Tableau supplémentaire S1 : Statistiques de production de la parole - Modèles additifs généralisés (GAM) : les statistiques F (degrés de liberté), le R2 ajusté de chaque caractéristique prosodique-acoustique statistiquement significative (Figure 6), et chaque métrique de rythme (Figure 7) par niveau linguistique, ainsi que les valeurs individuelles de chaque terme lissé (les covariables). Statistiques de perception de la parole : les statistiques χ2 de Kruskall-Wallis (degrés de liberté), les valeurs-p, et l'η2 ajusté, ainsi qu'un test post-hoc de Dunn pour la comparaison par paires (Figure 8 et Figure 9) de chaque différence statistiquement non significative entre les paires de voix cible et voix distractrice (Figure 8A,B et Figure 9A). Matrices de similarité acoustique pour les distances cosinus et euclidienne de chaque série. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Discussion

Le protocole actuel présente une nouveauté dans le domaine de la phonétique (médico-légale). Elle est divisée en deux phases : l’une basée sur la production (analyse acoustique) et l’autre basée sur la perception (analyse du jugement). La phase d’analyse de la production comprend la préparation des données et l’alignement forcé, le réalignement et l’extraction automatique des caractéristiques acoustiques prosodiques en plus des statistiques. Ce protocole relie l’étape de collecte des données à l’analyse des données de manière plus rapide et plus efficace que les protocoles traditionnels basés sur une segmentation principalement manuelle.

Cependant, le processus de réalignement, illustré dans les étapes de protocole 1.3.6 à 1.3.6.9, fonctionne essentiellement sur les unités de téléphone et de mot générées dans les étapes de protocole 1.3.1 à 1.3.4. La nouveauté du processus de réalignement est qu’il génère un nouveau TextGrid contenant trois nouveaux niveaux de texte : un niveau syllabique, un niveau de bloc de parole qui peut être généré automatiquement ou manuellement en fonction des mots, et un niveau de ton qui peut être très utile pour calculer les mesures f0. Les lignes directrices de réalignement proposées pour ce protocole ont déjà été utilisées dans des études sur le rythme de parole L2 21,69,70, des études sur la détection du degré d’accent étranger à l’aide de techniques d’apprentissage automatique22 et des études dans le domaine médico-légal 9.

L’extraction automatique des caractéristiques prosodiques, présentée dans les étapes de protocole 1.3.7 à 1.3.7.10, génère une matrice multidimensionnelle de caractéristiques prosodiques-acoustiques comme on a pu en témoigner dans la recherche actuelle. Ces caractéristiques comprennent des caractéristiques mélodiques, temporelles et spectrales (qualité et intensité de la voix)71. Un nombre considérable de ces caractéristiques acoustiques sont moins sensibles et quelque peu résistantes aux enregistrements audio bruyants qui finissent par être recueillis dans le cadre de la criminalistique ou de tout autre scénario72. De plus, la matrice multidimensionnelle peut être appliquée aux systèmes de reconnaissance vocale via plusieurs techniques d’IA (travaux en cours). Il peut encore être très utile dans l’enseignement des aspects prosodiques dans les cours de prononciationL2 21 (travail en cours).

L’analyse statistique de cette partie du protocole représente l’utilisation de la méthode GAM puisque nous avons traité une relation complexe entre une caractéristique acoustique spécifique et plusieurs locuteurs à facteur de langue. Pour modéliser une caractéristique acoustique spécifique, par exemple, il était nécessaire de vérifier comment d’autres caractéristiques acoustiques de la matrice (les termes lisses) se comporteraient afin de pouvoir décrire plus précisément ce qui se passait pendant la production de la parole.

En ce qui concerne l’analyse de perception, le protocole actuel a été constitué par la préparation et la mise en œuvre des alignements de voix, l’analyse statistique et l’analyse de similarité acoustique. Pour préparer les alignements, nous avons utilisé le script CreateLineup pour Praat, qui génère automatiquement un fichier audio pour chaque alignement contenant des feuilles séquencées de manière aléatoire et la voix cible, comme décrit dans les étapes de protocole 2.2 à 2.2.1.9.

Pour l’analyse statistique de ce protocole, nous avons effectué le test non paramétrique de Kruskal-Wallis car nos données ne répondaient pas aux hypothèses de l’analyse de variance (ANOVA). Une fois que nous avons établi une relation entre les scores de jugement évalués par les auditeurs et contrôlés pour la voix cible et les feuilles, nous avons choisi d’utiliser les statistiques du modèle linéaire.

Pour l’analyse de similarité acoustique, nous avons utilisé le script AcousticSmilarity_cosine_euclidean pour Python. Le programme ouvre l'arborescence des répertoires de l'ordinateur et demande à l'utilisateur de choisir le fichier contenant les caractéristiques prosodiques-acoustiques des feuilles et la voix cible qui compose la composition de la composition de l'alignement en analyse. D'un simple clic, le script génère trois matrices de similarité : un cosinus, un euclidien et un euclidien transformé (de zéro à un), sur les fichiers '.txt' (délimités par des tabulations) et '.csv. Nous devons toujours garder à l'esprit que chaque ensemble de données (le fichier '.txt' contenant les caractéristiques prosodiques-acoustiques des feuilles et de la cible) doit être dans le dossier d'origine de la programmation, et chaque dossier de programmation doit avoir une copie du script AcousticSmilarity_cosine_euclidean .

En résumé, le protocole actuel fait progresser la recherche phonétique (médico-légale). Comprenant des phases distinctes - analyses de production et de perception, ainsi que de similarité acoustique - il comble le fossé entre la collecte de données et l’analyse multidimensionnelle des caractéristiques acoustiques. Les chercheurs peuvent bénéficier d’une perspective holistique, en explorant à la fois les aspects de production et de perception. De plus, ce protocole garantit la reproductibilité de la recherche, permettant à d’autres de s’appuyer sur les lignes directrices de ce travail.

Limites et orientations futures
Nous devons toujours garder à l’esprit que tout se passera bien si la préparation des données suit les directives proposées dans les étapes de protocole 1.3.1 à 1.3.4. En outre, dans les procédures d'alignement forcé, nous devons être conscients qu'un aligneur forcé externe pré-entraîné - comme MAUS utilisé dans le travail actuel - est susceptible d'erreurs de segmentation, en particulier dans les données accentuées étrangères non pré-entraînées ou même dans les aligneurs pré-entraînés, que l'audio n'ait pas une bonne qualité ou que l'aligneur ne contienne pas le langage audio (ce fait rendrait le travail de l'expert plus difficile et plus long). La transcription médico-légale, en particulier des fichiers audio plus longs, rencontre des difficultés en ce qui concerne la représentation précise et fiable des enregistrements parlés72.

La transcription et l’alignement de fichiers audio plus longs présentent également plusieurs défis. Les performances des aligneurs sont influencées par le style de parole et l’environnement phonétique, ainsi que par des facteurs spécifiques au dialecte. Bien qu’il existe des différences spécifiques aux aligneurs, en général, leurs performances sont similaires et génèrent des segmentations qui se comparent bien à l’alignement manuel dans son ensemble73. De plus, la production anglaise L1 et L2 a été exécutée avec un modèle acoustique pré-entraîné de l’anglais américain en raison de l’indisponibilité de modèles de parole étrangers dans MAUS. De plus, il n’existe pas de modèles acoustiques pré-entraînés pour la PA dans les MAUS. Pour les données BP, les modèles acoustiques italiens préexistants ont été utilisés (voir NOTE, étape de protocole 1.3.5.7).

Dans le cadre de travaux futurs (en cours), nous utiliserons l’aligneur forcé de Montréal (AMF)74 dans le cadre du protocole. L’un des grands avantages de l’authentification multifacteur est la disponibilité de modèles acoustiques pré-entraînés et de modèles graphème-phonème pour une grande variété de langues (y compris BP), ainsi que la possibilité d’entraîner de nouveaux modèles acoustiques et graphème-phonème à n’importe quel nouvel ensemble de données (c’est-à-dire notre corpus vocal avec accent étranger)75.

Déclarations de divulgation

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Remerciements

Cette étude a été soutenue par le Conseil national pour le développement scientifique et technologique - CNPq, subvention n° 307010/2022-8 pour le premier auteur, et subvention n° 302194/2019-3 pour le deuxième auteur. Les auteurs tiennent à exprimer leur sincère gratitude aux participants à cette recherche pour leur généreuse collaboration et leurs contributions inestimables.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
CreateLineupPersonal collection#Script for praat pour la préparation des alignements vocaux
Dell I3 (avec disque SSD - Solid State Drive)  ;Dell#Ordinateur portable
Praat PaulBoersma & David Weenink#Logiciel d’analyse phonétique
Python 3Python Software Foundation#Langage de programmation interprété, de haut niveau et à usage général.
RLe Projet R pour l’Informatique Statistique#Langage de programmation pour l’informatique statistique
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorCollection personnelle#Script pour praat pour l’extraction automatique de caractéristiques acoustiques
SurveyMonkeySurveyMonkey Inc.#Assemblez des enquêtes personnalisables gratuites, ainsi qu’une suite de programmes back-end qui incluent l’analyse des données, la sélection d’échantillons, la suppression des biais et la représentation des données.
Tascam DR-100 MKIITascam#Enregistreur vocal numérique
Système de segmentation automatique de Munich MAUSUniversité de Munich#Alignement forcé de fichiers audio (.wav) et d’informations linguistiques (.txt)
VVUnitAlignerPersonal collection#Script pour praat pour le réalignement automatique et le post-traitement des unités phonétiques

Références

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Réimpressions et autorisations

Étiquettes

Caractéristiques prosodiquesperception de la parolequalité de la voixfréquence fondamentalereconnaissance du locuteursimilitude acoustique