Article de méthode

Accent étranger et identification du locuteur médico-légal dans les alignements vocaux : l’influence des caractéristiques acoustiques basées sur la prosodie

DOI :

10.3791/66313

27 septembre 2024

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette recherche visait à faire une comparaison entre L1-L2-anglais et L1-L2 portugais afin de vérifier dans quelle mesure l’effet d’un accent étranger compte à la fois pour les métriques et les paramètres prosodiques-acoustiques, ainsi que pour le choix de la voix cible dans une gamme de voix.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette recherche vise à examiner à la fois les caractéristiques prosodiques-acoustiques et les corrélats perceptifs de l'anglais avec un accent étranger et du portugais brésilien avec un accent étranger, et à vérifier comment les productions d'accents étrangers et natifs des locuteurs sont corrélées à la perception des auditeurs. Dans la méthodologie, nous avons mené une procédure de production de parole avec un groupe de locuteurs américains de portugais brésilien L2 et un groupe de locuteurs brésiliens de l’anglais L2, ainsi qu’une procédure de perception de la parole dans laquelle nous avons effectué des alignements vocaux pour les deux langues. Pour l’analyse statistique de la production de la parole, nous avons exécuté des modèles additifs généralisés pour évaluer l’effet des groupes de langues sur chaque classe (métrique ou prosodique-acoustique) des caractéristiques contrôlées pour l’effet de lissage de la ou des covariables de la classe opposée. Pour l'analyse statistique de la perception de la parole, nous avons effectué un test de Kruskal-Wallis et un test de Dunn post-hoc pour évaluer l'effet des voix des alignements sur les scores jugés par les auditeurs. Nous avons néanmoins effectué des tests de similarité acoustique (voix) basés sur les distances cosinus et euclidienne. Les résultats ont montré des différences acoustiques significatives entre les groupes linguistiques en termes de variabilité du f0, de durée et de qualité de la voix. Pour les alignements, les résultats ont indiqué que les caractéristiques prosodiques de f0, d'intensité et de qualité de la voix étaient corrélées aux jugements perçus par les auditeurs.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

L’accent est un aspect saillant et dynamique de la communication et de la fluidité, à la fois dans la langue maternelle (L1) et dans une langue étrangère (L2)1. L’accent étranger représente les caractéristiques phonétiques L2 d’une langue cible, et il peut changer (au fil du temps) en réponse à l’expérience L2 du locuteur, au style de parole, à la qualité de l’entrée, à l’exposition, entre autres variables. Un accent étranger peut être quantifié comme un degré (scalaire) de différence entre le discours L2 produit par un locuteur étranger et un accent local ou de référence de la langue cible2,3,4,5.

Cette recherche vise à examiner à la fois les caractéristiques prosodiques-acoustiques et les corrélats perceptifs de l'anglais avec un accent étranger et du portugais brésilien (BP) avec un accent étranger, ainsi qu'à vérifier dans quelle mesure les productions d'accents étrangers et natifs des locuteurs sont corrélées à la perception des auditeurs. Des recherches antérieures dans le domaine médico-légal ont démontré que la robustesse des voyelles et des consonnes dans l’identification des accents étrangers est soit stable pour une analyse à long terme d’un individu (The Lo Case6), soit se référant à la grande précision d’identification d’un locuteur (The Lindbergh Case7). Cependant, l’exploration des caractéristiques acoustiques prosodiques basées sur la durée, la fréquence fondamentale (f0, c’est-à-dire le corrélat acoustique de la hauteur), l’intensité et la qualité de la voix (VQ) a suscité de plus en plus d’attention 8,9. Ainsi, le choix des caractéristiques prosodiques-acoustiques dans cette étude représente une piste prometteuse dans le domaine de la phonétique médico-légale 8,10,11,12,13.

La présente recherche est soutenue par des études consacrées aux accents étrangers comme forme de déguisement de la voix dans les cas médico-légaux14,15, ainsi que dans la préparation des alignements vocaux pour la reconnaissance des locuteurs16,17. Par exemple, le débit de parole a joué un rôle important dans l’identification des locuteurs allemands, italiens, japonais et brésiliens de l’anglais18,19,20,21,22. Outre le débit de parole, les caractéristiques spectrales à long terme et f0 mettent au défi les locuteurs compétents en L2 avec la familiarité avec la langue cible, car le cerveau et les bases cognitives souffrent d'un déficit de mémoire, d'attention et d'émotion, ce qui se reflète dans les performances phonétiques du locuteur pendant les longs tours de parole23. Le point de vue sur les accents étrangers dans le domaine médico-légal est que la définition de ce qui ressemble vraiment à un accent étranger dépend beaucoup de la méconnaissance de l'auditeur plutôt que d'avoir un degré de discours avec accent étranger24.

Dans le domaine perceptuel, un outil médico-légal couramment utilisé depuis le milieu des années 1990 pour la reconnaissance des criminels est la Voice Lineup (reconnaissance auditive), qui est analogue à la reconnaissance visuelle utilisée pour identifier un auteur sur une scène de crime16,25. Dans une séance d'identification, la voix du suspect est présentée à côté de faire-valoir - des voix similaires sur le plan sociolinguistique tels que l'âge, le sexe, l'emplacement géographique, le dialecte et le statut culturel - pour être identifiée par un témoin auditif. Le succès ou l’échec d’une composition vocale dépend du nombre d’échantillons de voix et de la durée des échantillons25,26. De plus, pour les échantillons du monde réel, on considère que la qualité audio a un impact constant sur la précision de la reconnaissance vocale. Une mauvaise qualité audio peut déformer les caractéristiques uniques d’une voix27. Dans le cas d’une similitude vocale, des détails phonétiques fins basés sur f0 peuvent dérouter l’auditeur lors de la reconnaissance vocale 28,29. Ces caractéristiques acoustiques s’étendent au-delà de f0 et englobent des éléments de durée, ainsi que des caractéristiques spectrales d’intensité et de VQ30. Cette vue de plusieurs caractéristiques prosodiques est cruciale dans le contexte de la comparaison de voix médico-légales pour garantir une identification précise du locuteur 9,14,15,29,31.

En résumé, les études en phonétique médico-légale ont montré certaines variations concernant l’identification des accents étrangers au cours des dernières décennies. D’une part, un accent étranger ne semble pas affecter le processus d’identification d’un locuteur32,33 (surtout si le locuteur n’est pas familier avec l’accent étranger cible34). D’un autre côté, il y a des résultats dans la direction opposée 12,34,35.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce travail a reçu l’approbation d’un comité d’éthique de la recherche sur l’homme. De plus, le consentement éclairé de tous les participants à cette étude a été obtenu pour utiliser et publier leurs données.

1. Production de la parole

NOTE : Nous avons recueilli la parole d'une tâche de lecture sur les pics 'L1 English-L2 BP' produits par le groupe 1 : les peakers Sanglais américain (des États-Unis) (AmE-S), et sur les deux peakers 'L1 BP-L2 English' produits par le groupe 2 : les peakers Sde Brazilian(Bra-S). Voir Figure 1 pour un organigramme pour la production de parole.

figure-protocol-1Figure 1 : Organigramme schématique pour la production vocale. Veuillez cliquer ici pour voir une version agrandie de cette figure.

  1. Participants
    1. Déterminer le nombre de participants, la langue (L1 anglais, L2 BP ; L1 BP, L2 anglais), le sexe (féminin ou masculin), l’âge (moyenne, écart-type), les caractéristiques du groupe (professionnels ou étudiants de premier cycle) et le niveau de compétence L2 (avancé ou bien avancé) pour chaque groupe.
      REMARQUE : Pour la présente recherche, AmE-S et Bra-S ont tous deux été considérés comme compétents en L2 (les deux groupes ont été qualifiés de B2-C136). L’AmE-S vivait depuis deux ans au Brésil au moment où les procédures ont été menées. Le Bra-S vivait plus de deux ans aux États-Unis lorsque les procédures ont été effectuées. Lorsqu’ils vivaient à l’étranger, les deux groupes avaient l’habitude de parler leur L2 à des fins d’étude et de travail au moins 6 jours par semaine pendant ~4-5 heures par jour.
    2. Répartissez les participants dans une pièce confortable et calme et présentez le matériel de lecture pour chaque groupe.
  2. Collecte de données
    REMARQUE : Les données vocales doivent être collectées à partir d’une tâche de lecture dans les langues suivantes : L1-anglais et L2-BP ; L1-BP et L2-anglais. Laissez les participants lire les textes à l’avance si nécessaire.
    1. Procédures d’enregistrement
      1. Enregistrez les données vocales dans un endroit calme avec des conditions acoustiques appropriées.
      2. Utilisez un enregistreur vocal numérique (voir le Tableau des matériaux)37 et un microphone cardioïde unidirectionnel isolé électromagnétiquement (voir le Tableau des matériaux)38.
      3. Enregistrez les données audio sous forme .wav.
      4. Réglez la fréquence d’échantillonnage à 48 kHz et la fréquence de quantification à 16 bits.
        REMARQUE : Le format audio et la configuration des taux d’échantillonnage et de quantification décrits aux étapes 1.2.1.3 et 1.2.1.4 sont appliqués pour assurer une qualité élevée et une réduction du bruit afin de préserver les caractéristiques spectrales utilisées pour l’analyse acoustique ultérieure.
  3. Analyse acoustique
    REMARQUE : Divisez les procédures d’analyse acoustique en trois étapes : alignement forcé, réalignement et extraction des caractéristiques acoustiques.
    1. Écrivez la transcription linguistique (dans un '.txt) pour chaque fichier audio.
    2. Étiquetez la paire de fichiers '.txt'/'.wav' avec le même nom (c'est-à-dire 'my_file.wav'/ 'my_file. txt').
      REMARQUE : Afin d’améliorer l’exécution de la procédure décrite à la section 1.3.7, il est fortement recommandé que les trois premiers caractères des balises de fichier « .txt/.wav » représentent la langue, le dialecte ou l’accent, tandis que les quatrième à sixième caractères indiquent le sexe (par exemple, EL1FEM pour English L1 Fembière). À partir du septième caractère, l’utilisateur doit indiquer le numéro du locuteur (par exemple, 001 pour le premier locuteur). Par conséquent, la première paire « .txt/.wav » est EL1FEM001.
    3. Créez un dossier pour chaque langue L1-L2.
      REMARQUE : Un dossier pour L1-L2 anglais et un dossier pour L1-L2 BP.
    4. Certifiez que toutes les paires de fichiers de la même langue se trouvent dans le même dossier.
    5. Effectuez l’alignement forcé.
      1. Accédez à l’interface web de Munich Automatic Segmentation (MAUS) forced aligner (webMAUS)39 à https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Faites glisser et déposez chaque paire de . wav / . txt du dossier vers le rectangle en pointillés dans Fichiers (ou cliquez à l’intérieur du rectangle, Figure 2A).
      3. Cliquez sur le bouton Télécharger pour télécharger les fichiers dans l’aligneur (voir flèche rouge dans Figure 2A).
      4. Sélectionnez les options suivantes dans le menu Options du service (Figure 2B) : G2P-MAUS-PHO2SYL pour Nom du pipeline ; Anglais (États-Unis) (pour la langue) si les données en anglais L1-L2 sont en anglais ; Italien (IT) (pour la langue) si L1-L2 BP data.
        REMARQUE : Nous avons choisi 'italien' pour les données BP car webMAUS ne fournit pas de modèles acoustiques pré-entraînés pour l'alignement forcé BP. La littérature phonétique pose que la phonologie italienne a un inventaire symétrique à sept voyelles quelque peu comparable, tout comme BP40, ainsi que des similitudes acoustiques consonnes41,42.
      5. Conservez les options par défaut pour 'Format de sortie' et 'Garder tout'.
      6. Cochez la case Exécuter pour accepter les conditions d’utilisation (voir la flèche verte dans Figure 2C).
      7. Cliquez sur le bouton Exécuter le service Web pour exécuter les fichiers téléchargés dans aligner.
        REMARQUE : Pour chaque fichier audio, l'aligneur forcé MAUS renvoie un objet Praat TextGrid (un fichier « .txt » préformaté par Praat contenant l'annotation des mots, des syllabes phonologiques et des phonèmes basée sur la transcription linguistique extraite du fichier « .txt » décrit à l'étape 1.3.1).
      8. Cliquez sur le bouton Télécharger en tant que fichier ZIP pour télécharger les fichiers TextGrid sous forme de fichier compressé (Figure 2C).
        REMARQUE : assurez-vous que les fichiers TextGrid compressés sont téléchargés dans le même dossier que les fichiers audio.
      9. Extrayez les fichiers TextGrid pour un réalignement ultérieur dans le logiciel d’analyse phonétique 43.
    6. Effectuez le réalignement.
      1. Accédez et téléchargez le script pour Praat VVUnitAligner44 à partir de https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat.
      2. Certifiez que toutes les paires de fichiers de la même langue et le script VVUnitAligner se trouvent dans le même dossier.
        REMARQUE : Un dossier pour les fichiers anglais L1-L2 et le VVunitAligner, et un dossier pour les fichiers BP L1-L2 et le VVunitAligner.
      3. Ouvrez le logiciel d’analyse phonétique.
      4. Cliquez sur Praat | Ouvrez le script Praat... pour appeler le script à partir de la fenêtre de l’objet.
      5. Cliquez une fois sur le bouton Exécuter.
        REMARQUE : Une forme appelée Alignement des syllabes phonétiques contenant les paramètres d’utilisation du script apparaîtra à l’écran (Figure 3A).
      6. Cliquez sur le bouton Langue pour choisir parmi les langues « Anglais (US) », « Portugais (BR) », « Français (FR) » ou « Espagnol (ES) ».
      7. Cliquez sur le bouton Segmentation par blocs pour choisir entre la procédure de segmentation « Automatique », « Forcée (manuelle) » ou « Aucune ».
      8. Cochez l’option Enregistrer les fichiers TextGrid pour enregistrer automatiquement les nouveaux fichiers TextGrid.
      9. Cliquez sur OK | Exécutez les boutons pour un réalignement des unités phonétiques à partir de l’étape 1.3.5.7 .
        REMARQUE : Pour chaque fichier audio, VVUnitAligner générera un nouveau fichier TextGrid pour la section 1.3.7 (Figure 3B).
    7. Effectuez l’extraction automatique des caractéristiques acoustiques.
      1. Accédez et téléchargez le script SpeechRhythmExtractor45 depuis https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat pour l’extraction automatique des caractéristiques prosodiques-acoustiques.
      2. Créez un nouveau dossier et placez SpeechRhythmExtractor avec toutes les paires de fichiers audio/TextGrid de toutes les langues.
      3. Ouvrez le logiciel d’analyse phonétique.
      4. Cliquez sur Praat | Ouvrez le script Praat... pour appeler le script à partir de la fenêtre de l’objet.
      5. Cliquez une seule fois sur le bouton Exécuter.
        REMARQUE : Un formulaire contenant les paramètres du script apparaîtra à l’écran. Dans les cases des noms de fichiers '.txt' de sortie, renommez les fichiers en conséquence ou laissez les noms par défaut.
      6. Cochez l’option des paramètres de qualité vocale pour enregistrer le fichier de sortie VQ pour la qualité vocale (Figure 3C).
        REMARQUE : Ce deuxième fichier de sortie (le fichier de sortie VQ) contient les paramètres de la différence entre la 1ère et la 2ème harmonique (H1-H2) et le pic de proéminence cepstrale (CPP)9.
      7. Cochez l'option Cible linguistique pour choisir parmi les étiquettes « Langue », « Dialecte » ou « Accent » (Figure 3C).
      8. Cochez l’option Unité pour choisir les caractéristiques f0 en Hz ou en demi-tons (Figure 3C).
      9. Définissez dans les valeurs du seuil F0 les seuils minimum et maximum de f0 (Figure 3C).
        REMARQUE : À moins que la recherche n’ait des objectifs spécifiques ou des fonctionnalités audio spécifiques prédéfinies, il est fortement recommandé de laisser les paramètres de l’étape 1.3.7.9 avec les valeurs par défaut.
      10. Cliquez sur OK | Exécuter pour l’extraction automatique des caractéristiques acoustiques .
        REMARQUE : Le script SpeechRhythmExtractor renvoie un fichier '.txt' délimité par des tabulations (Fichier de sortie/Fichier de sortie VQ) contenant les caractéristiques acoustiques extraites des haut-parleurs.
  4. analyse statistique
    1. Téléchargez la feuille de calcul contenant les caractéristiques acoustiques dans l’environnement R46 (ou tout logiciel/environnement statistique de votre choix).
    2. Effectuez des statistiques non paramétriques à l’aide de modèles additifs généralisés (GAM).
      1. Effectuer des GAM en R.
      2. Tapez les commandes suivantes et appuyez sur Entrée.
        Bibliothèque(mgcv)
        model = gam(la caractéristique métrique/prosodique-acoustique dans l’analyse ~ le langage + s(la caractéristique métrique choisie, par = le langage) + autres caractéristiques métriques/prosodiques-acoustiques, données = le trame de données)
        REMARQUE : Nous avons décidé d’effectuer les statistiques de test du protocole dans le langage de programmation R en raison de sa popularité croissante parmi les phonéticiens (et les linguistes) de la communauté universitaire. R a été largement utilisé dans la recherche phonétique sur le terrain47. Gardez à l’esprit que l’étape 1.4.2.2 contient un pseudo-code. Écrivez le code en fonction des variables de recherche.

figure-protocol-2Figure 2 : Capture d'écran de l'alignement phonétique à l'aide de l'aligneur forcé MAUS. (A) Le rectangle en pointillés est destiné à glisser-déposer des fichiers 'my_file.wav'/' my_file.txt' ou à cliquer à l'intérieur pour rechercher de tels fichiers dans le dossier ; Le bouton de téléchargement est indiqué par la flèche rouge. (B) Les fichiers téléchargés à partir du panneau A (voir flèche bleue), le pipeline à utiliser, la langue des paires de fichiers, le format de fichier à renvoyer et un bouton 'vrai/faux' pour conserver tous les fichiers. (C) Les conditions d’utilisation de la case à cocher (voir la flèche verte), le bouton Exécuter les services Web et les Résultats (fichiers TextGrid à télécharger). Veuillez cliquer ici pour voir une version agrandie de cette figure.

figure-protocol-3Figure 3 : Capture d’écran de la procédure de réalignement. (A) Formulaire de saisie des paramètres pour la procédure de réalignement. (B) Forme d’onde partielle, spectrogramme à large bande avec contour f0 (bleu) et six niveaux segmentés (et étiquetés) comme niveau 1 : unités d’apparition de la voyelle à l’apparition de la voyelle suivante (V_to_V) ; apparition des voyelles (V_to_V) ; niveau 2 : unités de voyelle (V), de consonnette (C) et de pause (#) ; niveau 3 : représentations phoniques V_to_V ; niveau 4 : quelques mots du texte ; niveau 5 : quelques morceaux (CH) de discours du texte ; tier 6 : tier tonal contenant le ton le plus élevé (H) et le ton le plus bas (L) de chaque morceau de parole produit par un AmE-S femelle. (C) Paramètres d’entrée pour l’extraction automatique des caractéristiques acoustiques. Veuillez cliquer ici pour voir une version agrandie de cette figure.

2. Perception de la parole

NOTE : Nous avons réalisé quatre alignements vocaux en anglais avec des auditeurs américains et quatre alignements en BP avec des auditeurs brésiliens. Voir Figure 4 pour un organigramme de la perception de la parole.

figure-protocol-4Figure 4 : Organigramme schématique pour la perception de la parole. Veuillez cliquer ici pour voir une version agrandie de cette figure.

  1. Participants
    1. Choisissez des participants différents pour chaque groupe parmi ceux qui ont participé au protocole de production vocale.
      NOTE : Deux groupes de participants ont été sélectionnés pour cette partie du protocole : Groupe 1 : L’anglaisaméricain (des États-Unis) Listesers(AmE-L), et le groupe 2 : Les Listesers de Bra zilian (Bra-L). Pour la présente recherche, AmE-L et Bra-L ont tous deux été considérés comme compétents en L2 (les deux groupes ont été qualifiés de B2-C136 L’AmE-L avait vécu deux ans au Brésil lorsque les procédures ont été effectuées. Le Bra-L vivait plus de deux ans aux États-Unis lorsque les procédures ont été effectuées. Lorsqu’ils vivaient à l’étranger, les deux groupes avaient l’habitude de parler leur L2 à des fins d’étude et de travail (au moins six jours par semaine pendant environ 4 à 5 heures par jour).
    2. Déterminer le nombre de participants, la langue (L1 anglais, L2 BP ; L1 BP, L2 anglais), le sexe (féminin ou masculin), l’âge (moyenne, écart-type), les caractéristiques du groupe (professionnels ou étudiants de premier cycle) et le niveau de compétence L2 de chaque groupe.
  2. Les compositions vocales
    REMARQUE : Divisez les procédures des alignements vocaux en deux étapes différentes : la préparation et l'exécution des alignements vocaux.
    1. Préparez quatre alignements de voix pour l’anglais et quatre pour BP.
      1. Obtenez des fichiers audio auprès des haut-parleurs de la section 1 : Production de la parole.
      2. Certifiez que les fichiers audio de chaque facteur de langue se trouvent dans des dossiers distincts.
      3. Choisissez au hasard six morceaux de voix en anglais L1 ou en L1 BP.
        REMARQUE : Six voix dans la gamme représentent une voix cible et cinq feuilles.
      4. Choisissez un morceau de voix en anglais L2 ou en BP L2 à partir de l’un des haut-parleurs inclus à l’étape 2.2.1.3.
        REMARQUE : Le segment de voix de l’étape 2.2.1.4 est la voix de référence. Les morceaux doivent mesurer environ 20 s de long.8.
      5. Accédez et téléchargez le script pour Praat CreateLineup48 à partir de https://github.com/pabarbosa/prosody-scripts-CreateLineUp.
      6. Certifiez que la voix de référence L2, les feuilles L1 et la voix cible L1 se trouvent dans le même dossier avant d’exécuter le script CreateLineup (Figure 5).
      7. Ouvrez le logiciel d’analyse phonétique.
      8. Dans la fenêtre de l’objet, cliquez sur Praat | Ouvrez le script Praat... pour appeler le script.
      9. Cliquez sur Exécuter | Run.
        REMARQUE : Le script renvoie un fichier dans l’ordre suivant : (la voix de référence L2) + (la voix cible L1 et les feuilles distribuées de manière aléatoire) (Figure 5).
    2. Exécution des alignements vocaux
      1. Créez un espace en ligne pour héberger les files d’attente sur la plateforme de votre choix (par exemple, SurveyMonkey. Voir le tableau des matériaux) pour effectuer les alignements vocaux à distance.
      2. Accédez au lien de l’espace en ligne.
      3. Téléchargez les fichiers renvoyés par le script CreateLineup sur la plate-forme.
      4. Lancez la procédure devant les participants pour tester chaque étape.
        REMARQUE : Il est recommandé d’accéder au lien et d’exécuter les alignements pour vérifier si tout fonctionne normalement.
  3. analyse statistique
    1. Téléchargez la feuille de calcul contenant les scores des jugements des auditeurs dans l'environnement R (ou tout logiciel/environnement statistique de votre choix).
      1. Effectuer le test de Kruskal-Wallis en R.
      2. Tapez les commandes suivantes et appuyez sur Entrée.
        model = kruskal.test(jugements ~ chaque alignement vocal, données = la trame de données)
    2. Effectuez un test de Dunn post-hoc.
      1. Effectuez le test de Dunn dans R.
      2. Tapez les commandes suivantes et appuyez sur Entrée.
        library(FSA)
        model = dunnTest(jugements ~ chaque alignement vocal, data = data, method = « bonferroni »)
        NOTA : Les codes des étapes 2.3.1.2 et 2.3.2.2 sont des pseudo-codes (voir NOTA 1.4.2.2).
  4. Analyse de similarité acoustique
    1. Sélectionnez les alignements (cf. REMARQUE à l’étape 2.2.1.3) qui présentaient des différences non significatives entre la cible et l’une des feuilles.
    2. Répéter les procédures des étapes 1.3.1 à 1.3.7.5 et 1.3.7.8 à 1.3.7.10.
    3. Accédez et téléchargez le script pour Python49, AcousticSimilarity_cosine_euclidean50 depuis https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      REMARQUE : Le script renvoie trois matrices (en '.txt' et '.csv') : une pour la similarité cosinusoïdienne51,52, une pour la distance euclidienne52,53, et une pour les valeurs de distance euclidienne transformée, ainsi qu'une comparaison par paires entre la voix cible et chaque feuille.
    4. Certifiez que le script est téléchargé dans le même dossier que le jeu de données d’alignement.
    5. Cliquez sur le bouton Ouvrir le fichier... pour appeler le script.
    6. Cliquez sur Exécuter | Exécuter sans débogage buttons.
      REMARQUE : Le deuxième bouton Exécuter peut être étiqueté comme Exécuter ou Exécuter sans débogage ou Exécuter le script. Ils exécutent tous les mêmes commandes. Cela dépend simplement de l’environnement Python utilisé.
    7. Effectuer des tests de similarité vocale basés sur les caractéristiques acoustiques.
      REMARQUE : La similarité cosinusoïdale (ou distance cosinusoïdale) est une technique appliquée à l’intelligence artificielle (IA), en particulier à l’apprentissage automatique dans les systèmes de reconnaissance automatique de la parole (RAA). Il s’agit d’une mesure de similitude entre zéro et un. Une similitude cosinus proche de un signifie que deux voix sont très susceptibles d’être similaires. Une similitude cosinusoïdale proche de zéro signifie que les voix sont très susceptibles d’être dissemblables52. La distance euclidienne, souvent appelée similarité euclidienne, est également largement utilisée dans l’IA, l’apprentissage automatique et l’ASR. Il représente la distance en ligne droite entre deux points dans l’espace euclidien53, c’est-à-dire que plus les points sont proches (valeurs de distance plus courtes), plus les voix sont similaires. Pour une compréhension plus claire des résultats rapportés des deux techniques, nous avons effectué une transformation des scores bruts de distance euclidienne en valeurs de zéro (moins de similitude de voix) à un (plus de similitude de voix)54.

figure-protocol-5Figure 5 : Configuration du répertoire pour la perception de la parole. Dossiers d’alignement. Chaque dossier contient six voix L1, la voix cible L2, le script « CreateLineup » et le fichier audio de la gamme vocale (renvoyé après l’exécution du script). Veuillez cliquer ici pour voir une version agrandie de cette figure.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Résultats pour la production vocale
Dans cette section, nous avons décrit la performance des caractéristiques prosodiques-acoustiques statistiquement significatives et des mesures rythmiques. Ces caractéristiques prosodiques étaient la parole, l’articulation et les taux de pause, qui sont liés à la durée, et le chatoiement, qui est lié à la qualité de la voix. Les mesures rythmiques étaient l’écart-type (ET) de la durée de la syllabe, l’écart-type de la consonne, l’écart-type de la durée vocale ou consonantique et le coefficient de variation de la durée de la syllabe (voir le tableau supplémentaire S1).

Le débit de parole (Figure 6A) diminue plus rapidement pour l’anglais L1-L2 que pour la BP L1-L2, bien que le taux soit plus faible pour les deux L2. Le débit de parole est lié à trois paramètres : l’écart-type de la durée de la syllabe (SD-S), l’écart-type des voyelles (SD-V) et le coefficient de variation syllabique (Varco-S). Il est également important de garder à l’esprit que les groupes AmE-S et Bra-S maîtrisent leurs L2. Il semble que ce taux soit affecté par les valeurs plus élevées de la durée des syllabes et la variabilité plus faible produite par L1-L2 BP, provoquant des pentes moins raides.

Le taux d’articulation (Figure 6D) est lié au SD-S, au Varco-S, ainsi qu’au rapport du rythme syllabique (RR-S) ; ce dernier représente le rapport entre les syllabes courtes et longues. De telles mesures semblent affecter le taux d’articulation, tout comme le débit de parole affecté, en raison de la longueur des phrases et de la variation de la durée, ce qui entraîne une planification de la parole L2 plus élevée et une charge cognitive L2 9,23,54. Une charge cognitive-linguistique plus élevée peut être nécessaire dans le domaine de la longueur de la phrase de manière à ce que les paramètres prosodiques-acoustiques soient affectés55.

En ce qui concerne les caractéristiques prosodiques-acoustiques des taux de parole et d’articulation, nos résultats suggèrent que plus un locuteur varie la durée des syllabes (et des voyelles), plus ces taux sont faibles. Nous émettons l’hypothèse que la perception de la parole des BP L1 et L2 semble un peu plus lente que celle de L1 et L2-anglais, et que L1-anglais sonne plus vite que tous les autres niveaux de langue. Ce fait pourrait être lié au rythme de la parole et à l’hypothèse selon laquelle tandis que L1-L2 BP penche vers le pôle rythmé par syllabe du continuum rythmique, l’anglais L1-L2 se déplace vers le pôle temporisé par accentuation21,22.

Le scintillement local, Figure 6B, est influencé par SD-S et Varco-S. Pour le scintillement local, les deux productions de Bra-S, L1-BP et L2-English présentent une trajectoire quelque peu monotone à mesure que la variabilité de la durée des syllabes augmente (SD et Varco, voir le tableau supplémentaire S1). La perception de l’effort vocal peut être apparente à l’écoute des productions de Bra-S en raison d’une faible variation qui se situe entre 8,5 et 9 dB. La parole du soutien-gorge est affectée par la charge vocale. L1-BP est fortement affecté par la longueur des phrases, étant moins sensible aux variations élevées de la durée des syllabes (le motif rythmique de la BP montre moins de variations syllabiques22,56).

Le taux de pause (Figure 6C) montre que les locuteurs de L2-anglais produisent des pauses plus longues (de 200 ms à 375 ms) que les locuteurs L1-anglais, L1-BP et L2-BP (moyenne de 30 ms pour L1-anglais, 50 ms pour L1-BP et 100 ms pour L2-BP). La planification de la parole, dans ce cas, pourrait avoir affecté la production de L2-anglais en raison de l’augmentation de l’activité cérébrale54,57. On s’attend à ce qu’une meilleure maîtrise de la langue se traduise par une vitesse de lecture plus élevée et une plus grande span54 ; néanmoins, même pour les locuteurs maîtrisant la L2, les tâches de lecture présentaient plus d’efforts dans les aspects cognitifs d’ordre supérieur de la parole étrangère et dans le traitement du langage 54,57. Nos résultats montrent, au moins sur une base préliminaire, que les locuteurs de L2-BP peuvent être moins affectés par les pauses que les locuteurs de L2-anglais en raison des différences dans le modèle rythmique des deux langues.

figure-results-1Figure 6 : Modèles additifs généralisés pour les caractéristiques prosodiques-acoustiques. Sur l’axe Y, la variable réponse (les caractéristiques acoustiques à modéliser) ; sur l'axe des abscisses, les variables prédictives (le facteur « Langue » et les covariables dans les modèles additifs qui fourniront la forme et les trajectoires des courbes (c.-à-d. les effets de lissage : « Langue + covariables »), et le produit de la « Langue » et d'une caractéristique métrique qui fournira une projection plus précise de la variable de réponse (c.-à-d. interactions factor-smooth : 'covariable :Langue'). Abréviation : GAMs = Generalized Additive Models. Veuillez cliquer ici pour voir une version agrandie de cette figure.

En ce qui concerne les métriques rythmiques, pour le SD-S (Figure 7A), nos résultats révèlent que plus un locuteur fait varier la courbe f0 et augmente le débit de parole, plus le SD-S diminue pour tous les niveaux de langage (un effet miroir de Figure 6A). Dans le cas du SD pour les consonnes (SD-C, Figure 7C), L1-BP, contrairement à l’anglais L1, effectue une faible variation à mesure que le débit de parole ou la durée de la pause augmente. Une telle direction SD est prédite puisque la variabilité L1-anglais de la durée de la syllabe est (statistiquement) significativement plus élevée que L1-BP44,58. Le Varco-S (Figure 7B et Tableau supplémentaire S1) semble quelque peu corrélé à la L1 et à la L2 du même groupe linguistique. Au fur et à mesure que la variabilité de f0 et le débit de parole augmentent, le Varco-S diminue pour le L1-BP et semble diminuer et s’atténuer pour le L2-BP. Pour les productions anglaises, alors que la variabilité de f0 et le débit de parole augmentent, Varco-S augmente et s’atténue pour L1-anglais et L2-anglais.

En ce qui concerne le ET pour les voyelles ou les consonnes (SD-V_C, Figure 7D et la Table supplémentaire S1), nos résultats montrent certaines similitudes avec la performance de Varco-S (Figure 7B). Par exemple, un débit de parole plus élevé, une durée de pause et une variabilité f0 favorisent une trajectoire descendante-montante du SD-V_C pour L1-BP et pour le L2-BP. Dans les productions anglaises, bien que ces caractéristiques prosodiques soient plus élevées, le SD-V_C diminue légèrement, s’atténue pour L1-anglais, augmente légèrement, puis s’atténue pour L2-anglais. La corrélation Varco-S et SD-V_C avec L1-L2 des mêmes groupes linguistiques peut s’expliquer en partie par l’effet Lombard, qui fait référence à l’altération des paramètres acoustiques dans la parole due au bruit de fond59.

Dans le discours étranger, en fonction de la complexité de la tâche (par exemple, lire un discours), les locuteurs ont utilisé des stratégies acoustiques similaires sur L1 et L259,60. D’une part, Marcoux et Ernestus ont constaté que les mesures f0 (plage et médiane) dans le discours lombard L2 suggèrent que les anglophones L2 étaient influencés par leur néerlandais L161,62. D’autre part, des résultats plus récents suggèrent que, bien que l’on s’attende à ce que le discours lombard L2 diffère du discours lombard L1 en raison de la charge cognitive plus élevée lors de l’expression de la L2, les anglophones de L2 produisent un discours lombard dans la même direction que les anglophones de L163. La mesure dans laquelle nos résultats sont alignés avec Marcoux et Ernestus63 et divergent de Waaning59, Villegas et al.60, et Marcoux et Ernestus61,62 nécessite une enquête plus approfondie.

figure-results-2Figure 7 : Modèles additifs généralisés pour les caractéristiques métriques. Sur l’axe Y, la variable réponse (les caractéristiques métriques à modéliser) ; sur l'axe des abscisses, les variables prédictives (le facteur « Langue » et les covariables dans les modèles additifs qui fourniront la forme et les trajectoires des courbes (c.-à-d. les effets de lissage : « Langue + covariables »), et le produit de la « Langue » et d'une caractéristique métrique qui fournira une projection plus précise de la variable de réponse (c.-à-d. interactions factor-smooth : 'covariable :Langue'). Abréviation : GAMs = Generalized Additive Models. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Résultats pour la perception de la parole
En ce qui concerne les alignements de voix BP, dans l’alignement #1 (Figure 8A), la voix de feuille #3 a été jugée comme étant la voix cible. En fait, la voix cible était la voix #4. Les résultats ne montrent aucune différence statistiquement significative (voir le tableau supplémentaire S1) entre la feuille #3 (83 %) et la voix cible #4 (71 %). Dans la file d’attente #2 (Figure 8B), une comparaison entre la voix cible #3 (40 %) et la feuille #4 (20 %) n’a pas non plus montré de différence statistiquement significative (voir le tableau supplémentaire S1) pour les listes de voix anglaises. Dans la file d’attente #1 (Figure 9A), il n’y avait pas de différence significative (voir le tableau supplémentaire S1) entre le fleuret #2 (26 %) et la voix cible #4 (54 %).

Dans l’analyse de la similarité de voix, la similarité cosinusoïdale (CoSim) et la distance euclidienne (EucDist, [EucDist transformed]54) ont montré une corrélation cohérente entre le foil #3 et la cible pour la gamme de BP #1 (CoSim = 0,99 ; EucDist = 77,4, [0,93]). La corrélation entre le fleuret #4 et la cible était tout aussi forte dans la gamme BP #2 (CoSim = 0,99, EucDist = 76,3, [0,93]). Dans la gamme anglaise #1, la corrélation était cohérente pour CoSim (0,83), mais faible à satisfaisante pour EucDist (213,0, [0,47]. Dans l’ensemble, CoSim et EucDist ont été des techniques satisfaisantes pour déterminer la similitude des voix. De plus, CoSim a fonctionné un peu plus efficacement, comme l’ont expliqué Gahman et Elangovan52(voir le tableau supplémentaire S1).

En termes de similitude, qu’est-ce qui aurait pu conduire à une augmentation des fausses alarmes ? Les caractéristiques acoustiques prosodiques ont montré que, bien que les feuilles et les voix cibles se comportaient (statistiquement) significativement différemment - à l'exception des alignements présentés dans Figure 8A,B et Figure 9A-, les choix des auditeurs se sont quelque peu diversifiés le long des différents feuilles dans les autres alignements (Figure 8C,D, et Figure 9B-D). Un tel jugement semble dépendre davantage d’une (ou peut-être plusieurs) caractéristique acoustique spécifique que les locuteurs partagent que de toute une classe de caractéristiques acoustiques prosodiques. Par exemple, notre étude a présenté plusieurs caractéristiques (co)variant entre les productions ; Néanmoins, les résultats perceptifs montrent les préférences des jugements pour qu'une feuille spécifique corresponde à la voix cible8,35,64,65. D’autres analyses sont nécessaires dans les travaux futurs.

Il convient de noter que le choix d’une matrice paramétrique multidimensionnelle pour la similarité acoustique66 est celui présenté dans cette étude. Nos résultats sont alignés avec des études antérieures qui utilisaient des caractéristiques acoustiques basées sur f0, VQ et intensity9,35. De telles fonctionnalités sont remarquablement suggérées pour les tâches de comparaison de haut-parleurs dans le domaine de l’investigation 9,66. Il est néanmoins important de souligner que dans la présente recherche, aucune des feuilles n'a été prédite comme étant similaire à la voix cible, bien que nous ayons utilisé une variante des directives de McFarlane 16,17 dans la préparation des alignements vocaux pour la reconnaissance des locuteurs à accent étranger. De plus, nous devons souligner que notre procédure d'alignement des voix contient des différences importantes par rapport aux directives de McFarlane, y compris la longueur du stimulus, le nombre de voix, la sélection des feuilles (randomisée ici) et le style de parole.

Dans quelle mesure les caractéristiques acoustiques prosodiques de f0, la qualité et l'intensité de la voix semblent être liées à la perception des auditeurs dépendrait fortement du style de parole utilisé dans la recherche. Ici, nous avons utilisé des passages de lecture. La majorité des études sur les témoins auditifs optent pour des stimuli (semi-)spontanés comme solution équilibrée - par exemple, le corpus DyVis 67 - qui a été largement utilisé dans les enquêtes contemporaines sur les témoins auditifs28,68. La raison qui nous a amenés à choisir les tâches de lecture est que notre corpus, au moment de la composition de ce manuscrit, était constitué exclusivement de données obtenues à partir de tâches de lecture. Il est toutefois important de reconnaître que le processus de compilation d’un corpus (semi-)spontané est déjà en cours. De plus, le fait de lire une histoire peut générer un niveau fiable d’uniformité et de variation, à la fois au sein du locuteur et entre les locuteurs. Cela facilite l’accent sur les caractéristiques prosodiques ou phonétiques, individuelles ou dialectales, dans des situations impliquant une comparaison de voix. Cela devient particulièrement visible dans les cas de charge vocale lors de la production d’un accent étranger, même parmi les locuteurs compétents 8,9,23,54.

figure-results-3Figure 8 : Diagrammes contenant les résultats des quatre alignements réalisés par les auditeurs brésiliens. (A,B) Différence non significative entre la voix cible (en bleu) et une feuille (en bleu clair). (C,D) différences significatives par rapport aux feuilles et à la voix cible. Abréviation : NS = non significatif. Veuillez cliquer ici pour voir une version agrandie de cette figure.

figure-results-4Figure 9 : Diagrammes à barres contenant les résultats des quatre alignements effectués par les auditeurs américains. (A) Différence non significative entre la voix cible (en rouge) et une feuille (en rose). (B, C, D) Différences significatives entre les foils et la voix cible. Abréviation : NS = non significatif. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Tableau supplémentaire S1 : Statistiques de production de la parole - Modèles additifs généralisés (GAMs) : Les statistiques F (degrés de liberté), le R2 ajusté de chaque caractéristique prosodique-acoustique statistiquement significative (Figure 6), et la métrique rythmique (Figure 7) par niveau de langue, ainsi que les valeurs individuelles de chaque terme lisse (les covariables). Statistiques de perception de la parole : Les statistiques de Kruskall-Wallis χ2 (degrés de liberté), les valeurs p et le η2 ajusté, ainsi qu'un test de Dunn post-hoc pour la comparaison par paires (Figure 8 et Figure 9) de chaque différence statistiquement non significative entre les paires de voix cible-feuille (Figure 8A,B et ="xfig">Figure 9A). Matrices de similarité acoustique pour la distance cosinusoïdale et euclidienne de chaque alignement. Veuillez cliquer ici pour voir une version agrandie de cette figure.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le protocole actuel présente une nouveauté dans le domaine de la phonétique (médico-légale). Elle est divisée en deux phases : l’une basée sur la production (analyse acoustique) et l’autre basée sur la perception (analyse du jugement). La phase d’analyse de la production comprend la préparation des données et l’alignement forcé, le réalignement et l’extraction automatique des caractéristiques acoustiques prosodiques en plus des statistiques. Ce protocole relie l’étape de collecte des données à l’analyse des données de manière plus rapide et plus efficace que les protocoles traditionnels basés sur une segmentation principalement manuelle.

Cependant, le processus de réalignement, illustré dans les étapes de protocole 1.3.6 à 1.3.6.9, fonctionne essentiellement sur les unités de téléphone et de mot générées dans les étapes de protocole 1.3.1 à 1.3.4. La nouveauté du processus de réalignement est qu’il génère un nouveau TextGrid contenant trois nouveaux niveaux de texte : un niveau syllabique, un niveau de bloc de parole qui peut être généré automatiquement ou manuellement en fonction des mots, et un niveau de ton qui peut être très utile pour calculer les mesures f0. Les lignes directrices de réalignement proposées pour ce protocole ont déjà été utilisées dans des études sur le rythme de parole L2 21,69,70, des études sur la détection du degré d’accent étranger à l’aide de techniques d’apprentissage automatique22 et des études dans le domaine médico-légal 9.

L’extraction automatique des caractéristiques prosodiques, présentée dans les étapes de protocole 1.3.7 à 1.3.7.10, génère une matrice multidimensionnelle de caractéristiques prosodiques-acoustiques comme on a pu en témoigner dans la recherche actuelle. Ces caractéristiques comprennent des caractéristiques mélodiques, temporelles et spectrales (qualité et intensité de la voix)71. Un nombre considérable de ces caractéristiques acoustiques sont moins sensibles et quelque peu résistantes aux enregistrements audio bruyants qui finissent par être recueillis dans le cadre de la criminalistique ou de tout autre scénario72. De plus, la matrice multidimensionnelle peut être appliquée aux systèmes de reconnaissance vocale via plusieurs techniques d’IA (travaux en cours). Il peut encore être très utile dans l’enseignement des aspects prosodiques dans les cours de prononciationL2 21 (travail en cours).

L’analyse statistique de cette partie du protocole représente l’utilisation de la méthode GAM puisque nous avons traité une relation complexe entre une caractéristique acoustique spécifique et plusieurs locuteurs à facteur de langue. Pour modéliser une caractéristique acoustique spécifique, par exemple, il était nécessaire de vérifier comment d’autres caractéristiques acoustiques de la matrice (les termes lisses) se comporteraient afin de pouvoir décrire plus précisément ce qui se passait pendant la production de la parole.

En ce qui concerne l’analyse de perception, le protocole actuel a été constitué par la préparation et la mise en œuvre des alignements de voix, l’analyse statistique et l’analyse de similarité acoustique. Pour préparer les alignements, nous avons utilisé le script CreateLineup pour Praat, qui génère automatiquement un fichier audio pour chaque alignement contenant des feuilles séquencées de manière aléatoire et la voix cible, comme décrit dans les étapes de protocole 2.2 à 2.2.1.9.

Pour l’analyse statistique de ce protocole, nous avons effectué le test non paramétrique de Kruskal-Wallis car nos données ne répondaient pas aux hypothèses de l’analyse de variance (ANOVA). Une fois que nous avons établi une relation entre les scores de jugement évalués par les auditeurs et contrôlés pour la voix cible et les feuilles, nous avons choisi d’utiliser les statistiques du modèle linéaire.

Pour l’analyse de similarité acoustique, nous avons utilisé le script AcousticSmilarity_cosine_euclidean pour Python. Le programme ouvre l'arborescence des répertoires de l'ordinateur et demande à l'utilisateur de choisir le fichier contenant les caractéristiques prosodiques-acoustiques des feuilles et la voix cible qui compose la composition de la composition de l'alignement en analyse. D'un simple clic, le script génère trois matrices de similarité : un cosinus, un euclidien et un euclidien transformé (de zéro à un), sur les fichiers '.txt' (délimités par des tabulations) et '.csv. Nous devons toujours garder à l'esprit que chaque ensemble de données (le fichier '.txt' contenant les caractéristiques prosodiques-acoustiques des feuilles et de la cible) doit être dans le dossier d'origine de la programmation, et chaque dossier de programmation doit avoir une copie du script AcousticSmilarity_cosine_euclidean .

En résumé, le protocole actuel fait progresser la recherche phonétique (médico-légale). Comprenant des phases distinctes - analyses de production et de perception, ainsi que de similarité acoustique - il comble le fossé entre la collecte de données et l’analyse multidimensionnelle des caractéristiques acoustiques. Les chercheurs peuvent bénéficier d’une perspective holistique, en explorant à la fois les aspects de production et de perception. De plus, ce protocole garantit la reproductibilité de la recherche, permettant à d’autres de s’appuyer sur les lignes directrices de ce travail.

Limites et orientations futures
Nous devons toujours garder à l’esprit que tout se passera bien si la préparation des données suit les directives proposées dans les étapes de protocole 1.3.1 à 1.3.4. En outre, dans les procédures d'alignement forcé, nous devons être conscients qu'un aligneur forcé externe pré-entraîné - comme MAUS utilisé dans le travail actuel - est susceptible d'erreurs de segmentation, en particulier dans les données accentuées étrangères non pré-entraînées ou même dans les aligneurs pré-entraînés, que l'audio n'ait pas une bonne qualité ou que l'aligneur ne contienne pas le langage audio (ce fait rendrait le travail de l'expert plus difficile et plus long). La transcription médico-légale, en particulier des fichiers audio plus longs, rencontre des difficultés en ce qui concerne la représentation précise et fiable des enregistrements parlés72.

La transcription et l’alignement de fichiers audio plus longs présentent également plusieurs défis. Les performances des aligneurs sont influencées par le style de parole et l’environnement phonétique, ainsi que par des facteurs spécifiques au dialecte. Bien qu’il existe des différences spécifiques aux aligneurs, en général, leurs performances sont similaires et génèrent des segmentations qui se comparent bien à l’alignement manuel dans son ensemble73. De plus, la production anglaise L1 et L2 a été exécutée avec un modèle acoustique pré-entraîné de l’anglais américain en raison de l’indisponibilité de modèles de parole étrangers dans MAUS. De plus, il n’existe pas de modèles acoustiques pré-entraînés pour la PA dans les MAUS. Pour les données BP, les modèles acoustiques italiens préexistants ont été utilisés (voir NOTE, étape de protocole 1.3.5.7).

Dans le cadre de travaux futurs (en cours), nous utiliserons l’aligneur forcé de Montréal (AMF)74 dans le cadre du protocole. L’un des grands avantages de l’authentification multifacteur est la disponibilité de modèles acoustiques pré-entraînés et de modèles graphème-phonème pour une grande variété de langues (y compris BP), ainsi que la possibilité d’entraîner de nouveaux modèles acoustiques et graphème-phonème à n’importe quel nouvel ensemble de données (c’est-à-dire notre corpus vocal avec accent étranger)75.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs n’ont aucun conflit d’intérêts à déclarer.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cette étude a été soutenue par le Conseil national pour le développement scientifique et technologique - CNPq, subvention n° 307010/2022-8 pour le premier auteur, et subvention n° 302194/2019-3 pour le deuxième auteur. Les auteurs tiennent à exprimer leur sincère gratitude aux participants à cette recherche pour leur généreuse collaboration et leurs contributions inestimables.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
CreateLineupPersonal collection#Script for praat pour la préparation des alignements vocaux
Dell I3 (avec disque SSD - Solid State Drive)  ;Dell#Ordinateur portable
Praat PaulBoersma & David Weenink#Logiciel d’analyse phonétique
Python 3Python Software Foundation#Langage de programmation interprété, de haut niveau et à usage général.
RLe Projet R pour l’Informatique Statistique#Langage de programmation pour l’informatique statistique
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorCollection personnelle#Script pour praat pour l’extraction automatique de caractéristiques acoustiques
SurveyMonkeySurveyMonkey Inc.#Assemblez des enquêtes personnalisables gratuites, ainsi qu’une suite de programmes back-end qui incluent l’analyse des données, la sélection d’échantillons, la suppression des biais et la représentation des données.
Tascam DR-100 MKIITascam#Enregistreur vocal numérique
Système de segmentation automatique de Munich MAUSUniversité de Munich#Alignement forcé de fichiers audio (.wav) et d’informations linguistiques (.txt)
VVUnitAlignerPersonal collection#Script pour praat pour le réalignement automatique et le post-traitement des unités phonétiques

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

Caract ristiques prosodiquesperception de la parolequalit de la voixfr quence fondamentalereconnaissance du locuteursimilitude acoustique

Articles connexes