Résultats pour la production de la parole
Dans cette section, nous avons décrit la performance des caractéristiques prosodiques-acoustiques et des métriques rythmiques statistiquement significatives. Ces caractéristiques prosodiques comprenaient les débits de parole, d'articulation et de pauses, qui sont liés à la durée, ainsi que le scintillement (shimmer), qui est lié à la qualité vocale. Les métriques rythmiques étaient l'écart type (SD) de la durée des syllabes, l'écart type des consonnes, l'écart type de la durée vocale ou consonantique, et le coefficient de variation de la durée des syllabes (voir le Tableau supplémentaire S1).
Le rythme de parole (Figure 6A) diminue plus rapidement pour le passage de l'anglais L1 à l'anglais L2 que pour le passage du portugais L1 au portugais L2, bien que le rythme soit inférieur pour les deux L2. Le rythme de parole est lié à trois paramètres — l'écart type de la durée des syllabes (SD-S), l'écart type des voyelles (SD-V) et le coefficient de variation syllabique (Varco-S). Il est également important de noter que les groupes AmE-S et Bra-S maîtrisent tous deux leur L2. Il semble que ce rythme soit influencé par les valeurs plus élevées de la durée des syllabes et la variabilité plus faible produite par les locuteurs de L1-L2 BP, entraînant des pentes moins accentuées.
Le t aux d'articulation (Figure 6D) est lié au SD-S, au Varco-S, ainsi qu'au rapport de rythme syllabique (RR-S) ; ce dernier représente le rapport entre les syllabes plus courtes et plus longues. Ces métriques semblent influencer le taux d'articulation de la même manière que le taux de parole est affecté par la longueur des phrases et les variations de durée, entraînant une planification accrue de la parole en L2 et une charge cognitive en L29,23,54. Une charge cognitivo-linguistique plus élevée peut être requise dans le domaine de la longueur des phrases, de sorte que les paramètres prosodiques et acoustiques sont affectés55.
En ce qui concerne les caractéristiques prosodiques et acoustiques de la parole et des vitesses d'articulation, nos résultats indiquent que plus un locuteur fait varier la durée des syllabes (et des voyelles), plus ces vitesses sont faibles. Nous émettons l'hypothèse que la perception de la parole, tant en BP L1 qu'en BP L2, semble quelque peu plus lente qu'en anglais L1 et L2, et que l'anglais L1 paraît plus rapide que tous les autres niveaux linguistiques. Ce phénomène pourrait être lié au rythme de la parole et à l'hypothèse selon laquelle, tandis que le BP L1-L2 s'oriente vers le pôle syllabique du continuum rythmique, l'anglais L1-L2 évolue vers le pôle accentué21,22.
Le scintillement local, Figure 6B, est influencé par le SD-S et le Varco-S. Pour le scintillement local, les productions en Bra-S, en L1-BP et en L2-anglais présentent toutes une trajectoire quelque peu monotone à mesure que la variabilité de la durée des syllabes augmente (SD et Varco, voir Tableau supplémentaire S1). La perception de l'effort vocal peut être perceptible à l'écoute des productions en Bra-S, en raison d'une faible variation comprise entre 8,5 et 9 dB. La parole en Bra-S est affectée par la charge vocale. Le L1-BP est fortement influencé par la longueur de la phrase et est moins sensible aux fortes variations de la durée syllabique (le schéma rythmique du BP montre une moindre variation syllabique22,56).
Le t aux de pauses (Figure 6C) montre que les locuteurs anglophones L2 produisent des pauses plus longues (de 200 ms à 375 ms) que les locuteurs anglophones L1, les locuteurs brésilien-portugais L1 et les locuteurs brésilien-portugais L2 (moyenne de 30 ms pour les anglophones L1, 50 ms pour les brésilien-portugais L1 et 100 ms pour les brésilien-portugais L2). Dans ce cas, la planification de la parole pourrait avoir affecté la production en anglais L2 en raison d'une activité cérébrale accrue54,57. On s'attend à ce qu'un niveau de compétence linguistique plus élevé entraîne une vitesse et une portée de lecture plus grandes54 ; néanmoins, même pour les locuteurs L2 compétents, les tâches de lecture impliquent davantage d'efforts dans les aspects cognitifs de haut niveau liés à la parole étrangère et au traitement linguistique54,57. Nos résultats montrent, du moins de manière préliminaire, que les locuteurs brésilien-portugais L2 pourraient être moins affectés par les pauses que les locuteurs anglais L2, en raison de différences dans le schéma rythmique des deux langues.

Figure 6 : Modèles additifs généralisés pour les caractéristiques prosodiques et acoustiques. Sur l'axe des ordonnées, la variable réponse (les caractéristiques acoustiques à modéliser) ; sur l'axe des abscisses, les variables explicatives (le facteur « Langue » et les covariables dans les modèles additifs qui détermineront la forme et les trajectoires des courbes (c’est-à-dire les effets de lissage : « Langue + covariables »), ainsi que le produit du facteur « Langue » et d’une caractéristique métrique qui permettra une projection plus précise de la variable réponse (c’est-à-dire les interactions facteur-lissage : « covariable:Langue »). Abréviation : GAMs = Modèles additifs généralisés. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
En ce qui concerne les métriques du rythme, pour SD-S (Figure 7A), nos résultats révèlent que plus un locuteur fait varier la courbe de F0 et augmente la vitesse de parole, plus SD-S diminutions pour tous les niveaux linguistiques (un effet miroir de Figure 6A). Dans le cas de l'écart type (SD) pour les consonnes (SD-C, Figure 7C), le L1-BP, contrairement au L1 anglais, présente une faible variation lorsque le débit vocal ou la durée des pauses augmente. Ce sens de la variation standardisée est prédit, puisque la variabilité de la durée des syllabes en L1 anglais est (statistiquement) significativement plus élevée qu'en L1-BP.44,58. Le Varco-S (Figure 7B et Tableau supplémentaire S1) semble être quelque peu corrélée aux L1 et L2 du même groupe linguistique. Lorsque la variabilité de la fréquence fondamentale (f0) et la vitesse de parole augmentent, le Varco-S diminue pour le L1-BP et semble diminuer et s'atténuer pour le L2-BP. Pour les productions en anglais, tandis que la variabilité de la fréquence fondamentale (f0) et la vitesse de parole augmentent, Vitesse de parole augmente, Varco-S augmente et atténue pour L1-anglais et L2-anglais.
Concernant l'ÉT pour les voyelles ou les consonnes (SD-V_C, Figure 7D et Tableau supplémentaire S1), nos résultats montrent certaines similitudes avec les Varco-S performanceFigure 7B). Par exemple, des valeurs plus élevées Vitesse de parole, Durée de pause, et variabilité de f0 favoriser une trajectoire de chute puis de remontée de la SD-V_C pour L1-BP et pour L2-BP. Dans les productions en anglais, bien que ces caractéristiques prosodiques soient plus marquées, SD-V_C diminue légèrement, s'atténue pour l'anglais L1, augmente légèrement, puis s'atténue pour l'anglais L2. Le Varco-S et le SD-V_C la corrélation avec le L1-L2 des mêmes groupes linguistiques pourrait être partiellement expliquée par l'effet Lombard, qui désigne l'altération des paramètres acoustiques de la parole en raison du bruit de fond59.
Dans la parole étrangère, selon la complexité de la tâche (par exemple, parole lue), les locuteurs ont utilisé des stratégies acoustiques similaires en L1 et en L259,60. D’un côté, Marcoux et Ernestus ont constaté que les mesures de f0 (plage et médiane) dans la parole Lombard en L2 suggèrent que les locuteurs anglophones en L2 étaient influencés par leur néerlandais en L161,62. D’un autre côté, des découvertes plus récentes proposent que, bien que la parole Lombard en L2 doive différer de la parole Lombard en L1 en raison de la charge cognitive plus élevée lors de l’utilisation de la L2, les locuteurs anglophones en L2 produisent une parole Lombard dans la même direction que les locuteurs anglophones en L163. Dans quelle mesure nos résultats concordent avec ceux de Marcoux et Ernestus63 et s’écartent de Waaning59, Villegas et al.60, et Marcoux et Ernestus61,62 nécessite des recherches supplémentaires.

Figure 7 : Modèles additifs généralisés pour les caractéristiques métriques. Sur l’axe des ordonnées, la variable réponse (les caractéristiques métriques à modéliser) ; sur l’axe des abscisses, les variables explicatives (le facteur « Langue » et les covariables dans les modèles additifs qui détermineront la forme et les trajectoires des courbes (c’est-à-dire les effets de lissage : « Langue + covariables »), ainsi que le produit du facteur « Langue » et d’une caractéristique métrique, qui permettra une projection plus précise de la variable réponse (c’est-à-dire les interactions facteur-lissage : « covariable:Langue »). Abréviation : GAMs = Modèles additifs généralisés. Veuillez cliquer ici pour afficher une version agrandie de cette figure.
Résultats concernant la perception de la parole
En ce qui concerne les séries vocales BP, dans la série n°1 (Figure 8A), la voix parasite n°3 a été jugée comme étant la voix cible. En réalité, la voix cible était la voix n°4. Les résultats ne montrent aucune différence statistiquement significative (voir Tableau supplémentaire S1) entre la voix parasite n°3 (83 %) et la voix cible n°4 (71 %). Dans la série n°2 (Figure 8B), une comparaison entre la voix cible n°3 (40 %) et la voix parasite n°4 (20 %) n’a également révélé aucune différence statistiquement significative (voir Tableau supplémentaire S1) pour les séries vocales anglaises. Dans la série n°1 (Figure 9A), aucune différence significative (voir Tableau supplémentaire S1) n’a été observée entre la voix parasite n°2 (26 %) et la voix cible n°4 (54 %).
Dans l'analyse de la similarité vocale, la similarité cosinus (CoSim) et la distance euclidienne (EucDist, [EucDist transformée]54) ont montré une corrélation constante entre le témoin n°3 et la cible pour le groupe d'identification BP n°1 (CoSim = 0,99 ; EucDist = 77,4, [0,93]). La corrélation entre le témoin n°4 et la cible était tout aussi forte dans le groupe d'identification BP n°2 (CoSim = 0,99 ; EucDist = 76,3, [0,93]). Dans le groupe d'identification anglais n°1, la corrélation était constante pour CoSim (0,83), mais faible à satisfaisante pour EucDist (213,0, [0,47]). Dans l'ensemble, les deux techniques, CoSim et EucDist, se sont révélées satisfaisantes pour déterminer la similarité vocale. En outre, CoSim s'est avérée légèrement plus efficace, comme indiqué par Gahman et Elangovan52 (voir Tableau supplémentaire S1).
En ce qui concerne la similarité, qu'est-ce qui aurait pu entraîner une augmentation des fausses alarmes ? Les caractéristiques prosodiques et acoustiques ont montré que, bien que les voix distractrices et les voix cibles se comportent de manière significativement différente (sur le plan statistique) — à l'exception des séries présentées dans la Figure 8A,B et la Figure 9A — les choix des auditeurs se sont quelque peu diversifiés selon les différentes voix distractrices dans les autres séries (Figure 8C,D et Figure 9B-D). Ce type de jugement semble dépendre davantage d'une (ou peut-être plusieurs) caractéristique acoustique spécifique partagée par les locuteurs, plutôt qu'un ensemble complet de caractéristiques prosodiques et acoustiques. Par exemple, notre étude a mis en évidence plusieurs caractéristiques variant (ou covariant) entre les productions ; néanmoins, les résultats perceptifs montrent une préférence dans les jugements pour une voix distracter spécifique correspondant à la voix cible8,35,64,65. Des analyses supplémentaires seront nécessaires dans des travaux futurs.
Il est important de considérer le choix d'une matrice paramétrique multidimensionnelle pour la similarité acoustique66, telle que celle présentée dans cette étude. Nos résultats concordent avec des études antérieures ayant utilisé des caractéristiques acoustiques fondées sur le f0, la VQ et l'intensité9,35. Ces caractéristiques sont fortement recommandées pour les tâches de comparaison de locuteurs dans le domaine médico-légal9,66. Il est toutefois essentiel de souligner que, dans la présente recherche, aucun des locuteurs distracteurs n'a été prédit comme étant similaire à la voix cible, bien que nous ayons utilisé une variante des recommandations de McFarlane16,17 lors de la préparation des séries vocales pour la reconnaissance de locuteurs présentant un accent étranger. En outre, nous devons insister sur le fait que notre procédure de présentation de séries vocales comporte des différences importantes par rapport aux recommandations de McFarlane, notamment en ce qui concerne la durée des stimuli, le nombre de voix, la sélection des distracteurs (ici aléatoire) et le style de parole.
Dans quelle mesure les caractéristiques prosodiques et acoustiques de la fréquence fondamentale (f0), de la qualité vocale et de l'intensité semblent-elles liées à la perception des auditeurs dépend fortement du style de parole utilisé dans la recherche. Ici, nous avons utilisé des textes lus. La majorité des études en témoignage auditif optent pour des stimuli (semi-)spontanés comme solution équilibrée — par exemple, le corpus DyVis67 — qui a été largement utilisé dans les enquêtes contemporaines sur le témoignage auditif28,68. La raison pour laquelle nous avons choisi des tâches de lecture est que notre corpus, au moment de la rédaction de cet article, se composait exclusivement de données issues de tâches de lecture. Il est toutefois important de noter que le processus de constitution d'un corpus (semi-)spontané est déjà en cours. En outre, le fait de lire une histoire peut générer un niveau fiable d'uniformité et de variation, tant intra- qu'inter-locuteur. Cela facilite la mise en évidence de caractéristiques prosodiques ou phonétiques — individuelles ou dialectales — dans les situations de comparaison vocale. Ce phénomène devient particulièrement évident dans les cas de charge vocale lors de la production d'un accent étranger, même parmi des locuteurs compétents 8,9,23,54.

Figure 8 : Graphiques en barres présentant les résultats des quatre séries d'identification réalisées par les auditeurs brésiliens. (A,B) Différence non significative entre la voix cible (en bleu) et une voix distrayante (en bleu clair). (C,D) Différences significatives par rapport aux voix distrayantes et à la voix cible. Abréviation : NS = non significatif. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 9 : Graphiques en barres présentant les résultats des quatre séries d'identification réalisées par les auditeurs américains. (A) Différence non significative entre la voix cible (en rouge) et une voix distrayante (en rose). (B,C,D) Différences significatives entre les voix distrayantes et la voix cible. Abréviation : NS = non significatif. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Tableau supplémentaire S1 : Statistiques de production de la parole - Modèles additifs généralisés (GAM) : les statistiques F (degrés de liberté), le R2 ajusté de chaque caractéristique prosodique-acoustique statistiquement significative (Figure 6), et chaque métrique de rythme (Figure 7) par niveau linguistique, ainsi que les valeurs individuelles de chaque terme lissé (les covariables). Statistiques de perception de la parole : les statistiques χ2 de Kruskall-Wallis (degrés de liberté), les valeurs-p, et l'η2 ajusté, ainsi qu'un test post-hoc de Dunn pour la comparaison par paires (Figure 8 et Figure 9) de chaque différence statistiquement non significative entre les paires de voix cible et voix distractrice (Figure 8A,B et Figure 9A). Matrices de similarité acoustique pour les distances cosinus et euclidienne de chaque série. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.