Resultados para la producción del habla
En esta sección, describimos el desempeño de las características prosódico-acústicas y métricas rítmicas estadísticamente significativas. Dichas características prosódicas fueron las tasas de habla, articulación y pausas, que se relacionan con la duración, y el temblor, que se relaciona con la calidad de la voz. Las métricas rítmicas fueron la desviación estándar (SD) de la duración silábica, SD de consonante, SD de duración vocálica o consonántica y el coeficiente de variación de la duración silábica (véase la Tabla Suplementaria S1).
La velocidad del habla (Figura 6A) disminuye más rápidamente en inglés L1-L2 que en portugués brasileño L1-L2, aunque la velocidad es menor en ambos L2. La velocidad del habla se relaciona con tres métricas: desviación estándar de la duración silábica (SD-S), desviación estándar de las vocales (SD-V) y el coeficiente de variación silábico (Varco-S). También es importante tener en cuenta que tanto el grupo de hablantes de inglés americano como el de portugués brasileño son competentes en sus L2. Parece que dicha velocidad se ve afectada por los valores más altos de duración silábica y la menor variabilidad producida por el L1-L2 en portugués brasileño, lo que provoca pendientes menos pronunciadas.
La tasa de articulación (Figura 6D) está relacionada con SD-S, Varco-S, así como con la relación del ritmo silábico (RR-S); esta última representa la proporción entre sílabas más cortas y más largas. Dichas métricas parecen afectar la tasa de articulación de manera similar a como la tasa de habla se ve afectada por la longitud de la oración y la variación en la duración, lo que conduce a una mayor planificación del habla en un segundo idioma (L2) y a una mayor carga cognitiva en L29,23,54. Puede requerirse una carga cognitivo-lingüística mayor en el dominio de la longitud de la oración, de tal forma que se vean afectados los parámetros prosódico-acústicos55.
Con respecto a las características prosódico-acústicas de las tasas de habla y articulación, nuestros hallazgos sugieren que cuanto más varía un hablante la duración de las sílabas (y vocales), más bajas son dichas tasas. Planteamos la hipótesis de que la percepción del habla tanto del portugués brasileño L1 como del L2 suena algo más lenta que el inglés L1 y L2, y que el inglés L1 suena más rápido que todos los demás niveles lingüísticos. Este hecho podría estar relacionado con el ritmo del habla y con la hipótesis de que, mientras el portugués brasileño L1-L2 se inclina hacia el polo silábico del continuo rítmico, el inglés L1-L2 se desplaza hacia el polo acentual21,22.
El brillo local, Figura 6B, se ve influenciado por SD-S y Varco-S. Para el brillo local, las producciones de Bra-S, L1-BP y L2-inglés presentan una trayectoria algo monótona a medida que aumenta la variabilidad de la duración silábica (SD y Varco, véase la Tabla S1 suplementaria). La percepción del esfuerzo vocal podría ser evidente al escuchar las producciones de Bra-S debido a una baja variación que oscila entre 8,5 y 9 dB. El habla de Bra-S se ve afectada por la carga vocal. El L1-BP se ve altamente afectado por la longitud de la oración y es menos sensible a las altas variaciones en la duración silábica (el patrón rítmico del BP muestra menos variación silábica22,56).
La tasa de pausas (Figura 6C) muestra que los hablantes de inglés como segunda lengua producen pausas más largas (de 200 ms a 375 ms) que los hablantes de inglés como primera lengua, portugués brasileño como primera lengua y portugués brasileño como segunda lengua (un promedio de 30 ms para inglés como primera lengua, 50 ms para portugués brasileño como primera lengua y 100 ms para portugués brasileño como segunda lengua). La planificación del habla, en este caso, podría haber afectado la producción del inglés como segunda lengua debido a un aumento en la actividad cerebral54,57. Se espera que una mayor competencia lingüística resulte en una velocidad y amplitud de lectura mayores54; sin embargo, incluso para hablantes competentes en una segunda lengua, las tareas de lectura implicaron un esfuerzo mayor en aspectos cognitivos de orden superior del habla extranjera y en el procesamiento del lenguaje54,57. Nuestros hallazgos muestran, al menos de forma preliminar, que los hablantes de portugués brasileño como segunda lengua podrían verse menos afectados por las pausas que los hablantes de inglés como segunda lengua, debido a diferencias en el patrón rítmico de ambas lenguas.

Figura 6: Modelos Aditivos Generalizados para las características prosódico-acústicas. En el eje Y, la variable respuesta (las características acústicas que se van a modelar); en el eje X, las variables predictoras (el factor «Idioma» y las covariables en los modelos aditivos que proporcionarán la forma y las trayectorias de las curvas (es decir, los efectos de suavizado: «Idioma + covariables»), y el producto del factor «Idioma» y una característica métrica que proporcionará una proyección más precisa de la variable respuesta (es decir, interacciones factor-suavizado: «covariable:Idioma»). Abreviatura: GAMs = Modelos Aditivos Generalizados. Haga clic aquí para ver una versión más grande de esta figura.
En relación con las métricas rítmicas, para SD-S (Figura 7A), nuestros hallazgos revelan que cuanto más un hablante varía la curva de f0 y aumenta la velocidad del habla, más disminuye el SD-S en todos los niveles lingüísticos (un efecto espejo de la Figura 6A). En el caso de la desviación estándar para consonantes (SD-C, Figura 7C), el L1-BP, a diferencia del inglés L1, presenta una variación baja cuando aumenta la velocidad del habla o la duración de las pausas. Esta dirección del SD se predice dado que la variabilidad en la duración de sílabas del inglés L1 es (estadísticamente) significativamente mayor que la del L1-BP44,58. El Varco-S (Figura 7B y Tabla Suplementaria S1) parece estar algo correlacionado con el L1 y el L2 del mismo grupo lingüístico. A medida que aumenta la variabilidad de f0 y la velocidad del habla, el Varco-S disminuye para el L1-BP y parece disminuir y atenuarse para el L2-BP. En las producciones en inglés, mientras aumentan la variabilidad de f0 y la velocidad del habla, el Varco-S aumenta y se atenúa para el inglés L1 y el inglés L2.
Con respecto a la DS para vocales o consonantes (SD-V_C, Figura 7D y Tabla Suplementaria S1), nuestros resultados muestran algunas similitudes con el desempeño de Varco-S (Figura 7B). Por ejemplo, una mayor tasa de habla, duración de pausas y variabilidad de f0 favorecen una trayectoria ascendente-descendente de la SD-V_C en L1-BP y en L2-BP. En producciones en inglés, aunque estas características prosódicas son más altas, la SD-V_C disminuye ligeramente, se atenúa en L1-inglés, aumenta ligeramente y luego se atenúa en L2-inglés. La correlación entre Varco-S y SD-V_C en los grupos de hablantes L1 y L2 de la misma lengua podría explicarse parcialmente por el efecto Lombard, que hace referencia a la alteración de los parámetros acústicos en el habla debido al ruido de fondo59.
En el habla extranjera, dependiendo de la complejidad de la tarea (por ejemplo, lectura de habla), los hablantes han utilizado estrategias acústicas similares tanto en la L1 como en la L259,60. Por un lado, Marcoux y Ernestus descubrieron que las medidas de f0 (rango y mediana) en el habla Lombard en L2 sugieren que los hablantes de inglés como L2 estuvieron influenciados por su holandés como L161,62. Por otro lado, hallazgos más recientes proponen que, aunque se espera que el habla Lombard en L2 difiera del habla Lombard en L1 debido a la mayor carga cognitiva al hablar la L2, los hablantes de inglés como L2 produjeron el habla Lombard en la misma dirección que los hablantes de inglés como L163. El grado en que nuestros hallazgos coinciden con Marcoux y Ernestus63 y divergen de Waaning59, Villegas et al.60 y Marcoux y Ernestus61,62 requiere una investigación adicional.

Figura 7: Modelos Aditivos Generalizados para las características métricas. En el eje Y, la variable respuesta (las características métricas que se van a modelar); en el eje X, las variables predictoras (el factor «Idioma» y las covariables en los modelos aditivos que proporcionarán la forma y las trayectorias de las curvas (es decir, los efectos de suavizado: «Idioma + covariables»), y el producto del factor «Idioma» y una característica métrica que proporcionará una proyección más precisa de la variable respuesta (es decir, interacciones factor-suavizado: «covariable:Idioma»). Abreviatura: GAMs = Modelos Aditivos Generalizados. Haga clic aquí para ver una versión más grande de esta figura.
Resultados para la percepción del habla
En relación con las ruedas de reconocimiento de voces en portugués brasileño, en la rueda n.º 1 (Figura 8A), la voz falsa n.º 3 fue identificada como la voz objetivo. De hecho, la voz objetivo era la voz n.º 4. Los resultados no muestran diferencias estadísticamente significativas (véase Tabla Suplementaria S1) entre la voz falsa n.º 3 (83 %) y la voz objetivo n.º 4 (71 %). En la rueda n.º 2 (Figura 8B), una comparación entre la voz objetivo n.º 3 (40 %) y la voz falsa n.º 4 (20 %) tampoco mostró diferencias estadísticamente significativas (véase Tabla Suplementaria S1) para las ruedas de reconocimiento de voces en inglés. En la rueda n.º 1 (Figura 9A), no hubo diferencia significativa (véase Tabla Suplementaria S1) entre la voz falsa n.º 2 (26 %) y la voz objetivo n.º 4 (54 %).
En el análisis de la similitud vocal, tanto la similitud del coseno (CoSim) como la distancia euclidiana (EucDist, [EucDist transformada]54) mostraron una correlación constante entre el distractor n.º 3 y el objetivo en la rueda de reconocimiento BP n.º 1 (CoSim = 0,99; EucDist = 77,4, [0,93]). La correlación entre el distractor n.º 4 y el objetivo fue igualmente fuerte en la rueda de reconocimiento BP n.º 2 (CoSim = 0,99, EucDist = 76,3, [0,93]). En la rueda de reconocimiento en inglés n.º 1, la correlación fue constante para CoSim (0,83), pero débil a satisfactoria para EucDist (213,0, [0,47]). En general, ambas técnicas, CoSim y EucDist, fueron satisfactorias para determinar la similitud vocal. Además, CoSim tuvo un desempeño ligeramente más eficaz, como señalan Gahman y Elangovan52 (véase Tabla Suplementaria S1).
En cuanto a la similitud, ¿qué podría haber provocado un aumento en las alarmas falsas? Las características prosódico-acústicas mostraron evidencia de que, aunque las voces distractoras y las voces objetivo se desempeñaron (estadísticamente) de manera significativamente diferente —con la excepción de los grupos presentados en el Figure 8A,B y en el Figure 9A—, las elecciones de los oyentes se diversificaron algo a lo largo de diferentes distractores en los otros grupos (Figure 8C,D y Figure 9B-D). Esta clase de juicio parece depender más de una (o quizás más de una) característica acústica específica que comparten los hablantes, que de una clase completa de características prosódico-acústicas. Por ejemplo, nuestro estudio presentó varias características que variaban (conjuntamente) entre las producciones; sin embargo, los resultados perceptuales muestran preferencias en los juicios por un distractor específico para que coincida con la voz objetivo8,35,64,65. Serán necesarios análisis adicionales en trabajos futuros.
Es destacable considerar la elección de una matriz paramétrica multidimensional para la similitud acústica66 como la presentada en este estudio. Nuestros hallazgos coinciden con estudios previos que utilizaron características acústicas basadas en f0, VQ e intensidad9,35. Dichas características se recomiendan notablemente para tareas de comparación de hablantes en el ámbito forense9,66. No obstante, es importante destacar que en la presente investigación, ninguno de los hablantes de distracción fue predicho como similar a la voz objetivo, aunque hayamos utilizado una variante de las directrices de McFarlane16,17 en la preparación de los grupos de voces para el reconocimiento de hablantes con acento extranjero. Además, debemos enfatizar que nuestro procedimiento de formación de grupos de voces presenta diferencias importantes respecto a las directrices de McFarlane, incluyendo la duración del estímulo, el número de voces, la selección de los hablantes de distracción (aleatorizados en este caso) y el estilo de habla.
Hasta qué punto las características prosódico-acústicas del f0, la calidad vocal y la intensidad parecen estar relacionadas con la percepción de los oyentes dependería en gran medida del estilo de habla utilizado en la investigación. Aquí, utilizamos pasajes leídos. La mayoría de los estudios sobre testigos auditivos optan por estímulos (semi)espontáneos como una solución equilibrada, por ejemplo, el corpus DyVis67, que se ha empleado ampliamente en investigaciones contemporáneas sobre testigos auditivos28,68. La razón que nos llevó a elegir las tareas de lectura es que nuestro corpus, en el momento de redactar este manuscrito, consistía exclusivamente en datos obtenidos a partir de tareas de lectura. Sin embargo, es importante reconocer que ya está en marcha el proceso de compilación de un corpus (semi)espontáneo. Además, el acto de leer una historia puede generar un nivel confiable de uniformidad y variación, tanto intrahablante como interhablante. Esto facilita el énfasis en características prosódicas o fonéticas, individuales o dialectales, en situaciones que implican comparación de voces. Esto resulta especialmente evidente en casos de carga vocal durante la producción de un acento extranjero, incluso entre hablantes competentes 8,9,23,54.

Figura 8: Gráficos de barras que contienen los resultados de las cuatro ruedas de reconocimiento realizadas por los oyentes brasileños. (A,B) Diferencia no significativa entre la voz objetivo (en azul) y una voz falsa (en azul claro). (C,D) Diferencias significativas respecto a las voces falsas y la voz objetivo. Abreviatura: NS = no significativo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9: Gráficos de barras que contienen los resultados de las cuatro ruedas de reconocimiento realizadas por los oyentes estadounidenses. (A) Diferencia no significativa entre la voz objetivo (en rojo) y una voz falsa (en rosa). (B,C,D) Diferencias significativas entre las voces falsas y la voz objetivo. Abreviatura: NS = no significativo. Haga clic aquí para ver una versión más grande de esta figura.
Tabla Suplementaria S1: Estadísticas de producción del habla - Modelos Aditivos Generalizados (GAM): Las estadísticas F (grados de libertad), el R2 ajustado de cada característica prosódico-acústica estadísticamente significativa (Figura 6) y métrica de ritmo (Figura 7) por nivel de idioma, así como los valores individuales de cada término suave (las covariables). Estadísticas de percepción del habla: Las estadísticas χ2 de Kruskall-Wallis (grados de libertad), los valores p y el η2 ajustado, así como una prueba post hoc de Dunn para comparación por pares (Figura 8 y Figura 9) de cada diferencia estadísticamente no significativa entre los pares de voces objetivo-distractor (Figura 8A,B y Figura 9A). Matrices de similitud acústica para las distancias coseno y euclidiana de cada rueda de reconocimiento. Haga clic aquí para ver una versión ampliada de esta figura.