$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Resultados para la producción de voz
En esta sección, describimos el rendimiento de las características prosódico-acústicas estadísticamente significativas y las métricas rítmicas. Tales características prosódicas fueron el habla, la articulación y las tasas de pausa, que están relacionadas con la duración, y el brillo, que está relacionado con la calidad de la voz. Las métricas rítmicas fueron la desviación estándar (DE) de la duración de la sílaba, la DE de la consonante, la DE de la duración vocálica o consonántica y el coeficiente de variación de la duración de la sílaba (véase la Tabla Suplementaria S1).
La tasa del habla (Figura 6A) disminuye más rápidamente para L1-L2 inglés que para L1-L2 BP, aunque la tasa es menor para ambas L2. La velocidad del habla está relacionada con tres métricas: SD de la duración de la sílaba (SD-S), SD de las vocales (SD-V) y el coeficiente de variación silábica (Varco-S). También es importante tener en cuenta que tanto el grupo AmE-S como el grupo Bra-S son competentes en sus L2. Parece que dicha tasa se ve afectada por los mayores valores de duración de las sílabas y la menor variabilidad producida por L1-L2 BP, provocando pendientes menos pronunciadas.
La tasa de articulación (Figura 6D) está relacionada con SD-S, Varco-S, así como con la relación de ritmo silábico (RR-S); esta última representa la relación entre sílabas más cortas y más largas. Tales métricas parecen afectar la tasa de articulación al igual que la tasa de habla afectada debido a la longitud de la oración y la variación en la duración que conduce a una mayor planificación del habla L2 y a la carga cognitiva L29,23,54. Es posible que se requiera una mayor carga cognitivo-lingüística en el dominio de la longitud de la oración de manera que los parámetros prosódico-acústicos se vean afectados55.
Con respecto a las características prosódico-acústicas de las tasas de habla y articulación, nuestros hallazgos sugieren que cuanto más varía un hablante la duración de las sílabas (y vocales), menores son dichas tasas. Nuestra hipótesis es que la percepción del habla de L1 y L2 BP suena algo más lenta que L1 y L2-inglés, y que L1-inglés suena más rápido que todos los demás niveles del idioma. Este hecho podría estar relacionado con el ritmo del habla y la hipótesis de que mientras L1-L2 BP se inclina hacia el polo temporizado por sílabas del continuo rítmico, L1-L2 English se mueve hacia el polo temporizado por estrés21,22.
El brillo local, Figura 6B, está influenciado por SD-S y Varco-S. Para el brillo local, ambas producciones de Bra-S, L1-BP y L2-English presentan una trayectoria un tanto monótona a medida que aumenta la variabilidad de la duración de las sílabas (SD y Varco, ver Tabla Suplementaria S1). La percepción del esfuerzo vocal puede ser evidente al escuchar las producciones de Bra-S debido a una baja variación que oscila entre los 8,5 y los 9 dB. El habla de Bra-S se ve afectada por la carga vocal. L1-BP se ve muy afectada por el hecho de que la longitud de la oración es menos sensible a las altas variaciones de la duración de las sílabas (el patrón rítmico de BP muestra menos variación silábica22,56).
La tasa de pausa (Figura 6C) muestra que los hablantes de L2-inglés producen pausas más largas (de 200 ms a 375 ms) que las de L1-Inglés, L1-BP y L2-BP (media de 30 ms para L1-Inglés, 50 ms para L1-BP y 100 ms para L2-BP). La planificación del habla, en este caso, podría haber afectado la producción de inglés L2 debido al aumento de la actividad cerebral54,57. Se espera que un mayor dominio del idioma resulte en una mayor velocidad de lectura y span54; sin embargo, incluso para los hablantes competentes en L2, las tareas de lectura presentaron más esfuerzo en los aspectos cognitivos de orden superior del habla extranjera y en el procesamiento del lenguaje54,57. Nuestros hallazgos muestran, al menos de forma preliminar, que los hablantes de L2-BP pueden verse menos afectados por las pausas que los de L2-inglés debido a las diferencias en el patrón rítmico de ambos idiomas.

Figura 6: Modelos aditivos generalizados para las características prosódico-acústicas. En el eje Y, la variable de respuesta (las características acústicas a modelar); en el eje X, las variables predictoras (el factor 'Idioma' y las covariables en los modelos aditivos que proporcionarán la forma y las trayectorias de las curvas (es decir, los efectos de suavizado: 'Idioma + covariables'), y el producto del 'Lenguaje' y una característica métrica que proporcionará una proyección más precisa de la variable de respuesta (es decir, interacciones factor-suaves: 'covariable:Lenguaje'). Abreviatura: GAMs = Modelos Aditivos Generalizados. Por favor, haga clic aquí para ver una versión más grande de esta figura.
En relación con las métricas de ritmo, para SD-S (Figura 7A), nuestros hallazgos revelan que cuanto más varía un hablante la curva f0 y aumenta la velocidad del habla, más disminuye SD-S para todos los niveles del idioma (un efecto espejo de Figura 6A). En el caso de la SD para consonantes (SD-C, Figura 7C), L1-BP, a diferencia de L1 inglés, presenta una baja variación a medida que aumenta la velocidad del habla o la duración de la pausa. Dicha dirección SD se predice ya que la variabilidad de la duración de las sílabas en L1-English es (estadísticamente) significativamente mayor que L1-BP44,58. El Varco-S (Figura 7B y Tabla Suplementaria S1) parece estar algo correlacionado con la L1 y la L2 del mismo grupo lingüístico. A medida que la variabilidad f0 y la velocidad del habla aumentan, el Varco-S disminuye para la L1-BP y parece disminuir y atenuarse para la L2-BP. Para las producciones en inglés, mientras que la variabilidad f0 y la velocidad del habla aumentan, Varco-S aumenta y se atenúa para L1-Inglés y L2-Inglés.
Con respecto a la SD para vocales o consonantes (SD-V_C, Figura 7D y Tabla Suplementaria S1), nuestros resultados muestran algunas similitudes con el rendimiento de Varco-S (Figura 7B). Por ejemplo, una mayor velocidad del habla, duración de la pausa y variabilidad f0 promueven una trayectoria de caída-subida de la SD-V_C para L1-BP y para L2-BP. En las producciones en inglés, mientras que estos rasgos prosódicos son más altos, el SD-V_C disminuye ligeramente, se atenúa para L1-Inglés, aumenta ligeramente y luego se atenúa para L2-Inglés. La correlación entre Varco-S y SD-V_C con la L1-L2 de los mismos grupos lingüísticos puede explicarse parcialmente por el efecto Lombard, que se refiere a la alteración de los parámetros acústicos en el habla debido al ruido de fondo59.
En el habla extranjera, dependiendo de la complejidad de la tarea (por ejemplo, leer el habla), los hablantes han utilizado estrategias acústicas similares tanto en L1 como en L259,60. Por un lado, Marcoux y Ernestus encontraron que las medidas f0 (rango y mediana) en el habla lombarda L2 sugieren que los hablantes de inglés L2 fueron influenciados por su L1 Dutch61,62. Por otro lado, los hallazgos más recientes proponen que, aunque se espera que el habla lombarda de L2 difiera del habla lombarda L1 debido a la mayor carga cognitiva al hablar la L2, los hablantes de inglés L2 produjeron el habla lombarda en la misma dirección que los hablantes de inglés L163. La medida en que nuestros hallazgos están alineados con Marcoux y Ernestus63 y divergen de Waaning59, Villegas et al.60, y Marcoux and Ernestus61,62 necesita más investigación.

Figura 7: Modelos aditivos generalizados para las características métricas. En el eje Y, la variable de respuesta (las características métricas que se van a modelar); en el eje X, las variables predictoras (el factor 'Idioma' y las covariables en los modelos aditivos que proporcionarán la forma y las trayectorias de las curvas (es decir, los efectos de suavizado: 'Idioma + covariables'), y el producto del 'Lenguaje' y una característica métrica que proporcionará una proyección más precisa de la variable de respuesta (es decir, interacciones factor-suaves: 'covariable:Lenguaje'). Abreviatura: GAMs = Modelos Aditivos Generalizados. Por favor, haga clic aquí para ver una versión más grande de esta figura.
Resultados para la percepción del habla
En relación con las alineaciones de voz de BP, en la alineación #1 (Figura 8A), la voz de aluminio #3 fue juzgada como la voz objetivo. De hecho, la voz objetivo era la voz #4. Los resultados no muestran diferencias estadísticamente significativas (ver Tabla Suplementaria S1) entre la lámina #3 (83%) y la voz objetivo #4 (71%). En la alineación #2 (Figura 8B), una comparación entre la voz objetivo #3 (40%) y la foil #4 (20%) tampoco mostró diferencias estadísticamente significativas (ver Tabla Suplementaria S1) para las alineaciones de voces en inglés. En la alineación #1 (Figura 9A), no hubo diferencia significativa (ver Tabla Suplementaria S1) entre el foil #2 (26%) y la voz objetivo #4 (54%).
En el análisis de la similitud de voz, tanto la similitud del coseno (CoSim) como la distancia euclidiana (EucDist, [EucDist transformed]54) mostraron una correlación consistente entre la lámina #3 y el objetivo para la alineación BP #1 (CoSim = 0.99; EucDist = 77,4, [0,93]). La correlación entre la lámina #4 y el objetivo fue igualmente fuerte en la alineación BP #2 (CoSim = 0.99, EucDist = 76.3, [0.93]). En la alineación inglesa #1, la correlación fue consistente para CoSim (0.83(, pero de débil a satisfactoria para EucDist (213.0, [0.47]. En general, tanto CoSim como EucDist fueron técnicas satisfactorias para determinar la similitud de la voz. Además, CoSim funcionó un poco más eficazmente, como se aborda en Gahman y Elangovan52 (ver Tabla Suplementaria S1).
En términos de similitud, ¿qué podría haber llevado a un aumento de las falsas alarmas? Las características prosódico-acústicas mostraron evidencia de que, aunque los foils y las voces objetivo se comportaron (estadísticamente) de manera significativamente diferente, con una excepción para las alineaciones presentadas en Figure 8A,B y Figure 9A-las opciones de los oyentes se diversificaron un poco a lo largo de diferentes foils en las otras alineaciones (Figure 8C,D, y Figure 9B-D). Tal juicio parece depender más de una (o tal vez más) característica acústica específica que comparten los altavoces que de toda una clase de características prosódico-acústicas. Por ejemplo, nuestro estudio presentó varias características (co)variables entre producciones; Sin embargo, los resultados perceptuales muestran las preferencias de los juicios para que una lámina específica coincida con el objetivo voice8,35,64,65. Es necesario realizar más análisis en trabajos futuros.
Es notable considerar la elección de una matriz paramétrica multidimensional para la similitud acústica66 como la presentada en este estudio. Nuestros hallazgos están alineados con estudios previos que utilizaron características acústicas basadas en f0, VQ e intensity9,35. Tales características se sugieren notablemente para tareas de comparación de altavoces en el campo forense9,66. Sin embargo, es importante destacar que en la presente investigación, no se predijo que ninguna de las láminas fuera similar a la voz objetivo, aunque hemos utilizado una variante de las pautas de McFarlane16,17 en la preparación de las alineaciones de voz para el reconocimiento de hablantes con acento extranjero. Además, debemos enfatizar que nuestro procedimiento de alineación de voces contiene diferencias importantes con las pautas de McFarlane, incluida la duración del estímulo, el número de voces, la selección de láminas (aleatorias aquí) y el estilo de habla.
Hasta qué punto las características prosódico-acústicas de f0, la calidad de la voz y la intensidad parecen estar relacionadas con la percepción de los oyentes dependería en gran medida del estilo de habla utilizado en la investigación. Aquí, usamos pasajes de lectura. La mayoría de los estudios de testigos auditivos optan por estímulos (semi) espontáneos como una solución equilibrada -por ejemplo, el corpus DyVis67-que se ha empleado ampliamente en las investigaciones contemporáneas de testigos auditivos28,68. La razón que nos llevó a elegir las tareas de lectura es que nuestro corpus, en el momento de la composición de este manuscrito, estaba formado exclusivamente por datos obtenidos de las tareas de lectura. Sin embargo, es importante reconocer que el proceso de compilación de un corpus (semi) espontáneo ya está en marcha. Además, el acto de leer una historia puede generar un nivel confiable de uniformidad y variación, tanto dentro como entre hablantes. Esto facilita el énfasis en las características prosódicas o fonéticas, individuales o dialectales, en situaciones que involucran la comparación de la voz. Esto se hace especialmente notable en casos de carga vocal durante la producción de un acento extranjero, incluso entre hablantes competentes 8,9,23,54.

Figura 8: Gráficos de barras que contienen los resultados de las cuatro alineaciones realizadas por los oyentes brasileños. (A,B) Diferencia no significativa entre la voz objetivo (en azul) y una foil (en azul claro). (C,D) diferencias significativas con respecto a las láminas, y la voz objetivo. Abreviatura: NS = no significativo. Por favor, haga clic aquí para ver una versión más grande de esta figura.

Figura 9: Gráficos de barras que contienen los resultados de las cuatro alineaciones realizadas por los oyentes estadounidenses. (A) Diferencia no significativa entre la voz objetivo (en rojo) y una lámina (en rosa). (B, C, D) Diferencias significativas con respecto a las láminas y la voz objetivo. Abreviatura: NS = no significativo. Por favor, haga clic aquí para ver una versión más grande de esta figura.
Tabla suplementaria S1: Estadísticas de producción del habla - Modelos aditivos generalizados (GAMs): Las estadísticas F (grados de libertad), el R2 ajustado de cada característica prosódico-acústica estadísticamente significativa (Figura 6), y la métrica del ritmo (Figura 7) por nivel de idioma, así como los valores individuales de cada término suave (las covariables). Estadísticos de percepción del habla: Los estadísticos χ2 de Kruskall-Wallis (grados de libertad), los valores p y el η2 ajustado, así como una prueba de Dunn post-hoc para la comparación por pares (Figura 8 y Figura 9) de cada diferencia estadísticamente no significativa entre los pares de voces objetivo (Figura 8A,B y Figura 9A). Matrices de similitud acústica para la distancia coseno y euclidiana de cada alineación. Por favor, haga clic aquí para ver una versión más grande de esta figura.