Artículo de método

Acento extranjero e identificación forense de hablantes en alineaciones de voz: la influencia de las características acústicas basadas en la prosodia

1.5K visualizaciones

DOI:

10.3791/66313

27 de septiembre de 2024

En este artículo

Resumen

Esta investigación tuvo como objetivo hacer una comparación entre L1-L2-inglés y L1-L2 portugués para comprobar cuánto el efecto de un acento extranjero tiene en cuenta tanto las métricas como los parámetros prosódico-acústicos, así como la elección de la voz objetivo en una alineación de voz.

Resumen

Esta investigación tiene como objetivo examinar tanto las características prosódico-acústicas como los correlatos perceptivos del inglés con acento extranjero y el portugués brasileño con acento extranjero y verificar cómo las producciones de los hablantes de acentos extranjeros y nativos se correlacionan con la percepción de los oyentes. En la Metodología, llevamos a cabo un procedimiento de producción de habla con un grupo de hablantes americanos de L2 de portugués brasileño y un grupo de hablantes brasileños de L2 de inglés, y un procedimiento de percepción del habla en el que realizamos alineaciones de voz para ambas lenguas. Para el análisis estadístico de la producción del habla, se ejecutaron modelos aditivos generalizados para evaluar el efecto de los grupos lingüísticos en cada clase (métrica o prosódico-acústica) de características controladas para el efecto suavizante de las covariables de la clase opuesta. Para el análisis estadístico de la percepción del habla, se realizó una prueba de Kruskal-Wallis y una prueba de Dunn post-hoc para evaluar el efecto de las voces de las alineaciones en las puntuaciones juzgadas por los oyentes. Sin embargo, realizamos pruebas de similitud acústica (voz) basadas en las distancias del coseno y euclidiano. Los resultados mostraron diferencias acústicas significativas entre los grupos lingüísticos en términos de variabilidad del f0, duración y calidad de la voz. Para las alineaciones, los resultados indicaron que las características prosódicas de f0, intensidad y calidad de voz se correlacionaron con los juicios percibidos de los oyentes.

Introducción

El acento es un aspecto destacado y dinámico de la comunicación y la fluidez, tanto en la lengua materna (L1) como en una lengua extranjera (L2)1. El acento extranjero representa las características fonéticas de la L2 de una lengua de destino, y puede cambiar (con el tiempo) en respuesta a la experiencia del hablante en la L2, el estilo de habla, la calidad de la entrada, la exposición, entre otras variables. Un acento extranjero se puede cuantificar como un grado (escalar) de diferencia entre el habla L2 producida por un hablante extranjero y un acento local o de referencia del idioma de destino2,3,4,5.

Esta investigación tiene como objetivo examinar tanto las características prosódico-acústicas como los correlatos perceptivos del inglés con acento extranjero y el portugués brasileño (BP) con acento extranjero, así como verificar hasta qué punto las producciones de los hablantes de acentos extranjeros y nativos están correlacionadas con la percepción de los oyentes. Investigaciones previas en el campo forense han demostrado la robustez de las vocales y consonantes en la identificación de acento extranjero, ya sea como estables para un análisis a largo plazo de un individuo (The Lo Case6) o refiriéndose a la alta precisión de identificación de un hablante (The Lindbergh Case7). Sin embargo, la exploración de las características prosódico-acústicas basadas en la duración, la frecuencia fundamental (f0, es decir, el correlato acústico del tono), la intensidad y la calidad de la voz (VQ) ha ganado cada vez más atención8,9. Por lo tanto, la elección de las características prosódico-acústicas en este estudio representa una vía prometedora en el campo de la fonética forense8,10,11,12,13.

La presente investigación está respaldada por estudios dedicados a los acentos extranjeros como una forma de disfraz de voz en casos forenses14,15, así como en la preparación de alineaciones de voz para el reconocimiento de hablantes16,17. Por ejemplo, la velocidad del habla jugó un papel importante en la identificación de los hablantes de inglés, alemán, italiano, japonés y brasileño18,19,20,21,22. Además de la velocidad del habla, las características espectrales y f0 a largo plazo desafían a los hablantes competentes en L2 con la familiaridad con el idioma objetivo porque el cerebro y las bases cognitivas sufren un déficit en la memoria, la atención y la emoción, lo que se refleja en el rendimiento fonético del hablante durante los turnos largos del habla23. La visión de los acentos extranjeros en el campo forense es que la definición de lo que realmente suena como un acento extranjero depende en gran medida de la falta de familiaridad del oyente en lugar de tener un grado nada extremo de habla con acento extranjero24.

En el dominio perceptivo, una herramienta forense común utilizada desde mediados de la década de 1990 para el reconocimiento de criminales es la Alineación de Voz (reconocimiento auditivo), que es análoga al reconocimiento visual utilizado para identificar a un perpetrador en una escena del crimen16,25. En una alineación de voces, la voz del sospechoso se presenta junto a otras voces similares en aspectos sociolingüísticos como la edad, el sexo, la ubicación geográfica, el dialecto y el estado cultural, para su identificación por parte de un testigo. El éxito o el fracaso de una alineación de voces dependerá del número de muestras de voz y de la duración de las muestras25,26. Además, en el caso de las muestras del mundo real, se considera que la calidad del audio influye constantemente en la precisión del reconocimiento de voz. Una mala calidad de audio puede distorsionar las características únicas de una voz27. En el caso de similitud de voz, los detalles fonéticos finos basados en f0 pueden confundir al oyente durante el reconocimiento de voz28,29. Tales características acústicas se extienden más allá de f0 y abarcan elementos de duración, y características espectrales de intensidad y VQ30. Esta visión de múltiples características prosódicas es crucial en el contexto de la comparación forense de voces para garantizar una identificación precisa del hablante9,14,15,29,31.

En resumen, los estudios de fonética forense han mostrado algunas variaciones con respecto a la identificación del acento extranjero en las últimas décadas. Por un lado, un acento extranjero no parece afectar el proceso de identificación de un hablante32,33 (especialmente si el hablante no está familiarizado con el acento extranjero objetivo34). Por otro lado, hay hallazgos en la dirección opuesta12,34,35.

Protocolo

Este trabajo recibió la aprobación de un comité de ética en investigación humana. Además, se obtuvo el consentimiento informado de todos los participantes involucrados en este estudio para utilizar y publicar sus datos.

1. Producción del habla

NOTA: Recopilamos habla de una tarea de lectura en ambos casos, 'L1 inglés-L2 PB', producida por Grupo 1: El American Einglés (de los Estados Unidos de América) Saltavoces (inglés de EE. UU.), y en ambos producidos por 'L1 BP-L2 inglés' Grupo 2: El Brazilian Saltavoces (Bra-S). Véase Figura 1 para un diagrama de flujo para la producción del habla.

figure-protocol-1
Figura 1: Diagrama esquemático del flujo de producción del habla. Haga clic aquí para ver una versión más grande de esta figura.

  1. Participantes
    1. Determinar el número de participantes, el idioma (L1 inglés, L2 portugués; L1 portugués, L2 inglés), el sexo (hembra o macho), el edad (media, desviación estándar), el características del grupo (profesionales o estudiantes universitarios), y el Nivel de competencia en L2 (adelantado o muy adelantado) para cada grupo.
      NOTA: Para la presente investigación, tanto el AmE-S como el Bra-S se consideraron con dominio del L2 (ambos grupos fueron clasificados como B2-C1)36). El AmE-S había vivido dos años en Brasil cuando se realizaron los procedimientos. El Bra-S había vivido más de dos años en Estados Unidos cuando se realizaron los procedimientos. Durante su estancia en el extranjero, ambos grupos solían hablar su L2 con fines académicos y laborales al menos 6 días por semana durante aproximadamente 4-5 horas diarias.
    2. Asigne a los participantes a una habitación cómoda y tranquila y presente el material de lectura para cada grupo.
  2. Recolección de datos
    NOTA: Los datos de habla deben recopilarse mediante una tarea de lectura en los siguientes idiomas: L1-inglés y L2-portugués brasileño; L1-portugués brasileño y L2-inglés. Permita que los participantes lean los textos previamente si es necesario.
    1. Procedimientos de grabación
      1. Grabe los datos de habla en un lugar tranquilo con condiciones acústicas adecuadas.
      2. Utilice una grabadora de voz digital (consulte el Tabla de materiales)37 y un micrófono cardioide unidireccional con aislamiento electromagnético (ver el Tabla de materiales)38.
      3. Registre los datos de audio en '.wavforma.
      4. Configure la frecuencia de muestreo a 48 kHz y la tasa de cuantización a 16 bits.
        NOTA: El formato de audio y la configuración de las tasas de muestreo y cuantización descritas en los pasos 1.2.1.3 y 1.2.1.4 se aplican para garantizar una alta calidad y reducción de ruido, preservando así las características espectrales utilizadas en el análisis acústico posterior.
  3. Análisis acústico
    NOTA: Divida los procedimientos de análisis acústico en tres pasos: alineación forzada, realineación y extracción de características acústicas.
    1. Escriba la transcripción lingüística (en un '.txt' archivo) para cada archivo de audio.
    2. Etiquete el par de '.txt'/'.wav' archivos con el mismo nombre (es decir, 'my_file.wav'/ 'mi_archivo.txt').
      NOTA: Para mejorar el rendimiento del procedimiento descrito en la sección 1.3.7, se recomienda encarecidamente que los tres primeros caracteres de las etiquetas de los archivos ‘.txt/.wav’ representen el Idioma, Dialecto, o Acento, mientras que los caracteres cuarto a sexto indican el Sexo (p. ej., EL1FEM para Einglés L1 Female). A partir del séptimo carácter, el usuario debe indicar el número del hablante (por ejemplo, 001 para el primer altavoz). En consecuencia, el primer par ‘.txt/.wav’ es EL1FEM001.
    3. Cree una carpeta para cada idioma L1-L2.
      NOTA: Una carpeta para inglés L1-L2 y una carpeta para BP L1-L2.
    4. Asegúrese de que todos los pares de archivos del mismo idioma se encuentren en la misma carpeta.
    5. Realice la alineación forzada.
      1. Acceda a la interfaz web del alineador forzado Munich Automatic Segmentation (MAUS)webMAUS39 en https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline
      2. Arrastre y suelte cada par de .onda / .txt archivos del carpeta al rectángulo punteado en Archivos (o haga clic dentro del rectángulo, Figura 2A).
      3. Haga clic en el Subir botón para cargar los archivos en el alineador (ver flecha roja en Figura 2A).
      4. Seleccione las siguientes opciones en el Opciones de servicio menú (Figura 2B): G2P-MAUS-PHO2SYL para Nombre de la tubería; Español (EE. UU.) (para Idioma) si Datos en inglés L1-L2; italiano (IT) (para Idioma) si Datos de BP L1-L2.
        NOTA: Elegimos el italiano para los datos del PB porque webMAUS no proporciona modelos acústicos preentrenados para la alineación forzada del PB. La literatura fonética señala que la fonología del italiano posee un inventario de siete vocales simétrico algo comparable, al igual que el PB40, así como similitudes acústicas consonánticas41,42.
      5. Mantenga las opciones predeterminadas para 'Formato de salida' y 'Conservar todo'.
      6. Verifique el Ejecutar cuadro de opción para aceptar los términos de uso (ver flecha verde en Figura 2C).
      7. Haga clic en el Servicio web de ejecución botón para ejecutar los archivos cargados en el alineador.
        NOTA: Para cada archivo de audio, el alineador MAUS devuelve un Praat TextGrid objeto (un archivo '.txt' preformateado para Praat que contiene la anotación de palabras, sílabas fonológicas y fonos basada en la transcripción lingüística extraída del archivo '.txt' descrito en el paso 1.3.1).
      8. Haga clic en el Descargar como archivo ZIP botón para descargar los archivos TextGrid como un archivo comprimido (zip)Figura 2C).
        NOTA: Asegúrese de que los archivos TextGrid comprimidos se descarguen en la misma carpeta que los archivos de audio.
      9. Extraiga los archivos TextGrid para un posterior realineamiento en el software de análisis fonético43.
    6. Realice el realineamiento.
      1. Acceda y descargue el script para Praat VVUnitAligner44 desde https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat
      2. Certifique que todos los pares de archivos del mismo idioma y el VVUnitAligner los guiones están en la misma carpeta
        NOTA: Una carpeta para los archivos en inglés L1-L2 y el VVunitAligner, y una carpeta para los archivos BP L1-L2 y el VVunitAligner.
      3. Abra el software de análisis fonético.
      4. Haga clic Praat | Abrir script de Praat… para llamar el script desde el ventana del objeto.
      5. Haga clic en el Ejecutar botón una vez
        NOTA: Un formulario denominado Alineación silábica fonética que contiene la configuración para usar el script aparecerá en la pantalla (Figura 3A).
      6. Haga clic en el Idioma botón para elegir entre los idiomas 'inglés (EE. UU.)', 'portugués (BR)', 'francés (FR)' o 'español (ES)'
      7. Haga clic en el Segmentación de fragmentos botón para elegir entre el procedimiento de segmentación 'Automático', 'Forzado (manual)' o 'Ninguno'.
      8. Verifique el Guardar archivos TextGrid opción para guardar automáticamente los nuevos archivos TextGrid.
      9. Haga clic Aceptar | Ejecutar botones para una realineación de las unidades fonéticas del paso 1.3.5.7
        NOTA: Para cada archivo de audio, VVUnitAligner generará un nuevo archivo TextGrid para la sección 1.3.7Figura 3B).
    7. Realice la extracción automática de las características acústicas.
      1. Acceda y descargue el script SpeechRhythmExtractor45 desde https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat para la extracción automática de las características prosódico-acústicas.
      2. Cree una nueva carpeta y coloque SpeechRhythmExtractor junto con todos los pares de archivos de audio y TextGrid de todos los idiomas.
      3. Abra el software de análisis fonético.
      4. Haga clic Praat | Abrir script de Praat… para llamar el script desde el ventana del objeto.
      5. Haga clic en el Ejecutar botón solo una vez
        NOTA: Aparecerá en la pantalla un formulario con la configuración del script. En los cuadros correspondientes a los nombres de archivo de salida '.txt', cambie los nombres de los archivos según corresponda o mantenga los nombres predeterminados.
      6. Verifique el parámetros de calidad de la voz opción para guardar el Archivo de salida VQ para la calidad de la voz (Figura 3C).
        NOTA: Este segundo archivo de salida (el Archivo de salida VQ) contiene los parámetros de la diferencia entre el 1st y el 2nd armónicos (H1-H2) y el Pico de Prominencia Cepstral (CPP)9.
      7. Verifique el Objetivo lingüístico opción para elegir entre las etiquetas 'Idioma', 'Dialecto' o 'Acento' (Figura 3C).
      8. Verifique el Unidad opción para elegir las características de f0 en Hz o en semitonos (Figura 3C).
      9. Configurar los valores para umbral F0, los umbrales mínimo y máximo de f0 (Figura 3C).
        NOTA: A menos que la investigación tenga objetivos específicos o características de audio preestablecidas, se recomienda encarecidamente dejar los parámetros del paso 1.3.7.9 con los valores predeterminados.
      10. Haga clic Aceptar | Ejecutar para la extracción automática de las características acústicas.
        NOTA: El guion SpeechRhythmExtractor devuelve un archivo '.txt' delimitado por tabulaciones (Archivo de salida/ Archivo de salida VQ) que contiene las características acústicas extraídas de los hablantes.
  4. Análisis estadístico
    1. Cargue la hoja de cálculo que contiene las características acústicas en R46 entorno (o cualquier entorno/software estadístico de elección).
    2. Realice estadísticas no paramétricas mediante modelos aditivos generalizados (GAM).
      1. Realice GAM en R.
      2. Escriba los siguientes comandos y presione Introducir.
        library(mgcv)
        modelo = gam(el característica métrica/prosódica-acústica en el análisis ~ el Idioma + s(la seleccionada característica métrica, por = el Idioma) + otros características métricas/prosódicas-acústicas, datos = el marco de datos)
        NOTA: Decidimos realizar las estadísticas de prueba del protocolo en el lenguaje de programación R debido a su creciente popularidad entre los fonetistas (y lingüistas) en la comunidad académica. R ha sido ampliamente utilizado en investigaciones fonéticas de campo47. Tenga en cuenta que el paso 1.4.2.2 contiene un pseudocódigo. Escriba el código según las variables de la investigación.

figure-protocol-2
Figura 2: Captura de pantalla del alineamiento fonético utilizando el alineador forzado MAUS. (A) El rectángulo punteado sirve para arrastrar y soltar los archivos 'my_file.wav'/'my_file.txt' o hacer clic dentro para buscar dichos archivos en la carpeta; el botón de carga se indica con la flecha roja. (B) Los archivos cargados desde el panel A (ver flecha azul), la canalización que se utilizará, el idioma para los pares de archivos, el formato de archivo que se devolverá y un botón 'verdadero/falso' para conservar todos los archivos. (C) Los términos de uso con casilla de verificación (ver flecha verde), el botón Ejecutar servicios web y los resultados (archivos TextGrid para descargar). Haga clic aquí para ver una versión más grande de esta figura.

figure-protocol-3
Figura 3: Captura de pantalla del procedimiento de realineación. (A) Formulario de configuración de entrada para el procedimiento de realineación. (B) Forma de onda parcial, espectrograma de banda ancha con contorno de f0 (azul) y seis niveles segmentados (y etiquetados) como nivel 1: unidades desde el inicio de una vocal hasta el inicio de la siguiente vocal (V_a_V); inicio de vocal (V_a_V); nivel 2: unidades de vocal (V), consonante (C) y pausa (#); nivel 3: representaciones fónicas V_a_V; nivel 4: algunas palabras del texto; nivel 5: algunos fragmentos (CH) del habla del texto; nivel 6: nivel tonal que contiene el tono más alto (H) y el más bajo (L) de cada fragmento de habla producido por una hablante nativa de inglés americano. (C) Configuración de entrada para la extracción automática de las características acústicas. Haga clic aquí para ver una versión más grande de esta figura.

2. Percepción del habla

NOTA: Realizamos cuatro ruedas de reconocimiento vocal en inglés con oyentes estadounidenses y cuatro ruedas en portugués brasileño con oyentes brasileños. Véase Figura 4 para un diagrama de flujo sobre la percepción del habla.

figure-protocol-4
Figura 4: Diagrama de flujo esquemático para la percepción del habla. Haga clic aquí para ver una versión más grande de esta figura.

  1. Participantes
    1. Elija participantes diferentes para cada grupo a los que participaron en el protocolo de producción del habla.
      NOTA: Se seleccionaron dos grupos de participantes para esta parte del protocolo: Grupo 1: El American Einglés (de los Estados Unidos) Loyentes (AmE-L), y Grupo 2: El Brazilian Loyentes (Bra-L). Para la presente investigación, tanto AmE-L como Bra-L se consideraron competentes en el segundo idioma (ambos grupos fueron calificados como B2-C1)36 El hablante de inglés como lengua materna (AmE-L) había vivido dos años en Brasil cuando se realizaron los procedimientos. El hablante de portugués brasileño como lengua materna (Bra-L) había vivido más de dos años en Estados Unidos cuando se realizaron los procedimientos. Durante su estancia en el extranjero, ambos grupos solían hablar su segunda lengua (L2) con fines académicos y laborales (al menos seis días a la semana durante aproximadamente 4 a 5 horas diarias).
    2. Determinar el número de participantes, el idioma (L1 inglés, L2 portugués; L1 portugués, L2 inglés), el sexo (hembra o macho), el edad (media, desviación estándar), el características del grupo (profesionales o estudiantes universitarios) y el Nivel de competencia en L2 para cada grupo.
  2. Las ruedas de reconocimiento vocal
    NOTA: Divida los procedimientos de los reconocimientos vocales en dos pasos diferentes: preparar y realizar los reconocimientos vocales.
    1. Preparar cuatro ruedas de reconocimiento vocal en inglés y cuatro en portugués brasileño.
      1. Obtenga archivos de audio de los hablantes de la sección 1: Producción del habla.
      2. Certifique que los archivos de audio de cada factor lingüístico se encuentran en carpetas separadas.
      3. Elija aleatoriamente seis segmentos de voz en inglés L1 o BP L1.
        NOTA: Seis voces en la lista representan una voz objetivo y cinco láminas.
      4. Elija un fragmento de voz en inglés L2 o en portugués brasileño L2 de uno de los hablantes incluidos en el paso 2.2.1.3.
        NOTA: El fragmento de voz en el paso 2.2.1.4 es el voz de referencia. Los fragmentos deben tener aproximadamente 20 s de duración.8.
      5. Acceda y descargue el script para Praat CreateLineup48 desde https://github.com/pabarbosa/prosody-scripts-CreateLineUp
      6. Asegúrese de que la voz de referencia L2, las distracciones L1 y la voz objetivo L1 se encuentren en la misma carpeta antes de ejecutar el script CreateLineup (Figura 5).
      7. Abra el software de análisis fonético.
      8. Desde el ventana del objeto, haga clic Praat | Abrir script de Praat… para llamar el script.
      9. Haga clic Ejecutar | Ejecutar.
        NOTA: El script devuelve un archivo en el siguiente orden: (la voz de referencia L2) + (la voz objetivo L1 y las voces distractoras distribuidas aleatoriamente)Figura 5).
    2. Realización de los reconocimientos auditivos
      1. Cree un espacio en línea para alojar las alineaciones en cualquier plataforma de su elección (por ejemplo, SurveyMonkey. Consulte el Tabla de materiales) para realizar de forma remota los reconocimientos orales.
      2. Acceda al enlace del espacio en línea.
      3. Suba los archivos devueltos por el script CreateLineup a la plataforma.
      4. Realice el procedimiento antes que los participantes para probar cada paso.
        NOTA: Se recomienda acceder previamente al enlace y ejecutar las alineaciones para verificar si todo está funcionando correctamente.
  3. Análisis estadístico
    1. Cargue la hoja de cálculo que contiene las puntuaciones de las valoraciones de los oyentes en el entorno R (o cualquier software/entorno estadístico de elección).
      1. Realice la prueba de Kruskal-Wallis en R.
      2. Escriba los siguientes comandos y presione Ingresar.
        ​modelo = kruskal.test(juicios ~ cada uno ronda de voces, datos = el marco de datos)
    2. Realice una prueba post hoc de Dunn.
      1. Realice la prueba de Dunn en R.
      2. Escriba los siguientes comandos y presione Entrar.
        library(FSA)
        modelo = dunnTest(juicios ~ cada uno ronda de voces, datos = datos, método = "bonferroni")
        NOTA: Los códigos en los pasos 2.3.1.2 y 2.3.2.2 son pseudocódigos (ver NOTA 1.4.2.2).
  4. Análisis de similitud acústica
    1. Seleccione las alineaciones (véase NOTA en el paso 2.2.1.3) que presentaron diferencias no significativas entre el objetivo y cualquiera de las distractores.
    2. Repita los procedimientos de los pasos 1.3.1 a 1.3.7.5, y de los pasos 1.3.7.8 a 1.3.7.10.
    3. Acceda y descargue el script para Python49, SimilitudAcústica_coseno_euclidiana50 de https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py
      NOTA: El script devuelve tres matrices (en formato '.txt' y '.csv'): una para la similitud del coseno51,52, uno para la distancia euclidiana52,53y uno para los valores de distancia euclidiana transformada, así como una comparación por pares entre la voz objetivo y cada distractor.
    4. Asegúrese de que el script se haya descargado en la misma carpeta que el conjunto de datos de alineación.
    5. Haga clic en Abrir archivo… botón para llamar al script.
    6. Haga clic Ejecutar | Ejecutar sin depuración botones.
      NOTA: El segundo Ejecutar el botón puede estar etiquetado como Ejecutar o ejecutar sin depuración o Ejecutar secuencia de comandos. Todos ejecutan los mismos comandos. Simplemente depende del entorno de Python utilizado.
    7. Realice pruebas de similitud vocal basadas en características acústicas.
      ​NOTA: La similitud del coseno (o distancia del coseno) es una técnica aplicada en inteligencia artificial (IA), particularmente en aprendizaje automático en sistemas de reconocimiento automático del habla (RAH). Es una medida de similitud entre cero y uno. Una similitud del coseno cercana a uno significa que es muy probable que dos voces sean similares. Una similitud del coseno cercana a cero indica que es muy probable que las voces sean diferentes.52La distancia euclidiana, a menudo denominada similitud euclidiana, también se utiliza ampliamente en inteligencia artificial, aprendizaje automático y reconocimiento automático del habla. Representa la distancia en línea recta entre dos puntos en el espacio euclidiano.53, es decir, cuanto más cercanos sean los puntos (valores más bajos de distancia), mayor será la similitud entre las voces. Para una comprensión más clara de los resultados obtenidos con ambas técnicas, transformamos los puntajes brutos de la distancia euclidiana en valores que van de cero (menor similitud vocal) a uno (mayor similitud vocal)54.

figure-protocol-5
Figura 5: Configuración del directorio para la percepción del habla. Carpetas de formación en fila. Cada carpeta contiene seis voces de L1, la voz objetivo de L2, el script «CreateLineup» y el archivo de audio de la formación en fila (devuelto tras ejecutar el script). Haga clic aquí para ver una versión más grande de esta figura.

Resultados

Resultados para la producción del habla
En esta sección, describimos el desempeño de las características prosódico-acústicas y métricas rítmicas estadísticamente significativas. Dichas características prosódicas fueron las tasas de habla, articulación y pausas, que se relacionan con la duración, y el temblor, que se relaciona con la calidad de la voz. Las métricas rítmicas fueron la desviación estándar (SD) de la duración silábica, SD de consonante, SD de duración vocálica o consonántica y el coeficiente de variación de la duración silábica (véase la Tabla Suplementaria S1).

La velocidad del habla (Figura 6A) disminuye más rápidamente en inglés L1-L2 que en portugués brasileño L1-L2, aunque la velocidad es menor en ambos L2. La velocidad del habla se relaciona con tres métricas: desviación estándar de la duración silábica (SD-S), desviación estándar de las vocales (SD-V) y el coeficiente de variación silábico (Varco-S). También es importante tener en cuenta que tanto el grupo de hablantes de inglés americano como el de portugués brasileño son competentes en sus L2. Parece que dicha velocidad se ve afectada por los valores más altos de duración silábica y la menor variabilidad producida por el L1-L2 en portugués brasileño, lo que provoca pendientes menos pronunciadas.

La tasa de articulación (Figura 6D) está relacionada con SD-S, Varco-S, así como con la relación del ritmo silábico (RR-S); esta última representa la proporción entre sílabas más cortas y más largas. Dichas métricas parecen afectar la tasa de articulación de manera similar a como la tasa de habla se ve afectada por la longitud de la oración y la variación en la duración, lo que conduce a una mayor planificación del habla en un segundo idioma (L2) y a una mayor carga cognitiva en L29,23,54. Puede requerirse una carga cognitivo-lingüística mayor en el dominio de la longitud de la oración, de tal forma que se vean afectados los parámetros prosódico-acústicos55.

Con respecto a las características prosódico-acústicas de las tasas de habla y articulación, nuestros hallazgos sugieren que cuanto más varía un hablante la duración de las sílabas (y vocales), más bajas son dichas tasas. Planteamos la hipótesis de que la percepción del habla tanto del portugués brasileño L1 como del L2 suena algo más lenta que el inglés L1 y L2, y que el inglés L1 suena más rápido que todos los demás niveles lingüísticos. Este hecho podría estar relacionado con el ritmo del habla y con la hipótesis de que, mientras el portugués brasileño L1-L2 se inclina hacia el polo silábico del continuo rítmico, el inglés L1-L2 se desplaza hacia el polo acentual21,22.

El brillo local, Figura 6B, se ve influenciado por SD-S y Varco-S. Para el brillo local, las producciones de Bra-S, L1-BP y L2-inglés presentan una trayectoria algo monótona a medida que aumenta la variabilidad de la duración silábica (SD y Varco, véase la Tabla S1 suplementaria). La percepción del esfuerzo vocal podría ser evidente al escuchar las producciones de Bra-S debido a una baja variación que oscila entre 8,5 y 9 dB. El habla de Bra-S se ve afectada por la carga vocal. El L1-BP se ve altamente afectado por la longitud de la oración y es menos sensible a las altas variaciones en la duración silábica (el patrón rítmico del BP muestra menos variación silábica22,56).

La tasa de pausas (Figura 6C) muestra que los hablantes de inglés como segunda lengua producen pausas más largas (de 200 ms a 375 ms) que los hablantes de inglés como primera lengua, portugués brasileño como primera lengua y portugués brasileño como segunda lengua (un promedio de 30 ms para inglés como primera lengua, 50 ms para portugués brasileño como primera lengua y 100 ms para portugués brasileño como segunda lengua). La planificación del habla, en este caso, podría haber afectado la producción del inglés como segunda lengua debido a un aumento en la actividad cerebral54,57. Se espera que una mayor competencia lingüística resulte en una velocidad y amplitud de lectura mayores54; sin embargo, incluso para hablantes competentes en una segunda lengua, las tareas de lectura implicaron un esfuerzo mayor en aspectos cognitivos de orden superior del habla extranjera y en el procesamiento del lenguaje54,57. Nuestros hallazgos muestran, al menos de forma preliminar, que los hablantes de portugués brasileño como segunda lengua podrían verse menos afectados por las pausas que los hablantes de inglés como segunda lengua, debido a diferencias en el patrón rítmico de ambas lenguas.

figure-results-1
Figura 6: Modelos Aditivos Generalizados para las características prosódico-acústicas. En el eje Y, la variable respuesta (las características acústicas que se van a modelar); en el eje X, las variables predictoras (el factor «Idioma» y las covariables en los modelos aditivos que proporcionarán la forma y las trayectorias de las curvas (es decir, los efectos de suavizado: «Idioma + covariables»), y el producto del factor «Idioma» y una característica métrica que proporcionará una proyección más precisa de la variable respuesta (es decir, interacciones factor-suavizado: «covariable:Idioma»). Abreviatura: GAMs = Modelos Aditivos Generalizados. Haga clic aquí para ver una versión más grande de esta figura.

En relación con las métricas rítmicas, para SD-S (Figura 7A), nuestros hallazgos revelan que cuanto más un hablante varía la curva de f0 y aumenta la velocidad del habla, más disminuye el SD-S en todos los niveles lingüísticos (un efecto espejo de la Figura 6A). En el caso de la desviación estándar para consonantes (SD-C, Figura 7C), el L1-BP, a diferencia del inglés L1, presenta una variación baja cuando aumenta la velocidad del habla o la duración de las pausas. Esta dirección del SD se predice dado que la variabilidad en la duración de sílabas del inglés L1 es (estadísticamente) significativamente mayor que la del L1-BP44,58. El Varco-S (Figura 7B y Tabla Suplementaria S1) parece estar algo correlacionado con el L1 y el L2 del mismo grupo lingüístico. A medida que aumenta la variabilidad de f0 y la velocidad del habla, el Varco-S disminuye para el L1-BP y parece disminuir y atenuarse para el L2-BP. En las producciones en inglés, mientras aumentan la variabilidad de f0 y la velocidad del habla, el Varco-S aumenta y se atenúa para el inglés L1 y el inglés L2.

Con respecto a la DS para vocales o consonantes (SD-V_C, Figura 7D y Tabla Suplementaria S1), nuestros resultados muestran algunas similitudes con el desempeño de Varco-S (Figura 7B). Por ejemplo, una mayor tasa de habla, duración de pausas y variabilidad de f0 favorecen una trayectoria ascendente-descendente de la SD-V_C en L1-BP y en L2-BP. En producciones en inglés, aunque estas características prosódicas son más altas, la SD-V_C disminuye ligeramente, se atenúa en L1-inglés, aumenta ligeramente y luego se atenúa en L2-inglés. La correlación entre Varco-S y SD-V_C en los grupos de hablantes L1 y L2 de la misma lengua podría explicarse parcialmente por el efecto Lombard, que hace referencia a la alteración de los parámetros acústicos en el habla debido al ruido de fondo59.

En el habla extranjera, dependiendo de la complejidad de la tarea (por ejemplo, lectura de habla), los hablantes han utilizado estrategias acústicas similares tanto en la L1 como en la L259,60. Por un lado, Marcoux y Ernestus descubrieron que las medidas de f0 (rango y mediana) en el habla Lombard en L2 sugieren que los hablantes de inglés como L2 estuvieron influenciados por su holandés como L161,62. Por otro lado, hallazgos más recientes proponen que, aunque se espera que el habla Lombard en L2 difiera del habla Lombard en L1 debido a la mayor carga cognitiva al hablar la L2, los hablantes de inglés como L2 produjeron el habla Lombard en la misma dirección que los hablantes de inglés como L163. El grado en que nuestros hallazgos coinciden con Marcoux y Ernestus63 y divergen de Waaning59, Villegas et al.60 y Marcoux y Ernestus61,62 requiere una investigación adicional.

figure-results-2
Figura 7: Modelos Aditivos Generalizados para las características métricas. En el eje Y, la variable respuesta (las características métricas que se van a modelar); en el eje X, las variables predictoras (el factor «Idioma» y las covariables en los modelos aditivos que proporcionarán la forma y las trayectorias de las curvas (es decir, los efectos de suavizado: «Idioma + covariables»), y el producto del factor «Idioma» y una característica métrica que proporcionará una proyección más precisa de la variable respuesta (es decir, interacciones factor-suavizado: «covariable:Idioma»). Abreviatura: GAMs = Modelos Aditivos Generalizados. Haga clic aquí para ver una versión más grande de esta figura.

Resultados para la percepción del habla
En relación con las ruedas de reconocimiento de voces en portugués brasileño, en la rueda n.º 1 (Figura 8A), la voz falsa n.º 3 fue identificada como la voz objetivo. De hecho, la voz objetivo era la voz n.º 4. Los resultados no muestran diferencias estadísticamente significativas (véase Tabla Suplementaria S1) entre la voz falsa n.º 3 (83 %) y la voz objetivo n.º 4 (71 %). En la rueda n.º 2 (Figura 8B), una comparación entre la voz objetivo n.º 3 (40 %) y la voz falsa n.º 4 (20 %) tampoco mostró diferencias estadísticamente significativas (véase Tabla Suplementaria S1) para las ruedas de reconocimiento de voces en inglés. En la rueda n.º 1 (Figura 9A), no hubo diferencia significativa (véase Tabla Suplementaria S1) entre la voz falsa n.º 2 (26 %) y la voz objetivo n.º 4 (54 %).

En el análisis de la similitud vocal, tanto la similitud del coseno (CoSim) como la distancia euclidiana (EucDist, [EucDist transformada]54) mostraron una correlación constante entre el distractor n.º 3 y el objetivo en la rueda de reconocimiento BP n.º 1 (CoSim = 0,99; EucDist = 77,4, [0,93]). La correlación entre el distractor n.º 4 y el objetivo fue igualmente fuerte en la rueda de reconocimiento BP n.º 2 (CoSim = 0,99, EucDist = 76,3, [0,93]). En la rueda de reconocimiento en inglés n.º 1, la correlación fue constante para CoSim (0,83), pero débil a satisfactoria para EucDist (213,0, [0,47]). En general, ambas técnicas, CoSim y EucDist, fueron satisfactorias para determinar la similitud vocal. Además, CoSim tuvo un desempeño ligeramente más eficaz, como señalan Gahman y Elangovan52 (véase Tabla Suplementaria S1).

En cuanto a la similitud, ¿qué podría haber provocado un aumento en las alarmas falsas? Las características prosódico-acústicas mostraron evidencia de que, aunque las voces distractoras y las voces objetivo se desempeñaron (estadísticamente) de manera significativamente diferente —con la excepción de los grupos presentados en el Figure 8A,B y en el Figure 9A—, las elecciones de los oyentes se diversificaron algo a lo largo de diferentes distractores en los otros grupos (Figure 8C,D y Figure 9B-D). Esta clase de juicio parece depender más de una (o quizás más de una) característica acústica específica que comparten los hablantes, que de una clase completa de características prosódico-acústicas. Por ejemplo, nuestro estudio presentó varias características que variaban (conjuntamente) entre las producciones; sin embargo, los resultados perceptuales muestran preferencias en los juicios por un distractor específico para que coincida con la voz objetivo8,35,64,65. Serán necesarios análisis adicionales en trabajos futuros.

Es destacable considerar la elección de una matriz paramétrica multidimensional para la similitud acústica66 como la presentada en este estudio. Nuestros hallazgos coinciden con estudios previos que utilizaron características acústicas basadas en f0, VQ e intensidad9,35. Dichas características se recomiendan notablemente para tareas de comparación de hablantes en el ámbito forense9,66. No obstante, es importante destacar que en la presente investigación, ninguno de los hablantes de distracción fue predicho como similar a la voz objetivo, aunque hayamos utilizado una variante de las directrices de McFarlane16,17 en la preparación de los grupos de voces para el reconocimiento de hablantes con acento extranjero. Además, debemos enfatizar que nuestro procedimiento de formación de grupos de voces presenta diferencias importantes respecto a las directrices de McFarlane, incluyendo la duración del estímulo, el número de voces, la selección de los hablantes de distracción (aleatorizados en este caso) y el estilo de habla.

Hasta qué punto las características prosódico-acústicas del f0, la calidad vocal y la intensidad parecen estar relacionadas con la percepción de los oyentes dependería en gran medida del estilo de habla utilizado en la investigación. Aquí, utilizamos pasajes leídos. La mayoría de los estudios sobre testigos auditivos optan por estímulos (semi)espontáneos como una solución equilibrada, por ejemplo, el corpus DyVis67, que se ha empleado ampliamente en investigaciones contemporáneas sobre testigos auditivos28,68. La razón que nos llevó a elegir las tareas de lectura es que nuestro corpus, en el momento de redactar este manuscrito, consistía exclusivamente en datos obtenidos a partir de tareas de lectura. Sin embargo, es importante reconocer que ya está en marcha el proceso de compilación de un corpus (semi)espontáneo. Además, el acto de leer una historia puede generar un nivel confiable de uniformidad y variación, tanto intrahablante como interhablante. Esto facilita el énfasis en características prosódicas o fonéticas, individuales o dialectales, en situaciones que implican comparación de voces. Esto resulta especialmente evidente en casos de carga vocal durante la producción de un acento extranjero, incluso entre hablantes competentes 8,9,23,54.

figure-results-3
Figura 8: Gráficos de barras que contienen los resultados de las cuatro ruedas de reconocimiento realizadas por los oyentes brasileños. (A,B) Diferencia no significativa entre la voz objetivo (en azul) y una voz falsa (en azul claro). (C,D) Diferencias significativas respecto a las voces falsas y la voz objetivo. Abreviatura: NS = no significativo. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-4
Figura 9: Gráficos de barras que contienen los resultados de las cuatro ruedas de reconocimiento realizadas por los oyentes estadounidenses. (A) Diferencia no significativa entre la voz objetivo (en rojo) y una voz falsa (en rosa). (B,C,D) Diferencias significativas entre las voces falsas y la voz objetivo. Abreviatura: NS = no significativo. Haga clic aquí para ver una versión más grande de esta figura.

Tabla Suplementaria S1: Estadísticas de producción del habla - Modelos Aditivos Generalizados (GAM): Las estadísticas F (grados de libertad), el R2 ajustado de cada característica prosódico-acústica estadísticamente significativa (Figura 6) y métrica de ritmo (Figura 7) por nivel de idioma, así como los valores individuales de cada término suave (las covariables). Estadísticas de percepción del habla: Las estadísticas χ2 de Kruskall-Wallis (grados de libertad), los valores p y el η2 ajustado, así como una prueba post hoc de Dunn para comparación por pares (Figura 8 y Figura 9) de cada diferencia estadísticamente no significativa entre los pares de voces objetivo-distractor (Figura 8A,B y Figura 9A). Matrices de similitud acústica para las distancias coseno y euclidiana de cada rueda de reconocimiento. Haga clic aquí para ver una versión ampliada de esta figura.

Discusión

El protocolo actual presenta una novedad en el campo de la fonética (forense). Se divide en dos fases: una basada en la producción (análisis acústico) y otra basada en la percepción (análisis de juicio). La fase de análisis de producción comprende la preparación de datos y la alineación forzada, la realineación y la extracción automática de características prosódico-acústicas además de las estadísticas. Este protocolo conecta la etapa de recopilación de datos con el análisis de datos de una manera más rápida y eficiente que los protocolos tradicionales basados en una segmentación predominantemente manual.

Sin embargo, el proceso de realineación, que se muestra en los pasos de protocolo 1.3.6 a 1.3.6.9, funciona básicamente en las unidades de teléfono y palabra generadas en los pasos de protocolo 1.3.1 a 1.3.4. La novedad del proceso de realineación es que genera un nuevo TextGrid que contiene tres nuevos niveles de texto: un nivel silábico, un nivel de fragmento de voz que se puede generar de forma automática o manual en función de las palabras, y un nivel de tono que puede ser bastante útil para calcular los compases de f0. Las pautas de realineación propuestas para este protocolo se utilizaron previamente en estudios de ritmo del habla L2 21,69,70, estudios para la detección del grado de acento extranjero utilizando técnicas de aprendizaje automático22 y estudios en el dominio forense 9.

La extracción automática de características prosódicas, presentada en los pasos del protocolo 1.3.7 a 1.3.7.10, genera una matriz multidimensional de características prosódicas-acústicas como se pudo atestiguar en la investigación actual. Tales características incluyen características de habla melódicas, de duración y espectrales (calidad e intensidad de la voz)71. Un número considerable de estas características acústicas son menos sensibles y algo robustas a las grabaciones de audio ruidosas que eventualmente se recopilan en el escenario forense o en cualquier otro escenario72. Además, la matriz multidimensional se puede aplicar a los sistemas de reconocimiento de voz a través de varias técnicas de IA (trabajo en curso). Todavía puede ser bastante útil en la enseñanza de aspectos prosódicos en las clases de pronunciación L221 (trabajo en progreso).

El análisis estadístico de esta parte del protocolo representa el uso del método GAM, ya que se trata de una relación compleja entre una característica acústica específica y múltiples hablantes de factor de lenguaje. Para modelar una característica acústica específica, por ejemplo, era necesario verificar cómo se comportarían otras características acústicas de la matriz (los términos suaves) para que pudiéramos describir con mayor precisión lo que estaba sucediendo durante la producción del habla.

En cuanto al análisis de percepción, el protocolo actual se constituyó mediante la preparación e implementación de las alineaciones de voz, el análisis estadístico y el análisis de similitud acústica. Para preparar las alineaciones, usamos el script CreateLineup para Praat, que genera automáticamente un archivo de audio para cada alineación que contiene láminas secuenciadas aleatoriamente y voz de destino como se describe en los pasos del protocolo 2.2 a 2.2.1.9.

Para el análisis estadístico de este protocolo, se realizó la prueba no paramétrica de Kruskal-Wallis, ya que nuestros datos no cumplían con los supuestos del Análisis de Varianza (ANOVA). Una vez que tuvimos una relación entre las puntuaciones de juicio evaluadas por los oyentes y controlamos la voz objetivo y las láminas, optamos por utilizar las estadísticas del modelo lineal.

Para el análisis de similitud acústica, utilizamos el script AcousticSmilarity_cosine_euclidean para Python. El programa abre el árbol de directorios de la computadora y le pide al usuario que elija el archivo que contiene las características prosódico-acústicas de las láminas y la voz objetivo que compone la alineación en análisis. Con solo hacer clic en un botón, el script genera tres matrices de similitud: un coseno, un euclidiano y un euclidiano transformado (cero a uno), tanto en archivos '.txt' (delimitados por tabulaciones) como en '.csv'. Aún debemos tener en cuenta que cada conjunto de datos (el archivo '.txt' que contiene las características prosódico-acústicas de las láminas y el objetivo) debe estar en la carpeta original de la alineación, y cada carpeta de alineación debe tener una copia del script AcousticSmilarity_cosine_euclidean .

En resumen, el protocolo actual avanza en la investigación fonética (forense). Comprende distintas fases (análisis de producción y percepción, así como similitud acústica), cierra la brecha entre la recopilación de datos y el análisis multidimensional de características acústicas. Los investigadores pueden beneficiarse de una perspectiva holística, explorando tanto los aspectos de producción como los de percepción. Además, este protocolo garantiza la reproducibilidad de la investigación, lo que permite a otros basarse en las pautas de este trabajo.

Limitaciones y direcciones futuras
Aún debemos tener en cuenta que todo saldrá bien si la preparación de los datos sigue las pautas propuestas en los pasos del protocolo 1.3.1 a 1.3.4. Además, en los procedimientos de alineación forzada, debemos ser conscientes de que un alineador forzado externo preentrenado -como MAUS utilizado en el presente trabajo- es susceptible de errores de segmentación, especialmente en datos con acento extranjero no preentrenados o incluso en alineadores preentrenados, ya sea que el audio no tenga una buena calidad o que el alineador no contenga el idioma de audio (este hecho haría que el trabajo del experto sea más difícil y lento). La transcripción forense, especialmente de archivos de audio más largos, encuentra dificultades con respecto a la representación precisa y confiable de las grabaciones habladas72.

También hay varios desafíos en la transcripción y alineación de archivos de audio más largos. El rendimiento del alineador se ve afectado por el estilo de habla y el entorno fonético, así como por factores específicos del dialecto. Aunque existen diferencias específicas de alineadores, en general, su rendimiento es similar y genera segmentaciones que se comparan bien con la alineación manualen general 73. Además, la producción de inglés L1 y L2 se llevó a cabo con un modelo acústico preentrenado de inglés americano debido a la falta de disponibilidad de modelos de habla extranjera en MAUS. Además, no hay modelos acústicos preentrenados para BP en MAUS. Para los datos de BP, se utilizaron los modelos acústicos preexistentes de italiano (véase NOTA, paso 1.3.5.7 del protocolo).

En trabajos futuros (en curso), utilizaremos el Alineador Forzado de Montreal (MFA)74 como parte del protocolo. Una gran ventaja de MFA es la disponibilidad de modelos acústicos preentrenados y modelos de grafema a fonema para una amplia variedad de idiomas (incluido BP), así como la capacidad de entrenar nuevos modelos acústicos y de grafema a fonema para cualquier conjunto de datos nuevo (es decir, nuestro corpus de habla con acento extranjero)75.

Divulgaciones

Los autores no tienen conflictos de intereses que declarar.

Agradecimientos

Este estudio fue apoyado por el Consejo Nacional de Desarrollo Científico y Tecnológico - CNPq, subvención n.º 307010/2022-8 para el primer autor, y subvención n.º 302194/2019-3 para el segundo autor. Los autores desean expresar su sincero agradecimiento a los participantes de esta investigación por su generosa cooperación e invaluables contribuciones.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
CreateLineupColección personal#Script for praat para la preparación de alineaciones
de voz Dell I3 (con unidad de estado sólido - SSD) Dell#Ordenador portátil
PraatPaul Boersma & David Weenink#Software para el análisis fonético
Python 3Python Software Foundation#Lenguaje de programación interpretado, de alto nivel, de propósito general 
RThe R Project for Statistical Computing#Lenguaje de programación para la computación estadística
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorPersonal collection#Script for praat for automatic extraction of acoustic
features SurveyMonkeySurveyMonkey Inc.#Ensamblaje de encuestas personalizables gratuitas, así como un conjunto de programas de back-end que incluyen análisis de datos, selección de muestras, eliminación de sesgos y representación de datos.
Tascam DR-100 MKIITascam#Grabadora de voz digital
El sistema de segmentación automática de Múnich MAUSUniversidad de Múnich#Alineador forzado de archivos de audio (.wav) e información lingüística (.txt)
VVUnitAlignerColección personal#Script para praat para el realineamiento automático y el post-procesamiento de unidades fonéticas

Referencias

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Reimpresiones y permisos

Etiquetas

Características prosódicaspercepción del hablacalidad de la vozfrecuencia fundamentalreconocimiento del hablantesimilitud acústica