Artículo de método

Acento extranjero e identificación forense de hablantes en alineaciones de voz: la influencia de las características acústicas basadas en la prosodia

DOI:

10.3791/66313

27 de septiembre de 2024

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación tuvo como objetivo hacer una comparación entre L1-L2-inglés y L1-L2 portugués para comprobar cuánto el efecto de un acento extranjero tiene en cuenta tanto las métricas como los parámetros prosódico-acústicos, así como la elección de la voz objetivo en una alineación de voz.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Esta investigación tiene como objetivo examinar tanto las características prosódico-acústicas como los correlatos perceptivos del inglés con acento extranjero y el portugués brasileño con acento extranjero y verificar cómo las producciones de los hablantes de acentos extranjeros y nativos se correlacionan con la percepción de los oyentes. En la Metodología, llevamos a cabo un procedimiento de producción de habla con un grupo de hablantes americanos de L2 de portugués brasileño y un grupo de hablantes brasileños de L2 de inglés, y un procedimiento de percepción del habla en el que realizamos alineaciones de voz para ambas lenguas. Para el análisis estadístico de la producción del habla, se ejecutaron modelos aditivos generalizados para evaluar el efecto de los grupos lingüísticos en cada clase (métrica o prosódico-acústica) de características controladas para el efecto suavizante de las covariables de la clase opuesta. Para el análisis estadístico de la percepción del habla, se realizó una prueba de Kruskal-Wallis y una prueba de Dunn post-hoc para evaluar el efecto de las voces de las alineaciones en las puntuaciones juzgadas por los oyentes. Sin embargo, realizamos pruebas de similitud acústica (voz) basadas en las distancias del coseno y euclidiano. Los resultados mostraron diferencias acústicas significativas entre los grupos lingüísticos en términos de variabilidad del f0, duración y calidad de la voz. Para las alineaciones, los resultados indicaron que las características prosódicas de f0, intensidad y calidad de voz se correlacionaron con los juicios percibidos de los oyentes.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El acento es un aspecto destacado y dinámico de la comunicación y la fluidez, tanto en la lengua materna (L1) como en una lengua extranjera (L2)1. El acento extranjero representa las características fonéticas de la L2 de una lengua de destino, y puede cambiar (con el tiempo) en respuesta a la experiencia del hablante en la L2, el estilo de habla, la calidad de la entrada, la exposición, entre otras variables. Un acento extranjero se puede cuantificar como un grado (escalar) de diferencia entre el habla L2 producida por un hablante extranjero y un acento local o de referencia del idioma de destino2,3,4,5.

Esta investigación tiene como objetivo examinar tanto las características prosódico-acústicas como los correlatos perceptivos del inglés con acento extranjero y el portugués brasileño (BP) con acento extranjero, así como verificar hasta qué punto las producciones de los hablantes de acentos extranjeros y nativos están correlacionadas con la percepción de los oyentes. Investigaciones previas en el campo forense han demostrado la robustez de las vocales y consonantes en la identificación de acento extranjero, ya sea como estables para un análisis a largo plazo de un individuo (The Lo Case6) o refiriéndose a la alta precisión de identificación de un hablante (The Lindbergh Case7). Sin embargo, la exploración de las características prosódico-acústicas basadas en la duración, la frecuencia fundamental (f0, es decir, el correlato acústico del tono), la intensidad y la calidad de la voz (VQ) ha ganado cada vez más atención8,9. Por lo tanto, la elección de las características prosódico-acústicas en este estudio representa una vía prometedora en el campo de la fonética forense8,10,11,12,13.

La presente investigación está respaldada por estudios dedicados a los acentos extranjeros como una forma de disfraz de voz en casos forenses14,15, así como en la preparación de alineaciones de voz para el reconocimiento de hablantes16,17. Por ejemplo, la velocidad del habla jugó un papel importante en la identificación de los hablantes de inglés, alemán, italiano, japonés y brasileño18,19,20,21,22. Además de la velocidad del habla, las características espectrales y f0 a largo plazo desafían a los hablantes competentes en L2 con la familiaridad con el idioma objetivo porque el cerebro y las bases cognitivas sufren un déficit en la memoria, la atención y la emoción, lo que se refleja en el rendimiento fonético del hablante durante los turnos largos del habla23. La visión de los acentos extranjeros en el campo forense es que la definición de lo que realmente suena como un acento extranjero depende en gran medida de la falta de familiaridad del oyente en lugar de tener un grado nada extremo de habla con acento extranjero24.

En el dominio perceptivo, una herramienta forense común utilizada desde mediados de la década de 1990 para el reconocimiento de criminales es la Alineación de Voz (reconocimiento auditivo), que es análoga al reconocimiento visual utilizado para identificar a un perpetrador en una escena del crimen16,25. En una alineación de voces, la voz del sospechoso se presenta junto a otras voces similares en aspectos sociolingüísticos como la edad, el sexo, la ubicación geográfica, el dialecto y el estado cultural, para su identificación por parte de un testigo. El éxito o el fracaso de una alineación de voces dependerá del número de muestras de voz y de la duración de las muestras25,26. Además, en el caso de las muestras del mundo real, se considera que la calidad del audio influye constantemente en la precisión del reconocimiento de voz. Una mala calidad de audio puede distorsionar las características únicas de una voz27. En el caso de similitud de voz, los detalles fonéticos finos basados en f0 pueden confundir al oyente durante el reconocimiento de voz28,29. Tales características acústicas se extienden más allá de f0 y abarcan elementos de duración, y características espectrales de intensidad y VQ30. Esta visión de múltiples características prosódicas es crucial en el contexto de la comparación forense de voces para garantizar una identificación precisa del hablante9,14,15,29,31.

En resumen, los estudios de fonética forense han mostrado algunas variaciones con respecto a la identificación del acento extranjero en las últimas décadas. Por un lado, un acento extranjero no parece afectar el proceso de identificación de un hablante32,33 (especialmente si el hablante no está familiarizado con el acento extranjero objetivo34). Por otro lado, hay hallazgos en la dirección opuesta12,34,35.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo recibió la aprobación de un comité de ética de investigación en humanos. Además, se obtuvo el consentimiento informado de todos los participantes involucrados en este estudio para usar y publicar sus datos.

1. Producción de voz

NOTA: Recogimos el habla de una tarea de lectura tanto en 'L1 English-L2 BP' producido por el Grupo 1: The American English (de los EE. UU.) Speakers (AmE-S), como en ambos 'L1 BP-L2 English' producido por el Grupo 2: The Bra zilian Speakers (Bra-S). Consulte Figura 1 para obtener un diagrama de flujo para la producción de voz.

figure-protocol-1
Figura 1: Diagrama de flujo esquemático para la producción de voz. Por favor, haga clic aquí para ver una versión más grande de esta figura.

  1. Participantes
    1. Determinar el número de participantes, el idioma (L1 inglés, L2 BP; L1 BP, L2 inglés), el sexo (femenino o masculino), la edad (media, desviación estándar), las características del grupo (profesionales o estudiantes de pregrado) y el nivel de competencia en L2 (avanzado o avanzado) para cada grupo
      NOTA: Para la presente investigación, tanto AmE-S como Bra-S se consideraron competentes en L2 (ambos grupos fueron calificados como B2-C136). La AmE-S había vivido durante dos años en Brasil cuando se realizaron los procedimientos. El Bra-S había vivido más de dos años en los EE.UU. cuando se llevaron a cabo los procedimientos. Mientras vivían en el extranjero, ambos grupos solían hablar su L2 con fines de estudio y trabajo al menos 6 días a la semana durante ~ 4-5 h al día.
    2. Asigne a los participantes una habitación cómoda y tranquila y presente el material de lectura para cada grupo.
  2. Recolección de datos
    NOTA: Los datos del habla deben recopilarse de una tarea de lectura en los siguientes idiomas: L1-inglés y L2-BP; L1-BP y L2-Inglés. Deje que los participantes lean los textos de antemano si es necesario.
    1. Procedimientos de registro
      1. Registre los datos de voz en un lugar tranquilo con condiciones acústicas adecuadas.
      2. Utilice una grabadora de voz digital (ver la Tabla de Materiales)37 y un micrófono cardioide unidireccional electromagnético aislado (ver la Tabla de Materiales)38.
      3. Grabe los datos de audio en forma de '.wav'.
      4. Configure la frecuencia de muestreo a 48 kHz y la velocidad de cuantificación a 16 bits.
        NOTA: El formato de audio y la configuración de las velocidades de muestreo y cuantificación descritas en los pasos 1.2.1.3 y 1.2.1.4 se aplican para garantizar una alta calidad y reducción del ruido a fin de preservar las características espectrales utilizadas para el análisis acústico posterior.
  3. Análisis acústico
    NOTA: Divida los procedimientos de análisis acústico en tres pasos: alineación forzada, realineación y extracción de características acústicas.
    1. Escribe la transcripción lingüística (en un '.txt') para cada archivo de audio.
    2. Etiquete el par de archivos '.txt'/'.wav' con el mismo nombre (es decir, 'my_file.wav'/ 'my_file. txt').
      NOTA: Para mejorar el rendimiento del procedimiento descrito en la sección 1.3.7, se recomienda encarecidamente que los tres caracteres iniciales de las etiquetas de archivo '.txt/.wav' representen el idioma, el dialecto o el acento, mientras que los caracteres del cuarto al sexto denotan el sexo (por ejemplo, EL1FEM para English L1 Female). A partir del séptimo carácter, el usuario debe indicar el número de altavoz (por ejemplo, 001 para el primer altavoz). En consecuencia, el primer par '.txt/.wav' es EL1FEM001.
    3. Cree una carpeta para cada idioma L1-L2.
      NOTA: Una carpeta para L1-L2 inglés y una carpeta para L1-L2 BP.
    4. Certifique que todos los pares de archivos del mismo idioma están en la misma carpeta.
    5. Lleve a cabo la alineación forzada.
      1. Acceda a la interfaz web del alineador forzado Munich Automatic Segmentation (MAUS) (webMAUS)39 en https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Arrastra y suelta cada par de archivos . wav / . txt de la carpeta al rectángulo discontinuo en Archivos (o haga clic dentro del rectángulo, Figura 2A).
      3. Haga clic en el botón Cargar para cargar los archivos en el alineador (consulte la flecha roja en Figura 2A).
      4. Seleccione las siguientes opciones en el menú de opciones de servicio (Figura 2B): G2P-MAUS-PHO2SYL para el nombre de la canalización; Inglés (EE. UU.) (para el idioma) si los datos de inglés L1-L2 son; Italiano (IT) (para el idioma) si L1-L2 BP data.
        NOTA: Elegimos 'italiano' para los datos de BP porque webMAUS no proporciona modelos acústicos preentrenados para la alineación forzada de BP. La literatura fonética plantea que la fonología italiana tiene un inventario simétrico de siete vocales algo comparable, al igual que BP40, así como similitudes acústicas consonánticas41,42.
      5. Mantenga las opciones predeterminadas para 'Formato de salida' y 'Conservar todo'.
      6. Marque la casilla de opción Ejecutar para aceptar los términos de uso (consulte la flecha verde en Figura 2C).
      7. Haga clic en el botón Ejecutar servicio web para ejecutar los archivos cargados en el aligner.
        NOTA: Para cada archivo de audio, el alineador forzado MAUS devuelve un objeto Praat TextGrid (un archivo '.txt' preformateado Praat que contiene la anotación de palabras, sílabas fonológicas y teléfonos basados en la transcripción lingüística extraída del archivo '.txt' descrito en el paso 1.3.1).
      8. Haga clic en el botón Descargar como archivo ZIP para descargar los archivos de TextGrid como un archivo comprimido (Figura 2C).
        NOTA: Asegúrese de que los archivos TextGrid comprimidos se descarguen en la misma carpeta que los archivos de audio.
      9. Extraiga los archivos TextGrid para su posterior realineación en el software de análisis fonético43.
    6. Llevar a cabo la realineación.
      1. Acceda y descargue el script para Praat VVUnitAligner44 desde https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat.
      2. Certifique que todos los pares de archivos del mismo idioma y el script r VVUnitAligne están en la misma carpeta.
        NOTA: Una carpeta para los archivos L1-L2 en inglés y el VVunitAligner, y una carpeta para los archivos L1-L2 BP y el VVunitAligner.
      3. Abra el software de análisis fonético.
      4. Haga clic en Praat | Abra el script Praat... para llamar al script desde la ventana del objeto.
      5. Haga clic en el botón Ejecutar una vez.
        NOTA: Aparecerá en la pantalla un formulario llamado Alineación fonética de sílabas que contiene la configuración para usar el script (Figura 3A).
      6. Haga clic en el botón Idioma para elegir entre los idiomas 'Inglés (EE. UU.), 'Portugués (BR)', 'Francés (FR)' o 'Español (ES)'.
      7. Haga clic en el botón Segmentación de fragmentos para elegir entre el procedimiento de segmentación "Automático", "Forzado (manual)" o "Ninguno".
      8. Marque la opción Guardar archivos de TextGrid para guardar automáticamente los nuevos archivos de TextGrid.
      9. Haga clic en Aceptar | Ejecute los botones para una realineación de las unidades fonéticas del paso 1.3.5.7 .
        NOTA: Para cada archivo de audio, VVUnitAligner generará un nuevo archivo TextGrid para la sección 1.3.7 (Figura 3B).
    7. Llevar a cabo la extracción automática de las características acústicas.
      1. Acceda y descargue el script SpeechRhythmExtractor45 de https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat para la extracción automática de las características prosódico-acústicas.
      2. Cree una nueva carpeta y coloque SpeechRhythmExtractor junto con todos los pares de archivos de audio/TextGrid de todos los idiomas.
      3. Abra el software de análisis fonético.
      4. Haga clic en Praat | Abra el script Praat... para llamar al script desde la ventana del objeto.
      5. Haga clic en el botón Ejecutar solo una vez.
        NOTA: Aparecerá en la pantalla un formulario que contiene la configuración del script. En los cuadros de los nombres de archivo de salida '.txt', cambie el nombre de los archivos en consecuencia o deje los nombres predeterminados.
      6. Marque la opción de parámetros de calidad de voz para guardar el archivo de salida VQ para la calidad de voz (Figura 3C).
        NOTA: Este segundo archivo de salida (el archivo de salida VQ) contiene los parámetros de la diferencia entre el y el armónico (H1-H2) y el Pico de Prominencia Cepstral (CPP)9.
      7. Marque la opción Destino lingüístico para elegir entre las etiquetas 'Idioma', 'Dialecto' o 'Acento' (Figura 3C).
      8. Marque la opción Unidad para elegir las características f0 en Hz o en Semitonos (Figura 3C).
      9. Configure en los valores para el umbral F0, los umbrales mínimo y máximo f0 (Figura 3C).
        NOTA: A menos que la investigación tenga propósitos específicos o características de audio específicas preestablecidas, se recomienda encarecidamente dejar los parámetros del paso 1.3.7.9 con los valores predeterminados.
      10. Haga clic en Aceptar | Corre para la extracción automática de las características acústicas .
        NOTA: El script SpeechRhythmExtractor devuelve un archivo '.txt' delimitado por tabuladores (archivo de salida/archivo de salida VQ) que contiene las características acústicas extraídas de los altavoces.
  4. análisis estadístico
    1. Cargue la hoja de cálculo que contiene las características acústicas en el entorno R46 (o en cualquier software/entorno estadístico de su elección).
    2. Realizar estadísticas no paramétricas de modelos aditivos generalizados (GAM).
      1. Realizar GAM en R.
      2. Escriba los siguientes comandos y pulse Intro.
        biblioteca(mgcv)
        model = gam(la característica métrica/prosódica-acústica en el análisis ~ el Lenguaje + s(la característica métrica elegida, por = la Lengua) + otras características métricas/prosódico-acústicas, datos = el marco de datos)
        NOTA: Decidimos realizar las estadísticas de prueba del protocolo en el lenguaje de programación R debido a su creciente popularidad entre los fonéticos (y lingüistas) en la comunidad académica. R se ha utilizado ampliamente en la investigación fonética del trabajo de campo47. Tenga en cuenta que el paso 1.4.2.2 contiene un pseudocódigo. Escriba el código de acuerdo con las variables de investigación.

figure-protocol-2
Figura 2: Captura de pantalla de la alineación fonética usando el alineador forzado MAUS. (A) El rectángulo discontinuo está diseñado para arrastrar y soltar archivos 'my_file.wav'/' my_file.txt' o hacer clic dentro para buscar dichos archivos desde la carpeta; El botón de carga se indica con la flecha roja. (B) Los archivos cargados desde el panel A (ver flecha azul), la tubería que se utilizará, el idioma de los pares de archivos, el formato de archivo que se devolverá y un botón 'verdadero/falso' para conservar todos los archivos. (C) Los términos de uso de la casilla de verificación (consulte la flecha verde), el botón Ejecutar servicios web y los Resultados (archivos de cuadrícula de texto que se descargarán). Por favor, haga clic aquí para ver una versión más grande de esta figura.

figure-protocol-3
Figura 3: Captura de pantalla del procedimiento de realineamiento. (A) Formulario de configuración de entrada para el procedimiento de realineamiento. (B) Forma de onda parcial, espectrograma de banda ancha con contorno f0 (azul) y seis niveles segmentados (y etiquetados) como nivel 1: unidades de inicio vocálico hasta el siguiente inicio vocálico (V_to_V); inicio de las vocales (V_to_V); nivel 2: unidades de vocal (V), consonante (C) y pausa (#); Nivel 3: representaciones fónicas V_to_V; Nivel 4: algunas palabras del texto; nivel 5: algunos fragmentos (CH) de la oración del texto; nivel 6: nivel tonal que contiene el tono más alto (H) y el tono más bajo (L) de cada fragmento de voz producido por una AmE-S femenina. (C) Ajustes de entrada para la extracción automática de las características acústicas. Por favor, haga clic aquí para ver una versión más grande de esta figura.

2. Percepción del habla

NOTA: Realizamos cuatro alineaciones de voz en inglés con oyentes estadounidenses y cuatro alineaciones en BP con oyentes brasileños. Consulte Figura 4 para obtener un diagrama de flujo para la percepción del habla.

figure-protocol-4
Figura 4: Diagrama de flujo esquemático para la percepción del habla. Por favor, haga clic aquí para ver una versión más grande de esta figura.

  1. Participantes
    1. Elija diferentes participantes para cada grupo de los que participaron en el protocolo de producción de discurso.
      NOTA: Se seleccionaron dos grupos de participantes para esta parte del protocolo: Grupo 1: El Inglés Americano(de los EE.UU.) Listeners (AmE-L), y Grupo 2: Los Listeners Bra zilian(Bra-L). Para la presente investigación, tanto AmE-L como Bra-L fueron considerados competentes en L2 (ambos grupos fueron calificados como B2-C136 El AmE-L había vivido dos años en Brasil cuando se realizaron los procedimientos. El Bra-L había vivido más de dos años en los EE.UU. cuando se llevaron a cabo los procedimientos. Mientras vivían en el extranjero, ambos grupos solían hablar su L2 con fines de estudio y trabajo (al menos seis días a la semana durante unas 4 o 5 horas al día).
    2. Determinar el número de participantes, el idioma (L1 inglés, L2 BP; L1 BP, L2 inglés), el sexo (femenino o masculino), la edad (media, desviación estándar), las características del grupo (profesionales o estudiantes de pregrado) y el nivel de competencia en L2 para cada grupo.
  2. Las alineaciones de voz
    NOTA: Divida los procedimientos de las alineaciones de voz en dos pasos diferentes: preparación y ejecución de las alineaciones de voz.
    1. Prepare cuatro alineaciones de voz para inglés y cuatro para BP.
      1. Obtener archivos de audio de los altavoces de la sección 1: Producción de voz.
      2. Certificar que los archivos de audio de cada factor de idioma están en carpetas separadas.
      3. Elija al azar seis fragmentos de voz en L1 English o L1 BP.
        NOTA: Seis voces en la alineación representan una voz objetivo y cinco foils.
      4. Elija un fragmento de voz en L2 inglés o L2 BP de uno de los altavoces incluidos en el paso 2.2.1.3.
        NOTA: El fragmento de voz en el paso 2.2.1.4 es la voz de referencia. Los trozos deben tener una longitud aproximada de 20 s.8.
      5. Acceda y descargue el script para Praat CreateLineup48 desde https://github.com/pabarbosa/prosody-scripts-CreateLineUp.
      6. Certifique que la voz de referencia L2, las láminas L1 y la voz de destino L1 estén en la misma carpeta antes de ejecutar el script CreateLineup (Figura 5).
      7. Abra el software de análisis fonético.
      8. En la ventana del objeto, haga clic en Praat | Abra el script Praat... para llamar al script.
      9. Haga clic en Ejecutar | Ejecutar.
        NOTA: El script devuelve un archivo en el siguiente orden: (la voz de referencia L2) + (la voz objetivo L1 y las láminas distribuidas aleatoriamente) (Figura 5).
    2. Ejecución de las alineaciones de voz
      1. Crea un espacio en línea para alojar los carteles en cualquier plataforma que elijas (por ejemplo, SurveyMonkey. Consulte la Tabla de Materiales) para realizar de forma remota las alineaciones de voz.
      2. Acceda al enlace del espacio en línea.
      3. Cargue los archivos devueltos por el script CreateLineup en la plataforma.
      4. Ejecute el procedimiento antes que los participantes para probar cada paso.
        NOTA: Se recomienda acceder previamente al enlace y ejecutar las alineaciones para comprobar si todo está funcionando con normalidad.
  3. análisis estadístico
    1. Cargue la hoja de cálculo que contiene las puntuaciones de los juicios de los oyentes en el entorno de R (o en cualquier software/entorno estadístico de su elección).
      1. Realice la prueba de Kruskal-Wallis en R.
      2. Escriba los siguientes comandos y pulse Intro.
        modelo = kruskal.test(juicios ~ cada alineación de voz, datos = el marco de datos)
    2. Realiza una prueba de Dunn post-hoc.
      1. Realice la prueba de Dunn en R.
      2. Escriba los siguientes comandos y pulse Intro.
        biblioteca(FSA)
        model = dunnTest(judgments ~ each voice lineup, data = data, method = "bonferroni")
        NOTA: Los códigos de los pasos 2.3.1.2 y 2.3.2.2 son pseudocódigos (véase la NOTA 1.4.2.2).
  4. Análisis de similitud acústica
    1. Seleccione las alineaciones (véase la NOTA en el paso 2.2.1.3) que presenten diferencias no significativas entre el objetivo y cualquiera de los foils.
    2. Repita los procedimientos de los pasos 1.3.1 a 1.3.7.5 y de los pasos 1.3.7.8 a 1.3.7.10.
    3. Acceda y descargue el script para Python49, AcousticSimilarity_cosine_euclidean50 de https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      NOTA: El script devuelve tres matrices (en '.txt' y '.csv'): una para Cosine similarity51,52, una para Euclidean distance52,53, y otra para los valores de distancia euclidiana transformada, así como una comparación por pares entre la voz objetivo y cada foil.
    4. Certifique que el script se descarga en la misma carpeta del conjunto de datos de alineación.
    5. Haga clic en el botón Abrir archivo... para llamar al script.
    6. Haga clic en Ejecutar | Ejecutar sin depurar buttons.
      NOTA: El segundo botón Ejecutar puede estar etiquetado como Ejecutar o Ejecutar sin depuración o Ejecutar script. Todos ejecutan los mismos comandos. Simplemente depende del entorno de Python utilizado.
    7. Realizar pruebas de similitud de voz basadas en características acústicas.
      NOTA: La similitud del coseno (o distancia del coseno) es una técnica aplicada en la Inteligencia Artificial (IA), particularmente en el aprendizaje automático en sistemas de reconocimiento automático de voz (ASR). Es una medida de similitud entre cero y uno. Una similitud de coseno cercana a uno significa que es muy probable que dos voces sean similares. Una similitud de coseno cercana a cero significa que es muy probable que las voces sean diferentes52. La distancia euclidiana, a menudo denominada similitud euclidiana, también se utiliza ampliamente en la IA, el aprendizaje automático y la ASR. Representa la distancia en línea recta entre dos puntos en el espacio euclidiano53, es decir, cuanto más cerca están los puntos (valores más cortos de distancia), más similares son las voces. Para una comprensión más clara de los resultados reportados de ambas técnicas, realizamos una transformación de las puntuaciones brutas de la distancia euclidiana en valores de cero (menos similitud de voz) a uno (más similitud de voz)54.

figure-protocol-5
Figura 5: Configuración del directorio para la percepción del habla. Carpetas de alineación. Cada carpeta contiene seis voces L1, la voz de destino L2, el script "CreateLineup" y el archivo de audio de la alineación de voces (devuelto después de ejecutar el script). Por favor, haga clic aquí para ver una versión más grande de esta figura.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Resultados para la producción de voz
En esta sección, describimos el rendimiento de las características prosódico-acústicas estadísticamente significativas y las métricas rítmicas. Tales características prosódicas fueron el habla, la articulación y las tasas de pausa, que están relacionadas con la duración, y el brillo, que está relacionado con la calidad de la voz. Las métricas rítmicas fueron la desviación estándar (DE) de la duración de la sílaba, la DE de la consonante, la DE de la duración vocálica o consonántica y el coeficiente de variación de la duración de la sílaba (véase la Tabla Suplementaria S1).

La tasa del habla (Figura 6A) disminuye más rápidamente para L1-L2 inglés que para L1-L2 BP, aunque la tasa es menor para ambas L2. La velocidad del habla está relacionada con tres métricas: SD de la duración de la sílaba (SD-S), SD de las vocales (SD-V) y el coeficiente de variación silábica (Varco-S). También es importante tener en cuenta que tanto el grupo AmE-S como el grupo Bra-S son competentes en sus L2. Parece que dicha tasa se ve afectada por los mayores valores de duración de las sílabas y la menor variabilidad producida por L1-L2 BP, provocando pendientes menos pronunciadas.

La tasa de articulación (Figura 6D) está relacionada con SD-S, Varco-S, así como con la relación de ritmo silábico (RR-S); esta última representa la relación entre sílabas más cortas y más largas. Tales métricas parecen afectar la tasa de articulación al igual que la tasa de habla afectada debido a la longitud de la oración y la variación en la duración que conduce a una mayor planificación del habla L2 y a la carga cognitiva L29,23,54. Es posible que se requiera una mayor carga cognitivo-lingüística en el dominio de la longitud de la oración de manera que los parámetros prosódico-acústicos se vean afectados55.

Con respecto a las características prosódico-acústicas de las tasas de habla y articulación, nuestros hallazgos sugieren que cuanto más varía un hablante la duración de las sílabas (y vocales), menores son dichas tasas. Nuestra hipótesis es que la percepción del habla de L1 y L2 BP suena algo más lenta que L1 y L2-inglés, y que L1-inglés suena más rápido que todos los demás niveles del idioma. Este hecho podría estar relacionado con el ritmo del habla y la hipótesis de que mientras L1-L2 BP se inclina hacia el polo temporizado por sílabas del continuo rítmico, L1-L2 English se mueve hacia el polo temporizado por estrés21,22.

El brillo local, Figura 6B, está influenciado por SD-S y Varco-S. Para el brillo local, ambas producciones de Bra-S, L1-BP y L2-English presentan una trayectoria un tanto monótona a medida que aumenta la variabilidad de la duración de las sílabas (SD y Varco, ver Tabla Suplementaria S1). La percepción del esfuerzo vocal puede ser evidente al escuchar las producciones de Bra-S debido a una baja variación que oscila entre los 8,5 y los 9 dB. El habla de Bra-S se ve afectada por la carga vocal. L1-BP se ve muy afectada por el hecho de que la longitud de la oración es menos sensible a las altas variaciones de la duración de las sílabas (el patrón rítmico de BP muestra menos variación silábica22,56).

La tasa de pausa (Figura 6C) muestra que los hablantes de L2-inglés producen pausas más largas (de 200 ms a 375 ms) que las de L1-Inglés, L1-BP y L2-BP (media de 30 ms para L1-Inglés, 50 ms para L1-BP y 100 ms para L2-BP). La planificación del habla, en este caso, podría haber afectado la producción de inglés L2 debido al aumento de la actividad cerebral54,57. Se espera que un mayor dominio del idioma resulte en una mayor velocidad de lectura y span54; sin embargo, incluso para los hablantes competentes en L2, las tareas de lectura presentaron más esfuerzo en los aspectos cognitivos de orden superior del habla extranjera y en el procesamiento del lenguaje54,57. Nuestros hallazgos muestran, al menos de forma preliminar, que los hablantes de L2-BP pueden verse menos afectados por las pausas que los de L2-inglés debido a las diferencias en el patrón rítmico de ambos idiomas.

figure-results-1
Figura 6: Modelos aditivos generalizados para las características prosódico-acústicas. En el eje Y, la variable de respuesta (las características acústicas a modelar); en el eje X, las variables predictoras (el factor 'Idioma' y las covariables en los modelos aditivos que proporcionarán la forma y las trayectorias de las curvas (es decir, los efectos de suavizado: 'Idioma + covariables'), y el producto del 'Lenguaje' y una característica métrica que proporcionará una proyección más precisa de la variable de respuesta (es decir, interacciones factor-suaves: 'covariable:Lenguaje'). Abreviatura: GAMs = Modelos Aditivos Generalizados. Por favor, haga clic aquí para ver una versión más grande de esta figura.

En relación con las métricas de ritmo, para SD-S (Figura 7A), nuestros hallazgos revelan que cuanto más varía un hablante la curva f0 y aumenta la velocidad del habla, más disminuye SD-S para todos los niveles del idioma (un efecto espejo de Figura 6A). En el caso de la SD para consonantes (SD-C, Figura 7C), L1-BP, a diferencia de L1 inglés, presenta una baja variación a medida que aumenta la velocidad del habla o la duración de la pausa. Dicha dirección SD se predice ya que la variabilidad de la duración de las sílabas en L1-English es (estadísticamente) significativamente mayor que L1-BP44,58. El Varco-S (Figura 7B y Tabla Suplementaria S1) parece estar algo correlacionado con la L1 y la L2 del mismo grupo lingüístico. A medida que la variabilidad f0 y la velocidad del habla aumentan, el Varco-S disminuye para la L1-BP y parece disminuir y atenuarse para la L2-BP. Para las producciones en inglés, mientras que la variabilidad f0 y la velocidad del habla aumentan, Varco-S aumenta y se atenúa para L1-Inglés y L2-Inglés.

Con respecto a la SD para vocales o consonantes (SD-V_C, Figura 7D y Tabla Suplementaria S1), nuestros resultados muestran algunas similitudes con el rendimiento de Varco-S (Figura 7B). Por ejemplo, una mayor velocidad del habla, duración de la pausa y variabilidad f0 promueven una trayectoria de caída-subida de la SD-V_C para L1-BP y para L2-BP. En las producciones en inglés, mientras que estos rasgos prosódicos son más altos, el SD-V_C disminuye ligeramente, se atenúa para L1-Inglés, aumenta ligeramente y luego se atenúa para L2-Inglés. La correlación entre Varco-S y SD-V_C con la L1-L2 de los mismos grupos lingüísticos puede explicarse parcialmente por el efecto Lombard, que se refiere a la alteración de los parámetros acústicos en el habla debido al ruido de fondo59.

En el habla extranjera, dependiendo de la complejidad de la tarea (por ejemplo, leer el habla), los hablantes han utilizado estrategias acústicas similares tanto en L1 como en L259,60. Por un lado, Marcoux y Ernestus encontraron que las medidas f0 (rango y mediana) en el habla lombarda L2 sugieren que los hablantes de inglés L2 fueron influenciados por su L1 Dutch61,62. Por otro lado, los hallazgos más recientes proponen que, aunque se espera que el habla lombarda de L2 difiera del habla lombarda L1 debido a la mayor carga cognitiva al hablar la L2, los hablantes de inglés L2 produjeron el habla lombarda en la misma dirección que los hablantes de inglés L163. La medida en que nuestros hallazgos están alineados con Marcoux y Ernestus63 y divergen de Waaning59, Villegas et al.60, y Marcoux and Ernestus61,62 necesita más investigación.

figure-results-2
Figura 7: Modelos aditivos generalizados para las características métricas. En el eje Y, la variable de respuesta (las características métricas que se van a modelar); en el eje X, las variables predictoras (el factor 'Idioma' y las covariables en los modelos aditivos que proporcionarán la forma y las trayectorias de las curvas (es decir, los efectos de suavizado: 'Idioma + covariables'), y el producto del 'Lenguaje' y una característica métrica que proporcionará una proyección más precisa de la variable de respuesta (es decir, interacciones factor-suaves: 'covariable:Lenguaje'). Abreviatura: GAMs = Modelos Aditivos Generalizados. Por favor, haga clic aquí para ver una versión más grande de esta figura.

Resultados para la percepción del habla
En relación con las alineaciones de voz de BP, en la alineación #1 (Figura 8A), la voz de aluminio #3 fue juzgada como la voz objetivo. De hecho, la voz objetivo era la voz #4. Los resultados no muestran diferencias estadísticamente significativas (ver Tabla Suplementaria S1) entre la lámina #3 (83%) y la voz objetivo #4 (71%). En la alineación #2 (Figura 8B), una comparación entre la voz objetivo #3 (40%) y la foil #4 (20%) tampoco mostró diferencias estadísticamente significativas (ver Tabla Suplementaria S1) para las alineaciones de voces en inglés. En la alineación #1 (Figura 9A), no hubo diferencia significativa (ver Tabla Suplementaria S1) entre el foil #2 (26%) y la voz objetivo #4 (54%).

En el análisis de la similitud de voz, tanto la similitud del coseno (CoSim) como la distancia euclidiana (EucDist, [EucDist transformed]54) mostraron una correlación consistente entre la lámina #3 y el objetivo para la alineación BP #1 (CoSim = 0.99; EucDist = 77,4, [0,93]). La correlación entre la lámina #4 y el objetivo fue igualmente fuerte en la alineación BP #2 (CoSim = 0.99, EucDist = 76.3, [0.93]). En la alineación inglesa #1, la correlación fue consistente para CoSim (0.83(, pero de débil a satisfactoria para EucDist (213.0, [0.47]. En general, tanto CoSim como EucDist fueron técnicas satisfactorias para determinar la similitud de la voz. Además, CoSim funcionó un poco más eficazmente, como se aborda en Gahman y Elangovan52 (ver Tabla Suplementaria S1).

En términos de similitud, ¿qué podría haber llevado a un aumento de las falsas alarmas? Las características prosódico-acústicas mostraron evidencia de que, aunque los foils y las voces objetivo se comportaron (estadísticamente) de manera significativamente diferente, con una excepción para las alineaciones presentadas en Figure 8A,B y Figure 9A-las opciones de los oyentes se diversificaron un poco a lo largo de diferentes foils en las otras alineaciones (Figure 8C,D, y Figure 9B-D). Tal juicio parece depender más de una (o tal vez más) característica acústica específica que comparten los altavoces que de toda una clase de características prosódico-acústicas. Por ejemplo, nuestro estudio presentó varias características (co)variables entre producciones; Sin embargo, los resultados perceptuales muestran las preferencias de los juicios para que una lámina específica coincida con el objetivo voice8,35,64,65. Es necesario realizar más análisis en trabajos futuros.

Es notable considerar la elección de una matriz paramétrica multidimensional para la similitud acústica66 como la presentada en este estudio. Nuestros hallazgos están alineados con estudios previos que utilizaron características acústicas basadas en f0, VQ e intensity9,35. Tales características se sugieren notablemente para tareas de comparación de altavoces en el campo forense9,66. Sin embargo, es importante destacar que en la presente investigación, no se predijo que ninguna de las láminas fuera similar a la voz objetivo, aunque hemos utilizado una variante de las pautas de McFarlane16,17 en la preparación de las alineaciones de voz para el reconocimiento de hablantes con acento extranjero. Además, debemos enfatizar que nuestro procedimiento de alineación de voces contiene diferencias importantes con las pautas de McFarlane, incluida la duración del estímulo, el número de voces, la selección de láminas (aleatorias aquí) y el estilo de habla.

Hasta qué punto las características prosódico-acústicas de f0, la calidad de la voz y la intensidad parecen estar relacionadas con la percepción de los oyentes dependería en gran medida del estilo de habla utilizado en la investigación. Aquí, usamos pasajes de lectura. La mayoría de los estudios de testigos auditivos optan por estímulos (semi) espontáneos como una solución equilibrada -por ejemplo, el corpus DyVis67-que se ha empleado ampliamente en las investigaciones contemporáneas de testigos auditivos28,68. La razón que nos llevó a elegir las tareas de lectura es que nuestro corpus, en el momento de la composición de este manuscrito, estaba formado exclusivamente por datos obtenidos de las tareas de lectura. Sin embargo, es importante reconocer que el proceso de compilación de un corpus (semi) espontáneo ya está en marcha. Además, el acto de leer una historia puede generar un nivel confiable de uniformidad y variación, tanto dentro como entre hablantes. Esto facilita el énfasis en las características prosódicas o fonéticas, individuales o dialectales, en situaciones que involucran la comparación de la voz. Esto se hace especialmente notable en casos de carga vocal durante la producción de un acento extranjero, incluso entre hablantes competentes 8,9,23,54.

figure-results-3
Figura 8: Gráficos de barras que contienen los resultados de las cuatro alineaciones realizadas por los oyentes brasileños. (A,B) Diferencia no significativa entre la voz objetivo (en azul) y una foil (en azul claro). (C,D) diferencias significativas con respecto a las láminas, y la voz objetivo. Abreviatura: NS = no significativo. Por favor, haga clic aquí para ver una versión más grande de esta figura.

figure-results-4
Figura 9: Gráficos de barras que contienen los resultados de las cuatro alineaciones realizadas por los oyentes estadounidenses. (A) Diferencia no significativa entre la voz objetivo (en rojo) y una lámina (en rosa). (B, C, D) Diferencias significativas con respecto a las láminas y la voz objetivo. Abreviatura: NS = no significativo. Por favor, haga clic aquí para ver una versión más grande de esta figura.

Tabla suplementaria S1: Estadísticas de producción del habla - Modelos aditivos generalizados (GAMs): Las estadísticas F (grados de libertad), el R2 ajustado de cada característica prosódico-acústica estadísticamente significativa (Figura 6), y la métrica del ritmo (Figura 7) por nivel de idioma, así como los valores individuales de cada término suave (las covariables). Estadísticos de percepción del habla: Los estadísticos χ2 de Kruskall-Wallis (grados de libertad), los valores p y el η2 ajustado, así como una prueba de Dunn post-hoc para la comparación por pares (Figura 8 y Figura 9) de cada diferencia estadísticamente no significativa entre los pares de voces objetivo (Figura 8A,B y Figura 9A). Matrices de similitud acústica para la distancia coseno y euclidiana de cada alineación. Por favor, haga clic aquí para ver una versión más grande de esta figura.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El protocolo actual presenta una novedad en el campo de la fonética (forense). Se divide en dos fases: una basada en la producción (análisis acústico) y otra basada en la percepción (análisis de juicio). La fase de análisis de producción comprende la preparación de datos y la alineación forzada, la realineación y la extracción automática de características prosódico-acústicas además de las estadísticas. Este protocolo conecta la etapa de recopilación de datos con el análisis de datos de una manera más rápida y eficiente que los protocolos tradicionales basados en una segmentación predominantemente manual.

Sin embargo, el proceso de realineación, que se muestra en los pasos de protocolo 1.3.6 a 1.3.6.9, funciona básicamente en las unidades de teléfono y palabra generadas en los pasos de protocolo 1.3.1 a 1.3.4. La novedad del proceso de realineación es que genera un nuevo TextGrid que contiene tres nuevos niveles de texto: un nivel silábico, un nivel de fragmento de voz que se puede generar de forma automática o manual en función de las palabras, y un nivel de tono que puede ser bastante útil para calcular los compases de f0. Las pautas de realineación propuestas para este protocolo se utilizaron previamente en estudios de ritmo del habla L2 21,69,70, estudios para la detección del grado de acento extranjero utilizando técnicas de aprendizaje automático22 y estudios en el dominio forense 9.

La extracción automática de características prosódicas, presentada en los pasos del protocolo 1.3.7 a 1.3.7.10, genera una matriz multidimensional de características prosódicas-acústicas como se pudo atestiguar en la investigación actual. Tales características incluyen características de habla melódicas, de duración y espectrales (calidad e intensidad de la voz)71. Un número considerable de estas características acústicas son menos sensibles y algo robustas a las grabaciones de audio ruidosas que eventualmente se recopilan en el escenario forense o en cualquier otro escenario72. Además, la matriz multidimensional se puede aplicar a los sistemas de reconocimiento de voz a través de varias técnicas de IA (trabajo en curso). Todavía puede ser bastante útil en la enseñanza de aspectos prosódicos en las clases de pronunciación L221 (trabajo en progreso).

El análisis estadístico de esta parte del protocolo representa el uso del método GAM, ya que se trata de una relación compleja entre una característica acústica específica y múltiples hablantes de factor de lenguaje. Para modelar una característica acústica específica, por ejemplo, era necesario verificar cómo se comportarían otras características acústicas de la matriz (los términos suaves) para que pudiéramos describir con mayor precisión lo que estaba sucediendo durante la producción del habla.

En cuanto al análisis de percepción, el protocolo actual se constituyó mediante la preparación e implementación de las alineaciones de voz, el análisis estadístico y el análisis de similitud acústica. Para preparar las alineaciones, usamos el script CreateLineup para Praat, que genera automáticamente un archivo de audio para cada alineación que contiene láminas secuenciadas aleatoriamente y voz de destino como se describe en los pasos del protocolo 2.2 a 2.2.1.9.

Para el análisis estadístico de este protocolo, se realizó la prueba no paramétrica de Kruskal-Wallis, ya que nuestros datos no cumplían con los supuestos del Análisis de Varianza (ANOVA). Una vez que tuvimos una relación entre las puntuaciones de juicio evaluadas por los oyentes y controlamos la voz objetivo y las láminas, optamos por utilizar las estadísticas del modelo lineal.

Para el análisis de similitud acústica, utilizamos el script AcousticSmilarity_cosine_euclidean para Python. El programa abre el árbol de directorios de la computadora y le pide al usuario que elija el archivo que contiene las características prosódico-acústicas de las láminas y la voz objetivo que compone la alineación en análisis. Con solo hacer clic en un botón, el script genera tres matrices de similitud: un coseno, un euclidiano y un euclidiano transformado (cero a uno), tanto en archivos '.txt' (delimitados por tabulaciones) como en '.csv'. Aún debemos tener en cuenta que cada conjunto de datos (el archivo '.txt' que contiene las características prosódico-acústicas de las láminas y el objetivo) debe estar en la carpeta original de la alineación, y cada carpeta de alineación debe tener una copia del script AcousticSmilarity_cosine_euclidean .

En resumen, el protocolo actual avanza en la investigación fonética (forense). Comprende distintas fases (análisis de producción y percepción, así como similitud acústica), cierra la brecha entre la recopilación de datos y el análisis multidimensional de características acústicas. Los investigadores pueden beneficiarse de una perspectiva holística, explorando tanto los aspectos de producción como los de percepción. Además, este protocolo garantiza la reproducibilidad de la investigación, lo que permite a otros basarse en las pautas de este trabajo.

Limitaciones y direcciones futuras
Aún debemos tener en cuenta que todo saldrá bien si la preparación de los datos sigue las pautas propuestas en los pasos del protocolo 1.3.1 a 1.3.4. Además, en los procedimientos de alineación forzada, debemos ser conscientes de que un alineador forzado externo preentrenado -como MAUS utilizado en el presente trabajo- es susceptible de errores de segmentación, especialmente en datos con acento extranjero no preentrenados o incluso en alineadores preentrenados, ya sea que el audio no tenga una buena calidad o que el alineador no contenga el idioma de audio (este hecho haría que el trabajo del experto sea más difícil y lento). La transcripción forense, especialmente de archivos de audio más largos, encuentra dificultades con respecto a la representación precisa y confiable de las grabaciones habladas72.

También hay varios desafíos en la transcripción y alineación de archivos de audio más largos. El rendimiento del alineador se ve afectado por el estilo de habla y el entorno fonético, así como por factores específicos del dialecto. Aunque existen diferencias específicas de alineadores, en general, su rendimiento es similar y genera segmentaciones que se comparan bien con la alineación manualen general 73. Además, la producción de inglés L1 y L2 se llevó a cabo con un modelo acústico preentrenado de inglés americano debido a la falta de disponibilidad de modelos de habla extranjera en MAUS. Además, no hay modelos acústicos preentrenados para BP en MAUS. Para los datos de BP, se utilizaron los modelos acústicos preexistentes de italiano (véase NOTA, paso 1.3.5.7 del protocolo).

En trabajos futuros (en curso), utilizaremos el Alineador Forzado de Montreal (MFA)74 como parte del protocolo. Una gran ventaja de MFA es la disponibilidad de modelos acústicos preentrenados y modelos de grafema a fonema para una amplia variedad de idiomas (incluido BP), así como la capacidad de entrenar nuevos modelos acústicos y de grafema a fonema para cualquier conjunto de datos nuevo (es decir, nuestro corpus de habla con acento extranjero)75.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no tienen conflictos de intereses que declarar.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio fue apoyado por el Consejo Nacional de Desarrollo Científico y Tecnológico - CNPq, subvención n.º 307010/2022-8 para el primer autor, y subvención n.º 302194/2019-3 para el segundo autor. Los autores desean expresar su sincero agradecimiento a los participantes de esta investigación por su generosa cooperación e invaluables contribuciones.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
CreateLineupColección personal#Script for praat para la preparación de alineaciones
de voz Dell I3 (con unidad de estado sólido - SSD) Dell#Ordenador portátil
PraatPaul Boersma & David Weenink#Software para el análisis fonético
Python 3Python Software Foundation#Lenguaje de programación interpretado, de alto nivel, de propósito general 
RThe R Project for Statistical Computing#Lenguaje de programación para la computación estadística
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorPersonal collection#Script for praat for automatic extraction of acoustic
features SurveyMonkeySurveyMonkey Inc.#Ensamblaje de encuestas personalizables gratuitas, así como un conjunto de programas de back-end que incluyen análisis de datos, selección de muestras, eliminación de sesgos y representación de datos.
Tascam DR-100 MKIITascam#Grabadora de voz digital
El sistema de segmentación automática de Múnich MAUSUniversidad de Múnich#Alineador forzado de archivos de audio (.wav) e información lingüística (.txt)
VVUnitAlignerColección personal#Script para praat para el realineamiento automático y el post-procesamiento de unidades fonéticas

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Caracter sticas pros dicaspercepci n del hablacalidad de la vozfrecuencia fundamentalreconocimiento del hablantesimilitud ac stica

Artículos relacionados