Resultados para a produção da fala
Nesta seção, descrevemos o desempenho das características prosódico-acústicas e métricas rítmicas estatisticamente significativas. Tais características prosódicas foram as taxas de fala, de articulação e de pausas, que estão relacionadas à duração, e o tremor, que está relacionado à qualidade vocal. As métricas rítmicas foram o desvio padrão (DP) da duração da sílaba, DP do consonante, DP da duração vocálica ou consonantal e o coeficiente de variação da duração da sílaba (consulte a Tabela Suplementar S1).
A taxa de fala (Figura 6A) diminui mais rapidamente para o inglês L1-L2 do que para o PB L1-L2, embora a taxa seja menor para ambos os L2s. A taxa de fala está relacionada a três métricas – desvio padrão da duração da sílaba (SD-S), desvio padrão das vogais (SD-V) e o coeficiente de variação silábica (Varco-S). Também é importante ter em mente que os grupos AmE-S e Bra-S são proficientes em seus L2s. Parece que essa taxa é afetada pelos valores mais altos de duração da sílaba e pela menor variabilidade produzida pelo PB L1-L2, causando inclinações menos acentuadas.
A taxa de articulação (Figura 6D) está relacionada ao SD-S, Varco-S, bem como à Razão do Ritmo Silábico (RR-S); esta última representa a razão entre sílabas mais curtas e mais longas. Essas métricas parecem afetar a taxa de articulação da mesma forma que a taxa de fala é afetada pelo comprimento da frase e pela variação na duração, levando a um planejamento maior da fala em L2 e a uma carga cognitiva maior em L29,23,54. Pode ser necessária uma carga cognitivo-linguística maior no domínio do comprimento da frase, de modo que os parâmetros prosódico-acústicos sejam afetados55.
No que diz respeito às características prosódico-acústicas da Fala e das taxas de Articulação, nossos resultados indicam que quanto mais um falante varia a duração das sílabas (e vogais), menores são essas taxas. Hipotetizamos que a percepção da fala tanto do português brasileiro (PB) L1 quanto L2 soa um pouco mais lenta do que o inglês L1 e L2, e que o inglês L1 soa mais rápido do que todos os outros níveis linguísticos. Esse fato pode estar relacionado ao ritmo da fala e à hipótese de que, enquanto o PB L1-L2 tende ao polo sílaba-timbrado do contínuo rítmico, o inglês L1-L2 se direciona ao polo acento-timbrado21,22.
O brilho local, Figura 6B, é influenciado por SD-S e Varco-S. Para o brilho local, ambas as produções de Bra-S, L1-BP e L2-inglês apresentam uma trajetória algo monótona à medida que a variabilidade da duração da sílaba aumenta (SD e Varco, ver Tabela Suplementar S1). A percepção do esforço vocal pode ser evidente ao ouvir as produções de Bra-S devido a uma baixa variação que varia entre 8,5 e 9 dB. A fala de Bra-S é afetada pela carga vocal. O L1-BP é altamente afetado pelo comprimento da frase, sendo menos sensível a grandes variações na duração da sílaba (o padrão rítmico do BP mostra menor variação silábica22,56).
A taxa de pausa (Figura 6C) mostra que falantes de inglês como segunda língua produzem pausas mais longas (de 200 ms a 375 ms) do que os falantes de inglês como primeira língua, de português brasileiro como primeira língua e de português brasileiro como segunda língua (média de 30 ms para inglês como primeira língua, 50 ms para português brasileiro como primeira língua e 100 ms para português brasileiro como segunda língua). O planejamento da fala, neste caso, pode ter afetado a produção em inglês como segunda língua devido ao aumento da atividade cerebral54,57. Espera-se que uma proficiência linguística mais alta resulte em maior velocidade e amplitude de leitura54; no entanto, mesmo para falantes proficientes em uma segunda língua, tarefas de leitura exigiram maior esforço em aspectos cognitivos de ordem superior da fala estrangeira e no processamento linguístico54,57. Nossos resultados indicam, ao menos de forma preliminar, que falantes de português brasileiro como segunda língua podem ser menos afetados por pausas do que falantes de inglês como segunda língua, devido a diferenças no padrão rítmico das duas línguas.

Figura 6: Modelos Aditivos Generalizados para as características prosódico-acústicas. No eixo Y, a variável resposta (as características acústicas a serem modeladas); no eixo X, as variáveis preditoras (o fator 'Idioma' e as covariáveis nos modelos aditivos que fornecerão a forma e as trajetórias das curvas (ou seja, os efeitos de suavização: 'Idioma + covariáveis'), e o produto do fator 'Idioma' com uma característica métrica que fornecerá uma projeção mais precisa da variável resposta (ou seja, interações fator-suavização: 'covariável:Idioma'). Abreviação: GAMs = Modelos Aditivos Generalizados. Clique aqui para visualizar uma versão maior desta figura.
Em relação às métricas rítmicas, para SD-S (Figura 7A), nossos resultados revelam que quanto mais um falante varia a curva de f0 e aumenta a taxa de fala, menor é a SD-S em todos os níveis linguísticos (um efeito espelho da Figura 6A). No caso do desvio padrão para consoantes (SD-C, Figura 7C), o L1-BP, ao contrário do L1 inglês, apresenta baixa variação à medida que a taxa de fala ou a duração da pausa aumentam. Essa direção do SD é prevista, já que a variabilidade da duração da sílaba no L1 inglês é (estatisticamente) significativamente maior do que no L1-BP44,58. O Varco-S (Figura 7B e Tabela Suplementar S1) parece estar parcialmente correlacionado ao L1 e ao L2 do mesmo grupo linguístico. À medida que a variabilidade de f0 e a taxa de fala aumentam, o Varco-S diminui para o L1-BP e parece diminuir e atenuar-se para o L2-BP. Para as produções em inglês, enquanto a variabilidade de f0 e a taxa de fala aumentam, o Varco-S aumenta e atenua-se para o L1-inglês e o L2-inglês.
Quanto ao DP para vogais ou consoantes (SD-V_C, Figura 7D e Tabela Suplementar S1), nossos resultados mostram algumas semelhanças com os Varco-S desempenhoFigura 7B). Por exemplo, níveis mais elevados Taxa de fala, Duração da pausa, e variabilidade de f0 promover uma trajetória de queda e subsequente aumento do SD-V_C para L1-BP e para L2-BP. Em produções em inglês, embora essas características prosódicas sejam mais elevadas, SD-V_C diminui ligeiramente, atenua-se para o inglês L1, aumenta ligeiramente e, em seguida, atenua-se para o inglês L2. O Varco-S e o SD-V_C a correlação com o L1-L2 dos mesmos grupos linguísticos pode ser parcialmente explicada pelo Efeito Lombard, que se refere à alteração de parâmetros acústicos na fala devido ao ruído de fundo59.
Em discursos estrangeiros, dependendo da complexidade da tarefa (por exemplo, fala lida), os falantes utilizaram estratégias acústicas semelhantes tanto na L1 quanto na L259,60. Por um lado, Marcoux e Ernestus descobriram que medidas de f0 (alcance e mediana) na fala Lombard em L2 sugerem que falantes de inglês como L2 foram influenciados por sua L1, o holandês61,62. Por outro lado, descobertas mais recentes propõem que, embora se espere que a fala Lombard em L2 difira da fala Lombard em L1 devido à maior carga cognitiva ao falar em L2, falantes de inglês como L2 produziram fala Lombard na mesma direção que falantes de inglês como L163. O grau em que nossos resultados estão alinhados com Marcoux e Ernestus63 e divergem de Waaning59, Villegas et al.60 e Marcoux e Ernestus61,62 exige investigação adicional.

Figura 7: Modelos Aditivos Generalizados para as características métricas. No eixo Y, a variável resposta (as características métricas a serem modeladas); no eixo X, as variáveis preditoras (o fator 'Idioma' e as covariáveis nos modelos aditivos que definirão a forma e as trajetórias das curvas (ou seja, os efeitos de suavização: 'Idioma + covariáveis'), e o produto do fator 'Idioma' com uma característica métrica que fornecerá uma projeção mais precisa da variável resposta (ou seja, interações fator-suavização: 'covariável:Idioma'). Abreviação: GAMs = Modelos Aditivos Generalizados. Clique aqui para visualizar uma versão maior desta figura.
Resultados para a percepção da fala
Em relação às formações com vozes BP, na formação nº 1 (Figura 8A), a voz de controle nº 3 foi julgada como sendo a voz-alvo. Na verdade, a voz-alvo era a voz nº 4. Os resultados não mostraram diferença estatisticamente significativa (ver Tabela Suplementar S1) entre a voz de controle nº 3 (83%) e a voz-alvo nº 4 (71%). Na formação nº 2 (Figura 8B), uma comparação entre a voz-alvo nº 3 (40%) e a voz de controle nº 4 (20%) também não revelou diferença estatisticamente significativa (ver Tabela Suplementar S1) para as formações com vozes em inglês. Na formação nº 1 (Figura 9A), não houve diferença significativa (ver Tabela Suplementar S1) entre a voz de controle nº 2 (26%) e a voz-alvo nº 4 (54%).
Na análise da similaridade vocal, tanto a similaridade do cosseno (CoSim) quanto a distância euclidiana (EucDist, [EucDist transformada]54) mostraram uma correlação consistente entre o distrator nº 3 e o alvo na lista BP nº 1 (CoSim = 0,99; EucDist = 77,4, [0,93]). A correlação entre o distrator nº 4 e o alvo foi igualmente forte na lista BP nº 2 (CoSim = 0,99, EucDist = 76,3, [0,93]). Na lista em inglês nº 1, a correlação foi consistente para CoSim (0,83), mas fraca a satisfatória para EucDist (213,0, [0,47]). No geral, ambas as técnicas, CoSim e EucDist, foram satisfatórias para determinar a similaridade vocal. Além disso, CoSim apresentou desempenho ligeiramente mais eficaz, conforme abordado por Gahman e Elangovan52 (veja Tabela Suplementar S1).
Em termos de similaridade, o que poderia ter levado ao aumento de alarmes falsos? As características prosódico-acústicas indicaram que, embora vozes distratoras e vozes-alvo tenham apresentado desempenho (estatisticamente) significativamente diferente — com exceção dos conjuntos apresentados na Figura 8A,B e na Figura 9A — as escolhas dos ouvintes se diversificaram um pouco entre diferentes vozes distratoras nos demais conjuntos (Figura 8C,D e Figura 9B-D). Esse julgamento parece depender mais de uma (ou talvez mais de uma) característica acústica específica compartilhada entre os falantes do que de uma classe inteira de características prosódico-acústicas. Por exemplo, nosso estudo apresentou diversas características que (co)variaram entre as produções; no entanto, os resultados perceptuais mostram preferência nos julgamentos por uma voz distratora específica para corresponder à voz-alvo8,35,64,65. Análises adicionais são necessárias em trabalhos futuros.
É notável considerar a escolha de uma matriz paramétrica multidimensional para a similaridade acústica66, como a apresentada neste estudo. Nossos resultados estão alinhados com estudos anteriores que utilizaram características acústicas baseadas em f0, VQ e intensidade9,35. Tais características são notavelmente recomendadas para tarefas de comparação de falantes no campo forense9,66. É, contudo, importante destacar que, na presente pesquisa, nenhuma das vozes distratoras foi prevista como semelhante à voz-alvo, embora tenhamos utilizado uma variante das diretrizes de McFarlane16,17 na preparação dos conjuntos de vozes para o reconhecimento de falantes com sotaque estrangeiro. Além disso, devemos enfatizar que nosso procedimento de conjunto de vozes apresenta diferenças importantes em relação às diretrizes de McFarlane, incluindo o comprimento do estímulo, o número de vozes, a seleção das vozes distratoras (aqui randomizada) e o estilo de fala.
Até que ponto as características prosódico-acústicas de f0, qualidade vocal e intensidade parecem estar relacionadas à percepção dos ouvintes dependeria muito do estilo de fala utilizado na pesquisa. Aqui, utilizamos trechos de leitura. A maioria dos estudos com testemunhas auditivas opta por estímulos (semi-)espontâneos como uma solução equilibrada — por exemplo, o corpus DyVis67 — que tem sido amplamente empregado em investigações contemporâneas com testemunhas auditivas28,68. A razão que nos levou a escolher as tarefas de leitura é que nosso corpus, na época da elaboração deste manuscrito, consistia exclusivamente de dados obtidos a partir de tarefas de leitura. É, no entanto, importante reconhecer que o processo de compilação de um corpus (semi-)espontâneo já está em andamento. Além disso, o ato de ler uma história pode gerar um nível confiável de uniformidade e variação, tanto intrafalante quanto interfalante. Isso facilita a ênfase em características prosódicas ou fonéticas — individuais ou dialetais — em situações que envolvem comparação de vozes. Isso se torna especialmente evidente em casos de carga vocal durante a produção de um sotaque estrangeiro, mesmo entre falantes proficientes 8,9,23,54.

Figura 8: Gráficos de barras contendo os resultados dos quatro reconhecimentos realizados pelos ouvintes brasileiros. (A,B) Diferença não significativa entre a voz-alvo (em azul) e uma voz falsa (em azul claro). (C,D) Diferenças significativas entre as vozes falsas e a voz-alvo. Abreviação: NS = não significativo. Clique aqui para visualizar uma versão maior desta figura.

Figura 9: Gráficos de barras contendo os resultados dos quatro testes realizados pelos ouvintes americanos. (A) Diferença não significativa entre a voz-alvo (em vermelho) e uma voz distratora (em rosa). (B,C,D) Diferenças significativas entre as vozes distratoras e a voz-alvo. Abreviação: NS = não significativo. Clique aqui para visualizar uma versão maior desta figura.
Tabela Suplementar S1: Estatísticas de produção da fala – Modelos Aditivos Generalizados (GAMs): as estatísticas F (graus de liberdade), o R2 ajustado de cada característica prosódico-acústica estatisticamente significativa (Figura 6) e métrica de ritmo (Figura 7) por nível linguístico, bem como os valores individuais de cada termo suavizado (as covariáveis). Estatísticas de percepção da fala: estatísticas de Kruskall-Wallis χ2 (graus de liberdade), os valores de p e o η2 ajustado, além de um teste post-hoc de Dunn para comparação aos pares (Figura 8 e Figura 9) de cada diferença estatisticamente não significativa entre os pares de vozes alvo-e distrator (Figura 8A,B e Figura 9A). Matrizes de similaridade acústica para as distâncias cosseno e euclidiana de cada conjunto. Clique aqui para visualizar uma versão maior desta figura.