Artigo de método

Sotaque estrangeiro e identificação forense de locutores em escalações de voz: a influência de características acústicas baseadas em prosódia

1.5K visualizações

DOI:

10.3791/66313

27 de setembro de 2024

Neste artigo

Resumo

Esta pesquisa teve como objetivo fazer uma comparação entre L1-L2-Inglês e L1-L2 Português para verificar o quanto o efeito de um sotaque estrangeiro é responsável tanto pela métrica quanto pelos parâmetros prosódico-acústicos, bem como pela escolha da voz-alvo em uma formação de voz.

Resumo

Esta pesquisa tem como objetivo examinar tanto as características prosódicas-acústicas quanto os correlatos perceptuais do inglês com sotaque estrangeiro e do português brasileiro com sotaque estrangeiro e verificar como as produções de sotaques estrangeiros e nativos dos falantes estão correlacionadas com a percepção dos ouvintes. Na Metodologia, realizamos um procedimento de produção de fala com um grupo de falantes americanos de L2 Português Brasileiro e um grupo de falantes brasileiros de L2 Inglês, e um procedimento de percepção de fala no qual realizamos alinhamentos de voz para ambas as línguas. Para a análise estatística da produção de fala, foram executados Modelos Aditivos Generalizados para avaliar o efeito dos grupos linguísticos em cada classe (métrica ou prosódico-acústica) de características controladas para o efeito de suavização da(s) covariável(is) da classe oposta. Para a análise estatística da percepção de fala, foi realizado um teste de Kruskal-Wallis e um teste post-hoc de Dunn para avaliar o efeito das vozes das formações sobre os escores julgados pelos ouvintes. No entanto, foram realizados testes de similaridade acústica (vocal) com base nas distâncias cosseno e euclidiana. Os resultados mostraram diferenças acústicas significativas entre os grupos linguísticos em termos de variabilidade do f0, duração e qualidade vocal. Para as escalações, os resultados indicaram que as características prosódicas de f0, intensidade e qualidade de voz se correlacionaram com os julgamentos percebidos pelos ouvintes.

Introdução

O sotaque é um aspecto saliente e dinâmico da comunicação e fluência, tanto na língua nativa (L1) quanto em uma língua estrangeira (L2)1. O sotaque estrangeiro representa as características fonéticas de L2 de um idioma de destino e pode mudar (ao longo do tempo) em resposta à experiência de L2 do falante, estilo de fala, qualidade de entrada, exposição, entre outras variáveis. Um sotaque estrangeiro pode ser quantificado como um grau (escalar) de diferença entre a fala L2 produzida por um falante estrangeiro e um sotaque local ou de referência do idioma de destino2,3,4,5.

Esta pesquisa tem como objetivo examinar tanto as características prosódicas-acústicas quanto os correlatos perceptuais do inglês com sotaque estrangeiro e do português brasileiro (PB) com sotaque estrangeiro, bem como verificar em que medida as produções de sotaques estrangeiros e nativos dos falantes estão correlacionadas com a percepção dos ouvintes. Pesquisas anteriores no campo forense demonstraram a robustez das vogais e consoantes na identificação de sotaques estrangeiros como sendo estáveis para uma análise de longo prazo de um indivíduo (The Lo Case6) ou referindo-se à alta precisão de ID de um falante (The Lindbergh Case7). No entanto, a exploração de características prosódico-acústicas baseadas na duração, frequência fundamental (f0, ou seja, o correlato acústico da altura), intensidade e qualidade de voz (VQ) tem ganhado cada vez mais atenção8,9. Assim, a escolha por características prosódico-acústicas neste estudo representa um caminho promissor no campo da fonética forense8,10,11,12,13.

A presente pesquisa está apoiada em estudos dedicados aos sotaques estrangeiros como forma de disfarce de voz em casos forenses14,15, bem como na elaboração de lineups de voz para reconhecimento de locutores16,17. Por exemplo, a velocidade de fala desempenhou um papel importante na identificação de falantes de inglês, italiano, japonês e brasileiro de inglês18,19,20,21,22. Além da velocidade de fala, as características espectrais de longo prazo e f0 desafiam falantes proficientes em L2 com familiaridade com o idioma-alvo, pois o cérebro e as bases cognitivas sofrem um déficit de memória, atenção e emoção, refletindo no desempenho fonético do falante durante longos turnos de fala23. A visão dos sotaques estrangeiros no campo forense é que a definição do que realmente soa como um sotaque estrangeiro depende muito da falta de familiaridade do ouvinte, em vez de ter um grau zero a extremo de fala24.

No domínio perceptivo, uma ferramenta forense comum usada desde meados da década de 1990 para o reconhecimento de criminosos é o Voice Lineup (reconhecimento auditivo), que é análogo ao reconhecimento visual usado para identificar um perpetrador em uma cena de crime16,25. Em uma linha de voz, a voz do suspeito é apresentada ao lado de contrastes - vozes semelhantes em aspectos sociolinguísticos, como idade, sexo, localização geográfica, dialeto e status cultural - para identificação por uma testemunha auditiva. O sucesso ou falha de uma programação de voz dependerá do número de amostras de voz e das durações da amostra25,26. Além disso, para amostras do mundo real, considera-se que a qualidade do áudio afeta consistentemente a precisão do reconhecimento de voz. A baixa qualidade de áudio pode distorcer as características exclusivas de uma classe voice27. No caso de similaridade de voz, detalhes fonéticos finos baseados em f0 podem confundir o ouvinte durante o reconhecimento de voz28,29. Tais características acústicas se estendem além de f0 e abrangem elementos de duração e características espectrais de intensidade e classe VQ30. Essa visão de vários recursos prosódicos é crucial no contexto da comparação forense de voz para garantir a identificação precisa do falante9,14,15,29,31.

Em resumo, estudos em fonética forense mostraram alguma variação em relação à identificação de sotaque estrangeiro nas últimas décadas. Por um lado, um sotaque estrangeiro não parece afetar o processo de identificação de um falante32,33 (especialmente se o falante não estiver familiarizado com o sotaque estrangeiro alvo34). Por outro lado, há achados na direção oposta12,34,35.

Protocolo

Este trabalho recebeu aprovação de um comitê de ética em pesquisa com seres humanos. Além disso, foi obtido consentimento informado de todos os participantes envolvidos neste estudo para o uso e publicação de seus dados.

1. Produção da fala

OBSERVAÇÃO: Coletamos a fala de uma tarefa de leitura em ambos os casos de 'L1 inglês-L2 PB' produzidos por Grupo 1: O American Einglês (dos Estados Unidos da América) Salto-falantes (AmE-S), e em ambos os 'L1 BP-L2 Inglês' produzidos por Grupo 2: O Brabrasileiro Salto-falantes (Bra-S). Veja Figura 1 para um fluxograma para a produção da fala.

figure-protocol-1
Figura 1: Fluxograma esquemático da produção da fala. Clique aqui para visualizar uma versão maior desta figura.

  1. Participantes
    1. Determine o número de participantes, o idioma (L1 inglês, L2 português brasileiro; L1 português brasileiro, L2 inglês), o sexo (feminino ou masculino), o idade (média, desvio padrão), o características do grupo (profissionais ou estudantes de graduação), e o Nível de proficiência em L2 (avançado ou bem-avançado) para cada grupo.
      OBSERVAÇÃO: Para a presente pesquisa, tanto o AmE-S quanto o Bra-S foram considerados proficientes em L2 (ambos os grupos foram classificados como B2-C1)36). O AmE-S havia morado no Brasil por dois anos quando os procedimentos foram realizados. O Bra-S havia morado mais de dois anos nos Estados Unidos quando os procedimentos foram realizados. Durante a estadia no exterior, ambos os grupos costumavam falar seu L2 com finalidades acadêmicas e profissionais pelo menos seis dias por semana, cerca de 4-5 horas por dia.
    2. Aloque os participantes em uma sala confortável e silenciosa e apresente o material de leitura para cada grupo.
  2. Coleta de dados
    OBSERVAÇÃO: Os dados de fala devem ser coletados por meio de uma tarefa de leitura nas seguintes línguas: L1-inglês e L2-português brasileiro; L1-português brasileiro e L2-inglês. Permita que os participantes leiam os textos previamente, se necessário.
    1. Procedimentos de gravação
      1. Grave os dados de fala em um local silencioso com condições acústicas adequadas.
      2. Use um gravador de voz digital (consulte o Tabela de Materiais)37 e um microfone cardióide unidirecional com isolamento eletromagnético (consulte o Tabela de Materiais)38.
      3. Grave os dados de áudio em '.wav' formulário.
      4. Configure a taxa de amostragem em 48 kHz e a taxa de quantização em 16 bits.
        OBSERVAÇÃO: O formato de áudio e a configuração das taxas de amostragem e quantização descritas nas etapas 1.2.1.3 e 1.2.1.4 são aplicadas para garantir alta qualidade e redução de ruído, preservando assim as características espectrais utilizadas na análise acústica posterior.
  3. Análise acústica
    OBSERVAÇÃO: Divida os procedimentos de análise acústica em três etapas: alinhamento forçado, realinhamento e extração de características acústicas.
    1. Escreva a transcrição linguística (em um '.txt' arquivo) para cada arquivo de áudio.
    2. Marque o par de '.txt'/'.wavarquivos com o mesmo nome (ou seja, 'my_file.wav'/ 'meu_arquivo.txt').
      OBSERVAÇÃO: Para aprimorar o desempenho do procedimento descrito na seção 1.3.7, recomenda-se fortemente que os três caracteres iniciais das etiquetas dos arquivos ‘.txt/.wav’ representem os Idioma, Dialeto, ou Acento, enquanto o quarto ao sexto caracteres indicam o Sexo por exemplo, EL1FEM para EInglês L1 Fêmeaale). A partir do sétimo caractere, o usuário deve indicar o número do orador (por exemplo, 001 para o primeiro locutor). Consequentemente, o primeiro par ‘.txt/.wav’ é EL1FEM001.
    3. Crie uma pasta para cada idioma L1-L2.
      OBSERVAÇÃO: Uma pasta para L1-L2 Inglês e uma pasta para L1-L2 PB.
    4. Certifique-se de que todos os pares de arquivos do mesmo idioma estejam na mesma pasta.
    5. Realize o alinhamento forçado.
      1. Acesse a interface web do alinhador forçado Munich Automatic Segmentation (MAUS)webMAUS39 em https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Arraste e solte cada par de .wav / .txt arquivos do pasta até o retângulo tracejado em Arquivos (ou clique dentro do retângulo, Figura 2A).
      3. Clique no Carregar botão para carregar os arquivos no alinhador (veja a seta vermelha em Figura 2A).
      4. Selecione as seguintes opções na Opções de serviço menuFigura 2B): G2P-MAUS-PHO2SYL para Nome do pipeline; Inglês (EUA) (para Idioma) se Dados em inglês L1-L2; Italiano (IT) (para Idioma) se Dados de BP L1-L2.
        OBSERVAÇÃO: Optamos por 'italiano' para os dados do PB porque o webMAUS não fornece modelos acústicos pré-treinados para alinhamento forçado do PB. A literatura fonética sugere que a fonologia do italiano possui um inventário de sete vogais simétrico, de certa forma comparável ao do PB.40, bem como semelhanças acústicas consonantais41,42.
      5. Mantenha as opções padrão para 'Formato de saída' e 'Manter tudo'.
      6. Verifique o Executar caixa de seleção para aceitar os termos de uso (veja a seta verde em Figura 2C).
      7. Clique no Serviço Web de Execução botão para executar os arquivos carregados no alinhador.
        OBSERVAÇÃO: Para cada arquivo de áudio, o alinhador MAUS retorna um Praat TextGrid objeto (um arquivo '.txt' pré-formatado pelo Praat contendo a anotação de palavras, sílabas fonológicas e fonemas com base na transcrição linguística extraída do arquivo '.txt' descrito na etapa 1.3.1).
      8. Clique no Baixar como arquivo ZIP botão para baixar os arquivos TextGrid como um arquivo compactado (zip)Figura 2C).
        OBSERVAÇÃO: Certifique-se de que os arquivos TextGrid compactados sejam baixados na mesma pasta dos arquivos de áudio.
      9. Extraia os arquivos TextGrid para realinhamento posterior no software de análise fonética43.
    6. Realinhar.
      1. Acesse e baixe o script para o Praat VVUnitAligner44 de https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat
      2. Certifique-se de que todos os pares de arquivos do mesmo idioma e o VVUnitAligner os scripts estão na mesma pasta.
        OBSERVAÇÃO: Uma pasta para os arquivos em inglês L1-L2 e o VVunitAligner, e uma pasta para os arquivos BP L1-L2 e o VVunitAligner.
      3. Abra o software de análise fonética.
      4. Clique Praat | Abrir script do Praat… para chamar o script a partir do janela do objeto.
      5. Clique no Executar botão uma vez.
        OBSERVAÇÃO: Um formulário chamado Alinhamento silábico fonético contendo as configurações para usar o script aparecerá na tela (Figura 3A).
      6. Clique no Idioma botão para escolher entre os idiomas 'Inglês (EUA)', 'Português (BR)', 'Francês (FR)' ou 'Espanhol (ES)'.
      7. Clique no Segmentação em blocos botão para escolher entre os procedimentos de segmentação 'Automático', 'Forçado (manual)' ou 'Nenhum'.
      8. Verifique o Salvar arquivos TextGrid opção para salvar automaticamente os novos arquivos TextGrid.
      9. Clique Ok | Executar botões para um realinhamento das unidades fonéticas da etapa 1.3.5.7
        OBSERVAÇÃO: Para cada arquivo de áudio, o VVUnitAligner gerará um novo arquivo TextGrid para a seção 1.3.7Figura 3B).
    7. Realize a extração automática das características acústicas.
      1. Acesse e baixe o script SpeechRhythmExtractor45 de https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat para extração automática das características prosódico-acústicas.
      2. Crie uma nova pasta e coloque o SpeechRhythmExtractor junto com todos os pares de arquivos de áudio e TextGrid de todas as línguas.
      3. Abra o software de análise fonética.
      4. Clique Praat | Abrir script do Praat… para chamar o script a partir do janela do objeto.
      5. Clique no Executar pressione o botão apenas uma vez.
        OBSERVAÇÃO: Um formulário contendo as configurações do script será exibido na tela. Nas caixas dos nomes dos arquivos de saída '.txt', renomeie os arquivos conforme necessário ou mantenha os nomes padrão.
      6. Verifique o parâmetros de qualidade vocal opção para salvar o Arquivo de saída VQ para qualidade vocal (Figura 3C).
        OBSERVAÇÃO: Este segundo arquivo de saída (o Arquivo de saída VQ) contém os parâmetros da diferença entre o 1st e o 2nd harmônicos (H1-H2) e o Pico de Proeminência Cepstral (CPP)9.
      7. Verifique o Alvo linguístico opção para escolher entre as etiquetas 'Idioma', 'Dialeto' ou 'Sotaque' (Figura 3C).
      8. Verifique o Unidade opção de escolher as características de f0 em Hz ou em Semitons (Figura 3C).
      9. Defina os valores para limiar F0, os limiares mínimo e máximo de f0 (Figura 3C).
        OBSERVAÇÃO: A menos que a pesquisa tenha objetivos específicos ou características de áudio pré-definidas, recomenda-se fortemente manter os parâmetros do passo 1.3.7.9 com os valores padrão.
      10. Clique Ok | Executar para a extração automática das características acústicas.
        NOTA: O script SpeechRhythmExtractor retorna um arquivo '.txt' delimitado por tabulação (Arquivo de saída / Arquivo de saída VQ) contendo as características acústicas extraídas dos falantes.
  4. Análise estatística
    1. Carregue a planilha contendo as características acústicas no R46 ambiente (ou qualquer software/ambiente estatístico de sua escolha).
    2. Realize estatísticas não paramétricas de Modelos Aditivos Generalizados (GAMs).
      1. Realize GAMs em R.
      2. Digite os seguintes comandos e pressione Entrar.
        library(mgcv)
        modelo = gam(the característica métrica/prosódica-acústica na análise ~ o Idioma + s(a escolhida característica métrica, por = o Idioma) + outros características métricas/prosódicas-acústicas, dados = o quadro de dados)
        NOTA: Decidimos realizar as estatísticas de teste do protocolo na linguagem de programação R devido à sua crescente popularidade entre fonetistas (e linguistas) na comunidade acadêmica. O R tem sido amplamente utilizado em pesquisas fonéticas de campo47. Tenha em mente que a etapa 1.4.2.2 contém um pseudocódigo. Escreva o código de acordo com as variáveis da pesquisa.

figure-protocol-2
Figura 2: Captura de tela do alinhamento fonético usando o alinhador forçado MAUS. (A) O retângulo tracejado serve para arrastar e soltar arquivos 'my_file.wav'/'my_file.txt' ou clicar dentro para procurar esses arquivos na pasta; o botão de upload é indicado pela seta vermelha. (B) Os arquivos enviados do painel A (veja a seta azul), o pipeline a ser usado, o idioma para os pares de arquivos, o formato de arquivo a ser retornado e um botão 'verdadeiro/falso' para manter todos os arquivos. (C) Os termos de uso com caixa de seleção (veja a seta verde), o botão Executar Serviços Web e os resultados (arquivos TextGrid para serem baixados). Clique aqui para visualizar uma versão maior desta figura.

figure-protocol-3
Figura 3: Captura de tela do procedimento de realinhamento. (A) Formulário de configurações de entrada para o procedimento de realinhamento. (B) Forma de onda parcial, espectrograma de banda larga com contorno de f0 (azul) e seis camadas segmentadas (e rotuladas) como camada 1: unidades do início da vogal até o início da próxima vogal (V_para_V); início da vogal (V_para_V); camada 2: unidades de vogal (V), consoante (C) e pausa (#); camada 3: representações fônicas V_para_V; camada 4: algumas palavras do texto; camada 5: alguns segmentos (CH) da fala do texto; camada 6: camada tonal contendo o tom mais alto (H) e o tom mais baixo (L) de cada segmento de fala produzido por uma falante feminina de AmE-S. (C) Configurações de entrada para a extração automática das características acústicas. Clique aqui para visualizar uma versão maior desta figura.

2. Percepção da fala

OBSERVAÇÃO: Realizamos quatro rodadas de reconhecimento vocal em inglês com ouvintes americanos e quatro rodadas em PB com ouvintes brasileiros. Veja Figura 4 para um fluxograma da percepção da fala.

figure-protocol-4
Figura 4: Fluxograma esquemático da percepção da fala. Clique aqui para visualizar uma versão maior desta figura.

  1. Participantes
    1. Escolha participantes diferentes para cada grupo em relação aos que participaram do protocolo de produção da fala.
      NOTA: Dois grupos de participantes foram selecionados para esta parte do protocolo: Grupo 1: Os ouvintes de Inglês Americano (dos Estados Unidos da América) (IA-O) e Grupo 2: Os ouvintes Brasileiros (Bra-O). Para a presente pesquisa, tanto os IA-O quanto os Bra-O foram considerados proficientes no segundo idioma (ambos os grupos foram classificados como B2-C136. Os IA-O tinham morado dois anos no Brasil quando os procedimentos foram realizados. Os Bra-O tinham morado mais de dois anos nos Estados Unidos da América quando os procedimentos foram realizados. Durante a estadia no exterior, ambos os grupos costumavam falar seu L2 com fins acadêmicos e profissionais (pelo menos seis dias por semana, cerca de 4 a 5 horas por dia).
    2. Determine o número de participantes, a língua (L1 inglês, L2 PB; L1 PB, L2 inglês), o sexo (feminino ou masculino), a idade (média, desvio padrão), as características do grupo (profissionais ou estudantes universitários) e o nível de proficiência no L2 para cada grupo.
  2. Os conjuntos de vozes
    NOTA: Divida os procedimentos dos conjuntos de vozes em duas etapas distintas: preparação e execução dos conjuntos de vozes.
    1. Prepare quatro conjuntos de vozes para o inglês e quatro para o PB.
      1. Obtenha arquivos de áudio dos falantes da seção 1: Produção da fala.
      2. Verifique se os arquivos de áudio de cada fator linguístico estão em pastas separadas.
      3. Escolha aleatoriamente seis segmentos de voz em inglês L1 ou PB L1.
        NOTA: Seis vozes no conjunto representam uma voz-alvo e cinco vozes distratoras.
      4. Escolha um segmento de voz em inglês L2 ou PB L2 de um dos falantes incluídos na etapa 2.2.1.3.
        NOTA: O segmento de voz na etapa 2.2.1.4 é a voz de referência. Os segmentos devem ter aproximadamente 20 s de duração.8.
      5. Acesse e baixe o script para Praat CreateLineup48 de https://github.com/pabarbosa/prosody-scripts-CreateLineUp.
      6. Verifique se a voz de referência L2, as vozes distratoras L1 e a voz-alvo L1 estão na mesma pasta antes de executar o script CreateLineup (Figura 5).
      7. Abra o software de análise fonética.
      8. Na janela de objetos, clique em Praat | Abrir script do Praat… para chamar o script.
      9. Clique em Executar | Executar.
        NOTA: O script retorna um arquivo na seguinte ordem: (a voz de referência L2) + (a voz-alvo L1 e as vozes distratoras distribuídas aleatoriamente) (Figura 5).
    2. Execução dos conjuntos de vozes
      1. Crie um espaço online para hospedar os conjuntos em qualquer plataforma de sua escolha (por exemplo, SurveyMonkey. Veja a Tabela de Materiais) para realizar os conjuntos de vozes remotamente.
      2. Acesse o link do espaço online.
      3. Carregue os arquivos retornados pelo script CreateLineup na plataforma.
      4. Execute o procedimento antes dos participantes para testar cada etapa.
        NOTA: Recomenda-se acessar previamente o link e executar os conjuntos para verificar se tudo está funcionando normalmente.
  3. Análise estatística
    1. Carregue a planilha contendo as pontuações dos julgamentos dos ouvintes no ambiente R (ou qualquer software/ambiente estatístico de sua escolha).
      1. Realize o teste de Kruskal-Wallis no R.
      2. Digite os seguintes comandos e pressione Enter.
        ​modelo = kruskal.test(julgamentos ~ cada conjunto de vozes, dados = o data frame)
    2. Realize um teste post-hoc de Dunn.
      1. Realize o teste de Dunn no R.
      2. Digite os seguintes comandos e pressione Enter.
        library(FSA)
        modelo = dunnTest(julgamentos ~ cada conjunto de vozes, dados = dados, metodo = "bonferroni")
        NOTA: Os códigos nas etapas 2.3.1.2 e 2.3.2.2 são pseudocódigos (veja NOTA 1.4.2.2).
  4. Análise de similaridade acústica
    1. Selecione os conjuntos de vozes (cf. NOTA na etapa 2.2.1.3) que apresentaram diferenças não significativas entre a voz-alvo e qualquer uma das vozes distratoras.
    2. Repita os procedimentos das etapas 1.3.1 a 1.3.7.5 e das etapas 1.3.7.8 a 1.3.7.10.
    3. Acesse e baixe o script para Python49, AcousticSimilarity_cosine_euclidean50 de https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      NOTA: O script retorna três matrizes (em '.txt' e '.csv'): uma para a similaridade cosseno51,52, uma para a distância euclidiana52,53 e uma para os valores transformados da distância euclidiana, bem como uma comparação par a par entre a voz-alvo e cada voz distratora.
    4. Verifique se o script foi baixado na mesma pasta do conjunto de dados.
    5. Clique no botão Abrir arquivo… para chamar o script.
    6. Clique nos botões Executar | Executar Sem Depuração.
      NOTA: O segundo botão Executar pode estar rotulado como Executar ou Executar Sem Depuração ou Executar Script. Todos executam os mesmos comandos. Isso depende simplesmente do ambiente Python utilizado.
    7. Realize testes de similaridade vocal com base em características acústicas.
      ​NOTA: A similaridade cosseno (ou distância cosseno) é uma técnica aplicada em Inteligência Artificial (IA), particularmente em aprendizado de máquina em sistemas de reconhecimento automático de fala (RAF). É uma medida de similaridade entre zero e um. Uma similaridade cosseno próxima de um indica que duas vozes são muito provavelmente semelhantes. Uma similaridade cosseno próxima de zero indica que as vozes são muito provavelmente diferentes52. A distância euclidiana, muitas vezes referida como similaridade euclidiana, também é amplamente utilizada em IA, aprendizado de máquina e RAF. Representa a distância em linha reta entre dois pontos no espaço euclidiano53, ou seja, quanto mais próximos os pontos (menores os valores de distância), mais semelhantes são as vozes. Para uma compreensão mais clara dos resultados relatados por ambas as técnicas, realizamos uma transformação dos escores brutos da distância euclidiana em valores de zero (menor similaridade vocal) a um (maior similaridade vocal)54.

figure-protocol-5
Figura 5: Configuração do diretório para percepção da fala. Pastas de identificação. Cada pasta contém seis vozes de falantes nativos (L1), a voz-alvo de falante não nativo (L2), o script "CreateLineup" e o arquivo de áudio com a identificação vocal (gerado após a execução do script). Clique aqui para visualizar uma versão maior desta figura.

Resultados

Resultados para a produção da fala
Nesta seção, descrevemos o desempenho das características prosódico-acústicas e métricas rítmicas estatisticamente significativas. Tais características prosódicas foram as taxas de fala, de articulação e de pausas, que estão relacionadas à duração, e o tremor, que está relacionado à qualidade vocal. As métricas rítmicas foram o desvio padrão (DP) da duração da sílaba, DP do consonante, DP da duração vocálica ou consonantal e o coeficiente de variação da duração da sílaba (consulte a Tabela Suplementar S1).

A taxa de fala (Figura 6A) diminui mais rapidamente para o inglês L1-L2 do que para o PB L1-L2, embora a taxa seja menor para ambos os L2s. A taxa de fala está relacionada a três métricas – desvio padrão da duração da sílaba (SD-S), desvio padrão das vogais (SD-V) e o coeficiente de variação silábica (Varco-S). Também é importante ter em mente que os grupos AmE-S e Bra-S são proficientes em seus L2s. Parece que essa taxa é afetada pelos valores mais altos de duração da sílaba e pela menor variabilidade produzida pelo PB L1-L2, causando inclinações menos acentuadas.

A taxa de articulação (Figura 6D) está relacionada ao SD-S, Varco-S, bem como à Razão do Ritmo Silábico (RR-S); esta última representa a razão entre sílabas mais curtas e mais longas. Essas métricas parecem afetar a taxa de articulação da mesma forma que a taxa de fala é afetada pelo comprimento da frase e pela variação na duração, levando a um planejamento maior da fala em L2 e a uma carga cognitiva maior em L29,23,54. Pode ser necessária uma carga cognitivo-linguística maior no domínio do comprimento da frase, de modo que os parâmetros prosódico-acústicos sejam afetados55.

No que diz respeito às características prosódico-acústicas da Fala e das taxas de Articulação, nossos resultados indicam que quanto mais um falante varia a duração das sílabas (e vogais), menores são essas taxas. Hipotetizamos que a percepção da fala tanto do português brasileiro (PB) L1 quanto L2 soa um pouco mais lenta do que o inglês L1 e L2, e que o inglês L1 soa mais rápido do que todos os outros níveis linguísticos. Esse fato pode estar relacionado ao ritmo da fala e à hipótese de que, enquanto o PB L1-L2 tende ao polo sílaba-timbrado do contínuo rítmico, o inglês L1-L2 se direciona ao polo acento-timbrado21,22.

O brilho local, Figura 6B, é influenciado por SD-S e Varco-S. Para o brilho local, ambas as produções de Bra-S, L1-BP e L2-inglês apresentam uma trajetória algo monótona à medida que a variabilidade da duração da sílaba aumenta (SD e Varco, ver Tabela Suplementar S1). A percepção do esforço vocal pode ser evidente ao ouvir as produções de Bra-S devido a uma baixa variação que varia entre 8,5 e 9 dB. A fala de Bra-S é afetada pela carga vocal. O L1-BP é altamente afetado pelo comprimento da frase, sendo menos sensível a grandes variações na duração da sílaba (o padrão rítmico do BP mostra menor variação silábica22,56).

A taxa de pausa (Figura 6C) mostra que falantes de inglês como segunda língua produzem pausas mais longas (de 200 ms a 375 ms) do que os falantes de inglês como primeira língua, de português brasileiro como primeira língua e de português brasileiro como segunda língua (média de 30 ms para inglês como primeira língua, 50 ms para português brasileiro como primeira língua e 100 ms para português brasileiro como segunda língua). O planejamento da fala, neste caso, pode ter afetado a produção em inglês como segunda língua devido ao aumento da atividade cerebral54,57. Espera-se que uma proficiência linguística mais alta resulte em maior velocidade e amplitude de leitura54; no entanto, mesmo para falantes proficientes em uma segunda língua, tarefas de leitura exigiram maior esforço em aspectos cognitivos de ordem superior da fala estrangeira e no processamento linguístico54,57. Nossos resultados indicam, ao menos de forma preliminar, que falantes de português brasileiro como segunda língua podem ser menos afetados por pausas do que falantes de inglês como segunda língua, devido a diferenças no padrão rítmico das duas línguas.

figure-results-1
Figura 6: Modelos Aditivos Generalizados para as características prosódico-acústicas. No eixo Y, a variável resposta (as características acústicas a serem modeladas); no eixo X, as variáveis preditoras (o fator 'Idioma' e as covariáveis nos modelos aditivos que fornecerão a forma e as trajetórias das curvas (ou seja, os efeitos de suavização: 'Idioma + covariáveis'), e o produto do fator 'Idioma' com uma característica métrica que fornecerá uma projeção mais precisa da variável resposta (ou seja, interações fator-suavização: 'covariável:Idioma'). Abreviação: GAMs = Modelos Aditivos Generalizados. Clique aqui para visualizar uma versão maior desta figura.

Em relação às métricas rítmicas, para SD-S (Figura 7A), nossos resultados revelam que quanto mais um falante varia a curva de f0 e aumenta a taxa de fala, menor é a SD-S em todos os níveis linguísticos (um efeito espelho da Figura 6A). No caso do desvio padrão para consoantes (SD-C, Figura 7C), o L1-BP, ao contrário do L1 inglês, apresenta baixa variação à medida que a taxa de fala ou a duração da pausa aumentam. Essa direção do SD é prevista, já que a variabilidade da duração da sílaba no L1 inglês é (estatisticamente) significativamente maior do que no L1-BP44,58. O Varco-S (Figura 7B e Tabela Suplementar S1) parece estar parcialmente correlacionado ao L1 e ao L2 do mesmo grupo linguístico. À medida que a variabilidade de f0 e a taxa de fala aumentam, o Varco-S diminui para o L1-BP e parece diminuir e atenuar-se para o L2-BP. Para as produções em inglês, enquanto a variabilidade de f0 e a taxa de fala aumentam, o Varco-S aumenta e atenua-se para o L1-inglês e o L2-inglês.

Quanto ao DP para vogais ou consoantes (SD-V_C, Figura 7D e Tabela Suplementar S1), nossos resultados mostram algumas semelhanças com os Varco-S desempenhoFigura 7B). Por exemplo, níveis mais elevados Taxa de fala, Duração da pausa, e variabilidade de f0 promover uma trajetória de queda e subsequente aumento do SD-V_C para L1-BP e para L2-BP. Em produções em inglês, embora essas características prosódicas sejam mais elevadas, SD-V_C diminui ligeiramente, atenua-se para o inglês L1, aumenta ligeiramente e, em seguida, atenua-se para o inglês L2. O Varco-S e o SD-V_C a correlação com o L1-L2 dos mesmos grupos linguísticos pode ser parcialmente explicada pelo Efeito Lombard, que se refere à alteração de parâmetros acústicos na fala devido ao ruído de fundo59.

Em discursos estrangeiros, dependendo da complexidade da tarefa (por exemplo, fala lida), os falantes utilizaram estratégias acústicas semelhantes tanto na L1 quanto na L259,60. Por um lado, Marcoux e Ernestus descobriram que medidas de f0 (alcance e mediana) na fala Lombard em L2 sugerem que falantes de inglês como L2 foram influenciados por sua L1, o holandês61,62. Por outro lado, descobertas mais recentes propõem que, embora se espere que a fala Lombard em L2 difira da fala Lombard em L1 devido à maior carga cognitiva ao falar em L2, falantes de inglês como L2 produziram fala Lombard na mesma direção que falantes de inglês como L163. O grau em que nossos resultados estão alinhados com Marcoux e Ernestus63 e divergem de Waaning59, Villegas et al.60 e Marcoux e Ernestus61,62 exige investigação adicional.

figure-results-2
Figura 7: Modelos Aditivos Generalizados para as características métricas. No eixo Y, a variável resposta (as características métricas a serem modeladas); no eixo X, as variáveis preditoras (o fator 'Idioma' e as covariáveis nos modelos aditivos que definirão a forma e as trajetórias das curvas (ou seja, os efeitos de suavização: 'Idioma + covariáveis'), e o produto do fator 'Idioma' com uma característica métrica que fornecerá uma projeção mais precisa da variável resposta (ou seja, interações fator-suavização: 'covariável:Idioma'). Abreviação: GAMs = Modelos Aditivos Generalizados. Clique aqui para visualizar uma versão maior desta figura.

Resultados para a percepção da fala
Em relação às formações com vozes BP, na formação nº 1 (Figura 8A), a voz de controle nº 3 foi julgada como sendo a voz-alvo. Na verdade, a voz-alvo era a voz nº 4. Os resultados não mostraram diferença estatisticamente significativa (ver Tabela Suplementar S1) entre a voz de controle nº 3 (83%) e a voz-alvo nº 4 (71%). Na formação nº 2 (Figura 8B), uma comparação entre a voz-alvo nº 3 (40%) e a voz de controle nº 4 (20%) também não revelou diferença estatisticamente significativa (ver Tabela Suplementar S1) para as formações com vozes em inglês. Na formação nº 1 (Figura 9A), não houve diferença significativa (ver Tabela Suplementar S1) entre a voz de controle nº 2 (26%) e a voz-alvo nº 4 (54%).

Na análise da similaridade vocal, tanto a similaridade do cosseno (CoSim) quanto a distância euclidiana (EucDist, [EucDist transformada]54) mostraram uma correlação consistente entre o distrator nº 3 e o alvo na lista BP nº 1 (CoSim = 0,99; EucDist = 77,4, [0,93]). A correlação entre o distrator nº 4 e o alvo foi igualmente forte na lista BP nº 2 (CoSim = 0,99, EucDist = 76,3, [0,93]). Na lista em inglês nº 1, a correlação foi consistente para CoSim (0,83), mas fraca a satisfatória para EucDist (213,0, [0,47]). No geral, ambas as técnicas, CoSim e EucDist, foram satisfatórias para determinar a similaridade vocal. Além disso, CoSim apresentou desempenho ligeiramente mais eficaz, conforme abordado por Gahman e Elangovan52 (veja Tabela Suplementar S1).

Em termos de similaridade, o que poderia ter levado ao aumento de alarmes falsos? As características prosódico-acústicas indicaram que, embora vozes distratoras e vozes-alvo tenham apresentado desempenho (estatisticamente) significativamente diferente — com exceção dos conjuntos apresentados na Figura 8A,B e na Figura 9A — as escolhas dos ouvintes se diversificaram um pouco entre diferentes vozes distratoras nos demais conjuntos (Figura 8C,D e Figura 9B-D). Esse julgamento parece depender mais de uma (ou talvez mais de uma) característica acústica específica compartilhada entre os falantes do que de uma classe inteira de características prosódico-acústicas. Por exemplo, nosso estudo apresentou diversas características que (co)variaram entre as produções; no entanto, os resultados perceptuais mostram preferência nos julgamentos por uma voz distratora específica para corresponder à voz-alvo8,35,64,65. Análises adicionais são necessárias em trabalhos futuros.

É notável considerar a escolha de uma matriz paramétrica multidimensional para a similaridade acústica66, como a apresentada neste estudo. Nossos resultados estão alinhados com estudos anteriores que utilizaram características acústicas baseadas em f0, VQ e intensidade9,35. Tais características são notavelmente recomendadas para tarefas de comparação de falantes no campo forense9,66. É, contudo, importante destacar que, na presente pesquisa, nenhuma das vozes distratoras foi prevista como semelhante à voz-alvo, embora tenhamos utilizado uma variante das diretrizes de McFarlane16,17 na preparação dos conjuntos de vozes para o reconhecimento de falantes com sotaque estrangeiro. Além disso, devemos enfatizar que nosso procedimento de conjunto de vozes apresenta diferenças importantes em relação às diretrizes de McFarlane, incluindo o comprimento do estímulo, o número de vozes, a seleção das vozes distratoras (aqui randomizada) e o estilo de fala.

Até que ponto as características prosódico-acústicas de f0, qualidade vocal e intensidade parecem estar relacionadas à percepção dos ouvintes dependeria muito do estilo de fala utilizado na pesquisa. Aqui, utilizamos trechos de leitura. A maioria dos estudos com testemunhas auditivas opta por estímulos (semi-)espontâneos como uma solução equilibrada — por exemplo, o corpus DyVis67 — que tem sido amplamente empregado em investigações contemporâneas com testemunhas auditivas28,68. A razão que nos levou a escolher as tarefas de leitura é que nosso corpus, na época da elaboração deste manuscrito, consistia exclusivamente de dados obtidos a partir de tarefas de leitura. É, no entanto, importante reconhecer que o processo de compilação de um corpus (semi-)espontâneo já está em andamento. Além disso, o ato de ler uma história pode gerar um nível confiável de uniformidade e variação, tanto intrafalante quanto interfalante. Isso facilita a ênfase em características prosódicas ou fonéticas — individuais ou dialetais — em situações que envolvem comparação de vozes. Isso se torna especialmente evidente em casos de carga vocal durante a produção de um sotaque estrangeiro, mesmo entre falantes proficientes 8,9,23,54.

figure-results-3
Figura 8: Gráficos de barras contendo os resultados dos quatro reconhecimentos realizados pelos ouvintes brasileiros. (A,B) Diferença não significativa entre a voz-alvo (em azul) e uma voz falsa (em azul claro). (C,D) Diferenças significativas entre as vozes falsas e a voz-alvo. Abreviação: NS = não significativo. Clique aqui para visualizar uma versão maior desta figura.

figure-results-4
Figura 9: Gráficos de barras contendo os resultados dos quatro testes realizados pelos ouvintes americanos. (A) Diferença não significativa entre a voz-alvo (em vermelho) e uma voz distratora (em rosa). (B,C,D) Diferenças significativas entre as vozes distratoras e a voz-alvo. Abreviação: NS = não significativo. Clique aqui para visualizar uma versão maior desta figura.

Tabela Suplementar S1: Estatísticas de produção da fala – Modelos Aditivos Generalizados (GAMs): as estatísticas F (graus de liberdade), o R2 ajustado de cada característica prosódico-acústica estatisticamente significativa (Figura 6) e métrica de ritmo (Figura 7) por nível linguístico, bem como os valores individuais de cada termo suavizado (as covariáveis). Estatísticas de percepção da fala: estatísticas de Kruskall-Wallis χ2 (graus de liberdade), os valores de p e o η2 ajustado, além de um teste post-hoc de Dunn para comparação aos pares (Figura 8 e Figura 9) de cada diferença estatisticamente não significativa entre os pares de vozes alvo-e distrator (Figura 8A,B e Figura 9A). Matrizes de similaridade acústica para as distâncias cosseno e euclidiana de cada conjunto. Clique aqui para visualizar uma versão maior desta figura.

Discussão

O protocolo atual apresenta uma novidade no campo da fonética (forense). Está dividido em duas fases: uma baseada na produção (análise acústica) e outra baseada na percepção (análise do julgamento). A fase de análise de produção compreende a preparação de dados e alinhamento forçado, realinhamento e extração automática de características prosódicas-acústicas, além das estatísticas. Este protocolo conecta a etapa de coleta de dados à análise de dados de forma mais rápida e eficiente do que os protocolos tradicionais baseados em uma segmentação predominantemente manual.

No entanto, o processo de realinhamento, mostrado nas etapas de protocolo 1.3.6 a 1.3.6.9, funciona basicamente nas unidades de telefone e palavra geradas nas etapas de protocolo 1.3.1 a 1.3.4. A novidade do processo de realinhamento é que ele gera um novo TextGrid contendo três novas camadas de texto: uma camada silábica, uma camada de bloco de fala que pode ser gerada automática ou manualmente com base em palavras e uma camada de tom que pode ser bastante útil para calcular medidas f0. As diretrizes de realinhamento propostas para este protocolo foram previamente utilizadas em estudos de ritmo de fala de L221 , 69 , 70 , estudos para detecção de grau de sotaque estrangeiro usando técnicas de aprendizado de máquina22 e estudos no domínio forense9.

A extração automática de características prosódicas, apresentada nas etapas 1.3.7 a 1.3.7.10 do protocolo, gera uma matriz multidimensional de características prosódico-acústicas, como pôde ser atestado na presente pesquisa. Tais características incluem características melódicas, duracionais e espectrais (qualidade e intensidade da voz)71. Um número considerável dessas características acústicas é menos sensível e um tanto robusto a gravações de áudio ruidosas eventualmente coletadas no cenário forense ou em qualquer outro cenário72. Além disso, a matriz multidimensional pode ser aplicada a sistemas de reconhecimento de fala por meio de várias técnicas de IA (trabalho em andamento). Ainda pode ser bastante útil no ensino de aspectos prosódicos nas aulas de pronúncia de L221 (trabalho em andamento).

A análise estatística desta parte do protocolo representa o uso do método GAM, uma vez que lidamos com uma relação complexa entre uma característica acústica específica e falantes de múltiplos fatores de linguagem. Para modelar uma característica acústica específica, por exemplo, foi necessário verificar como outras características acústicas da matriz (os termos suaves) se comportariam para que pudéssemos descrever com mais precisão o que estava acontecendo durante a produção da fala.

Em relação à análise de percepção, o protocolo atual foi constituído por meio da elaboração e implementação das escalações vocais, análise estatística e análise de similaridade acústica. Para preparar as escalações, usamos o script CreateLineup para Praat, que gera automaticamente um arquivo de áudio para cada escalação contendo folhas sequenciadas aleatoriamente e voz-alvo, conforme descrito nas etapas 2.2 a 2.2.1.9 do protocolo.

Para a análise estatística deste protocolo, foi realizado o teste não paramétrico de Kruskal-Wallis, uma vez que nossos dados não atenderam aos pressupostos da Análise de Variância (ANOVA). Uma vez que tivemos uma relação entre os escores de julgamento avaliados pelos ouvintes e controlados para a voz-alvo e os foils, optou-se por utilizar a estatística do modelo linear.

Para a análise de similaridade acústica, utilizou-se o script AcousticSmilarity_cosine_euclidean para Python. O programa abre a árvore de diretórios do computador e pede ao usuário que escolha o arquivo que contém as características prosódico-acústicas das folhas e a voz-alvo que compõe a formação em análise. Com o clique de um botão, o script gera três matrizes de similaridade: um cosseno, um euclidiano e um euclidiano transformado (zero para um), em arquivos '.txt' (delimitado por tabulação) e '.csv'. Ainda devemos ter em mente que cada conjunto de dados (o arquivo '.txt' contendo as características prosódicas-acústicas das folhas e do alvo) deve estar na pasta original da escalação, e cada pasta de escalação deve ter uma cópia do script AcousticSmilarity_cosine_euclidean .

Em resumo, o protocolo atual avança na pesquisa fonética (forense). Compreendendo fases distintas - análises de produção e percepção, bem como similaridade acústica - ele preenche a lacuna entre a coleta de dados e a análise multidimensional de características acústicas. Os pesquisadores podem se beneficiar de uma perspectiva holística, explorando aspectos de produção e percepção. Além disso, esse protocolo garante a reprodutibilidade da pesquisa, permitindo que outros se baseiem nas diretrizes deste trabalho.

Limitações e direções futuras
Ainda devemos ter em mente que tudo funcionará com sucesso se a preparação dos dados seguir as diretrizes propostas nas etapas do protocolo 1.3.1 a 1.3.4. Além disso, nos procedimentos de alinhamento forçado, devemos estar cientes de que um alinhador forçado pré-treinado externo - como MAUS usado no trabalho atual - é suscetível a erros de segmentação, especialmente em dados com sotaque estrangeiro não pré-treinados ou mesmo em alinhadores pré-treinados, seja o áudio não tendo uma boa qualidade ou o alinhador não contenha o idioma do áudio (esse fato tornaria o trabalho do especialista mais difícil e demorado). A transcrição forense, especialmente de arquivos de áudio mais longos, encontra dificuldades no que diz respeito à representação precisa e confiável das gravações faladas72.

Existem também vários desafios na transcrição e alinhamento de arquivos de áudio mais longos. O desempenho do alinhador é afetado pelo estilo de fala e pelo ambiente fonético, bem como por fatores específicos do dialeto. Embora existam diferenças específicas do alinhador, em geral, seu desempenho é semelhante e gera segmentações que se comparam bem ao alinhamento manual geral73. Além disso, a produção de inglês L1 e L2 foi executada com um modelo acústico pré-treinado de inglês americano devido à indisponibilidade de modelos de fala estrangeiros no MAUS. Além disso, não há modelos acústicos pré-treinados para PA em MAUS. Para os dados de PA, foram utilizados os modelos acústicos pré-existentes do italiano (ver NOTA, passo 1.3.5.7 do protocolo).

Em trabalhos futuros (em andamento), usaremos o Montreal Forced Aligner (MFA)74 como parte do protocolo. Uma grande vantagem da MFA é a disponibilidade de modelos acústicos pré-treinados e modelos de grafema para fonema para uma ampla variedade de idiomas (incluindo PB), bem como a capacidade de treinar novos modelos acústicos e de grafema para fonema para qualquer novo conjunto de dados (ou seja, nosso corpus de fala com sotaque estrangeiro) 75 .

Divulgações

Os autores não têm conflitos de interesse a declarar.

Agradecimentos

Este estudo foi financiado pelo Conselho Nacional de Desenvolvimento Científico e Tecnológico - CNPq, processo nº 307010/2022-8 para o primeiro autor e processo nº 302194/2019-3 para o segundo autor. Os autores gostariam de expressar sua sincera gratidão aos participantes desta pesquisa por sua generosa cooperação e contribuições inestimáveis.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
CreateLineupColeção pessoal#Script para praat para preparação de lineups de voz
Dell I3 (com unidade de estado sólido - SSD) Dell#Computador portátil
PraatPaul Boersma & David Weenink#Software para análise fonética
Python 3Python Software Foundation#Linguagem de programação interpretada, de alto nível e de uso geral 
RThe R Project for Statistical Computing#Linguagem de programação para computação estatística
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorPersonal collection#Script para praat para extração automática de recursos acústicos
SurveyMonkeySurveyMonkey Inc.#Montagem de pesquisas personalizáveis gratuitas, bem como um conjunto de programas de back-end que incluem análise de dados, seleção de amostras, eliminação de vieses e representação de dados.
Tascam DR-100 MKIITascam#Gravador de voz digital
O Sistema de Segmentação Automática de Munique MAUSUniversidade de Munique#Alinhador forçado de arquivos de áudio (.wav) e informações linguísticas (.txt)
VVUnitAlignerColeção pessoal#Script para praat para realinhamento automático e pós-processamento de unidades fonéticas

Referências

  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Reimpressões e permissões

Etiquetas

Características ProsódicasPercepção da FalaQualidade da VozFrequência FundamentalReconhecimento do LocutorSimilaridade Acústica