Методическая статья

Иностранный акцент и криминалистическая идентификация диктора в голосовых рядах: влияние акустических особенностей на основе просодии

DOI:

10.3791/66313

27 сентября 2024 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование было направлено на сравнение L1-L2-English и L1-L2 Portuguese, чтобы проверить, насколько влияние иностранного акцента влияет как на метрики, так и на просометрически-акустические параметры, а также на выбор целевого голоса в голосовой линейке.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование направлено на изучение как просодических акустических особенностей, так и перцептивных коррелятов английского языка с иностранным акцентом и бразильского португальского с иностранным акцентом, а также на проверку того, как воспроизведение носителями иностранного и родного акцента коррелирует с восприятием слушателей. В рамках методики мы провели процедуру постановки речи с группой американских носителей бразильского португальского языка L2 и группой носителей бразильского английского языка L2, а также процедуру восприятия речи, в ходе которой мы выполнили голосовые расстановки для обоих языков. Для статистического анализа производства речи мы запустили обобщенные аддитивные модели, чтобы оценить влияние языковых групп на каждый класс (метрический или просодечно-акустический) признаков, контролируемых по эффекту сглаживания ковариат(ов) противоположного класса. Для статистического анализа восприятия речи мы провели тест Краскела-Уоллиса и апостериорный тест Данна, чтобы оценить влияние голосов составов на оценки, оцененные слушателями. Тем не менее, мы провели акустические (голосовые) тесты на сходство на основе косинусов и евклидовых расстояний. Результаты показали значительные акустические различия между языковыми группами с точки зрения вариабельности f0, длительности и качества голоса. Что касается составов, результаты показали, что просодические характеристики f0, интенсивности и качества голоса коррелируют с воспринимаемыми слушателями суждениями.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Акцент - это заметный и динамичный аспект общения и беглости, как на родном языке (L1), так и на иностранном языке (L2)1. Иностранный акцент представляет фонетические особенности L2 целевого языка, и он может меняться (со временем) в зависимости от опыта говорящего в L2, стиля речи, качества ввода, экспозиции и других переменных. Иностранный акцент может быть количественно выражен как (скалярная) степень различия между речью L2, произнесенной носителем иностранного языка, и местным или референсным акцентом целевого языка2,3,4,5.

Это исследование направлено на изучение как просодических акустических особенностей, так и перцептивных коррелятов английского языка с иностранным акцентом и бразильского португальского языка (BP) с иностранным акцентом, а также на проверку того, в какой степени воспроизведение носителями иностранного и родного акцента коррелирует с восприятием слушателей. Предыдущие исследования в области криминалистики продемонстрировали, что надежность гласных и согласных при идентификации иностранного акцента либо стабильна для долгосрочного анализа человека (The Lo Case6), либо указывает на высокую точность идентификации говорящего (The Lindbergh Case7). Тем не менее, исследование просодических акустических особенностей, основанных на длительности, основной частоте (f0, т.е. акустическом корреляте высоты тона), интенсивности и качестве голоса (VQ), привлекает все большее внимание8,9. Таким образом, выбор просодических акустических характеристик в этом исследовании представляет собой многообещающее направление в области судебной фонетики8,10,11,12,13.

Настоящее исследование подтверждается исследованиями, посвященными иностранным акцентам как форме маскировки голоса в судебно-медицинских делах14,15, а также при подготовке голосовых составов для распознавания говорящего16,17. Например, скорость речи играла важную роль в идентификации носителей немецкого, итальянского, японского и бразильского языков на английском языке18,19,20,21,22. Помимо скорости речи, долгосрочные спектральные функции и функции f0 бросают вызов носителям, владеющим L2, знакомым с изучаемым языком, потому что мозг и когнитивные основы страдают от дефицита памяти, внимания и эмоций, что отражается на фонетических характеристиках говорящего во время длинных речевых оборотов23. Взгляд на иностранные акценты в области криминалистики заключается в том, что определение того, что на самом деле звучит как иностранный акцент, во многом зависит от незнания слушателем незнакомости, а не от наличия крайней степени речи с иностранным акцентом24.

В области восприятия распространенным инструментом судебной экспертизы, используемым с середины 1990-х годов для распознавания преступников, является Voice Lineup (слуховое распознавание), которое является аналогом визуального распознавания, используемого для идентификации преступника на месте преступления16,25. В голосовой линейке голос подозреваемого представлен вместе с фольгированными голосами — голосами, схожими по социолингвистическим аспектам, таким как возраст, пол, географическое положение, диалект и культурный статус, — для идентификации очевидцем. Успех или неудача голосового состава будет зависеть от количества голосовых сэмплов и продолжительности выборки25,26. Кроме того, для реальных образцов считается, что качество звука постоянно влияет на точность распознавания голоса. Плохое качество звука может исказить уникальные характеристики voice27. В случае сходства голоса, мелкие фонетические детали, основанные на f0, могут запутать слушателя во время распознавания голоса28,29. Такие акустические характеристики выходят за рамки f0 и включают в себя элементы длительности, а также спектральные характеристики интенсивности и класса VQ30. Этот взгляд на множественные просодические особенности имеет решающее значение в контексте криминалистического сравнения голоса для обеспечения точной идентификации говорящего9,14,15,29,31.

В итоге, исследования в области судебной фонетики показали некоторые различия в идентификации иностранного акцента за последние десятилетия. С одной стороны, иностранный акцент, по-видимому, не влияет на процесс определения носителя sup32,33 (особенно если говорящий не знаком с целевым иностранным акцентом34). С другой стороны, есть выводы в обратном направлении12,34,35.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа получила одобрение комитета по этике исследований на людях. Кроме того, было получено информированное согласие всех участников этого исследования на использование и публикацию их данных.

1. Производство речи

ПРИМЕЧАНИЕ: Мы собрали речь из задания на чтение как по 'L1 English-L2 BP", созданному Группой 1: The American English (из США) Speakers (AmE-S), так и по обоим 'L1 BP-L2 English', созданному Группой 2: The Brazilian Speakers (Bra-S). Смотрите Рисунок 1 для блок-схемы для производства речи.

figure-protocol-1
Рисунок 1: Схематическая блок-схема для производства речи. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

  1. Участников
    1. Определите количество участников, язык (L1 английский, L2 BP; L1 BP, L2 английский), пол (женский или мужской), возраст (среднее, стандартное отклонение), характеристики группы (профессионалы или студенты бакалавриата) и уровень владения L2 (продвинутый или хорошо продвинутый) для каждой группы><. ПРИМЕЧАНИЕ: В настоящем исследовании оба AmE-S и Bra-S считались хорошо владеющими L2 (обе группы были квалифицированы как класс B2-C136). На момент проведения процедуры AmE-S уже два года жил в Бразилии. На момент проведения процедуры Бра-С прожил в США более двух лет. Живя за границей, обе группы говорили на своем L2 для учебы и работы не менее 6 дней в неделю ~4-5 часов в день.
    2. Распределите участников по удобной и тихой комнате и подарите материал для чтения каждой группе.
  2. Сбор данных
    ПРИМЕЧАНИЕ: Речевые данные должны быть собраны из задания на чтение на следующих языках: L1-английский и L2-BP; L1-BP и L2-английский. При необходимости пусть участники заранее прочитают тексты.
    1. Процедуры записи
      1. Записывайте речевые данные в тихом месте с соответствующими акустическими условиями.
      2. Используйте цифровой диктофон (см. Таблицу материалов)37 и однонаправленный кардиоидный микрофон с электромагнитной изоляцией (см. Таблицу материалов)38.
      3. Запишите аудиоданные в формате «.wav».
      4. Установите частоту дискретизации на 48 кГц и скорость квантования на 16 бит.
        ПРИМЕЧАНИЕ: Аудиоформат и конфигурация скоростей дискретизации и квантования, описанные в шагах 1.2.1.3 и 1.2.1.4, применяются для обеспечения высокого качества и снижения шума для сохранения спектральных особенностей, используемых для последующего акустического анализа.
  3. Акустический анализ
    ПРИМЕЧАНИЕ: Разделите процедуры акустического анализа на три этапа: принудительное выравнивание, повторное выравнивание и извлечение акустических признаков.
    1. Напишите языковую транскрипцию (в '.txt) для каждого аудиофайла.
    2. Пометьте пару файлов '.txt'/'.wav' с одинаковыми именами (например, 'my_file.wav'/ 'my_file. txt').
      ПРИМЕЧАНИЕ: Для повышения производительности процедуры, описанной в разделе 1.3.7, настоятельно рекомендуется, чтобы первые три символа файловых тегов '.txt/.wav' представляли язык, диалект или акцент, в то время как четвертый-шестой символы обозначают пол (например, EL1FEM для English L1 Female). Начиная с седьмого символа, пользователь должен указать номер громкоговорителя (например, 001 для первого громкоговорителя). Следовательно, первая пара '.txt/.wav' является EL1FEM001.
    3. Создайте папку для каждого языка L1-L2.
      ПРИМЕЧАНИЕ: Папка для L1-L2 английского языка и папка для L1-L2 BP.
    4. Подтвердите, что все пары файлов одного и того же языка находятся в одной папке.
    5. Проведите принудительное выравнивание.
      1. Получите доступ к веб-интерфейсу принудительного выравнивателя Munich Automatic Segmentation (MAUS) (webMAUS)39 в https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline.
      2. Перетащите каждую пару файлов . wav / . txt из папки в пунктирный прямоугольник в разделе Файлы (или щелкните внутри прямоугольника, рисунок 2A).
      3. Нажмите кнопку Upload, чтобы загрузить файлы в выравниватель (см. красную стрелку в Рисунок 2A).
      4. Выберите следующие параметры в меню Параметры сервиса (Рисунок 2B): G2P-MAUS-PHO2SYL для Имя трубопровода; Английский (US) (для языка), если данные L1-L2 на английском языке; Итальянский (IT) (для языка) если L1-L2 BP data.
        ПРИМЕЧАНИЕ: Мы выбрали «итальянский» для данных BP, потому что webMAUS не предоставляет предварительно обученных акустических моделей для принудительного выравнивания BP. Фонетическая литература утверждает, что итальянская фонология имеет несколько сопоставимый симметричный перечень из семи гласных, точно так же, как BP40, а также согласные акустические сходства41,42.
      5. Оставьте стандартные параметры для «Формата вывода» и «Сохранить все».
      6. Отметьте опцию Run для принятия условий использования (см. зеленую стрелку в Рисунок 2C).
      7. Нажмите кнопку «Запустить веб-сервис», чтобы запустить загруженные файлы в файле aligner.
        ПРИМЕЧАНИЕ: Для каждого аудиофайла принудительное выравнивание MAUS возвращает объект Praat TextGrid (предварительно отформатированный файл Praat '.txt', содержащий аннотацию слов, фонологических слогов и фонологических звуков на основе лингвистической транскрипции, извлеченной из файла '.txt', описанного в шаге 1.3.1).
      8. Нажмите кнопку Загрузить как ZIP-файл, чтобы загрузить файлы TextGrid в виде заархивированного файла (Рисунок 2C).
        ПРИМЕЧАНИЕ: Убедитесь, что заархивированные файлы TextGrid загружены в ту же папку, что и аудиофайлы.
      9. Извлеките файлы TextGrid для последующей перестройки в программном обеспечении для фонетического анализа43.
    6. Проведите перестройку.
      1. Получите доступ и загрузите скрипт для Praat VVUnitAligner44 с https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat.
      2. Подтвердите, что все пары файлов одного языка и скрипт VVUnitAligner находятся в одной папке.
        ПРИМЕЧАНИЕ: Папка для английских файлов L1-L2 и VVunitAligner, а также папка для файлов L1-L2 BP и VVunitAligner.
      3. Откройте программу для фонетического анализа.
      4. Нажмите Praat | Откройте скрипт Praat... для вызова скрипта из окна объекта.
      5. Нажмите кнопку «Запустить один раз».
        ПРИМЕЧАНИЕ: На экране появится форма под названием Фонетическое выравнивание слогов, содержащая настройки для использования скрипта (Рисунок 3A).
      6. Нажмите кнопку «Язык», чтобы выбрать один из следующих языков: «Английский (США)», «Португальский (BR)», «Французский (FR)» или «Испанский (ES)».
      7. Нажмите кнопку «Сегментация блоков», чтобы выбрать одну из следующих процедур: «Автоматическая», «Принудительная (ручная)» или «Нет».
      8. Отметьте опцию «Сохранить файлы TextGrid», чтобы автоматически сохранить новые файлы TextGrid.
      9. Нажмите «ОК» | Запустите кнопки для перестановки фонетических единиц с шага 1.3.5.7 .
        ПРИМЕЧАНИЕ: Для каждого аудиофайла VVUnitAligner сгенерирует новый файл TextGrid для раздела 1.3.7 (рисунок 3B).
    7. Проведите автоматическую экстракцию акустических особенностей.
      1. Получите доступ и загрузите скрипт SpeechRhythmExtractor45 от https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat для автоматического извлечения просодических и акустических признаков.
      2. Создайте новую папку и поместите SpeechRhythmExtractor вместе со всеми парами файлов audio/TextGrid всех языков.
      3. Откройте программу для фонетического анализа.
      4. Нажмите Praat | Откройте скрипт Praat... для вызова скрипта из окна объекта.
      5. Нажмите кнопку «Выполнить» только один раз.
        ПРИМЕЧАНИЕ: На экране появится форма с настройками скрипта. В окошках выходных имен файлов '.txt' переименуйте файлы соответствующим образом или оставьте имена по умолчанию.
      6. Отметьте опцию параметров качества голоса, чтобы сохранить Выходной файл VQ для качества голоса (Рисунок 3C).
        ПРИМЕЧАНИЕ: Этот второй выходной файл (Output file VQ) содержит параметры разницы между1-й и2-й гармониками (H1-H2) и Cepstral Prominence Peak (CPP)9.
      7. Отметьте опцию «Лингвистическая цель», чтобы выбрать одну из меток «Язык», «Диалект» или «Акцент» (Рисунок 3C).
      8. Отметьте опцию Единица измерения, чтобы выбрать функции f0 в Гц или в полутонах (Рисунок 3C).
      9. Устанавливаем в значениях порога F0 минимальный и максимальный пороги f0 (рисунок 3C).
        ПРИМЕЧАНИЕ: Если исследование не преследует конкретных целей или не имеет предустановленных специфических функций звука, настоятельно рекомендуется оставить параметры шага 1.3.7.9 со значениями по умолчанию.
      10. Нажмите «ОК» | Run для автоматического извлечения акустических особенностей .
        ПРИМЕЧАНИЕ: Скрипт SpeechRhythmExtractor возвращает файл '.txt, разделенный табуляцией (Output file/ Output file VQ), содержащий акустические особенности, извлеченные из динамиков.
  4. статистический анализ
    1. Загрузите таблицу, содержащую акустические характеристики, в среду R46 (или любую статистическую программу/среду по вашему выбору).
    2. Выполнение обобщенных аддитивных моделей (GAM) непараметрической статистики.
      1. Выполнение GAMs в R.
      2. Введите следующие команды и нажмите Enter.
        Библиотека(MGCV)
        model = gam(метрический/просодический-акустический признак в анализе ~ Язык + s(выбранный метрический признак, по = язык) + другие метрические/просодические-акустические характеристики, данные = кадр данных)
        ПРИМЕЧАНИЕ: Мы решили провести тестовую статистику протокола на языке программирования R из-за его растущей популярности среди фонетистов (и лингвистов) в академическом сообществе. R широко использовался в фонетических полевых исследованиях47. Имейте в виду, что шаг 1.4.2.2 содержит псевдокод. Напишите код в соответствии с исследовательскими переменными.

figure-protocol-2
Рисунок 2: Скриншот фонетического выравнивания с использованием принудительного выравнивания MAUS. (A) Пунктирный прямоугольник предназначен для перетаскивания файлов 'my_file.wav'/' my_file.txt' или клика внутри для поиска таких файлов из папки; Кнопка «Загрузить» обозначена красной стрелкой. (B) Файлы, загруженные с панели A (см. синюю стрелку), используемый конвейер, язык для пар файлов, формат файла, который должен быть возвращен, и кнопка 'true/false' для хранения всех файлов. (C) Флажок «Условия использования» (см. зеленую стрелку), кнопка «Запустить веб-сервисы» и «Результаты» (файлы TextGrid для загрузки). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-protocol-3
Рисунок 3: Скриншот процедуры перестройки. (A) Форма ввода настроек для процедуры перестройки. (B) Частичная форма волны, широкополосная спектрограмма с контуром f0 (синий) и шестью ярусами, сегментированными (и помеченными) как уровень 1: единицы начала гласных до следующего начала гласных (V_to_V); гласное начало (V_to_V); уровень 2: единицы гласной (V), согласной (C) и паузы (#); Уровень 3: Фонетические представления V_to_V; Уровень 4: несколько слов из текста; уровень 5: некоторые куски (СН) речи из текста; Уровень 6: тональный уровень, содержащий самый высокий (H) и самый низкий (L) тон каждого фрагмента речи, производимого женщиной AmE-S. (C) Входные настройки для автоматического выделения акустических особенностей. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

2. Восприятие речи

ПРИМЕЧАНИЕ: Мы провели четыре голосовых линейки на английском языке с американскими слушателями и четыре линейки на BP с бразильскими слушателями. Смотрите Рисунок 4 для блок-схемы восприятия речи.

figure-protocol-4
Рисунок 4: Схематическая блок-схема для восприятия речи. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

  1. Участников
    1. Выберите разных участников для каждой группы из тех, кто участвовал в протоколе производства речи.
      ПРИМЕЧАНИЕ: Для этой части протокола были отобраны две группы участников: Группа 1: Американский энглиш(из США) Listeners (AmE-L) и Группа 2: Brazilian Listeners (Bra-L). В настоящем исследовании оба препарата AmE-L и Bra-L были признаны хорошо владеющими L2 (обе группы были квалифицированы как класс B2-C136 На момент проведения процедур AmE-L прожил два года в Бразилии. На момент проведения процедуры Bra-L прожил в США более двух лет. Живя за границей, обе группы говорили на своем L2 в учебных и рабочих целях (по крайней мере, шесть дней в неделю по 4-5 часов в день).
    2. Определите количество участников, язык (L1 английский, L2 BP; L1 BP, L2 английский язык), пол (женский или мужской), возраст (среднее, стандартное отклонение), характеристики группы (профессионалы или студенты) и уровень владения L2 для каждой группы.
  2. Голосовые ряды
    ПРИМЕЧАНИЕ: Разделите процедуры озвучивания озвучивающих составов на два этапа: подготовка и проведение голосовых составов.
    1. Подготовьте четыре голосовых ряда для английского языка и четыре для BP.
      1. Получите аудиофайлы от спикеров раздела 1: Производство речи.
      2. Убедитесь, что аудиофайлы каждого языкового фактора находятся в отдельных папках.
      3. Случайным образом выберите шесть голосовых фрагментов на языках L1 English или L1 BP.
        ПРИМЕЧАНИЕ: Шесть голосов в линейке представляют один целевой голос и пять рапир.
      4. Выберите голосовой блок на английском языке L2 или L2 BP от одного из динамиков, включенных в шаг 2.2.1.3.
        ПРИМЕЧАНИЕ: Фрагмент голоса на шаге 2.2.1.4 является эталонным голосом. Длина кусков должна составлять примерно 20 с.8.
      5. Получите доступ и загрузите скрипт для Praat CreateLineup48 из https://github.com/pabarbosa/prosody-scripts-CreateLineUp.
      6. Перед запуском скрипта CreateLineup убедитесь, что эталонный голос L2, фольгированные L1 и целевой голос L1 находятся в одной папке (рисунок 5).
      7. Откройте программу для фонетического анализа.
      8. В окне объекта нажмите Praat | Откройте скрипт Praat... для вызова скрипта.
      9. Нажмите «Выполнить» | Run.
        ПРИМЕЧАНИЕ: Скрипт возвращает файл в следующем порядке: (эталонный голос L2) + (целевой голос L1 и случайно распределенные фольги) (рисунок 5).
    2. Запуск голосовых составов
      1. Создайте онлайн-пространство для размещения составов на любой платформе по выбору (например, SurveyMonkey). см. Таблицу материалов) для дистанционного дирижирования голосовыми составами.
      2. Перейдите по ссылке на онлайн-пространство.
      3. Загрузите файлы, возвращенные из скрипта CreateLineup, на платформу.
      4. Запустите процедуру перед участниками, чтобы проверить каждый шаг.
        ПРИМЕЧАНИЕ: Рекомендуется предварительно перейти по ссылке и запустить составы, чтобы проверить, все ли работает нормально.
  3. статистический анализ
    1. Загрузите таблицу, содержащую оценки суждений слушателей, в среду R (или любое другое статистическое программное обеспечение/среду по выбору).
      1. Выполните тест Краскела-Уоллиса в R.
      2. Введите следующие команды и нажмите Enter.
        model = kruskal.test(суждения ~ каждый голосовой состав, данные = кадр данных)
    2. Проведите апостериорный тест Данна.
      1. Выполните тест Данна в R.
      2. Введите следующие команды и нажмите Enter.
        библиотека(FSA)
        model = dunnTest(judgments ~ each voice lineup, data = data, method = "bonferroni")
        ПРИМЕЧАНИЕ: Коды на этапах 2.3.1.2 и 2.3.2.2 являются псевдокодами (см. ПРИМЕЧАНИЕ 1.4.2.2).
  4. Анализ акустического подобия
    1. Выберите расстановки (см. ПРИМЕЧАНИЕ на шаге 2.2.1.3), которые показали незначительные различия между мишенью и любой из рапирированных листов.
    2. Повторите процедуры, описанные в пунктах 1.3.1-1.3.7.5 и 1.3.7.8-1.3.7.10.
    3. Получите доступ и загрузите скрипт для Python49, AcousticSimilarity_cosine_euclidean50 с https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py.
      ПРИМЕЧАНИЕ: Скрипт возвращает три матрицы (в '.txt' и '.csv'): одну для косинусного сходства51,52, одну для евклидова расстояния52,53, и одну для преобразованных значений евклидова расстояния, а также попарное сравнение между целевым голосом и каждой фольгой.
    4. Подтвердите, что сценарий загружен в ту же папку набора данных.
    5. Нажмите кнопку "Открыть файл...", чтобы вызвать скрипт.
    6. Нажмите «Выполнить» | Запуск без кнопок отладки.
      ПРИМЕЧАНИЕ: Вторая кнопка «Выполнить» может быть помечена как «Выполнить» или «Выполнить без отладки» или «Запустить сценарий». Все они выполняют одни и те же команды. Это просто зависит от используемой среды Python.
    7. Проведите тесты на сходство голоса на основе акустических характеристик.
      ПРИМЕЧАНИЕ: Косинусное сходство (или косинусное расстояние) — это метод, применяемый в искусственном интеллекте (ИИ), в частности в машинном обучении в системах автоматического распознавания речи (ASR). Это мера сходства между нулем и единицей. Косинусное сходство, близкое к единице, означает, что два голоса, скорее всего, будут похожи. Косинусное сходство, близкое к нулю, означает, что голоса, скорее всего, будут непохожими52. Евклидово расстояние, часто называемое евклидовым подобием, также широко используется в искусственном интеллекте, машинном обучении и ASR. Он представляет собой расстояние по прямой между двумя точками в евклидовом пространстве53, т.е. чем ближе точки (чем меньше значения расстояния), тем больше похожи голоса. Для более четкого понимания полученных результатов обоих методов мы выполнили преобразование исходных оценок евклидова расстояния в значения от нуля (меньшее сходство голоса) до единицы (большее сходство голоса)54.

figure-protocol-5
Рисунок 5: Настройка каталога для восприятия речи. Папки для расстановки. Каждая папка содержит шесть голосов L1, целевой голос L2, сценарий "CreateLineup" и аудиофайл голосового состава (возвращается после запуска скрипта). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Результаты для производства речи
В этом разделе мы описали производительность статистически значимых просодических акустических особенностей и ритмических метрик. Такими просодическими особенностями были речь, артикуляция и паузы, которые связаны с продолжительностью, и мерцание, которое связано с качеством голоса. Метрики ритма представляли собой стандартное отклонение (SD) длительности слога, SD согласного, SD вокальной или согласной длительности и коэффициент вариации длительности слога (см. дополнительную таблицу S1).

Скорость речи (Рисунок 6A) снижается быстрее для L1-L2 English, чем для L1-L2 BP, хотя скорость ниже для обоих L2. Темп речи связан с тремя метриками - SD длительности слога (SD-S), SD гласных (SD-V) и коэффициентом силлабической вариации (Varco-S). Также важно иметь в виду, что и AmE-S, и группа Bra-S хорошо владеют своими L2. По-видимому, на такую скорость влияют более высокие значения длительности слогов и меньшая вариабельность, производимая L1-L2 BP, что приводит к менее крутым склонам.

Коэффициент артикуляции (Рисунок 6D) связан с SD-S, Varco-S, а также с слоговым ритмическим соотношением (RR-S); последнее представляет собой соотношение между короткими и длинными слогами. Такие метрики, по-видимому, влияют на частоту артикуляции так же, как и затронутая скорость речи из-за длины предложения и вариации длительности, что приводит к более высокому планированию речи L2, а когнитивная нагрузка L29,23,54. В области длины предложения может потребоваться более высокая когнитивно-лингвистическая нагрузка таким образом, что это повлияет на просодические акустические параметры55.

Что касается просодических акустических особенностей скорости речи и артикуляции, наши результаты показывают, что чем больше говорящий варьирует длительность слогов (и гласных), тем ниже такие показатели. Мы предполагаем, что восприятие речи как L1, так и L2 BP звучит несколько медленнее, чем L1 и L2-английский, и что L1-английский звучит быстрее, чем все остальные языковые уровни. Этот факт может быть связан с ритмом речи и гипотезой о том, что в то время как L1-L2 BP склоняется к слоговому полюсу ритмического континуума, L1-L2 английский движется к ударно-временному полюсу21,22.

Местное мерцание, Рисунок 6B, находится под влиянием SD-S и Varco-S. Для местного мерцания оба произведения Bra-S, L1-BP и L2-English представляют собой несколько монотонную траекторию по мере увеличения вариативности длительности слогов (SD и Varco, см. Дополнительную таблицу S1). Восприятие вокального усилия может быть очевидным при прослушивании продукции Bra-S из-за низкой вариации, которая колеблется от 8,5 до 9 дБ. На речь Bra-S влияет голосовая нагрузка. L1-BP сильно зависит от длины предложения, будучи менее чувствительным к большим вариациям длительности слогов (ритмический рисунок BP показывает меньше силлабических вариаций22,56).

Частота пауз (Рисунок 6C) показывает, что носители L2-английского создают более длительные паузы (от 200 мс до 375 мс), чем носители L1-английского, L1-BP и L2-BP (в среднем 30 мс для L1-английского, 50 мс для L1-BP и 100 мс для L2-BP). Планирование речи, в этом случае, могло повлиять на производство L2-английского из-за повышенной активности мозга54,57. Ожидается, что более высокий уровень владения языком приведет к увеличению скорости чтения и span54; тем не менее, даже для владеющих языком L2 задания на чтение требовали больше усилий в когнитивных аспектах иностранной речи более высокого порядка и в обработке языка54,57. Наши результаты показывают, по крайней мере, на предварительной основе, что носители L2-BP могут быть менее подвержены влиянию пауз, чем L2-английский, из-за различий в ритмическом рисунке обоих языков.

figure-results-1
Рисунок 6: Обобщенные аддитивные модели для просодических и акустических характеристик. По оси Y — переменная отклика (акустические особенности, подлежащие моделированию); на оси X — переменные-предикторы (фактор «Язык» и ковариаты в аддитивных моделях, которые будут обеспечивать форму и траектории кривых (т. е. эффекты сглаживания: «Язык + ковариаты»), а также произведение «Язык» и метрический признак, который обеспечит более точную проекцию переменной отклика (т. е. факторно-гладкие взаимодействия: 'covariate:Language'). Сокращение: GAMs = обобщенные аддитивные модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Что касается метрик ритма, для SD-S (Рисунок 7A), наши результаты показывают, что чем больше говорящий изменяет кривую f0 и увеличивает скорость речи, тем больше снижается SD-S для всех языковых уровней (зеркальный эффект Рисунок 6A). В случае SD для согласных (SD-C, Рисунок 7C), L1-BP, в отличие от L1 английского, выполняет низкую вариацию по мере увеличения скорости речи или длительности паузы. Такое направление SD прогнозируется, так как вариативность длительности слогов L1-English (статистически) значительно выше, чем у L1-BP44,58. Varco-S (Рисунок 7B и Дополнительная таблица S1) кажется в некоторой степени коррелированным с L1 и L2 одной и той же языковой группы. По мере увеличения вариабельности f0 и скорости речи, Varco-S уменьшается для L1-BP и, по-видимому, уменьшается и ослабевает для L2-BP. Для англоязычной продукции, в то время как вариативность f0 и скорость речи увеличиваются, Varco-S увеличивается и ослабевает для L1-английского и L2-английского.

Что касается SD для гласных или согласных (SD-V_C, Рисунок 7D и дополнительная таблица S1), наши результаты показывают некоторое сходство с производительностью Varco-S (Рисунок 7B). Например, более высокая скорость речи, продолжительность паузы и вариабельность f0 способствуют траектории падения-подъема SD-V_C для L1-BP и для L2-BP. В англоязычных произведениях, в то время как такие просодические особенности выше, SD-V_C немного уменьшается, ослабевает для L1-английского, немного увеличивается, а затем ослабевает для L2-английского. Корреляция Varco-S и SD-V_C с L1-L2 одних и тех же языковых групп может быть частично объяснена эффектом Ломбарда, который относится к изменению акустических параметров речи из-за фонового шума59.

В иностранной речи, в зависимости от сложности задачи (например, чтение речи), говорящие использовали похожие акустические стратегии как на L1, так и на L259,60. С одной стороны, Марку и Эрнестус обнаружили, что меры f0 (диапазон и медиана) в речи L2 на ломбардском языке предполагают, что на носителей английского языка L2 повлияло их L1 голландское ="xrefsup class="xref">62. С другой стороны, более поздние результаты показывают, что, хотя ожидается, что ломбардская речь L2 будет отличаться от ломбардской речи L1 из-за более высокой когнитивной нагрузки при говорении на L2, носители английского языка L2 воспроизводили ломбардскую речь в том же направлении, что и носители английского языка L1 63. Степень, в которой наши выводы согласуются с Marcoux и Ernestus63 и расходятся с Waaning59, Villegas et al.60, и Marcoux and Ernestus61,62, требует дальнейшего изучения.

figure-results-2
Рисунок 7: Обобщенные аддитивные модели для метрических признаков. По оси Y — переменная отклика (метрики, подлежащие моделированию); на оси X — переменные-предикторы (фактор «Язык» и ковариаты в аддитивных моделях, которые будут обеспечивать форму и траектории кривых (т. е. эффекты сглаживания: «Язык + ковариаты»), а также произведение «Язык» и метрический признак, который обеспечит более точную проекцию переменной отклика (т. е. факторно-гладкие взаимодействия: 'covariate:Language'). Сокращение: GAMs = обобщенные аддитивные модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Результаты для восприятия речи
Что касается голосовых составов BP, то в линейке #1 (Рисунок 8A), фольгированный голос #3 был оценен как целевой голос. На самом деле, целевой голос был голосом #4. Результаты не показывают статистически значимой разницы (см. Дополнительную таблицу S1) между фольгой #3 (83%) и целевым голосом #4 (71%). В линейке #2 (Рисунок 8B) сравнение между целевым голосом #3 (40%) и фольгой #4 (20%) также не показало статистически значимой разницы (см. Дополнительную таблицу S1) для английских голосовых составов. В линейке #1 (Рисунок 9A) не было существенной разницы (см. Дополнительную таблицу S1) между фольгой #2 (26%) и целевым голосом #4 (54%).

При анализе сходства голосов как косинусное сходство (CoSim), так и евклидово расстояние (EucDist, [EucDist transformed]54) показали устойчивую корреляцию между фольгой #3 и целью для линейки BP #1 (CoSim = 0.99; EucDist = 77,4, [0,93]). Корреляция между фольгой #4 и мишенью была столь же сильна в линейке BP #2 (CoSim = 0,99, EucDist = 76,3, [0,93]). В английской линейке #1 корреляция была стабильной для CoSim (0,83(, но слабой или удовлетворительной для EucDist (213,0, [0,47]. В целом, и CoSim, и EucDist были удовлетворительными методами определения сходства голосов. Кроме того, CoSim работал немного эффективнее, о чем свидетельствуют Gahman и Elangovan52 (см. Дополнительную таблицу S1).

С точки зрения сходства, что могло привести к увеличению количества ложных срабатываний? Просодические акустические особенности показали, что, хотя фольгированные и целевые голоса работали (статистически) значительно по-разному - за исключением составов, представленных в Рисунок 8A,B и Рисунок 9A - выбор слушателей несколько диверсифицировался по разным фольгированным типам в других составах (Рисунок 8C,D, и Рисунок 9B). Такое суждение, по-видимому, больше зависит от одной (или, может быть, нескольких) специфических акустических особенностей, общих для акустических носителей, чем от целого класса просодических акустических особенностей. Например, в нашем исследовании было представлено несколько особенностей, (со)варьирующихся между производствами; Тем не менее, перцептивные результаты показывают предпочтения суждений в отношении конкретного фольги, чтобы она соответствовала целевому голосовому классу8,35,64,65. В будущей работе необходимы дальнейшие анализы.

Стоит рассмотреть выбор многомерной параметрической матрицы для акустического сходства66 как представленный в этом исследовании. Наши результаты согласуются с предыдущими исследованиями, в которых использовались акустические характеристики на основе f0, VQ и intensity9,35. Такие функции замечательно рекомендуются для задач сравнения говорящих в криминалистической области9,66. Тем не менее, важно подчеркнуть, что в настоящем исследовании ни один из вариантов не был похож на целевой голос, хотя мы использовали вариант рекомендаций Макфарлейна16,17 при подготовке голосовых рядов для распознавания говорящих с иностранным акцентом. Кроме того, мы должны подчеркнуть, что наша процедура выстраивания голоса имеет важные отличия от рекомендаций Макфарлейна, включая длину стимула, количество голосов, выбор фольги (рандомизированный здесь) и стиль речи.

В какой степени просодечно-акустические особенности f0, качество и интенсивность голоса, по-видимому, связаны с восприятием слушателей, сильно зависит от стиля речи, используемого в исследовании. Здесь мы использовали чтение отрывков. Большинство исследований свидетелей используют (полу-) спонтанные стимулы в качестве сбалансированного решения - например, класс DyVis corpus67-, который широко используется в современных исследованиях свидетелей28,68. Причина, побудившая нас выбрать задания на чтение, заключается в том, что наш корпус на момент написания этой рукописи состоял исключительно из данных, полученных из заданий на чтение. Тем не менее, важно признать, что процесс составления (полу-) спонтанного корпуса уже идет. Кроме того, акт чтения рассказа может создать надежный уровень единообразия и вариативности, как внутри говорящего, так и между говорящим. Это облегчает акцент на просодических или фонетических характеристиках — индивидуальных или диалектных — в ситуациях, связанных со сравнением голоса. Это становится особенно заметным в случаях вокальной нагрузки во время произнесения иностранного акцента, даже среди опытных носителей 8,9,23,54.

figure-results-3
Рисунок 8: Гистограммы, содержащие результаты для четырех составов, выполненные бразильскими слушателями. (А,Б) Незначительная разница между голосом цели (синим цветом) и фольгой (голубым цветом). (C,D) существенные отличия от фольги и целевого голоса. Сокращение: NS = незначащий. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-4
Рисунок 9: Гистограммы, содержащие результаты для четырех составов, выполненные американскими слушателями. (A) Незначительная разница между целевым голосом (красным) и фольгой (розовым). (Б,В,Г) Существенные отличия от фольги и целевого голоса. Сокращение: NS = незначащий. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Дополнительная таблица S1: Статистика производства речи - Обобщенные аддитивные модели (GAM): F-статистика (степени свободы), скорректированное R2 каждого статистически значимого просодно-акустического признака (Рисунок 6) и метрика ритма (Рисунок 7) для уровня языка, а также индивидуальные значения каждого гладкого члена (ковариаты). Статистика восприятия речи: Статистика Крускалла-Уоллиса χ2 (степени свободы), p-значения и скорректированный η2, а также апостериорный тест Данна для попарного сравнения (Рисунок 8 и Рисунок 9) каждой статистически незначимой разницы между парами голосов с мишенью-фольгой (Рисунок 8A,B и Рисунок 9A). Матрицы акустического подобия для косинуса и евклидова расстояния каждой линейки. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Текущий протокол представляет собой новшество в области (судебной) фонетики. Он разделен на две фазы: одна основана на производстве (акустический анализ) и другая основана на восприятии (анализ суждений). Этап анализа продукции включает в себя подготовку данных и принудительное выравнивание, повторное выравнивание и автоматическое извлечение просодических акустических особенностей, помимо статистики. Этот протокол связывает этап сбора данных с анализом данных более быстрым и эффективным способом, чем традиционные протоколы, основанные преимущественно на ручной сегментации.

Тем не менее, процесс перестройки, показанный на этапах протокола с 1.3.6 по 1.3.6.9, в основном работает на телефонных и словесных единицах, сгенерированных на этапах протокола с 1.3.1 по 1.3.4. Новизна процесса перестройки заключается в том, что он генерирует новую сетку TextGrid, содержащую три новых уровня текста: слоговой уровень, уровень фрагментов речи, который может быть сгенерирован автоматически или вручную на основе слов, и уровень тона, который может быть весьма полезен для вычисления мер f0. Рекомендации по перестройке, предложенные для данного протокола, ранее использовались в исследованиях речевого ритма L2 21,69,70, исследованиях по выявлению степени иностранного акцента с использованием методов машинного обучения22 и исследованиях в области судебной экспертизы 9.

Автоматическое извлечение просодических признаков, представленное на этапах протокола с 1.3.7 по 1.3.7.10, генерирует многомерную матрицу просодических акустических признаков, что может быть засвидетельствовано в настоящем исследовании. К таким характеристикам относятся мелодические, длительные и спектральные (качество и интенсивность голоса) особенности речи71. Значительное число этих акустических особенностей менее чувствительны и в некоторой степени устойчивы к зашумленным аудиозаписям, которые в конечном итоге собираются в ходе судебной экспертизы или в любых другихсценариях. Кроме того, многомерная матрица может быть применена к системам распознавания речи с помощью нескольких методов искусственного интеллекта (работа в процессе). Он все еще может быть весьма полезен при обучении просодическим аспектам в классе произношения L221 (работа в процессе).

Статистический анализ этой части протокола представляет собой использование метода GAM, поскольку мы имели дело со сложной взаимосвязью между специфической акустической особенностью и носителями нескольких языковых факторов. Например, чтобы смоделировать конкретную акустическую особенность, необходимо было проверить, как будут работать другие акустические особенности матрицы (гладкие слагаемые), чтобы мы могли более точно описать, что происходит во время произнесения речи.

Что касается анализа восприятия, то текущий протокол был составлен путем подготовки и внедрения голосовых составов, статистического анализа и анализа акустического сходства. Для подготовки составов мы использовали скрипт CreateLineup для Praat, который автоматически генерирует аудиофайл для каждого состава, содержащий случайно расположенные последовательности фольги и целевой голос, как описано в шагах протокола с 2.2 по 2.2.1.9.

Для статистического анализа этого протокола мы провели непараметрический тест Краскела-Уоллиса, поскольку наши данные не соответствовали предположениям дисперсионного анализа (ANOVA). После того, как мы установили связь между оценками, оцененными слушателями и контролируемыми для целевого голоса и фольгой, мы решили использовать статистику линейной модели.

Для анализа акустического подобия мы использовали скрипт AcousticSmilarity_cosine_euclidean для Python. Программа открывает окно дерева каталогов компьютера и просит пользователя выбрать файл, содержащий просодические акустические характеристики фольги и целевой голос, составляющий состав анализируемого состава. Одним нажатием кнопки скрипт генерирует три матрицы подобия: косинусную, евклидову и преобразованную (от нуля к одному) евклидову, как в файлах '.txt' (с разделителями табуляцией), так и в файлах '.csv'. Мы все еще должны помнить, что каждый набор данных (файл '.txt, содержащий просодические акустические характеристики фольги и мишени) должен находиться в исходной папке состава, и в каждой папке расстановки должна быть копия сценария AcousticSmilarity_cosine_euclidean .

Подводя итог, можно сказать, что текущий протокол продвигается вперед в (криминалистических) исследованиях фонетики. Состоящая из отдельных этапов - анализа производства и восприятия, а также акустического сходства - она устраняет разрыв между сбором данных и многомерным анализом акустических характеристик. Исследователи могут извлечь пользу из целостной точки зрения, изучая как аспекты производства, так и восприятия. Более того, этот протокол обеспечивает воспроизводимость исследований, позволяя другим основываться на руководящих принципах этой работы.

Ограничения и будущие направления
Мы все еще должны помнить, что все будет успешно, если подготовка данных будет осуществляться в соответствии с рекомендациями, предложенными в пунктах протокола с 1.3.1 по 1.3.4. Кроме того, при принудительном выравнивании мы должны отдавать себе отчет в том, что внешний предварительно обученный принудительный выравниватель, подобный MAUS, используемый в текущей работе, подвержен ошибкам сегментации, особенно в необученных данных с иностранным акцентом или даже в предварительно обученных выравнивателях, независимо от того, имеет ли аудио плохое качество или выравниватель не содержит аудиоязыка (это сделало бы работу эксперта более сложной и трудоемкой). Судебная транскрипция, особенно более длинных аудиофайлов, сталкивается с трудностями в отношении точного и надежного представления устных записей72.

Существует также несколько проблем при расшифровке и выравнивании более длинных аудиофайлов. На производительность элайнера влияют стиль речи и фонетическая среда, а также факторы, специфичные для диалекта. Несмотря на то, что существуют различия, специфичные для выравнивателей, в целом их производительность схожа и генерирует сегментации, которые хорошо сопоставимы с ручным выравниванием в целом73. Кроме того, производство L1 и L2 на английском языке проводилось с использованием предварительно обученной акустической модели американского английского языка из-за отсутствия моделей иностранной речи в MAUS. Кроме того, в MAUS нет предварительно обученных акустических моделей для BP. Для получения данных BP использовались ранее существовавшие акустические модели итальянского языка (см. ПРИМЕЧАНИЕ, шаг протокола 1.3.5.7).

В будущей работе (в процессе) мы будем использовать Монреальский принудительный элайнер (MFA)74 как часть протокола. Большим преимуществом MFA является наличие предварительно обученных акустических моделей и моделей grapheme-to-phoneme для широкого спектра языков (включая BP), а также возможность обучения новых акустических и графемо-фонемных моделей на любой новый набор данных (т.е. наш корпус речи с иностранным акцентом)75.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

У авторов нет конфликта интересов, о котором можно было бы заявить.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Это исследование было поддержано Национальным советом по научно-техническому развитию - CNPq, грант No 307010/2022-8 для первого автора и грант No 302194/2019-3 для второго автора. Авторы выражают искреннюю благодарность участникам данного исследования за щедрое сотрудничество и неоценимый вклад.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
CreateLineupЛичная коллекция#Скрипт для подготовки голосовых составов
Dell I3 (с твердотельным накопителем - SSD) Dell#Laptop computer
PraatPaul Boersma & Дэвид Вининк#Программное обеспечение для фонетического анализа
Python 3Python Software Foundation#Интерпретируемый, высокоуровневый, язык программирования общего назначения 
RThe R Project for Statistical Computing#Programming language for stattistical computing
Shure Beta SM7BShure#Microphone
SpeechRhythmExtractorPersonal collection#Script for praat для автоматического извлечения акустических характеристик
SurveyMonkeySurveyMonkey Inc.#Соберите бесплатные настраиваемые опросы, а также набор серверных программ, которые включают анализ данных, отбор выборки, устранение предвзятости и представление данных.
Tascam DR-100 MKIITascam#Цифровой диктофон
Мюнхенская автоматическая система сегментации MAUSUniversity of Munich#Принудительное выравнивание аудио (.wav) и лингвистической информации (.txt) файлов
VVUnitAlignerЛичная коллекция#Скрипт для праата для автоматической перестройки и постобработки фонетических единиц

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи