Результаты продукции речи
В данном разделе мы описали показатели статистически значимых просодико-акустических признаков и метрик ритма. К таким просодическим признакам относились темп речи, темп артикуляции и частота пауз, которые связаны с длительностью, а также шиммер, который связан с качеством голоса. Метриками ритма были стандартное отклонение (SD) длительности слога, SD согласного, SD вокализированной или консонантной длительности и коэффициент вариации длительности слога (см. Дополнительную таблицу S1).
Скорость речи (Рисунок 6A) снижается более стремительно для L1-L2 English, чем для L1-L2 BP, хотя эта скорость ниже для обоих вариантов L2. Скорость речи связана с тремя показателями: стандартным отклонением длительности слога (SD-S), стандартным отклонением гласных (SD-V) и коэффициентом вариации слога (Varco-S). Также важно учитывать, что участники обеих групп, AmE-S и Bra-S, свободно владеют своим L2. Похоже, что на такую скорость влияют более высокие значения длительности слога и меньшая вариабельность, характерные для L1-L2 BP, что приводит к менее крутому наклону кривых.
Скорость артикуляции (Рисунок 6D) связана с SD-S, Varco-S, а также с коэффициентом слогового ритма (RR-S); последний представляет собой отношение коротких слогов к длинным. Похоже, что такие метрики влияют на Скорость артикуляции так же, как на Скорость речи, которая зависит от длины предложения и вариативности длительности, что ведет к более сложному планированию речи на втором языке (L2) и увеличению когнитивной нагрузки при использовании L29,23,54. Более высокая когнитивно-лингвистическая нагрузка может потребоваться при определенной длине предложения, что в свою очередь влияет на просодико-акустические параметры55.
Что касается просодико-акустических характеристик скорости речи и скорости артикуляции, наши результаты показывают, что чем больше говорящий варьирует длительность слогов (и гласных), тем ниже эти показатели. Мы предполагаем, что восприятие речи как на L1, так и на L2 BP кажется несколько более медленным, чем на L1 и L2-английском, а L1-английская речь воспринимается быстрее, чем речь на всех остальных уровнях владения языком. Этот факт может быть связан с ритмом речи и гипотезой о том, что в то время как L1-L2 BP тяготеет к слогово-ритмическому полю ритмического континуума, L1-L2 английский смещается к акцентно-ритмическому полю21,22.
Локальное мерцание, Рисунок 6B, находится под влиянием SD-S и Varco-S. Что касается локального мерцания, то в произведениях Bra-S, L1-BP и L2-English наблюдается в некоторой степени монотонная траектория по мере увеличения вариабельности длительности слога (SD и Varco, см. Дополнительную таблицу S1). При прослушивании произношений Bra-S может быть заметно восприятие вокального усилия из-за низкой вариации в диапазоне от 8,5 до 9 dB. Речь Bra-S подвержена влиянию вокальной нагрузки. L1-BP в значительной степени зависит от длины предложения, будучи менее чувствительным к высоким вариациям длительности слога (ритмический паттерн BP демонстрирует меньшую слоговую вариацию22,56).
Частота пауз (Рисунок 6C) показывает, что носители английского языка как второго (L2-English) делают более длительные паузы (от 200 ms до 375 ms), чем носители английского языка как первого (L1-English), носители бразильского португальского (L1-BP) и носители португальского языка как второго (L2-BP) (среднее значение составило 30 ms для L1-English, 50 ms для L1-BP и 100 ms для L2-BP). В данном случае планирование речи могло повлиять на продукцию L2-English вследствие повышенной активности мозга54,57. Ожидается, что более высокий уровень владения языком приведет к увеличению скорости и объема чтения54; тем не менее, даже для опытных носителей L2 задачи по чтению требовали больших усилий в аспектах когнитивных функций высшего порядка при использовании иностранной речи и в процессах обработки языка54,57. Наши результаты показывают, по крайней мере, на предварительном этапе, что носители L2-BP могут быть подвержены влиянию пауз в меньшей степени, чем носители L2-English, из-за различий в ритмическом рисунке обоих языков.

Рисунок 6: Обобщенные аддитивные модели для просодико-акустических признаков. По оси Y отложена зависимая переменная (моделируемые акустические признаки); по оси X — предикторы (фактор «Language» и ковариаты в аддитивных моделях, которые определяют форму и траекторию кривых (т. е. сглаживающие эффекты: «Language + covariates»), а также произведение фактора «Language» и метрического признака, обеспечивающее более точную проекцию зависимой переменной (т. е. взаимодействия фактора и сглаживающей функции: «covariate:Language»). Сокращение: GAMs = обобщенные аддитивные модели. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Что касается метрик ритма, для SD-S (Рисунок 7A) наши результаты показывают, что чем сильнее говорящий варьирует кривую f0 и увеличивает темп речи, тем больше снижается SD-S для всех уровней владения языком (зеркальный эффект по сравнению с Рисунком 6A). В случае SD для согласных (SD-C, Рисунок 7C), носители L1-BP, в отличие от носителей L1 English, демонстрируют низкую вариативность при увеличении темпа речи или длительности пауз. Такое направление SD было ожидаемым, так как вариабельность длительности слога у L1-English (статистически) значимо выше, чем у L1-BP44,58. Varco-S (Рисунок 7B и Дополнительная таблица S1), по-видимому, в некоторой степени коррелирует с L1 и L2 одной языковой группы. При увеличении вариабельности f0 и темпа речи Varco-S снижается для L1-BP и, по всей видимости, снижается и ослабевает для L2-BP. Для англоязычных высказываний при увеличении вариабельности f0 и темпа речи Varco-S увеличивается и ослабевает для L1-English и L2-English.
Что касается стандартного отклонения для гласных или согласных (SD-V_C, Рисунок 7D и Дополнительная таблица S1), наши результаты демонстрируют определенное сходство с показателями Varco-S (Рисунок 7B). Например, более высокая скорость речи, длительность пауз и вариабельность f0 способствуют траектории падения-подъема SD-V_C для L1-BP и для L2-BP. В англоязычных образцах, несмотря на более высокие значения этих просодических признаков, SD-V_C немного снижается, затухает для L1-English, немного увеличивается, а затем затухает для L2-English. Корреляция Varco-S и SD-V_C с L1-L2 в одних и тех же языковых группах может быть частично объяснена эффектом Ломбарда, который заключается в изменении акустических параметров речи из-за фонового шума59.
При использовании иностранного языка, в зависимости от сложности задачи (например, чтение текста), говорящие применяли схожие акустические стратегии как в L1, так и в L259,60. С одной стороны, Marcoux и Ernestus обнаружили, что показатели f0 (диапазон и медиана) в эффекте Ломбарда для L2 указывают на влияние родного голландского языка (L1) на англоязычную речь L261,62. С другой стороны, более современные данные позволяют предположить, что, хотя и ожидается, что эффект Ломбарда в L2 будет отличаться от L1 из-за более высокой когнитивной нагрузки при использовании L2, англоязычные говорящие L2 воспроизводили эффект Ломбарда в том же направлении, что и англоязычные носители L163. Степень, в которой наши результаты согласуются с данными Marcoux и Ernestus63 и расходятся с выводами Waaning59, Villegas et al.60, а также Marcoux и Ernestus61,62, требует дальнейшего изучения.

Рисунок 7: Обобщенные аддитивные модели для метрических признаков. По оси Y — откликающаяся переменная (моделируемые метрические признаки); по оси X — предикторы (фактор «Language» и ковариаты в аддитивных моделях, которые определяют форму и траектории кривых (т. е. эффекты сглаживания: «Language + covariates»), а также произведение фактора «Language» и метрического признака, которое обеспечивает более точную проекцию откликающейся переменной (т. е. взаимодействия фактора и сглаживания: «covariate:Language»). Сокращение: GAMs = обобщенные аддитивные модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Результаты восприятия речи
Что касается наборов голосов BP, в наборе №1 (Рисунок 8A) голос-дистрактор №3 был определен как целевой голос. Фактически целевым был голос №4. Результаты не показывают статистически значимого различия (см. Дополнительную таблицу S1) между дистрактором №3 (83%) и целевым голосом №4 (71%). В наборе №2 (Рисунок 8B) сравнение целевого голоса №3 (40%) и дистрактора №4 (20%) также не выявило статистически значимого различия (см. Дополнительную таблицу S1) для наборов английской речи. В наборе №1 (Рисунок 9A) не было обнаружено значимого различия (см. Дополнительную таблицу S1) между дистрактором №2 (26%) и целевым голосом №4 (54%).
При анализе сходства голосов как косинусное сходство (CoSim), так и евклидово расстояние (EucDist, [EucDist трансформированное]54) показали стабильную корреляцию между дистрактором №3 и целевым объектом для BP-линейки №1 (CoSim = 0.99; EucDist = 77.4, [0.93]). Корреляция между дистрактором №4 и целевым объектом была аналогично высокой в BP-линейке №2 (CoSim = 0.99, EucDist = 76.3, [0.93]). В английской линейке №1 корреляция была стабильной для CoSim (0.83), но слабой или удовлетворительной для EucDist (213.0, [0.47]). В целом, и CoSim, и EucDist оказались удовлетворительными методами определения сходства голосов. Кроме того, CoSim работал несколько эффективнее, что было отмечено Gahman и Elangovan52 (см. Дополнительную таблицу S1).
Что именно с точки зрения сходства могло привести к увеличению числа ложных тревог? Просодико-акустические признаки показали, что, хотя дистракторы и целевые голоса различались (статистически) значимо — за исключением рядов, представленных на Рисунке 8A,B и Рисунке 9A — выбор слушателей в остальных рядах был несколько более разнообразен в зависимости от конкретных дистракторов (Рисунок 8C,D и Рисунок 9B-D). Подобное суждение, по-видимому, больше зависит от одной (или, возможно, нескольких) конкретных акустических особенностей, общих для говорящих, чем от всего класса просодико-акустических признаков. Например, в нашем исследовании было представлено несколько признаков, которые (со)варьировались между образцами речи; тем не менее, результаты перцептивного анализа демонстрируют предпочтение при выборе определенного дистрактора, соответствующего целевому голосу8,35,64,65. В будущих работах необходим дальнейший анализ.
Следует отметить, что в данном исследовании в качестве многомерной параметрической матрицы акустического сходства66 был выбран представленный вариант. Наши результаты согласуются с данными предыдущих исследований, в которых использовались акустические признаки на основе f0, VQ и интенсивности9,35. Такие признаки настоятельно рекомендуются для задач сравнения говорящих в криминалистике9,66. Тем не менее, важно подчеркнуть, что в настоящем исследовании ни один из дистракторов не был определен как сходный с целевым голосом, несмотря на то, что при подготовке голосовых линеек для распознавания говорящих с иностранным акцентом мы использовали вариант рекомендаций Макфарлейна16,17. Кроме того, необходимо подчеркнуть, что наша процедура формирования голосовой линейки имеет существенные отличия от рекомендаций Макфарлейна, включая длительность стимула, количество голосов, способ подбора дистракторов (в данном случае рандомизированный) и стиль речи.
То, в какой степени просодико-акустические признаки f0, качества голоса и интенсивности связаны с восприятием слушателей, будет в значительной степени зависеть от стиля речи, используемого в исследовании. В данной работе мы использовали чтение текстов. В большинстве исследований свидетельских показаний по голосу в качестве сбалансированного решения выбираются (полу)спонтанные стимулы — например, корпус DyVis67, который широко применяется в современных исследованиях в этой области28,68. Причиной выбора задач по чтению стало то, что наш корпус на момент написания данной рукописи состоял исключительно из данных, полученных при чтении. Тем не менее важно отметить, что процесс формирования (полу)спонтанного корпуса уже ведется. Кроме того, чтение истории может обеспечить надежный уровень единообразия и вариативности как внутри одного говорящего, так и между разными говорящими. Это облегчает акцентирование внимания на просодических или фонетических характеристиках — индивидуальных или диалектных — в ситуациях сравнения голосов. Это становится особенно заметным в случаях вокальной нагрузки при воспроизведении иностранного акцента, даже у опытных говорящих 8,9,23,54.

Рисунок 8: Столбчатые диаграммы с результатами четырех серий тестов, проведенных бразильскими слушателями. (A,B) Незначимое различие между целевым голосом (синим) и дистрактором (светло-синим). (C,D) Значимые различия между дистракторами и целевым голосом. Сокращение: NS = незначимо. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 9: Столбчатые диаграммы с результатами четырех серий тестов, проведенных американскими слушателями. (A) Несущественная разница между целевым голосом (красным) и дистрактором (розовым). (B,C,D) Значимые различия между дистракторами и целевым голосом. Сокращение: NS = несущественно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Дополнительная таблица S1: Статистика продукции речи — обобщенные аддитивные модели (GAM): F-статистика (степени свободы), скорректированный R2 для каждого статистически значимого просодико-акустического признака (Рисунок 6) и метрики ритма (Рисунок 7) для каждого языкового уровня, а также индивидуальные значения каждого сглаживающего члена (ковариаты). Статистика восприятия речи: χ2-статистика Краскела-Уоллиса (степени свободы), значения p и скорректированный η2, а также апостериорный тест Данна для попарного сравнения (Рисунок 8 и Рисунок 9) каждой статистически незначимой разницы между парами целевых и фоновых голосов (Рисунок 8A,B и Рисунок 9A). Матрицы акустического сходства для косинусного и евклидова расстояний для каждой выборки. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.