$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Результаты для производства речи
В этом разделе мы описали производительность статистически значимых просодических акустических особенностей и ритмических метрик. Такими просодическими особенностями были речь, артикуляция и паузы, которые связаны с продолжительностью, и мерцание, которое связано с качеством голоса. Метрики ритма представляли собой стандартное отклонение (SD) длительности слога, SD согласного, SD вокальной или согласной длительности и коэффициент вариации длительности слога (см. дополнительную таблицу S1).
Скорость речи (Рисунок 6A) снижается быстрее для L1-L2 English, чем для L1-L2 BP, хотя скорость ниже для обоих L2. Темп речи связан с тремя метриками - SD длительности слога (SD-S), SD гласных (SD-V) и коэффициентом силлабической вариации (Varco-S). Также важно иметь в виду, что и AmE-S, и группа Bra-S хорошо владеют своими L2. По-видимому, на такую скорость влияют более высокие значения длительности слогов и меньшая вариабельность, производимая L1-L2 BP, что приводит к менее крутым склонам.
Коэффициент артикуляции (Рисунок 6D) связан с SD-S, Varco-S, а также с слоговым ритмическим соотношением (RR-S); последнее представляет собой соотношение между короткими и длинными слогами. Такие метрики, по-видимому, влияют на частоту артикуляции так же, как и затронутая скорость речи из-за длины предложения и вариации длительности, что приводит к более высокому планированию речи L2, а когнитивная нагрузка L29,23,54. В области длины предложения может потребоваться более высокая когнитивно-лингвистическая нагрузка таким образом, что это повлияет на просодические акустические параметры55.
Что касается просодических акустических особенностей скорости речи и артикуляции, наши результаты показывают, что чем больше говорящий варьирует длительность слогов (и гласных), тем ниже такие показатели. Мы предполагаем, что восприятие речи как L1, так и L2 BP звучит несколько медленнее, чем L1 и L2-английский, и что L1-английский звучит быстрее, чем все остальные языковые уровни. Этот факт может быть связан с ритмом речи и гипотезой о том, что в то время как L1-L2 BP склоняется к слоговому полюсу ритмического континуума, L1-L2 английский движется к ударно-временному полюсу21,22.
Местное мерцание, Рисунок 6B, находится под влиянием SD-S и Varco-S. Для местного мерцания оба произведения Bra-S, L1-BP и L2-English представляют собой несколько монотонную траекторию по мере увеличения вариативности длительности слогов (SD и Varco, см. Дополнительную таблицу S1). Восприятие вокального усилия может быть очевидным при прослушивании продукции Bra-S из-за низкой вариации, которая колеблется от 8,5 до 9 дБ. На речь Bra-S влияет голосовая нагрузка. L1-BP сильно зависит от длины предложения, будучи менее чувствительным к большим вариациям длительности слогов (ритмический рисунок BP показывает меньше силлабических вариаций22,56).
Частота пауз (Рисунок 6C) показывает, что носители L2-английского создают более длительные паузы (от 200 мс до 375 мс), чем носители L1-английского, L1-BP и L2-BP (в среднем 30 мс для L1-английского, 50 мс для L1-BP и 100 мс для L2-BP). Планирование речи, в этом случае, могло повлиять на производство L2-английского из-за повышенной активности мозга54,57. Ожидается, что более высокий уровень владения языком приведет к увеличению скорости чтения и span54; тем не менее, даже для владеющих языком L2 задания на чтение требовали больше усилий в когнитивных аспектах иностранной речи более высокого порядка и в обработке языка54,57. Наши результаты показывают, по крайней мере, на предварительной основе, что носители L2-BP могут быть менее подвержены влиянию пауз, чем L2-английский, из-за различий в ритмическом рисунке обоих языков.

Рисунок 6: Обобщенные аддитивные модели для просодических и акустических характеристик. По оси Y — переменная отклика (акустические особенности, подлежащие моделированию); на оси X — переменные-предикторы (фактор «Язык» и ковариаты в аддитивных моделях, которые будут обеспечивать форму и траектории кривых (т. е. эффекты сглаживания: «Язык + ковариаты»), а также произведение «Язык» и метрический признак, который обеспечит более точную проекцию переменной отклика (т. е. факторно-гладкие взаимодействия: 'covariate:Language'). Сокращение: GAMs = обобщенные аддитивные модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Что касается метрик ритма, для SD-S (Рисунок 7A), наши результаты показывают, что чем больше говорящий изменяет кривую f0 и увеличивает скорость речи, тем больше снижается SD-S для всех языковых уровней (зеркальный эффект Рисунок 6A). В случае SD для согласных (SD-C, Рисунок 7C), L1-BP, в отличие от L1 английского, выполняет низкую вариацию по мере увеличения скорости речи или длительности паузы. Такое направление SD прогнозируется, так как вариативность длительности слогов L1-English (статистически) значительно выше, чем у L1-BP44,58. Varco-S (Рисунок 7B и Дополнительная таблица S1) кажется в некоторой степени коррелированным с L1 и L2 одной и той же языковой группы. По мере увеличения вариабельности f0 и скорости речи, Varco-S уменьшается для L1-BP и, по-видимому, уменьшается и ослабевает для L2-BP. Для англоязычной продукции, в то время как вариативность f0 и скорость речи увеличиваются, Varco-S увеличивается и ослабевает для L1-английского и L2-английского.
Что касается SD для гласных или согласных (SD-V_C, Рисунок 7D и дополнительная таблица S1), наши результаты показывают некоторое сходство с производительностью Varco-S (Рисунок 7B). Например, более высокая скорость речи, продолжительность паузы и вариабельность f0 способствуют траектории падения-подъема SD-V_C для L1-BP и для L2-BP. В англоязычных произведениях, в то время как такие просодические особенности выше, SD-V_C немного уменьшается, ослабевает для L1-английского, немного увеличивается, а затем ослабевает для L2-английского. Корреляция Varco-S и SD-V_C с L1-L2 одних и тех же языковых групп может быть частично объяснена эффектом Ломбарда, который относится к изменению акустических параметров речи из-за фонового шума59.
В иностранной речи, в зависимости от сложности задачи (например, чтение речи), говорящие использовали похожие акустические стратегии как на L1, так и на L259,60. С одной стороны, Марку и Эрнестус обнаружили, что меры f0 (диапазон и медиана) в речи L2 на ломбардском языке предполагают, что на носителей английского языка L2 повлияло их L1 голландское ="xrefsup class="xref">62. С другой стороны, более поздние результаты показывают, что, хотя ожидается, что ломбардская речь L2 будет отличаться от ломбардской речи L1 из-за более высокой когнитивной нагрузки при говорении на L2, носители английского языка L2 воспроизводили ломбардскую речь в том же направлении, что и носители английского языка L1 63. Степень, в которой наши выводы согласуются с Marcoux и Ernestus63 и расходятся с Waaning59, Villegas et al.60, и Marcoux and Ernestus61,62, требует дальнейшего изучения.

Рисунок 7: Обобщенные аддитивные модели для метрических признаков. По оси Y — переменная отклика (метрики, подлежащие моделированию); на оси X — переменные-предикторы (фактор «Язык» и ковариаты в аддитивных моделях, которые будут обеспечивать форму и траектории кривых (т. е. эффекты сглаживания: «Язык + ковариаты»), а также произведение «Язык» и метрический признак, который обеспечит более точную проекцию переменной отклика (т. е. факторно-гладкие взаимодействия: 'covariate:Language'). Сокращение: GAMs = обобщенные аддитивные модели. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Результаты для восприятия речи
Что касается голосовых составов BP, то в линейке #1 (Рисунок 8A), фольгированный голос #3 был оценен как целевой голос. На самом деле, целевой голос был голосом #4. Результаты не показывают статистически значимой разницы (см. Дополнительную таблицу S1) между фольгой #3 (83%) и целевым голосом #4 (71%). В линейке #2 (Рисунок 8B) сравнение между целевым голосом #3 (40%) и фольгой #4 (20%) также не показало статистически значимой разницы (см. Дополнительную таблицу S1) для английских голосовых составов. В линейке #1 (Рисунок 9A) не было существенной разницы (см. Дополнительную таблицу S1) между фольгой #2 (26%) и целевым голосом #4 (54%).
При анализе сходства голосов как косинусное сходство (CoSim), так и евклидово расстояние (EucDist, [EucDist transformed]54) показали устойчивую корреляцию между фольгой #3 и целью для линейки BP #1 (CoSim = 0.99; EucDist = 77,4, [0,93]). Корреляция между фольгой #4 и мишенью была столь же сильна в линейке BP #2 (CoSim = 0,99, EucDist = 76,3, [0,93]). В английской линейке #1 корреляция была стабильной для CoSim (0,83(, но слабой или удовлетворительной для EucDist (213,0, [0,47]. В целом, и CoSim, и EucDist были удовлетворительными методами определения сходства голосов. Кроме того, CoSim работал немного эффективнее, о чем свидетельствуют Gahman и Elangovan52 (см. Дополнительную таблицу S1).
С точки зрения сходства, что могло привести к увеличению количества ложных срабатываний? Просодические акустические особенности показали, что, хотя фольгированные и целевые голоса работали (статистически) значительно по-разному - за исключением составов, представленных в Рисунок 8A,B и Рисунок 9A - выбор слушателей несколько диверсифицировался по разным фольгированным типам в других составах (Рисунок 8C,D, и Рисунок 9B-Г). Такое суждение, по-видимому, больше зависит от одной (или, может быть, нескольких) специфических акустических особенностей, общих для акустических носителей, чем от целого класса просодических акустических особенностей. Например, в нашем исследовании было представлено несколько особенностей, (со)варьирующихся между производствами; Тем не менее, перцептивные результаты показывают предпочтения суждений в отношении конкретного фольги, чтобы она соответствовала целевому голосовому классу8,35,64,65. В будущей работе необходимы дальнейшие анализы.
Стоит рассмотреть выбор многомерной параметрической матрицы для акустического сходства66 как представленный в этом исследовании. Наши результаты согласуются с предыдущими исследованиями, в которых использовались акустические характеристики на основе f0, VQ и intensity9,35. Такие функции замечательно рекомендуются для задач сравнения говорящих в криминалистической области9,66. Тем не менее, важно подчеркнуть, что в настоящем исследовании ни один из вариантов не был похож на целевой голос, хотя мы использовали вариант рекомендаций Макфарлейна16,17 при подготовке голосовых рядов для распознавания говорящих с иностранным акцентом. Кроме того, мы должны подчеркнуть, что наша процедура выстраивания голоса имеет важные отличия от рекомендаций Макфарлейна, включая длину стимула, количество голосов, выбор фольги (рандомизированный здесь) и стиль речи.
В какой степени просодечно-акустические особенности f0, качество и интенсивность голоса, по-видимому, связаны с восприятием слушателей, сильно зависит от стиля речи, используемого в исследовании. Здесь мы использовали чтение отрывков. Большинство исследований свидетелей используют (полу-) спонтанные стимулы в качестве сбалансированного решения - например, класс DyVis corpus67-, который широко используется в современных исследованиях свидетелей28,68. Причина, побудившая нас выбрать задания на чтение, заключается в том, что наш корпус на момент написания этой рукописи состоял исключительно из данных, полученных из заданий на чтение. Тем не менее, важно признать, что процесс составления (полу-) спонтанного корпуса уже идет. Кроме того, акт чтения рассказа может создать надежный уровень единообразия и вариативности, как внутри говорящего, так и между говорящим. Это облегчает акцент на просодических или фонетических характеристиках — индивидуальных или диалектных — в ситуациях, связанных со сравнением голоса. Это становится особенно заметным в случаях вокальной нагрузки во время произнесения иностранного акцента, даже среди опытных носителей 8,9,23,54.

Рисунок 8: Гистограммы, содержащие результаты для четырех составов, выполненные бразильскими слушателями. (А,Б) Незначительная разница между голосом цели (синим цветом) и фольгой (голубым цветом). (C,D) существенные отличия от фольги и целевого голоса. Сокращение: NS = незначащий. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 9: Гистограммы, содержащие результаты для четырех составов, выполненные американскими слушателями. (A) Незначительная разница между целевым голосом (красным) и фольгой (розовым). (Б,В,Г) Существенные отличия от фольги и целевого голоса. Сокращение: NS = незначащий. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Дополнительная таблица S1: Статистика производства речи - Обобщенные аддитивные модели (GAM): F-статистика (степени свободы), скорректированное R2 каждого статистически значимого просодно-акустического признака (Рисунок 6) и метрика ритма (Рисунок 7) для уровня языка, а также индивидуальные значения каждого гладкого члена (ковариаты). Статистика восприятия речи: Статистика Крускалла-Уоллиса χ2 (степени свободы), p-значения и скорректированный η2, а также апостериорный тест Данна для попарного сравнения (Рисунок 8 и Рисунок 9) каждой статистически незначимой разницы между парами голосов с мишенью-фольгой (Рисунок 8A,B и Рисунок 9A). Матрицы акустического подобия для косинуса и евклидова расстояния каждой линейки. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.