方法文章

外国口音与语音列队中的法医语音识别:基于韵律的声学特征的影响

DOI:

10.3791/66313

2024年9月27日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究旨在比较从母语到第二语言的英语与从母语到第二语言的葡萄牙语,以检验外国口音在各项指标、韵律-声学参数以及在语音列队中选择目标声音时所产生的影响程度。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究旨在考察外语口音英语和外语口音巴西葡萄牙语的韵律-声学特征及其感知相关性,并分析说话人产出的外语与母语口音与其听者感知之间的关联。在方法部分,我们对一组以巴西葡萄牙语为第二语言的美国说话人和一组以英语为第二语言的巴西说话人进行了言语产出实验,同时开展了言语感知实验,针对两种语言分别实施了语音列队识别测试。在言语产出的统计分析中,我们采用广义加性模型(Generalized Additive Models),在控制对立类别(韵律或声学-韵律)协变量平滑效应的前提下,评估语言组别对每一类特征的影响。在言语感知的统计分析中,我们采用Kruskal-Wallis检验及事后Dunn检验,评估语音列队中不同声音对听者评分结果的影响。此外,我们还基于余弦距离和欧氏距离进行了声学(语音)相似性检验。结果显示,不同语言组在基频(f0)变异度、时长和嗓音质量方面存在显著的声学差异。在语音列队测试中,结果表明基频(f0)、强度和嗓音质量等韵律特征与听者的感知判断存在相关性。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

口音是语言交流和流利表达中一个显著且动态的方面,无论是在母语(L1)还是在第二语言(L2)中均如此1外国口音 指的是第二语言学习者在目标语言中表现出的语音特征,它会随着说话者的第二语言经验、说话风格、输入质量、接触程度以及其他变量而发生变化(随时间推移)。外国口音可以被量化为外国说话者产出的第二语言语音与目标语言的本地或标准口音之间差异程度(标量)的度量2,3,4,5

本研究旨在考察外国口音英语和外国口音巴西葡萄牙语(BP)的韵律-声学特征及其感知相关性,并检验说话人产出的外语口音与母语口音在多大程度上与听者的感知相关联。法医学领域的前期研究表明,元音和辅音在外国口音识别中具有较强的稳定性,这种稳定性要么体现在对个体进行长期分析时的稳定性(The Lo Case6),要么体现在说话人身份识别的高准确率上(The Lindbergh Case7)。然而,基于时长、基频(f0,即音高的声学对应参数)、强度以及嗓音质量(VQ)的韵律-声学特征研究正受到越来越多的关注8,9。因此,本研究选择韵律-声学特征作为分析对象,代表了法医语音学领域一个具有前景的研究方向8,10,11,12,13

目前的研究得到了法医学领域关于外国口音作为声音伪装形式的相关研究的支持14,15,同时也得到了用于准备语音辨认听辨列队研究的支持16,17。例如,语速在识别以英语为第二语言的德国、意大利、日本和巴西说话者方面发挥了重要作用18,19,20,21,22。除了语速之外,长期频谱特征和基频(f0)特征也对熟悉目标语言的第二语言熟练使用者构成挑战,因为其大脑和认知基础在记忆、注意力和情绪方面存在不足,这些因素会在说话者进行较长语段表达时反映在语音表现上23。法医学领域对外国口音的看法是,某种语音是否真正听起来像外国口音,在很大程度上取决于听者的陌生感,而非说话者本身具有从无到极端程度的外国口音特征24

在感知领域,自20世纪90年代中期以来,一种常用于识别罪犯的法庭科学工具是语音列队(听觉识别),其原理类似于通过视觉识别在犯罪现场辨认作案人16,25。在语音列队中,嫌疑人的声音会与若干干扰声音(foils)一同呈现,这些干扰声音在社会语言学特征方面(如年龄、性别、地理位置、方言和文化背景)与嫌疑人相似,供听觉证人进行辨认。语音列队的成功与否取决于语音样本的数量及每段样本的持续时间25,26。此外,对于真实场景中的语音样本,音频质量被普遍认为会持续影响语音识别的准确性。低质量的音频可能扭曲声音的独特特征27。当语音相似时,基于基频(f0)的细微语音细节可能在语音识别过程中使听者产生混淆28,29。此类声学特征不仅限于f0,还包括时长、强度谱特征以及声门波形(VQ)等要素30。这种多维度韵律特征的观点在法庭语音比对中至关重要,有助于确保说话人识别的准确性9,14,15,29,31

总之,近几十年来,法医语音学在外国口音识别方面的研究显示出一些差异。一方面,外国口音似乎并不影响说话人识别的过程32,33(特别是当听者不熟悉目标外国口音时34)。另一方面,也有研究得出了相反的结果12,34,35

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究已获得人类研究伦理委员会的批准。此外,所有参与本研究的受试者均已签署知情同意书,同意使用并发表其数据。

1. 言语产生

注意:我们通过朗读任务采集了“以英语为第一语言、巴西葡萄牙语为第二语言”的受试者产出的言语数据 第1组:该 安培erican E英语(美国) S扬声器(AmE-S),以及由“L1 BP-L2 英语”产生的两者 第2组:该 文胸自连 S扬声器(Bra-S)。参见 图1 用于言语产生的流程图。

数据上传界面;序列分析工作流程;步骤:文件上传、处理、结果。
图1:言语产生的示意图流程图。 请点击此处查看此图的放大版本。

  1. 参与者
    1. 确定 参与者人数,the 语言 (L1 英语,L2 葡萄牙语;L1 葡萄牙语,L2 英语), 性别 (女性或男性),该 年龄 (均值,标准差),该 群体特征 (专业人士或本科生),以及 L2 熟练程度水平 (高级或较高级)每个组别。
      注意:在本研究中,美式英语-熟练者(AmE-S)和巴西葡萄牙语-熟练者(Bra-S)均被视为第二语言熟练者(两组均达到 B2-C1 水平)36)。AmE-S组在实验进行时已在巴西居住两年。Bra-S组在实验进行时已在美国居住超过两年。在海外居住期间,两组受试者每周至少有6天为学习和工作目的使用其第二语言(L2),每天约4至5小时。
    2. 将参与者分配至安静舒适的房间,并向各组展示阅读材料。
  2. 数据采集
    注意:必须通过以下语言的朗读任务收集言语数据:L1-英语和L2-巴西葡萄牙语;L1-巴西葡萄牙语和L2-英语。如有必要,可让参与者事先阅读文本。
    1. 记录程序
      1. 在声学条件适宜的安静环境中记录语音数据。
      2. 使用数字录音设备(参见 材料表)37 以及一个单向电磁隔离心形指向性麦克风(参见 材料表)38.
      3. 记录音频数据至“.wav形式。
      4. 将采样率设置为 48 kHz,量化率为 16 位。
        注意:步骤 1.2.1.3 和 1.2.1.4 中所述的音频格式以及采样和量化率的配置,旨在确保高质量并降低噪声,以保留用于后续声学分析的频谱特征。
  3. 声学分析
    注意:将声学分析流程分为三个步骤:强制对齐、重对齐和声学特征提取。
    1. 编写语言转录(在“.txt每个音频文件的“文件”)
    2. 标记这对.txt'/'.wav' 文件名相同的文件(例如,'my_file.'/ 'my_file.txt').
      注意:为了提高第 1.3.7 节所述操作步骤的性能,强烈建议“.txt/.wav”文件标签的前三个字符代表 语言, 方言,或 口音,而第四到第六个字符表示 性别 例如, EL1FEM 用于 E英语 L1 雌性ale)。从第七个字符开始,用户应标明说话者编号(例如, 001 对于第一位说话者)。因此,第一个“txt/wav”配对是 EL1FEM001.
    3. 为每种L1-L2语言创建一个文件夹。
      注意:一个用于 L1-L2 英语的文件夹和一个用于 L1-L2 BP 的文件夹。
    4. 确认所有相同语言的文件对均位于同一文件夹中。
    5. 进行强制对齐。
      1. 访问慕尼黑自动分割(Munich Automatic Segmentation,MAUS)强制对齐工具的网页界面网络MAUS39 在 https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/Pipeline 处
      2. 拖放每一对。wav / .txt 将文件从文件夹拖动到虚线矩形中 文件 (或点击矩形区域内) 图2A).
      3. 点击 上传 按钮以将文件上传至比对工具中(参见图中红色箭头所示) 图2A).
      4. 选择以下选项 服务选项 菜单 (图2B): G2P-MAUS-PHO2SYL 用于 流程名称;英语(美国) (用于 语言)如果 L1-L2 英语数据; 意大利语(IT) (用于 语言)如果 L1-L2 脑电数据.
        注意:我们为巴西葡萄牙语(BP)数据选择了“意大利语”,因为 webMAUS 未提供用于 BP 强制对齐的预训练声学模型。语音学文献指出,意大利语的音系具有一个对称的七元音系统,与巴西葡萄牙语的元音系统在某种程度上具有可比性。40以及辅音声学特征的相似性41,42.
      5. 保留“输出格式”和“保留所有内容”的默认选项。
      6. 检查 运行 接受使用条款的选项框(见绿色箭头所示) 图2C).
      7. 点击 运行网络服务 单击按钮以在比对工具中运行已上传的文件。
        注意:对于每个音频文件,MAUS 强制对齐工具会返回一个 Praat 文本网格 一个Praat预格式化的“.txt”文件,其中包含基于从1.3.1步骤所述“.txt”文件中提取的语言转录信息对词语、音系音节和音素进行的标注。
      8. 点击 下载为 ZIP 文件 下载 TextGrid 文件的按钮,可将文件打包为压缩文件图2C).
        注意:请确保将压缩的 TextGrid 文件下载到与音频文件相同的文件夹中。
      9. 提取TextGrid文件,以供后续在语音分析软件中重新对齐43.
    6. 进行重新比对。
      1. 获取并下载 Praat VVUnitAligner 的脚本44 来自 https://github.com/leonidasjr/VVunitAlignerCode_webMAUS/blob/main/VVunitAligner.praat
      2. 确认所有相同语言的文件对以及 VVUnitAligner 脚本位于同一文件夹中。
        注意:一个文件夹用于存放 L1-L2 英文文件和 VVunitAligner,另一个文件夹用于存放 L1-L2 BP 文件和 VVunitAligner。
      3. 打开语音分析软件。
      4. 点击 Praat | 打开 Praat 脚本… 从脚本调用 对象窗口.
      5. 点击 运行 按钮一次。
        注意:一种称为 音素音节对齐 包含使用该脚本设置的窗口将弹出在屏幕上(图3A).
      6. 点击 语言 按钮以选择“英语(美国)”、“葡萄牙语(巴西)”、“法语(法国)”或“西班牙语(西班牙)”语言。
      7. 点击 片段分割 按钮以选择“自动”、“强制(手动)”或“无”分割程序。
      8. 检查 保存 TextGrid 文件 自动保存新 TextGrid 文件的选项。
      9. 点击 好的 | 运行 用于从步骤 1.3.5.7 重新对齐音素单元的按钮。
        注意:对于每个音频文件,VVUnitAligner 将为第 1.3.7 节生成一个新的 TextGrid 文件图3B).
    7. 进行声学特征的自动提取。
      1. 获取并下载脚本 SpeechRhythmExtractor45 来自 https://github.com/leonidasjr/SpeechRhythmCode/blob/main/SpeechRhythmExtractor.praat,用于自动提取韵律-声学特征。
      2. 创建一个新文件夹,并将 SpeechRhythmExtractor 以及所有语言的音频/TextGrid 文件对放入该文件夹中。
      3. 打开语音分析软件。
      4. 点击 Praat | 打开 Praat 脚本… 从脚本调用 对象窗口.
      5. 点击 运行 仅按下按钮一次。
        注意:屏幕上将弹出一个包含脚本设置的表单。在输出的“.txt”文件名输入框中,相应地重命名文件,或保留默认文件名。
      6. 检查 嗓音质量参数 保存的选项 输出文件 VQ 音质图3C).
        注意:此第二个输出文件(该 输出文件 VQ) 包含了1之间的差异参数st 以及第2个nd 谐波(H1-H2)和倒频谱显著峰(CPP)9.
      7. 检查 语言目标 可从“语言”、“方言”或“口音”标签中进行选择图3C).
      8. 检查 单位 选择以赫兹(Hz)或半音(Semitones)为单位的 f0 特征图3C).
      9. 设置以下数值 F0 阈值,基频的最小值和最大值阈值(图3C).
        注意:除非研究有特定目的或预设了特定音频特征,强烈建议将步骤 1.3.7.9 的参数保留为默认值。
      10. 点击 好的 | 运行 用于声学特征的自动提取。
        注意:该脚本 语音节奏提取器 返回一个以制表符分隔的“.txt”文件(输出文件/输出文件 VQ) 包含从说话人提取的声学特征。
  4. 统计分析
    1. 将包含声学特征的电子表格上传至 R46 环境(或任何选定的统计软件/环境)。
    2. 执行广义可加模型(GAMs)非参数统计分析。
      1. 在 R 中执行 GAM
      2. 输入以下命令并按下 输入.
        library(mgcv)
        模型 = gam(公式 韵律/声学特征 在分析中 ~ 这一 语言 + s(所选的 计量特征,由 = the 语言) + 其他 韵律/声学特征,数据 = the 数据框)
        注意:我们选择使用 R 编程语言来执行本方案的统计检验,因为 R 在学术界的语音学家(及语言学家)中日益流行。R 已被广泛应用于语音学田野调查研究中47请注意,步骤 1.4.2.2 包含一段伪代码。请根据研究变量编写代码。

音位音节对齐图示;波形图、语谱图、文本网格;语音分析流程。
图 2:使用 MAUS 强制对齐工具进行音位对齐的截图。A)虚线矩形区域用于拖放 'my_file.wav' / 'my_file.txt' 文件,或点击内部以从文件夹中搜索此类文件;上传按钮由红色箭头指示。(B)来自面板 A 的已上传文件(见蓝色箭头)、将要使用的处理流程、文件对的语言、返回的文件格式,以及用于保留所有文件的“真/假”按钮。(C)使用条款的复选框(见绿色箭头)、运行网络服务 按钮,以及结果(可供下载的 TextGrid 文件)。请点击此处查看此图的放大版本。

语音数据分析示意图:强制对齐、韵律提取、统计分析过程。
图3:重新对齐过程的截图。A)重新对齐过程的输入设置表单。(B)部分波形图、宽带语谱图(含基频 f0 的蓝色轮廓线),以及六个已分段(并标注)的层级:第1层:从元音起始点到下一个元音起始点的单位(V_to_V);元音起始点(V_to_V);第2层:元音(V)、辅音(C)和停顿(#)的单位;第3层:V_to_V 的语音表征;第4层:文本中的部分词语;第5层:文本中部分语音语块(CH);第6层:音调层,包含由一名美式英语女性说话人产生的每个语音语块的最高(H)和最低(L)音调。(C)声学特征自动提取的输入设置。请点击此处查看该图的放大版本。

2. 语音感知

注意:我们使用美国听者进行了四次英语语音列队辨认实验,并使用巴西听者进行了四次巴西葡萄牙语(BP)语音列队辨认实验。语音感知实验流程图见图4

AmE-L组和Bra-L组的语音列阵示意图;共4组列阵,每组包含6个语音片段。
图4:言语感知的示意图流程图。 请点击此处查看此图的放大版本。

  1. 参与者
    1. 为每组选择与参与言语产生实验方案的受试者不同的新受试者。
      注意:本部分实验方案选择了两组参与者: 第1组:该 上午erican E英语(美国) L听者(AmE-L),以及 第2组:该 文胸zilian L听者(Bra-L)。在本研究中,美式英语听者(AmE-L)和巴西听者(Bra-L)均被视为第二语言熟练者(两组均被评定为B2-C1水平)36 AmE-L 在实验进行时已在巴西生活了两年。Bra-L 在实验进行时已在美国生活了两年以上。在海外居住期间,两组均因学习和工作需要使用其第二语言(每周至少六天,每天约4至5小时)。
    2. 确定 参与者人数,该 语言 (第一语言为英语,第二语言为葡萄牙语;第一语言为葡萄牙语,第二语言为英语) 性别 (女性或男性),该 年龄 (均值,标准差),该 群体特征 (专业人士或本科生)以及 L2 熟练水平 每组
  2. 语音列队
    注意:将语音列队的程序分为两个不同步骤:准备语音列队和实施语音列队。
    1. 为英语准备四个语音列队,为BP准备四个语音列队。
      1. 从第1节“言语产生”的讲话者处获取音频文件。
      2. 确认每种语言因素的音频文件均存放在独立的文件夹中。
      3. 随机选择六段以英语为第一语言或以巴西葡萄牙语为第一语言的语音片段。
        注意:列队中的六个声音代表 一个目标声音五片箔片.
      4. 从步骤 2.2.1.3 中包含的说话人中选择一个第二语言英语或第二语言巴西葡萄牙语的语音片段。
        注意:步骤 2.2.1.4 中的语音片段是 参考声音片段时长必须约为 20 秒。
      5. 获取并下载 Praat 创建队列的脚本48 来自 https://github.com/pabarbosa/prosody-scripts-CreateLineUp。
      6. 确认在运行 CreateLineup 脚本之前,L2 参考语音、L1 诱饵语音和 L1 目标语音均位于同一文件夹中图5).
      7. 打开语音分析软件。
      8. 对象窗口,点击 Praat | 打开 Praat 脚本… 调用脚本。
      9. 点击 运行 | 运行.
        注意:该脚本返回的文件顺序如下:(L2参考语音)+(L1目标语音及干扰项随机分布)图5).
    2. 进行语音列队测试
      1. 创建一个在线空间,以在任意选定平台(例如 SurveyMonkey。参见 材料表用于远程进行语音列队辨认。
      2. 访问在线空间链接。
      3. 将 CreateLineup 脚本生成的文件上传至平台。
      4. 在参与者之前运行该程序,以测试每一步骤。
        注意:建议预先访问链接并运行队列,以检查所有内容是否正常运行。
  3. 统计分析
    1. 将包含听者评分结果的电子表格上传至 R 环境(或其他选定的统计软件/环境)。
      1. 在 R 中执行 Kruskal-Wallis 检验。
      2. 输入以下命令并按下 输入.
        model = kruskal.test(判断 ~ 每个 声音列队辨认,数据 = 该 数据框)
    2. 进行事后Dunn检验。
      1. 在 R 中执行 Dunn 检验。
      2. 输入以下命令并按下 进入.
        library(FSA)
        model = dunnTest(判断 ~ 每个 声音列队辨认,data = data,method = "bonferroni"
        注意:步骤 2.3.1.2 和 2.3.2.2 中的代码为伪代码(参见注意 1.4.2.2)。
  4. 声学相似性分析
    1. 选择在目标与任一干扰项之间无显著差异的队列(参见步骤 2.2.1.3 中的注)。
    2. 重复执行步骤 1.3.1 至 1.3.7.5,以及步骤 1.3.7.8 至 1.3.7.10 的操作。
    3. 获取并下载 Python 脚本49,声学相似性_余弦_欧几里得50 来自 https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py。
      注意:该脚本返回三个矩阵(格式为“.txt”和“.csv”):一个用于余弦相似性51,52,一个用于欧几里得距离52,53以及针对转换后的欧氏距离值的分析,并对目标声音与每个干扰项进行成对比较。
    4. 确认脚本已下载至与阵容数据集相同的文件夹中。
    5. 点击 打开文件… 调用脚本的按钮。
    6. 点击 运行 | 不调试运行 按钮。
      注意:第二个 运行 按钮可能被标记为 运行或不调试运行 运行脚本。 它们都执行相同的命令,仅取决于所使用的 Python 环境。
    7. 基于声学特征进行声音相似性测试。
      注意:余弦相似度(或余弦距离)是一种应用于人工智能(AI)中的技术,尤其用于自动语音识别(ASR)系统的机器学习。该指标的取值范围为0到1,用于衡量相似性。余弦相似度接近1表示两种声音非常可能相似;接近0则表示声音非常可能不相似。52欧几里得距离,常被称为欧几里得相似度,也广泛应用于人工智能、机器学习和自动语音识别(ASR)中。它表示在欧几里得空间中两点之间的直线距离。53即点之间的距离越近(距离值越小),声音越相似。为了更清晰地理解两种技术的报告结果,我们将欧氏距离的原始得分转换为从0(声音相似性最低)到1(声音相似性最高)的数值。54.

语音识别实验流程图,包含统计分析和声学相似性测试。
图5:言语感知实验的目录设置。 队列文件夹。每个文件夹包含六种母语者(L1)语音、一种非母语目标语音(L2)、“CreateLineup”脚本以及运行脚本后生成的语音队列音频文件。请点击此处查看该图的放大版本。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

言语产生的结果
在本部分中,我们描述了具有统计学意义的韵律-声学特征和节奏性指标的表现。这些韵律特征包括与持续时间相关的言语速率、发音速率和停顿速率,以及与声音质量相关的微扰(shimmer)。节奏性指标包括音节时长的标准差(SD)、辅音时长的标准差、元音或辅音时长的标准差,以及音节时长的变异系数(参见补充表 S1)。

语速 (图6AL1-L2英语的下降速度比L1-L2 BP更快,尽管两种第二语言的下降速率均较低。 语速 与三个指标相关——音节持续时间的标准差(SD)SD-S),元音的标准差(SD)SD-V)以及音节变异系数(Varco-S)。还需要注意的是,AmE-S组和Bra-S组在各自的第二语言(L2)上均具有较高的熟练度。这种速率似乎受到音节时长较高值以及L1-L2巴西葡萄牙语(BP)产生的较低变异性的影响,从而导致较平缓的斜率。

发音速率图6D)与SD-SVarco-S以及音节节奏比(RR-S)相关;后者表示较短音节与较长音节之间的比率。这些指标似乎会影响发音速率,就如同句子长度和时长变化会影响语速一样,导致更高的第二语言言语规划需求和第二语言认知负荷9,23,54。在句子长度领域,可能需要更高的认知-语言负荷,从而影响韵律-声学参数55

关于语速发音速率的韵律-声学特征,我们的研究结果表明,说话者对音节(及元音)时长的变化程度越大,其语速和发音速率就越低。我们推测,母语及二语巴西葡萄牙语(BP)的言语感知速度似乎比母语及二语英语更慢,而母语英语则比其他所有语言水平听起来更快。这一现象可能与言语节奏有关,并支持如下假设:母语及二语巴西葡萄牙语倾向于节奏连续体中的“音节定时”一端,而母语及二语英语则趋向于“重音定时”一端21,22

局部闪烁度(Local shimmer图6B)受 SD-SVarco-S 的影响。对于 Local shimmer,Bra-S、L1-BP 和 L2-English 的发音在音节时长变异性增加(SD 和 Varco,见补充表 S1)时均呈现出一定程度的单调变化趋势。由于 Bra-S 发音的变异程度较低,范围在 8.5 至 9 dB 之间,因此在聆听时可能明显感知到发声费力。Bra-S 的言语受到发声负荷的影响。L1-BP 受句子长度影响较大,对音节时长的高变异性较不敏感(巴西葡萄牙语的节奏模式表现出较少的音节变异22,56)。

停顿率图 6C)显示,以英语为第二语言(L2-English)的说话者产生的停顿时间更长(从 200 毫秒到 375 毫秒),而以英语为母语(L1-English)、以巴西葡萄牙语为母语(L1-BP)以及以巴西葡萄牙语为第二语言(L2-BP)的说话者停顿时间较短(L1-English 平均为 30 毫秒,L1-BP 为 50 毫秒,L2-BP 为 100 毫秒)。在此情况下,言语规划可能因大脑活动增加而影响了L2-English的言语产出54,57。通常认为,更高的语言熟练度会带来更快的阅读速度和更广的阅读跨度54;然而,即使对于第二语言熟练的说话者而言,阅读任务在高阶认知层面和语言处理方面仍表现出更大的认知负荷54,57。我们的研究结果至少在初步层面上表明,由于两种语言在节奏模式上的差异,L2-BP 说话者在停顿方面受到的影响可能小于 L2-English 说话者。

语速与声学特征;音节语言数据变异性的线形图对比。
图6:韵律-声学特征的广义可加模型(GAMs)。 Y轴为响应变量(待建模的声学特征);X轴为预测变量(“语言”因子以及可加模型中的协变量,用于确定曲线的形状和轨迹(即平滑效应:“语言 + 协变量”),以及“语言”因子与某一度量特征的乘积项,用于更精确地预测响应变量(即因子-平滑交互项:“协变量:语言”)。缩写:GAMs = 广义可加模型(Generalized Additive Models)。请点击此处查看该图的放大版本。

在节奏度量方面,对于SD-S图7A),我们的研究结果表明,说话人对基频(f0)曲线的变化越大、语速越快,所有语言水平的SD-S值就越低(与图6A呈镜像效应)。对于辅音的SD(SD-C图7C),随着语速或停顿时长的增加,母语为巴西葡萄牙语者(L1-BP)的表现与母语为英语者(L1 English)相反,其变化幅度较小。这种SD变化趋势是可以预见的,因为母语为英语的音节时长变异性(在统计学上)显著高于母语为巴西葡萄牙语者44,58。对于Varco-S图7B补充表S1),其变化似乎在一定程度上与同语系的L1和L2相关。随着基频(f0)变异性及语速的增加,L1-BP的Varco-S降低,L2-BP也呈现出下降并趋于减弱的趋势。而对于英语产出,随着基频变异性及语速的增加,L1-英语和L2-英语的Varco-S则上升,并表现出减弱趋势。

关于元音或辅音的标准差(SD-V_C图7D补充表S1),我们的结果在一定程度上与 Varco-S 的表现相似(图7B)。例如,较高的 语速停顿时长f0 变异性 会促使母语为巴西葡萄牙语者(L1-BP)以及第二语言为巴西葡萄牙语者(L2-BP)的 SD-V_C 呈现先降后升的趋势。在英语产出中,尽管这些韵律特征更高,SD-V_C 在母语为英语者(L1-English)中略有下降并减弱,在第二语言为英语者(L2-English)中则先轻微上升,随后减弱。Varco-S 与同语系中L1与L2组别的 SD-V_C 相关性,可能部分归因于Lombard效应,即由于背景噪声导致语音声学参数发生改变的现象59

在外语言语中,根据任务的复杂程度(例如朗读言语),说话者在第一语言(L1)和第二语言(L2)中采用了相似的声学策略59,60。一方面,Marcoux 和 Ernestus 发现,L2 语境下的洛姆博德言语(Lombard speech)中基频(f0)指标(范围和中位数)表明,L2 英语说话者受到了其母语荷兰语(L1 Dutch)的影响61,62。另一方面,较新的研究提出,尽管由于使用第二语言时认知负荷更高,L2 洛姆博德言语预期会与 L1 洛姆博德言语存在差异,但 L2 英语说话者产生的洛姆博德言语变化方向与 L1 英语说话者一致63。我们的研究结果在多大程度上与 Marcoux 和 Ernestus63 的发现一致,而又与 Waaning59、Villegas 等人60 以及 Marcoux 和 Ernestus61,62 的研究相偏离,仍有待进一步研究。

言语变异性分析;显示标准差与语言因素关系的图表;言语分析。
图7:度量特征的广义可加模型。 Y轴为响应变量(待建模的度量特征);X轴为预测变量(“语言”因子以及可加模型中的协变量,这些协变量将提供曲线的形状和轨迹(即平滑效应:“语言 + 协变量”),以及“语言”因子与某一度量特征的乘积项,用于更精确地预测响应变量(即因子-平滑交互项:“协变量:语言”)。缩写:GAMs = 广义可加模型。请点击此处查看该图的放大版本。

言语感知实验结果
在巴西葡萄牙语(BP)语音列队中,列队 #1(图 8A)的干扰语音 #3 被判断为目标语音。实际上,目标语音应为语音 #4。结果显示,干扰语音 #3(83%)与目标语音 #4(71%)之间无统计学上的显著差异(见补充表 S1)。在列队 #2(图 8B)中,目标语音 #3(40%)与干扰语音 #4(20%)之间的比较也未显示出统计学上的显著差异(见补充表 S1),该结果针对英语语音列队。在列队 #1(图 9A)中,干扰语音 #2(26%)与目标语音 #4(54%)之间同样无显著差异(见补充表 S1)。

在声音相似性分析中,余弦相似度(CoSim)和欧氏距离(EucDist[EucDist transformed]54)均显示,在BP队列#1中,干扰项#3与目标声音之间存在一致的相关性(CoSim = 0.99;EucDist = 77.4,[0.93])。在BP队列#2中,干扰项#4与目标声音之间的相关性同样较强(CoSim = 0.99,EucDist = 76.3,[0.93])。在英语队列#1中,CoSim的相关性保持一致(0.83),而EucDist的相关性则为弱至中等水平(213.0,[0.47])。总体而言,CoSimEucDist均为判断声音相似性的有效方法。此外,如Gahman和Elangovan52所述,CoSim的表现略为更优(见补充表S1)。

从相似性的角度来看,是什么导致了误报率的上升?韵律-声学特征的证据表明,尽管干扰声音与目标声音在表现上存在(统计学上)显著差异(图8AB图9A 为例外),但在其他列队辨认中(图8CD 以及 图9BD),听者的判断在不同干扰项之间表现出一定程度的分散。这种判断似乎更多地依赖于说话人之间共享的一个(或多个)特定声学特征,而非整类韵律-声学特征。例如,本研究中呈现了多个在不同语音产出之间(共同)变化的特征;然而,感知实验结果表明,听者倾向于选择某个特定的干扰声音来匹配目标声音8,35,64,65。未来的研究还需进行更深入的分析。

值得注意的是,本研究中所采用的用于声学相似性的多维参数矩阵的选择66。我们的研究结果与先前研究一致,这些研究使用了基于基频(f0)、声门波形(VQ)和强度的声学特征9,35。此类特征在法医学领域的说话人比对任务中被显著推荐使用9,66。然而需要强调的是,在本研究中,尽管我们在准备带有外国口音的说话人识别语音列队时采用了McFarlane指南的一种变体16,17,但没有任何干扰语音被预测为与目标语音相似。此外,我们必须指出,我们的语音列队程序与McFarlane指南存在若干重要差异,包括刺激材料的长度、语音数量、干扰语音的选择(本研究中为随机选择)以及言语风格。

基频(f0)、音质和强度等韵律-声学特征在多大程度上与听者的感知相关,在很大程度上取决于研究中所采用的说话风格。本文采用了朗读语篇的方式。大多数听觉证人研究倾向于选择(半)自发性言语刺激作为平衡方案,例如DyVis语料库67,该语料库已在当代听觉证人研究中被广泛使用28,68。我们选择朗读任务的原因在于,本研究撰写时,我们的语料库完全由朗读任务所获得的数据组成。然而,需要指出的是,构建(半)自发性语料库的工作已在进行中。此外,朗读故事能够在说话人内部和说话人之间产生可靠程度的一致性和变异性。这有助于在涉及声音比对的情境中突出韵律或语音特征——无论是个体层面还是方言层面的特征。这种作用在产生外语口音时的发声负荷情况下尤为明显,即使是在语言能力较强的说话人中也是如此8,9,23,54

感知实验中语音列队得分的柱状图,突出显示目标语音。
图8:巴西听者完成的四组列队实验结果的柱状图。AB)目标语音(蓝色)与干扰项(浅蓝色)之间无显著差异。(CD)目标语音与干扰项之间存在显著差异。缩写:NS = 无显著性差异。请点击此处查看该图的放大版本。

显示不同语音列的亚美尼亚语听力得分的柱状图,突出目标语音。
图9:美国听者完成的四组语音列结果的柱状图。A)目标语音(红色)与干扰项(粉色)之间无显著差异。(BCD)目标语音与干扰项之间存在显著差异。缩写:NS = 无显著性差异。请点击此处查看该图的放大版本。

补充表 S1:言语产出统计——广义可加模型(GAMs):每个语言水平下具有统计学意义的韵律-声学特征(图6)和节奏度量(图7)的F统计量(自由度)、调整后的R2,以及每个平滑项(协变量)的单独数值。言语感知统计:Kruskall-Wallis χ2统计量(自由度)、p值和调整后的η2,以及针对目标-干扰声音对之间每项无统计学显著差异的后续Dunn检验(图8图9)(图8AB图9A)。每组听辨序列的余弦距离和欧氏距离的声学相似性矩阵。请点击此处查看该图的高清版本。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案在(法医)语音学领域具有创新性,分为两个阶段:一个基于发音(声学分析),另一个基于感知(听辨分析)。发音分析阶段包括数据准备、强制对齐、重新对齐以及韵律-声学特征的自动提取,此外还包括统计分析。该方案相较于主要依赖人工分段的传统方案,能够以更快且更高效的方式连接数据采集与数据分析阶段。

然而,重对齐过程(如方案步骤 1.3.6 至 1.3.6.9 所示)主要基于方案步骤 1.3.1 至 1.3.4 中生成的音素和词单元进行操作。该重对齐过程的创新之处在于,它生成了一个新的 TextGrid,其中包含三个新的文本层:一个音节层、一个语音语块层(可根据词自动或手动生成),以及一个声调层(可用于计算基频 f0 参数)。本方案所提出的重对齐准则此前已应用于二语语音节奏的研究21,69,70、利用机器学习技术检测外语口音程度的研究22,以及法医学领域的相关研究9

韵律特征的自动提取(见实验方案步骤1.3.7至1.3.7.10)可生成一个多维的韵律-声学特征矩阵,这一点已在当前研究中得到证实。这些特征包括旋律、时长以及频谱特征(嗓音质量和强度)71。其中许多声学特征对法医或其他实际场景中最终采集到的含噪声音频录音具有较低的敏感性和一定的鲁棒性72。此外,该多维矩阵可通过多种人工智能技术应用于语音识别系统(正在进行的研究)。它在第二语言发音教学中用于教授韵律特征方面仍然具有相当高的应用价值21(正在进行的研究)。

本部分方案的统计分析采用了广义相加模型(GAM)方法,因为我们面对的是特定声学特征与多个语言因素说话者之间的复杂关系。为了对某一特定声学特征进行建模,例如,有必要检验来自矩阵的其他声学特征(即平滑项)的表现情况,以便更准确地描述言语产生过程中发生的变化。

关于感知分析,本方案包括准备和实施语音列队、统计分析以及声学相似性分析。为准备列队,我们使用了适用于Praat的CreateLineup脚本,该脚本可自动生成每个列队的音频文件,其中包含随机排序的干扰语音和目标语音,具体步骤如方案2.2至2.2.1.9所述。

对于本方案的统计分析,由于数据不符合方差分析(ANOVA)的假设条件,我们采用了Kruskal-Wallis非参数检验。在确定了听者评估的判断分数与目标声音及干扰声音之间的关系后,我们选择使用线性模型统计方法。

在进行声学相似性分析时,我们使用了 Python 的 AcousticSmilarity_cosine_euclidean 脚本。该程序会弹出计算机的目录树,并提示用户选择包含陪衬样本与目标声纹的韵律-声学特征的文件,以构成待分析的声纹序列。点击按钮后,脚本将生成三个相似性矩阵:余弦相似度矩阵、欧氏距离矩阵,以及经过转换的(0 到 1)欧氏距离矩阵,并同时输出为“.txt”(制表符分隔)和“.csv”格式的文件。需要注意的是,每个数据集(即包含陪衬样本与目标声纹韵律-声学特征的“.txt”文件)必须保留在对应声纹序列的原始文件夹中,且每个声纹序列的文件夹内都应复制一份 AcousticSmilarity_cosine_euclidean 脚本。

总之,本方案推动了(法医)语音学研究的发展。该方案包含多个明确阶段——发音分析、感知分析以及声学相似性分析,弥合了数据采集与多维声学特征分析之间的差距。研究人员可从中获得整体性视角,同时探究发音与感知两个方面。此外,本方案确保了研究的可重复性,使其他研究者能够在此工作的指导原则基础上进一步开展研究。

局限性与未来方向
我们必须始终牢记,只有当数据准备遵循本方案步骤1.3.1至1.3.4中提出的指南时,一切才能顺利进行。此外,在强制对齐过程中,我们需要注意,当前研究所使用的外部预训练强制对齐工具(如MAUS)容易出现分段错误,尤其是在未经训练的带外国口音的数据中,甚至在已预训练的对齐器中,如果音频质量不佳或对齐器不支持该音频语言,也会出现此类问题(这种情况将使专家的工作更加困难且耗时)。法医语音转录,特别是针对较长音频文件的转录,在准确可靠地呈现口语录音方面面临诸多挑战72

转录和对齐较长音频文件也存在若干挑战。对齐工具的性能受到说话风格、语音环境以及特定方言因素的影响。尽管不同对齐工具有其各自的特点,但总体而言,它们的性能相似,生成的切分结果与人工对齐相比具有较好的一致性73。此外,由于MAUS中缺乏适用于外语的语音模型,本研究在处理英语母语者(L1)和第二语言英语使用者(L2)的英语产出时,采用了预训练的美式英语声学模型。同时,MAUS中目前尚无适用于巴西葡萄牙语(BP)的预训练声学模型。针对BP数据,本研究使用了现有的意大利语音声学模型(参见注释,实验方案步骤1.3.5.7)。

在未来的工作(进行中)中,我们将把蒙特利尔强制对齐工具(Montreal Forced Aligner, MFA)74作为实验方案的一部分。MFA 的一个显著优势是提供了多种语言(包括巴西葡萄牙语 BP)的预训练声学模型和音素转换模型,同时还具备针对任何新数据集(例如我们的带外国口音的语音语料库)训练新的声学模型和音素转换模型的能力75

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明无任何利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究由国家科学技术发展委员会(CNPq)资助,第一作者获资助号 307010/2022-8,第二作者获资助号 302194/2019-3。作者谨向参与本研究的各位受试者致以诚挚的感谢,感谢他们慷慨的合作与宝贵贡献。

材料

本文使用的材料清单
姓名公司目录编号评论
创建队列个人收藏#用于准备语音队列的 Praat 脚本
Dell I3 (带固态硬盘 - SSD) Dell#笔记本电脑
PraatPaul Boersma & David Weenink#语音学分析软件
Python 3Python 软件基金会#解释型、高级、通用编程语言 
R统计计算 R 项目#用于统计计算的编程语言
Shure Beta SM7BShure#麦克风
SpeechRhythmExtractor个人收藏#用于自动提取声学特征的 Praat 脚本
SurveyMonkeySurveyMonkey 公司#提供免费可自定义的调查问卷集合,以及一系列后端程序,包括数据分析、样本选择、去偏和数据呈现。
Tascam DR-100 MKIITascam#数字语音录音机
慕尼黑自动分割系统 MAUS慕尼黑大学#用于音频文件(.wav)和语言信息文件(.txt)的强制对齐工具
VVUnitAligner个人收藏#用于语音单元自动重对齐和后处理的 Praat 脚本

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Moyer, A. Foreign Accent: The Phenomenon of Non-native Speech. , Cambridge University Press. (2013).
  2. Munro, M., Derwing, T. Foreign accent, comprehensibility and intelligibility, redux. J Second Lang Pronunciation. 6 (3), 283-309 (2020).
  3. Levis, J. Intelligibility, Oral Communication, and the Teaching of Pronunciation. , Cambridge University Press. (2018).
  4. Munro, M. Applying Phonetics: Speech Science in Everyday Life. , Wiley-Blackwell. (2022).
  5. Gut, U. Speaker Classification. Muller, C. , Springer-Verlag. 75-87 (2007).
  6. Rogers, H. Foreign accent in voice discrimination: a case study. Forensic Linguistics. 5 (2), 203-208 (1998).
  7. Solan, L., Tiersma, P. Hearing Voices: Speaker Identification in Court. Hastings Law Journal. 54, 373-436 (2003).
  8. Alcaraz, J. The long-term average spectrum in forensic phonetics: From collation to discrimination of speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 87-110 (2023).
  9. Silva, L. Jr, Barbosa, P. A. Voice disguise and foreign accent: Prosodic aspects of English produced by Brazilian Portuguese speakers. Estudios de Fonética Experimental / Journal o Experimental Phonetics. 32, 195-226 (2023).
  10. Munro, M., Derwing, T. Modeling perceptions of the accentedness and comprehensibility of L2 speech. Studies in Second Language Acquisition. 23 (4), 451-468 (2001).
  11. Keating, P., Esposito, C. Linguistic Voice Quality. Working Papers in Phonetics. , 85-91 (2007).
  12. Niebuhr, O., Skarnitzl, R., Tylečková, L. The acoustic fingerprint of a charismatic voice -Initial evidence from correlations between long-term spectral features and listener ratings. Proceedings of Speech Prosody. , 359-363 (2018).
  13. Segundo San, E. International survey on voice quality: Forensic practitioners versus voice therapists. Estudios de Fonética Experimental. 29, 8-34 (2021).
  14. Farrús, M. Fusing prosodic and acoustic information for speaker recognition. International Journal of Speech, Language and the Law. 16 (1), 169(2009).
  15. Farrús, M. Voice disguise in automatic speaker recognition. ACM Computing Surveys. 51 (4), 1-2 (2018).
  16. Nolan, F. A recent voice parade. The International Journal of Speech, Language and the Law. 10 (2), 277-291 (2003).
  17. McDougall, K. Ear-catching versus eye-catching? Some developments and current challenges in earwitness identification evidence. Speaker Individuality in Phonetics and Speech Sciences. Bernardasci, C., Dipino, D., Garassino, D., Negrinelli, S., Pellegrino, E., Schmid, S. , Officinaventuno. 33-56 (2021).
  18. Gut, U. Rhythm in L2 speech. Speech and Language Technology. 14 (15), 83-94 (2012).
  19. Urbani, M. Pitch Range in L1/L2 English. An Analysis of F0 using LTD and Linguistic Measures. Coop. , Libraria Editrice Università di Padova. (2012).
  20. Gonzales, A., Ishihara, S., Tsurutani, C. Perception modeling of native and foreign-accented Japanese speech based on prosodic features of pitch accent. J Acoust Soc Am. 133 (5), 3572(2013).
  21. Silva, L. Jr, Barbosa, P. A. Speech rhythm of English as L2: an investigation of prosodic variables on the production of Brazilian Portuguese speakers. J Speech Sci. 8 (2), 37-57 (2019).
  22. Foreign accent and L2 speech rhythm of English a pilot study based on metric and prosodic parameters. Silva, L. Jr, Barbosa, P. A. Proceedings of the II Brazilian Conference on Prosody (Anais II Congresso Brasileiro de Prosódia), 1, 41-50 (2023).
  23. Costa, A. El cerebro bilingüe: La neurociencia del lenguaje. , Penguin Randon House. (2017).
  24. Eriksson, A. Tutorial on forensic speech science: Part I. Forensic Phonetics. , (2005).
  25. Harvey, M., Giroux, M., Price, H. Lineup size influences voice identification accuracy. Applied Cognitive Psychology. 37 (5), 42-89 (2023).
  26. Pautz, N., et al. Identifying unfamiliar voices: Examining the system variables of sample duration and parade size. Q J Exp Psychol (Hove). 76 (12), 2804-2822 (2023).
  27. McDougall, K., Nolan, F., Hudson, T. Telephone transmission and earwitnesses: Performance on voice parades controlled for voice similarity. Phonetica. 72 (4), 257-272 (2015).
  28. Nolan, F., McDougall, K., Hudson, T. Some acoustic correlates of perceived (dis) similarity between same-accent voices. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2011). , 1506-1509 (2011).
  29. Sheoran, S., Mahna, D. Voice identification and speech recognition: an arena of voice acoustics. Eur Chem Bull. 12 (5), 50-60 (2023).
  30. Hudson, T., McDougall, K., Hughes, V. Forensic phonetics. The Cambridge Handbook of Phonetics. Knight, R. -A., Setter, J. , Cambridge University Press. 631-656 (2021).
  31. Eriksson, A. The disguised voice: Imitating accents or speech styles and impersonating individuals. Language and identities. Llamas, C., Watt, D. , Edinburgh University Press. 86-96 (2010).
  32. Köster, O., Schiller, N. Different influences of the native language of a listener on speaker recognition. Forensic Linguistics. 4 (1), 18-27 (1997).
  33. The influence of native-language background on speaker recognition. Köster, O., Schiller, N., Künzel, H. Proceedings of the International Congress of Phonetic Sciences (ICPhS 1995), , 306-309 (1995).
  34. Thompson, C. P. A language effect in voice identification. Applied Cognitive Psychology. 1, 121-131 (1987).
  35. San Segundo, E., Univaso, P., Gurlekian, J. Sistema multiparamétrico para la comparación forense de hablantes. Estudios de Fonética Experimental. 28, 13-45 (2019).
  36. Council of Europe. Common European Framework of Reference for Languages: Learning, Teaching, Assessment. , Press Syndicate of the University of Cambridge. (2001).
  37. How to use Tascam DR-100 MKII: Getting started. , https://www.youtube.com/watch?v=O2E72uV9fWc (2018).
  38. Getting the most from your Shure SM58 microphone. , https://www.youtube.com/watch?v=wweNufW7EXA (2020).
  39. Kisler, T., Reichel, U. D., Schiel, F. Multilingual processing of speech via web services. Computer Speech & Language. 45, https://clarin.phonetik.uni-muenchen.de/BASWebServices/interface/WebMAUSBasic 326-347 (2017).
  40. Escudero, P., Boersma, P., Rauber, A., Bion, R. A cross-dialect acoustic description of vowels: Brazilian and European Portuguese. J Acoust Soc Am. 126 (3), 1379-1393 (2009).
  41. Post-aspiration in standard Italian: some first cross-regional acoustic evidence. Stevens, M., Hajek, J. Proceedings 11th Conference of the International Speech Communication Association (INTERSPEECH 2010), , 1557-1560 (2011).
  42. Barbosa, P., Madureira, S. Manual de Fonética Acústica Experimental: aplicações a dados do português. , Cortez. (2015).
  43. Boersma, P., Weenink, D. Praat: Doing phonetics by computer. (Version 6.1.38) [Computer program]. , https://www.praat.org/ (1992-2021).
  44. Silva, L. Jr VVUnitAligner. [Computer program]. , https://github.com/leonidasjr/VVunitAlignerCode_webMAUS (2022).
  45. Silva, L. Jr, Barbosa, P. A. SpeechRhythmExtractor [Computer program]. , https://github.com/leonidasjr/VowelCode (2019-2023).
  46. R Core Team. A language and environment for statistical computing. R Foundation for Statistical Computing. , https://www.R-project.org/ (2023).
  47. Pigoli, D., Hadjipantelis, P. Z., Coleman, J. Z., Aston, J. The statistical analysis of acoustic phonetic data. Journal of the Royal Statistical Society. 67 (5), 1103-1145 (2018).
  48. Barbosa, P. A. CreateLineup [Computer program]. , https://github.com/pabarbosa/prosody-scripts-CreateLineUp (2021).
  49. Van Rossum, G., Drake, F. L. Python 3 Reference Manual. , CreateSpace. (2009).
  50. Silva, L. Jr AcousticSimilarity_cosine_euclidean. [Computer program]. , https://github.com/leonidasjr/AcousticSimilarity/blob/main/AcousticSmilarity_cosine_euclidean.py (2024).
  51. Automatic assessment of voice similarity within and across speaker groups with different accents. Gerlach, L., McDougall, K., Kelly, F., Alexander, A. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023), , 3785-3789 (2023).
  52. Gahman, N., Elangovan, V. A comparison of document similarity algorithms. International Journal of Artificial Intelligence and Applications. 14 (2), 41-50 (2023).
  53. San Segundo, E., Tsanas, A., Gómez-Vilda, P. Euclidean distances as measures of speaker similarity including identical twin pairs: A forensic investigation using source and Filter voice characteristics. Forensic Science International. 270, 25-38 (2017).
  54. Speaker's voice characteristics and similarity measurement using Euclidean distances. Singh, M. K., Singh, N., Singh, A. K. Proceedings of the International Conference on Signal Processing and Communication (ICSC 2019), , 317-322 (2019).
  55. Darling-White, M., Banks, W. Speech rate varies with sentence length in typically developing children. J Speech Lang Hear Res. 64 (6), 2385-2391 (2021).
  56. Barbosa, P. A. Incursões em torno do ritmo da Fala. , Pontes Editores. (2006).
  57. Golestani, N., Pallier, C. Anatomical correlates of foreign speech sound production. Cereb Cortex. 17 (4), 929-934 (2007).
  58. Trouvain, J., Fauth, C., Möbius, B. Breath and non-breath pauses in fluent and disfluent phases of German and French L1 and L2 read speech. Proceedings of Speech Prosody. , 31-35 (2016).
  59. Waaning, J. The Lombard effect: the effects of noise exposure and being instructed to speak clearly on speech acoustic parameters. [Master's thesis]. , Radboud University. (2021).
  60. Villegas, J., Perkins, J., Wilson, I. Effects of task and language nativeness on the Lombard effect and on its onset and offset timing. J Acoust Soc Am. 149 (3), 1855(2021).
  61. Differences between native and non-native Lombard speech in terms of pitch range. Proceedings of the 23rd International Congress on Acoustics(ICA 2019). Marcoux, K., Ernestus, M. , 5713-5720 (2019).
  62. Marcoux, K., Ernestus, M. Pitch in native and non-native Lombard speech. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2019). , 2605-2609 (2019).
  63. Marcoux, K., Ernestus, M. Acoustic characteristics of non-native Lombard speech in the DELNN corpus. Journal of Phonetics. 102, 1-25 (2024).
  64. Gil, J., San Segundo, E. La cualidad de voz en fonética judicial [Voice quality in judicial phonetics]. Lingüística Forense: la Lingüística en el ámbito legal y policial. Garayzábal, M., Jiménez, M., Reigosa, M. , Euphonía Ediciones. 154-199 (2014).
  65. Gil, J., San Segundo, E. El disimulo de la cualidad de voz en fonética judicial: Estudio perceptivo de la hiponasalidad [Voice quality disguise in judicial phonetics: A perceptual study of hyponasality. Panorama de la fonética española actual. Penas-báñez, M. A. , Arco Libros. 321-366 (2013).
  66. Passeti, R., Madureira, S., Barbosa, P. What can voice line-ups tell us about voice similarity. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 3765-3769 (2023).
  67. Nolan, F. The DyViS database: Style-controlled recordings of 100 homogeneous speakers for forensic phonetic research. International Journal of Speech Language and the Law. 16 (1), 31-57 (2009).
  68. Caroll, D. Psychology of Language. , Wadsworth. (1994).
  69. Ortega-Llebaria, M., Silva, L. Jr, Nagao, J. Macro- and micro-rhythm in L2 English: Exploration and Refinement of Measures. Proceedings of the International Congress of Phonetic Sciences (ICPhS 2023). , 1582-1586 (2023).
  70. Fernández-Trinidad, M. Hacia la aplicabilidad de la cualidad de la voz en fonética judicial. Loquens. 9 (1-2), 1-11 (2022).
  71. Brouwer, S. The role of foreign accent and short-term exposure in speech-in-speech recognition. Atten Percep Psychophys. 81, 2053-2062 (2019).
  72. Love, R., Wright, D. Specifying challenges in transcribing covert recordings: Implications for forensic transcription. Front Commun. 6, 1-14 (2021).
  73. Meer, P. Automatic alignment for New Englishes: Applying state-of-the-art aligners to Trinidadian English. J Acoust Soc Am. 147 (4), 2283-2294 (2020).
  74. Montreal Forced Aligner: trainable text-speech alignment using Kaldi. McAuliffe, M., Socolof, M., Mihuc, S., Wagner, M., Sonderegger, M. Proceedings 18th Conference of the International Speech Communication Association (INTERSPEECH 2017), , 498-502 (2017).
  75. Chodroff, E. Montreal Forced Aligner: MFA Tutorial. , https://zenodo.org/records/7591607 (2023).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章