2024年9月27日
本研究旨在比较从母语到第二语言的英语与从母语到第二语言的葡萄牙语,以检验外国口音在各项指标、韵律-声学参数以及在语音列队中选择目标声音时所产生的影响程度。
我们的研究探讨了外国口音如何影响说话人识别。我们重点关注基于基频(即声音音高)、时长和音质等韵律特征。研究目标是理解这些特征如何影响听者在语音辨认 lineup 中的判断。
目前,针对自动说话人识别性能的研究日益增多,该技术将自动化应用于法庭语音比对的工作流程中。然而,对于需要向警方、法官和陪审员报告结果的法庭科学家而言,这些信息如同一个黑箱。基于经典技术(如 GMM、UBM 模型)和真人语音样本的自动说话人识别系统。
此外,还有基于人工智能的神经科学研究。我们提出了一种自动化流程,用于保留自动语音识别系统所遗漏的语言学信息。本方案采用结合听觉与声学的方法进行法医语音比对,同时明确该科学技术的发展国家,并利用自动化工具提取广泛的声学特征,以及执行声学相似性分析程序。
首先,以 TXT 文件格式为每个音频文件编写语言转录文本。将 TXT 文件和 WAV 文件使用相同的名称进行配对标注。为每种第一语言(L1)和第二语言(L2)创建独立的文件夹。
确保相同语言的所有文件对位于同一文件夹中。访问慕尼黑自动分割强制对齐工具(Munich Automatic Segmentation forced aligner)的网页界面,从文件夹中将每一对WAV和TXT文件拖放到文件区域的虚线矩形内。单击上传按钮,将文件上传至对齐工具。
在服务选项菜单中,针对 L1 L2 英文数据,选择“grapheme to phoneme to mouse to phone to syllable”作为管道名称,选择“English-US”作为语言。输出格式保持默认选项,并保留所有内容。勾选运行选项框以接受使用条款。
单击运行网络服务按钮,以在比对工具中运行已上传的文件。文件处理完成后,单击下载为压缩文件按钮,下载文本格文件。提取文本格文件,以供后续在语音学分析软件中重新对齐使用。
获取并下载 PRAAT VVUnitAligner 脚本。确保同一语言的所有文件对以及 VVUnitAligner 脚本均位于同一文件夹中。打开语音分析软件。
在对象窗口中,点击 Praat 并打开 Praat 脚本以加载脚本。点击运行按钮,然后选择语言为 English-US。接着,从片段分割按钮中选择自动模式。
勾选“保存文本网格文件”选项,以自动保存新生成的文本网格文件。单击“确定”和“运行”按钮,以重新对齐语音单元。从指定网站下载语音节奏提取脚本,用于自动提取韵律声学特征。
创建一个新文件夹,并将语音节奏提取脚本以及所有语言的音频文本网格文件添加到该文件夹中。打开语音分析软件,在对象窗口中点击 Praat,然后打开 Praat 脚本以加载该脚本。
然后单击运行按钮一次。勾选“语音质量参数”选项,以保存用于语音质量的输出文件 VQ。现在勾选“语言目标”选项以选择语言。
然后选中单位选项,以选择以半音为单位的基频(F0)特征。设置基频阈值,包括最小值和最大值阈值。点击“确定”,然后点击“运行”,以自动提取声学特征。
为了进行广义加性模型和非参数统计分析,请输入指定命令,并将包含提取的声学特征的电子表格上传到 R 环境中,最后按回车键执行。与母语为葡萄牙语、第二语言为英语(L1 L2 BP)的说话者相比,母语为英语、第二语言为英语(L1 L2 English)的说话者的语速下降更为迅速,后者由于音节持续时间较长且变异程度较低,其斜率较平缓。
尽管音节时长的变异性增加,巴西葡萄牙语母语者(L1 BP)和以英语为第二语言者(L2 English)的局部微扰(local shimmer)仍保持相对稳定。与英语母语者(L1 English)、巴西葡萄牙语母语者(L1 BP)以及以英语为第二语言者(L2 English)相比,以巴西葡萄牙语为第二语言者(L2 BP)的停顿频率更高,且停顿时间更长。构音速率受到的影响与语速相似,较低的构音速率与较高的认知语言负荷及音节变异相关。
随着语速在所有语言水平上的提高,音节时长的标准差减小。对于母语为巴西葡萄牙语(L1 BP)和第二语言为巴西葡萄牙语(L2 BP)的说话者,音节变异系数(Varco)随着基频(F0)变异性和语速的增加而减小;而对于母语为英语(L1 English)和第二语言为英语(L2 English)的说话者,该值则增加。随着语速或停顿时长的增加,母语为巴西葡萄牙语(L1 BP)的辅音标准差表现出比母语为英语(L1 English)更低的变异性。
对于母语为巴西葡萄牙语(L1 BP)和第二语言为巴西葡萄牙语(L2 BP)的发音人,元音和辅音的标准差随着韵律特征的增强呈现出先下降后上升的模式,而在母语为英语(L1 English)和第二语言为英语(L2 English)中则表现为先下降后趋于平缓。分别准备四组英语和巴西葡萄牙语的语音列队后,获取所选发音人的音频文件,并将其整理到按语言分类的文件夹中。随后,从L1英语或L1巴西葡萄牙语中随机选取六个语音片段,再从这六个片段中选择其一对应的L2英语或L2巴西葡萄牙语的一个语音片段。
获取并下载 Praat 创建音列的脚本。运行脚本前,请确保将第二语言参考声音、第一语言干扰项以及第一语言目标声音放置在同一文件夹中。打开语音分析软件。
在对象窗口中,单击 Praat 并打开 Praat 脚本以加载脚本。然后单击运行以执行创建队列脚本。在 R 环境中,要执行 Kruskal-Wallace 检验,请输入指定的命令。
然后上传包含听者评分结果的电子表格并按回车键。接着进行事后 Dunn 检验,输入以下命令并按回车键。访问并下载 Python 脚本“Acoustic Similarity Cosine Euclidean”。
确保下载的脚本与语音列队数据集保存在同一文件夹中。点击打开文件按钮调用该脚本,然后依次点击运行和“运行不调试”按钮以执行脚本。最后,基于声学特征进行语音相似性测试。
在BP语音列队一中,干扰语音三被判定为目标语音,且干扰语音三与目标语音四之间无显著差异。在BP语音列队二中,目标语音三与干扰语音四之间亦无显著差异。余弦相似度和欧氏距离均显示,在BP列队一中,干扰语音三与目标语音之间存在强相关性。
在BP队列二中,两种相似性指标在第四箔片与目标之间均表现出强相关性。
本研究探讨外国口音如何影响说话人识别,重点关注音高、时长和音质等韵律特征。该研究旨在理解这些特征如何影响听者在语音列队辨认中的判断。
对带外语口音语音中的韵律-声学特征进行定量分析,能够客观评估说话人身份,支持法医学及安全相关领域的研发流程。结合统计建模与声学相似性度量方法,可提高基于语音识别的预测置信度,降低高风险决策环节中的不确定性。在企业工作流中,此类能力至关重要,因其可通过稳健、可重复的说话人比对,为基于风险调整的投资组合决策提供依据。
该方案涵盖了从声学标志物的早期发现到统计验证和筛选的全过程,支持从假设检验到临床前系统评估的工作流程。