方法文章

基于记忆的训练与测试范式结合事件相关电位分析用于表达性言语中稳健的语音身份识别

2.1K 次观看

DOI:

10.3791/66913

2024年8月9日

本文内容

摘要

该研究引入了一种训练-测试范式,用于探究在确信与怀疑语调情境下事件相关电位的新/旧效应。数据显示,在Pz及其他电极处,400-850 ms时间窗口内晚正成分显著增强。该实验流程可用于探索言语韵律之外的其他因素及其对线索绑定目标识别的影响。

摘要

从语音流中识别熟悉的说话者是人类言语交流的一个基本方面。然而,目前尚不清楚听者如何在富有表现力的言语中仍能分辨说话者的身份。本研究建立了一种基于记忆的个体说话者身份识别方法,并配套开发了脑电图(EEG)数据分析流程,用于监测听者如何识别熟悉的说话者并区分陌生的说话者。EEG数据捕捉了基于声音进行新旧说话者区分过程中的实时认知活动,提供了大脑活动的实时测量指标,克服了反应时和准确率测量的局限性。该实验范式包含三个步骤:听者建立三个声音与其对应姓名之间的关联(训练阶段);听者从三个候选姓名中指出与某一声音对应的名字(检验阶段);听者在双选一迫选任务中区分三个熟悉的旧说话者声音和三个陌生的新说话者声音(测试阶段)。测试阶段中的语音语调分别为自信或怀疑两种类型。采用64通道EEG系统采集脑电数据,经过预处理后导入RStudio进行事件相关电位(ERP)和统计分析,同时导入MATLAB进行脑地形图分析。结果显示,在400–850 ms时间窗口内,无论是自信还是怀疑语调条件下,旧说话者条件相较于新说话者条件均诱发了更大的晚期正成分(LPC),该效应出现在Pz电极及其他更广泛分布的电极上。然而,在怀疑语调感知中,旧/新效应在中央区和后部电极上更为显著;而在自信语调条件下,该效应则出现在前部、中央区和后部电极上。本研究提出,该实验设计可作为研究各种情境下(例如,回指表达)说话者特异性线索绑定效应以及语音失认症等患者病理机制的参考范式。

引言

人类的语音流包含丰富的信息,例如情绪1,2、健康状况3,4、生物学性别5、年龄6,以及更为重要的个体声音身份7,8。研究表明,人类听者具有较强的能力通过声音识别并区分他人的身份,能够克服说话者在声学空间中围绕其身份平均表征所产生的个体内变异9。这些变异源于声学参数的调整(如基频和声道长度,即F0和VTL),而这些调整并不对应明确的语用意图9,也与情绪韵律10以及传达说话者“知晓感”的声音自信度相关11。行为实验已关注多种影响听者识别说话者表现的因素,包括语言相关的操控8,12,13、参与者自身特征(如音乐经验或阅读能力)14,15,以及刺激材料的相关调整(如逆向语音或非词)16,17;更多内容可在文献综述中找到18,19。近年来少数实验探讨了说话者身份表征的个体差异如何可能削弱识别准确性,所考虑的因素包括高与低情绪表达性16以及中性与恐惧韵律之间的对比5;此外,一篇综述还指出更多潜在情境有待进一步研究20

针对第一个研究空白,该研究提出,说话人识别的神经机制尚未充分探讨说话人内部变异如何影响听者的脑活动。例如,在Zäske等人开展的一项基于功能性磁共振成像(fMRI)的说话人识别任务中,当参与者正确识别出熟悉的说话人(旧说话人)与新说话人时,其右侧后部上颞回(pSTG)、右侧额下回/额中回(IFG/MFG)、右侧额内侧回以及左侧尾状核的激活程度均有所降低,且该效应不受语言内容是否相同的影响21。然而,Zäske等人此前的一项脑电图(EEG)研究在引入不同文本以实现说话人身份变化时,并未观察到这种新/旧效应22。具体而言,当听者听到熟悉的训练说话人重复相同文本(即语言内容无变化的重放)时,在Pz电极处检测到一个持续时间为300至700毫秒的更大的晚期正成分(LPC);而当说话人朗读新文本时,该成分则消失。

本研究支持 Zäske 等人21提出的观点,推测即使在训练和测试阶段使用不同的语言内容,事件相关电位(ERP)分析中仍可能观察到新/旧效应。这一推论基于以下观点:Zäske 等人22在使用不同文本的条件下未观察到新/旧效应,其原因可能在于训练任务中缺乏额外的核查环节,以确保身份学习的充分性和有效性,正如 Lavan 等人23所建议的那样。因此,本研究的首要目标是检验并验证这一假设。为实现该目标,本研究拟在训练-测试范式中增加一个核查环节22

本研究旨在解决的另一个关键问题是,在语调变化存在的情况下,说话人识别的稳健性如何。以往的行为学研究表明,听者在不同语调条件下识别说话人尤为困难,这表明语调语境具有调节作用——在训练和测试语调不同的条件下,听者的表现较差。本研究将通过让听者识别熟悉说话人在自信或怀疑语调下的语音,来检验这一假设24。本研究预期,所观察到的事件相关电位(ERP)差异将有助于解释语调如何影响说话人身份的识别。

本研究的核心目标是考察说话人识别中“旧/新”效应的稳健性,具体探讨在自信语调与怀疑语调条件下识别说话人是否存在差异。Xu 和 Armony10 采用训练-测试范式进行了一项行为学研究,其结果表明,听者无法克服语调差异(例如,在中性语调下训练识别某一说话人,而在恐惧语调下进行测试),其识别准确率甚至低于随机水平10。声学分析显示,说话人表达不同情绪状态时伴随着声道长度(VTL)和基频(F0)的调制;例如,自信语调的特征是VTL延长和F0降低,而怀疑语调则相反11,24。另一项来自 Lavan 等人23 的研究进一步证实,听者能够适应说话人的VTL和F0变化,并基于平均值形成对说话人的表征。该研究从行为数据角度表明,听者仍有可能在不同语调间识别出说话人身份(例如,在自信语调下训练识别某一说话人,而在怀疑语调下进行测试;相关结果见另一篇正在撰写的论文)。然而,关于说话人识别的神经机制,特别是 Zäske 等人22 所观察到的“旧/新”效应是否具有普遍性,目前尚不明确。因此,本研究致力于验证在自信与怀疑语调作为测试情境下,“旧/新”效应的稳健性。

该研究在新旧效应研究领域突破了以往的研究范式。过去的研究主要关注新旧说话人识别如何影响感知,而本研究在此基础上进一步引入了两个置信度水平(确信与怀疑),从而构建了一个2+2研究范式。这使我们能够在确信和怀疑语调的语境下探究说话人识别问题。该范式有助于考察新旧效应的稳健性。对记忆效应以及在确信和怀疑语调语境下的感兴趣脑区(ROI)的分析,为这一研究提供了证据支持。

总体而言,本研究旨在更新对语音识别脑电图(EEG)相关机制的理解,提出以下两个假设:即使在1)语言内容不相同的情况下,以及2)存在自信与怀疑语调的情况下,仍可观察到EEG新旧效应中增大的晚期正成分(LPC)。本研究通过三步实验范式对上述假设进行了检验。首先,在训练阶段,参与者建立了三种声音与其对应名称之间的关联。随后,在检验阶段,参与者需从三个候选名称中识别出与特定声音相对应的名称。该检验步骤借鉴Lavan等人23的方法,旨在克服因旧说话者熟悉度不足而导致的问题——此前研究中,当训练与测试阶段的文本内容不一致时,未能观察到新旧效应6,且参与者无法在中性与恐惧语调之间识别同一说话者10。最后,在测试阶段,参与者需在二选一的迫选任务中区分三种旧说话者声音与三种新说话者声音,语音语调以自信或怀疑的形式呈现。脑电数据使用64通道EEG系统采集,并在分析前进行了预处理。统计分析和事件相关电位(ERP)分析在RStudio中进行,而脑地形图分析则使用MATLAB完成。

在设计细节方面,本研究提出了一项说话人身份学习实验,该实验控制了说话者的身高因素,因为身高与声道长度(VTL)相关,并会影响对说话者身份的感知23。这一因素还会影响社会性印象,例如对支配性的感知25,而此类高层次印象的形成可能与说话人身份的解码过程存在交互作用26

方案

上海外国语大学语言学研究所伦理委员会已批准下述实验设计。本研究已获得所有参与者的知情同意。

1. 音频库的制备与验证

  1. 音频录制与编辑
    1. 参照先前英文版本的标准流程,创建一个中文语音数据库,并根据中国语境的需要进行适当调整11。本实验使用了123个包含三种语用意图(即判断、意图和事实)的句子。为此,可参考现有的英文陈述语料库11,并结合本地化场景创建适配的中文版本。
    2. 招募24名发音人(12名女性),在参照并调整以往录音任务指定说明的基础上11,24,用中性、怀疑和自信的语调表达这些句子。
      1. 本实验中的发音人均来自上海外国语大学,共24名普通话标准使用者,男女各12名,普通话水平测试成绩为87至91分,具备良好的普通话表达能力。男性平均年龄为24.55 ± 2.09岁,受教育年限为18.55 ± 1.79年,平均身高为174.02 ± 20.64 cm;女性平均年龄为22.30 ± 2.54岁,受教育年限为18.20 ± 2.59年,平均身高为165.24 ± 11.42 cm。所有发音人均未报告有言语-听力障碍或神经或精神类疾病。
    3. 要求每位发音人将每段文本重复朗读两 次。在Praat软件中将采样率设置为48,000 Hz27。确保每次录音流不超过10分钟,以防Praat系统崩溃导致录音丢失。
    4. 使用Praat将长音频流按句子剪辑成片段。由于每段文本有两次重复,应选择最能体现目标语调的版本作为目标句子。
  2. 音频筛选
    1. 使用Praat脚本将音频库归一化至70 dB,采样率调整为41,000 Hz28。具体操作为:打开Praat,加载声音文件,并在“Objects”窗口中选中这些文件;进入“Modify”菜单,选择Scale intensity...,在设置窗口中将“New average intensity (dB SPL)”设为70,点击OK以应用归一化处理。
    2. 招募48名独立听者,使用一个7点Likert量表 对每段音频的自信程度进行评分:1表示完全不自信,7表示非常自信11。确保每句话均由12名评分者进行评价。
    3. 根据预设阈值筛选音频,遵循一个主要原则:确保表达“自信”意图的音频平均评分高于表达“怀疑”意图的音频。该阈值需在同一生理性别下的12名发音人中保持一致。例如,若这些发音人对两个句子分别表达了自信和怀疑的语调,则其评分之间应存在显著差异。
    4. 为满足当前实验设计的需求,使用四个音频组块,共480个音频片段,每个组块包含120个音频。
      1. 将24名发音人分为四组,每组6人,包括两组男性和两组女性,每组内的发音人均属同一生理性别。
      2. 针对每组,基于感知评分(同一文本)选择音频片段,确保每句话的自信语调评分平均值高于怀疑语调评分。这四个组块在以下方面有所不同:1)组合的六名发音人身份不同;2)一半组块由男性表达,另一半由女性表达;3)每个组块所包含的文本内容不同。
    5. 在开始筛选前,记录每位发音人的身高数据,并据此按性别和身高将发音人划分为四个独立组别。
      1. 共有24名发音人,男女各12名。在每一性别组内,按身高对12名个体进行排序。
    6. 将这12名个体以交替方式分为两组;例如,从1到12的排序列表中,个体1、3、5、7、9、11组成一组,其余个体组成第二组。在这些组内,依据身高定期间隔选取用于音频片段的发音人。
      注:将身高作为控制变量,是基于已有研究发现,与发音人身高相关的声学参数(如声道长度VTL和基频F0)会影响说话人身份识别23

2. 脑电数据采集的编程

  1. 设计实验矩阵
    1. 本研究采用被试内设计。为每位被试准备一个测试环节,呈现内容保持一致,同时调整训练环节。准备四个区块,其中男性和女性说话者分别占据两个区块的一半。根据图1的建议,分配两个区块用于在确信语调上进行训练并在确信与怀疑语调上进行测试,另两个区块用于在怀疑语调上进行训练并在确信与怀疑语调上进行测试。
    2. 参考现有关于说话人识别和语音自信度感知的脑电图(EEG)研究22,29,确定各功能屏幕的持续时间。使用拉丁方矩阵在被试间平衡四个区块的顺序30,31。建议使用定制的Python代码生成此类列表。参见OSF上的拉丁方矩阵和PsychoPy程序试验列表代码片段32
    3. 从相同生物性别的身高序列中按区间选取说话人。在每个区块中,从原始24位说话人中选取6位,这些说话人根据其报告的身高分为四个列表。
    4. 选取《中国百家姓》中的前24个姓氏。将这些姓氏随机分配给24位说话人,并以“小”(中文中表示“小”或“年轻”)加姓氏的形式(如小赵)在音频中称呼他们。
    5. 将所有相关信息整理到一个电子表格中,列包括:说话人(1至24)、生物性别(男性或女性)、人名(来自24个姓氏)、确信程度(确信或怀疑)、项目(文本索引)、评定的确信度(感知研究中的平均得分)、声音(例如 sound/1_h_c_f_56.wav),
    6. 正确识别三选一(1、2或3),并正确识别旧与新(旧或新)。此外,确保已添加名为 training_a、training_b、training_c、check 和 test 的列。
    7. 在电子表格中添加 training_a_marker、training_b_marker、check_marker 和 testing_marker 列以发送EEG标记。将这些标记格式化为三位数字,即数字1也写作001。
  2. 构建三个实验环节
    注:推荐使用PsychoPy构建程序,主要通过使用构建器模式完成。此外,在构建器中使用代码组件将程序与EEG数据采集系统连接,平衡F和J按键,并计算屏幕上显示的准确率。
    1. 首先,点击编辑实验设置图标,将“实验信息”单元格调整为两个字段,即“被试”和“区块”。两者默认值均留空。在本研究中,40名被试每人进行四个区块,其中4/40名被试因检查环节准确率低于10/12而重复某些区块,重做率为19次重做次数 / (4区块 × 40名被试) = 11.875%。
    2. 训练环节:重复三次的身份学习
      1. 定义一个名为 Training_A 的循环,包含三个屏幕:注视点、呈现和空白屏。勾选是试验选项。将 nReps 设为1,Selected rows 和 Random Seed 留空。按如下方式编写条件:
        "$"trials/{:}_training_a.xlsx".format(expInfor["Participant"]), expInfo["Block"])
        其中 trials/ 是文件夹名称;Participant 是被试编号;Block 是当前区块的顺序。
      2. 在注视点屏幕中,添加一个文本组件,开始时间设为0,持续时间设为2秒,在文本输入框中输入“+”号,并选择每次重复设置。同样,在空白屏中添加一个类似的文本组件,文本框为空,持续0.5秒。
      3. 在呈现屏幕中,执行以下操作:
        1. 添加一个声音组件,开始时间设为0,停止持续时间留空,声音输入框中输入 $Sound 并选择每次重复设置。勾选与屏幕同步开始
        2. 添加另一个文本组件,开始条件输入 Cross_for_Training_A.status == FINISHED。停止持续时间留空。文本框显示 $Name。选择每次重复设置
        3. 添加一个 Key_Response_Training_A,其开始条件为 Training_A.status == FINISHED。停止持续时间留空。勾选强制结束例程。允许按键输入 space;设置选择常量
        4. 添加一个 Cross_for_Training_A。其开始时间设为0;停止条件设为 Training_A.status == FINISHED。在文本输入框中输入“+”号,并选择每次重复设置
      4. 参照 Training_A 的类似流程准备 Training_B。
    3. 检查环节:选择正在讲话的三位说话人的姓名。
      1. 定义一个名为 Check 的循环,使用与训练环节相同的注视点和空白屏。
      2. 与训练环节不同,添加一个用于收集键盘反应的函数。在呈现屏幕中执行以下操作。
        1. 添加一个声音组件并命名为 Checking_audio,开始时间设为0,停止持续时间留空。声音输入框设为 $Sound,并开启“每次重复设置”。
        2. 添加一个名为 Show_names 的文本组件,开始条件写入命令:
          Checking_audio.status == FINISHED
          ​停止持续时间留空。文本框设为 $ People_Name,并开启“每次重复设置”。
        3. 添加一个键盘组件并命名为 Key_Response_Check,其开始条件为 Checking_audio.status == FINISHED,停止持续时间留空。勾选强制结束例程,允许按键为 num_1、num_2 和 num_3,保持常量设置,以便被试使用数字小键盘索引其选择。
        4. 添加一个名为 Cross_Check 的注视点,开始时间设为0,停止条件输入 Checking_audio.status == FINISHED。在文本框中添加“+”号,并选择“每次重复设置”。
      3. 插入一个代码组件。在“实验开始”部分,将 total_trials、current_correct、current_incorrect 和 current_accuracy 初始化为0。在“例程开始”部分,将 user_input 定义为 None。在“每帧”部分,从键盘收集用户输入,并与电子表格文件中存储的正确响应进行比对,使用 key code user_key = Key_Response_Check.keys 提取1、2或3。然后将其与电子表格中名为 Correctly_recognize_one_out_of_three 的列中存储的1、2或3进行比对。
      4. 退出循环后,确保出现反馈屏幕,显示以下信息:check_feedbacks.text = f" 第二步已完成。\n您已识别了总共 {total_trials} 句话中的说话人,\n正确识别了 {current_correct} 位说话人,\n错误判断了 {current_incorrect} 位说话人。\n您的总体准确率为 {current_accuracy}%。\n\n如果准确率低于83.33%,请向实验员示意,\n您将重新熟悉上述三位说话人。\n\n如果达到要求,请按空格键继续。
    4. 测试环节:分类旧说话人与新说话人
      1. 定义一个名为 Testing 的循环。它包括注视点和空白屏(与训练环节相同)以及一个呈现屏幕。
      2. 按如下方式准备呈现部分。
        1. 添加一个声音播放组件 Testing_sound,设置与训练环节相同。添加一个 Key_response_old_new 组件,其开始条件为 Testing_sound.status == FINISHED,停止持续时间留空,并勾选强制结束例程。在允许按键中包含 f 和 j,并选择常量
      3. 添加一个名为 Testing_old_new 的文本组件,开始条件为 Testing_sound.status == FINISHED,停止持续时间留空,文本框留空并选择“每次重复设置”——文本将由后续代码组件定义。
      4. 添加一个 Cross_Testing,开始时间设为0,停止条件为 Testing_sound.status == FINISHED,文本框中输入“+”号,并开启“每次重复设置”。
      5. 添加一个如下所述的代码组件。
        1. 在“实验开始”部分,初始化试验总数(total_trials_t)、正确试验数(correct_trials_t)和错误试验数(incorrect_trials_t)。
        2. 在“例程开始”部分,首先进行条件判断,根据被试编号(expInfo["Participant"])确定呈现格式。如果编号为奇数,则确保旧与新刺激识别的说明以一种格式呈现,即("旧(F) 新(J)")或("新 (F) 旧 (J)")。
        3. 在此循环之外,有一个带代码组件的反馈屏幕。确保每帧部分读取:testing_feedbacks.text = f"您已识别了总共 {total_trials_t} 句话中的说话人,\n正确识别了 {correct_trials_t} 位说话人,\n错误判断了 {incorrect_trials_t} 位说话人。\n您的总体准确率为 {accuracy_t:.2f}%。\n请按空格键结束当前部分。
    5. 按如下所述将程序与Brain Products系统连接。
      1. 通过将每个音频的起始点设为标记来同步标记。在 Training_A 循环开始之前,在“实验开始”代码组件中定义EEG标记发送协议,如下所述。
        1. 导入必要的PsychoPy组件,包括parallel模块,并使用0x3EFC配置并行端口地址。
        2. 建立一个 sendTrigger 函数以发送EEG标记。该函数在验证其为NumPy整数并按需转换后,通过 parallel.setData(triggerCode) 经由并行端口发送指定的 triggerCode。
        3. 添加16毫秒的短暂等待,以确保在通过 parallel.setData(0) 重置触发通道为0之前捕获标记。
      2. 使用 sendTrigger() 向EEG记录器发送标记。在括号中包含相应列的确切名称。在本研究中,有 training_a_marker、training_b_marker、check_marker 和 testing_marker——参考电子表格中先前定义的列。

3. 采集脑电图数据

  1. 准备场地
    注意:至少需要两台计算机来完成数据采集。一台用于连接脑电图(EEG)系统,另一台用于采集行为数据。建议设置一个额外的屏幕,用于镜像显示行为数据采集计算机的界面。该系统由一个放大器和被动式脑电帽组成。
    1. 本研究招募无任何自述言语听力障碍的参与者,并确保其无任何精神或神经系统疾病。共筛选出43名参与者,其中3人因脑电标记对齐问题被排除。剩余40名参与者中,女性20名,男性20名。女性年龄为20.70 ± 0.37岁,男性为22.20 ± 0.37岁;女性受教育年限为17.55 ± 0.43年,男性为18.75 ± 0.38年。
    2. 分配参与者编号,并邀请参与者在实验前一小时内清洗并吹干头发 实验前1小时
    3. 将电解质凝胶与研磨性电解质凝胶按1:3的比例混合,并加入少量水。在容器中用勺子将混合物搅拌均匀。
    4. 准备尖头棉签和干燥的脑电帽。
    5. 让受试者舒适地坐在椅子上,并告知他们实验人员将为其佩戴脑电图(EEG)帽。解释称,实验人员会使用棉签在帽上的小孔中涂抹导电膏,该导电膏对人体无害,且有助于增强脑电信号的接收。
    6. 向参与者提供实验任务说明及实验知情同意书。在获得参与者的签名后,进入准备阶段。
    7. 将EEG帽连接至放大器,放大器再连接至EEG数据采集计算机。本研究使用被动式帽,因此需借助额外的显示器来检查64个电极上的颜色指示。
    8. 打开 BrainVision Recorder33 并导入一个已定义好记录参数的自定义工作区文件。单击 监测 检查阻抗。颜色条从红色到绿色,受设定的电阻水平影响,目标阻抗范围为 0 到 10 kΩ
  2. 准备参与者
    1. 让受试者在椅子上坐直。根据受试者头部选择合适尺寸(54 或 56 号)的凝胶型被动电极系统,并确保电极系统按照国际 10-20 系统正确佩戴。28,34.
    2. 首先,将一次性棉签浸入导电膏中,然后涂抹到帽孔内,确保与受试者的头皮充分接触摩擦。当脑电数据采集计算机上相应电极的指示灯变为绿色时,表明该电极已成功采集到最佳数据。
    3. 除两个独立侧电极外,屏幕上所有电极均显示指示颜色后 变为绿色(在监视器屏幕上) 将导电膏涂抹于侧电极上。将左侧电极贴附于受试者左眼下方眼睑区域,右侧电极贴附于右侧太阳穴附近。
    4. 当所有电极均显示为绿色时,将弹性网罩戴在受试者头部,以帮助脑电帽更牢固、稳定地贴合于受试者头部。
    5. 为受试者佩戴有线耳机(实验室专用的气导耳机)。关闭电磁屏蔽室门,通过麦克风指导受试者的动作,实现屏蔽室内内外的沟通。同时,通过外部显示器监测受试者的身体活动,例如提醒其避免大幅度移动;并通过行为数据监控器实时监控受试者在行为任务中的完成情况。
    6. 要求参与者佩戴通过音频接口连接到行为数据采集计算机的耳机。
  3. 独立分块运行实验
    1. 在用于采集脑电图数据的计算机上,打开 BrainVision Recorder 软件,点击 Monitor 以再次检查阻抗,然后点击 Stat/Resume Recording 开始记录。创建一个新的脑电图记录文件,并根据需要命名,例如 14_2,表示第 14 号被试的第二个实验区块。
    2. 打开 PsychoPy 程序中的运行实验(绿色按钮)以进行行为实验,输入被试的编号(例如:14)和对应的区块编号(例如:2),然后点击 好的 开始实验。
    3. 在参与者完成行为数据计算机上的检查阶段后,密切监控屏幕上报告的数据准确性。如果准确率低于12次中的10次,则要求参与者重新进行训练阶段,直至达到所需准确率,方可进入测试阶段。
    4. 密切关注参与者完成该区块测试阶段后屏幕上报告的新旧识别最终准确率。如果准确率异常偏低(例如低于50%),应向参与者询问可能的原因。
  4. 脑电图实验后
    1. 在参与者完成所有实验模块后,邀请其清洗头发。使用牙刷清除脑电帽上的残留导电膏,注意避免弄湿信号连接器,并将其包裹在塑料袋中。清洁完毕后,将脑电帽悬挂在通风良好的地方晾干。
    2. 将脑电图(EEG)数据和行为学数据复制到便携式硬盘中,并确保EEG数据与行为学数据相互对应。例如,EEG数据包含两个文件:14_2.eeg 和 14_2.vhdr,行为学数据则为 14_2.xlsx 文件。

4. 脑电图数据处理

注意:以下描述涉及使用 MATLAB 和 RStudio 进行批量处理的脑电图(EEG)数据预处理、统计分析和可视化。

  1. 使用 MATLAB 预处理 EEG 数据
    1. 合并 EEG 数据与行为数据
      1. 由于参与者可能需要重做任务以达到至少 10/12 的准确率要求,这会影响 EEG 和行为数据的命名,例如 14_2.vhdr 可能变为 14_2(1).vhdr,因此需通过删除除 14_2 以外的字符来标准化文件名。在遍历每位参与者的数据时,将数据文件命名为 sub、stripped_filename 和 .set,从而自动生成如 sub14_2.set(包含元数据和指向 EEG 数据集的链接)和 sub10_1.fdt(实际的 EEG 数据)的文件。此操作会将 14_2.vhdr 和 14_2.eeg 文件重命名为 sub14_2.fdt 和 sub14_2.set。
      2. 使用 EEG = pop_mergeset() 函数将每位参与者的不同区块数据按时间顺序(而非区块编号 1,2,3,4 的数值顺序)合并为单个文件。
      3. 根据时间顺序将每位参与者的多个行为数据文件合并为一个电子表格,这对于后续同步至关重要。
      4. 自定义代码以同步 EEG 信号中的试验与行为信号中的试验。例如,testing_list = [37:108, 145:216, 253:324, 361:432] 将对应四个区块的 EEG 标记点。
      5. 将行为数据电子表格转换为 .txt 文件,生成一个行列均包含数据的表格。列名包括步骤 2.1 中提到的大部分名称。
      6. 通过添加信息重新定义 EEG 数据内容,使用类似以下代码:EEG = pop_importepoch(EEG, behav_txt_path, {'Epoch', 'Sound', 'Speaker', 'Gender', 'Confidence_level', 'old_new_speaker', 'same_different_prosody', 'Response'}, 'timeunit', 1, 'headerlines', 1)。该过程通过批处理合并每位参与者的 EEG 与行为数据。
        注:Response 值 1 和 0 来自行为数据,其中 1 表示正确判断,0 表示错误判断。
    2. 预处理 EEG 数据
      1. 进行参考与重参考29,35,调用 pop_reref 函数将 EEG 数据重参考至 FCz 电极,确保每个信号均相对于 FCz 电极计算。使用 pop_reref 函数将 EEG 数据重参考至第 28 和 29 通道,代表位于后头皮的双侧乳突电极,确保每个信号均相对于双侧乳突计算。
      2. 设置高通滤波器(用于去除线性趋势):EEG = pop_eegfiltnew(EEG, [], 0.1, 16500, 1, [], 0),并在 -500 至 0 ms 范围内进行基线校正:EEG = pop_rmbase(EEG, [-500 0])。
      3. 手动检查不良试验:使用 EEGLAB 导入数据后,选择 Plot,然后点击 Channel Data (scroll),并将 Value 的最大值设为 50。
      4. 删除可见肌肉活动及其他类型伪迹的试验,并标记不良电极:将鼠标悬停在通道波形上会显示其电极。记录所有不良电极,返回 EEGLAB 主页面,选择 Tools 下的 Interpolate Electrodes,选择 Select from Data Channels,选中需要插值的电极,点击 OK 确认。将文件保存到新文件夹。
      5. 执行主成分分析(PCA):EEG = pop_runica(EEG, 'extended', 1, 'pca', 30, 'interupt', 'on')。手动拒绝有问题的独立成分(ICA),去除眼动、肌肉和通道噪声伪迹,然后保存文件。
      6. 使用 pop_eegthresh 函数设置 -75 至 +75 Hz 的阈值以去除极端值34,36,37
      7. 使用 pop_eegfiltnew 并将参数(第三个输入参数)设为 30,保留 30 Hz 及以下频率38
      8. 自定义代码列出所有感兴趣的条件,包括 old_new_speaker = {'old', 'new'};same_different_prosody = {'same', 'different'};Confidence_level = {'c', 'd'};Response = {'1', '0'}。然后组合这些条件创建如 sub1_new_different_c_0 的数据组合,并将其保存为扩展名为 txt 的文件。
  2. 使用 RStudio 进行事件相关电位(ERPs)分析
    1. 为组织数据,将其转换为长格式。将所有 .txt 文件导入 RStudio,并使用 rbind 函数将每个临时数据框追加至 alldata,创建一个包含所有文件数据的大型数据框。为准确起见,将所有数据中的 Row 列重命名为 Time。使用 melt 函数将 alldata 从宽格式转换为长格式(Data_Long),其中每个观测占据一行,并包含所有相关条件和通道信息。
    2. 使用 dplyr 包中的 filter 函数选择符合特定条件的数据:Judgement 为 1,Source 为 h,Memory 为 old 或 new,Prosody 为 c 或 d。
    3. 根据电极通道定义区域如下:左侧前部(F3, F7, FC5, F5, FT7, FC3, AF7, AF3);左侧中部(C3, T7, CP5, C5, TP7, CP3);左侧后部(P3, P7, P5, PO7, PO3);中线前部(Fz, AFz, FC1, FC2, F1, F2, FCz);中线中部(CP1, CP2, Cz, C1, C2, CPz);中线后部(Pz, O1, Oz, O2, P1, POz, P2);右侧前部(FC6, F4, F8, FC4, F6, AF4, AF8, FT8);右侧中部(CP6, C4, T8, CP4, C6, TP8);右侧后部(P4, P8, PO4, PO8, P6)。将这些区域分组为前部、中部和后部区域。
    4. 保存工作空间以便后续加载数据。使用 setwd() 保存,使用 load() 加载。
  3. 统计分析
    1. 对所有电极的 EEG 数据进行分析时,筛选数据集,仅包含 Judgement 为 1、Source 为 h、Memory 为 old 或 new、Subject 非空且 Time 在 400 至 850 ms 之间的数据点。
    2. 根据预定义映射更新感兴趣区域(ROI)的名称。例如,left anterior、medial anterior 和 right anterior 归为 anterior。
    3. 使用 lme4 包中的 lmer 拟合线性混合效应模型39,以 Voltage 为响应变量,Memory 和 ROI 为固定效应,并包含 Subject 和 Channel 的随机截距:fit_time_window <- lmer(Voltage ~ Memory * ROI + (1|Subject) + (1| channel), data=DATA)。将 DATA 替换为 combined、confidently only 和 doubtful-only 数据重复执行。参见 OSF 上的示例代码32
      1. 从拟合模型中获取分析结果:anova(fit_time_window)、eta_squared(fit_time_window) 和 emmeans(fit_time_window, specs = pairwise ~ Memory * ROI, adjust = "Tukey")。
    4. 对 Pz 电极的 EEG 数据进行分析时,在筛选数据集时遵循上述相同步骤,但还需添加条件 Channel == 'ChPz'。重复上述过程,但使用 lmer(Voltage ~ Memory + (1|Subject)) 分析 400 至 850 ms 的 Pz 数据。
    5. 绘制 Pz 的事件相关电位(ERPs)图(在 combined、confidently only 和 doubtful only 数据集上重复进行),筛选数据集,仅包含 Judgement 为 1、Source 为 h、Memory 为 old 或 new 且 Subject 非空的数据点。
      1. 定义包含多个电极点(包括 Pz)的向量,并在其前添加 Ch 以匹配数据中的通道命名约定。从中选出 Pz。
      2. 指定 ERP 分析的时间窗口:time_window <- c(400, 850)。定义感兴趣的电极,即 Pz。遍历所选电极并按以下描述创建图表。
        1. 使用 filter (Channel == k) 筛选 Pz 电极的数据,以隔离相关数据点。
        2. 基于 Memory 条件使用 interaction(current_channel_data$Memory) 创建线型和颜色的交互因子,并将条件标记为 Old 和 New。
        3. 使用 summarySEwithin 函数计算 Voltage 测量值随时间变化的汇总统计量和标准误,指定 Voltage 为测量变量,Time 为组内变量。
        4. 生成 Pz 电极的 ERP 图,通过使用 geom_rect 及参数 xmin、xmax、ymin 和 ymax 为指定时间窗口添加背景。使用 geom_ribbon 包含标准误带,使用 geom_line 绘制平均电压。使用 scale_x_continuous、scale_y_reverse、scale_linetype_manual、scale_fill_manual 和 scale_color_manual 等函数自定义图表外观和标签。
      3. 使用 theme_minimal 作为基础主题,并通过 theme 进一步自定义文本大小和图例位置。
  4. 使用 MATLAB 绘制地形图
    1. 导入数据并设置条件,使用 subject_list = 1:40 定义从 1 到 40 的受试者列表。定义两个空元胞数组以存储旧和新条件下正确分类的数据:"human_timelocked_old_correct = {}; human_timelocked_new_correct = {}。遍历受试者列表,导入每位受试者的数据,并根据条件进行筛选。
    2. 从原始 EEGLAB 数据中提取事件信息,仅选择 Response 等于 1 的事件。选择 Source 等于 h 的试验,并相应更新数据结构。分离旧和新条件的数据,仅限 Source 为 h 的正确试验,并进行锁时分析。
      1. 计算旧和新条件的总平均值:cfg = []; grandavg_old_correct = ft_timelockgrandaverage(cfg, human_timelocked_old_correct{:}); grandavg_new_correct = ft_timelockgrandaverage(cfg, human_timelocked_new_correct{:})。
    3. 执行如下所述的置换检验。
      1. 使用指定布局文件定义邻域配置:cfg_neigh = []; cfg_neigh.method = 'distance'; cfg_neigh.layout = 'path_to_layout_file'; neighbours = ft_prepare_neighbours(cfg_neigh)。
      2. 配置置换检验的参数,包括设计矩阵和统计方法:cfg = []; cfg.method = 'montecarlo'; cfg.statistic = 'ft_statfun_indepsamplesT'; cfg.correctm = 'cluster'; cfg.clusteralpha = 0.05; cfg.clusterstatistic = 'maxsum'; cfg.minnbchan = 2; cfg.tail = 0; cfg.clustertail = 0; cfg.alpha = 0.05; cfg.numrandomization = 1000; cfg.neighbours = neighbours; cfg.design = [2*ones(1, length(human_timelocked_new_correct)) ones(1, length(human_timelocked_old_correct))]; cfg.ivar = 1。此外,请参考以下链接(https://www.fieldtriptoolbox.org/tutorial/cluster_permutation_freq/)获取使用 Fieldtrip​40 的教程。
      3. 对旧和新条件的平均数据执行统计检验:stat = ft_timelockstatistics(cfg, human_timelocked_old_correct{:}, human_timelocked_new_correct{:})。
    4. 执行如下所述的自定义区间绘图。
      1. 计算两个条件之间的差异:cfg = []; cfg.operation = 'subtract'; cfg.parameter = 'avg'; grandavg_difference = ft_math(cfg, grandavg_old_correct, grandavg_new_correct)。
      2. 定义时间窗口:time_windows = { [0.500, 0.800] % LPC}。
      3. 创建图形并使用 ft_topoplotER(cfg_plot, grandavg_difference) 绘制条件间的差异。

结果

经典的旧/新效应表现为:当测试阶段的语音内容与训练阶段相匹配时,尤其是在旧说话人条件下相较于新说话人条件,受试者在Pz电极(300至700 ms)上的脑活动显著增强22。本方案揭示了该效应的一个更新版本:首先,在400至850 ms时间窗内,旧说话人条件在Pz电极以及全脑区域均表现出比新说话人条件更强的正向波形趋势;其次,测试阶段的语音内容将不同于训练阶段;第三,自信和怀疑两种语调条件均预期呈现上述趋势;最后,旧/新效应在测试阶段的怀疑语调条件下更为显著(图2)。

使用以下公式的LMER分析

lmer(电压 ~ 记忆 * 脑区 + (1|受试者) + (1|通道))

表明记忆类型(旧与新)和感兴趣区域(ROI)均存在主效应,且记忆与ROI之间存在交互作用(表1)。进一步的事后分析显示,在所有脑区中,旧刺激条件下的正电压均大于可疑条件,包括前部、中央和后部区域(表2)。比较各β值发现,旧/新效应在中央和后部电极上比在前部电极上更为显著:对于合并数据集,前部β值 = 0.40,中央β值 = 0.63,后部β值 = 0.60;对于高置信度数据集,前部β值 = 0.61,中央β值 = 0.63,后部β值 = 0.76;而对于可疑数据集,前部β值 = 0.44,中央β值 = 0.87,后部β值 = 0.69。中央和后部电极的参与在可疑语调条件下最为明显。

根据公式

lmer(电压 ~ 记忆 + (1|受试者))

我们证实了Pz电极上存在旧/新效应。在Pz电极处,观察到记忆(旧 vs. 新)的主效应(F(1, 69341.99) = 120.46, p < .001, η²p = .002, β = .425, SE = .039, z-ratio = 10.98, p < .001)。在仅确信条件下,Pz电极处观察到记忆(旧 vs. 新)的主效应(F(1, 34318.32) = 5.04, p = .025, η²p = .0001, β = .125, SE = .056, z-ratio = 2.25, p = .025)。在仅怀疑条件下,Pz电极处同样观察到记忆(旧 vs. 新)的主效应(F(1, 34993.20) = 317.02, p < .001, η²p = .009, β = .914, SE = .051, z-ratio = 17.81, p < .001)。

实验设计示意图;训练、检查、测试阶段,以及音频试验的韵律分析。
图1:每个区块数据收集的工作流程。 在(A)训练阶段,听者听到一个声音,并将随后呈现的姓名与该声音关联。需要记住三位之前出现过的说话人。程序中出现的语言原本为中文。A 和 C 代表如张晓(小张)之类的姓名。在(B)检查阶段,听者通过按下数字键上的 1、2 或 3,在听到声音时识别说话人的姓名,从而将声音身份与诸如赵晓(小赵)之类的姓名进行关联。在(C)测试阶段,听者听到一个声音,并判断其是由之前出现过的说话人还是新说话人说出。如(D)韵律设计所示,听者学习三位说话人仅以自信或怀疑的语气表达,但会听到六位说话人分别以自信和怀疑的语气说话。A 版本与 B 版本的出现互斥。若 A 版本与男性或女性说话人同时出现,则 B 版本将与相应的女性或男性说话人同时出现。请点击此处查看此图的放大版本。

脑电电压图与地形图;结合、自信、怀疑刺激分析。
图 2:新旧效应。A, B, C)图中分别显示了语调结合、仅自信和仅怀疑条件下,Pz电极在400至850毫秒时间窗内的灰色标记事件相关电位(ERP)。(D, E, F)图中分别展示了在所有电极(以黑点表示)上,语调结合、仅自信和仅怀疑条件下旧项目减去新项目的地形图分布。请点击此处查看该图的放大版本。

情境脑区F 值Pr(>F)偏 eta 方
综合记忆9938.98.00.00
感兴趣区4.13.02.13
记忆:感兴趣区182.37.00.00
确信记忆7291.22.00.00
感兴趣区3.60.03.12
记忆:感兴趣区41.94.00.00
怀疑记忆8333.38.00.00
感兴趣区4.65.01.15
记忆:感兴趣区290.15.00.00

表1:脑区间新/旧效应的线性混合效应模型(LMER)分析结果:综合、确信和怀疑数据集。通过事后分析,* 表示 p < .05 时显著,** 表示 p < .01 时显著,*** 表示 p < .001 时显著。

情境脑区对比估计值标准误z 值p 值
综合前部旧-新.40.0143.70.00***
中央旧-新.63.0161.74.00***
后部旧-新.60.0167.51.00***
确信前部旧-新.61.0146.63.00***
中央旧-新.63.0143.22.00***
后部旧-新.76.0159.95.00***
存疑前部旧-新.44.0135.95.00***
中央旧-新.87.0164.05.00***
后部旧-新.69.0157.75.00***

表2:不同脑区间新/旧效应的事后检验结果:综合、确信及怀疑数据集。通过事后分析,显著性水平为 p < .001(***)。

讨论

该研究提出了一种用于脑电图(EEG)数据采集与分析的流程,重点在于识别先前学习过的说话人身份。本研究解决了学习阶段与识别阶段之间的差异问题,包括言语内容22和韵律特征10的差异。该设计可适用于多个研究领域,包括心理语言学中的代词及回指加工等研究41

训练-测试范式是一种经典的实验设计,用于评估参与者在特定主题上的学习效果,例如声音学习42,43。该范式通过准确率来评估参与者对特定信息的掌握程度10。研究人员可在受控的实验条件下逐步引入变量,例如在训练和测试阶段采用不同的语调,以探究这些变量对声音识别准确率的影响,例如VTL/F0调制的声音23、恐惧与中性语调10,或本研究中的怀疑与自信语调。

然而,该范式存在局限性。学习环境与测试环境之间的差异可能影响实验结果的有效性,因为受控的学习条件可能无法反映更具可变性的测试条件。例如,训练阶段使用单一的语调模式,而非成比例的差异(如30%对比70%)44。为解决这种不平衡,确保更丰富的学习环境可以更好地模拟现实生活中的场景,即说话者在与听者交流时会使用多种不同的语调模式。此外,本研究承认,实验设计的复杂性(涉及多个阶段以及使用R Studio、MATLAB和Python等工具进行的复杂编程)对于初学者而言可能具有挑战性。

主要发现强调了充分熟悉和检查阶段的重要性。Xu 和 Armony 的研究指出,如果没有足够的训练和高于随机水平的检查,听者难以识别出熟悉的说话人身份10。此外,Zaske 等人发现,只有在重复相同文本时才会出现LPC旧/新效应,而在使用不同文本时则不存在该效应22。本研究通过引入检查阶段,揭示了即使采用不同的文本刺激,旧/新ERP效应仍然持续存在,从而支持了fMRI研究的结论21。该研究提示,对于基于训练-测试范式的实验设计,插入检查环节至关重要。这有助于听者建立对说话人声学特征的稳定印象,并将特定说话人与某个符号(例如姓名)关联起来23。如果未能充分学习说话人的表征,听者可能难以适应同一说话人内部的语音变异10

本研究还观察了韵律作为说话人识别绑定线索的作用45。与以往认为韵律可能阻碍对熟悉说话人识别的观点相反,本研究发现在自信和怀疑的韵律条件下均存在新旧效应。这一稳健的效应表明韵律在说话人识别中具有调节作用。进一步分析揭示了不同韵律条件下前部脑区激活的差异。与怀疑的韵律相比,自信的韵律在前部脑区引发的旧/新效应水平较低。该发现提示,由于发声道长度增加和基频降低,自信的言语可能使说话人识别更具挑战性,从而可能引起听者更多的注意11,29

本研究的设计可为未来针对患者群体(如面孔失认症或语音失认症患者)识别障碍的研究提供参考46,47。此外,对注意力持续时间较短的参与者(例如自闭症谱系障碍个体)进行适应性调整,可能有助于提高研究的可及性48

此外,该范式还超越了说话人识别,进一步探讨了心理语言学研究中的代词加工及回指理解。Cooplands 和 Nieuwland41 揭示了神经振荡同步模式如何区分回指理解中的先行词激活与整合过程,这与本研究对身份相关线索的探索相一致。本文中的类似线索包括交际风格(例如字面陈述或反语)、语序(主语-宾语-动词(SOV)或宾语-主语-动词(OSV)句法结构44,45,49,50),以及声音表达类型(自信与怀疑的语调)。

披露

无任何信息需要披露。

致谢

本工作得到国家自然科学基金(项目编号:31971037);由上海教育发展基金会和上海市教育委员会支持的曙光计划(项目编号:20SG31);上海市自然科学基金(项目编号:22ZR1460200);上海外国语大学导师指导计划(项目编号:2022113001);以及国家社会科学基金重大项目(项目编号:18ZDA293)的资助。

材料

本文使用的材料清单
姓名公司目录编号评论
用于 BrainAmp 的 64 导标准脑电帽Easycap GmbHSteingrabenstrasse 14 DE-82211https://shop.easycap.de/products/64ch-standard-braincap
研磨性电解质凝胶Easycap GmbHAbralyt 2000https://shop.easycap.de/products/abralyt-2000
actiCHamp PlusBrain Products GmbH64 导 + 8 个辅助通道https://www.brainproducts.com/solutions/actichamp/
音频接口Native Instruments GmbHKomplete audio 6https://www.native-instruments.com/en/products/komplete/audio-interfaces/komplete-audio-6/
泡沫耳塞NeuronixER3-14 https://neuronix.ca/products/er3-14-foam-eartips
基于凝胶的被动电极系统Brain Products GmbHBC 01453https://www.brainproducts.com/solutions/braincap/
高黏度电解质凝胶 Easycap GmbHSuperVischttps://shop.easycap.de/products/supervisc

参考文献

  1. Larrouy-Maestri, P., Poeppel, D., Pell, M. D. The sound of emotional prosody: Nearly 3 decades of research and future directions. Perspect Psychol Sci. , 17456916231217722(2024).
  2. Pell, M. D., Kotz, S. A. Comment: The next frontier: Prosody research gets interpersonal. Emotion Rev. 13 (1), 51-56 (2021).
  3. Cummins, N., et al. Multilingual markers of depression in remotely collected speech samples: A preliminary analysis. J Affect Disor. 341, 128-136 (2023).
  4. Cummins, N., Baird, A., Schuller, B. W. Speech analysis for health: Current state-of-the-art and the increasing impact of deep learning. Methods. 151, 41-54 (2018).
  5. Kennedy, E., Thibeault, S. L. Voice-gender incongruence and voice health information-seeking behaviors in the transgender community. Am J Speech-language Pathol. 29 (3), 1563-1573 (2020).
  6. Zäske, R., et al. Electrophysiological correlates of voice memory for young and old speakers in young and old listeners. Neuropsychologia. 116, 215-227 (2018).
  7. Lavan, N., Burton, A. M., Scott, S. K., Mcgettigan, C. Flexible voices: Identity perception from variable vocal signals. Psychonomic Bullet Rev. 26, 90-102 (2019).
  8. Perrachione, T. K., Del Tufo, S. N., Gabrieli, J. D. Human voice recognition depends on language ability. Science. 333 (6042), 595-595 (2011).
  9. Lavan, N., Knight, S., Mcgettigan, C. Listeners form average-based representations of individual voice identities. Nat Comm. 10 (1), 2404(2019).
  10. Xu, H., Armony, J. L. Influence of emotional prosody, content, and repetition on memory recognition of speaker identity. Quart J Exp Psychol. 74 (7), 1185-1201 (2021).
  11. Jiang, X., Pell, M. D. The sound of confidence and doubt. Speech Comm. 88, 106-126 (2017).
  12. Winters, S. J., Levi, S. V., Pisoni, D. B. Identification and discrimination of bilingual talkers across languages. J Acoustical Soci Am. 123 (6), 4524-4538 (2008).
  13. Orena, A. J., Polka, L., Theodore, R. M. Identifying bilingual talkers after a language switch: Language experience matters. J Acoustical Soc Am. 145 (4), EL303-EL309 (2019).
  14. Xie, X., Myers, E. The impact of musical training and tone language experience on talker identification. J Acoustical Soc Am. 137 (1), 419-432 (2015).
  15. Kadam, M. A., Orena, A. J., Theodore, R. M., Polka, L. Reading ability influences native and non-native voice recognition, even for unimpaired readers. J Acoustical Soc Am. 139 (1), EL6-EL12 (2016).
  16. Fleming, D., Giordano, B. L., Caldara, R., Belin, P. A language-familiarity effect for speaker discrimination without comprehension. Proc Natl Acad Sci. 111 (38), 13795-13798 (2014).
  17. White, K. S., Yee, E., Blumstein, S. E., Morgan, J. L. Adults show less sensitivity to phonetic detail in unfamiliar words, too. J Memory Lang. 68 (4), 362-378 (2013).
  18. Levi, S. Methodological considerations for interpreting the language familiarity effect in talker processing. Wiley Interdiscip Revi: Cognitive Sci. 10 (2), e1483(2019).
  19. Perrachione, T. K. Recognizing Speakers Across Languages. The Oxford Handbook of Voice Perception. Frühholz, S., Belin, P. , Oxford University Press. 515-538 (2018).
  20. Lavan, N., Burton, A. M., Scott, S. K., Mcgettigan, C. Flexible voices: Identity perception from variable vocal signals. Psychonomic Bullet Rev. 26 (1), 90-102 (2019).
  21. Zäske, R., Hasan, B. aS., Belin, P. It doesn't matter what you say: Fmri correlates of voice learning and recognition independent of speech content. Cortex. 94, 100-112 (2017).
  22. Zäske, R., Volberg, G., Kovács, G., Schweinberger, S. R. Electrophysiological correlates of voice learning and recognition. J Neurosci. 34 (33), 10821-10831 (2014).
  23. Lavan, N., Knight, S., Mcgettigan, C. Listeners form average-based representations of individual voice identities. Nat Comm. 10 (1), 1-9 (2019).
  24. Chen, W., Jiang, X. Voice-Cloning Artificial-Intelligence Speakers Can Also Mimic Human-Specific Vocal Expression. Preprints. , 10.20944/preprints202312.0807.v1 (2023).
  25. Pisanski, K., Anikin, A., Reby, D. Vocal size exaggeration may have contributed to the origins of vocalic complexity. Philosoph Trans Royal Soc B. 377 (1841), 20200401(2022).
  26. Belin, P., Fecteau, S., Bedard, C. Thinking the voice: Neural correlates of voice perception. Trend Cognitive Sci. 8 (3), 129-135 (2004).
  27. Boersma, P., Weenink, D. Praat: doing phonetics by computer. , Available from: https://www.fon.hum.uva.nl/praat/ (2022).
  28. Jiang, X., Pell, M. D. On how the brain decodes vocal cues about speaker confidence. Cortex. 66, 9-34 (2015).
  29. Jiang, X., Gossack-Keenan, K., Pell, M. D. To believe or not to believe? How voice and accent information in speech alter listener impressions of trust. Quart J Exp Psychol. 73 (1), 55-79 (2020).
  30. Rigoulot, S., Pell, M. D. Seeing emotion with your ears: Emotional prosody implicitly guides visual attention to faces. PloS One. 7 (1), e30740(2012).
  31. Cui, X., Jiang, X., Ding, H. Affective prosody guides facial emotion processing. Curr Psychol. 42 (27), 23891-23902 (2023).
  32. Chen, W., Jiang, X. Memorization-based training and testing paradigm for robust vocal identity recognition in expressive speech using event-related potentials analysis. , Available from: https://osf.io/6zu83/ (2024).
  33. Gmbh, B. P. Brainvision recorder. , Available from: https://www.brainproducts.com/downloads/recorder/ (2024).
  34. Jiang, X., Paulmann, S., Robin, J., Pell, M. D. More than accuracy: Nonverbal dialects modulate the time course of vocal emotion recognition across cultures. J Exp Psychol. 41 (3), 597(2015).
  35. Jiang, X., Pell, M. D. The feeling of another's knowing: How "mixed messages" in speech are reconciled. J Exp Psychol. 42 (9), 1412(2016).
  36. Zhou, X., et al. Semantic integration processes at different levels of syntactic hierarchy during sentence comprehension: An erp study. Neuropsychologia. 48 (6), 1551-1562 (2010).
  37. Jiang, X., Tan, Y., Zhou, X. Processing the universal quantifier during sentence comprehension: Erp evidence. Neuropsychologia. 47 (8-9), 1799-1815 (2009).
  38. Acunzo, D. J., Mackenzie, G., Van Rossum, M. C. W. Systematic biases in early erp and erf components as a result of high-pass filtering. J Neurosci Meth. 209 (1), 212-218 (2012).
  39. Bates, D. Fitting linear mixed models in r. R. 5 (1), 27-30 (2005).
  40. Oostenveld, R., Fries, P., Maris, E., Schoffelen, J. M. Fieldtrip: Open source software for advanced analysis of meg, eeg, and invasive electrophysiological data. Computat Intelligence Neurosci. 2011, 1-9 (2011).
  41. Coopmans, C. W., Nieuwland, M. S. Dissociating activation and integration of discourse referents: Evidence from erps and oscillations. Cortex. 126, 83-106 (2020).
  42. Humble, D., et al. The jena voice learning and memory test (jvlmt): A standardized tool for assessing the ability to learn and recognize voices. Behavior Res Meth. 55 (3), 1352-1371 (2023).
  43. Holmes, E., To, G., Johnsrude, I. S. How long does it take for a voice to become familiar? Speech intelligibility and voice recognition are differentially sensitive to voice training. Psychol Sci. 32 (6), 903-915 (2021).
  44. Kroczek, L. O. H., Gunter, T. C. Communicative predictions can overrule linguistic priors. Sci Rep. 7 (1), 17581(2017).
  45. Kroczek, L. O. H., Gunter, T. C. The time course of speaker-specific language processing. Cortex. 141, 311-321 (2021).
  46. Schroeger, A., et al. Atypical prosopagnosia following right hemispheric stroke: A 23-year follow-up study with mt. Cognitive Neuropsychol. 39 (3-4), 196-207 (2022).
  47. Garrido, L., et al. Developmental phonagnosia: A selective deficit of vocal identity recognition. Neuropsychologia. 47 (1), 123-131 (2009).
  48. Schelinski, S., Borowiak, K., Von Kriegstein, K. Temporal voice areas exist in autism spectrum disorder but are dysfunctional for voice identity recognition. Social Cognitive Affective Neurosci. 11 (11), 1812-1822 (2016).
  49. Holle, H., Gunter, T. C. The role of iconic gestures in speech disambiguation: Erp evidence. J Cognitive Neurosci. 19 (7), 1175-1192 (2007).
  50. Regel, S., Coulson, S., Gunter, T. C. The communicative style of a speaker can affect language comprehension? Erp evidence from the comprehension of irony. Brain Res. 1311, 121-135 (2010).

重印与许可

标签

脑电图分析说话人识别记忆训练晚期正电位言语韵律熟悉说话人识别脑地形图