该研究引入了一种训练-测试范式,用于探究在确信与怀疑语调情境下事件相关电位的新/旧效应。数据显示,在Pz及其他电极处,400-850 ms时间窗口内晚正成分显著增强。该实验流程可用于探索言语韵律之外的其他因素及其对线索绑定目标识别的影响。
该研究引入了一种训练-测试范式,用于探究在确信与怀疑语调情境下事件相关电位的新/旧效应。数据显示,在Pz及其他电极处,400-850 ms时间窗口内晚正成分显著增强。该实验流程可用于探索言语韵律之外的其他因素及其对线索绑定目标识别的影响。
从语音流中识别熟悉的说话者是人类言语交流的一个基本方面。然而,目前尚不清楚听者如何在富有表现力的言语中仍能分辨说话者的身份。本研究建立了一种基于记忆的个体说话者身份识别方法,并配套开发了脑电图(EEG)数据分析流程,用于监测听者如何识别熟悉的说话者并区分陌生的说话者。EEG数据捕捉了基于声音进行新旧说话者区分过程中的实时认知活动,提供了大脑活动的实时测量指标,克服了反应时和准确率测量的局限性。该实验范式包含三个步骤:听者建立三个声音与其对应姓名之间的关联(训练阶段);听者从三个候选姓名中指出与某一声音对应的名字(检验阶段);听者在双选一迫选任务中区分三个熟悉的旧说话者声音和三个陌生的新说话者声音(测试阶段)。测试阶段中的语音语调分别为自信或怀疑两种类型。采用64通道EEG系统采集脑电数据,经过预处理后导入RStudio进行事件相关电位(ERP)和统计分析,同时导入MATLAB进行脑地形图分析。结果显示,在400–850 ms时间窗口内,无论是自信还是怀疑语调条件下,旧说话者条件相较于新说话者条件均诱发了更大的晚期正成分(LPC),该效应出现在Pz电极及其他更广泛分布的电极上。然而,在怀疑语调感知中,旧/新效应在中央区和后部电极上更为显著;而在自信语调条件下,该效应则出现在前部、中央区和后部电极上。本研究提出,该实验设计可作为研究各种情境下(例如,回指表达)说话者特异性线索绑定效应以及语音失认症等患者病理机制的参考范式。
人类的语音流包含丰富的信息,例如情绪1,2、健康状况3,4、生物学性别5、年龄6,以及更为重要的个体声音身份7,8。研究表明,人类听者具有较强的能力通过声音识别并区分他人的身份,能够克服说话者在声学空间中围绕其身份平均表征所产生的个体内变异9。这些变异源于声学参数的调整(如基频和声道长度,即F0和VTL),而这些调整并不对应明确的语用意图9,也与情绪韵律10以及传达说话者“知晓感”的声音自信度相关11。行为实验已关注多种影响听者识别说话者表现的因素,包括语言相关的操控8,12,13、参与者自身特征(如音乐经验或阅读能力)14,15,以及刺激材料的相关调整(如逆向语音或非词)16,17;更多内容可在文献综述中找到18,19。近年来少数实验探讨了说话者身份表征的个体差异如何可能削弱识别准确性,所考虑的因素包括高与低情绪表达性16以及中性与恐惧韵律之间的对比5;此外,一篇综述还指出更多潜在情境有待进一步研究20。
针对第一个研究空白,该研究提出,说话人识别的神经机制尚未充分探讨说话人内部变异如何影响听者的脑活动。例如,在Zäske等人开展的一项基于功能性磁共振成像(fMRI)的说话人识别任务中,当参与者正确识别出熟悉的说话人(旧说话人)与新说话人时,其右侧后部上颞回(pSTG)、右侧额下回/额中回(IFG/MFG)、右侧额内侧回以及左侧尾状核的激活程度均有所降低,且该效应不受语言内容是否相同的影响21。然而,Zäske等人此前的一项脑电图(EEG)研究在引入不同文本以实现说话人身份变化时,并未观察到这种新/旧效应22。具体而言,当听者听到熟悉的训练说话人重复相同文本(即语言内容无变化的重放)时,在Pz电极处检测到一个持续时间为300至700毫秒的更大的晚期正成分(LPC);而当说话人朗读新文本时,该成分则消失。
本研究支持 Zäske 等人21提出的观点,推测即使在训练和测试阶段使用不同的语言内容,事件相关电位(ERP)分析中仍可能观察到新/旧效应。这一推论基于以下观点:Zäske 等人22在使用不同文本的条件下未观察到新/旧效应,其原因可能在于训练任务中缺乏额外的核查环节,以确保身份学习的充分性和有效性,正如 Lavan 等人23所建议的那样。因此,本研究的首要目标是检验并验证这一假设。为实现该目标,本研究拟在训练-测试范式中增加一个核查环节22。
本研究旨在解决的另一个关键问题是,在语调变化存在的情况下,说话人识别的稳健性如何。以往的行为学研究表明,听者在不同语调条件下识别说话人尤为困难,这表明语调语境具有调节作用——在训练和测试语调不同的条件下,听者的表现较差。本研究将通过让听者识别熟悉说话人在自信或怀疑语调下的语音,来检验这一假设24。本研究预期,所观察到的事件相关电位(ERP)差异将有助于解释语调如何影响说话人身份的识别。
本研究的核心目标是考察说话人识别中“旧/新”效应的稳健性,具体探讨在自信语调与怀疑语调条件下识别说话人是否存在差异。Xu 和 Armony10 采用训练-测试范式进行了一项行为学研究,其结果表明,听者无法克服语调差异(例如,在中性语调下训练识别某一说话人,而在恐惧语调下进行测试),其识别准确率甚至低于随机水平10。声学分析显示,说话人表达不同情绪状态时伴随着声道长度(VTL)和基频(F0)的调制;例如,自信语调的特征是VTL延长和F0降低,而怀疑语调则相反11,24。另一项来自 Lavan 等人23 的研究进一步证实,听者能够适应说话人的VTL和F0变化,并基于平均值形成对说话人的表征。该研究从行为数据角度表明,听者仍有可能在不同语调间识别出说话人身份(例如,在自信语调下训练识别某一说话人,而在怀疑语调下进行测试;相关结果见另一篇正在撰写的论文)。然而,关于说话人识别的神经机制,特别是 Zäske 等人22 所观察到的“旧/新”效应是否具有普遍性,目前尚不明确。因此,本研究致力于验证在自信与怀疑语调作为测试情境下,“旧/新”效应的稳健性。
该研究在新旧效应研究领域突破了以往的研究范式。过去的研究主要关注新旧说话人识别如何影响感知,而本研究在此基础上进一步引入了两个置信度水平(确信与怀疑),从而构建了一个2+2研究范式。这使我们能够在确信和怀疑语调的语境下探究说话人识别问题。该范式有助于考察新旧效应的稳健性。对记忆效应以及在确信和怀疑语调语境下的感兴趣脑区(ROI)的分析,为这一研究提供了证据支持。
总体而言,本研究旨在更新对语音识别脑电图(EEG)相关机制的理解,提出以下两个假设:即使在1)语言内容不相同的情况下,以及2)存在自信与怀疑语调的情况下,仍可观察到EEG新旧效应中增大的晚期正成分(LPC)。本研究通过三步实验范式对上述假设进行了检验。首先,在训练阶段,参与者建立了三种声音与其对应名称之间的关联。随后,在检验阶段,参与者需从三个候选名称中识别出与特定声音相对应的名称。该检验步骤借鉴Lavan等人23的方法,旨在克服因旧说话者熟悉度不足而导致的问题——此前研究中,当训练与测试阶段的文本内容不一致时,未能观察到新旧效应6,且参与者无法在中性与恐惧语调之间识别同一说话者10。最后,在测试阶段,参与者需在二选一的迫选任务中区分三种旧说话者声音与三种新说话者声音,语音语调以自信或怀疑的形式呈现。脑电数据使用64通道EEG系统采集,并在分析前进行了预处理。统计分析和事件相关电位(ERP)分析在RStudio中进行,而脑地形图分析则使用MATLAB完成。
在设计细节方面,本研究提出了一项说话人身份学习实验,该实验控制了说话者的身高因素,因为身高与声道长度(VTL)相关,并会影响对说话者身份的感知23。这一因素还会影响社会性印象,例如对支配性的感知25,而此类高层次印象的形成可能与说话人身份的解码过程存在交互作用26。
上海外国语大学语言学研究所伦理委员会已批准下述实验设计。本研究已获得所有参与者的知情同意。
1. 音频库的制备与验证
2. 脑电数据采集的编程
3. 采集脑电图数据
4. 脑电图数据处理
注意:以下描述涉及使用 MATLAB 和 RStudio 进行批量处理的脑电图(EEG)数据预处理、统计分析和可视化。
经典的旧/新效应表现为:当测试阶段的语音内容与训练阶段相匹配时,尤其是在旧说话人条件下相较于新说话人条件,受试者在Pz电极(300至700 ms)上的脑活动显著增强22。本方案揭示了该效应的一个更新版本:首先,在400至850 ms时间窗内,旧说话人条件在Pz电极以及全脑区域均表现出比新说话人条件更强的正向波形趋势;其次,测试阶段的语音内容将不同于训练阶段;第三,自信和怀疑两种语调条件均预期呈现上述趋势;最后,旧/新效应在测试阶段的怀疑语调条件下更为显著(图2)。
使用以下公式的LMER分析
lmer(电压 ~ 记忆 * 脑区 + (1|受试者) + (1|通道))
表明记忆类型(旧与新)和感兴趣区域(ROI)均存在主效应,且记忆与ROI之间存在交互作用(表1)。进一步的事后分析显示,在所有脑区中,旧刺激条件下的正电压均大于可疑条件,包括前部、中央和后部区域(表2)。比较各β值发现,旧/新效应在中央和后部电极上比在前部电极上更为显著:对于合并数据集,前部β值 = 0.40,中央β值 = 0.63,后部β值 = 0.60;对于高置信度数据集,前部β值 = 0.61,中央β值 = 0.63,后部β值 = 0.76;而对于可疑数据集,前部β值 = 0.44,中央β值 = 0.87,后部β值 = 0.69。中央和后部电极的参与在可疑语调条件下最为明显。
根据公式
lmer(电压 ~ 记忆 + (1|受试者))
我们证实了Pz电极上存在旧/新效应。在Pz电极处,观察到记忆(旧 vs. 新)的主效应(F(1, 69341.99) = 120.46, p < .001, η²p = .002, β = .425, SE = .039, z-ratio = 10.98, p < .001)。在仅确信条件下,Pz电极处观察到记忆(旧 vs. 新)的主效应(F(1, 34318.32) = 5.04, p = .025, η²p = .0001, β = .125, SE = .056, z-ratio = 2.25, p = .025)。在仅怀疑条件下,Pz电极处同样观察到记忆(旧 vs. 新)的主效应(F(1, 34993.20) = 317.02, p < .001, η²p = .009, β = .914, SE = .051, z-ratio = 17.81, p < .001)。

图1:每个区块数据收集的工作流程。 在(A)训练阶段,听者听到一个声音,并将随后呈现的姓名与该声音关联。需要记住三位之前出现过的说话人。程序中出现的语言原本为中文。A 和 C 代表如张晓(小张)之类的姓名。在(B)检查阶段,听者通过按下数字键上的 1、2 或 3,在听到声音时识别说话人的姓名,从而将声音身份与诸如赵晓(小赵)之类的姓名进行关联。在(C)测试阶段,听者听到一个声音,并判断其是由之前出现过的说话人还是新说话人说出。如(D)韵律设计所示,听者学习三位说话人仅以自信或怀疑的语气表达,但会听到六位说话人分别以自信和怀疑的语气说话。A 版本与 B 版本的出现互斥。若 A 版本与男性或女性说话人同时出现,则 B 版本将与相应的女性或男性说话人同时出现。请点击此处查看此图的放大版本。

图 2:新旧效应。(A, B, C)图中分别显示了语调结合、仅自信和仅怀疑条件下,Pz电极在400至850毫秒时间窗内的灰色标记事件相关电位(ERP)。(D, E, F)图中分别展示了在所有电极(以黑点表示)上,语调结合、仅自信和仅怀疑条件下旧项目减去新项目的地形图分布。请点击此处查看该图的放大版本。
| 情境 | 脑区 | F 值 | Pr(>F) | 偏 eta 方 |
| 综合 | 记忆 | 9938.98 | .00 | .00 |
| 感兴趣区 | 4.13 | .02 | .13 | |
| 记忆:感兴趣区 | 182.37 | .00 | .00 | |
| 确信 | 记忆 | 7291.22 | .00 | .00 |
| 感兴趣区 | 3.60 | .03 | .12 | |
| 记忆:感兴趣区 | 41.94 | .00 | .00 | |
| 怀疑 | 记忆 | 8333.38 | .00 | .00 |
| 感兴趣区 | 4.65 | .01 | .15 | |
| 记忆:感兴趣区 | 290.15 | .00 | .00 |
表1:脑区间新/旧效应的线性混合效应模型(LMER)分析结果:综合、确信和怀疑数据集。通过事后分析,* 表示 p < .05 时显著,** 表示 p < .01 时显著,*** 表示 p < .001 时显著。
| 情境 | 脑区 | 对比 | 估计值 | 标准误 | z 值 | p 值 |
| 综合 | 前部 | 旧-新 | .40 | .01 | 43.70 | .00*** |
| 中央 | 旧-新 | .63 | .01 | 61.74 | .00*** | |
| 后部 | 旧-新 | .60 | .01 | 67.51 | .00*** | |
| 确信 | 前部 | 旧-新 | .61 | .01 | 46.63 | .00*** |
| 中央 | 旧-新 | .63 | .01 | 43.22 | .00*** | |
| 后部 | 旧-新 | .76 | .01 | 59.95 | .00*** | |
| 存疑 | 前部 | 旧-新 | .44 | .01 | 35.95 | .00*** |
| 中央 | 旧-新 | .87 | .01 | 64.05 | .00*** | |
| 后部 | 旧-新 | .69 | .01 | 57.75 | .00*** |
表2:不同脑区间新/旧效应的事后检验结果:综合、确信及怀疑数据集。通过事后分析,显著性水平为 p < .001(***)。
该研究提出了一种用于脑电图(EEG)数据采集与分析的流程,重点在于识别先前学习过的说话人身份。本研究解决了学习阶段与识别阶段之间的差异问题,包括言语内容22和韵律特征10的差异。该设计可适用于多个研究领域,包括心理语言学中的代词及回指加工等研究41。
训练-测试范式是一种经典的实验设计,用于评估参与者在特定主题上的学习效果,例如声音学习42,43。该范式通过准确率来评估参与者对特定信息的掌握程度10。研究人员可在受控的实验条件下逐步引入变量,例如在训练和测试阶段采用不同的语调,以探究这些变量对声音识别准确率的影响,例如VTL/F0调制的声音23、恐惧与中性语调10,或本研究中的怀疑与自信语调。
然而,该范式存在局限性。学习环境与测试环境之间的差异可能影响实验结果的有效性,因为受控的学习条件可能无法反映更具可变性的测试条件。例如,训练阶段使用单一的语调模式,而非成比例的差异(如30%对比70%)44。为解决这种不平衡,确保更丰富的学习环境可以更好地模拟现实生活中的场景,即说话者在与听者交流时会使用多种不同的语调模式。此外,本研究承认,实验设计的复杂性(涉及多个阶段以及使用R Studio、MATLAB和Python等工具进行的复杂编程)对于初学者而言可能具有挑战性。
主要发现强调了充分熟悉和检查阶段的重要性。Xu 和 Armony 的研究指出,如果没有足够的训练和高于随机水平的检查,听者难以识别出熟悉的说话人身份10。此外,Zaske 等人发现,只有在重复相同文本时才会出现LPC旧/新效应,而在使用不同文本时则不存在该效应22。本研究通过引入检查阶段,揭示了即使采用不同的文本刺激,旧/新ERP效应仍然持续存在,从而支持了fMRI研究的结论21。该研究提示,对于基于训练-测试范式的实验设计,插入检查环节至关重要。这有助于听者建立对说话人声学特征的稳定印象,并将特定说话人与某个符号(例如姓名)关联起来23。如果未能充分学习说话人的表征,听者可能难以适应同一说话人内部的语音变异10。
本研究还观察了韵律作为说话人识别绑定线索的作用45。与以往认为韵律可能阻碍对熟悉说话人识别的观点相反,本研究发现在自信和怀疑的韵律条件下均存在新旧效应。这一稳健的效应表明韵律在说话人识别中具有调节作用。进一步分析揭示了不同韵律条件下前部脑区激活的差异。与怀疑的韵律相比,自信的韵律在前部脑区引发的旧/新效应水平较低。该发现提示,由于发声道长度增加和基频降低,自信的言语可能使说话人识别更具挑战性,从而可能引起听者更多的注意11,29。
本研究的设计可为未来针对患者群体(如面孔失认症或语音失认症患者)识别障碍的研究提供参考46,47。此外,对注意力持续时间较短的参与者(例如自闭症谱系障碍个体)进行适应性调整,可能有助于提高研究的可及性48。
此外,该范式还超越了说话人识别,进一步探讨了心理语言学研究中的代词加工及回指理解。Cooplands 和 Nieuwland41 揭示了神经振荡同步模式如何区分回指理解中的先行词激活与整合过程,这与本研究对身份相关线索的探索相一致。本文中的类似线索包括交际风格(例如字面陈述或反语)、语序(主语-宾语-动词(SOV)或宾语-主语-动词(OSV)句法结构44,45,49,50),以及声音表达类型(自信与怀疑的语调)。
无任何信息需要披露。
本工作得到国家自然科学基金(项目编号:31971037);由上海教育发展基金会和上海市教育委员会支持的曙光计划(项目编号:20SG31);上海市自然科学基金(项目编号:22ZR1460200);上海外国语大学导师指导计划(项目编号:2022113001);以及国家社会科学基金重大项目(项目编号:18ZDA293)的资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 用于 BrainAmp 的 64 导标准脑电帽 | Easycap GmbH | Steingrabenstrasse 14 DE-82211 | https://shop.easycap.de/products/64ch-standard-braincap |
| 研磨性电解质凝胶 | Easycap GmbH | Abralyt 2000 | https://shop.easycap.de/products/abralyt-2000 |
| actiCHamp Plus | Brain Products GmbH | 64 导 + 8 个辅助通道 | https://www.brainproducts.com/solutions/actichamp/ |
| 音频接口 | Native Instruments GmbH | Komplete audio 6 | https://www.native-instruments.com/en/products/komplete/audio-interfaces/komplete-audio-6/ |
| 泡沫耳塞 | Neuronix | ER3-14 | https://neuronix.ca/products/er3-14-foam-eartips |
| 基于凝胶的被动电极系统 | Brain Products GmbH | BC 01453 | https://www.brainproducts.com/solutions/braincap/ |
| 高黏度电解质凝胶 | Easycap GmbH | SuperVisc | https://shop.easycap.de/products/supervisc |