本文旨在提供详细的协议,用于对结构化访谈进行文化适应和心理测量验证,以评估特定精神疾病症状的严重程度。提出了经验支持的程序,从选择测量开始,详细说明实验程序和统计分析。
方法文章
本文旨在提供详细的协议,用于对结构化访谈进行文化适应和心理测量验证,以评估特定精神疾病症状的严重程度。提出了经验支持的程序,从选择测量开始,详细说明实验程序和统计分析。
精神疾病是导致长期残疾和死亡的重要原因。尽管可以进行治疗,但诊断准确性对于提供充分的循证治疗和开发新疗法至关重要。为了在临床访谈期间为诊断过程提供信息,强烈建议使用经过验证的评估措施,包括自我报告问卷和结构化访谈。然而,此类工具必须具有出色的心理测量特性,特别是在可靠性和有效性方面,以确保每个人的数据准确且可解释。此外,在新的国家、背景或语言中应用文书需要正式的文化适应。这一过程是强制性的,以确保改编版本的结果与原始调查表的结果相同。
在这里,我们描述了文化适应的详细协议和心理测量工具的综合心理测量验证。具体来说,我们概述了选择措施、执行实验程序和执行建立仪器心理测量特性所需的统计分析的步骤,包括诊断精神疾病的可靠性、结构效度和标准效度。我们的主要目的是提出一种透明、标准化的方法,用于文化适应和验证心理测量工具。这样的程序有助于最大限度地减少未来应用和研究中的混杂因素和不必要的变异性。我们预计该协议,包括一系列有经验支持的方法,将在研究环境中有用,以适应精神病学评估的心理测量工具的文化适应。
世界卫生组织 (WHO) 将精神疾病定义为异常思想、感知、情绪、行为和人际关系的组合1。这些情况是导致长期残疾和死亡的重要原因2.这些疾病的广泛范围包括重度抑郁症、强迫症 (OCD)、广泛性焦虑症和双相情感障碍3。尽管这些精神障碍中的每一种都有治疗选择,但诊断的准确性对于提供充分的循证治疗至关重要4。
关于诊断评估,一些指南,例如来自美国国家健康与临床卓越研究所的指南,建议使用与正在评估的疾病相关的经过验证的评估措施5,以便为临床医生提供额外的信息6。有几种针对各种精神障碍的工具7,用于筛查、诊断和评估症状严重程度或对治疗的反应 8,9。然而,在被视为充分之前,文书必须为要评估的人群提供准确、有效和可解释的数据10.重要的是,有关特定个体的信息质量取决于所用仪器的心理测量特性11.为了减少测试过程中的偏见,从应用到结果的解释,心理措施应标准化8.这是制定《教育和心理测试标准》的主要原因,作为评估测试、测试实践和测试使用影响的基础12.同样重要的是,大多数工具都是在英语国家制定的,13 使得在新的国家、文化和/或语言中使用之前必须进行文化和语言调整,以便在调查表的原始(来源)和新改编的(目标)版本之间达到等效性14。
当一种既定的工具在特定的语言或文化中不可用时,研究人员面临着两种主要策略之间的选择:开发一种新的、针对特定环境的手段,或者对现有的、经过充分验证的措施进行跨文化改编15。虽然开发一种新乐器可以确保最大的文化特异性,但这是一个极其耗费资源和时间的过程,可能需要16 年的时间。相比之下,采用既定的“黄金标准”工具具有明显的优势。这种方法通常更有效,而且至关重要的是,它允许对不同人群的发现进行跨文化比较,这是调整措施而不是创造新措施的主要目标17。
国际测试委员会制定了心理工具的跨文化翻译和改编指南17.翻译可以被认为是改编过程的第一阶段18,并且可以使用两种最流行的测试翻译方法中的一种或两种进行:(a)翻译和反向翻译,或(b)由第三人19比较的两个独立翻译。文化适应过程要求,除了精确的翻译外,还要求进行适应过程,以最大限度地提高原始措施与从中发展而来的措施之间的语义、惯用、经验和概念等同性14,20。最后,应评估翻译工具的心理测量特性,以便将其与主要语言20 的原始测量进行比较。具体来说,评估可靠性和有效性8,9,21非常重要,分别确保仪器产生一致的测量结果,并且它测量预期的结构22。
可靠性是指在不同时间、不同环境或由不同访谈者获得的测试结果在连贯性、稳定性、等效性和同质性方面的可重复性 23,24,25。它可以通过多种方法进行评估,包括评估重测、替代形式、分半可靠性以及内部一致性8,22,26,确定措施是否足够一致且没有测量误差8。虽然不可靠的工具不可能有效,但可靠的工具有时可能是无效的10.有效性根据三个类别27,28来考虑,即内容有效性、结构有效性和标准有效性。内容效度的概念涉及测试对其打算测量的维度进行充分采样的程度22,而结构效度,包括收敛和判别效度(有时称为发散效度29),表示度量的方差与基础结构的方差相关联的程度30,31.标准效度基于测试分数9 之间的关系,应使用相同结构的另一种衡量标准进行评估,理想情况下是一种广泛接受的衡量标准,被认为是黄金标准 8,28。此类有效性对于了解测量是否可用于对患者进行预测和/或决策尤为重要25,这在建立诊断时就是这种情况。
已经发布了许多关于心理测量工具跨文化适应的指南,以帮助研究人员完成这一复杂的过程17,32。然而,对这些文献的系统评价强调,对于遵循的最佳方法缺乏单一的、统一的共识33.此外,许多现有指南虽然有价值,但可能更多地关注最初的语言翻译,而不是确保仪器在临床使用中符合伦理所需的同样关键的后续心理测量验证19。这就需要一个详细的、可复制的协议,将适应和综合验证阶段集成到一个单一的分步框架中。
因此,专注于验证心理测量的标准化研究实践至关重要。本文中描述的方法将为研究人员和临床医生提供详细的方案,以对心理测量进行文化适应,特别是评估诊断精神疾病的标准有效性。为了帮助读者评估其适用性并确保可复制性,该协议包括关键的实际细节,例如样本量考虑、多会话管理时间的基本原理以及对已知限制的讨论。为此,我们将以欧洲葡萄牙耶鲁-布朗强迫量表第二版 (PY-BOCS-II)34 的验证研究为例,其中使用类似的方案来阐明 PY-BOCS-II 的因子结构和标准有效性用于诊断成人强迫症。因此,该协议也可用于未来在其他上下文或语言中对 Y-BOCS-II 进行验证研究。
这里描述的程序是为了收集 Castro-Rodrigues 等人描述的数据而开发的34。该方案是根据《赫尔辛基宣言》制定的,参与者被告知随时退出研究的可能性。它得到了 Champalimaud 基金会(2014 年 10 月 22 日批准)和 Centro Hospitalar Psiquiátrico de Lisboa(2014 年 11 月 14 日批准)的伦理委员会的审查和批准。只有在获得当地伦理委员会和/或该地点其他主管当局的批准后,才能将本协议用于其他项目或在其他地点进行。给出了有关 Y-BOCS-II34 葡萄牙语改编的具体示例来说明一些步骤,并提供了验证 Y-BOCS-II 是否适用于其他语言/上下文的具体说明。
1. 兴趣等级的选择
2. 选择评估量表心理测量特性的其他措施
3. 主要文书的翻译和文化改编
4. 参会人员的选拔和招募
5、测试电池的制备和应用
6. 统计分析
尽管 Y-BOCS-II 35 具有金标准地位和全面的结构,但在进行研究时,文献中尚未确立 Y-BOCS-II35 用于诊断目的的标准有效性。因此,该议定书旨在解决这一普遍差距,同时对葡萄牙进行必要的文化适应。在本节中,经作者许可,介绍了 PY-BOCS-II34 验证研究的代表性数据。结果分为两部分。首先,我们总结了中试测试阶段的定性结果,这些结果为仪器的最终版本提供了信息。其次,我们提出了有关其标准有效性的定量结果。
文化适应过程包括对患者进行试点测试,然后进行认知汇报访谈,以评估改编工具的清晰度和可理解性34。虽然大多数参与者认为说明很清楚,但定性反馈强调了几个需要改进的关键领域。根据患者的说法,问题包括仪器的长度、对某些示例的不适(由一名参与者报告),以及由于症状的偶发性质而难以量化每天花在症状上的平均时间。参与此过程的采访者也提供了批评性反馈,指出一些问题流程不顺畅,并确定了实际的格式问题,例如缺乏注释空间以及需要在每一页上重复标题。这些反馈导致了调整,包括细微的措辞和格式更改,以产生用于大规模验证的仪器的最终版本。
对于标准效度分析,我们招募了一小部分诊断为强迫症 (n = 20) 或情绪或焦虑症 (n = 18) 的患者样本,并由一名对诊断状态和其他心理测量测试结果不知情的研究人员进行 PY-BOCS-II,以避免标准污染。创建受试者工作特征 (ROC) 曲线以评估标准有效性,使用 SCID-OCD 作为区分强迫症参与者和其他诊断参与者的金标准。 图 1 显示了以盲法评估的强迫症或其他情绪和焦虑症患者之间区分的 ROC 曲线。获得 0.93 的曲线下面积 (AUC)(95% 置信区间 [CI]:0.84-1.00),对 ROC 曲线值的进一步分析表明,当用作诊断的分界值时,PY-BOCS-II 总分为 13 分,正确识别了强迫症,灵敏度为 90%,特异性为 94%。鉴于样本量和病例组合适中,这些准确性估计应在更大的队列中复制,以确认普遍性。

图 1:PY-BOCS-II 在识别强迫症方面的诊断准确性的受试者工作特征曲线。 该分析包括来自接受盲法评估的患者的数据,包括一组强迫症患者 (n = 20) 和一组患有情绪和焦虑障碍 (n = 18)。该图显示了 PY-BOCS-II 所有可能的截止分数的灵敏度(真阳性率)与 1 特异性(假阳性率)。SCID-OCD 被用作金标准诊断工具。缩写:AUC,曲线下面积;强迫症,强迫症;PY-BOCS-II,葡萄牙耶鲁-布朗强迫性量表-II;ROC,关于接收机工作特性的标准。该图是根据 Castro-Rodrigues 等人 34 修改而来的。 请点击此处查看此图的大图。
在这里,我们描述了精神病学诊断工具的文化适应和综合心理测量验证的详细协议。该协议从选择措施开始,然后详细说明必要的实验程序和统计分析。该协议的主要目的是提出一个清晰且标准化的分步程序来调整和验证心理测量,即 Y-BOCS-II34,从而最大限度地减少临床和研究使用中的混杂因素和不良变异性。这些方法侧重于文化适应和心理测量分析,包括标准有效性,这两者在具有诊断意图的新国家或环境中使用工具时都是必不可少的 13,17,19。
Y-BOCS-II34 是一项由临床医生管理的成人访谈,可以对强迫症进行详细评估。该工具包括两个主要部分:一个包含 67 个项目的症状检查表,用于识别和分类当前和过去的强迫症、强迫行为和回避行为,以及一个包含 10 个项目的严重程度量表,用于评估这些症状的严重程度。尽管其具有金标准地位和全面的结构,但在进行研究时,其用于诊断目的的标准有效性尚未在文献中得到有力的确立。因此,该议定书旨在解决这一更广泛的差距,同时为葡萄牙进行必要的文化适应。
该协议的一个关键步骤是严格的文化适应程序,根据现有指南和循证标准执行。同样重要的是,在应用心理测量时保持评估者对诊断状态的盲法,因为诊断知识可能会使结果产生偏差并影响诊断准确性的估计53,54。这对于结构化面试尤其重要,如我们的示例34 所示。虽然遵守这些步骤至关重要,但某些特征可能因研究而异(例如,样本量、项目分布、测量背景和结构的可实现性)55。此外,使用半结构化认知汇报、标准化指南和对重复主题的团队审查进行定性试点测试,为改进提供了可作的证据(参见协议步骤 3.2.2-3.2.4)。在对项目 44 进行改编时出现了一个实际例子:将“配偶”改为“家庭成员”,确保该文书在葡萄牙语境中捕捉到文化上适当的寻求保证的目标34.
除了翻译质量和盲法之外,综合验证还需要根据既定原则和国际指南(如COSMIN59)对可靠性(内部一致性和重测稳定性)、结构有效性(例如因子结构)和标准效度进行原则性的定量评估15。例如,对于 PY-BOCS-II34 的结构效度,根据科英布拉强迫量表 (COI;Inventário Obsessivo de Coimbra)56,一种葡萄牙自我报告测量,具有“频率”和“情绪困扰”分量表。虽然跨文化适应的一般准则提供了有用的基础32,但过于直译和利益攸关方参与有限等挑战可能会损害最终文书的有效性57。在缺乏单一共识方法33的情况下,本协议提供了一个透明的、分步的框架。其优点包括对目标人群进行强制性定性试点测试和盲法评估,以尽量减少标准污染53,以及全面心理测量验证的明确指导,以确保临床伦理19。通过区分适应和验证33,该协议旨在产生心理测量上合理的工具。
该方法已成功应用于 Castro-Rodrigues 等人 34 的研究,以评估 PY-BOCS-II 临床医生管理的强迫症诊断访谈的标准有效性。然而,该框架适用于其他格式(例如,自我报告量表和筛查问卷)。对于这些措施,定性试点测试至关重要,以确保项目在
没有临床医生58.事实上,我们已将这些方法的变体用于其他措施和目标:食物力量量表60 和耶鲁食物成瘾量表61 (可靠性和结构效度),以及肿瘤学环境中的仪器62。Lemos 等人 63 改编了应对创伤量表的感知能力,Almeida 等人 64 改编了家庭复原力问卷简表 (FaRE-SF-P),两者都结合了麦当劳的Ω和 Cronbach 的α,以提供稳健的内部一致性估计,特别是当未满足 tau 等效性时65。这种一致的方法支持在给定人群内有效开发全面的心理测量框架。
我们的标准有效性方案在临床环境中也有效。对于轻躁狂检查表-32 (HCL-32)66,使用了类似的验证方案,并简化了适应过程,因为该措施已经以葡萄牙语(巴西变体)而不是欧洲葡萄牙语67 提供。该项目的设计强调在双相谱系障碍背景下的筛查使用,而不是诊断确认。最近,Almeida 等人 68 评估了 BDI-II 测量癌症患者抑郁严重程度的标准有效性,强调了躯体症状重叠如何影响诊断准确性。
这些应用说明了该协议在措施类型(结构化访谈、自我报告)、结构(精神症状、食欲相关结构、情绪症状、应对、家庭复原力)和预期用途(诊断、筛查、严重程度、心理资源)方面的适应性。通过适当的调整以应对结构或人群特定的挑战,该方案可以扩展到初级保健中的大规模筛查和不同的精神病学诊断。它还与弱势群体有关,其中发育、认知或社会因素可能影响有效性,以及数字健康,在这些人群中,基于移动的评估和数字疗法需要文化敏感验证。
该协议的实施者可能会遇到实际挑战。在翻译过程中,如果难以达成共识,建议让一名高级独立调解员参与69.通过多中心合作,可以缓解单一地点的招聘缓慢70.对于特定文化的内容,概念改编应优先于直译,然后进行严格的试点测试14,58。道德保障措施也至关重要:评估同意能力、在适当时使用合法授权代表以及使用标准化工具(例如 MacCAT)可以支持中度至重度症状个体的知情参与47,48。
限制包括协议的资源强度(时间、资金、双语专家、训练有素的评估者),这可能会挑战资源匮乏环境中的可行性。标准验证还取决于目标培养物中是否存在完善的金标准。当缺乏这样的基准时,由独立专家进行共识诊断是一种可行但要求很高的替代方案。
总之,该协议结合了多种经验支持的方法,以在文化上适应和验证心理测量工具以用于精神病学的诊断用途。它在不同仪器上的成功应用表明了它在为跨文化和语言背景的临床和研究环境生成心理测量合理的工具方面的效用。
Albino J. Oliveira-Maia 是葡萄牙抑郁症试验的研究者或国家协调员,由 Compass Pathways(EudraCT 编号 2017-003288-36)和 Janssen-Cilag(EudraCT 编号 2019-002992-33、2022-000439-22、2022-000430-42)赞助;是 Schuhfried 的资助者,用于认知测试的规范和验证;已获得来自默沙东葡萄牙公司、Neurolite AG、杨森-Cilag、欧洲药物和药物成瘾监测中心、Bioprojet Pharma 和 NaturalX Health Ventures 的付款、酬金、咨询费或参加会议和参与顾问委员会的支持;是葡萄牙精神病学和心理健康学会的副主席;是葡萄牙医学会和葡萄牙卫生部国家医学检查委员会精神病学工作组的负责人;是葡萄牙成瘾行为和依赖研究所伦理委员会主席;并且是葡萄牙强迫症基金会科学委员会的主席。上述机构均未参与稿件的准备、审查或批准,或参与提交稿件出版的决定。
这项工作得到了欧盟地平线研究和创新计划(PsyPal;赠款协议编号 101137378)的资助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| <强>软件 | |||
| G*力量 | 福尔,F.,等人。 | www.gpower.hhu.de / Faul 等(2007) | 用于先验统计检验力分析的软件,用于确定样本量。 |
| IBM SPSS Windows 版统计,版本 25.0。 | 国际商业机器(IBM) | IBM SPSS 统计公司,发布于2017年 | 用于统计分析的统计软件 |
| JASP 统计软件 | JASP团队 | 版本 0.95 | 用于确认性因素分析的开源软件。 |
| Microsoft Excel | Microsoft | Office 365个人版 | 建立潜在参与者的临时数据库很有用 |
| Microsoft Word | Microsoft | Office 365个人版 | 方便撰写知情同意书及研究内容 |
| Randomg.org | https://www.random.org | 不适用 | 对随机化过程很重要 |
| 采访与心理测量仪器 | |||
| 贝克洼地清单-II(BDI-II) | 皮尔森 | Beck 等人(1996),《BDI-II 手册》 | 自述辨别效度工具(抑郁症)。 |
| 迷你国际神经精神病学访谈(MINI) | Sheehan, D.V. 等人。 | Sheehan 等(1998),《临床精神病学杂志》 | 简短访谈以评估合并疾病及排除标准。 |
| 状态-特质焦虑量表 - 表格Y(STAI-Y) | 心灵花园 | 斯皮尔伯格,C.D.(1983),《STAI手册》 | 辨别效度(焦虑)自我报告工具。 |
| DSM-IV强迫症子量表(SCID-OCD)结构化临床访谈 | 美国精神病学出版社 | First 等人(2002),SCID-I/P | 强迫症诊断标准的黄金标准面试。 |
| 耶鲁-布朗强迫症量表 - 第二版(Y-BOCS-II) | 古德曼,W.K.等人。 | Storch 等人(2010),《心理评估》 | 适应与验证协议的主要工具。 |
| <强>学习文档与其他材料 | |||
| 知情同意书 | 为本研究开发 | 不可用 | 列出研究流程的文件,所有参与者均签署。 |
| 纸张、打印机、铅笔 | 无 | 无 | 用于打印和完成评估的纸质副本。 |
| 半结构化认知总结访谈指南 | 无 | 作者可按要求提供 | 试点测试期间使用的标准导轨,用于收集对适应仪器的定性反馈。 |
| 电话 | 无 | 无 | 联系、筛选和安排参与者。 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可