数字策略支持无监督的远程评估和培训,但为确保收集数据的有效性和干预措施的实用性,仍需考虑若干因素。
综述文章
数字策略支持无监督的远程评估和培训,但为确保收集数据的有效性和干预措施的实用性,仍需考虑若干因素。
技术进步使认知和功能评估与培训能够数字化实现。数字策略大致分为两类:最初为数字交付开发的策略,以及从早期传统纸笔评估迁移而来的策略。关于监督评估与培训的研究也相当多。同时出现的数字化发展,如人工智能(AI),使得并行评估表格的快速生成和评估材料的国际翻译成为可能,暗示了全球范围内广泛部署的可能性。翻译并不能保证验证,许多评估工具虽然被翻译,但翻译后未进行规范化或验证。本综述探讨了当前数字评估和培训工作的现状,利用广泛部署的面对面评估案例,这些评估经历了翻译和数字化迁移,并与从未以纸质或线下方式实施的数字策略进行了比较。对无监督表演的实用性及其对自我管理数字评估或培训项目的个人影响进行了评论。在多个方面需要认真思考,以实现可访问且个性化的数字策略,包括心理测量完整性、语言效度、面对面人体测试员提供的社会支持,以及这些支持是否可以量化并辅以数字替代方案。
数字革命改变了老龄化及精神疾病领域的认知与功能评估与培训格局。如今进行的大量评估完全或部分依赖数字化交付。数字评估可以从由人工测试员执行的传统标准神经心理学测试迁移到 1,2,或完全原生的数字平台 3,4,5。一些策略包括在移动设备上进行6、7、8,这可以配合其他远程评估,以捕捉瞬间的情绪、地点和环境状况9。
系统性数字化迁移允许将数字版本的程序与传统版本进行比较。对于某些任务,已收集了大量验证信息,并系统地与遗留程序进行了比较。例如精神分裂症认知简要评估(BACS),其中广泛规范化的10 传统测试迁移至数字交付11,并进行了比较规范研究12。类似的例子是Loewenstein-Acevedo语义干扰与学习量表(LASSI-L)13的数字化迁移,该量表被迁移到由Avatar引导、可远程管理的14 版本,包含三个数字表格15。
数字任务的一个优势是快速且通常自动化的更新,包括测试刺激,非常可行。这包括采用人工智能(AI)策略的语言翻译,能够快速生成不同的版本。人工智能策略还促进了重复测试所需的平行形式开发,特别是记忆或问题解决测试,以避免不可接受的实践影响16,即使是在痴呆症人群中也存在17。本综述的目标之一是评估以往数字迁移和人工智能适应的质量,包括数字迁移后等效性、语言翻译及平行形式开发的数据。
数字评估的进一步发展是数字化评估或培训程序的远程或无监督自我管理。虽然这已成为商业计算机认知训练(CCT)多年的标准做法18,但一些研究表明,无监督的自我认知测试也是可行的 19,20,21。无监督的自我考试可以在家中通过联网的数字设备完成,也可以在考试中心进行,在那里多位参与者在最小监督下参加考试。可行性研究通常为短期研究,尽管部分研究时长与标准临床试验相同或更长。我们将回顾无监督评估和培训的整体状况,并对存在挑战或需要更多信息的领域进行评论。
无监督评估和培训中一个关键问题是跨文化适应与可行性。除了语言差异外,经济因素也存在显著差异,可能影响数字接入和识字率,包括手机、平板电脑或笔记本电脑的使用经验,以及家庭互联网接入。全球数字鸿沟不再是与年龄有关,而是经济问题。参与在线远程数字活动的动机在不同参与者之间可能差异很大。无监督评估的可行性指标包括同意率、评估完成率、数据有效性以及技术管理能力。大多数临床无监督评估针对具有预期障碍的个体,这些人可能会接受大量指导,包括面对面,涉及登录和完成评估或培训。来自报名参加所有注册和培训完全独立进行的远程学习者的可行性数据,19,23 可能无法推广到数字技能水平较低、对自身能力信心较低和整体认知表现较低的个体。这包括那些怀疑自己有早期痴呆迹象并在诊所进行无监督评估的个体。
在一项关于两种数字评估系统从设备驻留计算机呈现向云端传输转变的研究中,触摸屏数据采集速度相比电脑鼠标存在系统性优势。功能能力评估中常见的数字素养挑战:部分参与者键盘技能极差,需要学习如何输入大写字母以输入密码25。在美国26州一项针对认知和功能能力的多地点研究中,数字功能能力评估的表现在不同地理位置之间差异超过1.0 SD,追踪区域教育成就和收入。我们将利用所有可用指标评估无监督评估和培训的可行性和有效性。
如下所述,无监督技术交付的主要挑战并非数字结果未能与标准测量趋同。主要挑战在于自我管理评估和培训所需技术的广泛可行性,以及在缺乏人类监督下表现过于波动。在进行标准认知任务时,存在内在的社会互动,为遇到困难的参与者提供监督和协助。一个重要问题还包括,是否可以通过基于人工智能的交互方式,模拟传统人工评估程序中的参与者与测试者的互动,实现数字化支持。
以下是上述问题数据的回顾。其中包括适用于标准和数字评估的基于绩效测试的标准;遗留评估数字化迁移标准;以及数字原生任务验证过程与从传统纸质/人工交付格式迁移而来的任务的比较,包括替代形式、翻译和跨文化适应。此外,关于无监督给药与人工授药策略的可行性进行了广泛讨论,考虑了这些策略的整体可行性以及人类测试员在传统评估和培训干预中的作用。在这些评估情境中执行了多种功能,其中部分理论上可以借助AI辅助实现。 补充第一卷介绍了本综述中考虑的问题。
认知和功能评估验证的一般原则
在制定经过充分验证的数字评估或治疗策略时,需要考虑若干因素。这一过程的一个典型例子是协作式大规模结果评估开发项目——精神分裂症认知改善测量与治疗研究(MATRICS)计划,该项目对大量传统测试者提供的评估进行了验证研究。根据共识会议27的讨论,本研究的选择基于五个核心考虑因素:反复给药的可靠性、纵向使用的适用性、与功能结局的关联、对治疗相关变化的敏感性,以及整体的可行性和耐受性。重复给药的适用性被定义为因实践带来的最低限度表现提升或存在等效替代形式的可用性。尽管最终的MATRICS共识认知测试(MCCB)28 选择了符合这些标准的测试,但该测试组在远程进行时具有挑战性。类似的开发流程也被用于同样聚焦的评估——精神分裂症认知简要评估(BACS)3。BACS采用类似策略开发,BACS中六个测试者提供子测试均被检视,包括一项健康对照(n = 404)8的大型验证研究。
论文BACS在国际上得到了广泛验证,有多项研究探讨其使用情况(例如,30,31,32,33,34,35)。有趣的是,MCCB也被多次翻译,开发者网站36列出了45种不同的译本。网站上还指出,尽管在国际临床试验中广泛使用,45个版本中只有~10个具有官方语言规范。这个问题后面会讨论。
在一项比较研究中系统性地将BACS迁移到BAC-App,包括精神分裂症患者和健康对照组,所有参与者均接受了传统版本和数字版本的测试。在研究启动之前,已为多个BAC-App子测试开发了替代形式,包括言语记忆(七个版本)、符号编码(八个版本)和伦敦塔(八个版本)。因此,数字化迁移旨在实现两个版本的直接比较并验证并行形式。随后进行了一项大规模验证研究(N = 55312),对健康对照组和少量主观认知衰退参与者,提供了BAC-App表现的规范性信息。因此,规范性数据先用旧版收集,然后在数字版中重复,包括对等效形式的评估(尽管这些数据迄今尚未公开)。需要注意的是,最终的BAC-应用并非为无监督管理设计;必须有测试人员在场。
类似的数字迁移工作也针对一项遗留论文评估——Loewenstein-Acevedo语义干扰与学习量表(LASSI-L)13,14进行了类似的数字化迁移。该评估针对主动语义干扰的检测,已被证明能预测认知衰退加快,并在额外障碍较轻的情况下也能发现ADRD生物标志物的存在15。LASSI-L提供了大量规范性数据,随后开发了数字版(LASSI-D)用于无监督评估。在评估这些仪器的开发过程中,重点关注各给药间的可靠性、重复使用适用性、与功能结果的相关性,以及整体可行性和耐受性。BACS迁移的一项进展是同时验证西班牙语和英语版本的LASSI-D,而非类似版本的LASSI-L,并利用AI为基础的策略开发迁移版本,以提高无监督自我管理的可行性和有效性。具体来说,人类化身承担着人类测试员的职能,传递指令、纠正错误,并鼓励他们优化参与者的表现。从参与者收集的定性数据显示,avatar 提供的评估满意度很高,且这些评估的偏好分数高于人类进行的评估。
数字原生评估也应遵守相同的可靠性和效度原则,一些项目确实如此。例如,两种不同的数字功能能力衡量工具——虚拟现实功能能力评估工具(VRFCAT)3,37 和功能技能评估与培训项目(FUNSAT)25,38 的开发,在验证研究中遵循了相同的五项原则。VRFCAT 和 FUNSAT 都经历了向云端传输的二次数字化迁移24,且两种测试都有类似的替代形式。FUNSAT的迁移研究还考虑了西班牙语和英语使用者在三种替代形式的表现。
VRFCAT和FUNSAT的另一个特点是广泛进行收敛验证,并进行了传统和数字评估策略的比较。例如,研究了VRFCAT与其他纸笔功能能力指数的相关性,39。进行了一项定性研究以评估其对目标评估人群的接受度41。对于FUNSAT,还报告了因子结构42、治疗敏感性43、与BAC-app相关性44及其他功能能力指标45的研究,以及与自我报告功能的相关性46。
无监督评估技术
纸笔神经心理学评估是监督评估的典型案例,包括社交互动、监督、指导以及避免问题反应的建议。如上所述,一些数字执行的认知和功能测量设计由检查员执行。例如MCCB的同对CPT47 、BAC-app和VRFCAT。其他评估设计使得无需监督即可进行,无需考官在场,因为评估程序自动化且独立运行。其中一些项目显示出对漏掉48 分或部分子测试无效分数49 的脆弱性,尽管无效分数的比例较低。这些分数可能反映了考生参与度低,在某些情况下可以通过考官反馈进行纠正。利用现有数字技术,可以检测到测试过程中的中断,并可暂时暂停流程,提醒参与者继续。例如,FUNSAT评估和培训模块会暂停程序,并在15秒内未收到回复时弹出窗口。上述所有策略中并不具备这种内置检测过程。
关于无监督评估可行性的数据
有许多关于严重精神疾病和ADRD认知表现无监督评估的研究。一项大规模的ADRD综述 发现了28份近期研究报告和23种不同的无监督评估工具,这些工具可在办公室访问或远程完成。可接受性数据相当良好,知情同意率和参与率均超过85%。许多参与者表示愿意再次参与。
评估依从性差异较大,从8周研究的63%到另一项8周研究的94%不等。无法使用数据的比例较低,但某些评估策略导致评估完成时出现更高挑战。在家庭增强现实环境中,技术限制导致约21%的数据丢失,设备兼容性问题导致近32%的参与者无法完成远程评估。
心理测量因素在传统评估策略中通常被谨慎管理,但考量不足。例如,只有23个任务中报告了平行形式收敛度和测试-重测信度的低端。然而,由于部分评估是远程且临时进行的,环境因素可能影响绩效,这是一个重要的考量因素。因此,看似低的复测信度实际上可能反映了对环境影响的敏感性以及与环境因素变化相关的参与者内部方差 9.50。与标准认知评估的收敛效度一致可接受,相关性范围为r = 0.50至0.70。
精神分裂症患者远程认知评估的综述21 也同样规模(34篇文章),并提出了一些相同的问题,尽管只有部分研究实际上进行了真正的无监督评估。大多数远程评估未提及平行形式,且几乎没有关于远程授课规范相较于面对面评估的报告。事实上,34项研究中只有一项比较了远程评估、面对面评估和监督评估的规范性表现。与Polk等人研究相关的另一发现是,由于互联网连接问题、技术故障报告及其他技术因素导致的评估无法完成,几乎所有无监督研究均存在。
在尝试远程管理BAC-app时,参与者对数据完整性的担忧出现,因为他们在面对面和远程使用BAC-app51时都进行了测试。在该研究中,参与者在远程进行的单词列表学习测试中平均表现显著更好,表明他们在刺激出现时会写下或记录这些内容。在无监督评估时,似乎还需要采取某种安全策略来维护数据完整性。
远程提供数字认知和技能培训
已有多项关于远程训练精神分裂症52和轻度认知障碍53的认知和功能技能的研究。此外,认知训练作为综合干预措施被加入,以增强其他干预措施的效果,如基于应用程序的精神分裂症负性症状治疗54和MCI中的数字功能技能训练。总体发现是,从精神分裂症到轻度认知障碍(MCI)和注意力缺陷发育障碍(ADRD)等人群,在家庭和办公室的依从性与培训进展都非常相似。依从性从不完美,训练成果受个体差异特征影响,55,56。一个可能导致充分进步和依从性的因素是,无论是在办公室还是远程进行的认知训练程序基本相同。上述技术挑战和项目无法启动的问题,显然在远程培训和远程评估中是相同的。参与者接受面对面培训以促进软件无监督启动和操作的研究报告了最佳的远程依从性(例如,53)。
数字评估和治疗的全球应用
如上所述,已有多次传统论文评估的翻译,以及多项国际数字领域的努力。例如,西班牙开发了阅读障碍57和数学技能58的数字评估,尽管尚不清楚这些任务是否已被翻译成其他语言。在中国,制定了一种策略,将开路测试纳入额外的运动技能测量59,另一项中国研究开发了双任务干扰程序,用于研究复杂句子的处理情况60。在新加坡,有一个独特的跨语言培训项目,涉及英语和另一种亚洲语言的双语人士,旨在提升认知表现。所有这些研究都报告了开发的成功和接受度,尽管只有一项能够直接比较不同语言群体内测试的实用性。
翻译检验的局部验证作用
最广泛使用的传统面对面评估策略,如MCCB和BAC,已在上述不同语言和文化群体中得到广泛验证。相比之下,NIH工具箱——一项面向3至85岁人群的广泛评估——仅提供英语版本,并在单一线下数字平台62上进行。关于数字化迁移版本认知和功能评估任务及培训项目验证的区域和全球信息要少得多。例如,在 LUVADAXISTAT 的 ERUDITE63研究中,BAC-app 被用八种不同语言进行,而在数字迁移后,只有一项已发表的研究64 验证了该评估的不同语言形式(即西班牙语)。一些直接数字化评估,如VRFCAT,已在涉及30多种不同语言的研究中以翻译变体形式使用(65)。同样,没有实质性的证据支持VRFCAT跨语言的使用,尽管在制定原始英语版本评估时已验证了平行形式的相似性。如果迁移未改变测试的任何特征,使用数字迁移任务遗留版本收集的验证信息可能相当相关,但有许多语言尚未研究遗留和数字迁移的心理测量特征。然而,正如两篇关于ADRD和精神分裂症的综述中指出的,国际范围内在数字化和数字化迁移后,任务特征的关注极为有限。
这两项研究的挑战在于VRFCAT的变异性大于预期,且相当数量的参与者得分极低。翻译可能对性能产生了不利影响。同样可能的是,缺乏经验的测试者带来的挑战导致了评估过程中对参与者参与度的监督不力。尽管测试者面临明显挑战,但认为语言学验证的翻译能保证心理测量学相似的仪器可能还为时过早。在系统性数字化迁移过程中,应检查纸笔旧有工具是否生成与数字化版本相似的评分,尽管如上述两篇综述所述,这并未被记录为普遍。上述关于LASSI-D数字迁移的策略不易受到这些挑战的影响,因为它包含对三种数字平行形式与人类管理的旧有版本在西班牙语和英语上的系统性心理测量比较。然而,这是一个非常细致的流程,对于30种语言的临床试验来说,及时实施将极具挑战性。
人体测试员的角色是什么?
数据表明,非监督数字评估和培训的一个重大挑战是使参与者能够使用技术并访问系统。其他挑战,如参与者报告的技术不兼容,也可能源于他们对数字策略的不熟悉以及无法操作技术。因此,在无监督评估范式中,评估开始前的个性化指导可能是有益甚至必要的策略。
一些基于技术的评估主要在门诊访问期间进行,包括大多数为精神分裂症远程评估设计的任务。例如,VRFCAT和BAC-App一样,要求面对面监督评估。VRFCAT在正式评估前设有介绍部分,期间人体测试员回答问题并调整不足部分,而主评估部分则持续进行。考官被指示监督参与者,并在其未能坚持努力时给予指导。然而,一项最新的VRFCAT研究发现,一些参与者出现了许多“强制进阶”,即他们未能在300秒内完成测试目标。由于部分目标仅是一个简短的任务(“拿起钱包”),因此可能怀疑审查员监督存在失误。BAC-app技术负责所有刺激的管理和数据收集,但仍需人工测试员监督表现并在参与者完成后推进子任务。Cogstate系统不要求对参与者的表现进行监督,但已有多起报告指出,精神分裂症66 中某些组件的表现无效,且对障碍的敏感性降低,这些问题可能源于参与者持续表现不足和分数不稳定,这些问题可以通过面对面监督发现并纠正。
可以用数字监督吗?
目前对聊天机器人或其他人工智能交付的数字心理治疗干预项目有相当大的兴趣。这些干预的挑战之一是需要双向沟通,即AI治疗师必须实时理解客户的沟通并做出适当回应。开发LASSI-D时采用了不同的人工智能策略。一个由人工智能创建的人类化身作为测试技术员,提供标准测试中人类测试员发布的所有指令和反馈。化身还被教导回答一组预设的常见问题,这些常见问题由受试者触摸屏幕上的“?”图标触发。当时没有尝试进行互动交流。该程序的接受度相当高(测试完成率为95%),在以单语为主的少数群体中,完成率极高(评估会话超过96%),且对头像测试者优于人类测试者的质性偏好。
扩展AI指导用于无监督评估和培训的一个可能途径是开发一套培训和协助系统,帮助参与者首次设置和发起无监督评估或培训。虽然仍在开发中,FUNSAT正在修改中,加入一个带有人类头像指导的初始教学模块,以培训潜在参与者报名培训、登录网站并启动培训工作。这些策略比聊天机器人治疗互动更有可能保持一致且准确地传递,因为虚拟形象交流基于预设的回答和一致的指令传递。
其他数字策略
本次综述重点关注基于表现的有意认知评估。目前已有大量被动数字表型测量方法被检测到,并可与无监督评估结果相关联。这些包括地理定位67、身体活动68、社会情境69、设备交互70和言语和语言特征71。虽然这些不一定是认知的衡量标准,但它们反映了可能影响认知表现的潜在环境因素。例如,从面部或声音反应、社会环境和背景干扰推断出的情绪状态,可能与认知表现相关,尤其是在无监督评估时。一些与无监督评估相关的挑战可以通过同时使用被动电子细胞数字表型来发现和减少。由于这些措施不需要有意为之收集数据,因此不会增加评估负担。
认知和功能缺陷的数字化评估与治疗极具前景,因为它们能够扩大流程规模,触及那些可能无法通过其他方式接触的参与者。技术进步使刺激的翻译变得容易,创建并行评估表,实现远程授课。大多数数据表明,非监督评估和培训的结果在全球绩效指数方面与传统策略高度趋同。然而,参与者参与度和测试开发的技术特性都存在挑战。许多参与者无法在无监督的情况下管理技术。尽管技术使翻译刺激和创建平行形式变得容易,但对由此产生的翻译或新形式心理测量相似性关注不足。系统化的心理测量评估方法不能因为技术使得生成测试刺激变得更容易而被开脱。
一些使用数字结果评估的药物治疗研究未能发现治疗效果,这些失败部分可能与测试的不同版本有关,比如平行形式或翻译刺激,而与原始版本不一致。这些策略,无论是由于测试者的问题还是新开发表格的挑战,也被发现可能导致测试性能过于变异和数据缺失。
另一种补充方法是使用AI引导的头像测试和培训助手。这些方法前景显著,但自身需要验证才能全面部署。在采用此类策略的情况下,需要分步式方法:助理最初提供完整的脚本化指令和反馈,随后接受大型语言模型培训,以理解参与者的问题并与参与者互动。
评估和干预的社会背景对于维持技术相关努力至关重要。人体测试员可以适应参与者的挑战,促进培训参与,同时提供技术支持。这种互动需要整合进数字无监督认知评估和培训方法中,以扩大这些策略的覆盖范围。最需要这些评估和干预策略的参与者,在自我执行认知和功能技能评估及培训任务时,最可能需要辅助协助。
补充文件1:开发有效绩效评估相关问题:重点关注数字化评估和培训的有效性、可行性和耐受性。 请点击这里下载此文件。
哈维博士曾获得Alkermes、BMS(Karuna Therapeutics)、博林格英格海姆、Kynexis、Minerva Neurosciences、Neurocrine Biosciences和Recognify等机构的咨询费或差旅报销。他获得了Intracellular Therapeutics(现为强生集团一部分)的研究资助。他还从精神分裂症认知简要评估(Clario,前WCG Endpoint Solutions, Inc,前Verasci,并收录于MCCB)获得版税。他是i-Function, Inc.的首席科学官,也是EMA Wellness, Inc.的科学顾问。Kallestrup先生是i-Function, Inc.的联合创始人兼首席执行官。
支持FUNSAT和LASSI-D开发的研究由美国国家老龄化研究院(NIA)R44 AG074818-02、R43 AG057238-02和R44 AG057238-04资助,彼得·卡勒斯特鲁普担任首席研究员。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可