需要JoVE订阅才能观看此内容。 请登录或开始免费试用

综述文章

虚拟现实在肿瘤学教育中的应用与生成式人工智能的全景:临床推理评估工具的范围综述

175 次观看

DOI:

10.3791/70722

2026年5月15日

本文内容

摘要

本范围综述发现,虚拟现实(VR)和生成式人工智能(GenAI)为评估肿瘤学培训中的临床推理能力提供了新方法。然而,由于现有证据尚处于初步阶段,两者在广泛用于教育之前,均需要更充分的验证和伦理框架支持。

摘要

肿瘤学是临床推理作为一项基本能力的领域,需要在高风险环境中综合复杂的临床信息。传统的评估方法,如笔试、客观结构化临床考试(OSCE)和基于工作场所的评估,虽能提供有价值的知识,但在反映临床推理的动态性和迭代性方面仍显不足。新兴的数字技术,特别是虚拟现实(VR)和生成式人工智能(GenAI),为克服这些局限性提供了新的机遇。VR可构建基于模拟的环境,具有沉浸感,能够通过可观察的临床行为来评估推理过程中的操作性和情境性因素。而GenAI则提供基于对话的交互方式,有助于评估认知和分析过程,包括关键的认知活动。文献表明,这些技术具有互补优势,但在概念上尚缺乏整合。VR主要记录行为表现,而GenAI侧重于认知过程,两者目前尚未有效结合。此外,现有证据存在方法学异质性、依赖初步研究以及缺乏有效性证据的问题,尤其是在信度和实际影响方面。其他需考虑的因素还包括认知负荷的影响、用户个体差异以及伦理问题,例如算法偏见和透明度。实施的可行性还受到组织层面因素的影响,如基础设施和机构准备程度。总体而言,VR和GenAI在肿瘤学临床推理评估中展现出前景,但仍处于发展阶段。未来该领域的发展将需要统一的评估框架、严格的验证过程以及明确的伦理规范体系。

引言

临床推理是诊断与管理背后认知及元认知过程的核心,构成了安全且有效的肿瘤学实践的基石1。在肿瘤学背景下,这一过程尤为复杂,临床医生必须在不确定性中进行概率性决策,快速整合不断更新的治疗证据,并参与多学科肿瘤委员会的讨论。此外,肿瘤科医生还需在生物医学思维与以患者为中心的思维之间取得平衡,包括向患者告知不良预后、处理伦理问题,以及根据疾病进展的动态变化调整治疗方案2,3。这些多层次的要求使得临床推理能力的培养与评估在肿瘤学教育中尤为关键。传统上,临床推理主要通过笔试、客观结构化临床考试(OSCE)以及基于工作场所的评估(如迷你临床评估练习,Mini-CEX)进行评价4。尽管这些方法可提供有关学习者能力的背景信息,但仍存在显著局限性:笔试更倾向于考察静态知识而非动态思维过程;OSCE耗费资源且可能存在生态效度不足的问题;而基于工作场所的评估通常具有片段性和主观性,易受情境偏倚影响。这些限制共同导致难以深入研究临床推理所具有的迭代性、情境依赖性和长期性特征,尤其是在肿瘤学这类高风险且认知负荷高的专业领域5。总体而言,这些局限性阻碍了对临床推理的迭代性、情境依赖性和长期性本质的全面捕捉,特别是在肿瘤学等高风险且认知要求高的专科领域尤为突出6

近年来数字技术的新发展为克服这些挑战提供了良好机遇。其中两项技术包括虚拟现实(Virtual Reality, VR)和生成式人工智能(Generative Artificial Intelligence, GenAI),它们已成为强大的医学教育工具。VR 提供基于模拟的沉浸式环境,具有高度的空间感和情境性,能够重现复杂的临床场景。在肿瘤学教育中,这些模拟可再现诸如肿瘤急症、化疗期间的并发症以及敏感的医患互动等场景,使学习者能够在安全且受控的环境中以体验式方式练习临床决策7,8,9。尤为重要的是,VR 系统能够捕捉详细的行为数据——例如操作序列、时间点和决策路径——从而实现对临床推理过程中操作性和情境性维度的评估。

与此同时,生成式人工智能(GenAI),尤其是大语言模型(LLMs),为评估推理的认知架构开辟了新的机遇。GenAI 系统能够通过自然语言与学习者互动,使其参与适应性的、基于对话的情境中,进行假设生成、鉴别诊断的形成以及治疗方案的论证。这些系统可基于自然语言处理技术分析学习者的回答,从而对推理过程进行潜在的个性化且可扩展的评估,而此类评估以往在客观测量方面一直具有挑战性10,11,12

此外,现有文献在方法学上分散且异质。大部分现有证据基于试点研究、技术报告或主要面向培训而非实际评估的应用。因此,关于虚拟现实(VR)和生成式人工智能(GenAI)评估能力的大多数论点均基于技术功能,而非严格的实证验证。已报道的有效性证据各不相同,其中主要报告的是内容效度,而对内部结构、信度或与既往 established 评估指标的相关性则极少提及。

这些限制因素还因可用性、认知负荷和伦理问题等新问题而进一步加剧。例如,生成式人工智能(GenAI)系统提供了一种可扩展的交互式解决方案;然而,信息冗余、系统响应的变异性以及用户对系统的熟悉程度等问题可能会影响学习者的互动效果和表现。同样,在评估场景中缺乏透明度、公平性和问责性,可归因于人工智能驱动评分的“黑箱”特性。从实施角度看,虚拟现实(VR)系统需要大量的基础设施投资,而生成式人工智能的采用则取决于机构的准备程度、治理机制及其与教育目标的一致性。这些因素凸显了建立更完善的概念和组织框架的重要性,以评估此类技术如何融入肿瘤学教育。

与此一致,本综述将对虚拟现实(VR)和生成式人工智能(GenAI)在肿瘤学教育中的现有文献进行深入的叙述性综合,特别关注其在评估临床推理能力方面的应用。具体而言,本文旨在:(1)描述这些工具的技术设计及其实施背景;(2)回顾有关其有效性及教育效果的现有证据;(3)概述主要挑战,如认知、伦理和组织层面的问题,并提出未来研究与实践的方向。本文系统检索了主要学术数据库以获取相关文献,但由于综述类文章的惯例,本文侧重于解释与综合,而非方法学的详细报告。

图1 将基于虚拟现实的临床操作评估与基于生成式人工智能的临床认知评估相结合的整合模型。这种双重方法可全面捕捉临床推理的行为层面和分析层面,从而实现全面的评估与反馈。

使用虚拟现实和生成式人工智能进行迭代临床推理的示意图,包含评估结果与反馈回路。
图1:使用虚拟现实(VR)和生成式人工智能(GenAI)进行临床推理评估的整合模型。 本图展示了一个整合模型,该模型结合虚拟现实(VR)用于评估基于操作的临床推理(例如工作流程、操作步骤、团队协作)以及生成式人工智能(GenAI)用于评估认知与对话式推理(例如诊断、论证、反思)。请点击此处查看此图的放大版本。

访问受限。请登录或开始试用以查看此内容。

综述与观点

技术类型与实施
肿瘤学教育领域在临床推理评估方面的数字技术现状呈现出两种数字技术范式。当前的方法主要依赖基于虚拟现实(VR)和生成式人工智能(GenAI)的系统。尽管这两种方法都致力于提升对复杂临床能力的评估效果,但在技术基础、交互方式和评估逻辑方面存在显著差异13,14。这些系统通过头戴式显示设备和交互式界面,将学习者置于真实的肿瘤学场景中,例如门诊咨询、肿瘤急症的住院管理,或在多学科决策环境中进行训练6

虚拟现实(VR)系统的一个优势是能够利用嵌入式分析工具记录细致的行为数据。这些数据包括一系列操作行为、决策时序、导航路径以及对临床指南的遵循情况。这些指标使教育工作者能够评估临床推理过程中的操作性要素,例如信息采集、诊断步骤的优先排序以及管理路径的实施15。然而,基于虚拟现实的评估工具在实施过程中伴随着显著的基础设施和后勤挑战。硬件采购、软件开发与维护所需的高昂初始成本可能限制其可及性,尤其是在资源有限的环境中16。此外,专用物理空间的需求、技术支持以及教师培训进一步增加了大规模部署的复杂性。这些限制因素通常使虚拟现实应用局限于专业的模拟培训中心,从而制约了其在肿瘤学课程中的可扩展性与广泛整合。

相反,基于生成式人工智能(GenAI)的工具通过自然语言交互运行,提供了一种新的评估方法。这类工具基于大语言模型架构开发,使学习者能够参与互动式的文本或语音对话,模拟临床推理机制。系统鼓励学习者描述鉴别诊断、阐述管理决策背后的依据,并应对不断变化的临床情境,同时系统提供形成性反馈与评估10,11

生成式人工智能(GenAI)系统的主要优势在于能够评估临床推理中的认知和分析层面。这些工具可通过分析学习者的语言输出,评估其推理的结构、连贯性和深度,不仅限于判断答案正确与否,还能获取有关思维过程的定性信息。此外,生成式人工智能解决方案在可扩展性和可及性方面具有显著优势。与虚拟现实(VR)系统不同,生成式人工智能可应用于远程和异步学习场景,且仅需基于网络的界面即可实施5

尽管具有诸多优势,基于生成式人工智能(GenAI)的评估工具仍存在显著缺陷。其对自然语言处理的依赖导致了评分可靠性、可解释性及透明度方面的问题。许多系统属于“黑箱”模式,即评分决策的逻辑并不总是对教育工作者或学习者公开17。文献中一个明显的核心主题是两种技术范式在生态效度与可扩展性之间存在内在的权衡。虚拟现实(VR)系统在重现真实临床环境和捕捉具身化决策能力方面表现优异,但资源消耗大,因而可扩展性受限。相比之下,生成式人工智能(GenAI)系统则能够以可扩展且基于对话的方式评估认知过程7

关键的是,现有文献中严重缺乏将虚拟现实(VR)与生成式人工智能(GenAI)的优势相结合的集成或混合平台。此类整合可能有助于同时测量操作表现与认知推理,因为临床决策的本质是相互关联的18。从实施角度来看,技术能力并非决定技术采纳的唯一因素;组织和环境因素也起着重要作用。技术-组织-环境(TOE)模型是解释这些动态关系的一个良好理论视角19

总体而言,虚拟现实(VR)和生成式人工智能(GenAI)工具的类型学揭示了一个不连续但快速发展的领域。尽管这两种技术在测量临床推理的特定方面具有各自的优势,但它们目前的分离状态并未提供全面评估的机会。有必要通过概念整合、技术创新和情境敏感的实施策略来弥合这一差距,从而推动该领域向更全面、更有效的评估模型发展。

临床推理的构建与迭代评估
临床推理是一个多维度的概念,涉及支持诊断和治疗决策的认知、元认知及行为过程。在肿瘤学中,不确定性、动态变化的证据以及对多学科协作的需求进一步增加了这些过程的复杂性。现有文献 increasingly 将临床推理概念化为一个连续过程,包括信息获取、假设生成、诊断优化、决策过程以及反思性评估20,21

基于虚拟现实(VR)的系统在很大程度上与临床推理中可观测和以动作为导向的方面的评估相一致。这些平台将学习者置于模拟的临床环境中,使其能够测试人们如何获取知识、关注诊断过程以及执行一系列操作。该系统着重于将推理转化为行动,其中临床决策基于模拟环境中的互动模式22

相比之下,基于生成式人工智能(GenAI)的系统侧重于激发和分析临床推理背后内在的认知过程。通过自然语言交互,鼓励学习者提出不同的诊断,论证临床管理决策,并思考临床中的不确定性问题。这类系统通常应用自然语言处理方法,通过衡量学习者回答的语义连贯性、逻辑结构和思维深度,来判断其推理能力,从而近似模拟专家的判断13,10

尽管这些是互补的优势,但文献中发现最关键的弱点是认知与行为领域评估之间的对抗性割裂。临床推理的真实实践本质上是迭代的,这意味着思维与行动之间存在持续的反馈。这是有效临床决策过程中的一个关键循环过程,尤其在肿瘤学中更是如此,因为患者对治疗的状况和反应会随着时间而变化11

这种动态交互在当前的虚拟现实(VR)和生成式人工智能(GenAI)工具中往往未能得到体现。VR系统通常从可观察的行为中推导出推理过程,而未必触及潜在的心理活动;而GenAI系统则在临床行为背景之外分析明确表达的推理。因此,这两种策略均呈现出有偏颇的临床能力图像,无法充分评估推理活动的全部范围。另一个与将自动化分析作为主要评估工具相关的重大缺陷在于:在VR中,通过日志文件分析来理解用户行为,但这些测量可能不足以揭示临床决策背后的实际推理过程。同样,对语言的算法解读常被用于为GenAI系统评分,却可能忽略临床直觉、不确定性处理或情境特异性推理等语言细微之处。23.

此外,文献指出,目前尚缺乏将技术产出映射到已知临床推理模型的标准化方法。尽管已有研究隐含地将虚拟现实(VR)与程序性推理相关联,将生成式人工智能(GenAI)与认知性推理相关联,但鲜有研究将这些工具置于经过验证的理论框架之中。这种差异限制了对不同研究结果进行比较的可能性,也阻碍了构建一致的技术增强型评估体系。24.

该领域未来的研究重点应放在整合认知与行为评估模式上。将沉浸式模拟与实时人工智能介导的对话相结合的混合系统,能够更好地体现临床推理的迭代特性。通过这些系统,学习者在虚拟环境中的行为可触发人工智能代理的提问反应,从而同时评估学习者的行为及其行为背后的原因25,26

总体而言,尽管虚拟现实(VR)和生成式人工智能(GenAI)技术能够为临床推理的特定方面提供有价值的见解,但目前它们的应用仍较为分散。需要整合相关概念、方法学严谨性以及技术创新,以解决这种碎片化问题,并在肿瘤学教育中建立全面且有意义的评估策略。表1重点列出了虚拟现实(VR)与生成式人工智能(GenAI)在评估临床推理方面的关键差异,比较了二者在关注重点、交互方式、优势、局限性以及数据输出方面的不同。此外,图2展示了临床推理的迭代循环过程,说明VR如何支持数据采集、行动实施和反思,而GenAI则有助于假设生成、优化及诊断解释。两者结合可实现持续的循证决策与体验式学习闭环。

维度虚拟现实 (VR)生成式人工智能 (GenAI)
评估重点程序性 / 行为性认知性 / 分析性
交互模式沉浸式模拟基于对话
优势高生态效度高可扩展性
局限性资源密集型透明度有限
数据类型行为日志自然语言响应

表1: 虚拟现实与生成式人工智能在临床推理评估中的比较。 虚拟现实(VR)与生成式人工智能(GenAI)在临床推理评估中的关键维度对比,包括评估重点、交互模式、优势、局限性及数据类型。

临床推理循环图、虚拟现实与人工智能的贡献、假设检验过程。
图2:迭代式临床推理循环:虚拟现实与生成式人工智能的贡献。迭代式临床推理循环展示了虚拟现实在基于模拟的任务中如何捕捉操作行为与表现(信息采集与决策过程),同时生成式人工智能支持假设生成、鉴别诊断、解释与优化,二者共同促进持续反思并从经验中学习。请点击此处查看该图的放大版本。

效度证据与测量局限性
建立充分的效度证据是实施任何评估工具的核心,尤其是在肿瘤学教育等高风险领域。现代效度理论认为,效度是一个单一的构念,其成立依赖于多种来源的证据支持,包括内容证据、反应过程证据、内部结构证据、与其他变量的关系证据以及评估结果的影响证据27,28

大多数研究集中于内容效度,通常通过专家对临床情境、任务设计或评分标准的评审来加以证明。尽管这些方法可确保评估材料与肿瘤学实践的相关性和一致性,但并未充分提供有关工具测量临床推理潜在构念能力的信息。在大多数情况下,内容效度的验证被视为有效性的充分证据,尽管缺乏更为严格的心理测量学实践支持。29.

关于反应过程效度的证据报告尚不一致,即学习者如何感知和参与评估活动。其他研究采用可用性测试、学习者反馈或出声思维法,以表明参与者正以预期的方式与虚拟现实环境或生成式人工智能系统进行交互。此外,目前尚不清楚这些交互在多大程度上能够准确捕捉真实的临床推理能力,尤其是在模拟或人工智能介导的情境中30

虚拟现实(VR)和生成式人工智能(GenAI)技术面临的一个最重要限制是缺乏内部结构证据。可靠性指标(包括内部一致性、评分者间一致性或重测稳定性)很少被报告。对于基于自动评分的工具而言,这一问题尤为突出。生成式人工智能系统的评分算法通常依赖自然语言处理,其结果可能因提示词设计、模型参数或上下文解释的不同而产生差异31

同样,目前关于这些技术与其他变量之间关系的证据也十分有限。很少有研究试图将虚拟现实(VR)或生成式人工智能(GenAI)平台上的表现与现有的评估方法(包括客观结构化临床考试(OSCE)、笔试或工作场所评估)相关联。缺乏此类比较使得人们难以判断这些技术所测量的是否与当前临床能力框架中的构念具有一致性。这种在聚合效度和区分效度方面的不足,限制了对评估结果的解释力与可信度。32.

然而,现有文献中最大的空白在于其缺乏迁移效度。目前几乎没有数据能够支持虚拟现实(VR)模拟或基于生成式人工智能(GenAI)的测试训练可与实际肿瘤学临床实践中更优的临床推理能力相关联这一观点。由于医学培训的最终目标是改善患者照护,这一局限性成为将此类工具纳入正式评估项目的主要障碍之一。在缺乏纵向研究或结局研究的情况下,这些技术的教育效果仅局限于其被应用的模拟或实验情境中。33.

除了这些心理测量学上的缺陷外,自动化分析技术的日益使用还带来了其他挑战。虚拟现实(VR)和生成式人工智能(GenAI)都严重依赖算法对用户行为或语言进行解释,这引发了关于透明度和可解释性的疑问。在基于生成式人工智能的评估中,大型语言模型的“黑箱”特性使得人们难以理解分数是如何生成的,也难以保证评分的无偏性。这种不可解释性可能会破坏教师与学生之间的信任关系,尤其是在高利害情境下34

另一个关键问题是基于人工智能评估中的偏见。用于构建语言模型的训练数据可能捕捉到临床知识、沟通模式或文化实践方面的差异,从而导致对不同学习者群体评分时出现系统性偏差。若不加以解决,此类偏见可能对医学教育中的公平性与公正性产生严重后果。35.

此外,评估的含义(有效性另一个重要方面)在现有文献中很少被讨论。极少有研究探讨虚拟现实(VR)或生成式人工智能(GenAI)工具的使用对学习者行为、教育路径或临床环境中决策的影响。缺乏对这些技术下游效应的研究,限制了人们对这些技术可能带来的积极效果及潜在 unintended 效应的认识36

总之,虚拟现实(VR)和生成式人工智能(GenAI)技术在提供临床推理评估新方法方面具有前景,但现有证据基础尚不足以支持其在高风险情境中的应用。在所有领域,加强有效性将是下一步的关键:推动这些工具从实验性使用转变为肿瘤学教育评估中的有效组成部分。表2总结了VR和GenAI在四个领域的有效性证据——内容、内部结构、与其他变量的关系以及后果——同时指出了主要局限性,包括由专家主导的设计、可靠性测试不足、比较研究稀少以及缺乏长期结果数据。

适用范围虚拟现实证据生成式人工智能证据主要局限性
内容中等主要依赖专家判断
内部结构有限有限缺乏可靠性检验
与其他变量的关系稀少稀少缺乏足够的比较研究
后果极少极少无长期结果数据

表2:不同技术的有效性证据。 本表格展示了虚拟现实(VR)和生成式人工智能(GenAI)在临床推理评估中,涵盖内容、内部结构、与其他变量的关系以及后果等领域的有效性证据

教育成果与解读注意事项
虚拟现实(VR)和生成式人工智能(GenAI)在肿瘤学教育中的日益广泛应用,已伴随着文献中记录的整体积极教育效果。这些效果包括提高学习者的参与度、学习动机、对学习环境真实感的感知,以及获得即时、个性化反馈的能力37,38,39。这些发现表明,这些技术有望丰富教育体验,并支持临床推理能力的培养。

大量报告结果基于自我报告,例如学习者满意度、感知自信心或主观学习效果评估。尽管这些指标能够提供有关用户体验的有益信息,但它们并不总是与临床推理能力或临床表现的实际提升相关联40。在客观报告的情况下,研究往往集中于技术平台本身上的表现结果。虽然这些结果可能表明工具得到了有效使用,但无法确定此类互动是否能够进一步转化为临床推理能力的整体胜任水平。在受控或模拟环境中观察到的提升可能源于对系统的熟悉程度,而非真正的认知或行为进步。另一项局限性与现有研究的方法学特征有关。大量文献由小规模、单机构的研究构成,样本量有限且干预周期较短。这些局限性降低了统计效能,并限制了研究结果在更广泛教育环境中的可推广性33

可迁移性问题是癌症教育中尤为关注的问题。肿瘤学临床推理是一种复杂且具有纵向性的决策过程,发生在特定时间范围内和临床情境之中。然而,目前尚缺乏关于在虚拟现实(VR)或生成式人工智能(GenAI)干预中所训练的技能是否能在即时学习情境之后持续存在,或是否会影响真实临床实践的文献。此外,现有文献往往将培训结果与评估结果混为一谈。大多数VR和GenAI应用的主要目的是作为教育工具促进学习,但其成功有时被误认为是评估有效性的标志。为了准确解读,有必要区分形成性学习的益处与总结性评估的实用性42

此外,还有一些认知因素使得教育成果的解释更加复杂。先进技术会带来一系列认知负荷,可能影响学习者的表现。例如,沉浸式虚拟现实(VR)系统在导航、与界面交互或感官处理方面可能产生无关的认知负荷。通过合理的设计以及用户对系统的熟悉程度,这些因素可能促进或阻碍学习过程36。用户体验和技术使用经验也是影响因素。那些更习惯于计算机界面或人工智能驱动系统的学生可能表现更优,这并不一定是因为他们具备更强的临床推理能力,而是因为他们与系统的交互更为便捷43

意外后果的可能性是另一个需要考虑的因素。例如,过度依赖人工智能生成的反馈可能会降低逻辑思维或批判性分析的机会。同样,设计精良的虚拟现实情境可能会无意中限制决策能力,因为它减少了可能采取行动的数量。目前的文献尚未充分研究这些影响,但它们对教育设计具有重要意义44

尽管存在这些限制,但在学习者参与度和体验式学习方面所记录的积极趋势不容忽视。安全的实践环境、实时反馈,以及能够反复接触复杂情境,是虚拟现实(VR)和生成式人工智能(GenAI)技术所提供的优势。这些特点可与当前的教育理论(如体验式学习和刻意练习)相联系,这些理论强调主动学习和持续提升45

总体而言,尽管虚拟现实(VR)和生成式人工智能(GenAI)技术在变革肿瘤学教育方面展现出巨大潜力,但目前其证据基础在方法学和解释上仍存在局限。因此,必须持审慎和谨慎的态度,以避免对研究结果进行过度泛化,并确保有关教育有效性的主张具有坚实的实证依据。

认知、伦理与组织方面的考量
从认知角度看,这些技术的开发与应用可能显著影响学习者获取信息和进行临床推理的方式。认知负荷理论为理解这些影响提供了一个实用的框架,该理论包含三种类型的认知负荷:内在认知负荷、外在认知负荷和相关认知负荷43。尽管虚拟现实(VR)环境具有沉浸感和吸引力,但可能给用户带来较大的外在认知负荷,原因在于需要进行导航、接受感官刺激以及应对界面的复杂性。如果缺乏周密设计,这些因素可能会将认知资源转移到非核心的推理过程上,从而削弱学习效果和评估表现38

同理,生成式人工智能(GenAI)系统在信息呈现和交互动态方面带来了新的认知挑战。例如,人工智能系统产生的过多或冗余反馈可能导致信息超载,从而妨碍有效学习。另一方面,经过合理设计的自适应反馈可通过图式构建和反思性思维增强相关认知负荷46。因此,指导性支持与认知自主性之间的平衡至关重要,过度依赖人工智能生成的回答可能会减少独立解决问题和批判性思维的机会。
用户对这类技术的认知参与程度还受到其熟悉度和数字素养的影响44

伦理问题在虚拟现实(VR)和生成式人工智能(GenAI)用于教育评估时同样至关重要。其中最突出的问题之一是基于人工智能系统中的算法偏见。机器学习模型(例如大语言模型)依赖大量数据进行训练,而这些数据可能带有对现有社会、文化或职业规范的偏向性。因此,评估结果可能导致对特定学习者群体的不当歧视,从而引发对公平性与公正性的质疑35。其他伦理问题还包括透明度与可解释性。大多数生成式人工智能系统属于“黑箱”模型,其决策过程缺乏明确说明。这种评估过程的不可解释性可能削弱学习者与教育者之间的信任,尤其是在评估结果具有重大学术影响的情况下34

数据的安全性和隐私性也是一个需要重点考虑的因素,因为教育数据以及可能涉及的临床数据均属于敏感信息。虚拟现实(VR)可用于记录详细的行为数据,而生成式人工智能(GenAI)平台则能够处理大量文本数据。为了维护伦理标准及机构公信力,必须确保遵守数据保护规定,并保障用户信息的安全47

除了个体层面的问题外,组织层面的问题在这些技术的成功应用中也起着决定性作用。在肿瘤学教育中实施虚拟现实(VR)和生成式人工智能(GenAI)必须与机构的目标、资源获取途径以及支持性的治理框架保持一致。技术-组织-环境(TOE)模型是分析这些因素的有力工具,可重点关注技术准备度、组织能力以及外部环境影响之间的相互作用48

组织准备度包括教师的能力、培训以及对新技术的接受程度。对采用新技术的可能抵触情绪,可能源于对可靠性的担忧、工作负担过重,或仅仅是对人工智能驱动系统的不熟悉。通过有针对性的教师发展计划,以及明确制定技术在评估中使用的规定,可以克服这些障碍。49.

该领域的一种新方法聚焦于“开明自主”的理念,即构建人工智能系统以辅助而非取代人类判断。该方法主张将自动化分析与人工控制有机结合,使技术在不干扰责任性或专业性的前提下提升决策水平50。在临床推理评估的背景下,这可能涉及将人工智能生成的见解与专家评估相结合,以实现更全面、更可靠的评估过程。

总体而言,将虚拟现实(VR)和生成式人工智能(GenAI)引入肿瘤学教育不仅涉及技术革新,还涉及复杂的认知、伦理和组织层面的问题。充分考虑这些因素对于最大限度地发挥这些技术的教育价值并降低潜在风险至关重要。一种跨学科的策略至关重要,该策略需综合考虑以用户为中心的设计、伦理问题以及机构的准备情况,以推动在临床推理评估中负责任地应用技术。图3 技术-组织-环境(TOE)框架,用于识别将虚拟现实(VR)和生成式人工智能(GenAI)整合到肿瘤学教育中的关键实施因素。成功实施需要系统能力、组织支持以及外部环境条件之间的协调一致。

技术、组织、环境因素促成实施成功的教育示意图。
图3 在肿瘤学教育中实施虚拟现实(VR)与生成式人工智能(GenAI)的技术-组织-环境(TOE)框架。 技术-组织-环境(TOE)框架应用于肿瘤学教育中虚拟现实(VR)与生成式人工智能(GenAI)的整合,突出显示在系统能力、领导力与课程设置,以及监管、资金和文化因素方面的关键要素,以实现成功实施。 请点击此处查看此图的放大版本。

访问受限。请登录或开始试用以查看此内容。

结论

肿瘤学中的临床推理是一个不断扩展且具有挑战性的问题,长期以来一直是肿瘤决策中复杂、动态、高风险且依赖具体情境的重要方面。本综述探讨了虚拟现实(VR)和生成式人工智能(GenAI)作为克服传统评估技术局限性的创新解决方案所具备的新功能。综合现有证据表明,这些技术具有互补而非重叠的优势,但尚未实现概念上的系统化,也未克服方法学上的限制,或完成部分有效性验证。

基于虚拟现实(VR)的系统可提供高保真、沉浸式的环境,用于观察和测量临床推理中的操作性和情境性组成部分。VR通过在模拟临床过程中记录和分析详细的行为信息,提高了生态效度,从而深入了解学习者在复杂情境下的行为表现。相比之下,基于生成式人工智能(GenAI)的系统则能够通过自适应对话,评估推理过程中的认知与分析层面。

尽管已取得这些进展,但本综述的一个关键发现是这些技术范式之间缺乏关联性。目前的实施方案往往孤立地关注行为表现或认知过程,无法反映思维与行动之间相互作用的特性,而这种相互作用正是真实临床推理的核心特征。这种割裂状况还因有效性证据不足而进一步加剧,尤其是在可靠性、可迁移...

访问受限。请登录或开始试用以查看此内容。

致谢

资助:基金:浙江省教育厅一般科研项目(自然科学类)(项目编号:Y202558353)。

基金项目:高等教育专项研究项目:人工智能赋能教育教学应用(KT2025426)

访问受限。请登录或开始试用以查看此内容。

参考文献

  1. Shimizu, H., Nakayama, K. I. Artificial intelligence in oncology. Cancer Sci. 111 (5), 1452-1460 (2020).
  2. Ginsburg, K. B., Curtis, G. L., Timar, R. E., George, A. K., Cher, M. L. Delayed radical prostatectomy is not associated with adverse oncologic outcomes: implications for men experiencing surgical delay due to the COVID-19 pandemic. J Urol. 204 (4), 720-725 (2020).
  3. Egbuna, I., Olatokun, T., Ozo-Ogueji, P., Ekechi, C., Akinbo, O., et al. Revolutionizing cancer surgery: Harnessing artificial intelligence and augmented reality for next-generation precision oncology. Int J Life Sci Res Arch. 9 (1), 147-176 (2025).
  4. Sminia, P., et al. Clinical radiobiology for radiation oncology. Radiobiology textbook. , (2023).
  5. Wood, E. A., Ange, B. L., Miller, D. D. Are we ready to integrate artificial intelligence literacy into medical school curriculum? Students and faculty survey. J Med Educ Curric Dev. 8, 23821205211024078 (2021).
  6. Kok, D. L., Dushyanthen, S., Peters, G., Sapkaroski, D., Barrett, M., et al. Virtual reality and augmented reality in radiation oncology education: A review and expert commentary. Tech Innov Patient Support Radiat Oncol. 24, 25-31 (2022).
  7. Rahimi, F., Sadeghi-Niaraki, A., Choi, S. M. Generative AI meets virtual reality: A comprehensive survey on applications, challenges, and future directions. IEEE Access. 13, 1-20 (2025).
  8. von Ende, E., Ryan, S., Crain, M. A., Makary, M. S. Artificial intelligence, augmented reality, and virtual reality advances and applications in interventional radiology. Diagnostics (Basel). 13 (5), 892 (2023).
  9. Esmail, S., Concannon, B. Immersive virtual reality and AI (generative pretrained transformer) to enhance student preparedness for objective structured clinical examinations: Mixed methods study. JMIR Serious Games. 13, e69428 (2025).
  10. Gilson, A., Safranek, C. W., Huang, T., Socrates, V., Chi, L., et al. How does ChatGPT perform on the United States Medical Licensing Examination (USMLE)? The implications of large language models for medical education and knowledge assessment. JMIR Med Educ. 9 (1), e45312 (2023).
  11. Kung, T. H., Cheatham, M., Medenilla, A., Sillos, C., De Leon, L., et al. Performance of ChatGPT on USMLE: Potential for AI-assisted medical education using large language models. PLoS Digit Health. 2 (2), e0000198 (2023).
  12. Xu, L., Sanders, L., Li, K., Chow, J. C. Chatbot for health care and oncology applications using artificial intelligence and machine learning: Systematic review. JMIR Cancer. 7 (4), e27850 (2021).
  13. Pottle, J. Virtual reality and the transformation of medical education. Future Healthc J. 6 (3), 181-185 (2019).
  14. Farina, E., Nabhen, J. J., Dacoregio, M. I., Batalini, F., Moraes, F. Y. An overview of artificial intelligence in oncology. Future Sci OA. 8 (4), FSO787 (2022).
  15. Hamilton, A. Artificial intelligence and healthcare simulation: The shifting landscape of medical education. Cureus. 16 (5), e00000 (2024).
  16. Siddiqui, F. M., Jabeen, S., Alwazzan, A., Vacca, S., Dalal, L., et al. Integration of augmented reality, virtual reality, and extended reality in healthcare and medical education: A systematic review. J Med Educ Curric Dev. 12, 23821205251342315 (2025).
  17. Wang, S., Zhang, H. Industrial information integration through autonomous AI agents: Paradoxical effects on transparency, dehumanization, and responsible operations. J Ind Inf Integr. 51, 101089 (2026).
  18. Tortora, A., Amaro, I., Della Greca, A., Barra, P. Exploring the role of generative artificial intelligence in virtual reality: Opportunities and future perspectives. , 125-142 (2025).
  19. Wang, S., Zhang, H. Generative AI in international hotel marketing: Impacts on employee creativity and performance. Int J Contemp Hosp Manag. 37 (8), 2601-2626 (2025).
  20. Christensen, N., Jones, M. A., Rivett, D. A., Jones, M. A., Rivett, D. A. Strategies to facilitate clinical reasoning development. Clinical reasoning in musculoskeletal practice. , 562-582 (2019).
  21. Cook, D. A., Sherbino, J., Durning, S. J. Management reasoning: Beyond the diagnosis. JAMA. 319 (22), 2267-2268 (2018).
  22. Croskerry, P. A universal model of diagnostic reasoning. Acad Med. 84 (8), 1022-1028 (2009).
  23. Norman, G. Research in clinical reasoning: Past history and current trends. Med Educ. 39 (4), 418-427 (2005).
  24. Topol, E. J. High-performance medicine: The convergence of human and artificial intelligence. Nat Med. 25 (1), 44-56 (2019).
  25. Durning, S. J., Artino, A. R., Pangaro, L. N., van der Vleuten, C., Schuwirth, L. Redefining context in the clinical encounter: Implications for research and training in medical education. Acad Med. 85 (5), 894-901 (2010).
  26. Bickmore, T. W., Giorgino, T. Health dialog systems for patients and consumers. J Biomed Inform. 39 (5), 556-571 (2006).
  27. Messick, S. Validity. educational measurement. , 13-103 (1989).
  28. Cook, D. A., Beckman, T. J. Current concepts in validity and reliability for psychometric instruments: Theory and application. Am J Med. 119 (2), 166.e7-166.e16 (2006).
  29. Downing, S. M. Validity: On meaningful interpretation of assessment data. Med Educ. 37 (9), 830-837 (2003).
  30. Artino, A. R., La Rochelle, J. S., Dezee, K. J., Gehlbach, H. Developing questionnaires for educational research: AMEE Guide No. 87. Med Teach. 36 (6), 463-474 (2014).
  31. Gwet, K. L. . Handbook of inter-rater reliability. , (2021).
  32. Norcini, J., Anderson, M. B., Bollela, V., Burch, V., Costa, M. J., et al. Criteria for good assessment: Consensus statement and recommendations from the Ottawa 2010 Conference. Med Teach. 33 (3), 206-214 (2011).
  33. Cook, D. A., Hatala, R., Brydges, R., Zendejas, B., Szostek, J. H., et al. Technology-enhanced simulation for health professions education: A systematic review and meta-analysis. JAMA. 306 (9), 978-988 (2011).
  34. Topol, E. J. . Deep medicine: How artificial intelligence can make healthcare human again. , (2019).
  35. Obermeyer, Z., Powers, B., Vogeli, C., Mullainathan, S. Dissecting racial bias in an algorithm used to manage the health of populations. Science. 366 (6464), 447-453 (2019).
  36. van der Vleuten, C. P. M., Schuwirth, L. W. T. Assessing professional competence: From methods to programmes. Med Educ. 39 (3), 309-317 (2005).
  37. Radianti, J., Majchrzak, T. A., Fromm, J., Wohlgenannt, I. A systematic review of immersive virtual reality applications for higher education: Design elements, lessons learned, and research agenda. Comput Educ. 147, 103778 (2020).
  38. Makransky, G., Petersen, G. B. Immersive virtual reality and learning: A meta-analysis. Educ Psychol Rev. 31 (4), 915-943 (2019).
  39. Luckin, R., Holmes, W., Griffiths, M., Forcier, L. B. . Intelligence unleashed: An argument for AI in education. , (2016).
  40. Sitzmann, T., Ely, K., Brown, K. G., Bauer, K. N. Self-assessment of knowledge: A cognitive learning or affective measure?. Acad Manag Learn Educ. 9 (2), 169-191 (2010).
  41. Reeves, S., Fletcher, S., Barr, H., Birch, I., Boet, S., et al. A BEME systematic review of the effects of interprofessional education. Med Teach. 38 (7), 656-668 (2016).
  42. Issenberg, S. B., McGaghie, W. C., Petrusa, E. R., Lee Gordon, D., Scalese, R. J. Features and uses of high-fidelity medical simulations that lead to effective learning: A meta-analysis. Med Teach. 27 (1), 10-28 (2005).
  43. Sweller, J. Cognitive load theory. Psychol Learn Motiv. 55, 37-76 (2011).
  44. Liaw, S. S., Huang, H. M. Perceived satisfaction, perceived usefulness and interactive learning environments as predictors to self-regulation in e-learning environments. Comput Educ. 60 (1), 14-24 (2013).
  45. Carr, S. AI gone wild: Implications of artificial intelligence for education. Educ Technol. 60 (2), 3-10 (2020).
  46. Wang, S., Sun, Z. Roles of artificial intelligence experience, information redundancy, and familiarity in shaping active learning. Educ Inf Technol. 30 (2), 2525-2546 (2025).
  47. European Parliament and Council. General Data Protection Regulation (GDPR). Off J Eur Union. L119, 1-88 (2016).
  48. Tornatzky, L. G., Fleischer, M. . The processes of technological innovation. , (1990).
  49. Rogers, E. M. . Diffusion of innovations. , (2003).
  50. Floridi, L., Cowls, J. A unified framework of five principles for AI in society. Harv Data Sci Rev. 1 (1), 1-15 (2019).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签