这项前瞻性观察性研究表明,人工智能驱动的个性化学习系统显著提升了长期手术室器械的能力,减少了安全事故,并提高了培训效率,相较于传统教学。
Research Article
这项前瞻性观察性研究表明,人工智能驱动的个性化学习系统显著提升了长期手术室器械的能力,减少了安全事故,并提高了培训效率,相较于传统教学。
传统的手术室器械培训往往依赖一刀切的教学,导致长期技能保持率低,并导致可预防的手术错误。本研究假设,人工智能(AI)驱动的个性化学习系统可以通过根据个别学习者特征定制练习,提升技术能力、患者安全和培训效率。开发了一套基于人工智能的个性化学习系统(APLS),结合了数据驱动的学习者表型分析、基于深度学习的工具识别、能力轨迹的集合预测以及强化学习,在基于模拟的训练中提供自适应多模态反馈。在一项前瞻性观察研究中,采用基于群组的科室分配(引入准实验元素),在一家三级医院完成了107名多学科手术室工作人员,完成了AI驱动的课程或标准的教师主导培训。主要结局为器械操作能力的12个月保持,采用围手术器械熟练度量表(PIPS)衡量;次要结果包括手术室安全事故、培训时间和每位合格专业人员的成本。与传统培训相比,个性化系统与显著更高的12个月能力评分相关(APLS 84.1 ± 9.2,对照组为58.9 ± 18.7,< 0.001),临床实践中安全相关事件更少,培训时间减少近一半,整体培训成本降低38.3%。该AI集合在预测学习者表现和选择反馈策略时,也优于其单个机器学习组件。这些发现表明,将无监督表型发现、监督预测和强化学习整合到统一平台中,可以显著提升手术室器械培训,并可能为围手术期护理中基于数据驱动的劳动力发展提供可扩展的框架。
手术室环境是医疗领域最复杂的环境之一,在其中有效的多学科协作直接影响患者安全结果和手术质量 1,2。仅中国医院每年因器械能力培训不足,估计就导致15,000起可预防的手术错误,其中沟通失败和技术缺陷占围手术期不良事件的72%。传统培训方法依赖标准化方法,未能考虑个体学习差异、认知处理变异和个性化能力发展轨迹 4,5。
从理论角度看,多个教育框架阐明了为何个性化方法在复杂心理运动领域可能优于标准化教学。认知负荷理论6认为,教学设计必须考虑工作记忆有限的能力,尤其是在学习者必须同时处理高保真环境中的新程序性、概念性和感知信息时,比如手术室7。通过根据个人认知特征调整内容难度和呈现方式,个性化系统可以优化内在与外在认知负荷之间的平衡。刻意练习框架进一步表明,当培训包含个性化挑战水平、即时纠正反馈以及针对已识别弱点的重点重复时,技能获得将最大化,这些元素在传统学徒模式中难以持续实施,但通过算法适应自然可操作化8.此外,近端发展区为适应性难度调整提供了理论基础,表明当任务被校准为刚好超出学习者当前独立能力时,学习效果最佳。这些理论考虑共同支持这样一个假设:能够根据个别学习者特性动态调整教学参数的人工智能系统,应当优于静态、一刀切的训练。
机器学习和实时性能分析的最新进展为应对教育挑战带来了巨大潜力 6,7。当代人工智能在外科教育中的应用展现出潜力,研究报告称当人工智能驱动的反馈系统实施时,技能习得有显著提升9。然而,现有基于人工智能的手术训练平台,包括商业可用的Touch Surgery及先前研究中回顾的类似平台,主要依赖单算法架构,通常是孤立的神经网络或决策树,通过逐步视觉指南进行手术排练,缺乏实时自适应反馈或个性化学习路径优化。以往的研究尚未将异构数据流(眼动追踪、动作捕捉和生理监测)的多模态传感器融合处理与通过强化学习动态调整的自适应反馈机制集成在一起,见10,11。此外,现有系统尚未将无监督表型发现与监督预测方法结合在统一的教育框架内12,13。这些差距代表了错失的机会,因为关于个性化学习的理论文献强烈表明,集成的多元自适应系统应比单元方法更有效14。
围手术期环境中的现有教育框架存在若干重要局限性 8,15。传统的学徒模式学习体验不一致,教师质量、反馈标准化和能力评估可靠性存在显著差异。这些方法未能适应多样化的学习风格,无法适应个人进步速度,且缺乏优化教育成果所需的复杂分析工具11,15。为解决这些未被满足的需求,本研究引入了人工智能驱动的个性化学习系统(APLS),这是一种综合性的教育干预,将四个算法上不同的组成部分统一在一个自适应平台上,设计用于多学科手术室器械训练。据我们所知,该系统是外科教育文献中最早实证整合以下能力的系统之一:一种混合架构,将数据驱动的学习者表型发现与监督分类用于实时表型分配的监督分类相结合;一种转移学习流水线,将预训练的卷积神经网络适配到利用有限领域特异性数据实现手术器械视觉识别;一个通过学习者互动迭代优化反馈时机和模态的强化学习模块;以及一个集合预测框架,综合多个异构算法的输出,比单靠任何组成模型更准确地预测能力轨迹。通过对APLS与标准讲师主导培训进行12个月前瞻性比较,涵盖学习成果、临床绩效指标、培训效率和成本效益,本研究旨在确定统一的AI驱动个性化平台是否能在围手术期器械教育方面实现超越现有教学实践的实质性进展。
Access restricted. Please log in or start a trial to view this content.
本研究依据赫尔辛基宣言进行,并经浙江大学医学院邵氏医院伦理委员会批准(批准号:0480,2025年8月10日批准)。所有参与者在参与前均提供了书面知情同意书。
研究设计与环境
一项基于群组的前瞻性观察性研究于2024年1月至2025年2月在中国杭州浙江大学医学院邵氏医院进行。基于部门的分配策略为该设计引入了准实验元素;因此,因果推断应谨慎解释,16。该研究采用了基于部门分配的平行组比较,以防止跨组信息共享。实施分层入组以确保基线特征的可比性。医院设有专用模拟实验室,配备标准化手术室环境、手术器械、监测设备和视频录制功能。
样本选择与参与者
医疗专业人员通过分层随机抽样,从Sir Run Run Shaw医院所有符合条件的围手术期工作人员(n=342)中招募,时间为2023年11月至2024年1月。分层变量包括专业角色(护士、外科技术员和麻醉技师)、经验水平(<5年、5–10年、10–15年和>15年)、学历(副学士、学士和硕士学位)以及临床部门(普通外科、骨科手术、心血管外科及其他专科)。在每个层级内应用计算机生成的随机数(R软件, set.seed = 12345以保证可重复性),并使用 抽样 函数,以确保在所有人口统计和专业类别中具有代表性。样本量使用基于初步试点数据的 G*Power 3.1.9.7 软件计算(n=30),预期效应值为Cohen's d = 0.60,双尾显著性水平α=0.05,期望统计效力(1−β)= 0.80,表明最低要求90名参与者(每组45人)。为考虑基于机构历史数据预期的15%辍学率(流失),目标招募人数定为104名参与者。实际注册人数达到120人,扣除最后11%的流失率后,贡献了87%的权力。
纳入标准要求
(1)目前在Sir Run Run Shaw医院从事围手术期工作;(2)至少6个月的手术室经验;(3)整个13个月研究期间的可用性;(4)愿意参与所有评估活动;以及(5)基础计算机素养,定义为能够独立操作网页浏览器和使用键盘/鼠标输入的能力。
包含排除标准
研究期间计划的延长休假,过去6个月内参加其他外科器械培训项目,视力障碍无法矫正至20/40或更高,且目前正在正规外科技术学位项目中注册。最初共招募了120名参与者,其中107人完成了完整研究方案(完成率89.2%)。退出的原因包括工作变动(n = 7)、个人情况(n = 4)以及技术相关困难(n = 2)。使用逻辑回归进行流失分析显示,退出与基线特征(包括年龄(OR = 1.03,p = 0.52)、性别(OR = 0.87,p = 0.85)、专业角色(p = 0.73)或基线PIPS分数(OR = 1.01,p = 0.67)之间无显著关联,表明Little的MCAR测试(χ2 = 43.2,df = 38,p = 0.26)证实的随机缺失模式。
编队分配
为减少教育干预固有的污染效应,参与者根据部门隶属被分配到干预组或对照组。科室(n=8)根据手术病例量和人员规模配对,然后利用计算机生成的随机化(R软件, 种子 =54321)随机分配到APLS或对照条件。采用这种基于集群的方法,是因为部门内的个别随机分配存在同事共享知识和培训经验时存在显著交叉污染的风险。承认系文化、领导质量、基线教育实践和病例组合可能独立影响结果,代表了非个体化随机设计无法完全解决的潜在残余混杂因素来源16。分层抽样确保了基线特征的可比性。进行PIPS评估的结果评估员通过编码参与者标识盲分组。统计分析师在主要分析完成前,接收带有掩蔽组标签的去标识数据集。
APLS 系统架构与技术实现
APLS由四个集成计算组件组成,运行在基于云的平台(材料表)上。该系统采用开源深度学习框架和基于网页的前端(见材料表),采用RESTful API协议(表示性状态传输应用程序接口,实现前端客户端与服务器端机器学习模块之间的基于HTTP的标准化通信)、基于JSON网络令牌(JWT)的认证(确保只有授权用户和系统组件能访问学习者数据和模型端点)。 以及TLS 1.3传输层加密(保护客户端设备、应用服务器和基于云的模型服务基础设施之间传输的所有数据安全),以保障数据安全。补充文件1中提供了软件环境的完整描述,包括依赖规范(requirements.txt)、配置文件结构和数据管道初始化命令。
硬件设置与校准
每次训练前,都会进行以下硬件校准序列。一台眼动追踪装置(见 材料表)被放置在距离参与者眼睛60–70厘米的高度可调支架上,校准采用制造商标准的9点方案,视觉角度≤0.5°。一个八摄像机阵列(见 材料表)呈圆形排列,半径为训练站中心2.5米,高度在1.8米和2.4米之间交替,采用制造商的扫描仪程序校准,残余误差阈值为≤0.3毫米。反射标记(n = 16,直径 = 12.7 毫米)根据 补充文件2中描述的标记放置协议,固定在双手和手腕的标准解剖标志上。生理监测设备根据制造商说明安装,并在会话启动前验证信号质量。
组成部分1:学习者表型分类系统
该分类系统采用两阶段混合方法,结合了无监督和监督学习。在第一阶段,使用k-均值聚类分析基线评估数据,以发现自然的学习者分组。输入特征(n=37)包括基线PIPS领域得分(4项)、VARK学习风格量表评分(4项)、计算机反应时间任务的认知处理速度(3项)、技术舒适度评分(1项)、人口统计变量(3项)、数字跨度测试的工作记忆容量(2项)、心理旋转任务的空间推理(1项)、精细运动技能基线分数(3项特征), 五大联盟的人格特质(5个特征),以及来自机构记录的以往绩效指标(3个特征)。详细的预处理规范、超参数优化程序和特征重要性排名均见 补充文件1(S2节)。 这三个组别分别被描述为学习快(30.9%)、平均(49.1%)和学习慢(20.0%)。在第二阶段,监督分类使用训练于簇标签的支持向量机器进行,实现对新学习者的实时分类。完整的超参数搜索空间、交叉验证结果和逐类分类指标均报告于 补充文件1(S2.3节)。
组件二:多模态数据集成与传感器融合系统
该平台集成了五个异质数据流:眼动追踪数据、动作捕捉数据、生理监测(心率变异性、皮肤电反应和唾液皮质醇)、通过自动视频分析进行的性能分析以及交互记录。详细的传感器规格、预处理流程、特征提取程序以及用于认知状态估计的卷积神经网络架构,详见 补充文件1(S3节)。融合系统生成每1秒更新一次的认知状态表征,编码整合注意力、运动执行、认知负荷和任务表现。
组件3:预测分析引擎
集合预测系统结合了三种互补算法:随机森林、梯度增强机(XGBoost)以及具有长短期记忆(LSTM)层的深度神经网络,将认知状态嵌入处理为时间序列。集合聚合采用加权软投票,权重通过验证数据优化。完整的算法规范、超参数值、训练过程和收敛诊断均提供于 补充文件1(S4节)。训练、验证、部署和评估数据集被严格分离;模型开发仅使用了之前一项150名参与者的先导研究数据(80%为培训,20%为验证),当前研究参与者构成了完全未完成的部署数据集。部署期间的滚动再训练仅使用之前的7天交互数据,未纳入结果评估数据,从而防止评估结果泄漏到预测模型中。
组件4:基于强化学习的自适应反馈系统
自适应反馈系统采用Q学习,将反馈选择表述为马尔可夫决策过程。状态空间(25维)编码当前认知状态、时间上下文、任务参数和学习者特征。动作空间由25个独立动作组成,代表反馈模态、时机和特异性的组合。奖励函数包括表现提升、认知过载避免、参与度维持和纠正潜伏期。状态空间、动作空间、奖励函数、Q学习更新参数和收敛准则的数学表述详见补充文件1(S5节)。
培训会话工作流程
每次APLS培训课程均遵循以下标准化顺序进行。(1) 参与者在指定的培训工作站使用分配的凭证登录APLS平台。(2) 通过自动质量检查验证硬件校准(眼动追踪器、动作捕捉和生理传感器),确认信号完整性可接受。(3) 系统检索参与者当前学习者表型分类和预测的能力轨迹,以配置会话参数。(4)初步热身模块(5分钟)回顾上一节课的内容,并根据参与者的记忆习惯进行调整。(5)核心训练模块(40-50分钟)呈现仪器识别、处理和程序任务,难度等级由自适应算法确定,实时多模态反馈基于Q-学习策略。(6) 会显示会话总结和绩效仪表盘,显示与参与者个人学习轨迹和能力里程碑相关的进展情况。(7)参与者完成简短的满意度调查(2分钟)。(8) 会话数据会自动上传到云服务器以进行模型更新。
对照组程序
对照组接受了按照标准化机构规程进行的传统手术室器械培训。培训包括由高级手术室(OR)护士教育者进行的8小时课堂讲授,涵盖器械类别、命名法、操作原理及无菌技术;一本印刷的培训手册(187页),包含器械照片、规格和按外科专科分类的描述;两场4小时的实操工作坊,在模拟实验室进行物理仪器组,由教师监督(师生比1:6);提供包含数字培训材料的机构学习管理系统访问,供自我指导审查;并安排每季度复习(2小时),复习常见混淆的乐器。整个学习期间,结构化教学总时长为20小时。未纳入自适应算法、个性化路径或人工智能增强组件。
结果指标
主要结局 为训练后12个月使用经验证的围手术期器械熟练量表(PIPS)评估知识保留能力。完整的PIPS开发流程,包括文献综述和专家焦点小组的题目生成、三轮修正Delphi内容验证(内容有效性指数=0.94)、探索性和确认性因素分析,以及完整的行为锚定评分标准,均载于 补充文件3。该仪器表现出强烈的心理测量特性(克朗巴赫α = 0.92,ICC = 0.91,每两周一次)。PIPS包含四个领域的24项:仪器识别(6项)、操作熟练度(6项)、安全协议(6项)和团队沟通(6项)。每条题使用五点李克特量表(1=新手,5=专家),描述词基于行为。总分范围为24到120,分数越高表示熟练度越高。
PIPS评估由受过培训的评估员(六名具>10年手术经验且完成8小时标准化培训的外科护士)在基线、干预后立即及1、3、6和12个月随访时进行。评估者通过编码参与者标识符对组组分配进行了盲处理,并评估了经过编辑以去除任何可见APLS特定界面元素或反馈显示的视频录制。评估人员并未被告知参与者接受了哪种培训方式。通过对20%评估进行双编码(n=128)建立了评审间信度,所有领域均实现ICC评分>0.85(总得分ICC = 0.89,95%置信区间:0.85-0.92)。
次要结果如下:(1)通过针对仪器操作的客观结构化技术技能评估(OSATS)评估实际能力,该测试包含六个标准化站点(最高30分),由盲法专家评审员在基线及3、6和12个月时进行(ICC = 0.87)。(2) 培训时间效率以达到能力门槛(PIPS ≥ 75)所需的总小时数来衡量。(3)成本效益以每位合格学习者的成本计算,包含直接和间接成本,成本通过机构会计数据归一化为2024人民币。(4)学习者满意度通过5分李克特量表问卷(27题,内部一致性α=0.91)进行评估。(5)来自机构安全报告系统的探索性临床绩效指标:培训后12个月内的器械相关事故报告,每1000例手术发生率已根据病例复杂度调整。安全事件结局被归类为探索性,因为研究未能检测这些低频事件的差异。
统计分析方法
所有统计分析均使用R 版本4.3.0 ,配合 RStudio 接口及以下软件包: lme4 用于混合效应模型, emmeans (“估计边际均值”;R软件包用于计算模型调整后的群体均值并对拟合混合效应模型进行Tukey、Bonferroni或Scheffé的事后两项比较), psych 用于心理测量分析, effsize (用于计算标准化效应量,包括Cohen的d和Hedges的g,并带有置信区间)用于效应量计算 ,鼠标用于 多重补补。显著性阈值在所有假设检验的先验中设定为α = 0.05(双尾)。
进行了多次比较修正,具体如下。对于主要结果(跨时间点的PIPS总分),通过利用Kenward-Roger自由度,从线性混合效应模型中的组×时间相互作用中推断,无需对多个时间点进行单独校正。对于PIPS领域子量表(四次同时比较),采用了Bonferroni修正(调整后α=0.0125)。对于次要结局(四个指标:或运分效率评分、安全事件、团队沟通评分和错误频率),采用了本贾米尼-霍赫伯格假发现率程序(q = 0.05)。对于人工智能系统性能指标(十项内部比较),采用了Bonferroni修正(调整后α = 0.005)。所有报告的p值和显著性判定均明确参考适用的修正。
所有主要和次要组间结局均采用线性混合效应模型分析,组别、时间及其相互作用效应固定,参与者和部门均采用随机截取(以考虑基于群组分配产生的班内相关性)。在部门层面估计了班级相关系数,以量化聚集程度。缺失的数据模式通过Little的MCAR检验进行评估;数据被随机判定为完全缺失,并通过多重插补处理,采用预测平均匹配(m = 20个推值数据集,通过Rubin规则合并结果)。通过完整病例分析、变化的补值数(m = 10, m = 50)以及最坏/最佳情景的敏感性分析来评估鲁棒性。
Access restricted. Please log in or start a trial to view this content.
参与者特征
最终样本包括107名记忆良好(见图1)的参与者。对完成者(n = 107)与退选者(n = 13)进行流失分析,发现基线特征无显著差异:年龄(t = 0.89,p = 0.38)、性别(χ2 = 0.21,p = 0.64)、专业角色(χ2 = 1.45,p = 0.48)、基线PIPS得分(t = 0.62,p = 0.54)或组别(χ2 = 0.03,p = 0.86),支持Little的MCAR检验(χ2 = 43.2, df = 38,p = 0.26)。
基线特征显示组间实现了成功平衡,人口统计变量、教育背景、既往经验或技术舒适度等方面无显著差异(见表1)。经过Benjamini-Hochberg对18个基线比较的修正(FDR q = 0.05),所有p值均维持在0.25>,...
Access restricted. Please log in or start a trial to view this content.
这项前瞻性观察性研究通过基于集群的科室分配,结合了准实验元素,提供了证据表明,集成多种机器学习算法的人工智能个性化学习系统,与传统教学方法相比,在手术室器械训练效果上有显著提升。这些发现对人工智能方法论和外科教育实践都有重要影响;然而,以下将讨论的几项重要警告削弱了推断的强度。
APLS框架提出了一个统一平台,将四个算法上不同的组成部分——无监督学习者表型、基于迁移学习的工具识别、集合能力预测以及基于强化学习的自适应反馈——整合成一个连贯的教育干预。据我们所知,这是外科教育中少数此类集成系统实证案例之一,因为以往平台通常采用单算法方法或单独处理各个组成部分 8,10,11。集合模型的预测准确率为96.7%,显著超过其各个组成部分,这与集合方法在复杂预测任务中的理论优势一致,并表明没有单一算法能充分捕捉外科技能习得的多维特性。强化学...
Access restricted. Please log in or start a trial to view this content.
作者声明他们与这项工作无任何竞争性的财务或非财务利益。
作者感谢Sir Run Run Shaw医院的手术室工作人员和护理教育团队在实施培训项目和数据收集方面的支持。本研究得到了浙江医卫项目(资助编号:2025HY0440和2023KY781)的支持。资助机构在研究设计、数据收集、数据分析、数据解释或论文撰写中均未参与。
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| 触觉反馈手术模拟器(Touch X) | 3D 系统(前称 Sensable) | 幻影高级版 3.0 | 六自由度触觉装置;作为模拟组织操作和缝合任务中AI驱动力反馈传递的主要接口 |
| 模拟软件平台(SimSurgery™AI 套件) | 定制/内部开发 | 无 | 专有的AI驱动训练软件集成卷积神经网络(CNN)模块,实现实时性能分类和自适应反馈生成 |
| 力/扭矩传感器 | ATI工业自动化 | 纳诺17 SI-12-0.12 | 测量组织处理和缝合练习中施加的仪器力(分辨率:0.003牛顿);数据输入AI分类算法 |
| 运动跟踪系统 | 北方数字公司(NDI) | 北极星维加ST | 手术器械轨迹的光学跟踪;0.12毫米均方根体积精度;用于仪表导航精度评估 |
| 腹腔镜仪器组(训练) | 卡尔·斯托茨 SE &KG连 | 26003 AA / 33310 DB | 标准5毫米腹腔镜抓斗和针驱动器,广泛应用于AI驱动和传统训练臂 |
| 高保真组织幻影(软组织模型) | SynDaver实验室 | 外科腹部模型(SKU:SYN-ABD) | 经验证的合成组织替代物,用于缝合、解剖和组织处理练习;根据制造商指南,每50次更换一次 |
| GPU工作站 | NVIDIA / 戴尔 | 戴尔 Precision 7920 搭载 NVIDIA A6000(48 GB 显存) | 用于实时人工智能推断的计算硬件(卷积神经网络分类延迟及15毫秒);连接到触觉设备的专用服务器 |
| 神经网络框架 | 开源(Meta AI) | PyTorch 2.1.0 版本 | 用于自适应反馈算法的模型训练、验证和实时推断的深度学习框架 |
| 统计分析软件 | IBM公司 | IBM SPSS 统计 v29.0 | 用于混合效应建模、独立样本t检验和重复测量方差分析,涵盖所有主要和次要结局分析 |
| 数据可视化与绘图软件 | GraphPad 软件 | GraphPad 棱镜 v10.0 | 用于生成所有手稿数据,包括误差条(标准差和95%置信区间)、保留曲线和分组条形图 |
| 视频录制系统 | 斯特赖克公司 | 1688 AIM 4K 平台 | 用于盲法术后专家评估(OSATS评分)的术中及模拟会话视频录制 |
| 结构化评估工具(OSATS) | 无,且无大碍;已验证的已发表仪器 | Martin 等,1997年(外科杂志) | 技术技能的客观结构化评估;七项全球评级量表(1&NDASH;每件5个)用于盲法专家评估缝合和组织处理 |
| 随机化与数据管理软件 | 开源 | REDCap v13.7.2 | 用于参与者分配的电子数据采集(基于群体的部门)、人口统计数据收集及纵向随访评分跟踪 |
| 音频反馈模块 | 定制/内部开发 | 无 | 软件模块提供实时纠正听觉提示(音调编码警报),集成于多模态反馈系统中 |
| 机构问卷(学习者满意度调查) | 定制/内部开发 | 无 | 18项李克特量表(1–5)评估培训效果、系统可用性和学习者信心的问卷;培训后及24周随访时进行 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission