研究文章

基于人工智能辅助三维建模的健康应用中工程技能视觉评估研究

228 次观看

DOI:

10.3791/69747

2026年2月13日

本文内容

摘要

本研究提出了一种多模态、由人工智能驱动的方法,用于客观评估医学三维建模中的工程技能,该方法融合了几何、行为和认知指标。通过结合实时可视化分析的贝叶斯融合技术,可实现对技能水平的精确评分,且该评分方法已在多种任务和不同技能水平的参与者中得到验证。

摘要

人工智能(AI)辅助的三维建模已成为现代医疗保健的核心技术,但目前该领域仍缺乏一种可重复且可扩展的方法,用于评估临床应用数字模型的工程能力。现有的质量检查通常仅关注最终的网格输出结果,而未考虑建模工作流程、操作者行为以及与AI辅助的交互过程。这一空白限制了研究的可重复性、有效培训的开展以及监管合规性。本研究提出首个端到端的可视化分析框架,旨在量化并传达以健康为核心的三维建模任务中的工程技能。该框架定义了一种领域特定的技能构念,涵盖从几何精度到操作熟练度及认知适应能力等多个维度,并通过一组可解释的行为、几何和生理指标对这些维度进行量化。该框架采用四层架构,集成了多模态数据采集、基于轻量级深度学习模型的实时特征提取、基于贝叶斯证据融合的连续能力评估,以及直观的可视化反馈模块。系统通过在线主动学习机制,能够在引入新工具或建模场景时保持校准,同时最大限度减少专家标注的需求。该框架在60名参与者中进行了测试,任务包括骨科植入物设计和血管重建两类具有临床真实性的建模任务。结果表明,该框架与专家评估具有高度一致性,能够清晰区分不同技能水平,并有效预测未来的建模质量。相关性分析、回归分析、效度检验和可视化任务分别使用Python完成。可用性测试显示用户接受度较高,参与者普遍认为可视化反馈清晰明了,有助于自主改进。最终,该框架将三维建模评估从静态的结果审查转变为基于多模态证据的动态、以过程为中心的评估。该成果为关乎健康的三维建模工作流程提供了实用、可解释且可扩展的培训、认证与监管监督解决方案,并为未来医学设计中人机协作与能力分析奠定了基础。

引言

人工智能驱动的3D建模在医疗领域的快速市场应用正在改变植入物、导板和解剖结构重建的创建方式,但目前该领域仍缺乏可靠的评估方法来衡量这些模型背后的工程技能。当前主流做法严重依赖对最终产品的检查,这种方法虽然有助于发现几何误差,却无法反映建模工作流程、用户与AI的交互过程以及建模过程中每一时刻的决策行为。因此,临床团队往往难以判断一个模型是通过具备专业能力且可重复的流程生成的,还是仅仅依靠侥幸的试错法完成的1。这一缺陷正变得日益重要。医院、监管机构和3D打印项目现在要求提供整个工作流程质量一致性的证据,而不仅仅是一个正确的最终网格模型,因为建模错误可能影响手术安全、器械适配性以及制造过程的可追溯性。目前尚无一种方法能够以集成化、系统化且可扩展的方式捕捉(或计算)包含建模技能中的行为、认知和操作层面的综合指标。这正是本文的核心动机2,但针对以解剖结构为中心、由AI增强的建模任务,尚未提出关于"工作流程胜任力"的操作性定义3。监管期望与日常实践之间的这一差距,是本研究的首要动因。第二个动因来自教学需求。医疗科技初创企业和大学医院通常通过将新人与资深建模人员配对,进行为期6至18个月的培训。这种方法虽然有效,但难以规模化:2020年至2024年间,支持AI的医学CAD软件安装量增长了340%,而合格导师的数量却基本保持不变4。一个能够实时观察、诊断并提供指导的可视化分析系统,将使培训效率不再受限于导师资源的可用性,并缩短放射技师或护士等非传统背景人员在前端分割任务中的学习曲线。

第三,存在认知科学层面的论据。医学建模是一种高风险的视觉问题解决形式,融合了空间推理、解剖学知识和软件操作能力。要理解这些资源如何被协调运作、在何时发生故障以及何时被外包给人工智能,需要对眼动、手部动作和生理信号进行逐秒级的实时捕捉。同一数据流不仅可用于阐明人类专家能力,也可用于评估该能力,从而在研究与应用之间形成良性循环。尽管已有大量文献探讨了(i)外科手术中的操作技能评估,以及(ii)CAD网格的几何质量度量标准5,但二者交叉领域——即以健康为核心、在人工智能辅助下的三维建模中对工程技能进行视觉评估——仍缺乏深入探索。具体而言,现有评估量规缺乏针对特定领域的技能构念,因此将血管分叉角度等依赖解剖结构的关键特征,与螺栓孔等通用机械特征同等对待。评分函数中未包含基于解剖学信息的约束条件,例如骨小梁填充孔隙率或截骨曲率限制。在传感碎片化方面,CAD、手术模拟或虚拟现实游戏中的过程捕捉研究很少在亚秒级分辨率下同步运动学、注视、生理和语音数据6。因此,跨模态验证无法实现,各信号通道的增量价值仍不明确7。关于静态评分问题,当前工具通常仅在操作结束后生成一个二元的通过/失败标签,缺乏一种系统化的方法来表达不确定性,或随着新证据的出现动态更新对学习者能力的判断——而这正是贝叶斯认证协议的关键要求8。最后,在反馈不连续性方面,即使收集了丰富的数据,这些数据通常也仅用于事后回顾,或以原始曲线形式展示。目前尚不存在一种与理论一致、面向特定角色的可视化图层,能够将低层次信号实时转化为可操作的建议910。这四项不足已转化为实际痛点:30%的3D打印解剖导板仍需人工返工,美国食品药品监督管理局(FDA)每季度召回2至3批患者特异性植入物,原因在于原始设计工程师误解了公差标注11。因此,亟需一种端到端的框架,实现从多模态感知到可解释反馈的闭环。

医学三维建模在三个方面不同于工业CAD,这些差异直接影响技能评估:解剖几何结构具有非参数化特征,误差容限接近于零,且必须满足监管可追溯性要求12目前主流的评估范式仍是专家对最终的多边形网格或STL文件进行总结性评审。常见的评分标准包括与金标准模板的几何偏差、拓扑流形性以及医生指定解剖标志的存在情况。由于评估依赖人工检查,评估者间的一致性(Cohen's κ)通常难以超过0.65。13商业平台(如 Mimics Innovation Suite 和 3D Slicer)可为网格质量提供通过/失败标记,但这些标记基于确定性标准(如三角形纵横比、面相交),而忽略了实际的建模过程14人工智能驱动的三维可视化可增强解剖学理解,但其有效应用在很大程度上依赖于操作者的建模技能。尽管虚拟诊断成像系统(VDR)能够提供精确的容积图像,目前尚无系统化方法用于评估用户如何解读、优化或操作这些模型。本研究通过评估人工智能辅助三维建模能力,填补了这一空白。15作者以30 Hz的频率记录滚动和工具调用事件以及三维光标坐标。他们使用长短期记忆(LSTM)自编码器进行检测 "低效的刀具路径" 在机械CAD中,相对于人工标注实现了0.81的F1分数。将分析扩展至视觉注意力,TAP-3D数据集16 包含120名工程师执行Solid Works练习时的眼动数据。注视—扫视序列被编码为128维的word2vec向量;聚类分析揭示出五种不同的视觉策略,且这些策略与建模时间存在显著相关性r = 0.73)。除了用户交互指标外,Mandal, A. 和 Ghosh, A. R.17 利用基于CAD模型生成的三维数字形貌训练的三维卷积神经网络(3D CNNs)估算复杂组织工程支架的力学特性17该方法能准确预测支架行为,并为多孔结构和超材料结构提供更快速的AI辅助设计途径。然而,该预测的可重复性程度受数据集多样性的影响,尤其是在几何形状高度不规则或存在制造缺陷的情况下。

Schönfeldt, N.、Hancock, P. 和 Birt, J. 的近期研究18 已将数据采集扩展至包括语音和出声思考报告,具体方法是将口头评论转录为200维的BERT嵌入,以将其与软件任务中的调试成功率进行关联分析18尽管医学建模人员的言语比程序员少,但我们实验室的试录结果显示,诸如 "这个脊状结构看起来有噪声" 与随后40%的撤销操作事件相吻合,表明其具有预测价值。这些研究表明,操作过程数据可以无干扰地被采集,并且机器学习模型能够将这些数据映射到绩效评估结构中。然而,这些研究均未针对医疗领域的特定三维建模,而在该领域中,解剖结构的变异性以及人工智能辅助带来了额外的复杂性。视觉分析已广泛应用于外科模拟和机器人培训中的形成性反馈。MiEye系统19 在录制的腹腔镜视频上叠加彩色编码的误差热图;与仅提供二元反馈相比,受训者的学习效率提高26%。针对计算机辅助教学(CAD)教育,Chou, Y. H. 等人。20 提出一种雷达图,用于对比学生指标(特征数量、重建时间、重建错误)与班级百分位;使用该图表的学生,其测试后成绩提升了0.35个标准差。实时可视化在教学中仍属研究不足的领域。Kim, I.-J. 和 Quteineh, H. H.21 将实时运动学数据以半透明丝带形式在虚拟现实中呈现,但其度量标准仅限于位置误差,未涉及认知负荷。据我们所知,目前尚无现有框架能够将几何、行为与生理信号流整合为一个可解释的、实时的可视化反馈层,专门用于人工智能辅助的医学三维建模。综述揭示了本研究拟解决的四个具体不足:缺乏面向医疗的技能构念:现有评分标准将医学建模视为通用计算机辅助设计(CAD),忽视了解剖学相关的约束条件,如多孔骨结构的填充方式或血管分叉角度。感知数据碎片化:研究通常仅利用单一模态(运动学、眼动或生理信号),极少尝试实现亚秒级的多模态同步,且缺乏跨模态验证。贝叶斯更新或在线置信度追踪尚未应用于建模技能评估,因此评估者无法表达不确定性,也无法在任务进行过程中动态纳入新证据。反馈不连续:即使采集了丰富的数据,这些数据也往往仅用于事后回顾或以原始曲线形式展示,缺乏一种系统性的可视化层级,将低层次信号实时映射为具有可操作性且与理论一致的反馈。这些缺陷为开发端到端框架提供了依据:(i)建立基于医疗应用需求的多维技能构念;(ii)通过校准的贝叶斯推断融合异构的操作数据;(iii)渲染不断演化的信念状态 通过 交互式、角色特定的可视化。从实践角度来看,所提出的框架为医院提供了一种用于建模质量的实时监测工具,减少了对冗长专家评审周期的依赖,并促进了患者特异性器械在临床中的安全应用。培训中心可利用该框架提供结构化、数据驱动的反馈,以促进学习者能力发展,并支持在不同学员群体中建立标准化的能力基准。对于监管机构而言,该框架提供了一种可审计且透明的机制,用于记录工作流程中的能力表现,符合医学3D打印流程持续验证的新兴要求。基于上述动机,本研究设计并验证了一种可视化分析框架,用于量化人工智能辅助、以健康为中心的3D建模中的工程技能。具体而言,该框架旨在:基于多孔骨结构填充、血管角度及其他解剖相关公差,定义一个多维度的技能构念;以亚秒级分辨率同步眼动、手部运动、生理信号及与AI交互的数据;通过贝叶斯更新融合这些异构数据流,生成具有明确置信度的动态能力评估;通过实时雷达图、热图和3D标注呈现该评估结果,用于即时指导或认证;并保持至少90%的评估准确率 通过 无需完全重新训练即可适应新打印机、AI 模型或临床规则的主动学习校准。

本研究探讨两个核心问题:多模态数据融合是否能够提高技能评估的准确性,相较于专家评估;以及贝叶斯更新是否能够在无需完全重新训练模型的情况下,维持评估的准确性。

访问受限。请登录或开始试用以查看此内容。

方案

本研究涉及人类参与者,并经上海外国语大学贤达经济人文学院人类研究保护伦理委员会审查和批准(批准号:2025XD1221)。所有参与者均签署了知情同意书,并完成了30分钟的实验前培训:实验组(EG)参与者学习解读框架提供的视觉反馈(雷达图、热图),而对照组(CG)参与者仅接受平台操作培训。为确保数据采集的准确性,实验前还包括5分钟的眼动仪和生理传感器校准。

研究目标与方案概述

本研究的目的是构建一个闭环、端到端的系统,该系统整合多模态数据采集、特征提取、贝叶斯融合和视觉反馈,以可解释的方式评估工程技能。图1展示了基于人工智能辅助3D建模的健康应用中工程技能评估的协议流程图。

框架概述与层次化逻辑

本研究提出的用于人工智能辅助三维建模健康应用中工程技能的视觉评估框架,基于“数据驱动—特征提取—证据融合—视觉反馈”的闭环逻辑构建,其核心目标是实现从多模态原始数据到可解释技能评估结果的端到端转换22。为确保工程技能评估中多模态特征的可靠提取,该框架以毫秒级时间同步同时采集交互、生理、眼动、手势及语音信号。该框架采用分层架构设计,包含四个核心层:多模态数据采集层(L1)、人工智能特征提取层(L2)、证据融合与评分引擎(L3)以及视觉反馈层(L4)。各层通过标准化数据接口实现双向交互,同时引入框架校准模块(L5),以确保评估结果的动态有效性。图2展示了端到端的流程,从通过人工智能进行特征提取的多模态数据(眼动、运动学、生理、语音)采集开始,经贝叶斯评分,最终实现实时视觉与视听反馈。各层之间相互交互,其中第五层提供持续校准。该架构支持参与者在执行实时三维建模任务时,进行协调处理与经验证的技能估计。

公式 (1) 贝叶斯置信度更新公式:

贝叶斯定理公式,统计概率,方程分析,P(θ|D)=P(D|θ)P(θ)/P(D)。

其中:P(θ) 表示技能水平 θ 的先验概率(基于历史评估数据);P(D∥θ) 表示在技能水平 θ 下观测到多模态特征数据 D 的似然概率;P(D) 为边缘概率;P(D∥θ) 为融合数据 D 后技能水平 θ 的后验概率,即最终的置信度评分。该框架采用结构化德尔菲法和层次分析法(AHP)23 对指标进行加权。由十位领域专家(骨科外科医生、生物医学工程师和经验丰富的医学 CAD 建模人员)组成专家组,通过三轮德尔菲法,使用 9 点李克特量表对各指标的重要性进行评分,直至专家评分趋于稳定(变异系数 <0.15)24。随后,基于专家达成一致或分布的评分结果构建两两比较矩阵,并采用 AHP 一致性检验标准进行验证,要求一致性比率(CR)< 0.1。若 CR 超过 0.1,则对矩阵进行重新调整。各两两比较矩阵的 AHP 一致性比率介于 0.03 至 0.08 之间,表明在整个多层次层次结构方法中具有良好的内部逻辑一致性。该框架中每一层的设计均遵循“模块化—可扩展性”原则。例如,L1 层可通过增加生物传感器扩展生理数据采集维度;L2 层可通过更换预训练模型以适应不同医疗应用场景下的技能评估需求;L4 层可根据用户角色支持自定义的可视化维度。这为后续在医学三维建模教育及专业技能认证场景中的应用提供了灵活性。

多模态数据采集层

三维相互作用事件流

该模块从人工智能辅助的3D建模平台采集工程师的操作数据 通过 软件插件(16)涵盖离散操作事件和连续参数数据。离散事件包括模型选择、顶点调整和人工智能工具调用,而连续参数涉及建模速度、撤销/重做次数以及人工智能建议接受率。每个事件均记录有13位时间戳及相应的三维模型坐标系值(x, y, z)。例如,在调整骨科植入物模型的曲率时,插件会记录操作的开始和结束时间、调整后的顶点坐标以及曲率变化,从而形成结构化的事件日志(见 表1表格 3 个数据字段)。这些数据随后通过定制算法进行处理,以计算特定领域的几何、效率和认知指标,从而实现对健康相关应用中建模行为的细粒度表征。

眼动与手势信号

使用桌面式眼动仪采集眼动数据,重点关注三维建模界面中的注视点和扫视参数,这些参数反映了工程师的认知注意力分布。

通过深度相机捕捉手势信号,提取22个上肢关键关节坐标以识别典型建模手势25。该相机将3D手势坐标数据转换为归一化向量序列,以减少个体体型差异的影响。

该模块的数据同步依赖于框架的统一硬件触发信号(来自3D建模软件的10 Hz时间戳),同步误差控制在±50 ms以内(计算得出) 通过 公式 3-2)以确保眼动/手势行为与建模操作之间的时间相关性 26公式(2)展示了数据同步误差的计算方法:

算法性能评估的误差计算公式 Et=||t_device−t_software||   (2)

其中:Et = 设备采集时间(tdevice)与软件时间戳(tsoftware)之间的同步误差;tdevice = 眼动仪/深度相机的实际采集时间;tsoftware = 3D建模软件的触发时间戳。

生理与声音数据

生理数据被采集 通过 可穿戴传感器:肌电图(EMG)传感器(采样频率 1000 Hz) 27固定在工程师前臂上,用于记录精细操作过程中的肌肉张力,以反映操作稳定性。心电图(ECG)传感器(采样频率 250 Hz)28佩戴于胸部以采集表征认知负荷的心率变异性(HRV)指标,语音数据则通过指向性麦克风(采样频率 44.1 kHz)进行采集。29,记录建模过程中录音工程师的口头评论,以补充认知状态分析。所有生理信号和语音数据在存入带时间戳的多模态数据库之前均需经过预处理。 图3 展示了物理实验硬件的配置。来自肌电/心电可穿戴设备、麦克风、眼动仪和深度相机的传感器数据均连接至一台三维建模工作站。在时间序列数据存入多模态数据库之前,同步模块会对所有数据流进行校准(误差范围在±50 ms以内)。该材料规范确保了特征提取与评分流程能够获得可靠且时间对齐的输入数据。

AI 特征提取层

几何质量指标

该模块从三维交互事件流和最终模型输出中提取反映三维模型准确性和合理性的定量特征,作为评估工程师“建模精度”技能的核心依据。为评估结构准确性、解剖一致性以及三维模型的完整性,采用基于偏差、拓扑和模板的特征指标,设计了三个关键指标,其计算方法和物理意义如下所述:

模型偏差率(MDR)

该指标用于测量工程师建模结果与标准模板之间的几何偏差。偏差通过比较两个模型之间关键特征点的欧几里得距离来计算。公式如公式(3)所示:

“统计分析中使用的平均偏差比公式(MDR),以数学方程形式表示。”   (3)

其中:n = 预定义的关键特征点数量(根据模型复杂度设定为 50–100);Pi,engineer = 工程师模型中第 i 个特征点的三维坐标;Pi,standard = 标准模板中第 i 个特征点的三维坐标;|⋅| = 欧几里得距离算子。

较低的MDR值表示与标准模型的一致性更高,合格的健康应用模型阈值为≤ 5%。建模能力的评估基于在实时三维操作场景中,所提出的人工智能工具在时间效率、冗余动作、手势稳定性以及使用模式方面的表现。

拓扑一致性(TC)

这用于评估三维模型的拓扑结构是否满足医学应用要求。该指标通过统计模型中拓扑缺陷的数量(D)以及拓扑元素的总数(T,即顶点、边和面的总和)来计算,如公式(4)所示:

透射系数公式,TC=(1-D/T)×100%,用于光学分析计算。   (4)

例如,如果一个膝关节模型包含 2 条非流形边(D = 2)和总共 1200 个拓扑元素(T = 1200),则其完整性为 99.83%。为避免制造风险,医学模型要求完整性不低于 98%。

特征完整性(FC)

该指标用于评估工程师是否已完全实现健康应用程序模型中的所有必需功能。通过将已完成的必需功能数量(Fcompleted)与任务要求中定义的必需功能总数(Ftotal)进行比较,来确定该指标:

计算完成百分比的公式;方程、数学分析、效率比率。   (5)

行为效率指标

该模块处理三维交互事件流和手势信号,以提取反映工程师建模操作效率的特征,评估其“操作熟练度”技能。建模过程中的认知负荷通过同步采集的生理信号、眼动信号和肌电图(EMG)信号进行测量。这些指标用于追踪建模过程中注意力随时间的分布情况以及工作负荷的波动情况。

建模时间效率(MTE)

该指标将工程师实际建模时间(Tactual)与高级专家完成相同任务的平均时间(Texpert)进行比较,并归一化为0-100分制:

MTE 公式,用于性能评估的最大函数;数学方程,用于教学。   (6)

例如,如果一名工程师完成一项任务需要45分钟,而专家平均只需30分钟,则效率得分为100 - (45 - 30) × 50 = 75,表明效率中等。

重复手术率(ROR)

该指标用于计算建模过程中不必要的操作所占的比例。其计算方法为冗余操作次数(Oredundant)与总操作次数(Ototal)的比值:

ROR 公式,ROR=(O_redundant/O_total)×100%,用于数据冗余分析的方程。   (7)

人工智能算法通过规则匹配和手势一致性分析来识别冗余操作。

人工智能工具使用率(ATUR)

该指标用于衡量工程师利用人工智能辅助功能提升效率的能力,定义为人工智能工具调用次数(IAI)与总工具调用次数(Itotal)的比值:

使用IAI和Itotal计算ATUR百分比的公式。   (8)

较高的 ATUR 表明人工智能工具更好地融入了建模过程,这是现代医学 3D 建模中的一项关键技能。

手势平滑度(GS)

这用于评估工程师在建模过程中上肢运动的稳定性。该指标通过22个上肢关键关节速度(vj)随时间变化的标准差来计算:

吉尼-辛普森指数计算的统计公式,显示标准差和最大值。   (9)

较低的标准差(即更高的GS值)表明操作动作更平滑,反映出更高的操作熟练度。这些指标在建模过程中实时提取,人工智能算法每5分钟更新一次指标数值,并将其存储至特征数据库中,用于后续的融合分析。

认知负荷指标

本模块通过分析建模过程中工程师的眼动信号和生理数据,量化其认知负荷,评估其“认知适应性”技能。采用德尔菲-层次分析法(Delphi-AHP)和贝叶斯证据更新对多模态指标进行加权,输出实时、概率性的工程技能评分。本研究构建了三个关键指标:

注视分散(FD)

这反映了工程师视觉注意力的分布范围。该值通过计算在2分钟时间窗口内,三维建模界面中最大与最小注视点坐标((xmax,ymax) 和 (xmin,ymin))之间的欧几里得距离得到:

分形维度公式示意图,用于几何或数据分析研究的 FD 方程。   (10)

较大的 FD 表示注意力分散,通常与高认知负荷相关。

心率变异性(HRV)- SDNN

SDNN(正常心动间期标准差)从心电图(ECG)数据中提取,用于测量工程师心率的波动。较低的SDNN表明交感神经活动增强,反映认知负荷增加。人工智能算法首先滤除心电图噪声(通过 小波变换),然后使用公式(11)计算 SDNN:

心率变异性分析中的SDNN方程;显示NN间期标准差的公式。   (11)

其中:N = 5 分钟时间窗内的正常心跳次数;RRk = 第 k 次与第 (k + 1) 次正常心跳之间的时间间隔;动态平衡;化学图示,可逆反应符号 \( \overline{\text{RR}} \)。 = 该时间窗内的平均 RR 间期。

肌电图(EMG)- 均方根(RMS)

前臂肌电(EMG)信号的均方根(RMS)反映肌肉张力:RMS值越高,表明由于认知压力导致肌肉僵硬度增加。计算公式为:

肌电图(EMG)信号分析的均方根(RMS)公式。   (12)

其中:m 表示 1 分钟时间窗内的 EMG 信号采样点数量,EMG(t) 表示在时间 t 的 EMG 信号幅值。为帮助理解概念并促进本研究的可重复性,已绘制一张概要示意图。该图展示了十个评估指标之间的层次关系,以及所提出框架背后的三个主要构念:几何质量、操作效率和认知适应性。此示意图描述了多模态输入信号如何被转化为可测量的指标,并通过贝叶斯方法进行融合,从而生成综合工程技能评分。该概览以简洁形式呈现了评估逻辑,提升了本研究在形成性评价以及未来教育和监管方向上的方法透明度。图 4 展示了所建议的工程技能评估框架的层次结构,将十个多模态指标归入三个基本构念:几何质量、操作效率和认知灵活性。这些因素共同构成了用于评估人工智能辅助三维建模表现的总体技能结果。

证据融合与评分引擎

指标权重分配(德尔菲法 + 层次分析法)

本模块通过结合德尔菲法(专家共识)与层次分析法(AHP),针对多维特征间重要性差异的问题,为提取出的十个指标(三个几何质量指标、四个行为效率指标和三个认知负荷指标)分配权重,并以可视化且可解释的形式呈现这些复杂的多模态指标,例如雷达图、热图以及带注释的回放,用于与生物医学相关的诊断推断。

德尔菲共识阶段

由十位专家组成的专家组通过三轮匿名问卷调查,使用9分制量表(1分表示“最不重要”,9分表示“最重要”)对每个指标的重要性进行评估。每轮调查后,向专家组提供统计反馈,包括平均得分和变异系数(CV),以协助调整评分。收敛性定义为每个指标的CV ≤ 0.15。值得注意的是,诸如模型偏差率(MDR)和人工智能工具使用率(ATUR)等指标通常在第二轮即达成共识,这归因于其直接的临床相关性。

为确保技术的稳健性,本方案对多模态数据对齐(同步容差 ≤ 50 ms;统一触发时钟为 30 Hz)和指标计算方法进行了标准化。例如,MDR 由 50–100 个解剖关键点推导得出,而拓扑一致性(TC)阈值则设定为 >98%,适用于无缺陷元件。这些阈值均依据临床容许标准进行论证,例如多孔骨结构的偏差 < 5%,血管分叉角度误差 < 3°。此外,该方法采用基于高斯似然建模的贝叶斯评分(针对不同技能等级使用校准后的 σ 范围),并利用批大小为 32、学习率为 1 × 10-4、训练 120 个周期的 CNN-LSTM 特征提取器。

AHP 层次结构建立

构建了一个三级层次结构:目标层(A):工程技能综合评估;准则层(B):3个一级指标(B1:几何质量,B2:行为效率,B3:认知负荷);指标层(C):10个二级指标(C1:MDR,C2:TC,…,C10:EMG RMS)。

成对比较与一致性检验

根据德尔菲共识结果,为准则层和指标层构建两两比较矩阵。以准则层为例,该矩阵定义如下:

MB 的矩阵方程,符号,矩阵的数学表示,线性代数概念。   (13)

其中:aij 表示 Bj 相对于 Bj 的重要性比值。准则层的权重向量(WB = [wB1, wB2, wB3])通过特征向量法计算得出。为避免逻辑矛盾,使用公式(14)检验一致性比率(CR):

静态平衡概念,公式 CR=CI/RI,方程,教育用途,物理原理   (14)

其中:(λmax = 矩阵的最大特征值,= 指标数量),为随机一致性指标(当 n = 3 时,RI = 0.58)。若 CR < 0.1,则结果可接受。

通过该过程可获得典型权重:(几何质量)、(行为效率)、(认知负荷);在指标层中,MDR(C1)的权重通常最高(约0.25),而EMG RMS(C10)的权重最低(约0.05)。

贝叶斯置信度更新

该模块通过加权指标融合生成最终的技能置信度评分,利用实时多模态数据更新先验概率,以解决“单特征评估的不确定性”问题。该过程基于公式(1)(贝叶斯公式),并分为两个步骤实现:

步骤 1:先验概率初始化(P(θ))

技能水平分为5个等级:(新手)、(初级)、(中级)、(高级)、(专家)。先验概率通过历史数据初始化:如果系统已评估了500名工程师,其中100人被归类为θ3,则P(θ3) = 100/500 = 0.2。对于没有历史数据的新用户,采用均匀先验分布(即对所有i,P(θi) = 0.2)。

步骤 2:后验概率计算(P(θ∥D))

多模态特征数据是10个归一化指标的加权和:

加权和计算公式,Σk=1^10 Wck*Cknorm,用于数据分析方法。   (15)

其中:wCk  表示第 k 个指标的权重(来自第 3.4.1 节),Cknorm 表示第 k 个指标的归一化值(范围为 [0,1])。

似然概率使用高斯分布建模,假设技能水平为的工程师的特征数据服从(均值 μi,方差 统计学中的方差公式,σ²ᵢ,数学符号。)。这些参数通过200个带标签的样本进行校准。

最后,计算后验概率 通过 公式(3-1),对应最大值的技能等级即为实时评估结果。例如,若某工程师的 D = 0.72,且该值高于其他等级的值,则其被划分为“高级”。

为了可视化置信度更新过程,图5展示了如何利用贝叶斯推断和实时信号作为证据,将已知的相等技能概率更新为后验分布。在观察任务之后,模型会更新以增强支持后验概率最大的技能等级的证据。验证测试表明专家技能等级具有较强的收敛稳定性,且贝叶斯评分与专家评分高度相关,支持在工作流程中可信地使用贝叶斯更新。

该层的输出为综合技能评分(0-100,由最大后验概率映射而来)和置信区间,随后传输至视觉反馈层进行直观展示。

视觉反馈层

实时雷达图

该模块将10个归一化指标和3个三级准则得分转换为雷达图,便于直观比较工程师技能的优势与不足。雷达图设计为7个轴(3个一级准则轴:B1–B3;4个核心二级指标轴:C1=MDR、C4=ATUR、C7=FD、C9=SDNN,因其权重较高且可解释性强而被选中),每个轴的取值范围均归一化至[0,100](由[0,1]的归一化值映射而来)。 通过 公式3-7)。为了在框架构建初期通过专家标注和主动学习更新持续提高测量准确性,引入了健康建模背景及不断深化的理解。

公式 (16) 雷达图的指标值映射:

V 雷达方程:V_radar = Ck_norm × 100,雷达速度分析的数学公式。   (16)

其中:Vradar = 雷达图轴上显示的值;Cknorm = 第 k 个指标的归一化值([0,1] 范围)。

雷达图实时更新(每5分钟一次),并包含两个参考基准:标准基准线(虚线,Vradar = 80,代表“高级”技能水平阈值)和专家平均线(点线,基于50名资深工程师的历史数据计算得出)。图6展示了工程师在多个关键指标综合表现上的行为特征:几何质量、认知负荷、工具使用效率和注视点分散度,并与相应的专家基准进行了比较。作为反馈层的一部分,利用融合指标生成的真实得分被转化为可解读的能力画像。用户研究表明,该方法能有效快速识别能力差距,同时在建模任务中促进基于数据的结构化改进计算。

时间热图

该模块可视化了技能指标在整个建模过程中的动态变化趋势,有助于识别工程师遇到困难的时间段。热图采用二维网格形式:横轴表示时间间隔(每10分钟为一个时间段,共2小时,总计12个时间段),纵轴表示5项关键指标(C1=MDR,C4=ATUR,C6=GS,C7=FD,C9=SDNN)。每个网格单元的颜色强度对应指标的归一化值,颜色标尺从蓝色(低值,表现较差:Cknorm < 0.5)到红色(高值,表现良好:Cknorm < 0.8),如公式(17)所定义:

公式(3-8)给出了热图的颜色强度计算方法:

图像处理中的颜色归一化公式,展示强度缩放的计算公式。   (17)

其中:Icolor = RGB 颜色强度值(0-255,0 表示蓝色,255 表示红色);min(Cknorm) 和 max(Cknorm) = 指标在所有时间区间内的归一化最小值和最大值。

图7展示了以10分钟为分段的认知负荷、注视分散度、注视稳定性以及决策延迟指标随时间变化的动态情况。请注意,高亮区域表示高认知需求或工作流程中断。该时间视图直接由融合的多模态数据流生成,并结合专家标注,凸显了其在分析疲劳建模、注意力转移及任务特异性困难中的关键作用。

D回放注释

该模块将技能评估标注叠加在三维模型的操作回放上,实现对工程师建模行为的逐步分析。回放速度可调(0.5倍至2倍实时速度),并与多模态数据的时间戳同步。嵌入了三类标注:几何误差标注:当模型区域的MDR(C1)超过5%(合格阈值)时,以红色线框高亮显示,并通过文本标签标出偏差值。效率警告标注:在冗余操作发生的位置出现黄色感叹号,并通过弹窗显示操作类型。认知负荷标注:角落处的绿色/红色状态条表示实时认知负荷(基于C9:SDNN和C10:EMG RMS),其中红色表示“高负荷”(SDNN < 50 ms),绿色表示“正常负荷”(SDNN > 100 ms)。

框架校准与迭代

专家注释界面

该模块提供了一种人机协同的界面,供资深专家校正并标注框架的评估结果,以应对因健康应用场景变化所导致的“评估准确性漂移”问题。该界面设计包含三个核心功能:结果校正、指标重加权和标注存储。

结果校正函数

专家首先审查视觉反馈结果和框架的综合技能评分(0-100)。如果评分与专家判断存在偏差,专家可手动调整评分并记录调整原因。校正幅度将被量化 通过 公式 (18):

数据分析中的偏差校正公式,变量为 S_corrected、S_framework、α、S_expert。   (18)

其中:Scorrected = 最终校正得分;Sframework = 框架输出的初始得分;Sexpert = 专家人工评分;α = 校正权重(默认设置为 0.8,确保专家判断占主导地位,同时保留框架的合理性)。

指示剂重加权函数

针对特定场景的校准,专家可通过滑动条(0-0.5 范围)调整各个指标的权重。调整后,界面将自动重新计算一致性比率(CR)(使用公式 3-6),并在出现(不合理权重分布)时向专家发出警告,确保调整后的权重在数学上有效。

注释存储功能

所有校正后的分数、调整后的权重以及专家评论均存储在一个带有时间戳和情景标签的注释数据库中。该数据库作为后续在线主动学习模块的训练数据,典型的数据模式如表2所示。

在线主动学习更新

该模块利用标注数据迭代优化框架的核心算法(L2 层的 AI 特征提取模型和 L3 层的贝叶斯评分引擎),使框架能够在无需完全重新训练的情况下适应新的健康应用场景。更新过程遵循基于委员会查询(query-by-committee, QBC)的策略,分为三个阶段:

第一阶段:不确定性计算

部署了三个并行的“委员会模型”(均基于与 L2 特征提取模型相同的架构,但在不同的历史数据集上进行训练):

模型 A:在骨科植入物建模数据上进行训练;

模型B:基于器官重建数据进行训练;

模型C:基于牙科种植体建模数据训练。

对于每个未标记的样本(工程师的建模数据),委员会模型会输出三个预测技能分数。该样本的不确定性通过这三个分数的变异系数(CV)来计算:

变异系数公式,CV=std(SA,SB,SC)/S,统计分析方程。   (19)

其中:SA,SB,SC = 三个委员会模型预测的分数;std (⋅) = 标准差;静力平衡 ΣFx=0 示意图;杠杆系统展示力矩平衡原理。 = 三个分数的平均值。

较高的变异系数(CV)表明委员会模型之间存在更大的分歧(即不确定性更高),意味着该样本在标注过程中具有更高的价值。

第二阶段:样本选择

该框架选取变异系数(CV)最高的前10%样本,并将其发送至专家标注界面进行标注。这种主动选择策略与随机选择相比,可将需要专家标注的样本数量减少40%–60%,从而提高校准效率。

阶段3:模型重新训练与更新

新标注的样本用于微调框架的算法:

对于L2特征提取模型:使用标注的几何误差数据,以1e-5的学习率(初始训练学习率的10%)重新训练模型,仅更新最后两层以避免过拟合。

对于 L3 贝叶斯评分引擎:每个技能水平的高斯分布参数(统计符号 μᵢ, σᵢ²;均值与方差;数据分析中的方程;简洁的图表说明。)使用标注的评分数据进行更新,更新公式如公式(20)所示:

在自适应过程中更新内部变量(μᵢ)的公式;迭代计算公式。   (20)

其中:带下标 i 和上标 new 的 mu 符号 = 技能水平 θi 的更新后均值;数学符号:带下标 i 的旧 mu,表示过程中化学势的变化 = 更新前的原始均值;S-θi = 标注为 θi 的样本的平均校正得分;β = 遗忘因子(设为 0.7,用于平衡历史数据与新标注)。

更新后的框架在重新训练后立即在线部署,并在部署前进行性能检查:如果该框架新输出结果与专家标注之间的平均绝对误差 ≤3(相较于前一版本降低 ≥20%),则确认更新;否则,将使用额外的标注样本重复重新训练过程。

这种迭代校准机制可确保该框架的评估准确率即使在医疗应用3D建模技术不断演进的情况下仍保持在90%以上,从而维持长期的适应性。

访问受限。请登录或开始试用以查看此内容。

结果

通过实验评估技能区分度、结构效度、预测效度以及实时反馈的有效性,结果验证了该框架的有效性、可靠性和可用性。

实验设计

实验在一台配备12核Intel处理器、32 GB内存和1 TB固态硬盘的计算机上的Python环境中进行。使用NumPy和Pandas进行数据同步。特征提取采用了OpenCV和SciPy库。CNN-LSTM模型通过PyTorch执行。贝叶斯更新使用PyMC实现,而Matplotlib和Plotly则用于实时可视化分析,以实现受控的多模态数据采集和模型执行条件,从而确保该框架的特征提取与评分组件可被重复验证。

参与者与分组

为验证该框架在评估不同熟练程度工程师方面的有效性,采用分层抽样策略招募了60名参与者,涵盖定义的五个技能等级(新手至专家)。采用此方法旨在确保所选队列能够代表不同专业水平,并通过分层抽样和受控的子组分配来评估框架的性...

访问受限。请登录或开始试用以查看此内容。

讨论

尽管现有的三维建模与交互框架数量有限,且在少数情况下可提供有用信息,但这些框架主要评估的是用户在三维建模任务中的工程能力。大多数先前的手势追踪与界面研究19侧重于评估交互行为,而非用户能力本身的评估。类似地,在基于虚拟现实/触觉的教育系统20中,学习者虽能更深入地理解解剖结构,却无法量化工作流程的准确性,也无法验证决策过程。对于人工智能支持的可视化工具21亦是如此。本文提出的框架利用注视固定模式、手部运动学、生理变化及语音标记,来评估建模过程中的完整行为特征。通过应用贝叶斯证据融合,该框架从多源数据流中生成可观测的技能评估结果。最后,借助角色感知的可视化分析技术,用户能够以可解释的方式获得关于其表现的反馈。本文所展示的策略直接为衡量用户在人工智能辅助、关乎健康的三维建模系统中的能力这一挑战,提供了新颖且有效的解决方案。

本文提出了首个端到端的可视化分析框架,用于客观评估人工智能辅助、以健康为中心的三维建模中的工程能力。该框架结合多模态感知、...

访问受限。请登录或开始试用以查看此内容。

披露

作者无任何利益冲突需要披露。

材料

本文使用的材料清单
姓名公司目录编号评论
人工智能辅助三维建模软件Materialise NV, BelgiumMimics AI v25.0用于股骨柄假体建模和肝脏血管重建任务,具备人工智能分割和缺陷检测功能。
眼动仪(台式)Tobii Pro FusionTPF-120以120 Hz频率采集注视点和扫视数据,用于量化建模过程中的视觉注意力。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章