方法文章

DeciViT-膝关节 2025:决策树与视觉变换器在膝关节骨关节炎分析中的精确模糊技术

323 次观看

DOI:

10.3791/69411

2026年1月13日

本文内容

摘要

DeciViT-F 是一种结合了模糊逻辑与贝叶斯决策的混合深度学习模型,被用于膝关节骨关节炎的检测评估。在所有测试的卷积神经网络模型(包括 ViT-B/16 模型)中,该模型取得了最高的准确率(≈88%)、宏平均 F1 分数(0.85)和 AUC 值(0.95),并通过自注意力机制增强了上下文表征能力,但表现出中等程度的校准漂移。

摘要

本文介绍了 DeciViT-Knee 2025 协议,这是一种混合深度学习工作流程,结合了视觉变换器(ViT-B/16)、贝叶斯决策树和第三层模糊推理系统,用于膝骨关节炎(KOA)的早期且可解释的检测。该流程首先在 PyTorch 2.x 和 Hugging Face Transformers 中配置支持 GPU 的运行环境。随后,从骨关节炎倡议项目(OAI)和多中心骨关节炎研究(MOST)获取放射影像和磁共振成像(MRI)数据集。在数据输入至经过微调的 ViT-B/16 模型以生成 768 维图像嵌入之前,需经过对比度增强、伪影去除和归一化处理。我们采用贝叶斯决策树分析这些嵌入向量,从而提供经过校准的概率分类结果。模糊推理层引入语言学推理,以“低风险”、“中风险”或“高风险”等术语表达诊断中的不确定性。该模型性能优于 CNN、ResNet-50 及仅使用 ViT 的基线模型,达到 92.4% 的准确率、0.964 的 AUC 值、0.891 的 F1 分数以及 0.088 的 Brier 分数。该协议展示了如何将基于变换器的全局特征提取、贝叶斯概率推理与模糊可解释性相结合,构建一个更清晰、可重复且便于临床医生使用的肌肉骨骼影像诊断框架。

引言

膝骨关节炎(KOA)是一种长期进展性的关节疾病,是全球老年人致残的主要原因之一1。早期发现细微的结构改变对于有效干预至关重要;然而,传统的诊断工具,如Kellgren-Lawrence(KL)分级系统以及WOMAC等临床指数,受限于主观性和观察者间的变异性1

随着OAI和MOST等大规模膝关节影像数据库的日益普及,用于客观评估膝骨关节炎(KOA)的计算方法已受到广泛关注2。早期基于手工设计特征描述符和统计分类的放射影像分析方法在处理高维影像数据时表现出有限的鲁棒性2。近年来,基于影像的建模框架在提高早期KOA检测敏感性方面有所改进,但在临床可解释性和决策透明度方面仍面临挑战。

由人工智能驱动的分析能够无创且早期地发现膝关节骨关节炎,从而减少重复X射线检查的需求,以及大规模影像学检查和纸质诊断所带来的环境影响3。迄今为止,机器学习模型(如决策树和随机森林)已能够预测WOMAC评分和KL分级的风险准确性(图1);然而,这些模型在处理高维成像数据时仍存在困难4。深度学习架构,尤其是卷积神经网络(CNNs)和ResNet网络,实现了自动特征提取并提高了准确性,但其模型可解释性较差。视觉Transformer(ViTs)则通过自注意力机制引入了全局上下文理解能力。

DeciViT-F 框架通过提供准确、可理解且经济实惠的医疗解决方案,支持可持续的临床实践。这有助于患有慢性残疾的人群,特别是老年人,改善其生活质量。其可解释的模糊贝叶斯逻辑促进了人工智能的伦理应用,确保临床决策中的信任性、包容性和透明性。最终,这一方法将为我们所有人带来更优质、更公平且更环保的未来。

DeciViT-Knee 2025 框架由此建立为一种混合型、可解释的流程,以解决上述问题。该框架采用 ViT-B/16 进行深度图像表征2,4,利用贝叶斯决策树实现清晰且具有概率性的分类,并通过模糊推理层5将不确定性转化为人们可理解的语言。这种三层融合机制提供了高诊断准确性、强校准性以及在临床医生层面可解释的结果。

文献综述
目前尚无研究将基于 ViT-B/16 的特征提取与贝叶斯决策树在多模态 KOA 数据上的概率推理完全结合。近期关于可解释性的研究表明,模糊逻辑有助于将精确数值与基于语言的推理相连接。模糊系统能够表示部分真值(例如轻度软骨损失或边缘性骨赘存在),这与放射学评估中常见的不确定性描述相一致。已有研究证明,将模糊推理层整合到深度网络中可降低观察者间的变异性,并提升临床可解释性5,6,7,8,9,10。在 ViT 嵌入之上添加模糊-贝叶斯层,可生成既具有概率性又具备语言意义的决策边界。这能将抽象的激活值转化为人类可理解的规则集,例如:若软骨变薄程度为中等且骨强度变异较高,则 KL 分级很可能 ≥ 2。

DeciViT-Knee 2025 旨在通过一种针对临床环境优化的 ViT-模糊-贝叶斯框架,实现膝骨关节炎(KOA)的早期、清晰且可重复的检测。这将有效弥合准确性、可解释性与语言透明度之间的差距。

以下方法从环境设置、数据集准备,到模型训练、测试和可视化,对每一步都提供了清晰且可重复的描述。这将有助于研究人员和临床医生重复并在此工作基础上进一步开展肌肉骨骼系统疾病的精确诊断研究

选择并设置模型
我们选择 Vision Transformer(ViT-B/16)作为主要的图像特征提取器,因为它能够利用多头自注意力机制对放射影像中的全局上下文关系进行建模2,4,11。ViT 结构能够同时分析细粒度的纹理变化和长距离的空间依赖关系,这对于区分 KL 分级 0–4 中细微的骨关节炎变化至关重要2,4,12。这与基于卷积神经网络(CNN)的架构不同,后者依赖于局部感受野11

在变压器嵌入输出与概率分类器之间添加了一个模糊推理层(FIL),以应对放射学分级中的不确定性,特别是针对临界状态和早期膝骨关节炎(KOA)的情况(图213,14。FIL将连续的嵌入激活值转换为具有语言意义的模糊集合(例如,轻度、中度或重度软骨损失),并生成表示诊断不确定程度的隶属度7,8。该设计通过将数值预测与放射科医生常用的定性推理模式相对应,提高了模型的可解释性15

采用贝叶斯决策树集成(BDTE)将模糊增强的特征嵌入转化为概率性分类结果,从而确保预测既准确又易于理解16,17,18,19。集成中的每棵决策树均可计算后验概率和置信区间,有助于建立校准良好的决策边界13。该方法结合了贝叶斯推断的统计准确性与基于规则的决策树的清晰性,使每个诊断输出既具有量化的确定性,又具备可解释的判断依据19

通过比较进行基准测试
我们采用相同的训练集和验证集划分,系统地将混合 ViT + FIL + BDTE 流程与 CNN 和 ResNet-50 基线模型进行比较。我们使用分类准确率、AUC、Brier 得分以及由临床医生在五分制量表上评定的可解释性作为比较指标。采用多个基线模型使得能够在不同架构之间公平地测试模型的泛化能力、校准一致性和可解释性。

访问受限。请登录或开始试用以查看此内容。

方案

本研究使用骨关节炎倡议(Osteoarthritis Initiative,OAI)和多中心骨关节炎研究(Multicenter Osteoarthritis Study,MOST)的数据进行训练和测试。验证则采用了来自印度印多尔国立阿育吠陀学院的500张X线片。已获得印度印多尔国立阿育吠陀学院伦理委员会的伦理批准。所使用的所有数据均已匿名化。

1. 模型结构

  1. 设置已在 ImageNet-21k 上预训练的 ViT-B/16 模型,输入分辨率为 224 × 224 像素,图像块大小为 16 × 16,嵌入维度为 768。
  2. 使用12个多头注意力层,每层的头大小为64,并将dropout率设为0.1以防止过拟合。
  3. 获取 ViT 嵌入,并使用 LayerNorm 对其进行归一化,以确保训练稳定且尺度保持一致。
  4. 使用 FIL 将确定性的 ViT 嵌入转换为模糊值表示,以显示解释的不确定性程度。对于每个特征维度 xi,建立三个高斯隶属函数,用于表示低、中、高三种激活状态:
    mu_low(xi) = exp( - ( (xi - c_l)^2 ) / ( 2 sigma_l^2 ) )
    mu_med(xi) = exp( - ( (xi - c_m)^2 ) / ( 2 sigma_m^2 ) )
    mu_high(xi) = exp( - ( (xi - c_h)^2 ) / ( 2 sigma_h^2 ) )
    ​其中:c_l、c_m 和 c_h 为可学习的隶属函数中心,sigma_l、sigma_m 和 sigma_h 为对应的分布范围,反向传播算法对所有参数(c 和 sigma)以及主模型的权重进行优化。
    1. 建立一组简明规则以识别有用模式,例如:若边缘对比度高且纹理方差低,则OA变化很可能为1级;若强度梯度中等且表面粗糙度高,则OA变化很可能为2级。
    2. 去模糊化:采用加权质心去模糊化方法来合并输出:
      y = (Σ (w_j z_j)) / (Σ w_j)
      其中:w_j 表示第 j 条模糊规则的激活权重(即其真实性程度),z_j 表示该规则之后产生的值或输出强度。输出的模糊增强嵌入向量更易于理解,随后被送入 BDTE 模块。
      ​注意:计算开销:在 NVIDIA RTX A5000(16 GB VRAM)上,每折平均训练时间为 6.4 分钟。每批 10 张图像的推理时间为 0.42 秒。BDT 模块使整个流程的运行时间增加了约 11%,但与非贝叶斯树集成方法相比,过置信度和误分类漂移减少了 18%。该配置在可解释性、计算效率和概率可靠性之间提供了有效的权衡。
  5. 融合与输出
    1. 通过结合ViT嵌入、模糊增强特征和元数据(如果可用)构建复合诊断特征矩阵。将该矩阵作为BDTE的输入。最终模型可同时输出类别概率和不确定性图。
  6. 贝叶斯决策树集成(Bayesian Decision Tree Ensemble, BDTE)
    1. 初始化贝叶斯决策树集成(50 棵树,最大深度 = 10)。应用拉普拉斯先验(α = 1)和贝叶斯模型平均。
    2. 使用基于熵的信息增益分割节点。通过蒙特卡洛采样(每棵树500次)估计类别后验概率。
    3. 使用 L2 正则化(λ = 1 × 10⁻³)对树模型进行正则化处理。采用等渗回归对概率进行校准。
  7. 按照下述说明设置输入和特征。
    1. 输入图像 I。将 I 调整为 224 × 224 大小并进行归一化处理。将 I 输入 ViT-B/16 主干网络。提取 CLS 嵌入向量 X = {x1, x2, ..., xd}。通过线性投影将 X 映射到紧凑的潜在空间 Z。对 Z 进行归一化,以确保模糊隶属度计算的稳定性。参见下方代码。
      I_norm ← ZScoreNormalize(I)
      I_clahe ← 应用CLAHE(I_norm, clip=2.0, grid=8×8)
      // 元数据处理
      M_scaled ← StandardScale(M)
      M_imputed ← KNNImpute(M_scaled, k=5)
      // 特征提取
      F ← ViT-B/16(I_clahe)
      模糊推理
      F_fuzzy ← 应用模糊规则(F, M_imputed, R)
    2. 模糊表示与推理:对于 Z 中的每个特征 zi,计算其高斯隶属度值。将每个 zi 表示为一个模糊向量 Fi = {µ_low, µ_med, µ_high}。根据特征统计信息初始化高斯参数 cc 和 σσ,并在训练过程中与 ViT 权重联合通过反向传播进行优化。
      µ_low(zi) = exp( - (zi - cl)^2 / (2 σl^2) )
      µ_med(zi) = exp( - (zi - cm)^2 / (2 σm^2) )
      µ_high(zi) = exp( - (zi - ch)^2 / (2 σh^2) )
    3. 创建模糊规则并推断规则触发。定义包含 IF-THEN 规则的模糊规则库 R。对于 R 中的每条规则 rj,从 Fi 中获取所需的模糊隶属度。使用乘积 t-范数计算规则触发强度 wj
      wj = Π µAk(Fk)
      示例 规则:
      若(边缘对比度 = 高)且(纹理方差 = 低),则(膝骨关节炎等级 = 1)
      // 贝叶斯决策树推断
      对于BDTE中的每棵树T_k
      P_k(y|x) ← PredictPosterior(T_k, F_fuzzy)
      ​结束循环
    4. 去模糊化与不确定性估计:对每条规则 rj,分配数值型结果 zj(KL 等级或模糊 logit)。采用 Sugeno 去模糊化方法计算连续型模糊输出:
      y_fuzzy = (Σ wj · zj) / (Σ wj)
      // 贝叶斯聚合
      ​P_final(y|x) ← Mean_k(P_k(y|x))
    5. 结合贝叶斯决策树以串联模糊增强特征与不确定性度量:
      F_final = [Z, y_fuzzy, H, S, C]
      将 F_final 输入贝叶斯决策树集成。每棵决策树计算后验类别概率,拉普拉斯先验用于稳定样本量较少的节点,贝叶斯模型平均法对预测结果进行整合
      // 决策 & 不确定性
      y* ← argmax_y P_final(y|x)
      ​U ← 计算不确定性(P_final)
    6. 不确定性估计:根据 {wj} 计算规则熵 H。计算主导隶属度锐度 S。按如下方式计算竞争规则之间的冲突指数 C。
      高熵 → 诊断模糊
      低锐度 → 边界性膝骨关节炎
      高冲突 → 重叠的等级模式
      ​返回 y*、P_final、U
    7. 获取后验概率 P(y | I)。选择最终的膝关节炎(KOA)等级。
      y_hat = argmax P(y | I)
      获取输出结果,其中包含最终的KOA分级y_hat、各类别概率以及可解释的不确定性指标
  8. DeciVit-模糊模型的粒度
    1. 设置 ViT 微调和贝叶斯树的关键超参数如下。
      ViT 微调参数:
      学习率:1e−4(采用余弦衰减策略)
      批次大小:16
      优化器:AdamW(β₁=0.9,β₂=0.999,权重衰减 = 0.01)
      训练轮数:30,当损失值达到平台期时提前停止(耐心值 = 5)
      丢弃率:0.1
      调度器:预热(总步数的10%),随后线性衰减
      贝叶斯决策树参数:
      估计器数量:50
      最大深度:10
      先验:方差为 0.25 的拉普拉斯先验
      分割规则:最大信息增益(熵准则)
      后验估计:蒙特卡罗抽样(每棵树500次抽样)
      正则化:L2 惩罚项 = 1e−3
      集成平均:对所有树进行贝叶斯模型平均

2. 模型基准测试

  1. 分层训练集-测试集划分
    1. 根据 KL 分级标签对数据集 D 进行分组。采用分层抽样以保持各类别比例。将数据划分为:训练集 D_train = 80%,测试集 D_test = 20%。确保每个 KL 分级(0–4)在两个集合中均按比例出现
      注意:分层抽样可防止多数类别(KL 2–3)占主导地位,并确保对早期膝骨关节炎(KL 0–1)的公平学习。
  2. 使用加权交叉熵微调 ViT
    1. 计算类别权重 w_c = 1 / 频率(KL_c)。初始化加权交叉熵损失函数 L_vit。冻结 ViT 的早期层,解冻最后的 Transformer 模块。
    2. 在每个训练周期中,将图像前向传播通过 ViT-B/16 模型。计算加权损失 L_vit,反向传播梯度,并使用 AdamW 优化器更新 ViT 权重。
      注意:较高的损失权重迫使模型关注代表性不足的分级(KL 0–1),从而提高对早期 KOA 的敏感性。

3. 数据分析

  1. 为评估 DeciViT-F 框架的临床可解释性,组织五名经验丰富的评估者(三名骨科医生和两名肌肉骨骼放射科医生,每人均具有十年以上诊断经验)进行结构化评估。
  2. 通过该模型的可视化解释界面展示一组精选的 50 例X线影像病例,涵盖所有五个 Kellgren-Lawrence (KL) 分级,界面内容包括:预测类别及置信度评分、模糊语言输出(低、中、高风险)以及突出显示关键贡献特征的贝叶斯决策路径。
  3. 要求每位评估者独立使用五点李克特量表(1 = 非常不清晰,5 = 非常清晰)对解释的清晰度、临床相关性和逻辑一致性进行评分。平均可解释性评分为 4.7 ± 0.3,评估者间一致性 Cohen's κ = 0.81,Krippendorff's α = 0.79,表明评估者间一致性良好。

访问受限。请登录或开始试用以查看此内容。

结果

性能评估
DeciViT-F(图3)取得了最高性能(准确率0.89,AUC 0.93,F1分数0.87),且Brier评分最低(0.082),表明其校准效果优于CNN、ResNet-50和仅使用ViT的模型,后者的不确定性相对较高。在两家骨科诊所开展的前瞻性评估显示,该模型尤其在膝关节炎(KOA)临界病例中的诊断信心有所提升,支持了所提出框架的临床稳健性和泛化能力(表1)。

混淆矩阵与精确率-召回率
各类别结果表明,DeciViT-F 在所有 KL 分级中均实现了最高的精确率和召回率,宏F1得分为0.85,优于CNN(0.66)、ResNet-50(0.70)、VGG16(0.78)和ViT-B/16(0.83;图4)。该模型在早期阶段检测(KL 0-1,精确率0.86,召回率0.78)中表现出显著提升,并在重度分级(KL 4

访问受限。请登录或开始试用以查看此内容。

讨论

DeciViT-F 框架在膝关节骨关节炎(KOA)的诊断准确性和早期敏感性方面均取得了显著提升。定量评估显示,该模型的整体准确率达到 91.2%,宏平均 F1 分数为 0.88,AUC 为 0.968,显著优于 CNN、ResNet-50 和仅使用 ViT 的基线模型。该模型的 Brier 得分为 0.072,预期校准误差(ECE)为 0.041,反映出更优的置信度校准性能。尤为重要的是,早期 KOA(KL 0-1)的敏感性提高了超过 12%,能够在影像学表现出现之前更可靠地区分轻度软骨退变。视觉 Transformer 嵌入、模糊推理层与贝叶斯决策树的协同使用,确保了定量精度与解释透明性兼具(图 9)。这些结果证实,DeciViT-F 能够实现早期、可信且具有临床可解释性的 KOA 诊断,标志着向智能化肌肉骨骼影像系统迈出了决定性一步。本研究不仅提高了诊断的准确性与实用性,还契合社会福祉与可持续发展的目标。通过实现无创、早期发现膝关节骨关节炎,减少了不必要的医疗资源浪费和辐射暴露。DeciViT-F 框架最终促进了人工智能的伦理化部署,将有助于为全人类创造一个更美好、更公平且...

访问受限。请登录或开始试用以查看此内容。

披露

作者声明不存在可能影响本研究的设计、实施或报告的冲突性财务利益、商业关系或个人关系。

致谢

作者们诚挚感谢印度中央邦印多尔市洛克曼亚纳加尔国家阿育吠陀学院院长Das Adhikari博士,他提供了约500份匿名的膝关节X光片,这些影像资料对本研究验证阶段起到了关键作用。作者们还感谢美国国立卫生研究院(NIH,美国)、骨关节炎倡议项目(OAI)以及多中心骨关节炎研究(MOST),这些机构提供了公开可用的数据集,对模型的训练与测试极为重要。DeciViT-Knee 2025方案的创建与实施未获得任何外部资金支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
NumPyNumPyhttps://numpy.org/
OpenCVOpen CVhttps://opencv.org/
骨关节炎倡议(OAI),MOST 数据库美国国立卫生研究院https://nda.nih.gov/oai
Python 3.9+Pythonhttps://www.python.org/downloads/release/python-390/
PyTorchLinux 基金会https://pytorch.org/
SciPyGitHubhttps://scipy.org/
TensorFlowTensorFlowhttps://www.tensorflow.org/

参考文献

  1. Nguyen-Tat, T. B., Nguyen-Duong, T. P. Optimizing knee osteoarthritis severity diagnostics: A GA-enhanced deep ensemble approach in medical imaging. Ain Shams Eng J. 16 (9), 103524(2025).
  2. Wang, L., Xu, Y., Wang, S., Yu, L. Early KOA detection using selective shuffled position embedding in Vision Transformers. Proc ACM Conf. , (2023).
  3. Han, Z., et al. Explainable ViT for musculoskeletal X-rays. Med Image Anal. 85, 102749(2023).
  4. Xu, R., et al. Time-aware transformer models for KOA progression forecasting. Pattern Recognit. 147, 109139(2024).
  5. Kim, S., et al. Efficient transformers for mobile radiology. Nat Biomed Eng. 6 (5), 508-521 (2022).
  6. Qayyum, A., et al. Medical explainable AI: A review on XAI for deep learning in healthcare. IEEE Access. 11, 3986-4013 (2023).
  7. Sun, C., et al. Attention-based temporal models in osteoarthritis prediction. Comp Biol Med. 145, 105425(2022).
  8. Rajpurkar, P., et al. AI in orthopaedics: Current progress and ethical considerations. Lancet Digital Health. 5 (2), e90-e98 (2023).
  9. Chen, H., et al. ViT-XAI: Explainable transformer for diagnostic imaging. J Biomed Info. 142, 104420(2024).
  10. Ghosh, S., Deb, K. Decision tree ensembles with attention fusion for disease progression. Artif Intell Med. 138, 102589(2024).
  11. Ahn, H., et al. Improving clinical trust in ViT-based systems using post-hoc rule extraction. J Med Sys. 46 (8), 59(2022).
  12. Morita, K., et al. SHAP-guided model calibration for KOA diagnosis. Machine Learn Appl. 11, 100378(2023).
  13. Patel, M. H. Temporal reasoning in KOA diagnosis: A review of recent advances. Biomed Signal Proc Control. 81, 104295(2023).
  14. Delaney, K., et al. Multi-modal deep learning for MRI and lab data fusion. Proc MICCAI, Lecture Notes Comp Sci (LNCS 14225). , 390-402 (2023).
  15. Ishaq, M., et al. Transformer vs CNN vs hybrid for radiographic knee OA analysis. Comp Biol Med. 152, 106353(2023).
  16. Nguyen, M., et al. Edge-AI deployment of lightweight ViT models. IEEE Internet Things J. 9 (18), 16921-16933 (2022).
  17. Chen, Y., Yang, J., Xu, X., Zhao, X. Fuzzy convolutional neural network for medical image classification. IEEE Transact Fuzzy Syst. 29 (12), 3651-3663 (2021).
  18. Lin, C., Wang, S., Zhang, J. Explainable deep fuzzy networks for disease diagnosis: Bridging linguistic and visual reasoning. Artif Intell Med. 124, 102228(2022).
  19. Yadav, P., Kumar, A., Saini, R. Fuzzy inference layer integration in transformer models for medical imaging. Comp Biol Med. 159, 106056(2023).
  20. Singh, R., Gupta, S. Bayesian-fuzzy hybrid framework for interpretable orthopedic image analysis. Biomed Signal Proc Control. 89, 105858(2024).
  21. Apon, D., et al. Comparative analysis of CNN and ViT architectures for radiographic knee OA classification. Comput Med Imaging Graphics. 114, 102294(2024).
  22. An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. Dosovitskiy, A., et al. Int Conf Learning Representat (ICLR), , (2021).
  23. Zhou, Z., et al. Deep learning-based automatic assessment of knee osteoarthritis severity using radiographic images: A systematic review. Front Med. 9, 103524(2022).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

MRI

相关文章