本研究比较了五种机器学习算法在使用超分辨率超声特征进行甲状腺结节分类中的性能。支持向量机(SVM)表现最佳(准确率为68.6%,曲线下面积为0.690),识别出微钙化和增强后扩大是关键贡献因素,但研究结果在用于临床实践前需经过外部验证。
研究文章
69 次观看
⸱
2026年9月11日
* These authors contributed equally
本研究比较了五种机器学习算法在使用超分辨率超声特征进行甲状腺结节分类中的性能。支持向量机(SVM)表现最佳(准确率为68.6%,曲线下面积为0.690),识别出微钙化和增强后扩大是关键贡献因素,但研究结果在用于临床实践前需经过外部验证。
本研究比较了五种机器学习算法——随机森林(Random Forest, RF)、支持向量机(Support Vector Machine, SVM)、决策树(Decision Tree, DT)、极端梯度提升(eXtreme Gradient Boosting, XGBoost)和梯度提升(Gradient Boosting, GB)——利用常规超声、超声造影(contrast-enhanced ultrasound, CEUS)和超分辨率超声(super-resolution ultrasound, SRUS)提取的定量特征对甲状腺结节进行分类。该回顾性研究纳入了来自63名患者(30个良性结节和38个经证实为乳头状甲状腺癌[PTC]的结节)的68个甲状腺结节,通过五折患者分组交叉验证分析了25个定量特征,确保同一患者的全部结节均被分配至同一折中。模型性能在各折间进行汇总,并基于合并的折外(out-of-fold, OOF)预测结果进行评估;针对表现最优的SVM模型,采用基于排列的解释器进行了聚焦的折外SHAP(SHapley Additive exPlanations)分析。SVM取得了最高的平均准确率(0.686 ± 0.120)和平均受试者工作特征曲线下面积(Receiver Operating Characteristic-Area Under Curve, ROC-AUC)(0.690 ± 0.164),合并折外预测的敏感性为0.842,特异性为0.500,其中微钙化和造影后增大被识别为对模型贡献最重要的SHAP特征。RF表现出较为均衡的性能(准确率55.9%,敏感性55.3%,特异性56.7%),而DT表现较差(准确率0.429,ROC-AUC 0.447),接近随机猜测水平。研究表明,定量SRUS测量值可被整合进传统分类模型中;然而,该结果仍属探索性质,需在更大样本队列中开展前瞻性、多中心研究以进一步验证,方可考虑临床应用。
甲状腺结节是一种极为常见的临床发现,在无症状人群中通过超声检查的检出率可高达68%1。近期的荟萃分析显示,全球甲状腺结节的患病率已从2000–2011年间的21.53%上升至2012–2022年间的29.29%,影响约每四位普通人群个体中的一位2,3。在这些结节中,最终有7–15%被诊断为甲状腺癌,其中乳头状甲状腺癌(PTC)是最主要的亚型4,5。PTC占所有甲状腺恶性肿瘤的80–90%,已成为增长最快的癌症类型之一,其发病率从1975年的每10万人4.8例上升至2012年的每10万人14.9例6。
常规超声检查仍是甲状腺结节评估的基石,提供了一种无创、经济且广泛可及的诊断方法7。提示恶性的传统超声特征包括明显低回声、边界不规则、微钙化以及纵横比大于1的形态8,9。然而,其根本受限于声学衍射极限,空间分辨率被限制在约100微米左右10。这一限制显著影响了对微血管结构的可视化能力以及对精细血管形态的评估,而这些参数对于区分良恶性甲状腺病变至关重要11。彩色多普勒血流成像(CDFI)和超声造影(CEUS)虽然提高了血流检测能力,但仅能显示流速超过1 cm/s的血管,且仍受衍射极限分辨率的制约12,13。
超分辨率超声(SRUS)作为一种变革性技术,突破了传统超声系统的衍射极限14,15。该技术利用造影微泡作为定位与追踪的点目标,实现微米级空间分辨率,从而以前所未有的细节水平对微血管结构进行可视化和定量分析16,17。该方法可同时测量微血管密度(MVD)和微血管血流速度(MFR),提供传统无创影像技术无法实现的结构与功能评估17,18。初步研究表明,良性甲状腺结节的MFR显著高于恶性结节,其平均值分别为16.76 ± 6.82 mm/s和9.86 ± 4.54 mm/s19。 “超声微血管组学”(ultrasound microvasculomics)的提出——即从SRUS图像中高通量提取定量特征——进一步提升了实现精准化、个体化微血管评估的潜力。
机器学习(ML)已彻底改变了医学影像分析,尤其在甲状腺结节特征识别方面20,21。深度学习模型,特别是卷积神经网络(CNN),在以往研究中已实现受试者工作特征曲线下面积(ROC-AUC)超过0.90的性能22,23,24。集成机器学习方法结合了多种算法——包括随机森林(RF)、支持向量机(SVM)、决策树(DT)、梯度提升(GB)和极端梯度提升(XGBoost)——在提高异质数据集上的诊断准确性和稳健性方面展现出良好前景21。正如Habchi等25近期全面综述所述,用于甲状腺癌的人工智能(AI)领域已迅速扩展,涵盖视觉转换器、大语言模型和混合架构,反映出该领域正朝着日益复杂的基于影像的诊断框架发展。
尽管传统超声特征已与人工智能算法进行了广泛研究,但超分辨率微血管参数与机器学习模型的结合仍基本未被探索。尽管超分辨率超声(SRUS)技术具有广阔的应用前景,且机器学习算法在医学影像中的有效性已得到证实,但仍有一些关键问题尚未解决。首先,当应用于SRUS提取的微血管特征时,哪种机器学习架构表现最优——是随机森林(RF)和支撑向量机(SVM)等传统算法,还是XGBoost和梯度提升(GB)等先进的集成方法?其次,这些模型在区分良性和恶性甲状腺结节时,其敏感性、特异性和总体诊断准确性的表现如何?第三,从SRUS成像中提取的哪些微血管参数对分类性能的贡献最为显著?回答这些问题对于建立基于证据的临床框架,推动SRUS辅助甲状腺结节诊断的临床转化至关重要。
因此,本研究旨在利用超分辨率超声微血管成像数据,全面评估五种机器学习算法(RF、SVM、DT、XGBoost 和 GB)在甲状腺结节分类中的性能。通过系统比较这些方法并识别最具信息量的微血管生物标志物,本研究力图推进甲状腺结节表征的诊断模式,并为支持超分辨率超声(SRUS)技术在肿瘤影像学中临床应用价值的不断增长的证据体系做出贡献。我们假设预先设定的25个变量特征集能够在良性结节与被报告为乳头状甲状腺癌的结节之间实现高于随机水平的区分能力。采用基于患者分组的交叉验证以减少信息泄露,并引入聚焦的SHAP分析来描述所选分类器如何利用测量得到的变量。这两项分析均为探索性分析。
研究设计与患者人群
本项回顾性研究分析了2024年6月13日至2025年1月13日期间获取的甲状腺超声检查结果。研究方案经首都医科大学附属北京友谊医院伦理委员会批准(批准号:BFHHZS20240300),并遵循《赫尔辛基宣言》中所述的伦理原则进行;由于本研究为回顾性设计,故免除了知情同意要求。数据集包含来自63例患者的68个甲状腺结节(其中良性30个,恶性38个),以结节为分析单位。参考诊断依据超声引导下细针穿刺细胞学(FNAC)结果确定。恶性组包括38个经FNAC报告为甲状腺乳头状癌的结节。
纳入标准
纳入研究的患者需同时满足以下所有标准:(1)接受过常规灰阶和彩色多普勒超声检查,并随后进行对比增强超声(CEUS)检查,且图像质量满意,可进行后续的微血管血流成像分析;(2)经细针穿刺活检证实细胞病理学诊断为乳头状甲状腺癌(PTC),无论是否同时进行BRAFV600E突变检测且结果阳性;或细胞学结果为Bethesda III类(意义不明的非典型病变),但同时BRAFV600E突变检测结果为阳性;(3)细胞病理学诊断为良性增生性结节、腺瘤样结节或Bethesda II类良性滤泡性结节,且未同时检出BRAFV600E突变阳性。
排除标准
如果存在以下任一情况,则患者被排除在研究之外:(1)CEUS图像质量差或微泡信号不足,无法可靠评估微血管血流;(2)缺乏细胞学或病理学结果;(3)组织病理学诊断为罕见或特殊类型的甲状腺癌(如未分化型变异);或(4)细胞学结果提示滤泡性肿瘤(Bethesda IV类)或任何来源不确定的滤泡性病变,无论突变状态如何;(5)桥本甲状腺炎
超声、CEUS 和 SRUS 采集
所有检查均使用引用的超声系统和线阵探头进行。患者取仰卧位,颈部后仰。在B型超声上定位并测量目标结节,记录微钙化,并采用相同的病灶中心成像平面,通过彩色多普勒评估结节内血流情况。
建立静脉通路后,将系统切换至低机械指数的CEUS/URM模式(URM表示超分辨率显微成像)。经静脉团注1.2 mL SonoVue,随后立即用5 mL生理盐水冲管;在团注开始的同时启动屏幕计时器并进行连续动态图像采集。探头保持在固定的切面,施加压力最小化,并要求患者在造影剂灌注和消退期间避免吞咽动作。
对于定量对比增强超声(CEUS),采用病灶限定的兴趣区来获取时间-强度参数。对于超快超声微血管成像(SRUS),URM 工作流程在运动控制后对微泡信号进行定位和追踪,并生成血管比率、复杂度、微血管密度、灌注指数和血流速度等测量参数。代表性图像导出时的设置为 VSP 4、RES 2、CTR 3、SM 2、VEN 3 和 CPT 10 s;其余检查对应的设置不可用。
25个模型输入变量列于表1中,并按采集方式分组:年龄和性别;B型超声微钙化;彩色多普勒结节内血流;定性超声造影;定量超声造影;以及11项剪切波弹性成像微血管测量指标。
特征选择
在机器学习模型中保留了全部25个定量特征。仅使用了数值型特征;患者姓名、登记编号和病灶大小字段被排除在外。未进行数据驱动的特征筛选,所有分类器均输入相同的预设预测变量。
特征标准化
交叉验证之前未进行任何转换、插补或全局缩放处理。仅对基于径向基函数的支持向量机(SVM)通过 StandardScaler 流水线进行了标准化处理。该缩放器在每一折的训练结节数据上进行拟合,然后应用于该折的验证结节数据。基于树的分类器则直接使用原始的数值尺度:

其中 x 为原始特征值,µ 为训练折的均值,σ 为训练折的标准差。按折预处理可防止验证集样本影响 SVM 的缩放参数。
数据划分
主要性能评估采用五折分层分组交叉验证(StratifiedGroupKFold),shuffle = True,random_state = 42。患者标识符定义了63个组,同一患者的全部结节被分配至同一折中。每个折的训练集与验证子集中均不包含来自同一患者的结节。
模型训练与验证
训练方案
评估了五种分类器:随机森林(100 棵树;random_state = 42)、径向基函数支持向量机(SVM)(C = 1.0;gamma = scale;probability = True;StandardScaler 流水线;random_state = 42)、决策树(基尼准则;无限制深度;random_state = 42)、XGBoost(100 个估计器;learning_rate = 0.3;max_depth = 6;subsample = 1.0;colsample_bytree = 1.0;random_state = 42)以及梯度提升(gradient boosting)(100 个估计器;learning_rate = 0.1;max_depth = 3;random_state = 42)。未进行网格搜索、贝叶斯优化、阈值调优或嵌套模型选择。
交叉验证
在五个按患者分组的折叠中,模型在其余患者组上进行训练,并在保留的组上进行评估。针对每个折叠计算准确率、灵敏度、特异度、精确率、F1分数和ROC曲线下面积(ROC-AUC),并以均值±标准差(SD)形式汇总。将所有68个结节的留一外(OOF)预测结果合并,为每个模型生成一条交叉验证的ROC曲线和一个混淆矩阵。
性能评估
评估指标
在每个按患者分组的验证折内以及使用以下指标对汇总的折外预测结果进行模型性能评估:
准确率:正确预测结果所占的总体比例

灵敏度(召回率):正确识别出的实际恶性结节所占的比例

特异性:正确识别的实际良性结节的比例

精确度(阳性预测值):预测为恶性的病例中实际为恶性的比例

F1分数:精确率与召回率的调和平均数

受试者工作特征曲线下面积(ROC-AUC):衡量模型在所有分类阈值下区分良性和恶性结节能力的指标
其中 TP 表示真阳性(正确识别的恶性结节),TN 表示真阴性(正确识别的良性结节),FP 表示假阳性(被错误分类为恶性的良性结节),FN 表示假阴性(被错误分类为良性的恶性结节)。
混淆矩阵分析
OOF 混淆矩阵是通过汇总每个结节的预测结果生成的,这些预测仅来自该患者被排除在外的折叠(fold)中。因此,每个结节的预测结果均由一个在其他患者结节上训练的模型得出。
特征重要性分析
对于随机森林模型,特征重要性评分基于所有决策树中基尼不纯度的平均降低值进行计算。确定并排序了最重要的前15个特征,以明确哪些微血管参数对分类性能的贡献最为显著。
探索性 SHAP 分析
采用基于排列的解释器对支持向量机(SVM)进行了聚焦的OOF SHAP分析。对于每个被保留的结节,仅使用相应的训练折观测数据作为背景分布(128个反向排列;随机种子 = 20260716)。平均绝对SHAP值用于总结特征贡献的大小,而带符号的SHAP值指示了贡献的方向。该分析为探索性分析,不用于推断因果关系、识别独立生物标志物或定义临床阈值。
统计学分析
比较分析
模型性能在五个按患者分组的验证折以及汇总的折外预测结果中进行了描述性总结。由于各折之间存在关联且队列规模较小,未进行正式的模型间假设检验或基于P值的排序。
对于基线组间比较,使用Shapiro-Wilk检验评估每个结果组内连续变量的正态性。当两组数据均符合正态分布时,采用Welch t 检验;否则,采用双侧Mann-Whitney U 检验。分类变量采用Pearson卡方检验,对于稀疏的2×2列联表则使用Fisher精确检验。P值为双侧、探索性且未经校正(alpha = 0.05)。
可重复性
可重复性通过明确的患者群体定义、固定的随机种子(42)、固定的分类器配置以及按折预处理得到保障。标识符仅用于分组,未作为预测变量输入模型,也未随模型输出导出。
患者特征与研究人群
共纳入63例患者的68个甲状腺结节,包括30个良性结节和38个甲状腺乳头状癌(PTC)。以结节作为分析单位,通过患者分组确保同一患者的结节不会同时出现在训练集和验证集中。基线特征总结于表2中。
图1展示了根据超声引导下细针穿刺细胞学(FNAC)结果,分别来自一个代表性良性结节和一个被报告为乳头状甲状腺癌(PTC)结节的病灶局限性SRUS/URM重建图像,技术上均取得成功。两个示例均显示了病灶轮廓、重建的微血管图谱以及设备生成的定量叠加图像。这些示例表明在两种参考类别中均成功实现了数据采集与重建,但其本身尚不足以确立诊断区分能力或模型性能。
使用68个结节数据集的五折患者分组交叉验证评估了五种分类器。性能指标以各折均值±标准差以及汇总的留一折出(OOF)值形式报告于表3中。图2、图3和图4分别展示了留一折出的ROC曲线、分组折次的指标汇总以及留一折出的混淆矩阵。
图4展示了汇总的留一患者(OOF)混淆矩阵,其中每个结节的预测仅由未包含该患者其他结节的训练模型完成。支持向量机(SVM)正确分类了38个恶性结节中的32个(灵敏度为0.842),但将30个良性结节中的15个误分类为恶性(特异性为0.500)。决策树模型的假阴性和假阳性分类数量最多。这些模式说明了为何仅依赖准确率是不充分的,并展示了不同模型在实际应用中的成功与欠佳表现。
在聚焦的 OOF SHAP 分析中(图5 和 表 4微钙化和增强后增大对支持向量机(SVM)恶性概率的模型特异性贡献最大,其次为强化均匀性和性别。这些结果描述了该队列中拟合的SVM如何利用所测变量,但并未确立各变量独立的临床重要性。
数据可用性声明
本文所依据的数据将在向通讯作者提出合理请求后予以共享。

图1。具有代表性的病灶局限性SRUS/URM图像。(A)良性甲状腺结节。(B)根据超声引导下细针穿刺细胞学(FNAC)诊断的乳头状甲状腺癌。每个图示均显示病灶轮廓及其对应的微血管重建图像,以及设备生成的定量叠加图。这些示例展示了成功的图像采集与重建结果,但不用于评估诊断准确性。缩写:SRUS = 超分辨率超声;URM = 超高分辨率显微成像;FNAC = 细针穿刺细胞学。请点击此处查看该图的放大版本。

图2。五种分类器的按患者分组的组外验证ROC曲线。 每条曲线汇总了每个结节的一次留出预测结果;虚线对角线表示随机判别水平。缩写:RF = Random Forest;SVM = Support Vector Machine;DT = Decision Tree;XGB = eXtreme Gradient Boosting;GB = Gradient Boosting;OOF = Out-of-fold;ROC-AUC = Receiver Operating Characteristic-Area Under Curve。请点击此处查看该图的放大版本。

图 3。五次按患者分组的验证折中,准确率、灵敏度、特异度、精确率、F1 分数和 ROC-AUC 的均值 ± 标准差。缩写:SD = 标准差; ROC-AUC = 受试者工作特征曲线下面积。请点击此处查看该图的放大版本。

图 4.按患者分组的留折外(OOF)混淆矩阵。 行表示参考类别,列表示预测类别。每个结节的预测结果由一个未使用该患者任何结节进行训练的模型生成。缩写:OOF = 留折外(Out-of-fold)。请点击此处查看该图的放大版本。

图 5.使用基于排列的解释器对 SVM 进行 OOF SHAP 分析。 (A)按均值绝对 SHAP 值从大到小排列前十项。(B)在 68 个保留预测样本中,相同变量的带符号 SHAP 值。缩写:OOF = Out-of-fold(交叉验证外);SHAP = SHapley Additive exPlanations(SHapley 加性解释);SVM = Support Vector Machine(支持向量机);MVD = Microvascular density(微血管密度)。请点击此处查看该图的放大版本。
| 数据获取来源 | 预测因子 | 模型处理方式 |
| 人口统计学 | 年龄;性别 | 作为数值型工作表变量;均作为预先设定的模型输入保留。 |
| B型超声 | 微钙化 | 作为数值型工作表变量;未进行全局标准化。 |
| 彩色多普勒 | 结节内血流(血流信号) | 归类为彩色多普勒预测因子,而非B型超声预测因子。 |
| 定性超声造影(CEUS) | 增强后病灶增大;增强模式;增强均匀性 | 作为数值型工作表变量;保留为预先设定的输入参数。 |
| 定量超声造影(CEUS) | AUC、峰值强度、达峰时间、到达时间、上升时间、平均通过时间、半峰强度时间 | 七个时间-强度曲线变量;未进行缺失值填补或全局标准化。 |
| 剪切波弹性成像超声(SRUS)微血管参数 | 血管比、复杂度、最大/最小/平均/标准差微血管密度(MVD)、灌注指数、最大/最小/平均/标准差血流速度 | 十一个微血管变量;未进行先验特征筛选。 |
表1:定量变量及预处理。 25个预先指定的预测因子按数据获取来源分组:年龄和性别;B型超声微钙化;彩色多普勒结内血流;定性和定量的增强超声(CEUS)测量指标;以及超分辨率超声(SRUS)微血管测量指标。姓名、注册ID和病灶大小字段已被排除。25个变量矩阵中无缺失值。患者身份信息仅用于分组。StandardScaler仅在支持向量机(SVM)训练折内进行拟合。缩写:CEUS = contrast-enhanced ultrasound;SRUS = Super-resolution ultrasound;SVM = Support Vector Machine。
| 采集来源 | 特征 | 良性结节 | 恶性结节 | P 值 |
| (n = 30) | (n = 38) | |||
| 人口统计学 | 年龄,年 | 48 (42, 55) | 48 (41, 52) | 0.551 |
| 人口统计学 | 性别,n (%) | 0.012 | ||
| 人口统计学 | 女性 | 26 (86.7%) | 27 (71.1%) | |
| 人口统计学 | 男性 | 4 (13.3%) | 11 (28.9%) | |
| B型超声 | ||||
| B型超声 | 微钙化,n (%) | 0.001 | ||
| B型超声 | 无 | 12 (40.0%) | 2 (5.3%) | |
| B型超声 | 有 | 18 (60.0%) | 36 (94.7%) | |
| 彩色多普勒 | 血流,n (%) | 0.1 | ||
| 彩色多普勒 | 无 | 7 (23.3%) | 8 (21.1%) | |
| 彩色多普勒 | 有 | 23 (76.7%) | 30 (78.9%) | |
| 定性CEUS | 增强后增大,n (%) | 0.001 | ||
| 定性CEUS | 否 | 16 (53.3%) | 5 (13.2%) | |
| 定性CEUS | 是 | 14 (46.7%) | 33 (86.8%) | |
| 定性CEUS | 增强均匀性,n(%) | 0.087 | ||
| 定性CEUS | 不均匀 | 11 (36.7%) | 23 (60.5%) | |
| 定性CEUS | 均匀 | 19 (63.3%) | 15 (39.5%) | |
| 定性CEUS | 增强模式,n (%) | |||
| 定性CEUS | 低增强 | 18 (60.0%) | 20 (52.6%) | |
| 定性CEUS | 等增强 | 3 (10.0%) | 0 (0.0%) | |
| 定性CEUS | 高增强 | 9 (30.0%) | 18 (47.4%) | |
| 定量CEUS | ||||
| 定量CEUS | 曲线下面积 (AUC),dB·s | 3255.49 (2457.15, 4048.94) | 3620.76 (3096.36, 4066.75) | 0.201 |
| 定量CEUS | 峰值强度 (PI),dB | 48.93 (40.93, 55.78) | 50.22 (42.49, 56.82) | 0.621 |
| 定量CEUS | 达峰时间 (TTP),s | 17.78 (16.47, 19.30) | 20.42 (17.53, 23.47) | 0.045 |
| 定量CEUS | 到达时间 (AT),s | 9.88 (8.23, 11.53) | 9.88 (8.64, 11.53) | 0.1 |
| 定量CEUS | 上升时间 (RT),s | 8.43 (6.92, 9.55) | 9.55 (7.00, 12.11) | 0.164 |
| 定量CEUS | 平均通过时间 (MTT),s | 69.38 (60.17, 87.84) | 82.82 (64.22, 99.15) | 0.102 |
| 定量CEUS | 半峰强度时间 (THP),s | 81.62 (70.53, 99.93) | 95.34 (73.60, 109.44) | 0.157 |
| SRUS微血管 | ||||
| SRUS微血管 | 血管比率,% | 56.29 (43.34, 71.44) | 57.81 (41.49, 70.24) | 0.772 |
| SRUS微血管 | 复杂程度 | 1.68 (1.59, 1.73) | 1.62 (1.57, 1.69) | 0.083 |
| SRUS微血管 | 微血管密度—最大值 | 15.24 (10.59, 17.88) | 13.28 (9.60, 15.92) | 0.142 |
| SRUS微血管 | 微血管密度—最小值 | 0.07 (0.05, 0.07) | 0.06 (0.04, 0.07) | 0.385 |
| SRUS微血管 | 微血管密度—均值 | 6.20 (3.46, 7.45) | 4.71 (3.74, 6.78) | 0.161 |
| SRUS微血管 | 微血管密度—标准差 | 3.15 (2.12, 3.64) | 2.56 (1.94, 3.04) | 0.085 |
| SRUS微血管 | 灌注指数 | 6.81 (4.53, 9.05) | 7.12 (4.52, 9.90) | 0.666 |
| SRUS微血管 | 最大血流速度,mm/s | 25.13 (22.24, 26.43) | 26.32 (23.86, 28.00) | 0.152 |
表2:30个良性与38个恶性甲状腺结节的基线特征。 良性(n = 30)和恶性(n = 38)结节的基线人口学及影像学特征。数值以n(%)或中位数(四分位间距)表示。参考标签根据超声引导下细针抽吸细胞学检查(FNAC)确定;未获得术后组织病理学结果。缩写:EUS = 增强超声;SRUS = 超分辨率超声。
| 分类器 | 准确率 | 灵敏度 | 特异性 | 精确率 | F1分数 | ROC-AUC | |
| 随机森林 | 分层分组K折验证 | 0.548 ± 0.176 | 0.573 ± 0.297 | 0.572 ± 0.105 | 0.603 ± 0.139 | 0.555 ± 0.204 | 0.633 ± 0.137 |
| 合并OOF | 0.559 | 0.553 | 0.567 | 0.618 | 0.583 | 0.579 | |
| 支持向量机(SVM) | 分层分组K折验证 | 0.686 ± 0.120 | 0.850 ± 0.180 | 0.495 ± 0.204 | 0.678 ± 0.154 | 0.740 ± 0.118 | 0.690 ± 0.164 |
| 合并OOF | 0.691 | 0.842 | 0.5 | 0.681 | 0.753 | 0.655 | |
| 决策树 | 分层分组K折验证 | 0.429 ± 0.073 | 0.492 ± 0.229 | 0.402 ± 0.247 | 0.514 ± 0.169 | 0.468 ± 0.117 | 0.447 ± 0.073 |
| 合并OOF | 0.426 | 0.474 | 0.367 | 0.486 | 0.48 | 0.42 | |
| XGBoost | 分层分组K折验证 | 0.541 ± 0.151 | 0.494 ± 0.197 | 0.595 ± 0.137 | 0.587 ± 0.228 | 0.530 ± 0.202 | 0.571 ± 0.163 |
| 合并OOF | 0.544 | 0.5 | 0.6 | 0.613 | 0.551 | 0.594 | |
| 梯度提升 | 分层分组K折验证 | 0.544 ± 0.099 | 0.500 ± 0.091 | 0.550 ± 0.213 | 0.624 ± 0.087 | 0.546 ± 0.053 | 0.579 ± 0.124 |
| 合并OOF | 0.544 | 0.5 | 0.6 | 0.613 | 0.551 | 0.555 |
表3:五折患者分组交叉验证性能及汇总的组外(OOF)性能。来自同一患者的全部结节被分配至同一折中。数值为五次分层分组K折交叉验证(StratifiedGroupKFold)结果的均值±标准差。68个结节来自63个患者组;每折保留12–13个患者组的12–5个结节用于验证。每个汇总的组外(OOF)值均基于在排除该患者所有结节的验证折中对每个结节所做出的单次预测。对应的汇总组外混淆矩阵见图3。缩写:OOF = 组外(out-of-fold);SVM = 支持向量机(Support Vector Machine)。
| 排序 | 特征 | 平均 |SHAP| | 平均 |SHAP| 的折叠标准差 |
| 1 | 微钙化 | 0.0357 | 0.023 |
| 2 | 对比增强后增大 | 0.0331 | 0.0165 |
| 3 | 强化均匀性 | 0.0207 | 0.008 |
| 4 | 性别 | 0.0194 | 0.0109 |
| 5 | 血流速度标准差 | 0.0159 | 0.01 |
| 6 | 平均微血管密度(MVD 均值) | 0.0124 | 0.0086 |
| 7 | 平均通过时间 | 0.0118 | 0.0069 |
| 8 | 血流速度最小值 | 0.0107 | 0.0061 |
| 9 | 强化模式 | 0.0103 | 0.0112 |
| 10 | 微血管密度标准差(MVD SD) | 0.0102 | 0.0077 |
表4:SVM模型的全局OOF SHAP特征排序。 SHAP值用于量化各特征对SVM恶性概率的贡献。每个结节在其独立的患者分组验证折中被解释一次。全局值为68个OOF解释中平均绝对SHAP值的均值;折间标准差(fold SD)为五个折中各折平均绝对SHAP值的标准差。排序结果为模型特异性的探索性总结,不代表因果效应、独立生物标志物或临床阈值。缩写:OOF = 折外(out-of-fold);SVM = 支持向量机(Support Vector Machine);MVD = 微血管密度(microvascular density);SHAP = SHapley加性解释(SHapley Additive exPlanations)。
目前对甲状腺结节的诊断方法主要依赖于传统超声检查,而该方法具有明显的操作者依赖性,且存在观察者间差异5,以及无法显示衍射极限以下微血管结构的局限性。据我们所知,本研究是首次在科研环境下,对应用于超分辨率超声(SRUS)微血管成像数据的多种机器学习算法进行全面评估,实现了对甲状腺结节乳头状癌(PTC)风险的客观定量评估。
本研究的主要贡献在于建立了一个基于患者水平的分析框架,该框架整合了基于定位的对比微泡超分辨率超声(SRUS)测量结果、B型超声、彩色多普勒超声、定性与定量对比增强超声(CEUS)以及临床变量,用于对甲状腺结节进行分类。其创新之处在于将实验测得的微血管信息纳入预设的25变量多模态特征集,并采用抗数据泄露的患者分组策略进行评估,而非依赖于新的分类器架构。来自同一患者的全部结节均保留在同一折叠组中;支持向量机(SVM)的缩放器仅基于各训练折叠组进行拟合;模型评估采用了五折患者分组交叉验证、汇总的留一外(OOF)预测结果以及聚焦的OOF SHAP分析。在此框架下,SVM取得了最高的平均准确率(0.686 ± 0.120)和平均ROC曲线下面积(0.690 ± 0.164),但其汇总OOF特异性仅为0.500,且在不同折叠组间性能存在波动。综上所述,这些发现确立了一种可重复的、在患者水平上联合评估微血管与常规超声数据的方法,同时也指出了在临床应用前仍需进一步优化的方面。
既往关于甲状腺的研究已证实对比增强微泡超快超声成像(contrast-microbubble SRUS)的可行性,并在一个包含24个结节的小样本队列中报告了微血管血流的组间差异26。本研究从三个方面进一步拓展了该成像可行性的验证。首先,将SRUS-derived血管密度、血流速度和灌注参数与B型超声下的微钙化、彩色多普勒血流成像中的结节内血管分布、定性和定量对比增强超声(CEUS)以及年龄和性别等因素共同纳入分析,而非仅进行孤立的SRUS比较。其次,在预处理和验证过程中始终以患者为独立分析单位,确保同一患者的结节不会同时出现在训练集和验证集中。第三,采用相同的以患者为分组单位的分析框架,将模型性能与汇总的留一法外预测(pooled OOF predictions)以及聚焦的留一法外SHAP分析(OOF SHAP analysis)相联系。上述要素共同构建了一个将数据采集、定量微血管特征表征、模型评估与结果解释整合为一体的可重复工作流程,为未来研究奠定了基础。
我们已发现多项近期研究,探讨了人工智能与深度学习在恶性甲状腺结节诊断中的应用。将我们的方法与这些研究进行区分具有重要意义。Feng 等人开发了一种多中心、多模态模型,用于术前对乳头状甲状腺癌进行风险分层27,而 Gatta 等人则综合了基于常规甲状腺超声图像、经外部评估的机器学习模型,用于良恶性结节的鉴别诊断28。Li 等人将计算型单图像超分辨率技术应用于常规超声,以实现结节定位29,He 等人则利用生成对抗网络增强的B模式放射组学来预测细针穿刺结果为无法诊断(Bethesda I类)30。基于几何感知、迁移学习和Transformer的方法进一步展示了甲状腺超声研究在算法上的多样性31。上述研究均使用常规超声图像、多模态临床或影像变量,或经计算增强的图像表征;但并未对注射后的造影微泡进行定位,也未直接量化病灶层面的微血管密度与血流情况。Habchi 等人将基于VGG19的迁移学习框架应用于常规甲状腺超声图像,并在公开数据集上报告了较高的分类准确率32。尽管该研究展示了深度学习在此领域的潜力,但其完全依赖于B模式图像特征。
相比之下,本研究的特定贡献在于采用基于定位的超分辨率超声(SRUS)技术获取实验测量的微血管参数,并将其与常规超声和对比增强超声(CEUS)特征相结合,进行以患者为分组单位的评估。所引用的研究与本研究具有互补性,而非直接的性能对照,因其输入参数、终点指标、参考标准及验证设计均不相同。我们认为这种互补性是一种优势,表明存在多种独立途径可实现更优的风险分层。值得注意的是,我们的研究结果也与基于深度学习的方法相辅相成,例如Habchi等人提出的具有几何感知能力的Bandelet变换框架31,以及Xu等人建立的迁移学习基准模型33,这些方法侧重于常规B模式图像分类,而非定量血流动力学生物标志物——这是两种根本不同的输入模态,各自捕捉了肿瘤生物学的不同方面。
我们的结果表明,五种评估分类器的性能存在显著差异。支持向量机(SVM)在平均准确率(0.686 ± 0.120)和ROC-AUC(0.690 ± 0.164)方面表现最佳,且在交叉验证中的标准差最低,显示出其在小样本任务上的稳健性能。汇总的留一法(OOF)验证进一步证实,SVM的敏感性为84.2%(38个恶性结节中有32个被正确识别),F1分数为0.753,是所有模型中最高的。这种强大的检测能力在临床实践中具有重要意义,因为漏诊可能导致严重后果。然而,其特异性仅为50.0%(30个良性结节中有15个被误分类),这一模式需要谨慎解读。这种相对较低的特异性可能反映了我们数据集的高维特性(25个预测变量对比30个良性样本)。在如此稀疏的特征空间中,SVM的决策边界会受到少数具有类似恶性微血管特征的良性结节的过度影响,迫使分类器采取保守策略——将不确定的病例标记为恶性——以最小化假阴性。从临床角度来看,在筛查场景中这种权衡是可以接受的,因为漏诊乳头状甲状腺癌(PTC)的后果通常远比不必要的细针穿刺活检(FNAC)更为严重。在未来的研究中,应优先考虑扩大样本量,特别是增加更多良性样本,并尝试再次使用代价敏感学习或降维方法,在保持高敏感性的同时提升特异性。
随机森林(RF)表现出的平均准确率为(0.548 ± 0.176),低于支持向量机(SVM)。然而,RF显示出平衡的汇总留一法(OOF)性能(准确率55.9%,敏感性55.3%,特异性56.7%),这对于临床决策支持系统具有重要价值。基于不纯度的重要性排序显示,平均微血管密度(MVD)、平均血流速度和灌注指数位于前列变量之中,表明其具有明确的SRUS信号意义。XGBoost与梯度提升算法表现居中,均未优于RF,这可能归因于在样本量有限(n = 68)且正则化策略保守的情况下,模型对超参数较为敏感。决策树(DT)表现较差(准确率0.429,ROC-AUC 0.447),接近随机猜测水平——这在单棵决策树易发生过拟合的情况下属预期结果。综上所述,当优先考虑最大化敏感性时,SVM为更优选择;而RF在性能均衡性与可解释性方面具备优势;两者均需进一步研究验证。
聚焦的SHAP分析确定微钙化、对比增强后增大和增强均匀性为前三大预测因素,其次是性别和超快超声参量(SRUS参数),包括血流速度标准差、平均微血管密度(MVD)和平均传输时间。传统特征占主导地位,但SRUS参数提供了独立的增量信息。SRUS指标的重要性与其物理优势一致。SRUS可实现约10 µm的分辨率,而传统多普勒的分辨率受限于约200–300 µm。Zhang等证实恶性结节的血流速度较低(9.86 vs. 16.76 mm/s,p < 0.01)且MVD较低19,反映了乳头状甲状腺癌(PTC)以纤维化和淋巴优势为特征的生物学特性。我们的SHAP结果具有生物学合理性,且与TI-RADS标准的一致性支持了具有临床意义的模式学习8。
准确的风险分层对患者的诊疗和临床决策具有重要意义。如果能够通过机器学习对SRUS影像进行分析来识别高风险结节,患者便可更及时地接受细针穿刺细胞学检查(FNAC),从而减轻焦虑并防止癌症进展。对于部分经筛选的低风险结节,则可采用超声进行随访监测。定量微血管测量指标未来可能在该过程中补充传统的影像学观察。然而,本研究并未验证该分类模型的输出是否能提升医生的诊断效能、减少不必要的FNAC操作或改变患者的临床结局。因此,该模型的输出结果尚不能用于指导临床决策,而应被视为研究级工具,用于验证原理并为后续前瞻性评估奠定基础。在分析过程中,来自同一患者的全部结节必须保留在相同的折叠分组中,且预处理步骤必须仅基于该分组的训练集部分进行拟合。
应考虑若干局限性。首先,本研究为一项回顾性、单中心研究,纳入了63例患者中的68个结节,且未进行外部验证;样本量较小可能增加过拟合的风险。尽管如此,基于患者分组的交叉验证在一定程度上提供了可靠性。其次,所有参考标签均来源于超声引导下的细针抽吸细胞学检查(FNAC),而非术后组织病理学结果。FNAC可提供细胞学证据,但并不等同于术后组织学确诊,可能引入分类误差,尤其是在被标记为良性结节的病例中,尽管我们已对良性结节的范围进行了严格限定,并对所有结节进行了BRAFV600E基因检测。第三,恶性组仅限于FNAC报告为乳头状甲状腺癌(PTC)的结节,限制了结果向其他类型甲状腺恶性肿瘤的推广性。第四,未系统收集其他临床因素(如甲状腺功能、家族史)。最后,未进行系统的超参数优化、校准分析,也未开展基于独立图像的深度学习方法对比。尽管存在这些局限性,本研究结果与生物学合理性及现有文献的一致性增强了其可信度。未来研究应优先关注以下方向:(1)在更大规模队列中开展前瞻性、多中心验证,并以术后组织病理学为参考标准;(2)多模态融合,将超分辨率超声(SRUS)与弹性成像、常规超声结合;(3)整合血清生物标志物、标准化采集流程、质量控制标准34以及特征工程优化。
综上所述,本研究证明了将传统机器学习算法应用于定量的SRUS微血管测量以支持甲状腺结节探索性分类的可行性。支持向量机(SVM)表现出高灵敏度但特异性有限,提示其可能作为筛查辅助工具而非诊断替代手段。尽管研究尚属初步,我们的发现建立了一个可重复且抗渗漏的评估流程,并值得在更大样本队列中进行前瞻性验证。
作者声明无任何利益冲突。
作者感谢首都医科大学附属北京友谊医院超声科工作人员在患者数据收集过程中提供的帮助。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 决策树分类器 | scikit-learn | Version 1.5.2 | 机器学习分类器 |
| 细针穿刺活检针 | 用于超声引导下细针穿刺抽吸活检(FNAC) | ||
| 梯度提升分类器 | scikit-learn | Version 1.5.2 | 机器学习分类器 |
| 静脉导管 | 用于对比剂给药 | ||
| Python | Python Software Foundation | Version 3.11.9 | 用于机器学习分析的编程语言 |
| 随机森林分类器 | scikit-learn | Version 1.5.2 | 机器学习分类器 |
| SHAP(排列解释器) | SHAP Developers | Version 0.46.0 | 模型可解释性分析 |
| SonoVue 对比剂 | Bracco | 用于CEUS/SRUS成像的超声对比剂 | |
| StandardScaler | scikit-learn | Version 1.5.2 | SVM流程中的特征标准化 |
| 无菌生理盐水 | 对比剂注射后用于静脉冲洗 | ||
| StratifiedGroupKFold | scikit-learn | Version 1.5.2 | 按患者分组的交叉验证 |
| 支持向量机(SVM)分类器 | scikit-learn | Version 1.5.2 | 径向基函数核分类器 |
| U5-15LE 线阵换能器 | VINNO Technology | U5-15LE | 线性超声探头 |
| ULTIMUS 9E 超声系统 | VINNO Technology | ULTIMUS 9E | 用于B模式、彩色多普勒、CEUS和SRUS成像的超声成像系统 |
| XGBoost | XGBoost Developers | Version 2.1.1 | 梯度提升框架 |