研究文章

用于非酒精性脂肪肝疾病预测的自动化机器学习模型及外部队列验证

DOI:

10.3791/70033

2026年7月3日

* These authors contributed equally

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了一种逐步进行的自动化机器学习(AutoML)方案,利用NHANES数据和一个外部队列来筛查非酒精性脂肪性肝病。该方法可自动完成特征优先排序和模型选择(GBM),并包含基于SHAP的解释性分析以及外部验证,以实现可重复的临床应用。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

非酒精性脂肪性肝病(NAFLD)是一种常见的肝脏疾病,与肥胖、胰岛素抵抗和代谢综合征密切相关,常在疾病晚期才被诊断。传统的诊断方法,包括影像学检查和肝活检,在早期检测方面存在局限性。因此,亟需一种高效且无创的工具用于NAFLD的早期筛查。本研究利用NHANES的大规模数据集(n = 2677),结合自动机器学习(AutoML)技术,构建了一种NAFLD诊断模型。此外,还采用了一个独立的外部验证队列(n = 200)来评估该模型的外部有效性和性能。为筛选有潜力的临床特征,采用了一种结合LASSO回归与基于ChatGPT-4的智能分析的两阶段特征筛选方法。随后,通过整合多种机器学习算法的AutoML流程进行模型训练与验证。模型性能通过ROC曲线、F1分数以及SHapley加性解释(SHAP)分析进行评估。梯度提升机(GBM)模型在训练集中的AUC为0.843,在测试集中为0.851,在外部验证集中达到0.945,表明其在不同数据集中均具有较高的诊断准确性。BMI、甘油三酯和γ-谷氨酰转移酶(GGT)等关键预测因子被识别为模型预测的重要贡献因素。SHAP分析进一步证实了这些变量在预测NAFLD中的重要性。该基于AutoML的NAFLD诊断模型显著提升了早期检测能力,为传统诊断方法提供了一种可靠、无创且高效的替代方案。该方法在NAFLD的临床应用中具有广阔前景,可在减少对专家经验依赖的同时提高诊断精度。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

非酒精性脂肪性肝病(NAFLD)是全球最常见的肝脏疾病之一,目前约影响全球35%的成年人群,且并非由过量饮酒引起1。该病的特征是超过5%的肝细胞出现脂肪堆积,可能进展为更严重的病变,包括炎症、肝纤维化、肝硬化,最终导致肝功能衰竭2,3 目前,诊断NAFLD的传统方法主要依赖于异常的肝生化指标和超声成像。然而,当脂肪变性程度低于20%时,超声的敏感性有限,这降低了其对轻度脂肪浸润的检出可靠性,常导致早期NAFLD漏诊4。尽管肝活检被视为诊断NAFLD的金标准,但其有创性以及可能引发疼痛、感染和出血等并发症的风险,限制了其在大规模筛查中的可行性5。因此,迫切需要一种高效、无创、经济且高敏感性的工具,以促进NAFLD的筛查。

随着人工智能(AI)和机器学习(ML)技术的快速发展,数据驱动的方法为非酒精性脂肪性肝病(NAFLD)的早期诊断和风险评估提供了新的解决方案。通过分析大规模、复杂的多维数据,机器学习技术能够自动识别潜在的模式和关联关系,并已广泛应用于多种疾病的诊断与预测6。例如,已有研究应用机器学习算法预测慢性乙型肝炎病毒感染者的肝硬化风险,取得了令人鼓舞的结果7。在NAFLD领域,类似的研究已成功利用传统机器学习算法(如支持向量机(SVM)和随机森林(RF))构建诊断模型,实现了较高的准确率,并展现出良好的临床适用性8,9,10,11,12,13,14,15,16,17,18。例如,研究人员开发了一种利用实验室参数的机器学习模型,通过分析常规实验室数据,在普通人群中有效筛查出NAFLD。一项基于实验室参数的机器学习模型已被建立13,用于通过分析常规实验室数据在普通人群中高效筛查NAFLD。通过结合瞬时弹性成像技术与机器学习方法,并利用NHANES 2017–2018数据,研究者预测了美国NAFLD的患病率16。研究团队利用机器学习算法探究瞬时弹性成像与其他临床变量之间的相关性,构建了一个预测模型,能够可靠地估计不同人群中NAFLD的患病率。

然而,传统的机器学习方法通常需要大量的人工干预,特别是在特征工程、模型选择和参数调优方面,这些步骤需要专业的知识和经验。为解决这些局限性,自动化机器学习(AutoML)应运而生。AutoML 能够自动完成整个模型构建流程,包括数据预处理、特征选择、模型选择以及超参数优化,从而显著提升机器学习过程的效率与准确性19。已有研究利用 H2O AutoML 平台开发并验证了用于预测食管静脉曲张出血的模型20。该模型采用了多种算法,包括深度学习(DL)、极端梯度提升(XGBoost)、广义线性模型(GLM)、梯度提升机(GBM)、随机森林(RF)以及堆叠集成方法,预测时间跨度为12个月。研究人员还利用 SEER 数据库的数据,采用 AutoML 预测胃肠道间质瘤患者发生肝转移的风险21。此外,已有研究借助 AutoML 平台,利用常规临床数据开发出一种快速且经济高效的前列腺癌诊断工具22 AutoML 的兴起为临床诊断提供了更高效的解决方案,其在非酒精性脂肪性肝病(NAFLD)筛查中的潜力值得进一步探索。尽管 NAFLD 的早期发现和准确诊断至关重要,但该疾病的无症状特性给诊断带来了重大挑战。尽管 AutoML 技术在疾病诊断中展现出巨大潜力,其在 NAFLD 诊断中的应用仍较为有限,凸显出该研究领域广阔的发展前景。

本研究利用AutoML技术结合瞬时弹性成像,基于美国国家健康与营养调查数据库(NHANES,2017–2018年)的数据,建立了一种非酒精性脂肪性肝病(NAFLD)诊断模型。该模型在中国温州医科大学附属第一医院感染科人群数据集(2018–2020年)上进行了外部验证。研究评估了该模型在外部数据集上的表现,并与传统方法进行了比较,从而弥补了现有研究的不足。通过分析多种血液和生化指标,采用逻辑回归和随机森林等算法构建了预测模型。结果表明,该模型在准确识别非NAFLD个体方面表现出优越性能。这不仅为NAFLD的早期筛查提供了高效且精确的工具,也推动了AutoML在医学领域的应用发展。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

患者与研究设计

本研究的第一个数据集来自2017–2018年国家健康与营养调查(NHANES)数据库。选择这一特定时间段的原因是该调查数据包含了使用FibroScan®技术进行的肝脏超声瞬时弹性成像测量。NHANES采用分层、多阶段的概率抽样设计,是一项由国家卫生统计中心(NCHS)组织实施的全国性、基于人群的双年度调查,系统地收集美国非机构化人群具有全国代表性的健康相关数据,以评估美国普通平民人口的营养和健康状况1。NHANES是一项具有全国代表性的横断面研究,由国家卫生统计中心(NCHS)负责管理。调查方案获得了NCHS研究伦理审查委员会的批准,所有参与者均签署了知情同意书。本研究遵循《赫尔辛基宣言》和《伊斯坦布尔宣言》的原则,并获得了温州医科大学附属第一医院伦理委员会的批准(批准号:2016–246,2016年12月1日),每位参与者均签署了书面知情同意书。

第一组数据包括20172018年NHANES调查中接受FibroScan检查的5494名个体。在进行以下排除后,共有2677名参与者被纳入分析,其中包括718名非酒精性脂肪性肝病(NAFLD)患者和1959名非NAFLD个体。这些参与者随后被随机分为训练集(n = 1785)和测试集(n = 892)。第二组数据来自温州医科大学附属第一医院感染科(2018–2020年)的582名个体。在应用相同的排除标准后,共纳入200名个体,其中包括159名NAFLD患者和41名非NAFLD个体。该队列被用作独立验证集。本研究设计旨在利用多中心数据构建并验证模型,从而提高研究结果的可靠性和普适性。NAFLD组与非NAFLD组的基线临床特征通过table one软件包进行总结(表1)。此外,患者筛选过程及整体研究流程如 图1 所示。

非酒精性脂肪性肝病的诊断标准与排除标准

非酒精性脂肪性肝病(NAFLD)的诊断依据如下标准16:年龄≥18岁,接受瞬时弹性成像(FibroScan)筛查,且在既往12个月内饮酒量限制在女性≤140 g/周、男性≤210 g/周;使用FibroScan 502 V2 Touch系统(Echosens,法国巴黎)配备中等(M)或超大(XL)探头测得的受控衰减参数(CAP)值≥302 dB/m;或经温州医科大学附属第一医院感染科肝活检病理确诊23

非酒精性脂肪性肝病(NAFLD)的排除标准如下所述:.高酒精摄入量(每日平均摄入量 > 女性20克 > 男性每日30克,依据NHANES酒精使用调查5乙型或丙型肝炎、HIV感染、自身免疫性肝炎、原发性胆汁性胆管炎、威尔逊病、长期使用非甾体抗炎药、钙通道阻滞剂、他莫昔芬、胺碘酮、糖皮质激素、异烟肼或甲氨蝶呤、妊娠或哺乳期,以及肝癌或其他任何良性或恶性肿瘤的诊断。

数据收集与变量选择

本研究中包含的潜在预测变量如下所列:

人口统计学特征(即年龄和性别);体重指数(BMI);NHANES 数据库中参与者的 CAP 值;常规生化检测指标[即白蛋白(ALB)、球蛋白(GLO)、总蛋白(TP)、乳酸脱氢酶(LDH)、血尿素氮(BUN)、尿酸(UA)、γ-谷氨酰转移酶(GGT)、甘油三酯(TG)、血清葡萄糖(Glu)、血清肌酐(SCr)、总胆红素(TBIL)、钠离子(Na⁺)、氯离子(Cl⁻)、钾离子(K⁺)、钙(Ca)、碳酸氢盐(HCO₃)、总胆固醇(TC)、天冬氨酸氨基转移酶(AST)和丙氨酸氨基转移酶(ALT)];标准血液学参数[即红细胞计数(RBC)、白细胞计数(WBC)、中性粒细胞计数(NEUT)、嗜酸性粒细胞计数(EOS)、淋巴细胞计数(LYM)、单核细胞计数(MON)、红细胞分布宽度(RDW)和血小板计数(PLT)];高血压和糖尿病(DM)病史。本研究纳入对象中,糖尿病和高血压的诊断标准源自一项先前针对非酒精性脂肪性肝病(NAFLD)的基于机器学习的预测模型研究24

缺失数据处理与特征选择

本研究使用的队列数据包含缺失值。若排除所有不完整的记录,不仅会减小分析样本量,还可能降低数据质量,并导致预测结果出现偏倚。因此,缺失值超过20%的数据被予以剔除。对于缺失值≤20%的数据集,则根据数据类型采用不同的填补方法:连续型变量使用"norm"方法,二分类变量使用"logreg"方法,多分类变量使用"polyreg"方法。上述填补通过R语言中的"mice"包进行多重填补25。在本研究中,所有连续型变量均被二分化为二分类变量,最优分类阈值通过受试者工作特征(ROC)曲线分析确定。具体而言,选取ROC曲线上对应最大约登指数(Youden Index)的截断点作为最优分类标准,从而在灵敏度与特异性之间保持适当平衡的同时优化分类性能。随后,采用偏最小二乘判别分析(PLS-DA)对数据进行有效聚类。

为进一步进行特征筛选,使用 "caret" 软件包将个体以 7:3 的比例随机分配至训练集和测试集。首先,采用最小绝对收缩与选择算子(LASSO)回归进行特征筛选,共识别出 14 个关键变量用于后续分析。随后,应用 ChatGPT-4 为每个变量分配重要性评分。为在控制潜在偏差和随机变异的同时系统评估特征重要性,实施了标准化评估流程。提供给模型的具体提示为:"基于现有非酒精性脂肪性肝病(NAFLD)临床文献,对通过 LASSO 回归识别出的以下 14 个变量中的每一个赋予 1(最低)至 10(最高)的重要性评分"。通过将评估严格限制在 LASSO 回归预先筛选出的变量范围内,最大限度降低了引入虚构或无关特征的风险。为严格防止潜在的数据泄露和无意中使用结局事件发生率,语言模型完全未接触实际数据集,评分过程仅基于变量名称所对应的已有医学知识进行综合判断。该方法通过确保纯数据驱动的特征在最终模型整合前具备充分的病理生理学合理性,从而增强了传统方法(如 LASSO 稳定性选择或基于 SHAP 的剪枝)的可靠性。此外,为降低单次响应的方差,该过程独立重复了 10 次,计算每个变量在各轮次中的平均评分,以实现客观的优先级排序。随后,变量按其平均评分从高到低排序。最终,筛选范围进一步缩小至仅包含平均重要性评分超过 5 的变量,共得到 8 个关键变量:SCr、UA、GGT、Glu、Hypertension、Diabetes、TG 和 BMI。

基于 AutoML 的非酒精性脂肪性肝病预测模型的开发

本研究利用 H2O AutoML 集成了一系列经典与先进的机器学习算法,用于非酒精性脂肪性肝病(NAFLD)的有效诊断。通过采用 H2O.ai 平台的 AutoML 功能,开展了针对二分类任务的机器学习分析。所使用的算法包括极端梯度提升(XGBoost)、梯度提升机(GBM)、广义线性模型(GLM)、极度随机树(XRT)、深度学习(DL)以及堆叠集成模型。这些算法经过系统评估,以确定用于疾病诊断的最优模型。为确保方法学的严格可重复性,明确设定了 H2O AutoML 的执行参数:自动搜索过程限制为最长运行时间 11,687 秒,最多生成 302 个模型,并采用固定的随机种子 13。内部预处理选项包括使用均值/众数算法自动填补残余缺失值,以及对高基数分类变量进行目标编码。最终选定的最优模型(标记为 GBM_grid_1_model77)为梯度提升机,其具体超参数如下:共包含 28 棵树,最大树深度为 5,学习率为 0.1。

为增强模型的稳健性并降低过拟合风险,采用了一种结合系统性超参数调优与验证协议的AutoML框架。该过程首先通过超参数优化,自动探索200种不同的模型配置,并采用5折交叉验证,将训练数据集划分为五个互斥的子集。在迭代训练过程中,每种配置使用其中四个子集(80%)进行模型构建,同时保留一个子集(20%)用于验证,并依次在所有折中轮换验证角色。为在计算效率与性能优化之间取得平衡,基于ROC曲线下面积(AUC)指标实施了动态早停机制。当AUC的提升在连续三个周期内低于0.001阈值时,该机制将终止训练,适用于单个模型的优化以及整体AutoML搜索过程。最终模型的选择优先考虑在训练集和验证集上均表现出最高平均AUC的配置,同时要求这些数据集之间的性能保持一致,并在交叉验证迭代中具有最小的指标方差。这一集成方法通过严格的验证协议和自动优化约束,确保了最佳的预测准确性及良好的泛化能力。

模型性能评估与预测结果解读

采用ROC曲线、F1分数和SHapley加性解释(SHAP)分析对模型性能及预测结果的解释性进行了全面评估。首先,利用训练好的模型在测试数据集上生成预测结果,并提取正类(即类别1)的预测概率(pred_prob)。使用pROC包构建ROC曲线,并计算模型的AUC及其95%置信区间。通过Youden's J统计量(J = 灵敏度 + 特异度 − 1)确定ROC曲线上的最优阈值,用于二分类标签的判定。基于该由ROC曲线得出的阈值,将预测概率转换为二分类预测标签(0或1),并据此生成混淆矩阵。利用混淆矩阵函数计算测试集上的F1分数,并生成混淆矩阵的可视化图像并保存。此外,还在一个包含200例独立外部验证数据集(来自温州医科大学附属第一医院)上进一步验证了模型性能。使用“shapviz”包分析SHAP值,以阐明各变量对模型预测结果的影响,从而为个体NAFLD发生风险预测的解释提供依据。

统计学方法

统计分析和软件开发使用 R 4.2.3 版本(R Foundation for Statistical Computing,奥地利维也纳)完成。连续变量首先通过 Shapiro-Wilk 检验或 Q-Q 图的视觉检查评估正态性。符合正态分布的数据以均值 ± 标准差(SD)表示,两组独立样本之间的比较采用独立样本 t 检验。对于多组比较,视情况采用单因素方差分析(one-way ANOVA),并辅以事后 Tukey’s HSD 检验。非正态分布的连续数据以中位数 [四分位距(IQR),P25–P75] 汇总,两组独立样本的比较采用 Mann-Whitney U 检验,多组比较则采用 Kruskal-Wallis 检验,必要时进行 Dunn 事后检验。分类变量以频数和百分比(%)表示,组间比例的比较采用卡方检验(χ2 检验),当预期单元格频数小于 5 时使用 Fisher 精确检验。检验水准设为 α = 0.05(双侧),p 值 < 0.05 被认为具有统计学显著性。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

非酒精性脂肪性肝病的临床特征

本研究系统分析了非酒精性脂肪性肝病(NAFLD)患者与非NAFLD个体的临床特征。采用多种方法清晰展示了这些特征在样本人群中的分布及差异(表1)。共纳入2,677名个体进行分析,其中718名为NAFLD患者。分析涵盖多种临床指标,包括BMI、TG、GGT、UA及其他指标(如图1所示)。通过对临床和代谢变量进行偏最小二乘判别分析(PLS-DA),发现NAFLD组与非NAFLD组之间存在显著分离(图2A),表明这些临床特征在区分NAFLD与非NAFLD方面具有关键作用。此外,热图(图2B)显示,NAFLD组在多个临床和生化参数上存在显著偏离,包括白细胞计数(WBC)、中性粒细胞计数(NE)、单核细胞计数(MO)、红细胞计数(RBC)、UA、GGT、ALT、AST、TG、BMI和血糖(GLU)。这些异常在NAFLD...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

非酒精性脂肪性肝病(NAFLD)是全球最常见的慢性肝病病因,其患病率每年约上升1%26。全球约有30%的人口受其影响,使NAFLD不仅成为最主要的慢性肝病,也成为肝移植增长最快的适应证之一3 自动化机器学习(AutoML)已成为医学领域的一项重要工具,其主要目标之一是通过识别输入特征之间的相关性来构建预测模型。越来越多的研究表明,机器学习在开发脂肪肝疾病的诊断模型方面具有巨大潜力5。本研究有效利用了AutoML技术,建立了NAFLD的诊断模型。

通过对NHANES 2017–2018数据集应用严格的诊断和排除标准,我们将参与者分层为明确定义的非酒精性脂肪性肝病(NAFLD)组和非NAFLD组。比较分析显示,NAFLD组不仅在传统代谢指标(UA、GGT、ALT、AST、TG)方面显著升高,而且在血液学参数(WBC、NEUT、MON、RBC)方面也明显升高,揭示了在肝功能障碍的同时存在明显的全身性炎症和血液学...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在利益冲突。在本研究中,ChatGPT-4(OpenAI)在特征选择阶段被用作智能分析工具,以评估LASSO回归所识别变量的临床相关性。所有由人工智能生成的评分均经过作者仔细审查,并通过后续的AutoML流程进行了实证验证。ChatGPT-4未被用于修改原始数据或执行数学计算。作者对最终结果的完整性与准确性承担全部责任。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本工作由 福建医科大学科研启动基金 [2021QH1176]、浙江省临床检验诊断与转化研究重点实验室 [2022E10022]、浙江省医药卫生科技计划项目 [2024KY1265] 以及温州市基本公益科研项目 [Y2023096] 资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
非酒精性脂肪性肝病数据集(2017–2018)NHANES数据库 [https://wwwn.cdc.gov/nchs/nhanes/continuousnhanes/default.aspx?BeginYear=2017]N/A作为模型构建的训练集
非酒精性脂肪性肝病数据集(2018–2020)中国温州医科大学附属第一医院(2018–2020)[https://doi.org/10.6084/m9.figshare.32105248.]N/A作为模型外部验证的测试集
R(版本 4.2.3)R统计计算基金会N/A与其他工具结合使用,用于数据分析以及生成可视化和图形展示
Adobe Illustrator 2025(版本 29.2)Adobe Systems IncorporatedN/A用于图像排版与编辑
ChatGPT-4OpenAI Inc.N/A为每个选定变量分配重要性评分
H2O AutoML(3.44.0.3)H2O.aiN/A用于集成一整套机器学习算法

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

233 JoVE

相关文章