本研究介绍了基于深度学习的工作流程,利用预处理的眼底图像和优化的卷积神经网络架构,实现准确的疾病分类和可解释的病灶定位,实现可扩展的临床应用。
方法文章
本研究介绍了基于深度学习的工作流程,利用预处理的眼底图像和优化的卷积神经网络架构,实现准确的疾病分类和可解释的病灶定位,实现可扩展的临床应用。
糖尿病视网膜病变(DR)是全球视力丧失的主要原因之一,尤其是在糖尿病控制不佳的患者中。通过自动化图像分析实现早期检测已成为支持及时干预的可扩展解决方案。基于深度学习的模型,尤其是卷积神经网络(CNN),在通过视网膜眼底图像检测DR方面展现出显著前景。本研究旨在(i)开发一个使用EfficientNetB0和DenseNet121进行五阶段DR分类的集成深度学习框架,(ii)系统评估眼底图像预处理对诊断表现的影响,(iii)结合基于Grad-CAM的视觉解释病灶定位,(iv)实现高诊断准确性和计算效率,适合可扩展筛查。整理了一个包含EyePACS、APTOS 2019及中国三级护理中心53,412张眼底图像的数据集。预处理步骤包括对比限制自适应直方图均衡(CLAHE)、伪影去除和归一化。迁移学习采用了EfficientNetB0和DenseNet121骨干,随后采用混合组装。模型采用准确率、宏观AUC、敏感度、特异性和F1评分进行评估。采用Grad-CAM技术观察病灶定位。混合集合模型实现了91.2%的准确率,0.961宏观AUC,92.1%的灵敏度,F1得分为0.913。预处理性能提升了3-4%,集合方法优于独立CNN。Grad-CAM叠加验证了病灶定位的准确性。模型性能评估了五阶段DR分级和二元可转诊DR检测,以反映临床筛查需求。本研究提出了一种临床可行且可解释的深度学习模型用于DR检测。未来工作将包括对独立数据集进行外部验证、前瞻性的真实世界评估,以及针对移动和现场筛查应用的模型优化(如剪枝和量化)。
DR是糖尿病的一种微血管并发症,仍然是全球可避免视力障碍的主要原因之一。慢性高血糖会损伤视网膜毛细血管,导致血管通透性增加、微动脉瘤形成、出血、渗出物,并在晚期出现新生血管增生。若不及时干预,这些变化可能进展为玻璃体出血、牵引性视网膜脱离及不可逆视力丧失1,2。流行病学研究估计,约35%的糖尿病患者表现出某种程度的DR,其中近10%每年发展为视力威胁视网膜病变。全球趋势表明,过去二十年里DR的患病率大幅上升。一项具有里程碑意义的荟萃分析报告显示,DR患病率从2000年代初的13.6%上升到2020年超过20%。同样,视力威胁的DR和糖尿病黄斑水肿的发病率也呈上升趋势,尤其是在中低收入地区3。农村和经济弱势地区眼科筛查服务的有限可及性导致诊断和治疗延迟5.
早期发现DR至关重要,因为在非增生阶段进行干预,如局部或全视网膜激光光凝、玻璃体内抗血管内生长因子(抗VEGF)治疗以及玻璃体切除术,可以有效预防视力下降的进展。然而,传统筛查项目通常依赖受过培训的专家手工调色彩色眼底照片,这一资源密集的过程限制了扩展性和及时覆盖5。远程眼科项目已部分弥补了这些空白,但仍依赖有限的专家资源和标准化的影像协议。人工智能(AI),尤其是深度学习(DL)的进步,带来了能够高精度快速地检测和分级眼底图像DR的自动化解决方案。CNN提取微动脉瘤、出血和渗出物等层级特征,并在基准数据集8,9中已实现超过90%的敏感性和特异性。Gulshan 等人和 Ting 等人的里程碑式研究表明,DL 算法在识别可引用的 DR 方面能够匹敌甚至超越专家评分者,为自主筛查系统的监管批准铺平了道路 8,9。后续工作探索了迁移学习、集合建模和混合CNN循环神经网络架构,以提升在不同影像状况和患者群体中的泛化能力(10,11)。
尽管取得了这些有希望的结果,但基于DL的DR筛查的临床转化仍存在诸多挑战。首先,稳健的性能需要大型且注释良好的数据集,以捕捉成像设备、种族和疾病表现的变异性12.评分者间的注释不一致进一步复杂化了模型训练和评估。其次,图像预处理步骤如通过CLAHE增强对比度、降噪和色彩归一化,显著影响细微病变的可见度,进而降低特征提取的可靠性13。第三,模型可解释性仍是一个活跃的研究领域;临床医生需要透明的决策支持工具,突出驱动算法预测的显著图像区域14.最后,需要监管框架和成本效益分析,指导AI工具融入现有筛查路径,尤其是在资源有限的环境中15。本研究通过提出一个全面的深度学习框架来应对这些挑战,该框架整合了眼底图像的优化预处理、先进的卷积神经网络架构和迁移学习策略。我们采用CLAHE和自动伪影去除以增强病灶对比,随后对预训练的CNN骨架进行微调,以利用大尺度自然图像特征。因此,本研究提出了一种可解释的深度学习框架,用于早期DR检测,将优化的眼底图像预处理与高效的集成卷积神经网络架构(见图1)整合在一起。本研究的主要贡献包括系统评估预处理策略、设计计算高效混合集合,以及引入视觉可解释性以支持临床解释。通过将准确性、透明度和可部署性结合起来,本研究旨在推动AI辅助DR筛查的实际应用性。DR通过五个临床定义的阶段进行:无DR、轻度、中度、重度非增殖DR和增殖DR。早期阶段表现为微动脉瘤和轻微出血,晚期则伴有广泛血管损伤、新生血管形成及视力丧失风险。症状通常在晚期阶段才出现,因此自动化筛查对于早期干预至关重要。

图1:手稿中作品的图形表示 请点击此处查看该图的放大版本。
为应对这些挑战,本研究提出了一种结构化的深度学习DR检测协议,将标准化的眼底图像预处理、优化的卷积神经网络训练和可解释的模型输出整合在统一的工作流程中。该协议旨在通过明确说明预处理策略、模型架构和训练配置,提高可重复性和方法论透明度。通过强调计算高效的轻量级集合并结合基于Grad-CAM的视觉解释,所提出的方法定义了一个实用且可解释的框架,旨在实现异构多中心视网膜成像数据集间的一致评估。
访问受限。请登录或开始试用以查看此内容。
本研究采用回顾性分析。根据机构和国家法规,因未访问或使用可识别的患者信息,因此放弃了伦理委员会的正式批准和知情同意。
1. 数据来源与获取

图2:代表性彩色眼底照片,展示了糖尿病视网膜病变的不同阶段。请点击此处查看该图的放大版本。
2. 预处理(CLAHE、归一化、伪影去除)
3. 模型架构(CNN变体,优化层)
4. 模型训练与优化(迁移学习、超参数)
5. 评估指标与验证(AUC、准确性、敏感性/特异性)
访问受限。请登录或开始试用以查看此内容。
数据集摘要与预处理效应
该精选数据集包含53,412张彩色眼底图像,分布在五个DR严重程度类别:无DR(0)- 39.2%,轻度(1) - 18.4%,中度(2)- 22.5%,重度(3)- 12.1%,以及增殖DR(4)- 7.8%。数据来源于EyePACS、APTOS 2019及中国三级眼科中心,确保了族群、成像条件和相机规格的多样性。
预处理显著提升了病灶的可见性。在绿色通道上施用CLAHE改善了局部对比,尤其是在微动脉瘤和出血方面。通过遮罩和阈值去除背景伪影,成功消除了超过94%的黑色边框和照明光晕。归一化实现了数据集间像素强度分布一致,减少了设备间的变异性。
数据增强通过翻转、旋转、缩放和亮度/对比度抖动,使训练集大小增加了3.5×。这一步对于提升模型泛化和减少训练中的过拟合至关重要。
访问受限。请登录或开始试用以查看此内容。
本研究开发并严格评估了一个混合集合模型,结合了EfficientNetB0和DenseNet121,通过迁移学习微调,并辅以经典预处理步骤、CLAHE、伪影去除和强度归一化,用于五类DR分级。该集合表现出色:准确率91.2%,巨量AUC 0.961,F₁分数0.913,灵敏度92.1%,如第6节报告。这些指标显著优于基线CNN(准确率~83.4%,宏AUC ~0.88)以及单独骨干模型,如ResNet50、EfficientNetB0和DenseNet121。我们的结果与Gulshan等人的里程碑式研究相比更为有利。 JAMA报告了EyePACS和Messidor2可参考DR检测的AUC ≈ 0.99,使用十个基于InceptionV3的CNN训练,训练于超过128,000张图像,人类水平的灵敏度和特异度为16。虽然我们的混合模型未能达到此级别的判别,但它使用更少的参数,收敛速度更快(从零训练时>通常为30个纪元),且部署更为简便。同样,Chetoui和Akhloufi证明,Effici...
访问受限。请登录或开始试用以查看此内容。
作者们确认他们没有任何财务利益冲突。
该工作得到了2024温州基础研究项目的支持。(拨款编号:Y20240360)
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Fundus Camera(Topcon、佳能、蔡司) | Topcon / 佳能 / 蔡司 | 用于在不同照明条件下拍摄高分辨率彩色眼底照片 | |
| NVIDIA 特斯拉 V100 GPU | 英伟达公司 | 特斯拉V100 | 32 GB 显存;用于训练深度学习模型 |
| Python(OpenCV,imgaug 库) | 开源社区 | 图像预处理包括CLAHE、伪影去除、归一化、增强 | |
| TensorFlow 2.10 + Keras | 谷歌大脑 | 用于CNN模型构建和训练的深度学习框架 | |
| 高效NetB0 &DenseNet121 预训练骨干 | 开源(TensorFlow/Keras 应用) | 用于灾难复原分类的迁移学习骨干在ImageNet上预训练 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可