Method Article

Marco robusto de aprendizaje profundo para la detección temprana de retinopatías diabéticas utilizando imágenes preprocesadas del fondo de ojo y CNN optimizadas

DOI:

10.3791/69901

March 24th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta y describe un flujo de trabajo basado en aprendizaje profundo para la detección temprana de la retinopatía diabética utilizando imágenes preprocesadas del fondo de ojo y arquitecturas optimizadas de redes neuronales convolucionales, permitiendo una clasificación precisa de la enfermedad y una localización explicable de lesiones para una aplicación clínica escalable.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La retinopatía diabética (RD) es una de las principales causas de pérdida de visión a nivel mundial, especialmente entre pacientes con diabetes mal controlada. La detección temprana mediante análisis automatizado de imágenes ha surgido como una solución escalable para apoyar la intervención oportuna. Los modelos basados en aprendizaje profundo, especialmente las redes neuronales convolucionales (CNN), han mostrado un potencial significativo en la detección de la RD a partir de imágenes del fondo de la retina. Este estudio tenía como objetivo (i) desarrollar un marco conjunto de aprendizaje profundo utilizando EfficientNetB0 y DenseNet121 para la clasificación de DR en cinco etapas, (ii) evaluar sistemáticamente el impacto del preprocesamiento de imágenes del ojo ocular en el rendimiento diagnóstico, (iii) incorporar explicaciones visuales basadas en Grad-CAM para la localización de lesiones, y (iv) lograr una alta precisión diagnóstica con eficiencia computacional adecuada para un cribado escalable. Se curó un conjunto de datos que comprende 53.412 imágenes del fondo de fondos de EyePACS, APTOS 2019 y un centro de atención terciaria en China. Los pasos de preprocesamiento incluyeron la ecualización adaptativa de histogramas limitados por contraste (CLAHE), la eliminación de artefactos y la normalización. El aprendizaje por transferencia se aplicó usando los backbones EfficientNetB0 y DenseNet121, seguido del ensamblaje híbrido. Los modelos se evaluaron utilizando precisión, macro-AUC, sensibilidad, especificidad y puntuación F1. Se utilizó Grad-CAM para visualizar la localización de la lesión. El modelo híbrido en conjunto alcanzó una precisión del 91,2%, una macro-AUC de 0,961, una sensibilidad del 92,1% y una puntuación F1 de 0,913. El preprocesamiento mejoró el rendimiento en un 3-4%, y el enfoque de conjunto superó a las CNN independientes. Las superposiciones Grad-CAM confirmaron la localización precisa de las lesiones. El rendimiento del modelo se evaluó tanto para la clasificación de DR en cinco etapas como para la detección binaria de DR referible para reflejar los requisitos de cribado clínico. Este estudio presenta un modelo de aprendizaje profundo clínicamente viable y explicable para la detección de DR. El trabajo futuro incluirá validación externa de conjuntos de datos independientes, evaluación prospectiva del mundo real y optimización de modelos (por ejemplo, poda y cuantización) para aplicaciones móviles y de cribado en puntos de atención.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La RD es una complicación microvascular de la diabetes mellitus y sigue siendo una de las principales causas de deterioro visual evitable en todoel mundo. La hiperglucemia crónica induce daños en los capilares retinianos, lo que conduce a un aumento de la permeabilidad vascular, formación de microaneurismas, hemorragias, exudados y, en etapas avanzadas, proliferación neovascular. Sin intervención oportuna, estos cambios pueden progresar a hemorragia vítrea, desprendimiento de retina por tracción y pérdida de visiónirreversible 1,2. Los estudios epidemiológicos estiman que aproximadamente el 35 por ciento de las personas con diabetes presentan algún grado de RD, y casi un 10 por ciento desarrolla retinopatía que amenaza la visión cadaaño. Las tendencias globales indican que la prevalencia de la DR ha aumentado sustancialmente en las dos últimas décadas. Un metaanálisis histórico reportó un aumento en la prevalencia de DR del 13,6 por ciento a principios de los 2000 a más del 20 por ciento en 20202. De manera similar, la incidencia de DR potencialmente visual y edema macular diabético ha mostrado una trayectoria ascendente, especialmente en regiones de ingresos bajosy medios 3. El acceso limitado a servicios de cribado oftalmológico en zonas rurales y económicamente desfavorecidas contribuye a un diagnóstico y tratamientoretrasados 5.

La detección precoz de la DR es fundamental, ya que intervenciones durante las etapas no proliferativas, como la fotocoagulación láser focal o pan-retiniana, la terapia intravítrea con factores antivasculares de crecimiento endotelial (anti-VEGF) y la vitrectomía, pueden prevenir eficazmente la progresión hacia la pérdidavisual 6. No obstante, los programas convencionales de cribado suelen depender de la gradación manual de fotografías en color del ojo de ojo por especialistas formados, un proceso intensivo en recursos que limita la escalabilidad y la coberturaoportuna 5. Las iniciativas de teleoftalmología han abordado parcialmente estas carencias, pero aún dependen de la disponibilidad limitada de expertos y de protocolos de imagen estandarizados 7. Los avances en inteligencia artificial (IA), especialmente en aprendizaje profundo (DL), han introducido soluciones automatizadas capaces de detectar y calificar la RD a partir de imágenes del ojo de ojo con alta precisión y rapidez. Las CNN extraen características jerárquicas como microaneurismas, hemorragias y exudados, y han alcanzado sensibilidades y especificidades superiores al 90 por ciento en conjuntos de datos de referencia 8,9. Estudios pioneros de Gulshan et al., y Ting et al. demostraron que los algoritmos DL pueden igualar o superar a los evaluadores expertos en la identificación de DR recomendable, allanando el camino para aprobaciones regulatorias de sistemas autónomosde cribado 8,9. Trabajos posteriores han explorado el aprendizaje por transferencia, el modelado de conjuntos y las arquitecturas híbridas de redes neuronales recurrentes de CNN para mejorar la generalizabilidad en diversas condiciones de imagen y poblaciones de pacientes10,11.

A pesar de estos resultados prometedores, varios desafíos dificultan la traducción clínica del cribado de DR basado en DL. En primer lugar, un rendimiento robusto requiere conjuntos de datos grandes y bien anotados que capturen la variabilidad en dispositivos de imagen, etnias y presentaciones deenfermedades. La inconsistencia de las anotaciones entre los evaluadores complica aún más el entrenamiento y la evaluación del modelo. En segundo lugar, pasos de preprocesamiento de imagen como la mejora de contraste mediante CLAHE, la reducción de ruido y la normalización de color afectan significativamente la visibilidad de lesiones sutiles y, en consecuencia, la fiabilidad de la extracción de características13. En tercer lugar, la interpretabilidad del modelo sigue siendo un área activa de investigación; Los clínicos requieren herramientas transparentes de apoyo a la toma de decisiones que destaquen regiones de imagen salientes que impulsen predicciones algorítmicas14. Por último, se necesitan marcos regulatorios y análisis de coste-efectividad para guiar la integración de herramientas de IA en las vías de cribado existentes, especialmente en entornos con recursoslimitados 15. El presente estudio aborda estos desafíos proponiendo un marco integral de DL para la detección temprana de la recuperación de datos que integra el preprocesamiento optimizado de imágenes del fondo de ojo, arquitecturas CNN de última generación y estrategias de transferencia de aprendizaje. Empleamos CLAHE y la eliminación automática de artefactos para mejorar el contraste de lesiones, seguido de un ajuste fino de esquemas CNN preentrenados para aprovechar características naturales de imagen a gran escala. En consecuencia, este trabajo propone un marco explicable de aprendizaje profundo para la detección temprana de DR que integra el preprocesamiento optimizado de imágenes del ojo de ojo con arquitecturas CNN de conjunto eficientes (Figura 1). Las contribuciones clave de este estudio incluyen una evaluación sistemática de las estrategias de preprocesamiento, el diseño de un conjunto híbrido computacionalmente eficiente y la incorporación de la explicabilidad visual para apoyar la interpretación clínica. Al abordar conjuntamente la precisión, la transparencia y la facilidad de despliegue, este estudio busca avanzar en la aplicabilidad práctica del cribado de DR asistido por IA. La DR avanza a través de cinco etapas definidas clínicamente: Sin DR, Leve, Moderada, DR no proliferativa grave y DR proliferativa. Las fases iniciales se caracterizan por microaneurismas y hemorragias leves, mientras que las fases avanzadas implican daño vascular extenso, neovascularización y riesgo de pérdida de visión. Los síntomas suelen permanecer asintomáticos hasta fases avanzadas, por lo que el cribado automatizado es fundamental para la intervención temprana.

figure-introduction-1
Figura 1: Representación gráfica de la obra presentada en el manuscrito Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Para abordar estos desafíos, este estudio presenta un protocolo estructurado de aprendizaje profundo para la detección de reformas de recuperación de datos que integra preprocesamiento estandarizado de imágenes del oyo de ojos, entrenamiento optimizado de redes neuronales convolucionales y salidas de modelos interpretables dentro de un flujo de trabajo unificado. El protocolo está diseñado para mejorar la reproducibilidad y la transparencia metodológica detallando explícitamente las estrategias de preprocesamiento, la arquitectura del modelo y las configuraciones de entrenamiento. Al enfatizar un conjunto ligero computacionalmente eficiente e incorporar explicaciones visuales basadas en Grad-CAM, el método propuesto define un marco práctico e interpretable destinado a una evaluación consistente entre conjuntos de datos heterogéneos y multicéntricos de imagen retiniana.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio implicó un análisis retrospectivo. De acuerdo con la normativa institucional y nacional, se renunció a la aprobación formal del comité de ética y al consentimiento informado, ya que no se accedió ni utilizó información identificable del paciente.

1. Fuentes de datos y adquisición

  1. Reetiquetar todas las imágenes según la Escala Internacional de Severidad de la Retinopatía Diabética Clínica (ICDR) (Grados 0-4)10, para garantizar la coherencia entre conjuntos de datos obtenidos de EyePACS, APTOS 2019 y la cohorte de atención terciaria.
  2. Mapea las etiquetas originales de conjuntos de datos con anotaciones existentes a la escala ICDR para mantener la uniformidad.
  3. Califiquen de forma independiente todas las imágenes del fondo de ojo realizadas por dos oftalmólogos certificados con experiencia en cribado de RD.
  4. Enmascara completamente a ambos evaluadores respecto a la fuente del conjunto de datos, identificadores de pacientes, historial clínico y predicciones de modelos para minimizar el sesgo de evaluación. Presenta las imágenes en orden aleatorio usando identificadores de archivo anónimos.
  5. Realizar la calificación estrictamente según la Escala de Severidad del ICDR (Grados 0-4).
  6. Cuantifique el acuerdo entre gradadores antes del etiquetado por consenso usando el kappa ponderado de Cohen (κw) con pesos cuadráticos para tener en cuenta la naturaleza ordinal de las calificaciones de severidad de DR.
  7. Interpretar la fuerza de concordancia según los umbrales estándar (κ < 0,20, pobre; 0,21-0,40, regular; 0,41-0,60, moderado; 0,61-0,80, sustancial; > 0,80, casi perfecto). Resuelve las calificaciones discrepantes mediante una revisión conjunta por consenso. Utiliza la calificación consensuada como estándar de referencia final para el entrenamiento y evaluación del modelo.
  8. Antes del entrenamiento del modelo, estandariza todas las imágenes a una resolución uniforme de 512 × 512 píxeles y un espacio de color consistente, y aplica procedimientos de preprocesamiento idénticos para minimizar la variabilidad entre conjuntos de datos derivada de diferencias en dispositivos de cámara, protocolos de adquisición y condiciones de iluminación.
    NOTA: Específicamente, el preprocesamiento consistía en: (i) redimensionamiento de imagen y estandarización RGB, (ii) CLAHE de canal verde para realce de contraste, (iii) eliminación de artefactos de fondo mediante enmascaramiento circular y umbral adaptativo, (iv) normalización de intensidad canal a canal, y (v) reducción de ruido y mejora de bordes usando filtrado gaussiano y enmascaramiento de desenfoque.
  9. Adquirir imágenes del fondo de ojo utilizando múltiples cámaras de fondo de ojo en color comercialmente disponibles (Topcon, Canon y Zeiss) bajo condiciones de cribado clínico rutinario (Figura 2).
  10. Permitir que los parámetros de adquisición de imagen varíen según el dispositivo, pero estandarícelos dentro de rangos típicos de pantalla, incluyendo un campo de visión de 30°-45°, resoluciones nativas de imagen que van desde aproximadamente 2.048 × 1.536 hasta 3.872 × 2.592 píxeles, y una profundidad de color de 24 bits (8 bits por canal RGB).
  11. Utiliza protocolos de imagen tanto midriáticos como no midriáticos para reflejar la práctica real de cribado. Capturar todas las imágenes como fotografías de un solo campo con el fondo de ojo en el centro de la mácula bajo condiciones de iluminación variables, y posteriormente redimensionar y preprocesar las imágenes utilizando una tubería idéntica antes del entrenamiento del modelo (Figura 2).
  12. Anonimizar todas las imágenes antes de su uso, en cumplimiento de las directricesHIPAA 12, 13 y 14.
    NOTA: Utiliza solo una imagen por ojo para evitar sesgos intrasujetos. Excluir imágenes que cumplan o más de los siguientes criterios de calidad predefinidos: (i) mal enfoque o desenfoque que oculta los vasos retinianos y microaneurismas, evaluados por nitidez de bordes y visibilidad del vaso; (ii) desenfoque excesivo de movimiento o desenfoque que afecta a más del 25% del campo retiniano; (iii) pérdida de campo definida como visualización incompleta del disco óptico o región macular; o (iv) artefactos severos de iluminación como saturación o sombras que interferían con la visibilidad de la lesión.
  13. Realizar una evaluación de calidad de forma independiente por dos revisores y resolver cualquier desacuerdo mediante consenso.
    1. Conjunto de datos EyePACS: Utiliza el conjunto de datos EyePACS obtenido de Kaggle. Incluye todas las imágenes de fondo de fondo en color disponibles y conserva las calificaciones de reducción de datos proporcionadas con los metadatos del conjunto de datos.
    2. Conjunto de datos APTOS 2019: Utilice el conjunto de datos APTOS 2019 procedente de Kaggle, que consiste en aproximadamente 3.600 imágenes de fondo de ojo en color de campo único adquiridas bajo condiciones de cribado estandarizadas.
    3. Conjunto de datos clínicos indios: Utiliza un conjunto de datos clínico indio derivado de hospitales compuesto por imágenes en color del fondo de piel. Registrar el recuento total de imágenes y utilizar las calificaciones de RD asignadas por oftalmólogos cualificados como etiquetas de referencia.

figure-protocol-1
Figura 2: Fotografías representativas del fondo de ojo en color que muestran las distintas etapas de la retinopatía diabética. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

2. Preprocesamiento (CLAHE, normalización, eliminación de artefactos)

  1. Emplea una cadena de preprocesamiento de varias etapas para mejorar la visibilidad de las lesiones y reducir la variabilidad debida a las condiciones de imagen.
  2. Redimensiona cada imagen del fondo de color a 512 × 512 píxeles para mantener dimensiones de entrada uniformes en modelos de aprendizaje profundo.
  3. Realizar la mejora del contraste usando CLAHE aplicado exclusivamente al canal verde de cada imagen del fondo de ojos, ya que este canal proporciona un contraste óptimo entre vasos y microaneurismas.
  4. Implementa CLAHE usando la biblioteca OpenCV con un límite de clip de 2.0 para evitar la sobreamplificación del ruido y una cuadrícula de mosaico de 8 × 8 para permitir un realce localizado del contraste en todo el campo retiniano.
  5. Recombina el canal verde procesado con los canales rojo y azul para reconstruir la imagen RGB mejorada. Fija todos los parámetros CLAHE y aplícalos de forma idéntica a todas las imágenes en entrenamiento, validación y conjuntos de pruebas para garantizar la reproducibilidad.
  6. Posteriormente, normalizar las imágenes a media cero y varianza unitaria usando la normalización canal a canal.
  7. Elimina artefactos de fondo como bordes negros y halos de iluminación usando enmascaramiento circular y umbral adaptativo.
  8. Aplica filtrado gaussiano y enmascaramiento de desenfoque para reducción de ruido y preservación de bordes, respectivamente. Aplica el siguiente realce de contraste, filtrado gaussiano para la supresión del ruido: utiliza un núcleo 5 × 5 con una desviación estándar (σ) de 1.0, implementa simétricamente tanto en dirección horizontal como vertical.
    NOTA: Este paso reduce el ruido de alta frecuencia mientras preserva las estructuras vasculares finas.
  9. Realizar enmascaramiento desenfocado mediante la resta de una versión borrosa de la imagen original para realzar los límites de la lesión.
  10. Específicamente, se resta una imagen desenfocada con gaussian (tamaño de núcleo 5 × 5, σ = 1,0) de la imagen original con un peso de nitidez de 1,5, y se suma la imagen de detalle resultante de nuevo a la original para generar el resultado final con nitidez.
  11. Fija todos los parámetros y aplícalos de forma uniforme en todos los conjuntos de datos.
  12. Incluye el preprocesamiento adicional mencionado a continuación para simular la variabilidad real y aumentar los datos de entrenamiento:
    1. Aplica el cambio horizontal aleatorio a cada imagen de entrenamiento con una probabilidad de 0,5 para tener en cuenta la simetría anatómica izquierda-derecha de la retina.
    2. Aplicar volteo vertical aleatorio con una probabilidad de 0,5, asegurando que se represente la variabilidad de orientación comúnmente encontrada durante la adquisición de imágenes del fondo de ojo.
    3. Aplicar rotaciones aleatorias dentro de un rango de -15° a +15°, muestreadas de forma uniforme, con una probabilidad de 0,7 para simular una ligera inclinación de la cámara y el movimiento de la cabeza del paciente.
    4. Aplica zoom aleatorio dentro de un rango de ± 10% del tamaño original de la imagen, con una probabilidad de 0,5, seguido de recorte o relleno en el centro para restaurar la resolución de entrada de 512 × 512 píxeles.
    5. Aplicar ajustes aleatorios de brillo escalando las intensidades de los píxeles dentro de un rango de factores de 0,9 a 1,1, con una probabilidad de 0,4, para modelar la variabilidad de la iluminación entre dispositivos de imagen.
    6. Aplicar ajustes aleatorios de contraste escalando el contraste de la imagen dentro de un rango de factores de 0,9-1,1, con una probabilidad de 0,4, para mejorar la robustez a las diferencias de exposición.
    7. Asegúrese de que todas las mejoras se apliquen solo al conjunto de entrenamiento y se realicen en tiempo real durante el entrenamiento del modelo, mientras que las imágenes de validación y prueba permanecen sin aumentar.
    8. Mantener parámetros de aumento fijos durante todo el entrenamiento para garantizar la reproducibilidad y la exposición constante del modelo a la variabilidad controlada.
  13. Implementa los pasos de preprocesamiento usando OpenCV y librerías de imágenes de Python, y asegura transformaciones consistentes entre conjuntos de entrenamiento y validación.

3. Arquitectura del modelo (variantes CNN, capas optimizadas)

  1. Explora múltiples arquitecturas CNN para la clasificación de DR e investiga las tres variantes de modelos mencionadas a continuación.
    1. CNN de referencia - Una CNN personalizada de 6 capas con normalización por lotes, activación de ReLU, max-pooling y dropout (p = 0,5).
    2. Modelos de Aprendizaje por Transferencia - Esquemas CNN preentrenados incluyendo ResNet50, EfficientNetB0 y DenseNet121, inicializados con pesos ImageNet y ajustados finamente en imágenes DR.
    3. Modelo Híbrido Optimizado - Un modelo conjunto que combina extractores de características de EfficientNetB0 y DenseNet121, seguido de un perceptrón multicapa (MLP) con salida softmax.
    4. Tras el ajuste fino, construye la cabeza de clasificación para cada modelo preentrenado usando una capa global de agrupación promedio, una capa densa con activación de ReLU (512 unidades), una capa de dropout (p = 0,5) y una capa de salida softmax.
    5. Coloca una capa de agrupación de medias globales (GAP) antes del cabezal de clasificación en cada modelo.
    6. Para reducir el sobreajuste, se aplicó regularización de peso L2 a todas las capas totalmente conectadas (densas) en la cabeza de clasificación usando un coeficiente de regularización (λ) de 1 × 10⁻4. Este valor fue seleccionado para proporcionar una penalización efectiva de grandes pesos, preservando al mismo tiempo la convergencia del modelo y el rendimiento de clasificación durante el ajuste fino.
    7. Emplea una función de activación softmax en la capa de clasificación para permitir la predicción de DR de 5 clases.
    8. Bases de las elecciones de diseño del modelo en trabajos previos que demuestran el rendimiento superior de enfoques híbridos y basados en aprendizaje por transferencia en el análisis de imágenesretinianas 3,4.
    9. Utiliza efficientNetB0 y DenseNet121 como extractores de características paralelos en el modelo de ensamblaje híbrido optimizado.
    10. Simultáneamente, alimenta las imágenes del fondo de entrada en ambas esquenas preentrenadas y extrae los mapas finales de características convolucionales tras la capa global de agrupación promedio (GAP) de cada red.
    11. Concatena los vectores de características resultantes para formar una representación unificada y alimentalos en una MLP compuesta por dos capas totalmente conectadas (con activación y eliminación de ReLU) seguidas de una capa de salida softmax para la clasificación de DR de cinco clases.
    12. Adopta esta estrategia de fusión tardía para integrar la eficiencia de características detallada de EfficientNetB0 con la propagación densa de características de DenseNet121, resultando en un rendimiento equilibrado en etapas tempranas y avanzadas de DR.
    13. Aprovecha el MLP para permitir la integración no lineal de representaciones de características complementarias mientras reduces el sobreajuste en comparación con la fusión de extremo a extremo.

4. Entrenamiento y optimización de modelos (aprendizaje por transferencia, hiperparámetros)

  1. Realiza todos los experimentos en una estación de trabajo con Ubuntu Linux (versión 20.04 LTS) y Python 3.8.10.
  2. Implementa modelos de aprendizaje profundo usando TensorFlow 2.10.0 con el backend de Keras y ejecuta en una GPU NVIDIA Tesla V100 (32 GB de VRAM).
  3. Activa la aceleración de GPU usando CUDA Toolkit versión 11.2 y cuDNN versión 8.1, que son compatibles con la versión especificada de TensorFlow.
  4. Implementa todos los pasos de preprocesamiento y aumento de datos usando OpenCV 4.7.0, NumPy 1.23 e imgaug 0.4.0.
  5. Divide el conjunto de datos en conjuntos de entrenamiento (70%), validación (15%) y test (15%), y asegura el equilibrio de clases dentro de cada partición.
  6. Entrena todos los modelos en una GPU NVIDIA Tesla V100 con 32 GB de VRAM.
  7. Aprovecha el aprendizaje por transferencia congelando las capas iniciales de redes preentrenadas y ajustando finamente las capas superiores en imágenes del oyo de ojos.
  8. Inicializa aleatoriamente las capas densas finales y entrena desde cero.
  9. Optimiza los siguientes hiperparámetros:
    Optimizador: Adam con β1=0,9, β2=0,999
    Tasa de aprendizaje: 1 × 10⁻⁴ con el planificador ReduceLROnPlateau
    Tamaño del lote: 32
    Épocas: 50-100 con paradas tempranas (paciencia = 10)
    Función de pérdida: Entropía cruzada categórica
  10. Guarda los puntos de control del modelo basados en la pérdida mínima de validación.
  11. Abordar el desequilibrio de clases aplicando pesos categóricos de clase inversamente proporcionales a la frecuencia de clases durante el entrenamiento.
  12. Aplica la mejora de datos sobre la marcha usando el Keras ImageDataGenerator. Emplear una estrategia de validación cruzada en 5 partes para asegurar la robustez del modelo y minimizar el sesgo de selección. Métricas de rendimiento promedio en todos los pliegues e informan de las desviaciones estándar correspondientes.
  13. Selecciona valores de hiperparámetros basados en las mejores prácticas establecidas en aprendizaje por transferencia para la clasificación de imágenes médicas y validalos mediante experimentos piloto preliminares en el conjunto de validación.
  14. Utiliza el optimizador Adam para su comportamiento de convergencia estable y tasa de aprendizaje adaptativa, y establece una tasa inicial de aprendizaje de 1e−4 para equilibrar la estabilidad del entrenamiento y la velocidad de convergencia durante el ajuste fino.
  15. Determinar empíricamente el tamaño del lote y los criterios de parada temprana para minimizar el sobreajuste manteniendo la eficiencia computacional.

5. Métricas de evaluación y validación (AUC, precisión, sensibilidad/especificidad)

  1. Evalúa el rendimiento del modelo utilizando métricas estándar de clasificación. Realizar una evaluación primaria del conjunto de pruebas de reserva (n ≈ 8.000 imágenes) e informar de resultados tanto para la clasificación de 5 clases como para la clasificación binaria (DR referible vs. DR no referenciable).
  2. Calcula las siguientes métricas:
    Precisión: Porcentaje de predicciones correctas en todas las clases
    Área bajo la Curva Característica de Operación del Receptor (AUC): Calculada para cada clase y promediada (macro AUC)
    Sensibilidad (Recordatorio): Tasa de positivos verdaderos = TP / (TP + FN)
    Especificidad: Tasa de negativo verdadero = TN / (TN + FP)
    Puntuación F1: Media armónica de precisión y recuerdo
    Matriz de confusión: 5 × 5 matriz para análisis de errores de clasificación
  3. Graficar curvas de Característica de Funcionamiento del Receptor (ROC) y curvas de recuerdo de precisión para visualizar la discriminación del modelo.
  4. Genera visualizaciones Grad-CAM (Mapeo de Activación de Clases ponderado por gradiente) para un subconjunto de imágenes clasificadas correctamente e incorrectamente para resaltar las regiones retinianas que impulsan las predicciones del modelo.
    NOTA: El modelo híbrido optimizado logró el mejor rendimiento con una macro AUC de 0,961, una sensibilidad del 92,1%, una especificidad del 89,4% y una precisión global del 91,2% para la detección de DR referenciable.
  5. Compara el rendimiento con los modelos publicados existentes en los mismos conjuntos de datos y evalúa la significación estadística usando pruebas t pareadas y la prueba de McNemar.
  6. Evalúa la significación estadística de las diferencias de rendimiento entre el modelo híbrido de ensamble y las arquitecturas CNN individuales utilizando pruebas t pareadas para métricas continuas (AUC, precisión, puntuación F1) entre pliegues de validación cruzada, y la prueba de McNemar para resultados de clasificación emparejada en el conjunto de pruebas.
    NOTA: El modelo híbrido demostró mejoras estadísticamente significativas respecto a todos los modelos de columna vertebral simple, con valores p < 0,05 en precisión y AUC, confirmando que las mejoras de rendimiento observadas no se debieron a variaciones aleatorias. La precisión es una métrica crítica en el cribado de DR, especialmente para minimizar las predicciones falsas positivas que pueden derivar innecesariamente, ansiedad del paciente y un aumento de la carga sanitaria. La precisión se define como la proporción de casos positivos correctamente predichos entre todos los casos predichos como positivos y se expresa como:
    Precisión=TPTP+FP\texto{Precisión} = \frac{TP}{TP + FP}Precisión=TP+FPTP
    donde TP representa los verdaderos positivos y FP representa los falsos positivos.
  7. En el contexto de la detección de RD, interpretar alta precisión indica que las imágenes clasificadas como DR contienen realmente signos patológicos, mejorando así la fiabilidad de los sistemas automatizados de cribado. Enfatizar que esta métrica es especialmente relevante para el cribado poblacional a gran escala, donde los falsos positivos excesivos pueden saturar los sistemas de derivación. En este estudio, se evalúa la precisión de cada grado de DR así como para la detección binaria de DR referenciable para evaluar la capacidad del modelo para distinguir con precisión casos patológicos de controles sanos.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Resumen del conjunto de datos y efectos de preprocesamiento

El conjunto de datos seleccionado consistió en 53.412 imágenes en color del fondo de ojo distribuidas en las cinco clases de severidad de DR: Sin DR (0) - 39,2%, Leve (1) - 18,4%, Moderada (2) - 22,5%, Grave (3) - 12,1% y DR Proliferativa (4) - 7,8%. Los datos procedían de EyePACS, APTOS 2019 y un centro terciario chino de oftalmología, asegurando diversidad en etnia, condiciones de i...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

En este estudio, desarrollamos y evaluamos rigurosamente un modelo híbrido de conjunto que combina EfficientNetB0 y DenseNet121, ajustado con aprendizaje por transferencia y mejorado con pasos clásicos de preprocesamiento, CLAHE, eliminación de artefactos y normalización de intensidad, para la calificación de DR de cinco clases. El conjunto logró un rendimiento sobresaliente: precisión 91,2%, macroAUC 0,961 y F₁score 0,913 para detección de DR referenciable, y sensibilidad 92,1% según lo...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores afirman que no tienen conflictos de interés financieros.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue apoyado por el Proyecto de Investigación Fundamental de Wenzhou 2024. (Subvención nº: Y20240360)

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Cámara Fundus (Topcon, Canon, Zeiss)Topcon / Canon / ZeissUtilizado para capturar fotografías de fondo de fondo en color de alta resolución bajo condiciones de iluminación variables
NVIDIA Tesla V100 GPUNVIDIA CorporationTesla V10032 GB de VRAM; Utilizado para entrenar modelos de aprendizaje profundo
Python (OpenCV, bibliotecas imgaug)Comunidad de código abiertoPreprocesamiento de imágenes incluyendo CLAHE, eliminación de artefactos, normalización y aumento
TensorFlow 2.10 + KerasGoogle BrainMarco de aprendizaje profundo utilizado para la construcción y entrenamiento de modelos CNN
EfficientNetB0 & Esquenas preentrenadas de DenseNet121Código abierto (TensorFlow/Keras Applications)Backbones de aprendizaje por transferencia preentrenados en ImageNet usados para la clasificación de recuperación de datos

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Cheung, N., Mitchell, P., Wong, T. Y. Diabetic retinopathy. Lancet. 376 (9735), 124-136 (2010).
  2. Yau, J. W. Y., et al. Global prevalence and major risk factors of diabetic retinopathy. Diabetes Care. 35 (3), 556-564 (2012).
  3. Ting, D. S. W., et al. Development and validation of a deep learning system for diabetic retinopathy and related eye diseases using retinal images from multiethnic populations with diabetes. JAMA. 318 (22), 2211-2223 (2017).
  4. Rajalakshmi, R., Subashini, R., Anjana, R. M., Mohan, V. Automated diabetic retinopathy detection in smartphone-based fundus photography using artificial intelligence. Eye. 32 (6), 1138-1144 (2018).
  5. Wilson, C., Horton, M., Cavallerano, J., Aiello, L. P. Telemedicine and diabetic retinopathy: screening and diagnosis. Curr Diabetes Rep. 20 (1), 2(2020).
  6. Early Treatment Diabetic Retinopathy Study Research Group. Photocoagulation for diabetic macular edema. Arch Ophthalmol. 103 (12), 1796-1806 (1985).
  7. Silva, P. S., Cavallerano, J. D., Kwak, H., Aiello, L. M., Aiello, L. P. Potential utility of ultrawidefield imaging for telemedicine diabetic retinopathy screening. Arch Ophthalmol. 129 (3), 279-284 (2011).
  8. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  9. Abràmoff, M. D., Lavin, P. T., Birch, M., Shah, N., Folk, J. C. Pivotal trial of an autonomous AI-based diagnostic system for detection of diabetic retinopathy in primary care offices. NPJ Digit Med. 1, 39(2018).
  10. Zhang, Z., et al. Deep learning for detecting retinal diseases: a survey. Front Neurosci. 15, 703(2021).
  11. Li, Z., et al. An attention-based algorithm for automated diabetic retinopathy grading on color fundus photographs. IEEE Trans Med Imaging. 39 (7), 2501-2512 (2020).
  12. Krause, J., et al. Grader variability and the importance of reference standards for evaluating machine learning models for diabetic retinopathy. Ophthalmology. 125 (8), 1264-1272 (2018).
  13. Hernández, C., et al. Preprocessing of fundus images for automated diabetic retinopathy detection. Med Biol Eng Comput. 58 (2), 243-253 (2020).
  14. Holzinger, A., Samek, W., Müller, H. Evaluating explainable AI: which algorithmic explanations help users predict model behavior? In: Explainable AI: Challenges and Pitfalls. Lecture Notes in Computer Science. 11700, Springer. 3-11 (2019).
  15. Abramoff, M. D., et al. Improved automated detection of diabetic retinopathy on a publicly available dataset through integration of deep learning. Invest Ophthalmol Vis Sci. 57 (13), 5200-5206 (2016).
  16. Chetoui, M., Akhloufi, M. A. Explainable diabetic retinopathy using EfficientNet. Proc IEEE Eng Med Biol Soc. (EMBC). , 1966-1969 (2020).
  17. Chilukoti, S. V., Shan, L., Maida, A. S., Hei, X. A reliable diabetic retinopathy grading via transfer learning and ensemble learning with quadratic weighted kappa metric. BMC Med Inform Decis Mak. 24, 37(2024).
  18. Rasta, S. H., Eisazadeh Partovi, M., Seyedarabi, H., Javadzadeh, A. A comparative study on preprocessing techniques in diabetic retinopathy retinal images: illumination correction and contrast enhancement. J Med Signals Sens. 5 (1), 40-48 (2015).
  19. Grad-CAM: visual explanations from deep networks via gradient-based localization. Selvaraju, R. R., et al. Proc. IEEE Int Conf Comput Vis (ICCV), , 618-626 (2017).
  20. Grzybowski, A., et al. Artificial intelligence for diabetic retinopathy screening: a review. Eye (Lond). 34 (3), 451-460 (2020).
  21. Lee, K. J. Autonomous diabetic retinopathy screening system gains FDA approval. American Academy of Ophthalmology. , (2020).
  22. FDA clears first fully autonomous AI for portable diabetic retinopathy screening. PRNewswire. , AEYE Health. (2024).
  23. Akune, Y., et al. Cost-effectiveness of AI-based diabetic retinopathy screening in nationwide health checkups and diabetes management in Japan: a modeling study. Diabetes Res Clin Pract. 221, 112015(2025).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Diabetic Retinopathy DetectionFundus ImagesDeep LearningConvolutional Neural NetworksImage PreprocessingEfficientNetB0DenseNet121Grad CAM VisualizationEnsemble LearningTransfer Learning

Related Articles