La retinopatia diabetica (DR) è una delle principali cause di perdita della vista a livello globale, in particolare tra i pazienti con diabete poco controllato. La rilevazione precoce tramite analisi automatica delle immagini si è affermata come una soluzione scalabile per supportare interventi tempestivi. I modelli basati sul deep learning, in particolare le reti neurali convoluzionali (CNN), hanno mostrato un significativo potenziale nel rilevamento della DR da immagini del fondo della retina. Questo studio mirava a (i) sviluppare un framework di deep learning in ensemble utilizzando EfficientNetB0 e DenseNet121 per la classificazione DR in cinque stadi, (ii) valutare sistematicamente l'impatto della pre-elaborazione delle immagini del fondo sul fondo sul rendimento diagnostico, (iii) incorporare spiegazioni visive basate su Grad-CAM per la localizzazione delle lesioni, e (iv) ottenere un'elevata accuratezza diagnostica con efficienza computazionale adatta a screening scalabile. È stato curato un dataset comprendente 53.412 immagini del fondo di fondo da EyePACS, APTOS 2019 e un centro di cure terziari in Cina. I passaggi di preprocessing includevano l'equalizzazione adattativa dell'istogramma limitato a contrasto (CLAHE), la rimozione di artefatti e la normalizzazione. L'apprendimento per trasferimento è stato applicato utilizzando le backbone EfficientNetB0 e DenseNet121, seguito dall'assemblaggio ibrido. I modelli sono stati valutati utilizzando accuratezza, macro-AUC, sensibilità, specificità e punteggio F1. Grad-CAM è stato utilizzato per visualizzare la localizzazione delle lesioni. Il modello ibrido ensemble ha raggiunto una precisione del 91,2%, un macro-AUC di 0,961, una sensibilità del 92,1% e un punteggio F1 di 0,913. Il preprocessing ha migliorato le prestazioni del 3-4%, e l'approccio di ensemble ha superato le CNN standalone. Le sovrapposizioni Grad-CAM hanno confermato una localizzazione accurata delle lesioni. Le prestazioni del modello sono state valutate sia per la valutazione DR in cinque stadi sia per la rilevazione binaria di DR per riflettere i requisiti di screening clinico. Questo studio presenta un modello di deep learning clinicamente valido e spiegabile per il rilevamento della DR. I lavori futuri includeranno la validazione esterna su dataset indipendenti, valutazioni prospettiche nel mondo reale e ottimizzazione dei modelli (ad esempio, potatura e quantizzazione) per applicazioni di screening mobile e di punto di cura.