$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El cáncer de pulmón sigue siendo uno de los principales tipos de cáncer, lo que provoca graves problemas de salud, a menudo conduciendo a la muerte1. La radiómica permite la caracterización cuantitativa de imágenes médicas extrayendo grandes conjuntos de características que describen la forma, textura e intensidad del tumor 2,3. Estas características, también denominadas características artesanales, sirven como posibles biomarcadores para el diagnóstico, el pronóstico y la respuesta al tratamiento del cáncer de pulmón. Sin embargo, los conjuntos de datos de radiología suelen ser de alta dimensión y limitados por muestras, lo que conduce a características redundantes y ruidosas que degradan el rendimiento delmodelo 4,5,6,7. Por tanto, una selección eficiente y explicable de características es crucial para desarrollar modelos predictivos robustos basados en radiología.
Los enfoques tradicionales de selección de características, como los métodos de filtrado (por ejemplo, análisis de correlación, análisis de varianza [ANOVA], información mutua) y métodos de envoltura (por ejemplo, selección secuencial de características, eliminación recursiva de características) se utilizan ampliamente para modelos de detección de cáncer basados en radiología 4,8,9. Sin embargo, a menudo no logran captar interacciones de características no lineales y dependencias contextuales profundas inherentes a los datos deradiómica 9,10,11. Se han explorado técnicas de aprendizaje de características en conjunto para la clasificación de imágenes médicas, pero han alcanzado una precisión moderada, que podría mejorarseaún más 12.
Los métodos de aprendizaje profundo, especialmente las redes neuronales profundas (DNN), han demostrado una capacidad superior para modelar relaciones no lineales y jerárquicas entre características y resultados, lo que los hace ideales para guiar la selección de características y proporcionar modelos precisos de detecciónde cáncer 13,14. En este contexto, se explora el potencial de usar una red neuronal convolucional, técnicas de IA multimodal y VCG-16, un modelo preentrenado para el diagnóstico del cáncer, 1,15,16. Se propuso, entrenó y probó un modelo híbrido de aprendizajeprofundo 17, que incluye el modelo preentrenado VGG-19 y redes de memoria a corto plazo (LSTM), en un gran número de imágenes, logrando una precisión superior al 99%.
Además de la detección del cáncer, también se ha realizado investigación sobre la estadificación del cáncer. Hugo et al.18 diseñaron un modelo de red neuronal feed-forward en la base de datos NSCLC de 300 pacientes para clasificar el cáncer en estadios I, II y III con una precisión del 74,52% en las pruebas del modelo. Se presentó un método de inversiónbayesiana 3 basado en radiografía para la detección en estadio de cáncer de pulmón utilizando el conjunto de datos NLST sobre un tamaño de muestra de 200. El método propuesto alcanzó una precisión del 86%. La revisión bibliográfica ha revelado que la mayoría de los estudios sobre la detección del cáncer se han centrado únicamente en clasificar tumores benignos y malignos, y solo unos pocos han abordado la clasificación en estadio canceroso, con una precisión inferior al 90% que puede mejorarse aún más. Este artículo de investigación aborda la brecha de investigación mencionada y propone un marco robusto de clasificación basada en características radiómicas para una detección precisa en la fase del cáncer de pulmón.
En este estudio se ha introducido un marco de eliminación de características recursivas basado en pérdida de gradiente (GL-RFE), integrando la retropropagación de gradientes desde redes neuronales en el proceso RFE. A diferencia de los métodos convencionales de RFE que se basan en métricas estáticas de importancia de características, GL-RFE aprovecha los gradientes de la función de pérdida respecto a cada característica de entrada para medir cuán fuerte influye cada característica en las predicciones del modelo. Al eliminar iterativamente características con contribuciones mínimas al gradiente, el modelo presentado realiza la selección de características de las 15 principales características diagnósticas optimizadas para la detección en estadio de cáncer de pulmón en 2 clases (etapas I y II combinadas y etapas IIIa y IIIb combinadas). El diagrama de flujo de trabajo realizado se muestra en la Figura 1. El conjunto de datos de cáncer de pulmón elegido para el modelo presentado es NSCLC Radiomics19, que cuenta con 411 volúmenes de formato denominados imagen digital y comunicaciones en medicina (DICOM) con información clínica en estadios del cáncer. Se extraen un total de 106 características de radiómica 3D de cada volumen DICOM para cáncer de pulmón utilizando PyRadiomics20, una extensión de un software de código abierto, 3D Slicer21. Estas características pertenecen a siete clasesde rasgos: 22, incluyendo forma, método de diferencia de niveles de grises (GLDM), matriz de coocurrencia de nivel de grises (GLCM), primer orden, matriz de longitud de recorrido de nivel gris (GLRLM), matriz de zonas de tamaño de nivel gris (GLSZM), matriz de diferencia de tonos de grises vecindario (NGTDM). Los datos de radiómica de la clase minoritaria (etapa I y etapa II) fueron sobremuestreados utilizando la técnica sintética de sobremuestreo de minorías (SMOTE)23.
La novedad del marco propuesto GL-RFE radica en integrar el análisis de sensibilidad basado en gradientes derivado del entrenamiento de redes neuronales en el proceso de eliminación de características recursivas. A diferencia de los enfoques convencionales de RFE que se basan en medidas de importancia estáticas, GL-RFE evalúa dinámicamente la relevancia de características mediante gradientes retropropagados de la función de pérdida. Esto permite identificar características que influyen directamente en las predicciones del modelo para la etapa del cáncer, manteniendo la interpretabilidad y la viabilidad computacional para conjuntos de datos médicos relativamente pequeños.
El conjunto de datos empleado para el entrenamiento y la prueba del marco propuesto es un conjunto de datos de imágenes de TC disponible públicamente con 422 pacientes con cáncer de pulmón, conocido como NSCLC Radiomics17. Para cada paciente, el conjunto de datos incluye un volumen de TAC y un conjunto de estructuras de radioterapia DICOM (RTSTRUCT) y un archivo de segmentación DICOM (SEG). Estos archivos contienen delimitaciones manuales realizadas por un oncólogo radioterápico del volumen tridimensional del volumen macroscopo primario del tumor (GTV-1), así como de la imagen pulmonar. El conjunto de datos es un conjunto preprocesado, y las dimensiones de las imágenes son 512 x 512 píxeles.
Debido a la naturaleza no lineal de las características radiómicas hechas a mano, estas características no pueden usarse directamente con modelos de aprendizaje profundo para el diagnóstico del cáncer, y sus patrones de datos inherentes deben capturarse mediante técnicas de IA. GL-RFE clasifica las características en función de la magnitud del gradiente de pérdida del modelo L respecto a cada característica de entrada xi.
Para cada característica de entrada xi, el gradiente absoluto medio se calcula de la siguiente manera:
(1)
Aquí, N es el número total de muestras. Lj es la pérdida para la jmuestra ésima de la muestra. xIJ es la i-ésima característica de la jésima muestra.
representa la sensibilidad de la pérdida respecto a la característica de entrada.
Las características con magnitudes de gradiente bajo tienen un impacto mínimo en las actualizaciones del modelo y se eliminan recursivamente. El flujo de trabajo propuesto para eliminar las características radiómicas de bajo gradiente utilizando un perceptrón multicapa (MLP) y entrenar una red neuronal de aprendizaje profundo (DNN) sobre las 15 características principales se muestra en la Figura 1. A continuación, se evalúa el rendimiento del método GL-RFE para la selección de características.
El modelo de aprendizaje profundo mencionado con el método GL–RFE está implementado en un Jupyter notebook en Google Colab, que permite escribir y ejecutar código Python en un entorno online. Es necesario descargar diferentes paquetes, incluidos en los pasos del protocolo y en los materiales, para compilar el código. Utilizando el método descrito en la sección de Protocolos, se identifican las 15 principales características radiómicas para la detección del cáncer de pulmón y se utilizan para lograr una detección precisa del cáncer en conjuntos de datos de prueba.