Artículo de investigación

Un enfoque novedoso que utiliza un transformador visual con IA para el análisis de tomografía computarizada para la detección de cáncer de pulmón

DOI:

10.3791/69302

28 de noviembre de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El uso de transformadores de visión en este estudio permite clasificar el cáncer de pulmón a partir de imágenes de TC, logrando una precisión del 98,18% en 1.190 escaneos. El modelo mantuvo un nivel satisfactorio de robustez, con niveles de precisión entre el 80 y el 88 % en imágenes ruidosas y borrosas, frente a modelos estándar de redes neuronales convolucionales (CNN), en aplicaciones de diagnóstico de salud para consumidores.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El diagnóstico del cáncer de pulmón sigue siendo complicado debido a las sutiles diferencias entre enfermedades benignas y malignas en los estudios de imagen. Aunque las redes neuronales convolucionales tradicionales (CNN) han sido la base del análisis de imagen médica, aún tienen una aplicabilidad y robustez limitadas con la variación de métodos de imagen. El avance del aprendizaje automático está transformando los métodos tradicionales de diagnóstico en tecnologías sanitarias orientadas al consumidor, cambiando los procesos de accesibilidad y la atención personalizada al paciente. Este artículo describe el uso de Transformadores de Visión (ViTs) para la clasificación del cáncer de pulmón mediante tomografías computarizadas, asociadas a aplicaciones de salud para consumidores. El modelo Vision Transformer se entrenó con un conjunto de datos completo de 1.190 imágenes CT y alcanzó una tasa de clasificación del 98,18% con un coeficiente de correlación de Matthews de 0,9676. Además, el rendimiento del modelo fue validado en escenarios simulados en tiempo real utilizando ruidos en tiempo real y conjuntos de datos difusos. Aunque conserva los métodos de validación con gran precisión diagnóstica, en todo el conjunto de datos el modelo ViT también superó al método convencional validado al mostrar una precisión entre el 80 y el 88% para diferenciar entre imágenes ruidosas e imágenes borrosas, incluso en estas circunstancias. Aunque los resultados iniciales proporcionan información prometedora sobre la robustez de los ViTs al tratar con variaciones de imagen, debe aplicarse un enfoque cauteloso para contextualizar los resultados, ya que los estudios de evaluación se completaron dentro de un conjunto de datos y entornos de simulación relativamente pequeños. Será valioso para futuros estudios de investigación utilizar conjuntos de datos más amplios que sean más representativos de condiciones clínicas reales y conjuntos de datos clínicamente validados para determinar si las ViT son ventajosas para la identificación clínica del diagnóstico oncológico y para mejorar la detección precoz.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El cáncer de pulmón tiene una carga global considerable, afectando a millones de vidas cada año. Debido a la naturaleza agresiva del cáncer y al frecuente estado de enfermedad de presentación tardía, la mortalidad asociada al cáncer de pulmón es alta. La detección precoz es esencial porque la intervención puede mejorar mucho la eficacia del tratamiento y las tasasde supervivencia. El enfoque convencional para el cribado preliminar y el diagnóstico sigue siendo el uso de tomografía computarizada (TC) para permitir una visualización más detallada de las estructuras pulmonares. Sin embargo, la evaluación de las imágenes de la TC es compleja y depende totalmente de los revisores como radiólogos. La variabilidad tumoral en atributos como tamaño, forma y densidad también mitiga la fiabilidad de cualquier observación humana. Los factores ambientales pueden cuestionar la precisión y la reproducibilidad de la toma de decisiones basadas en el análisis humano.
Teniendo en cuenta estos factores limitantes, la literatura reciente ha impulsado fuertemente la aplicación de la inteligencia artificial (IA) a la imagen médica, con un mayor enfoque en los modelos de aprendizaje profundo (DL). DL, especialmente con las Redes Neuronales Convolucionales (CNN), han alterado el patrón de observaciones en la imagen médica al modificar los análisis delas imágenes 2. Las CNN han mejorado significativamente los procesos diagnósticos en oncología, demostrando la capacidad de identificar características sutiles y complejas en los datos de imagen que a menudo son indistinguibles para el ojo humano. A pesar de estos avances, las CNN se enfrentan a limitaciones como el sobreajuste en conjuntos de datos pequeños, una menor robustez bajo condiciones de adquisición variable y dependencia de campos receptivos locales que pueden pasar por alto dependencias globales. Aunque los enfoques híbridos CNN-Transformer intentan combinar priors convolucionales con mecanismos de atención, aún heredan sesgos de las arquitecturas convolucionales. La Figura 1 muestra algunas instancias del conjunto de datos que muestran diferentes clases.

figure-introduction-1
Figura 1: Ilustración visual de diferentes clases mostrando rebanadas representativas de tomografía computarizada de pulmones normales, benignos y malignos, destacando sus similitudes y diferencias. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Se muestran imágenes representativas de TC para casos normales, benignos y malignos. Aunque la marcada explícita de las regiones discriminativas ayudaría a la interpretación visual, la anotación manual requiere radiólogos expertos y estaba fuera del alcance de este estudio.

Los Transformadores de Visión (ViTs), introducidos originalmente para la clasificación de imagennatural 3, presentan una alternativa prometedora. A diferencia de las CNN o híbridos CNN-Transformer, ViTs emplea un marco totalmente orientado a la atención que captura información contextual global a lo largo de toda una imagen. Este estudio es especialmente relevante para la imagen por TC, donde el carácter difuso e irregular de los atributos tumorales puede extenderse a través de regiones en lugar de limitarse solo a campos receptivos locales. Mientras que las redes híbridas CNN-Transformer estabilizan el sesgo inductivo convolucional, los Vision Transformers (ViTs) implementan una arquitectura completamente basada en la atención, permitiendo al modelo ViT capturar dependencias a largo plazo a lo largo de imágenes TC completas, un beneficio al evaluar atributos tumorales pulmonares difuntos o irregulares.

La aparición de modelos basados en transformadores en el campo de la imagen médica es reciente, con algunos ejemplos en radiología blanda e histopatología,4,5,6 que han mostrado ventajas notables en robustez al ruido, desenfoque y variabilidad entre escáneres en comparación con los sistemas CNN tradicionales, al justificar la ViT en un contexto clínico así sin sobrevalorar la novedad. Dado un enfoque más estricto para la imagen del cáncer de pulmón en comparación con las aplicaciones de consumo en salud, este estudio pretende justificar la practicidad en un área sólida de la medicina basada en la evidencia, situándose al mismo tiempo entre la literatura no del todo abrumadora disponible recientemente sobre transformers y sus aplicaciones. La literatura previa ha demostrado que las precisiones de las modalidades diagnósticas CNN caen drásticamente debido a la variabilidadde adquisición 7, donde el ViT correspondiente funciona mejor con las mismas perturbaciones,8 lo que da credibilidad al concepto de usar un ViT en modalidades de evaluación y presentar una opción para aumentar la reproducibilidad en los flujos de trabajo diagnósticos. Además, cuestiones prácticas, como el tamaño requerido del conjunto de datos, la carga computacional y la generalizabilidad a diferentes entornos clínicos, se plantean claramente en el estudio, utilizando métodos como la ampliación de datos, el aprendizaje por transferencia y las variantes ViTeficientes 9,10 para abordar estos posibles desafíos en el uso real.

Este estudio se basa en este avance implementando ViTs para la estadificación del cáncer de pulmón utilizando datos de imágenes CT y examinando la robustez y generalizabilidad del modelo en presencia de problemas de imagen reales. Los datos de TC pueden incluir artefactos, ruido y desenfoque en una medida común que pueden ocultar características significativas para los clínicos. Al examinar la resiliencia ante estos cambios en la imagen, este estudio pretende ofrecer un marco adicional de estadificación en el que se pueda confiar en la práctica al tomar decisiones relacionadas con el cuidado y el tratamiento.

Las contribuciones de este estudio incluyen: i) detectar específicamente el cáncer de pulmón a partir de imágenes TC en el conjunto de datos IQ-OTH/NCCD mediante el uso y examen del rendimiento de un modelo Vision Transformer; ii) evaluar el rendimiento del modelo en escenarios de imagen clínica del mundo real comunes en los datos de TC, como ruido y borrosidad; iii) comparación de precisión, sensibilidad y especificidad de ViTs como alternativa a los modelos tradicionales de CNN.

La organización del resto de este artículo es la siguiente: la Sección II repasa la revisión bibliográfica que proporciona trabajos previos relacionados con la detección del cáncer de pulmón mediante técnicas de aprendizaje profundo y la progresión de las CNN a arquitecturas más avanzadas como las ViTs. La Sección III presenta el enfoque adoptado para este trabajo, que incluye preprocesamiento de datos, información sobre la arquitectura del modelo y detalles de los procedimientos de entrenamiento. La Sección IV presenta los hallazgos que abordan específicamente las características prescriptivas de las ViTs como método clínico y cómo pueden mejorar la precisión y fiabilidad de los cribados del cáncer de pulmón. La Sección V resume los hallazgos y contribuciones a la práctica y analiza las direcciones futuras en el contexto del aprendizaje profundo en un entorno médico.

TRABAJO RELACIONADO:

El aprendizaje profundo (DL) ha revolucionado la imagen médica durante los últimos diez años, especialmente en el diagnóstico del cáncer de pulmón. Al principio, la disciplina dependía de técnicas convencionales de aprendizaje automático como las Máquinas de Vectores de Soporte (SVMs) y los árboles de decisión, que estaban limitados por la necesidad de características bien construidas y correctamente obtenidas. Estas características manejaban mal las intrincadas imágenes médicas y a menudo inyectaban subjetividad.

Un cambio significativo se produjo con la invención de las Redes Neuronales Convolucionales (CNN), que permitieron extraer automáticamente características jerárquicas de los datos11. Las CNN se han utilizado ampliamente en la estadificación del cáncer basada en tomografías computarizadas, detección de nódulos y clasificación como benignas o malignas. Las CNN tienen éxito, pero tienen limitaciones. Estas incluyen diferencias en los entornos de recopilación de imágenes y la necesidad de grandes conjuntos de datos anotados, que son difíciles de conseguir debido a cuestiones de privacidad y a la naturaleza laboriosa de la anotación médica. La Tabla 112, 13, 14, 15, 16, 17, 18, 19, 20 ofrece un resumen de estudios recientes realizados en el campo del diagnóstico del cáncer de pulmón.

Crasta, Lavina Jean, Rupal Neema y Alwyn Roshan Pais (2024) [20]Presentar un novedoso marco de aprendizaje profundo para la detección y clasificación del cáncer de pulmón utilizando imágenes CT [20].El artículo introduce un 3D-VNet para segmentación y un 3D-ResNet para la clasificación, mostrando mejoras en precisión y robustez respecto a métodos anteriores.
Crasta, Lavina Jean, Rupal Neema y Alwyn Roshan Pais (2024) [20]Presentar un novedoso marco de aprendizaje profundo para la detección y clasificación del cáncer de pulmón utilizando imágenes CT [20].El artículo introduce un 3D-VNet para segmentación y un 3D-ResNet para la clasificación, mostrando mejoras en precisión y robustez respecto a métodos anteriores.

Tabla 1: Resumen de estudios recientes que describen las técnicas utilizadas y el rendimiento reportado para dar contexto.

Al utilizar procesos de autoatención que consideran todo el contexto de una imagen a la vez, los Transformadores de Visión (ViTs) están empezando a emerger como una alternativa competitiva a las CNN en tareas relacionadas con la imagen. Las ViT son especialmente prometedoras para la imagen médica, porque la importancia de algunas regiones puede depender de partes más alejadas de la imagen debido a su capacidad de procesamiento global. Sin embargo, a pesar de su capacidad para manejar tareas complejas como reconocer correlaciones entre numerosos indicadores de enfermedad en las exploraciones, las ViT aún no están bien estudiadas en el campo de la imagen médica.

Las ViT no se han explorado en gran medida en el campo de los dispositivos sanitarios centrados en el consumidor. Este estudio pretende salvar la brecha entre alta precisión y menor latencia para dispositivos sanitarios centrados en el consumidor, donde pueden rendir bien y ofrecer predicciones precisas en tiempo real.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El conjunto de datos incluye un total de 1.190 cortes de tomografía computarizada de 110 casos, categorizados en tres clases: normales (55 casos), benignos (15 casos) y malignos (40 casos). Cada caso consta de múltiples cortes CT (que van de aproximadamente 80 a 200 cortes por caso), ofreciendo diversas vistas axiales de la región torácica. Las imágenes CT se obtuvieron en DICOM usando el escáner SOMATOM con parámetros estándar de imagen: voltaje del tubo = 120 kV, grosor de corte = 1 mm, ancho de ventana = 350–1.200 unidades de Hounsfield (HU) y valores del centro de la ventana = 50–600 HU, durante una pausa total de inspiración.

Todas las imágenes fueron completamente desidentificadas antes del análisis para eliminar cualquier información personal identificable (PII). El conjunto de datos fue aprobado éticamente por los comités de revisión institucional de los centros médicos participantes, con el consentimiento por escrito renunciado por el comité de supervisión. Los casos incluían a personas de diversos orígenes como empleados públicos, agricultores y residentes de varias provincias iraquíes (incluyendo Bagdad, Wasit, Diyala, Salahuddin y Babylon) con diversidad de género, edad, nivel educativo y estado de vida.

Como el conjunto de datos está disponible públicamente y ha sido desidentificado, no fue necesaria una aprobación ética adicional para su uso en este estudio. El conjunto de datos cumple con los términos y condiciones especificados por sus colaboradores originales y la plataforma anfitriona.

La metodología de esta investigación utiliza un proceso en varias etapas diseñado para crear un modelo predictivo con la ayuda del conjunto de datos de cáncer de pulmón IQ-OTH/NCCD 21. Esta metodología establece un terreno sólido para dispositivos sanitarios centrados en el consumidor, donde se requiere menos latencia, lo que puede ofrecer una mayor precisión. La Figura 2 muestra el mecanismo de funcionamiento del modelo propuesto.

figure-protocol-1
Figura 2: Diagrama de flujo de trabajo del modelo propuesto que muestra los pasos de preprocesamiento, aumentación, clasificación del transformador de visión y evaluación. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

1. Descripción del conjunto de datos

El conjunto de datos de cáncer de pulmón IQ-OTH/NCCD fue recopilado en el Hospital Universitario de Oncología de Irak/Centro Nacional para Enfermedades Oncológicas durante el otoño de 2019. La parte de entrenamiento del conjunto de datos utilizada contenía 1.097 imágenes cuya descripción se muestra en la Tabla 2, que ilustra el recuento de instancias muestrales de diferentes clases.

ClaseNúmero de imágenes
Normal416
Benigno120
Maligno561

Tabla 2: Ejemplos de imágenes de TC normales, benignas y malignas del conjunto de datos.

Se eligió el conjunto de datos IQ-OTH/NCCD sobre cáncer de pulmón por su representación completa de tomografías normales, benignas y malignas. Aunque existen otros conjuntos de datos, como LIDC-IDRI y NSCLC-Radiomics, estos se centran principalmente en la detección de nódulos o carecen de muestras suficientes de casos benignos. El conjunto de datos IQ-OTH/NCCD es especialmente adecuado para nuestro estudio, ya que permite al Transformador Visivo aprender características discriminativas en las tres clases, facilitando una clasificación robusta de patrones sutiles en imágenes de TC pulmonar.

2. Preprocesamiento de datos

El preprocesamiento es un paso importante para mejorar el rendimiento del modelo mediante la consistencia y los ajustes adecuados de los datos que serán procesados a través de la red neuronal. Para asegurar la consistencia en el tamaño de entrada de la red neuronal, hemos escalado todas las imágenes a la misma dimensión de 256 x 256 píxeles y normalizado los datos a un valor de píxel entre 0 y 1 con la esperanza de mejorar el entrenamiento y convergencia del modelo. La Tabla 3 contiene los valores de la técnica de aumento.

TécnicaValor
Normalización-
Redimensionarimage_size x image_size
RandomRotationfactor=0,02
RandomZoomheight_factor=0,2, width_factor=0,2

Tabla 3: Técnicas de aumento aplicadas con rangos de parámetros.

Para aumentar la robustez del modelo frente al sobreajuste y mejorar su capacidad de generalización, se aplican técnicas de aumento de datos como rotaciones aleatorias y zooms, simulando diversos ángulos y tamaños de manifestaciones del cáncer de pulmón tal como pueden aparecer en diferentes pacientes. En este estudio se aplicaron rotaciones aleatorias con ángulos muestreados uniformemente a partir de 0,02 radianes y transformaciones de zoom aleatorias con factores de altura y anchura variables. Las imágenes que siguen a la mejora se muestran en la Figura 3.

figure-protocol-2
Figura 3: Imágenes de TC tras la mejora que demuestran rotación, zoom y normalización para mejorar la generalización del modelo. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

Estas técnicas de preprocesamiento son necesarias, y la ampliación se ha utilizado en todas las clases para garantizar la robustez del modelo.

3. Arquitectura del modelo

Adaptando el novedoso marco Vision Transformer (ViT) para manejar eficazmente datos de imágenes complicados, la arquitectura del modelo pretende categorizar los TAC en tres categorías: normales, benignos y malignos. Con este método, se procesan imágenes de entrada de 256 x 256 píxeles. Para garantizar la consistencia y promover un aprendizaje de modelos más eficiente, cada imagen se somete a varias operaciones de preprocesamiento, como el redimensionamiento y la normalización. Para mejorar la resiliencia del modelo a cambios en la escala y orientación de la imagen, el diseño comienza con una capa de aumento de datos que utiliza métodos como normalización, redimensionamiento, rotaciones aleatorias de 0,02 radianes y zooms aleatorios de hasta el 20%. Tras la aumentación, el modelo toma 16 parches de 16 píxeles de cada imagen, por lo que cada imagen tiene 256 parches.

El algoritmo 1 define el flujo de trabajo del modelo propuesto, cómo se construye y el ajuste fino que se realiza respecto al modelo.

Algoritmo 1: Clasificación del cáncer de pulmón usando transformadores de visión
Entrada: Conjunto de imágenes CT I del conjunto de datos IQ-OTH/NCCD
Resultado: Resultados de clasificación C en categorías: Normal, Benigno, Maligno
Preprocesamiento:
   for each image i in I do
i <- Resize(i, 256 x 256)         // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i)        // Apply random rotations and zooms
   end for

Configuración del modelo:
  Initialize Vision Transformer (ViT) Model
  Set number of patches P = 16 x 16
  Set number of heads H = 6 in multi-head attention

Adiestramiento:
  for epoch = 1 to MaxEpochs do
    for each batch b in I do
      Patches <- ExtractPatches(b, P)
      EncodedPatches <- PatchEncoder(Patches)
      AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
      ClassLogits <- TransformerEncoder(AttentionWeights)
      Loss <- ComputeLoss(ClassLogits, TrueLabels)
      UpdateModelWeights(Loss)
    end for
    if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
      break
    end if
  end for

Validación:
  Split data into TrainingSet (80%) and ValidationSet (20%)
  ComputeValidationMetrics(ValidationSet)

Evaluación:
  C <- Classify(I)
  ComputePerformanceMetrics(C)
  Return C

Para preservar las relaciones espaciales entre parches, estos parches se aplanan (ecuación 1) en vectores de 768 dimensiones (porque cada parche tiene 16 x 16 x 3 = 768) y luego se envían a través de una capa de codificación de parches, que proyecta cada vector en un espacio de 64 dimensiones integrando incrustaciones posicionales. El núcleo de la arquitectura consta de ocho capas transformadoras, cada una con un mecanismo de atención multicabezal con seis cabezas, lo que permite al modelo enfocar simultáneamente diferentes partes de la imagen y capturar una amplia gama de características. Se representa mediante las ecuaciones 2, 3 y 4.

figure-protocol-3

Donde μ es la media y σ2 es la varianza de la entrada x, y ε es una pequeña constante para evitar la división por cero.

figure-protocol-4

Donde Q es la matriz de consulta, K es la matriz clave, V es la matriz de valores y dk es la dimensión de los vectores clave.

figure-protocol-5
figure-protocol-6

Donde WiQ, WiK y WiV son las matrices de pesos aprendidas para consultas, claves y valores, respectivamente, y WO es la matriz de pesos de salida.

El diagrama de bloques del modelo propuesto se ha mostrado en la Figura 4.

figure-protocol-7
Figura 4: Diagrama de bloques del modelo Vision Transformer con cabeza MLP, detallando las principales capas de procesamiento y la arquitectura. Por favor, haz clic aquí para ver una versión ampliada de esta figura.

Cada capa transformadora incluye una percepción multicapa (MLP) con unidades ocultas primero escaladas hasta 128 y luego de nuevo a 64, expandiendo y comprimiendo efectivamente el flujo de información para capturar dependencias complejas.

El dropout se aplica estratégicamente a una tasa de 0,1 dentro de los mecanismos de atención y los MLPs para evitar el sobreajuste. La salida del codificador del transformador se procesa a través de una cabeza MLP compuesta por dos capas densas con 2.048 y 1.024 unidades, respectivamente, empleando Unidades Lineales de Error Gaussiano (GELU) para su activación, lo que ha demostrado funcionar bien en aplicaciones de aprendizaje profundo. Esto se consigue usando la ecuación 5.

figure-protocol-8

Donde W1 y W2 son matrices de pesos, b1 y b2 son sesgos, y GELU es la función de activación utilizada.

Se utilizaba una caída de 0,1 en las capas transformadoras para evitar el sobreajuste sin perder información importante de características. La función de activación GELU se utilizó por sus características suaves y no lineales, que promueven el flujo de gradiente y la convergencia en modelos basados en transformadores. La caída se regulariza usando la ecuación 6.figure-protocol-9

Donde p es la tasa de abandono (por ejemplo, 0,1 o 0,5), y la capa de abandono pone aleatoriamente una fracción p de las unidades de entrada a cero durante el entrenamiento.

Una tasa de dropout de 0,5 en estas capas ayuda aún más a mitigar el sobreajuste. La capa final del modelo es una capa logits (ecuación 7) que genera tres logits de clase correspondientes a las categorías normal, benigna y maligna, utilizando una función de pérdida de entropía cruzada categórica dispersa (ecuación 8) apropiada para este entorno de clasificación multiclase.

figure-protocol-10

figure-protocol-11

Donde zi es el vector logits para la clase i, SoftMax(zi)) representa las probabilidades predichas y yi es la etiqueta de clase verdadera.

El modelo se compila con el optimizador AdamW (ecuaciones 9, 10, 11, 12 y 13), una extensión del optimizador Adam que maneja de forma más eficaz la decación de peso, con una tasa de aprendizaje de 0,001 y una decaimiento de peso de 0,0001, optimizando tanto la velocidad de aprendizaje como la estabilidad del modelo.

figure-protocol-12

figure-protocol-13
figure-protocol-14
figure-protocol-15
figure-protocol-16

Donde mt y vt son el primer y segundo momento de los gradientes, figure-protocol-17 y figure-protocol-18 son los momentos corregidos por sesgo, η es la tasa de aprendizaje, y ε es una pequeña constante para evitar la división por cero.

El modelo, cuando está entrenado, utiliza un tamaño de lote de 32 para aprovechar la aceleración de la GPU y así calcular más rápido y está configurado para entrenar durante 100 épocas.

Pero el entrenamiento tiene un mecanismo de detención temprana en la pérdida de validación para limitar el entrenamiento cuando el modelo deja de mejorar, para ahorrar recursos computacionales y evitar el sobreentrenamiento de 5 épocas consecutivas. El rendimiento del modelo se rastrea con métricas como la precisión categórica escasa y la precisión de las dos principales, que informan sobre la capacidad de clasificación del modelo en las categorías predichas más probables. Las llamadas de regreso para el entrenamiento del modelo abarcan puntos de control que guardarán el modelo de mayor rendimiento según la precisión de validación para asegurar que la versión más exitosa del modelo se mantenga una vez finalizado el proceso de entrenamiento. Esta arquitectura robusta y bien planificada aprovecha las capacidades de los transformers para procesar datos de imagen médica con un enfoque muy avanzado para utilizar métodos de IA contemporáneos en aplicaciones importantes en diagnósticos sanitarios.

4. Formación y validación

El modelo se entrenó en un entorno Kaggle usando una GPU NVIDIA P100, y durante el proceso de entrenamiento se utilizó un mini-lote de descenso de gradiente con un tamaño de lote de 32. El optimizador utilizado durante el entrenamiento fue AdamW, con una tasa de aprendizaje de 0,001 y una disminución de peso de 0,0001; Esto era un buen equilibrio entre una convergencia rápida y cierta regularización. El modelo se entrenó durante 100 épocas, sin embargo, se utilizó una parada temprana tras la pérdida de validación con una paciencia de 5 épocas. En pocas palabras, si el entrenamiento no mejoraba la pérdida de validación durante 5 épocas continuas, el entrenamiento se detenía por sobreajuste y eficiencia computacional. En la mayoría de los casos, este modelo restauraba pesos de la época con la menor pérdida de validación, lo que indicaba que estaba funcionando de forma óptima y no necesitaba ejecutar las 100 épocas completas. Un total de unos 32 minutos para entrenar el modelo.

Durante el entrenamiento, las métricas incluyeron precisión categórica escasa y precisión top 2, monitorizadas tanto en conjuntos de entrenamiento como de validación. Estas métricas proporcionan información sobre con qué frecuencia un modelo predice la clase correcta y si la clase correcta está dentro de las dos principales predicciones, lo cual en aplicaciones médicas es importante porque las clasificaciones erróneas de alta confianza pueden tener consecuencias significativas. Las curvas de aprendizaje para la pérdida y la precisión se visualizan en la Figura 5.

.figure-protocol-19

Figura 5: Curvas de precisión y pérdida de entrenamiento y validación a lo largo de 50 épocas que muestran un aprendizaje estable y un sobreajuste mínimo. Por favor, haga clic aquí para ver una versión ampliada de esta figura.

No se realizó validación cruzada en el presente estudio. Esta configuración permitía experimentar de forma eficiente con la arquitectura del modelo, incluyendo ajustes en las capas de transformadores y los tamaños de las cabezas MLP, asegurando al tiempo que el modelo se generalizaba bien sobre datos de validación no vistos.

5. Análisis estadístico

El rendimiento del modelo Vision Transformer fue analizado estadísticamente basándose en el conjunto de datos de cáncer de pulmón IQ-OTH/NCCD. La precisión, el recuerdo, la puntuación F1 y la exactitud se calcularon usando las ecuaciones 14, 15, 16 y 17 respectivamente. Estas cuatro se consideran las medidas convencionales para tareas de clasificación, ya que pueden revelar información sobre el rendimiento del modelo en la clasificación y clasificación por clase para cada clase.

figure-protocol-20
figure-protocol-21
figure-protocol-22
figure-protocol-23

El recuerdo es una medida de la capacidad de un modelo para identificar todas las instancias relevantes en una clase, mientras que la precisión es la proporción de identificaciones positivas que realmente fueron correctas. La puntuación F1 equilibra la memoria y la precisión cuando ambas son importantes.
Las medidas de rendimiento utilizadas para esta tarea fueron el coeficiente de correlación de Matthews (MCC) - ecuación 18 - y la ecuación de Kappa de Cohen 19.

figure-protocol-24
figure-protocol-25

Donde P0 es el acuerdo observado mientras que Pe es el acuerdo esperado.

El MCC es una medida integral del desempeño en la clasificación, teniendo en cuenta tanto los verdaderos positivos como los negativos, los falsos positivos y los falsos negativos. Su valor puede estar entre -1 y 1, siendo 1 la predicción perfecta, 0 la predicción aleatoria y -1 la desacuerdo total entre las etiquetas predicha y verdadera. El MCC fue valioso para comparaciones entre diferentes desempeños de modelos cuando se aplicó a conjuntos de datos desequilibrados y proporcionó una medida equilibrada independientemente del tamaño de las clases.

Como parte de un análisis estadístico adicional, se calculó la puntuación F2, priorizando la recuperación, según la ecuación 20.

figure-protocol-26

El rendimiento del modelo también se cuantificó utilizando el Error Cuadrático Medio (MSE), el Error Cuadrático Medio Raíz (RMSE) y el Error Absoluto Medio (MAE), que suelen ser mediciones para tareas de regresión pero modificadas aquí para la tarea de clasificación para cuantificar cuán grande era el error de media sin tener en cuenta la dirección.

Para determinar si sería práctico integrar ViTs dentro de dispositivos sanitarios orientados al consumidor, realizamos resultados exhaustivos de evaluación de rendimiento centrados únicamente en la eficiencia temporal del modelo. Creamos funciones para informar del tiempo que se tarda en predecir una sola o simplemente varias imágenes, ya que esto resulta especialmente relevante para aplicaciones en tiempo real. Para cada imagen, antes de empezar a predecir, los datos se preprocesan primero para que tengan la forma de la imagen de entrada deseada por el modelo. La hora en que empezó la predicción y la hora en que se completó la registramos para obtener los resultados de tiempo y latencia. El tiempo y la latencia media se calcularon usando la ecuación 21 y la ecuación 22 respectivamente.

figure-protocol-27
figure-protocol-28

Dónde:

  • N es el número de imágenes (muestras).
  • Tend es el tiempo registrado tras predecir la i-ésima imagen.
  • tstart es el tiempo registrado antes de predecir la i-ésima imagen.

Se realizaron más experimentos para evaluar la robustez del modelo Vision Transformer que propusimos introduciendo sistemáticamente más ruido y desenfoque en las imágenes. Se añadió ruido gaussiano a cada píxel con un factor de ruido de 0,4 mientras se recortaban los valores de píxeles en el rango de [0,1]. El factor de desenfoque se redujo mediante desenfoque Gaussiano con un tamaño de grano de 45× 45. Estos experimentos están diseñados para evaluar el modelo de forma integral bajo degradaciones simuladas de la calidad de la imagen perceptiva.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El modelo Vision Transformer demostró resultados excepcionales en múltiples métricas de evaluación en los conjuntos de datos de cáncer de pulmón IQ-OTH/NCCD, diferenciando eficazmente imágenes de TC normales, benignas y malignas. El rendimiento global del modelo alcanzó una alta precisión del 98,18% en el conjunto de datos de prueba, compuesto por 220 imágenes. Esta precisión extremadamente alta indica que el modelo puede generalizar de forma muy eficaz y...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ha logrado resultados notables en la evaluación e implementación del modelo Vision Transformer en el conjunto de datos de cáncer de pulmón IQ-OTH/NCCD con alta precisión. La precisión general para clasificar una tomografía computarizada como normal, benigna y maligna es del 98,18% usando este modelo.

Esta precisión superior queda aún más demostrada por el rendimiento del modelo en otras puntuaciones clave, como la precisión del 100% para la detección de casos ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen ningún conflicto de interés.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue apoyado por el Proyecto de Apoyo de Investigadores de la Universidad Princesa Nourah bint Abdulrahman número (PNURSP2025R432), Universidad Princesa Nourah bint Abdulrahman, Riad, Arabia Saudí.  Los autores agradecen al Decano de Estudios de Posgrado e Investigación Científica de la Universidad de Najran por financiar este trabajo bajo el código de subvención del Programa de Financiación para el Crecimiento (NU/GP/SERC/13/575-6).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
GPU A100 (CUDA)NVIDIACUDA Versión 11.6Aceleración de GPU para entrenamiento y evaluación de modelos.
AMD EPYC-7502P CPUAMDN/AProcesador utilizado para computación de alto rendimiento.
Gigabit EthernetIntelN/ARedes para comunicación segura entre pares en CPS.
MatplotlibFundación de Software PythonVersión 3.5Biblioteca de visualización para graficar resultados.
Sistema Criptográfico PaillierCódigo abierto (implementado mediante TenSEAL)N/APermite el cifrado homomórfico aditivo sobre gradientes.
PySyftMinada a cielo abiertoVersión 0.6.0Privacidad diferencial y biblioteca de aprendizaje federado.
Python (distribución anaconda)Anaconda IncVersión 3.9Incluye paquetes preinstalados y herramientas de gestión de entorno, utilizadas para scripting y desarrollo de frameworks.
PyTorchMeta IAVersión 1.12Marco de aprendizaje profundo para entrenar modelos.
RAMCorsario256 GigaByte (GB) Alto soporte de memoria para entrenamiento intensivo.
Scikit-learnFundación de Software PythonVersión 1.1Herramientas de aprendizaje automático para la evaluación del rendimiento.
SeabornFundación de Software PythonVersión 0.11Biblioteca de visualización estadística de datos.
Almacenamiento SSDSeagate1 terabyte (TB)Para almacenamiento y recuperación de datos rápidos.
TenSEALMinada a cielo abiertoVersión 0.3Biblioteca de cifrado homomórfica para agregación segura.
TensorFlowGoogleVersión 2.9Marco de aprendizaje profundo para modelos de difusión.
Ubuntu OSCanónicoVersión 20.04 LTSSistema operativo utilizado para todos los experimentos.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Imagenolog a M dica por IAAprendizaje Autom tico en la SaludClasificaci n del C ncer de Pulm nRobustez de las Im genesPrecisi n Diagn sticaRuido en Im genes M dicasDiagn sticos Oncol gicos

Artículos relacionados