$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El conjunto de datos incluye un total de 1.190 cortes de tomografía computarizada de 110 casos, categorizados en tres clases: normales (55 casos), benignos (15 casos) y malignos (40 casos). Cada caso consta de múltiples cortes CT (que van de aproximadamente 80 a 200 cortes por caso), ofreciendo diversas vistas axiales de la región torácica. Las imágenes CT se obtuvieron en DICOM usando el escáner SOMATOM con parámetros estándar de imagen: voltaje del tubo = 120 kV, grosor de corte = 1 mm, ancho de ventana = 350–1.200 unidades de Hounsfield (HU) y valores del centro de la ventana = 50–600 HU, durante una pausa total de inspiración.
Todas las imágenes fueron completamente desidentificadas antes del análisis para eliminar cualquier información personal identificable (PII). El conjunto de datos fue aprobado éticamente por los comités de revisión institucional de los centros médicos participantes, con el consentimiento por escrito renunciado por el comité de supervisión. Los casos incluían a personas de diversos orígenes como empleados públicos, agricultores y residentes de varias provincias iraquíes (incluyendo Bagdad, Wasit, Diyala, Salahuddin y Babylon) con diversidad de género, edad, nivel educativo y estado de vida.
Como el conjunto de datos está disponible públicamente y ha sido desidentificado, no fue necesaria una aprobación ética adicional para su uso en este estudio. El conjunto de datos cumple con los términos y condiciones especificados por sus colaboradores originales y la plataforma anfitriona.
La metodología de esta investigación utiliza un proceso en varias etapas diseñado para crear un modelo predictivo con la ayuda del conjunto de datos de cáncer de pulmón IQ-OTH/NCCD 21. Esta metodología establece un terreno sólido para dispositivos sanitarios centrados en el consumidor, donde se requiere menos latencia, lo que puede ofrecer una mayor precisión. La Figura 2 muestra el mecanismo de funcionamiento del modelo propuesto.

Figura 2: Diagrama de flujo de trabajo del modelo propuesto que muestra los pasos de preprocesamiento, aumentación, clasificación del transformador de visión y evaluación. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
1. Descripción del conjunto de datos
El conjunto de datos de cáncer de pulmón IQ-OTH/NCCD fue recopilado en el Hospital Universitario de Oncología de Irak/Centro Nacional para Enfermedades Oncológicas durante el otoño de 2019. La parte de entrenamiento del conjunto de datos utilizada contenía 1.097 imágenes cuya descripción se muestra en la Tabla 2, que ilustra el recuento de instancias muestrales de diferentes clases.
| Clase | Número de imágenes |
| Normal | 416 |
| Benigno | 120 |
| Maligno | 561 |
Tabla 2: Ejemplos de imágenes de TC normales, benignas y malignas del conjunto de datos.
Se eligió el conjunto de datos IQ-OTH/NCCD sobre cáncer de pulmón por su representación completa de tomografías normales, benignas y malignas. Aunque existen otros conjuntos de datos, como LIDC-IDRI y NSCLC-Radiomics, estos se centran principalmente en la detección de nódulos o carecen de muestras suficientes de casos benignos. El conjunto de datos IQ-OTH/NCCD es especialmente adecuado para nuestro estudio, ya que permite al Transformador Visivo aprender características discriminativas en las tres clases, facilitando una clasificación robusta de patrones sutiles en imágenes de TC pulmonar.
2. Preprocesamiento de datos
El preprocesamiento es un paso importante para mejorar el rendimiento del modelo mediante la consistencia y los ajustes adecuados de los datos que serán procesados a través de la red neuronal. Para asegurar la consistencia en el tamaño de entrada de la red neuronal, hemos escalado todas las imágenes a la misma dimensión de 256 x 256 píxeles y normalizado los datos a un valor de píxel entre 0 y 1 con la esperanza de mejorar el entrenamiento y convergencia del modelo. La Tabla 3 contiene los valores de la técnica de aumento.
| Técnica | Valor |
| Normalización | - |
| Redimensionar | image_size x image_size |
| RandomRotation | factor=0,02 |
| RandomZoom | height_factor=0,2, width_factor=0,2 |
Tabla 3: Técnicas de aumento aplicadas con rangos de parámetros.
Para aumentar la robustez del modelo frente al sobreajuste y mejorar su capacidad de generalización, se aplican técnicas de aumento de datos como rotaciones aleatorias y zooms, simulando diversos ángulos y tamaños de manifestaciones del cáncer de pulmón tal como pueden aparecer en diferentes pacientes. En este estudio se aplicaron rotaciones aleatorias con ángulos muestreados uniformemente a partir de 0,02 radianes y transformaciones de zoom aleatorias con factores de altura y anchura variables. Las imágenes que siguen a la mejora se muestran en la Figura 3.

Figura 3: Imágenes de TC tras la mejora que demuestran rotación, zoom y normalización para mejorar la generalización del modelo. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
Estas técnicas de preprocesamiento son necesarias, y la ampliación se ha utilizado en todas las clases para garantizar la robustez del modelo.
3. Arquitectura del modelo
Adaptando el novedoso marco Vision Transformer (ViT) para manejar eficazmente datos de imágenes complicados, la arquitectura del modelo pretende categorizar los TAC en tres categorías: normales, benignos y malignos. Con este método, se procesan imágenes de entrada de 256 x 256 píxeles. Para garantizar la consistencia y promover un aprendizaje de modelos más eficiente, cada imagen se somete a varias operaciones de preprocesamiento, como el redimensionamiento y la normalización. Para mejorar la resiliencia del modelo a cambios en la escala y orientación de la imagen, el diseño comienza con una capa de aumento de datos que utiliza métodos como normalización, redimensionamiento, rotaciones aleatorias de 0,02 radianes y zooms aleatorios de hasta el 20%. Tras la aumentación, el modelo toma 16 parches de 16 píxeles de cada imagen, por lo que cada imagen tiene 256 parches.
El algoritmo 1 define el flujo de trabajo del modelo propuesto, cómo se construye y el ajuste fino que se realiza respecto al modelo.
Algoritmo 1: Clasificación del cáncer de pulmón usando transformadores de visión
Entrada: Conjunto de imágenes CT I del conjunto de datos IQ-OTH/NCCD
Resultado: Resultados de clasificación C en categorías: Normal, Benigno, Maligno
Preprocesamiento:
for each image i in I do
i <- Resize(i, 256 x 256) // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i) // Apply random rotations and zooms
end for
Configuración del modelo:
Initialize Vision Transformer (ViT) Model
Set number of patches P = 16 x 16
Set number of heads H = 6 in multi-head attention
Adiestramiento:
for epoch = 1 to MaxEpochs do
for each batch b in I do
Patches <- ExtractPatches(b, P)
EncodedPatches <- PatchEncoder(Patches)
AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
ClassLogits <- TransformerEncoder(AttentionWeights)
Loss <- ComputeLoss(ClassLogits, TrueLabels)
UpdateModelWeights(Loss)
end for
if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
break
end if
end for
Validación:
Split data into TrainingSet (80%) and ValidationSet (20%)
ComputeValidationMetrics(ValidationSet)
Evaluación:
C <- Classify(I)
ComputePerformanceMetrics(C)
Return C
Para preservar las relaciones espaciales entre parches, estos parches se aplanan (ecuación 1) en vectores de 768 dimensiones (porque cada parche tiene 16 x 16 x 3 = 768) y luego se envían a través de una capa de codificación de parches, que proyecta cada vector en un espacio de 64 dimensiones integrando incrustaciones posicionales. El núcleo de la arquitectura consta de ocho capas transformadoras, cada una con un mecanismo de atención multicabezal con seis cabezas, lo que permite al modelo enfocar simultáneamente diferentes partes de la imagen y capturar una amplia gama de características. Se representa mediante las ecuaciones 2, 3 y 4.

Donde μ es la media y σ2 es la varianza de la entrada x, y ε es una pequeña constante para evitar la división por cero.

Donde Q es la matriz de consulta, K es la matriz clave, V es la matriz de valores y dk es la dimensión de los vectores clave.


Donde WiQ, WiK y WiV son las matrices de pesos aprendidas para consultas, claves y valores, respectivamente, y WO es la matriz de pesos de salida.
El diagrama de bloques del modelo propuesto se ha mostrado en la Figura 4.

Figura 4: Diagrama de bloques del modelo Vision Transformer con cabeza MLP, detallando las principales capas de procesamiento y la arquitectura. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Cada capa transformadora incluye una percepción multicapa (MLP) con unidades ocultas primero escaladas hasta 128 y luego de nuevo a 64, expandiendo y comprimiendo efectivamente el flujo de información para capturar dependencias complejas.
El dropout se aplica estratégicamente a una tasa de 0,1 dentro de los mecanismos de atención y los MLPs para evitar el sobreajuste. La salida del codificador del transformador se procesa a través de una cabeza MLP compuesta por dos capas densas con 2.048 y 1.024 unidades, respectivamente, empleando Unidades Lineales de Error Gaussiano (GELU) para su activación, lo que ha demostrado funcionar bien en aplicaciones de aprendizaje profundo. Esto se consigue usando la ecuación 5.

Donde W1 y W2 son matrices de pesos, b1 y b2 son sesgos, y GELU es la función de activación utilizada.
Se utilizaba una caída de 0,1 en las capas transformadoras para evitar el sobreajuste sin perder información importante de características. La función de activación GELU se utilizó por sus características suaves y no lineales, que promueven el flujo de gradiente y la convergencia en modelos basados en transformadores. La caída se regulariza usando la ecuación 6.
Donde p es la tasa de abandono (por ejemplo, 0,1 o 0,5), y la capa de abandono pone aleatoriamente una fracción p de las unidades de entrada a cero durante el entrenamiento.
Una tasa de dropout de 0,5 en estas capas ayuda aún más a mitigar el sobreajuste. La capa final del modelo es una capa logits (ecuación 7) que genera tres logits de clase correspondientes a las categorías normal, benigna y maligna, utilizando una función de pérdida de entropía cruzada categórica dispersa (ecuación 8) apropiada para este entorno de clasificación multiclase.


Donde zi es el vector logits para la clase i, SoftMax(zi)) representa las probabilidades predichas y yi es la etiqueta de clase verdadera.
El modelo se compila con el optimizador AdamW (ecuaciones 9, 10, 11, 12 y 13), una extensión del optimizador Adam que maneja de forma más eficaz la decación de peso, con una tasa de aprendizaje de 0,001 y una decaimiento de peso de 0,0001, optimizando tanto la velocidad de aprendizaje como la estabilidad del modelo.





Donde mt y vt son el primer y segundo momento de los gradientes,
y
son los momentos corregidos por sesgo, η es la tasa de aprendizaje, y ε es una pequeña constante para evitar la división por cero.
El modelo, cuando está entrenado, utiliza un tamaño de lote de 32 para aprovechar la aceleración de la GPU y así calcular más rápido y está configurado para entrenar durante 100 épocas.
Pero el entrenamiento tiene un mecanismo de detención temprana en la pérdida de validación para limitar el entrenamiento cuando el modelo deja de mejorar, para ahorrar recursos computacionales y evitar el sobreentrenamiento de 5 épocas consecutivas. El rendimiento del modelo se rastrea con métricas como la precisión categórica escasa y la precisión de las dos principales, que informan sobre la capacidad de clasificación del modelo en las categorías predichas más probables. Las llamadas de regreso para el entrenamiento del modelo abarcan puntos de control que guardarán el modelo de mayor rendimiento según la precisión de validación para asegurar que la versión más exitosa del modelo se mantenga una vez finalizado el proceso de entrenamiento. Esta arquitectura robusta y bien planificada aprovecha las capacidades de los transformers para procesar datos de imagen médica con un enfoque muy avanzado para utilizar métodos de IA contemporáneos en aplicaciones importantes en diagnósticos sanitarios.
4. Formación y validación
El modelo se entrenó en un entorno Kaggle usando una GPU NVIDIA P100, y durante el proceso de entrenamiento se utilizó un mini-lote de descenso de gradiente con un tamaño de lote de 32. El optimizador utilizado durante el entrenamiento fue AdamW, con una tasa de aprendizaje de 0,001 y una disminución de peso de 0,0001; Esto era un buen equilibrio entre una convergencia rápida y cierta regularización. El modelo se entrenó durante 100 épocas, sin embargo, se utilizó una parada temprana tras la pérdida de validación con una paciencia de 5 épocas. En pocas palabras, si el entrenamiento no mejoraba la pérdida de validación durante 5 épocas continuas, el entrenamiento se detenía por sobreajuste y eficiencia computacional. En la mayoría de los casos, este modelo restauraba pesos de la época con la menor pérdida de validación, lo que indicaba que estaba funcionando de forma óptima y no necesitaba ejecutar las 100 épocas completas. Un total de unos 32 minutos para entrenar el modelo.
Durante el entrenamiento, las métricas incluyeron precisión categórica escasa y precisión top 2, monitorizadas tanto en conjuntos de entrenamiento como de validación. Estas métricas proporcionan información sobre con qué frecuencia un modelo predice la clase correcta y si la clase correcta está dentro de las dos principales predicciones, lo cual en aplicaciones médicas es importante porque las clasificaciones erróneas de alta confianza pueden tener consecuencias significativas. Las curvas de aprendizaje para la pérdida y la precisión se visualizan en la Figura 5.
.
Figura 5: Curvas de precisión y pérdida de entrenamiento y validación a lo largo de 50 épocas que muestran un aprendizaje estable y un sobreajuste mínimo. Por favor, haga clic aquí para ver una versión ampliada de esta figura.
No se realizó validación cruzada en el presente estudio. Esta configuración permitía experimentar de forma eficiente con la arquitectura del modelo, incluyendo ajustes en las capas de transformadores y los tamaños de las cabezas MLP, asegurando al tiempo que el modelo se generalizaba bien sobre datos de validación no vistos.
5. Análisis estadístico
El rendimiento del modelo Vision Transformer fue analizado estadísticamente basándose en el conjunto de datos de cáncer de pulmón IQ-OTH/NCCD. La precisión, el recuerdo, la puntuación F1 y la exactitud se calcularon usando las ecuaciones 14, 15, 16 y 17 respectivamente. Estas cuatro se consideran las medidas convencionales para tareas de clasificación, ya que pueden revelar información sobre el rendimiento del modelo en la clasificación y clasificación por clase para cada clase.




El recuerdo es una medida de la capacidad de un modelo para identificar todas las instancias relevantes en una clase, mientras que la precisión es la proporción de identificaciones positivas que realmente fueron correctas. La puntuación F1 equilibra la memoria y la precisión cuando ambas son importantes.
Las medidas de rendimiento utilizadas para esta tarea fueron el coeficiente de correlación de Matthews (MCC) - ecuación 18 - y la ecuación de Kappa de Cohen 19.


Donde P0 es el acuerdo observado mientras que Pe es el acuerdo esperado.
El MCC es una medida integral del desempeño en la clasificación, teniendo en cuenta tanto los verdaderos positivos como los negativos, los falsos positivos y los falsos negativos. Su valor puede estar entre -1 y 1, siendo 1 la predicción perfecta, 0 la predicción aleatoria y -1 la desacuerdo total entre las etiquetas predicha y verdadera. El MCC fue valioso para comparaciones entre diferentes desempeños de modelos cuando se aplicó a conjuntos de datos desequilibrados y proporcionó una medida equilibrada independientemente del tamaño de las clases.
Como parte de un análisis estadístico adicional, se calculó la puntuación F2, priorizando la recuperación, según la ecuación 20.

El rendimiento del modelo también se cuantificó utilizando el Error Cuadrático Medio (MSE), el Error Cuadrático Medio Raíz (RMSE) y el Error Absoluto Medio (MAE), que suelen ser mediciones para tareas de regresión pero modificadas aquí para la tarea de clasificación para cuantificar cuán grande era el error de media sin tener en cuenta la dirección.
Para determinar si sería práctico integrar ViTs dentro de dispositivos sanitarios orientados al consumidor, realizamos resultados exhaustivos de evaluación de rendimiento centrados únicamente en la eficiencia temporal del modelo. Creamos funciones para informar del tiempo que se tarda en predecir una sola o simplemente varias imágenes, ya que esto resulta especialmente relevante para aplicaciones en tiempo real. Para cada imagen, antes de empezar a predecir, los datos se preprocesan primero para que tengan la forma de la imagen de entrada deseada por el modelo. La hora en que empezó la predicción y la hora en que se completó la registramos para obtener los resultados de tiempo y latencia. El tiempo y la latencia media se calcularon usando la ecuación 21 y la ecuación 22 respectivamente.


Dónde:
- N es el número de imágenes (muestras).
- Tend es el tiempo registrado tras predecir la i-ésima imagen.
- tstart es el tiempo registrado antes de predecir la i-ésima imagen.
Se realizaron más experimentos para evaluar la robustez del modelo Vision Transformer que propusimos introduciendo sistemáticamente más ruido y desenfoque en las imágenes. Se añadió ruido gaussiano a cada píxel con un factor de ruido de 0,4 mientras se recortaban los valores de píxeles en el rango de [0,1]. El factor de desenfoque se redujo mediante desenfoque Gaussiano con un tamaño de grano de 45× 45. Estos experimentos están diseñados para evaluar el modelo de forma integral bajo degradaciones simuladas de la calidad de la imagen perceptiva.