$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudio no implicó experimentación directa con participantes humanos ni animales. Todo el trabajo se realizó utilizando el conjunto de datos LC25000 anonimizado y público de imágenes histopatológicas, que no contenía información identificable del paciente ni manipulación directa de tejido humano. No se requirió la aprobación de la Junta de Revisión Institucional (IRB) ni del Comité de Cuidado y Uso Institucional de Animales (IACUC). Todos los procedimientos cumplieron con los estándares éticos y se ajustaron a los términos de uso del conjunto de datos para la investigación académica. La Figura 2 muestra los pasos del diagrama de flujo de trabajo.

Figura 2: Flujo de trabajo del método propuesto. El flujo de trabajo incluye preprocesamiento de datos, aumentación, entrenamiento de modelos y evaluación. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
Descripción del conjunto de datos
El conjunto de datos LC25000 se utilizó para este estudio. Consistía en 25.000 imágenes histopatológicas, todas formateadas uniformemente como archivos JPEG con una resolución de 768 × 768 píxeles. El conjunto de datos se originó a partir de un conjunto inicial de 1.250 imágenes originales, incluyendo 250 imágenes de tejido pulmonar benigno, 250 adenocarcinomas pulmonares, 250 carcinomas escamosos pulmonares, 250 imágenes benignas de tejido colon y 250 adenocarcinomas de colon. Las imágenes restantes se generaron mediante aumento de datos para ampliar el conjunto de datos, asegurando una colección diversa y extensa para un entrenamiento y validación robusta del modelo.
Las imágenes de alta resolución permitieron un examen detallado de las estructuras celulares, lo cual fue esencial para una clasificación precisa del cáncer. La ampliación de datos era necesaria debido al número limitado de imágenes originales; Se emplearon técnicas como rotaciones, volteos, zooms y desplazamientos para aumentar sintéticamente el tamaño y la diversidad del conjunto de datos. Este proceso generó 23.750 imágenes sintéticas adicionales de forma equilibrada por clases, resultando en un conjunto final de datos de 25.000 imágenes, con cada clase conteniendo 5.000 imágenes tras la ampliación.
Preprocesamiento de datos
Las imágenes histopatológicas en bruto dentro del conjunto de datos tenían una resolución de 768 × 768 píxeles. Para garantizar la compatibilidad con la arquitectura EfficientNetB7 y maximizar la eficiencia computacional, cada imagen se redimensionó de 768 × 768 a 224 × 224 píxeles. Este proceso de redimensionamiento representó un equilibrio entre preservar características histológicas esenciales y reducir la sobrecarga computacional. La operación de redimensionamiento se representó matemáticamente como se muestra en
Ecuación 1:
(1)
donde X representaba la imagen original, Xredimensionada era la imagen redimensionada, y h y w eran la altura y anchura deseadas, respectivamente. Todos los valores de píxeles se normalizaron en un rango de 0 a 1, lo que estabilizó y aceleró el entrenamiento asegurando una distribución de entrada consistente entre imágenes. Esta normalización se calculó matemáticamente como se muestra en la Ecuación 2. Este paso fue esencial para mejorar la convergencia de modelos durante el entrenamiento.
(2)
La ampliación de datos se empleó como una técnica crítica para mejorar la robustez y aplicabilidad de los modelos de aprendizaje profundo, especialmente en el contexto de la imagen médica con conjuntos de datos limitados y desequilibrados. En este estudio, se aplicaron diversas técnicas de aumento utilizando el módulo ImageDataGenerator de TensorFlow para simular la variación in vivo en imágenes histopatológicas. Estas técnicas incluían rotaciones aleatorias de hasta 20 grados para simular la variabilidad de la orientación del tejido, desplazamientos horizontales y verticales de hasta el 20% de las dimensiones de la imagen para imitar la variabilidad de posición durante la preparación de la diapositiva, y zooms aleatorios de hasta un 20% para reflejar la variabilidad en los niveles de aumento.
Además, se realizó un cambio horizontal para introducir variaciones en imagen espinada, enriqueciendo así aún más el conjunto de datos de entrenamiento. Para gestionar los píxeles recién sintetizados generados durante estas transformaciones, se adoptó una estrategia de relleno del vecino más cercano para asegurar transiciones suaves y preservar la integridad de las características histológicas clave. La matriz de rotación 2D utilizada para la aumentación está representada en la Ecuación 3, y la Ecuación 4 define una función con un cambio incremental:
(3)
(4)
Estas técnicas de aumento compensaron desafíos como el desequilibrio de clases, ligeras variaciones histológicas y limitaciones del conjunto de datos, permitiendo que el modelo aprendiera características invariantes y reduciendo el riesgo de sobreajuste. Al ampliar sintéticamente el conjunto de datos e incorporar variabilidad controlada, la ampliación de datos mejoró significativamente la capacidad del modelo para generalizar a datos nuevos y no vistos, produciendo así un sistema más fuerte y robusto para el despliegue clínico en el diagnóstico de cáncer de pulmón y colon.
Arquitectura del modelo
El modelo se desarrolló basándose en la arquitectura EfficientNetB7, una red de aprendizaje profundo de última generación reconocida por su rendimiento, escalabilidad y eficacia en tareas de clasificación de imágenes. EfficientNetB7 fue construido utilizando una serie de bloques de Convolución de Cuello de Botella Móvil Invertido (MBConv), que incorporaban convoluciones separables en profundidad. Este diseño estructural comprimía eficazmente el modelo, resultando en reducciones significativas en el número de parámetros con una pérdida mínima de rendimiento. Esta innovación permitió al modelo alcanzar alta precisión con menores costes computacionales, lo que lo hace especialmente adecuado para aplicaciones computacionalmente intensivas como el análisis histopatológico de imágenes. La Figura 3 muestra la arquitectura del modelo del EfficientNetB7 preentrenado.

Figura 3: Arquitectura del modelo de EfficientNetB7. Esta figura muestra la estructura detallada del modelo EfficientNetB7, ilustrando sus capas principales y bloques funcionales utilizados para la clasificación de imágenes. Por favor, haz clic aquí para ver una versión ampliada de esta figura.
El modelo aceptaba imágenes histopatológicas preprocesadas que habían sido redimensionadas desde sus dimensiones originales de 768 × 768 píxeles hasta 224 × 224 píxeles para ajustarse a los requisitos de entrada de EfficientNetB7. Cada imagen pasaba por varios procesos dentro de la red, incluyendo normalización por lotes, funciones de activación de Swish y operaciones de convolución. La normalización por lotes se calculó como se muestra en la Ecuación 5. La función de activación Swish introdujo la no linealidad y permitió un entrenamiento más rápido y eficiente en comparación con funciones tradicionales como ReLU. Estas capas estaban diseñadas para extraer y mejorar características jerárquicas, permitiendo que el modelo aprendiera progresivamente desde patrones de bajo nivel hasta altos niveles a medida que las imágenes se propagaban a través de la red.
(5)
La columna vertebral convolucional de EfficientNetB7, preentrenada en el conjunto de datos ImageNet, proporcionaba un conjunto altamente generalizable de detectores de características efectivos en una amplia gama de dominios de imagen. La base preentrenada desempeñó un papel clave en la captura de patrones sutiles pero informativos en imágenes histopatológicas, que a menudo se caracterizan por una alta variabilidad intra-clase y características de grano fino. La salida de las capas convolucionales se pasaba a una capa global de pooling promedio, que reducía las dimensiones espaciales a un solo vector de características para cada imagen. Este vector, que encapsulaba las características más relevantes aprendidas por las capas convolucionales, se aplanaba en un arreglo unidimensional para compatibilidad con capas totalmente conectadas. El algoritmo para la detección mejorada del cáncer de pulmón y colon se proporciona en el Archivo Suplementario 1.
La arquitectura de red posterior incluía dos capas densas (totalmente conectadas) con 128 y 64 unidades, respectivamente. Ambas capas utilizaron la función de activación de la Unidad Lineal Rectificada (ReLU) para introducir no linealidad adicional y afinar las características extraídas, permitiendo al modelo reconocer patrones y relaciones más precisos dentro de los datos. La capa final del modelo era una capa de salida SoftMax con cinco neuronas, cada una representando una de las cinco clases del conjunto de datos. La función SoftMax producía una distribución de probabilidad entre las clases, que reflejaba la predicción del modelo para cada imagen de entrada, tal como se describe en la Ecuación 6:
(6)
La combinación de técnicas convolucionales de última generación, regularización robusta y estrategias de optimización efectivas dio lugar a un modelo de aprendizaje profundo bien adaptado para la clasificación de imágenes médicas de alto riesgo. El modelo alcanzó precisión, escalabilidad y eficiencia operativa, demostrando un gran potencial para su aplicación clínica en el diagnóstico de cáncer de pulmón y colon. Dentro de este marco, la regularización se logró principalmente mediante aumento avanzado de datos y el uso de la parada temprana; No se aplicó ningún descenso explícito ni desintegración de peso a las capas densas.
Formación y validación
La canalización de validación y preentrenamiento de la red neuronal convolucional (CNN) para LC25000 clasificación histopatológica de imágenes fue diseñada para optimizar el rendimiento del modelo y asegurar una buena generalización. La cadena comenzó con un preprocesamiento exhaustivo, que incluyó reducir las imágenes originales de 768 × 768 píxeles a 224 × 224 píxeles para ajustarse a los requisitos de entrada de la arquitectura EfficientNetB7. Las intensidades de píxeles se normalizaron al rango [0, 1] para estabilizar y acelerar el entrenamiento, y se aplicaron técnicas de aumento de datos, incluyendo rotaciones aleatorias, desplazamientos, zooms y volteos horizontales, para introducir variabilidad y mitigar el sobreajuste. Estas operaciones de preprocesamiento aseguraban que el modelo aprendiera características invariantes y se generalizara bien a nuevos datos.
El modelo EfficientNetB7, preentrenado en el conjunto de datos ImageNet, se empleó como base, proporcionando un conjunto robusto de detectores de características capaz de identificar patrones histológicos sutiles. Posteriormente, el modelo fue ajustado con dos capas densas (128 y 64 unidades) activadas por la función de Unidad Lineal Rectificada (ReLU), seguidas de una capa de salida SoftMax para la clasificación de cinco clases. Esta arquitectura estaba optimizada tanto para la precisión como para la eficiencia computacional, lo que la hacía muy adecuada para el análisis de imágenes médicas. La regla de actualización del optimizador de Adam para θ se muestra en la Ecuación 7.
(7)
El entrenamiento del modelo se realizó en lotes de 128 imágenes usando el optimizador Adam, que escaló adaptativamente la tasa de aprendizaje para promover una convergencia efectiva. Se implementó un criterio temprano de parada para monitorizar la pérdida de validación y el entrenamiento de detención si no se observaba mejora, evitando así el sobreajuste y optimizando los recursos computacionales. Durante el entrenamiento, se rastrearon métricas clave de rendimiento —incluyendo precisión, pérdida, precisión y recuperación— utilizando un conjunto de validación de retención que comprendía el 20% de los datos. El conjunto de retención proporcionó información crítica sobre las capacidades de generalización del modelo y mitigó el riesgo de sobreajuste a datos no vistos.
La integración de estrategias avanzadas de preprocesamiento, aumento de datos y optimización resultó en una excelente precisión y robustez del modelo, demostrando un gran potencial para su aplicación clínica en la detección del cáncer de pulmón y colon. Todos los experimentos se realizaron en una GPU NVIDIA Tesla P100 con 16 GB de memoria y 64 GB de RAM del sistema. La cadena completa de entrenamiento —incluyendo preprocesamiento, aumento y optimización del modelo— requirió aproximadamente tres horas para completar diez épocas con un tamaño de lote de 128. Esta infraestructura computacional fue seleccionada para gestionar eficientemente el gran conjunto de datos ampliado, manteniendo tiempos de entrenamiento razonables y adecuados para entornos de investigación clínica.
Para la reproducibilidad, todos los hiperparámetros críticos se especificaron explícitamente. El modelo se entrenó usando el optimizador Adam con una tasa de aprendizaje constante de 0,001. El entrenamiento se realizó durante un máximo de 10 épocas, con una parada temprana basada en la pérdida de validación y una paciencia de tres épocas para evitar sobreajustes. Se utilizó un lote de 128 unidades tanto para la fase de entrenamiento como para la de validación. Para asegurar resultados consistentes, la semilla aleatoria se estableció en 42 en todas las etapas de la carga de datos y el entrenamiento del modelo. No se aplicó ningún calendario de decadencia de la tasa de aprendizaje durante la formación.
El protocolo combinaba un preprocesamiento sistemático, hiperparámetros bien calibrados, esquemas rigurosos de validación y un entorno computacional abierto para promover tanto la precisión como la reproducibilidad. El flujo de trabajo, al integrar una arquitectura robusta de aprendizaje profundo, optimización eficaz y diseño experimental reproducible, estableció una base sólida para la clasificación histopatológica de imágenes. Además de demostrar un fuerte rendimiento en la detección del cáncer de pulmón y colon, el protocolo definió un marco escalable que podría extenderse a desafíos similares de imagen biomédica en futuras investigaciones.
Durante el desarrollo del modelo, se implementaron varios ajustes prácticos para lograr resultados fiables y reproducibles. Se utilizaron paradas tempranas y aumentos avanzados de datos para abordar el desequilibrio de clases y el sobreajuste. El alto uso de memoria durante el entrenamiento se mitigó redimensionando las imágenes a 224 × 224 píxeles y usando un tamaño de lote de 128. Cuando se encontraba una convergencia lenta, la tasa de aprendizaje se establecía empíricamente en 0,001. Se realizó la verificación manual de la estructura del directorio de imágenes para evitar errores de carga de datos, y se corrigieron semillas aleatorias para garantizar la reproducibilidad. Estas estrategias pueden servir como guía práctica para investigadores que enfrentan desafíos análogos al entrenar modelos de aprendizaje profundo con grandes conjuntos de datos histopatológicos de imágenes.
Análisis estadístico
La modelización estadística del rendimiento del modelo se realizó utilizando un conjunto completo de métricas para evaluar la precisión, estabilidad y generalizabilidad. Las principales medidas de evaluación incluyeron precisión, recuerdo, puntuación F1 y exactitud para cuantificar el rendimiento en la clasificación. La matriz de confusión se utilizó para informar métricas de error específicas de cada clase, calculadas según las Ecuaciones 8-10:
(8)
(9)
(10)
Además, se evaluaron medidas de error como el Error Cuadrático Medio (MSE), el Error Cuadrático Medio Raíz (RMSE) y el Error Absoluto Medio (MAE) para evaluar la precisión de las predicciones, calculadas usando las Ecuaciones 11-13:
(11)
(12)
(13)
Se emplearon la curva de Característica de Operación del Receptor (ROC) y el Área Bajo la Curva (AUC) para evaluar la capacidad del modelo para discriminar entre clases en varios umbrales. El AUC se calculó como se muestra en la Ecuación 14:
(14)
Estos análisis estadísticos proporcionaron una evaluación exhaustiva del rendimiento en la clasificación, la robustez y la generalización del modelo hacia datos no vistos.
Estudio de ablación
Para evaluar más a fondo la contribución de cada componente dentro del marco de clasificación, se realizó un estudio de ablación omitiendo o modificando selectivamente elementos arquitectónicos específicos del modelo final. Específicamente, se evaluaron dos configuraciones experimentales alternativas: una configuración incluía tanto las capas de Agrupación Promedio Global como las de Aplanamiento, seguidas por dos capas densas (128 y 64 unidades, respectivamente); la otra configuración omitió tanto la capa Flatten como la capa densa de 128 unidades, dejando solo la capa de Agrupación Media Global y una única capa densa de 64 unidades.
La arquitectura completa, según se informa en los resultados principales, alcanzó una precisión de validación de aproximadamente el 96%. Cuando se excluyó la capa Flatten, y solo se utilizaron las capas densas de 128 y 64 unidades tras la Agrupación Promedio Global, la precisión de validación cayó al 81,6%. Por el contrario, cuando se excluyó la capa densa de 128 unidades y se mantuvo la capa Flatten, la precisión de la validación disminuyó al 88%. Estos resultados indicaron la necesidad de incluir tanto la capa extra densa como los componentes arquitectónicos adecuados para lograr un rendimiento óptimo en la clasificación. Los hallazgos de los experimentos de ablación demostraron consistentemente que la combinación de Global Average Pooling, Aplanamiento y dos capas totalmente conectadas permitía una representación de características más expresiva, resultando en una clasificación histopatológica de imágenes más robusta y precisa.