Artículo de método

Modelos innovadores híbridos de aprendizaje profundo CNN-Transformer para el diagnóstico automatizado de viruela del mono a partir de imágenes médicas

DOI:

10.3791/70533

29 de mayo de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El uso de una colección curada de 2.280 imágenes de lesiones cutáneas produjo un flujo de trabajo binario estandarizado de aprendizaje profundo para clasificar la presencia de mpox en cada imagen. Se compararon un modelo personalizado y un modelo de InceptionV3, ResNetV2, ResNet50, DenseNet121 y un híbrido CNN-transformador en el contexto de una tubería común de preprocesamiento y entrenamiento.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La apariencia visual de las lesiones cutáneas de la viruela del mono sigue estando poco establecida debido a su similitud con otras enfermedades cutáneas vesiculares y pustulares. Este artículo puso a prueba la hipótesis de que un modelo híbrido de aprendizaje profundo, integrado con codificadores de características convolucionales y basados en transformadores, puede clasificar automáticamente las imágenes mpox dentro de una cadena experimental unificada. Para garantizar la coherencia entre modelos e informes, el análisis principal se realizó como una tarea binaria: mpox frente a otras condiciones con la misma o similar presentación. Estos datos de referencia consistieron en 2.280 imágenes: 1.020 imágenes de lesiones no mpox y 1.260 imágenes de lesiones no mpox. Las imágenes se redujeron a un tamaño estándar de entrada de 150 × 150 píxeles, y los valores estaban en el rango [0, 1]. Durante el entrenamiento, las imágenes se complementaban con rotación, traslación, cizalladura, zoom y volteo horizontal. Se compararon una CNN secuencial personalizada, InceptionV3, ResNetV2, ResNet50, DenseNet121 y una arquitectura híbrida CNN-transformador propuesta. Cada modelo de línea base se entrenó durante 15 épocas usando el optimizador Adam y la pérdida binaria de entropía cruzada. Se midieron la precisión del entrenamiento y validación, la pérdida, la precisión, la llamada de recuperación, la puntuación F1 y el área bajo la curva característica de funcionamiento del receptor para evaluar el rendimiento, cuando fue posible. La mejor precisión de validación interna reportada se observó con la CNN secuencial, y el modelo híbrido alcanzó una precisión de 98,50, un recuerdo de 98,50 y una puntuación F1 de 98,58, lo que dio lugar a un perfil discriminativo equilibrado. InceptionV3 muestra signos de sobreajuste, y ResNetV2 no proporcionó datos de validación suficientes para soportar una prueba de generalización robusta. En general, el modelo híbrido puede considerarse una estrategia viable y equilibrada y no necesariamente mejor que todas las líneas base.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La detección automática y rápida de la mpox en casos médicos es clínicamente significativa, ya que la enfermedad puede ser similar a una variedad de otras erupciones vesiculares o pustulares en la evaluación visual inicial. En la práctica, los clínicos no prestan mucha atención únicamente a la morfología de las lesiones, sino que combinan el patrón, la distribución, la historia, el riesgo de exposición, el contexto epidemiológico y la confirmación enlaboratorio 1. No obstante, las herramientas computacionales utilizan imágenes y también pueden realizar un procedimiento de triaje útil en entornos donde la revisión dermatológica especializada está limitada o retrasada. Es especialmente aplicable en el seguimiento de brotes, el cribado teledermatológico y los entornos con recursos limitados y que tienen un número significativo de casos posibles que deben priorizarse para someterse a pruebas confirmatorias.

Los enfoques basados en aprendizaje profundo también han surgido como atractivos para esta tarea, ya que pueden descubrir imágenes discriminativas de lesiones sin necesidad de usar descriptores que deben crearsemanualmente 2. La revisión más popular de la literatura sigue siendo la de redes neuronales convolucionales debido a su eficacia en texturas locales, rango de color y reconocimiento de márgenes de lesiones3. Trabajos recientes han desarrollado aún más este paradigma con la ayuda del aprendizaje por transferencia, mecanismos de atención y módulos transformadores, que intentan modelar una mayor dependencia espacial de la imagen. No obstante, la literatura sobre mpox tiene un rendimiento reportado alto que debe tomarse con precaución. Una gran variedad de estudios ha utilizado conjuntos de datos públicos dispersos, tiene diferentes conjuntos de clases heterogéneas o compara resultados con diversos regímenes de preprocesamiento yvalidación 4. Por ello, a menudo surge el dilema de si los aumentos en el rendimiento son resultado de un modelo verdaderamente superior, una división deseable, aumentos vigorosos o disparidades en la formulación de la tarea subyacente.

La MPOX sigue siendo una de las enfermedades infecciosas más importantes con implicaciones adversas para la salud pública, ya que sus lesiones que implican infecciones cutáneas pueden confundirse con otras lesiones vesiculares y pustulares en la interfaz durante el cribado ocular durante el examenprimario 5. Prácticamente, los clínicos no hacen su diagnóstico de mpox basándose en la morfología: el patrón, la distribución, la historia, la epidemiología y la confirmación en laboratorio son componentes de la decisióndiagnóstica 6. No obstante, pueden desempeñar un papel beneficioso en el proceso de triaje con la ayuda de herramientas computacionales que dependen de las imágenes, especialmente cuando la experiencia de los dermatólogos es insuficiente, lenta o no disponible. Podrían ser aplicables en teledermatología, en casos donde un brote deba abordarse mediante cribado, y en lugares con limitaciones de recursos donde los casos sospechosos en la lista de prioridades deben abordarserápidamente 7.

Los métodos basados en aprendizaje profundo, porque permiten aprender representaciones discriminativas de lesiones, serían atractivos para esta tarea porque aprenden tales representaciones sin descriptores elaborados a mano, dependiendo de las características de las imágenesde entrada 8. Ha sido una auténtica fiebre en el campo de las imágenes dermatológicas utilizar redes neuronales convolucionales (CNN) para analizar imágenes, ya que poseen la capacidad de codificar textura local, la periferia de las lesiones y un significado morfológico exquisito. Estudios posteriores han proporcionado este paradigma mediante aprendizaje por transferencia, atención y submódulos basados en transformadores para aprender relaciones espaciales más generales y tendenciascontextuales 9. No obstante, la literatura sobre la imagen por mpox sigue siendo heterogénea. No es raro que el rendimiento se informe no solo de la selección de arquitectura, sino también de la estructura del conjunto de datos, el plan de aumento, la definición de clases y la estructurade validación 10. Entonces, un buen rendimiento en los titulares no indica necesariamente una mayor generalización.

En el trabajo actual, este problema se resuelve utilizando un benchmark de clasificación de imágenes mpox binaria más perceptible einternamente consistente 11. No aborda la contribución en el formato de proponer una arquitectura híbrida completamente nueva, ya que los métodos CNN-transformadores ya se han esparcido en toda la literatura12. Más bien, el experimento introduce una comparación estándar con la descomposición binaria primaria explícita, donde las piezas adicionales de evidencia multiclase, preprocesamiento/entrenamiento y rendimiento del modelo se consideran de forma amigable para protocolos, y el rendimiento del modelo se considera de forma conservadora en comparación con el entornoexperimental 13. En este paradigma, un modelo CNN-transformer puede seguir teniendo importancia funcional, ya que las CNN están óptimamente estructuradas para captar información local de lesiones, mientras que las representaciones basadas en transformadores tienen el potencial de representar también estructuras espaciales a largo alcance de interés en dermatología.

La investigación reciente sobre clasificación de imágenes sobre mpox puede dividirse en tres grandes corrientes de investigación que se basan en una metodología. Este último se basa en las CNN convencionales y el aprendizaje por transferencia debido a su madurez, velocidad de cálculo y recreación de texturas específicas de lalesión 14. Este último explora modelos basados en la atención o transformadores, más adecuados para aprender el contexto global de la lesión. El tercero integra convolucional y atención en las tuberías híbridas para preservar la sensibilidad local pero utilizando modelado contextual de cuerpo mayor. Varios de los estudios reportan un alto rendimiento que no puede compararse fácilmente directamente porque difieren en el tamaño de su conjunto de datos, la estrategia de curación, la estructura de sus clases, el preprocesamiento y el protocolode validación 15. Son orientados a la clasificación binaria, a la discriminación dermatológica multiclase, no todos con las mismas medidas de evaluación. Los conjuntos de datos de imágenes mpox disponibles públicamente también pueden incluir imágenes casi duplicadas o muy similares, que requerirán un rendimiento aparente inflado en caso de que el control dividido no seasuficiente 16.

El análisis dado se basa en un conjunto binario controlado de 2.280 fotografías de lesiones cutáneas, 1.020 fotografías de mpox y 1.260 fotografías de Otros. La Otra categoría se solapa con las lesiones no mpox que aparecen a simple vista, lo que sitúa la tarea en una formulación de triaje temprano clínicamente interesante, en comparación con un sistema completo de localizacióndermatológica 17. Todas las imágenes fueron redimensionadas, normalizadas, estandarizadas, ampliadas y evaluadas en una típica cadena interna de validación de entrenamiento. El objetivo principal fue comparar el comportamiento de modelos convencionales e híbridos de aprendizaje profundo en un benchmark transparente y concluir si la arquitectura híbrida sugerida ofrece un equilibrio superior entre discriminación e interpretabilidad, en comparación con las referencias populares.

La carencia definitiva que cubre la versión revisada actual no es la mera presentación del modelo híbrido, ya que las estrategias del transformador híbrido CNN ya han sido cubiertas en la literatura. En cambio, la desconexión es que lo que se necesitaba era una métrica más distinta y coherente internamente que ignorara las salidas binarias primarias de la tarea y las salidas multiclase exploratorias, caractease la cadena de preprocesamiento y entrenamiento de forma reproducible, y presentara el rendimiento del modelo de una manera que no exagerara la novedad ni la preparación clínica18. En ese sentido, merece la pena considerar una arquitectura híbrida, ya que las CNN destacan en la extracción local de características, y la atención similar a la de un transformador puede, en teoría, modelar configuraciones globales de lesiones y conexiones espaciales a largo alcance para ayudar en el diagnósticovisual 19. La cuestión práctica no es si un diseño híbrido tendrá un equilibrio favorable entre discriminación, estabilidad e interpretabilidad en comparación con las líneas base típicas sobre el mismo aspecto de datos curados, sino si proporciona un buen equilibrio entre fiscalidad, estabilidad e interpretabilidad.

Los trabajos más recientes sobre análisis de imágenes mpox pueden dividirse en tres corrientes generales del estudio de métodos. La primera utiliza CNN tradicionales y arquitecturas de aprendizaje por transferencia debido a su madurez, eficiencia computacional y capacidad para aprender texturas específicas de la lesión y características morfológicaslocales 20. La segunda corriente ofrece modelos de transformadores de visión o mejorados de atención para capturar las asociaciones espaciales más amplias sobre el campo de la lesión, especialmente cuando las manchas de textura están compuestas por distribución contextual de la lesión y, por tanto, pueden ser tan importantes como las manchas de textura individuales. La tercera corriente añade la convolución y la atención para apoyar tuberías híbridas en un intento de mantener la sensibilidad local de las CNNs, pero utilizando la capacidad de modelado contextual de los bloques de atención.

Aunque la mayoría de estos trabajos afirman una excelente precisión, la comparación entre estudios no es una tarea fácil debido a las diferencias en tamaño, estrategia de curación, composición de clases y diseño de validación entre losconjuntos de datos 21. Existen publicaciones que evalúan la discriminación binaria, y aquellas que evalúan la categorización dermatológica multiclase, algunas también están equilibradas en la precisión y la memoria de los reportes, y otras se centran en la precisión22. Además, los conjuntos de datos mpox reportados pueden basarse en colecciones de imágenes en línea, colecciones seleccionadas o subconjuntos aumentados, lo que puede mejorar el rendimiento reportado cuando las fugas de validación de trenes o las imágenes casi duplicadas no se gestionan bien. Por tanto, la Tabla 1 no se mantiene como un mero compendio de trabajos previos, sino como un mapa esquemático de familias de modelos, restricciones de conjuntos de datos y las oportunidades que ofrecen los métodos disponibles en esta investigación.

El valor metodológico de la obra en cuestión se refleja de manera más limitada y más defendible. Este artículo discutirá la necesidad del benchmark binario transparente con la ayuda del conjunto de datos seleccionado proporcionado, informará sobre el preprocesamiento y el procedimiento de entrenamiento y comparará directamente el modelo híbrido propuesto con las referencias populares23. Estos cambios también separan el experimento binario principal y la evidencia multiclase de suplementación de manera que permite asociar las afirmaciones de rendimiento con el contexto experimentaladecuado 24. La diferencia marca un efecto decisivo en el análisis discursivo de la conducta de los modelos, las medidas reportadas y la practicidad.

El experimento principal de este guion es un experimento de clasificación binaria sobre un conjunto más pequeño de 2280 imágenes de lesiones cutáneas, que fue seleccionado a mano. En este conjunto de datos, el número de imágenes identificadas como mpox fue de 1.020, y las que se clasificaron como otras fueron 1.260. La otra categoría implica la presentación de apariencias dermatológicas no relacionadas con la mucola que tienen un carácter visual, principalmente lesiones que el manuscrito denomina lesiones similares a la varicela yal sarampión 25. Esta nomenclatura dual hace que este agrupamiento binario sea clínicamente significativo como formulación de cribado primitivo, ya que el modelo pregunta si es capaz de desagregar mpox sospechosa y alternativas visualmente confusas, pero también es menos complejo que un benchmark dermatológico multiclase completo.

El entrenamiento de los modelos debía estandarizarse, con todas las imágenes preprocesadas antes de entrenarse. El redimensionamiento, la normalización de intensidad, el aumento y la conversión de etiquetas categóricas a binarias también se mencionan en el manuscrito. Sin embargo, en el sentido actualizado, estos pasos se consideran componentes de una tubería reproducible y no notas escritas en la periferia. Su array se dividió a su vez en subconjuntos de entrenamiento y validación que consistían en directorios, y las métricas de rendimiento mencionadas debían considerarse impactos internos en el rendimiento de validación en lugar de como indicadores de un grupo externo de pruebas completamente independiente. Para ser más claros, esta colección de 2.280 imágenes se considerará los datos oficiales sobre los que se realizará el análisis principal. El encuadre binario se eligió porque refleja la pregunta de triaje temprano común en la práctica: ¿es más probable que la imagen de una lesión sospechosa sea mpox que otras condiciones visualmente similares? Este encuadre es limitado en comparación con un diagnóstico dermatológico extenso, pero es un punto de partida válido y técnicamente interpretable para la comparación comparativa.

La descripción actualizada del conjunto de datos también tiene en cuenta que el artículo incluye algunos resultados adicionales obtenidos con la ayuda de diferentes estructuras de clases o algunos subconjuntos enriquecidos, que se muestran en las Figuras 1A–I. En lugar de eliminar esos materiales, el manuscrito ahora los contextualiza directamente para permitir que los lectores vean los resultados que forman parte del benchmark binario y los que forman parte de experimentos secundarios. Este método mantendrá toda la documentación de este estudio, pero no permitirá la inclusión de experimentos incompatibles en una sola afirmación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NOTA: Utiliza el conjunto de datos de imágenes binarias mpox seleccionadas descrito en el manuscrito para el experimento principal. El conjunto de datos contiene 2.280 imágenes de lesiones cutáneas, incluyendo 1.020 imágenes de mpox y 1.260 imágenes etiquetadas como Otras. Utiliza solo análisis de imagen secundario; No realicéis reclutamiento directo de pacientes, intervenciones clínicas, experimentación con animales ni generación de nuevas muestras biológicas como parte de este flujo de trabajo.

1. Obtener y curar el conjunto de datos

  1. Definamos un esquema binario de etiquetado con dos clases: mpox y Other.
  2. Asigna lesiones visualmente similares no relacionadas con la opresión a la Otra clase.
  3. Revisa todas las imágenes para comprobar la legibilidad, identidad de clase y idoneidad para la clasificación supervisada de imágenes.
  4. Excluye imágenes inutilizables o ambiguas durante la curación.
  5. Organiza las imágenes seleccionadas en carpetas de clases basadas en directorios para cargarlas aguas abajo con generadores de imágenes.

2. Redimensionar y normalizar las imágenes

  1. Redimensiona todas las imágenes a 150 x 150 píxeles antes del entrenamiento del modelo.
  2. Aplica interpolación bicúbica durante el redimensionamiento para preservar transiciones de imagen suaves.
  3. Reescala la intensidad de los píxeles dividiendo cada valor de píxel entre 255.
  4. Normaliza todas las intensidades de la imagen al rango [0,1].
    NOTA: Utiliza el mismo procedimiento de resolución espacial y normalización para todos los modelos para mantener una comparación justa entre arquitecturas.

3. Mejorar las imágenes de entrenamiento

  1. Aplica la mejora solo al subconjunto de entrenamiento.
  2. Ajusta el rango de rotación a 20°.
  3. Ajusta el rango de ancho y desplazamiento a 0,2.
  4. Ajusta el rango de cambio de altura a 0,2.
  5. Ajusta el rango de corte a 0,2.
  6. Pon el rango de zoom en 0,2.
  7. Activa el volteo horizontal.
  8. Utiliza el relleno de vecino más cercano para los píxeles introducidos durante la aumentación.
  9. Realiza aumentos online durante el entrenamiento en lugar de duplicar permanentemente los archivos de imagen.
    NOTA: No aumentes las imágenes de validación; Solo reescala.

4. Codificar las etiquetas y separar el conjunto de datos

  1. Codifica las dos clases como etiquetas binarias.
  2. Carga las imágenes usando generadores basados en directorios en modo de clase binaria.
  3. Pon el tamaño del lote en 32.
  4. Divide el conjunto de datos en subconjuntos de entrenamiento y validación.
    NOTA: El manuscrito informa únicamente de benchmarking interno de validación de entrenamiento y no incluye una cohorte externa de prueba independiente.

5. Construir los modelos base de CNN

  1. Construye una línea base CNN secuencial con tres bloques convolucionales.
  2. Usa 32 filtros en el primer bloque convolucional y sigue el bloque con el máximo pooling.
  3. Usa 64 filtros en el segundo bloque convolucional y sigue el bloque con el máximo pooling.
  4. Usa 128 filtros en el tercer bloque convolucional y sigue el bloque con el máximo pooling.
  5. Aplana los mapas de características extraídos.
  6. Añade una capa densa con 512 unidades.
  7. Solicita abandonar la carrera con una tasa de 0,5.
  8. Utiliza una capa de salida sigmoide para la clasificación binaria.
  9. Incluye InceptionV3, ResNetV2, ResNet50 y DenseNet121 como arquitecturas de referencia comparativas.
    NOTA: Utiliza el mismo conjunto de datos binario curado y la misma línea de preprocesamiento para todas las comparaciones de línea base cuando sea aplicable.

6. Definir el modelo híbrido CNN-transformador

  1. Utiliza un módulo CNN como codificador de características local.
  2. Extrae la textura de la lesión, los bordes y los patrones morfológicos locales con el componente CNN.
  3. Utiliza un módulo basado en transformadores como codificador de contexto.
  4. Modela dependencias espaciales más amplias en la representación aprendida con el componente transformador.
  5. Proyecta los vectores de características CNN y transformador a la misma dimensionalidad y fusionalos mediante la suma elemento.
  6. Mapea la representación fusionada a una salida binaria mpox-contra-Otro mediante un cabezal de clasificación.
    NOTA: Informa de la arquitectura híbrida a nivel de módulo si el número de cabezas de atención, dimensiones de incrustación y capas de transformador no está explícitamente disponible.

7. Proceso de formación y práctica de tasación

  1. Ensamblar el clasificador binario usando el modelo implementado con el optimizador Adam, la pérdida binaria de entropía cruzada y la precisión como métrica principal de entrenamiento.
  2. Entrena el modelo de referencia claramente definido para 15 épocas en el conjunto de datos seleccionado mpox contra otros.
  3. Realizar todos los experimentos en un entorno de aprendizaje profundo basado en Python en un sistema equipado con GPU, y resumir los recursos de software y el entorno computacional generalizado en la Tabla de Materiales.
  4. Monitorizar las curvas de pérdida de entrenamiento y validación durante el entrenamiento, y calcular la precisión, precisión, recuerdo, puntuación F1 y AUC para cada modelo individual cuando esté disponible.
  5. Interpreta el rendimiento del modelo enfatizando la consistencia en el comportamiento de informes y generalización, y prioriza un equilibrio entre sensibilidad y especificidad frente a valores de precisión máxima individual.
  6. Formula dos preguntas de evaluación para cada modelo: (i) qué tan bien se ajusta el modelo a los datos de entrenamiento y (ii) qué tan bien se transfiere la representación aprendida a imágenes de validación mantenidas de la misma fuente seleccionada.
    NOTA: Presenta estos dos aspectos explícitamente en el manuscrito para distinguir la capacidad representacional de la generalización útil.
  7. Interpretar la alta precisión del entrenamiento como evidencia de suficiente capacidad representativa, e interpretar un rendimiento de validación alto y estable como el indicador más significativo de una generalización útil.

8. Análisis experimentales

  1. Informa solo de los resultados que estén directamente respaldados por los resultados grabados y evita extrapolar más allá de la evidencia documentada.
  2. Establece explícitamente limitaciones cuando falte información de validación o cuando una tabla refleje una estructura de clases diferente.
  3. Trata la tarea de clasificación binaria mpox frente a otros como el análisis principal y úsala como referencia interna para todos los experimentos.
  4. Traduce el código original de implementación a un protocolo narrativo y a la Tabla 2 para que el conjunto de datos, el entorno de software, las familias de modelos y la configuración de entrenamiento se resuman de forma concisa para su reproducibilidad.
  5. Generalizar las descripciones de hardware y software para que el enfoque siga siendo la reproducibilidad metodológica en lugar de en una plataforma específica de un solo proveedor.
  6. Presentan los resultados modelo por modelo en la misma secuencia en la que se introducen las arquitecturas, para simplificar la comparación del comportamiento de entrenamiento, el comportamiento de validación y la completitud de los informes.
  7. Describe la línea base de CNN secuencial como que logra un rendimiento interno de validación muy alto, advirtiendo que esto puede reflejar características favorables de división y no generalizarse externamente.
  8. Interpreta el modelo secuencial como una referencia interna fuerte en lugar de una demostración definitiva de la robustez diagnóstica desplegable.
  9. Justifica mantener paneles separados de InceptionV3 porque las trayectorias de pérdida y precisión juntas revelan una optimización efectiva del entrenamiento pero un comportamiento de validación inconsistente.
  10. Describe ResNetV2 como una línea base informativa pero parcialmente informada porque no se disponían de métricas de validación comparables.
  11. Trate el experimento multiclase ResNet50 como evidencia suplementaria distinta del benchmark binario principal.
  12. Interpreta DenseNet121 como un benchmark intermedio con un rendimiento competitivo pero no dominante en el subconjunto binario reportado.
  13. Describe el híbrido CNN-transformador como alguien que logra una discriminación equilibrada de clases en lugar de una ganancia unilateral en una única métrica.
  14. Evitar reclamar la superioridad universal del modelo híbrido sobre todas las referencias porque algunos modelos fueron evaluados bajo condiciones de reporte diferentes.
  15. Posicionar el modelo híbrido como un compromiso prometedor entre alto rendimiento de validación y equilibrio métrico, y recomendar una evaluación adicional en benchmarks estandarizados probados externamente.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Comparación más allá de la precisión de los titulares

Estos resultados muestran que las comparaciones de modelos en el análisis de imágenes médicas no solo deben centrarse en la precisión de los titulares, sino también en el comportamiento de las arquitecturas respecto a diversas métricas y diferentes entornos experimentales. A lo largo de los experimentos, los modelos no se comportaban de forma similar: el simple CNN secuencial era extremadam...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El resultado clave del estudio es que la clasificación binaria de mpox frente a lesiones visualmente similares, denominada clasificación automatizada, es posible con el conjunto de datos curado utilizado en este estudio, pero tal éxito depende en gran medida de la interpretación de laevidencia 27. Separando adecuadamente los experimentos, el manuscrito presenta pruebas de que tanto las arquitecturas convencionales como las híbridas propuestas pueden usarse para lo...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen intereses financieros o no financieros en competencia conocidos que pudieran haber influido en el trabajo relatado en este manuscrito.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen el apoyo financiero recibido de Vel Tech Rangarajan, Dr. Sagunthala R&D Institute of Science and Technology, bajo el Fondo de Investigación y Desarrollo (RDF), Subvención nº VTU/RDF/FY2026-27/009. Este apoyo fue fundamental para facilitar la exitosa ejecución de este trabajo de investigación.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjunto de datosConjunto de datos de imágenes mpox seleccionadas; 2.280 imágenes para el benchmark binario principal (1.020 mpox y 1.260 otros)Fuente primaria de entrenamiento y validación interna
Definición de tareaClasificación binaria para el estudio central; los resúmenes complementarios multiclase y ampliados se mantienen por separadoGarantiza una interpretación consistente de las métricas reportadas
Entorno de programaciónFlujo de trabajo de cuadernos basado en PythonManejo de datos, entrenamiento de modelos y trazado
Marco de aprendizaje profundoLa implementación de TensorFlow / Keras se reporta en el código enviadoDesarrollo y optimización de modelos
Utilidades de imagenImageDataGenerator con reescalado y aumentación; Cartografía de bibliotecas para curvas de entrenamientoPreprocesamiento, aumento y reporte visual
Arquitecturas de línea baseCNN secuencial, InceptionV3, ResNetV2, ResNet50, DenseNet121Comparativa comparativa
Arquitectura propuestaClasificador híbrido CNN-transformadorContribución metodológica principal
Entornos de entrenamientoTamaño de entrada 150 x 150; tamaño del lote 32; optimizador Adam; entropía cruzada binaria; 15 épocas reportadas para el código base suministradoReproducibilidad del flujo de trabajo central
Entorno de cómputosistema computacional habilitado con GPU; Detalles del hardware generalizados en la narrativaAceleración del modelo durante el entrenamiento

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Diagn stico de la viruela del monoaprendizaje profundo h bridoclasificaci n de im genes m dicasim genes de lesiones cut neasclasificaci n binariaaumento de im genesvalidaci n del modelo

Artículos relacionados