É necessária uma assinatura do JoVE para visualizar este conteúdo. Faça login ou inicie seu teste gratuito.

Artigo de método

Modelos Inovadores de Aprendizado Profundo Híbrido CNN-Transformer para o Diagnóstico Automatizado da Varíola dos Macacos a partir de Imagens Médicas

159 visualizações

DOI:

10.3791/70533

29 de maio de 2026

Neste artigo

Resumo

O uso de uma coleção curada de 2.280 imagens de lesões cutâneas produziu um fluxo de trabalho binário padronizado de aprendizado profundo para classificar a presença de mpox em cada imagem. Um modelo personalizado e InceptionV3, ResNetV2, ResNet50, DenseNet121 e um híbrido CNN-transformador foram comparados no contexto de um pipeline comum de pré-processamento e treinamento.

Resumo

A aparência visual das lesões cutâneas da varíola do macaco permanece pouco estabelecida devido à sua semelhança com outras doenças cutâneas vesiculares e pustulares. Este artigo testou a hipótese de que um modelo híbrido de aprendizado profundo, integrado com codificadores de características convolucionais e baseados em transformadores, pode classificar automaticamente imagens mpox dentro de um pipeline experimental unificado. Para garantir consistência entre modelos e relatórios, a análise principal foi realizada como uma tarefa binária: mpox vs outras condições com a mesma ou semelhante apresentação. Esses dados de referência consistiram em 2.280 imagens: 1.020 imagens de lesões não mpox e 1.260 imagens de lesões não mpox. As imagens foram reduzidas para um tamanho padrão de entrada de 150 × 150 pixels, e os valores ficaram na faixa [0, 1]. Durante o treinamento, as imagens foram complementadas com rotação, translação, cisalhamento, zoom e inversão horizontal. Foram comparados um CNN Sequencial personalizado, InceptionV3, ResNetV2, ResNet50, DenseNet121 e uma arquitetura híbrida CNN-transformador proposta. Todo modelo de linha de base foi treinado por 15 épocas usando o otimizador Adam e a perda binária de entropia cruzada. A precisão do treinamento e validação, perda, precisão, recall, F1-score e área sob a curva característica operacional do receptor foram medidos para avaliar o desempenho, sempre que possível. A melhor precisão interna relatada foi observada com a CNN Sequencial, e o modelo híbrido alcançou precisão de 98,50, recall de 98,50 e pontuação F1 de 98,58, resultando em um perfil discriminativo balanceado. O InceptionV3 apresenta sinais de sobreajuste, e o ResNetV2 não forneceu dados de validação suficientes para suportar um teste de generalização robusto. No geral, o modelo híbrido pode ser visto como uma estratégia viável e equilibrada, e não necessariamente melhor do que todas as linhas de base.

Introdução

A detecção automatizada e rápida de mpox em casos médicos é clinicamente significativa, pois a doença pode ser semelhante a várias outras erupções vesiculares ou pustulares na avaliação visual inicial. Os clínicos, na prática, não prestam muita atenção apenas à morfologia das lesões, mas combinam padrão, distribuição, histórico, risco de exposição, contexto epidemiológico e confirmaçãolaboratorial 1. No entanto, ferramentas computacionais utilizam imagens e também podem realizar um procedimento útil de triagem em ambientes onde a revisão dermatológica especializada é limitada ou atrasada. É especialmente aplicá....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

NOTA: Use o conjunto de dados de imagens binárias mpox curadas descrito no manuscrito para o experimento principal. O conjunto de dados contém 2.280 imagens de lesões cutâneas, incluindo 1.020 imagens de mpox e 1.260 imagens rotuladas como Outros. Use apenas análise secundária de imagem; Não realize recrutamento direto de pacientes, intervenção clínica, experimentação com animais ou geração de novos espécimes biológicos como parte desse fluxo de trabalho.

1. Obter e curar o conjunto de dados

  1. Defina um esquema binário de rotulagem com duas classes: mpox e Other.
  2. Atribua....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Comparação além da precisão das manchetes

Esses resultados mostram que comparações de modelos na análise de imagens médicas devem focar não apenas na precisão das manchetes, mas também no comportamento das arquiteturas em relação a diversas métricas e diferentes contextos experimentais. Durante os experimentos, os modelos não se comportaram de forma semelhante: a simples CNN Sequencial teve desempenho extremamente alto na divisão interna de va.......

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

O principal resultado do estudo é que a classificação binária de lesões de mpox versus lesões visualmente semelhantes, chamada classificação automatizada, é possível com o conjunto de dados curado utilizado neste estudo, mas tal sucesso depende em grande parte da interpretação daevidência 27. Separando adequadamente os experimentos, o manuscrito apresenta evidências de que tanto arquiteturas híbridas convencionais quanto propostas podem ser usadas para realizar fo.......

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores declaram que não possuem interesses financeiros ou não financeiros concorrentes conhecidos que possam ter influenciado o trabalho relatado neste manuscrito.

Agradecimentos

Os autores agradecem com gratidão o apoio financeiro recebido do Vel Tech Rangarajan Dr. Sagunthala P&D Institute of Science and Technology, sob o Fundo de Pesquisa e Desenvolvimento (RDF), Bolsa nº VTU/RDF/AF2026-27/009. Esse apoio foi fundamental para facilitar a execução bem-sucedida desse trabalho de pesquisa.

....

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Conjunto de dadosConjunto de dados curados de imagens mpox; 2.280 imagens para o benchmark binário principal (1.020 mpox e 1.260 Outros)Fonte de treinamento primário e validação interna
Definição da tarefaClassificação binária para o estudo principal; Resumos suplementares multiclasse e ampliados mantidos separadamenteGarante uma interpretação consistente das métricas reportadas
Ambiente de programaçãoFluxo de trabalho de cadernos baseado em PythonTratamento de dados, treinamento de modelos e plotagem
Estrutura de aprendizado profundoImplementação do TensorFlow / Keras reportada no código enviadoDesenvolvimento e otimização de modelos
Utilitários de imagemImageDataGenerator com reescalonamento e aumento; plotando bibliotecas para curvas de treinamentoPré-processamento, aumento e relatórios visuais
Arquiteturas de linha baseCNN Sequencial, InceptionV3, ResNetV2, ResNet50, DenseNet121Benchmarking comparativo
Arquitetura propostaClassificador híbrido CNN-transformadorContribuição metodológica primária
Ambientes de treinamentoTamanho de entrada 150 x 150; tamanho do lote 32; otimizador Adam; entropia cruzada binária; 15 épocas reportadas para o código de referência fornecidoReprodutibilidade do fluxo de trabalho central
Ambiente de computaçãosistema computacional habilitado por GPU; Detalhes do hardware generalizados na narrativaAceleração do modelo durante o treinamento

Reimpressões e permissões

Etiquetas

Diagnóstico de MonkeypoxAprendizado Profundo HíbridoClassificação de Imagens MédicasImagens de Lesões CutâneasClassificação BináriaAumentação de ImagensValidação de Modelo