A aparência visual das lesões cutâneas da varíola do macaco permanece pouco estabelecida devido à sua semelhança com outras doenças cutâneas vesiculares e pustulares. Este artigo testou a hipótese de que um modelo híbrido de aprendizado profundo, integrado com codificadores de características convolucionais e baseados em transformadores, pode classificar automaticamente imagens mpox dentro de um pipeline experimental unificado. Para garantir consistência entre modelos e relatórios, a análise principal foi realizada como uma tarefa binária: mpox vs outras condições com a mesma ou semelhante apresentação. Esses dados de referência consistiram em 2.280 imagens: 1.020 imagens de lesões não mpox e 1.260 imagens de lesões não mpox. As imagens foram reduzidas para um tamanho padrão de entrada de 150 × 150 pixels, e os valores ficaram na faixa [0, 1]. Durante o treinamento, as imagens foram complementadas com rotação, translação, cisalhamento, zoom e inversão horizontal. Foram comparados um CNN Sequencial personalizado, InceptionV3, ResNetV2, ResNet50, DenseNet121 e uma arquitetura híbrida CNN-transformador proposta. Todo modelo de linha de base foi treinado por 15 épocas usando o otimizador Adam e a perda binária de entropia cruzada. A precisão do treinamento e validação, perda, precisão, recall, F1-score e área sob a curva característica operacional do receptor foram medidos para avaliar o desempenho, sempre que possível. A melhor precisão interna relatada foi observada com a CNN Sequencial, e o modelo híbrido alcançou precisão de 98,50, recall de 98,50 e pontuação F1 de 98,58, resultando em um perfil discriminativo balanceado. O InceptionV3 apresenta sinais de sobreajuste, e o ResNetV2 não forneceu dados de validação suficientes para suportar um teste de generalização robusto. No geral, o modelo híbrido pode ser visto como uma estratégia viável e equilibrada, e não necessariamente melhor do que todas as linhas de base.