$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
A detecção automatizada e rápida de mpox em casos médicos é clinicamente significativa, pois a doença pode ser semelhante a várias outras erupções vesiculares ou pustulares na avaliação visual inicial. Os clínicos, na prática, não prestam muita atenção apenas à morfologia das lesões, mas combinam padrão, distribuição, histórico, risco de exposição, contexto epidemiológico e confirmaçãolaboratorial 1. No entanto, ferramentas computacionais utilizam imagens e também podem realizar um procedimento útil de triagem em ambientes onde a revisão dermatológica especializada é limitada ou atrasada. É especialmente aplicável no rastreamento de surtos, triagem por teledermatologia e ambientes com recursos limitados e que possuem um número significativo de casos possíveis que devem ser priorizados para testes confirmatórios.
As abordagens baseadas em aprendizado profundo também surgiram como atraentes para essa tarefa, pois podem descobrir imagens discriminativas de lesões sem o uso de descritores que precisam ser criados manualmente2. A revisão mais popular da literatura ainda pertence às redes neurais convolucionais devido à sua eficácia em textura local, faixa de cores e reconhecimento de margens delesões 3. Trabalhos recentes desenvolveram ainda mais esse paradigma com a ajuda de aprendizado por transferência, mecanismos de atenção e módulos transformadores, que tentam modelar uma dependência espacial maior da imagem. No entanto, a literatura sobre mpox apresenta altos relatos de desempenho, o que deve ser tomado com cautela. Uma grande variedade de estudos utilizou conjuntos de dados públicos esparsos, possui diferentes conjuntos de classes heterogêneas ou compara resultados com diversos regimes de pré-processamento evalidação 4. Por conta disso, frequentemente surge o dilema de saber se aumentos de desempenho são resultado de um modelo verdadeiramente superior, uma divisão desejável, aumento vigoroso ou disparidades na formulação da tarefa subjacente.
A mpox continua sendo uma das doenças infecciosas significativas com implicações negativas para a saúde pública, pois suas lesões envolvendo infecções cutâneas podem aparentemente ser confundidas com outras lesões vesiculares e pustulares na interface durante a triagem ocular durante o exameprimário 5. Na prática, os profissionais não fazem o diagnóstico de mpox com base na morfologia: padrão, distribuição, histórico, epidemiologia e confirmação laboratorial são componentes da decisãode diagnóstico 6. No entanto, eles podem desempenhar um papel benéfico no processo de triagem com a ajuda de ferramentas computacionais que dependem das imagens, especialmente quando a experiência dos dermatologistas é inadequada, lenta ou indisponível. Elas podem ser aplicáveis em teledermatologia, em casos em que um surto deve ser tratado com triagem, e em locais com limitações de recursos onde casos suspeitos na lista de prioridades devem ser rapidamentetratados 7.
Métodos baseados em deep learning, por permitirem aprender representações discriminativas de lesões, seriam atraentes para essa tarefa porque aprendem tais representações sem descritores feitos à mão, dependendo das características das imagensde entrada 8. Tem sido uma febre no campo das imagens dermatológicas utilizar redes neurais convolucionais (CNNs) na análise de imagens, pois elas possuem a capacidade de codificar textura local, periferia das lesões e significado morfológico requintado. Estudos posteriores forneceram esse paradigma por meio de aprendizagem por transferência, atenção e submódulos baseados em transformadores para aprender relações espaciais mais gerais e tendênciascontextuais 9. No entanto, a literatura sobre a imagem mpox ainda é heterogênea. Não é incomum que o desempenho seja reportado como baseado não apenas na seleção da arquitetura, mas também na estrutura do conjunto de dados, plano de aumento, definição de classes e estruturade validação 10. Então, um bom desempenho em manchetes não indica necessariamente maior generalização.
No trabalho atual, esse problema é resolvido usando um benchmark de classificação de imagem mpox binária mais perceptível e internamenteconsistente 11. Não discute a contribuição no formato de propor uma arquitetura híbrida totalmente nova, já que métodos CNN-transformadores já foram espalhados pela literatura12. Em vez disso, o experimento introduz uma comparação padrão com a decomposição binária primária explícita, onde as evidências multiclass extras, pré-processamento/treinamento e desempenho do modelo são consideradas de forma amigável ao protocolo, e o desempenho do modelo é considerado de forma conservadora em comparação ao ambiente experimental13. Nesse paradigma, um modelo CNN-transformer ainda pode ser de importância funcional, já que CNNs são idealmente estruturadas para capturar informações locais de lesões, enquanto representações baseadas em transformadores também têm potencial para representar estruturas espaciais de longo alcance de interesse em dermatologia.
Pesquisas recentes de classificação de imagens sobre mpox podem ser divididas em três grandes áreas de pesquisa baseadas em uma metodologia. Esta última é baseada nas CNNs convencionais e no aprendizado por transferência devido à sua maturidade, velocidade de computação e recriação de texturas específicas delesão. Este último explora modelos baseados em atenção ou transformadores, mais adequados para aprender o contexto global da lesão. O terceiro integra convolucional e atenção nos pipelines híbridos para preservar a sensibilidade local, mas usando modelagem contextual de corpo maior. Vários dos estudos relatam alto desempenho que não pode ser facilmente comparado diretamente porque diferem no tamanho do conjunto de dados, estratégia de curadoria, estrutura de suas classes, pré-processamento e protocolode validação 15. Eles são orientados para classificação binária, multiclasse e discriminação dermatológica, nem todos com as mesmas medidas de avaliação. Conjuntos de dados de imagens mpox disponibilizados publicamente também podem incluir imagens quase duplicadas ou muito semelhantes, que exigirão que o desempenho aparente seja inflado caso o controle dividido não seja suficiente16.
A análise dada baseia-se em um conjunto binário controlado de 2.280 fotografias de lesões cutâneas, 1.020 fotografias de mpox e 1.260 fotografias de outros foram planejadas. A Outra categoria se sobrepõe às lesões não mpox que aparecem a olho nu, o que coloca a tarefa em uma formulação de triagem precoce clinicamente interessante, em comparação com um sistema completo de localizaçãodermatológica 17. As imagens foram todas redimensionadas, normalizadas, padronizadas, aumentadas e avaliadas em um pipeline interno típico de validação interna de treinamento. O principal objetivo foi comparar o comportamento de modelos convencionais e híbridos de deep learning em um benchmark transparente e concluir se a arquitetura híbrida sugerida oferece um equilíbrio superior entre discriminação e interpretabilidade, em relação às referências de base populares.
A lacuna definitiva que a versão revisada atual aborda, portanto, não é apenas a apresentação do modelo híbrido, já que as estratégias do transformador híbrido CNN já foram abordadas na literatura. Em vez disso, a desconexão é que o que era necessário era uma métrica mais distinta e internamente consistente, que desconsidere as saídas binárias primárias e multiclasse exploratória, caracterize o pipeline de pré-processamento e treinamento de forma reprodutível e apresente o desempenho do modelo de uma forma que não exagere a novidade ou a preparação clínica18. Nesse sentido, uma arquitetura híbrida ainda vale a pena ser considerada, já que CNNs se destacam na extração local de características, e a atenção semelhante a transformador pode, em teoria, modelar configurações globais de lesões e conexões espaciais de longo alcance para auxiliar no diagnósticovisual 19. A questão prática não é se um desenho híbrido terá um equilíbrio favorável entre discriminação, estabilidade e interpretabilidade em comparação com as linhas de base típicas no mesmo aspecto de dados curados, mas sim se ele oferece um bom equilíbrio entre tributação, estabilidade e interpretabilidade.
Os trabalhos mais recentes sobre análise de imagem mpox podem ser divididos em três áreas gerais do estudo dos métodos. A primeira utiliza CNNs tradicionais e arquiteturas de aprendizagem por transferência devido à sua maturidade, eficiência computacional e capacidade de aprender texturas específicas de lesões e características morfológicaslocais 20. O segundo fluxo oferece modelos de transformador visual ou aprimorados de atenção para capturar as associações espaciais mais amplas sobre o campo da lesão, especialmente quando as manchas de textura são compostas por distribuição contextual da lesão e, assim, podem ser tão importantes quanto as manchas individuais de textura. O terceiro fluxo adiciona o convolucional e a atenção para suportar pipelines híbridos na tentativa de manter a sensibilidade local das CNNs, mas utilizando a capacidade de modelagem contextual dos blocos de atenção.
Embora a maioria desses trabalhos afirme excelente precisão, a comparação entre estudos não é uma tarefa fácil devido às diferenças em tamanho, estratégia de curadoria, composição de classes e design de validação entre osconjuntos de dados 21. Existem publicações que avaliam a discriminação binária, e aquelas que avaliam a categorização dermatológica multiclasse; algumas também são equilibradas na precisão e recordação dos relatos, e outras focam na precisão22. Além disso, conjuntos de dados mpox reportados podem ser baseados em coleções de imagens online, coleções curadas ou subconjuntos aumentados, o que pode aumentar o desempenho reportado quando vazamentos de validação de trens ou imagens quase duplicadas não são bem gerenciados. Assim, a Tabela 1 não é mantida apenas como um compêndio de trabalhos anteriores, mas sim como um mapa esquemático das famílias de modelos, restrições do conjunto de dados e as oportunidades oferecidas pelos métodos disponíveis nesta pesquisa.
O valor metodológico do trabalho em questão se reflete de maneira mais limitada e defensável. Este artigo discutirá a necessidade do benchmark binário transparente com a ajuda do conjunto de dados curado fornecido, reportará o procedimento de pré-processamento e treinamento e comparará diretamente o modelo híbrido proposto com as referências populares23. Essas mudanças também separam o experimento binário principal e a evidência multiclasse de suplementação de forma a permitir que as reivindicações de desempenho sejam associadas ao contexto experimentalapropriado 24. A diferença faz uma diferença decisiva na análise discursiva da conduta do modelo, das medidas relatadas e da praticidade.
O principal experimento desse roteiro é um experimento de classificação binária em um conjunto menor de 2280 imagens de lesões cutâneas, que foi curado manualmente. Neste conjunto de dados, o número de imagens identificadas como mpox foi de 1.020, e as que foram categorizadas como outras foram 1.260. A outra categoria envolve a apresentação de aparências dermatológicas não relacionadas à variação e que têm caráter visual, principalmente lesões em que o manuscrito se refere a elas como lesões semelhantes à catapora esarampo 25. Essa nomenclatura dual torna esse agrupamento binário clinicamente significativo como uma formulação primitiva de triagem, pois o modelo questiona se o modelo é capaz de desagregar mpox suspeita e alternativas visualmente confusas, mas também é menos complexo do que um benchmark dermatológico multiclasse completo.
O treinamento dos modelos precisava ser padronizado, com todas as imagens pré-processadas antes de serem treinadas. Redimensionamento, normalização de intensidade, aumento e conversão de rótulos categóricos para binários também são mencionados no manuscrito. No entanto, no sentido atualizado, esses passos são considerados componentes de um pipeline reproduzível e não como notas escritas na periferia. Seu array foi ainda dividido em subconjuntos de treinamento e validação consistindo em diretórios, e as métricas de desempenho mencionadas deveriam então ser vistas como impactos internos de validação no desempenho, em vez de indicadores de um grupo externo de testes completamente independente. Para ser mais claro, essa coleção de 2.280 imagens será considerada como o dado oficial sobre o qual será realizada a análise principal. O enquadramento binário foi escolhido porque reflete a pergunta da triagem precoce comum na prática: a imagem de uma lesão suspeita é mais provável de ser mpox do que outras condições visualmente semelhantes? Esse enquadramento é limitado em comparação com um diagnóstico dermatológico extenso, mas é um ponto de partida válido e tecnicamente interpretável para benchmarking comparativo.
A descrição atualizada do conjunto de dados também considera o fato de que o artigo inclui alguns resultados adicionais obtidos com a ajuda de diferentes estruturas de classes ou alguns subconjuntos enriquecidos, que são mostrados nas Figuras 1A–I. Em vez de excluir esses materiais, o manuscrito agora os contextualiza diretamente para permitir que os leitores vejam os resultados que fazem parte do benchmark binário e os que fazem parte de experimentos secundários. Esse método manterá toda a documentação deste estudo, mas não permitirá a integração de experimentos incompatíveis em uma única afirmação.