Esta pesquisa foi realizada em conformidade com as diretrizes institucionais para pesquisa computacional e processamento de dados. Nenhum sujeito humano ou animal vertebrado esteve envolvido neste estudo.
Preparação e pré-processamento de conjuntos de dados
Coleta e organização de conjuntos de dados
Imagens dermoscópicas foram coletadas dos conjuntos de dados PH2, ISIC2018 e ISIC2017, com links específicos fornecidos na Tabela de Materiais. O conjunto de dados PH2 contém 200 imagens de alta resolução (1000 × 1000 pixels), ISIC2018 inclui 2.594 imagens com máscaras de segmentação correspondentes, e ISIC2017 inclui 2.150 imagens com máscaras de segmentação. Os dados foram organizados em conjuntos de treinamento, validação e teste seguindo protocolos padrão, garantindo que as imagens estejam em formatos compatíveis (por exemplo, .jpg, .png ou .tiff) e incluam máscaras de verdade terrestre correspondentes em formato binário.
Os dados foram organizados em conjuntos de treinamento, validação e teste seguindo protocolos padrão. Os conjuntos de dados foram divididos da seguinte forma: para ISIC2018, 1.815 imagens foram alocadas para treinamento, 259 para validação e 520 para testes. Para ISIC2017, 1.500 imagens foram alocadas para treinamento, 220 para validação e 430 para testes. Para PH2, o conjunto de dados foi dividido em 160 imagens de treinamento, 10 imagens de validação e 30 imagens de teste. Uma resolução de imagem consistente de 256 × 256 pixels foi mantida durante todo o pipeline de pré-processamento.
Ampliação e normalização de dados
Técnicas de aumento de dados foram aplicadas para aprimorar a generalização dos modelos. Foram implementados giros horizontais, verticais e rotação aleatória dentro de uma faixa de ±15°. Correção gama e transformação logarítmica foram aplicadas com probabilidade de 0,3 cada. Os valores dos pixels foram normalizados usando estatísticas do ImageNet (média = [0,485, 0,456, 0,406], desvio padrão = [0,229, 0,224, 0,225]).
Redimensione todas as imagens de entrada para 256 × 256 pixels: Para garantir eficiência computacional, todas as imagens de entrada foram redimensionadas para uma resolução uniforme de 256 × 256 pixels. Embora imagens de alta resolução, como as do conjunto de dados (1000 × 1000 pixels), contenham detalhes detalhados e informações de textura cruciais para a delimitação precisa dos limites das lesões, aumentar a resolução não melhorou significativamente o desempenho do modelo. Portanto, a resolução não foi aumentada para manter um equilíbrio entre eficiência computacional e precisão do modelo. Trabalhos futuros podem investigar mais a fundo os efeitos de entradas de maior resolução para determinar se os benefícios na precisão da segmentação justificam o aumento do custo computacional. As imagens eram convertidas para o formato RGB quando necessário. Os dados pré-processados eram salvos em diretórios estruturados, mantendo as divisões originais do conjunto de dados.
Implementação da arquitetura HMP-MUNet
Design da arquitetura de rede
O HMP-MUNet foi configurado seguindo a estrutura hierárquica codificador-decodificador em formato de U, conforme mostrado na Figura 1. A rede foi configurada com expansão progressiva de canais: 8→16→32→64→128→256 canais entre os níveis do codificador.
Uma mudança arquitetônica significativa foi feita ao reduzir a profundidade da rede de quatro níveis hierárquicos para dois, o que ajuda a simplificar o modelo e melhorar a eficiência computacional. Embora a profundidade seja reduzida, as dimensões do canal foram aumentadas em cada nível, permitindo que a rede capturasse características mais ricas e expressivas. Para aprimorar ainda mais o aprendizado de características do modelo, mecanismos de atenção foram introduzidos para focar a rede nas características mais relevantes em múltiplas escalas. Esses mecanismos de atenção compensam efetivamente a possível perda da abstração hierárquica de características devido à arquitetura mais rasa.
O codificador foi inicializado com operações duplas Conv2D para extração inicial de características dos tensores de entrada X(C, H×W). A configuração alternada de três módulos especializados foi implementada: Esquema de Comutação Baseado em Vision Mamba de Alta Ordem (H-VSS), Rede Paralela Flexível Multi-Profundidade (PMFlex) e Rede de Fusão de Atenção Dilatada Multi-Escala (MSDAFN).
O modelo utiliza estatísticas do ImageNet (média e desvio padrão) para normalização, evitando a necessidade de recalcular para cada conjunto de dados, melhorando assim a eficiência computacional. Ele garante estabilidade e generalizabilidade, aproveitando o uso extensivo do ImageNet em tarefas de visão computacional. Essa escolha simplifica o design ao reduzir a complexidade do pré-processamento e aprimora a transferibilidade entre conjuntos de dados, permitindo que o modelo se generalize efetivamente entre diversas imagens de lesões cutâneas.
Implementação do esquema de comutação baseado em mamba de visão de alta ordem (H-VSS)
O módulo H-VSS foi implementado de acordo com a arquitetura da Figura 2. A Normalização de Camada (LN) e a ativação Hardswish (HS) foram configuradas com conexões residuais seguindo a Equação (1):

O componente Local Espacial Descriptor (LSD) foi implementado para manter a coerência espacial. O módulo de Varredura Espacial Seletiva 2D (SS2D) foi configurado com padrões de varredura multidirecionais seguindo a Equação (2):

O processamento Multi-Layer Perceptron (MLP) foi adicionado com conexões residuais conforme especificado na Equação (3):

O mecanismo de Varredura Seletiva 2D de Alta Ordem (H-SS2D) projeta recursos de entrada para o espaço bidimensional para modelagem contextual aprimorada.
Implementação de rede flexível paralela multi-profundidade (PMFlex)
O módulo PMFlex foi configurado de acordo com as especificações da Figura 3 . A Normalização de Camada foi aplicada aos mapas de características de entrada X(C, H×W), depois particionada em quatro segmentos ao longo da dimensão do canal seguindo a Equação (4):

Cada Y_i segmentada de recurso era processada por meio de módulos compartilhados do Visual Mamba (VMamba). As saídas processadas foram concatenadas, e o refinamento foi aplicado por meio da Normalização de Camada e projeção, conforme descrito na Equação (5):

Implementação da rede de fusão de atenção dilatada em múltiplas escalas (MSDAFN)
O módulo MSDAFN foi implementado seguindo a arquitetura da Figura 4. Operações de convolução paralelas foram configuradas com taxas de dilatação de 6, 12 e 18 para extração de características em múltiplas escalas de acordo com a Equação (6):

Recursos multiescala foram integrados por meio de concatenação de canais conforme especificado na Equação (7):

Mecanismos de atenção dupla foram implementados para recalibração de características. Os pesos de atenção dos canais foram calculados usando o agrupamento médio global seguindo a Equação (8):

A ponderação de atenção do canal foi aplicada conforme descrito na Equação (9):

A atenção espacial foi configurada por meio de operações de convolução seguindo a Equação (10):

A atenção do canal e espacial foi combinada conforme especificado na Equação (11):

Configuração e otimização do treinamento
Configuração do ambiente
O ambiente experimental foi configurado em um sistema Ubuntu 20.04 com GPU (32 GB de VRAM). Python 3.8, framework de deep learning (RRID: SCR_018536) e CUDA 11.8 foram instalados. O tamanho da imagem de entrada foi definido para 256 × 256 pixels para tarefas de lesões cutâneas.
Função de perda e configuração do otimizador
A função de perda do BceDice foi implementada para otimização de treinamento. O otimizador AdamW foi configurado com taxa inicial de aprendizado de 0,001, tamanho de lote de 8 e 250 épocas de treinamento. Foi aplicada uma redução de peso de 1 × 10⁻5 para regularização.
Para a configuração base, este estudo refere-se ao trabalho de Liu et al. (2024) no modelo Vmamba, que foi usado como modelo visual de espaço de estados para a tarefa11 de classificação de imagens médicas. As configurações exatas e scripts usados para implementar o Vmamba são baseados em seus trabalhos publicados e adaptados para este estudo, com ajustes específicos para melhor se adequar ao conjunto de dados de imagem médica.
O escalonamento da taxa de aprendizado foi configurado usando recozimento cosseno com reinicializações em quente. Configure T_0 = 10 épocas para o período inicial de reinício, T_mult = 2 para multiplicação de períodos, e η_min = 1 × 10⁻6 para a taxa mínima de aprendizado.
Otimização de hiperparâmetros
Para garantir reprodutibilidade e consistência, todos os experimentos foram realizados usando uma semente aleatória fixa de 42. A otimização sistemática dos hiperparâmetros foi conduzida focando no tamanho do lote, taxa de aprendizado e taxa de caminho de drop. Foram avaliados os tamanhos dos lotes 4, 8, 16 e 32. As taxas de aprendizado de 0,0005, 0,001, 0,0015 e 0,002 foram testadas. O desempenho da validação foi monitorado usando o Coeficiente de Similaridade de Dados (DSC) como métrica principal. Tamanhos de lote maiores que 8 podem levar ao excesso de memória em GPUs com menos de 32 GB de VRAM.
Avaliação de modelos e avaliação de desempenho
Configuração das métricas de avaliação
Métricas de avaliação abrangentes, incluindo Interseção Média sobre União (mIoU), Coeficiente de Similaridade de Dados (DSC), Sensibilidade (Sen), Especificidade (Spe) e Precisão (Acc), foram implementadas. As métricas foram calculadas segundo as seguintes formulações:
A Interseção Média sobre União (mIoU) quantifica a sobreposição entre a segmentação de verdade prevista e a segmentação de verdade:

O Coeficiente de Similaridade de Dados (DSC) mede a consistência da segmentação. Os valores variam de 0 a 1, com valores mais altos indicando melhor desempenho:

Sensibilidade (Sen) mede a capacidade do modelo de detectar amostras positivas:

A especificidade S(Spe) avalia o reconhecimento correto negativo da amostra:

A precisão (Acc) mede a correção geral da previsão:

Parâmetros (M) refletem a complexidade do modelo, medindo parâmetros totais treináveis:

onde Pi é o número de parâmetros na i-ésima camada, e N é o número total de camadas. Contagens menores de parâmetros indicam modelos mais leves, adequados para implantação clínica.
Protocolo do estudo de ablação
Estudos ablativos de ablação foram realizados para validar contribuições dos componentes arquitetônicos após o desenho experimental na Tabela 1. Quatro variantes arquitetônicas foram avaliadas: H-MUNet (linha de base sem MSDAFN e PMFlex), HP-MUNet (sem MSDAFN), HM-MUNet (sem PMFlex) e HMP-MUNet (modelo completo).
Parâmetros de treinamento idênticos foram configurados em todas as variantes: taxa de aprendizado 0,001, tamanho do lote 8, 250 épocas. A convergência do treinamento foi monitorada e melhorias de desempenho foram validadas para cada adição de componente.
Análise de eficiência computacional
As métricas de eficiência computacional, incluindo contagem de parâmetros, FLOPs e tempo de inferência entre diferentes arquiteturas, foram medidas. A avaliação do tempo de inferência do modelo em uma GPU de grau clínico padrão mostra que, embora tenha melhor desempenho em GPUs de alto desempenho, o modelo é aproximadamente 70% mais lento em hardware mais comumente utilizado. No entanto, ainda é capaz de velocidades de inferência eficientes, tornando-o adequado para implantação clínica prática. Monitore o uso da memória da GPU durante o treinamento para garantir a estabilidade do sistema. Mínimo recomendado de 16 GB de memória GPU para tamanho 8 do lote.
Validação e análise
Benchmarking de desempenho
O desempenho do HMP-MUNet foi comparado com métodos de ponta em ambos os conjuntos de dados. Todos os modelos comparados foram implementados e treinados sob os mesmos protocolos de divisão de dados, pré-processamento, aumento de dados e treinamento para garantir que as diferenças de desempenho fossem exclusivamente devido a diferenças arquitetônicas. Os resultados quantitativos, incluindo melhorias de 2,89% e 5,25% nos conjuntos de dados ISIC2018 e PH2, foram documentados, respectivamente. O estudo validou que a contagem de parâmetros foi reduzida 4,55 vezes em comparação com a linha de base do U-Net.
Análise estatística
Testes de significância estatística foram realizados usando testes t pareados para comparações de desempenho. Intervalos de confiança foram calculados para as métricas relatadas. A reprodutibilidade foi garantida por meio de múltiplas corridas de treinamento com diferentes sementes aleatórias.
As configurações ótimas de hiperparâmetros foram registradas como tamanho de lote 8 e taxa de aprendizado 0,001, alcançando um pico de DSC de 0,9585 no conjunto de dados PH2 e 0,9044 no conjunto de dados ISIC2018, conforme documentado nos resultados experimentais. Dados de validação suficientes foram garantidos para evitar sobreajustamento. Curvas de perda de validação foram monitoradas para aplicar critérios de parada precoce.