Artigo de investigação

HMP-MUNet: Um Framework Híbrido de Deep Learning para Segmentação Automatizada de Lesões de Pele em Imagens Dermoscópicas

167 vistas

DOI:

10.3791/69449

17 de março de 2026

* These authors contributed equally

Neste artigo

Resumo

O HP-MUNet introduz uma estrutura híbrida de deep learning para segmentação automatizada de lesões de pele. Ao integrar Modelos de Espaço de Estado com mecanismos de atenção multiescala, ela aprimora a precisão da segmentação enquanto otimiza a eficiência computacional, oferecendo uma solução robusta para diagnóstico de câncer de pele em ambientes clínicos.

Resumo

Sistemas de diagnóstico assistido por computador para lesões cutâneas enfrentam desafios significativos para alcançar alta precisão diagnóstica e eficiência computacional. As abordagens atuais de aprendizado profundo frequentemente exigem recursos computacionais substanciais, enquanto lutam para capturar as variações morfológicas complexas inerentes às lesões cutâneas em diferentes escalas. High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet), uma nova estrutura de deep learning que aborda essas limitações por meio de um design arquitetônico inovador que combina Modelos de Espaço de Estado com avançadas capacidades de processamento multiescala.

A abordagem descrita neste estudo integra uma estrutura híbrida U-Net que combina um módulo de espaço de estados de visão de alta ordem para modelagem de contexto global, uma rede de fusão de atenção dilatada em múltiplas escalas para extração hierárquica de características em múltiplos campos receptivos, e uma rede flexível paralela multi-profundidade para otimização computacional. Essa arquitetura utiliza um codificador-decodificador em formato de U modificado com dimensões de canal aumentadas e mecanismos avançados de atenção para aprimorar o aprendizado de características.

Uma avaliação abrangente em conjuntos de dados de referência mostra um Coeficiente de Similaridade de Dice de 95,85% no PH2 e 90,44% no ISIC2018. O modelo alcança essa precisão superior usando apenas 7,61 milhões de parâmetros, representando uma redução notável de 72,2% em comparação com as arquiteturas Vision Mamba existentes, mantendo alta precisão de segmentação. O design leve mostra potencial para implantação em diversos ambientes clínicos e modalidades de imagem, dependendo da validação clínica, desde centros dermatológicos especializados até instituições de atenção primária.

O HMP-MUNet oferece uma solução automatizada para segmentação de lesões cutâneas que melhora a consistência diagnóstica e apoia fluxos de trabalho clínicos, com potencial para validação adicional no uso clínico. A integração das capacidades de modelagem de alto nível com considerações práticas de implantação oferece uma solução potencial para melhorar os protocolos de rastreamento do câncer de pele e expandir a acessibilidade à saúde em aplicações de diagnóstico assistido por computador.

Introdução

Os sistemas de diagnóstico assistido por computador (CAD) visam aprimorar as práticas de imagem médica em diversas especialidades clínicas, aprimorando a detecção, o diagnóstico e o planejamento de tratamentosde doenças. Em dermatologia, a integração da inteligência artificial (IA) e técnicas avançadas de imagem emergiu como uma ferramenta fundamental para melhorar a precisão diagnóstica e os resultados clínicos, especialmente na detecção precoce do câncer de pele, que responde por aproximadamente 90% de todas as malignidadesde pele 2. O desenvolvimento de abordagens algorítmicas sofisticadas para análise automatizada de lesões cutâneas contribui para o avanço da medicina de precisão, permitindo suporte diagnóstico padronizado e reprodutível que aprimora a tomada de decisão clínica em diversos ambientesde saúde 3,4.

A imagem dermatológica moderna abrange múltiplas modalidades, incluindo dermoscopia, fotografia digital, tomografia de coerência óptica e sistemas de imagemmultiespectral 5. Profissionais de saúde utilizam imagens dermoscópicas para diagnosticar manualmente o câncer de pele por meio de métodos laborosos e demorados, que exigem considerável expertise6. O desafio de manter a consistência diagnóstica entre diferentes ambientes clínicos e condições de imagem impulsionou o desenvolvimento de sistemas CAD que fornecem análise objetiva e quantitativa de lesões cutâneas. A segmentação das lesões cutâneas a partir de imagens dermoscópicas constitui uma etapa fundamental de pré-processamento que impacta diretamente a precisão subsequente da classificação e a utilidadeclínica 7. Geralmente, o diagnóstico assistido por computador do câncer de pele envolve cinco etapas: aquisição de imagens, pré-processamento, segmentação, extração de características eclassificação 8. A delimitação precisa dos limites é essencial para a caracterização exata das lesões, permitindo que os profissionais avaliem características morfológicas como assimetria, irregularidade das bordas, variação de cor e diâmetro — parâmetros-chave nos critérios diagnósticosestabelecidos 9.

O surgimento dos Modelos de Estado-Espaço (SSMs), particularmente a arquitetura Mamba, oferece complexidade computacional linear, melhorando a eficiência computacional enquanto mantém capacidades superiores de modelagem de dependências de longoalcance 10. Avanços recentes na segmentação de lesõescutâneas 11, comoU-Net 9, Att-UNet12, UTNetV213 e UNet++14 , demonstraram melhorias notáveis na precisão da segmentação. Por exemplo, o U-Net alcança um Coeficiente de Similaridade de Dados (DSC) de 87,55% no conjunto de dados ISIC2018, enquanto o UNet++ alcança 87,83% e o Att-UNet alcança 87,91%. No conjunto de dados PH2, o U-Net atinge um DSC de 90,6%, enquanto o C2SDG15 e oSCR-Net 16alcançam 90,3% e 89,89%, respectivamente. O HP-MUNet aprimora esses modelos ao integrar um mecanismo de atenção multiescala e capacidades de processamento paralelo, reduzindo a contagem de parâmetros em 72,2% enquanto alcança uma precisão superior com um DSC de 95,85% no conjunto de dados PH2 e 90,44% no conjunto de dados ISIC2018. Dada a importância de equilibrar capacidades de aprendizado de representações visuais com o consumo de recursos computacionais, explorar arquiteturas genéricas de classificação de imagens médicas que alcançam os melhores compromissos é significativo para o desenvolvimento de sistemas de diagnóstico clínicointeligente 17. A estrutura estruturada do SSMs espacial aprimora as arquiteturas tradicionais Mamba ao otimizar matrizes de transição de estado, melhorar a eficiência computacional e reduzir a sobrecarga de memória — características essenciais para a implantação clínica em diversas modalidadesde imagem 18.

Pesquisas recentes demonstram que arquiteturas Vision Mamba, especialmente aquelas que utilizam o Esquema de Comutação Baseado em Vision Mamba de Alta Ordem (H-VSS), alcançam desempenho superior com contagem de parâmetros significativamente reduzida em comparação com transformadores convencionais, tornando-as particularmente adequadas para integração de fluxo de trabalhoclínico 19. No entanto, implementações existentes do Vision Mamba enfrentam desafios, incluindo limitações no consumo de memória e restrições de escalabilidade sob condições clínicasde implantação 20. Os métodos atuais de segmentação de imagens médicas geralmente são divididos em CNNs e modelos baseados em transformadores, onde CNNs tradicionais são limitadas por restrições de campo receptivo, tornando a captura de dependência de longo alcancedesafiadora 21. Na imagem médica, distinguir regiões críticas, como lesões, da pele saudável exige alta precisão, exigindo a adoção de soluções tecnológicas avançadas para enfrentar essesdesafios 22. Arquiteturas contemporâneas de segmentação evoluíram para atender a requisitos clínicos específicos, incluindo eficiência computacional para aplicações em tempo real, precisão para tarefas diagnósticas críticas e robustez em diversos protocolos de imagem23. Variantes avançadas do U-Net incorporando mecanismos de atenção, estratégias de fusão de características em múltiplas escalas e codificadores baseados em transformadores demonstraram desempenho superior em cenários complexos de imagem médica12,24. Essas inovações arquitetônicas aprimoram diretamente as aplicações clínicas ao permitir a delimitação precisa de estruturas anatômicas, identificação de regiões patológicas e extração de biomarcadores quantitativos, todos cruciais para a medicina baseada emevidências 25,26. No entanto, desafios de integração, incluindo compatibilidade de interface com prontuários eletrônicos médicos (EMR) existentes, armazenamento e recuperação de imagens grandes e interoperabilidade entre diferentes sistemas institucionais, continuam sendo obstáculos significativos para a adoção clínicaampla 27.

Este artigo apresenta o High-order Multi-scale Parallel Vision Mamba U-Net (HMP-MUNet), um sistema CAD inovador projetado especificamente para segmentação automatizada de lesões cutâneas na prática clínica. A estrutura aqui aborda lacunas críticas nos sistemas atuais de imagem médica incorporando componentes arquitetônicos inovadores: a Multi-Scale Dilated Attention Fusion Network (MSDAFN) e a Parallel Multi-depth Flexible Network (PMFlex). O MSDAFN implementa estratégias sofisticadas de extração de características que combinam mecanismos de atenção espacial e de canal com convoluções dilatadas em múltiplas escalas, permitindo a detecção aprimorada de características sutis de lesões em diferentes escalas — crucial para o diagnóstico preciso dos diversos tipos de lesões encontradas na práticaclínica 28. O PMFlex introduz capacidades de processamento paralelo que permitem a análise simultânea de múltiplos fluxos de entrada, melhorando significativamente a eficiência computacional enquanto mantém capacidades de modelagem de alta ordem essenciais para a precisão de nívelclínico 29. O HMP-MUNet, por meio de suas técnicas inovadoras de segmentação e estratégias computacionais, busca expandir os limites do diagnóstico de câncer de pele, possibilitando um diagnóstico clínico precisoe em tempo real 30,31.

As principais contribuições desta pesquisa estão alinhadas com os objetivos centrais de avançar a CAD em imagem médica: aprimoramento da modelagem global do contexto por meio do MSDAFN, aprimorando a extração de características e a eficiência da fusão para localização precisa de lesões em diversas apresentações clínicas; processamento paralelo eficiente via PMFlex reduzindo a sobrecarga computacional enquanto mantém a precisão de nível clínico, facilitando a implantação em ambientes clínicos com recursos limitados; otimização de implantação clínica por meio de design consciente de hardware, permitindo processamento eficiente de imagens dermoscópicas de alta resolução que suportam fluxos de trabalho clínicos em tempo real; Desempenho clínico demonstrado por meio de avaliação abrangente em conjuntos de dados padrão com métricas de desempenho adequadas para integração clínica; e solução diagnóstica integrada que combina modelagem de alta ordem, análise em múltiplas escalas e computação paralela, fornecendo soluções abrangentes para diagnóstico dermatológico de precisão. Essa pesquisa avança a imagem médica computadorizada ao fornecer soluções inovadoras e clinicamente aplicáveis, atendendo tanto aos requisitos tecnológicos quanto práticos para análise automatizada de lesões cutâneas em ambientes de saúde contemporâneos.

A estrutura foi projetada para lidar com imagens dermoscópicas de alta resolução, tipicamente com resoluções de entrada de 256 × 256, proporcionando um equilíbrio entre eficiência computacional e detalhe da imagem. No entanto, a variabilidade no equipamento e na qualidade da imagem, como diferenças na iluminação, tom de pele e presença de cabelo, pode afetar o desempenho da segmentação. Apesar desses desafios, o design do sistema é otimizado para fluxos de trabalho clínicos em tempo real e é adaptável a diferentes dispositivos de imagem, garantindo desempenho robusto em diversos ambientes clínicos.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Esta pesquisa foi realizada em conformidade com as diretrizes institucionais para pesquisa computacional e processamento de dados. Nenhum sujeito humano ou animal vertebrado esteve envolvido neste estudo.

Preparação e pré-processamento de conjuntos de dados

Coleta e organização de conjuntos de dados

Imagens dermoscópicas foram coletadas dos conjuntos de dados PH2, ISIC2018 e ISIC2017, com links específicos fornecidos na Tabela de Materiais. O conjunto de dados PH2 contém 200 imagens de alta resolução (1000 × 1000 pixels), ISIC2018 inclui 2.594 imagens com máscaras de segmentação correspondentes, e ISIC2017 inclui 2.150 imagens com máscaras de segmentação. Os dados foram organizados em conjuntos de treinamento, validação e teste seguindo protocolos padrão, garantindo que as imagens estejam em formatos compatíveis (por exemplo, .jpg, .png ou .tiff) e incluam máscaras de verdade terrestre correspondentes em formato binário.

Os dados foram organizados em conjuntos de treinamento, validação e teste seguindo protocolos padrão. Os conjuntos de dados foram divididos da seguinte forma: para ISIC2018, 1.815 imagens foram alocadas para treinamento, 259 para validação e 520 para testes. Para ISIC2017, 1.500 imagens foram alocadas para treinamento, 220 para validação e 430 para testes. Para PH2, o conjunto de dados foi dividido em 160 imagens de treinamento, 10 imagens de validação e 30 imagens de teste. Uma resolução de imagem consistente de 256 × 256 pixels foi mantida durante todo o pipeline de pré-processamento.

Ampliação e normalização de dados

Técnicas de aumento de dados foram aplicadas para aprimorar a generalização dos modelos. Foram implementados giros horizontais, verticais e rotação aleatória dentro de uma faixa de ±15°. Correção gama e transformação logarítmica foram aplicadas com probabilidade de 0,3 cada. Os valores dos pixels foram normalizados usando estatísticas do ImageNet (média = [0,485, 0,456, 0,406], desvio padrão = [0,229, 0,224, 0,225]).

Redimensione todas as imagens de entrada para 256 × 256 pixels: Para garantir eficiência computacional, todas as imagens de entrada foram redimensionadas para uma resolução uniforme de 256 × 256 pixels. Embora imagens de alta resolução, como as do conjunto de dados (1000 × 1000 pixels), contenham detalhes detalhados e informações de textura cruciais para a delimitação precisa dos limites das lesões, aumentar a resolução não melhorou significativamente o desempenho do modelo. Portanto, a resolução não foi aumentada para manter um equilíbrio entre eficiência computacional e precisão do modelo. Trabalhos futuros podem investigar mais a fundo os efeitos de entradas de maior resolução para determinar se os benefícios na precisão da segmentação justificam o aumento do custo computacional. As imagens eram convertidas para o formato RGB quando necessário. Os dados pré-processados eram salvos em diretórios estruturados, mantendo as divisões originais do conjunto de dados.

Implementação da arquitetura HMP-MUNet

Design da arquitetura de rede

O HMP-MUNet foi configurado seguindo a estrutura hierárquica codificador-decodificador em formato de U, conforme mostrado na Figura 1. A rede foi configurada com expansão progressiva de canais: 8→16→32→64→128→256 canais entre os níveis do codificador.

Uma mudança arquitetônica significativa foi feita ao reduzir a profundidade da rede de quatro níveis hierárquicos para dois, o que ajuda a simplificar o modelo e melhorar a eficiência computacional. Embora a profundidade seja reduzida, as dimensões do canal foram aumentadas em cada nível, permitindo que a rede capturasse características mais ricas e expressivas. Para aprimorar ainda mais o aprendizado de características do modelo, mecanismos de atenção foram introduzidos para focar a rede nas características mais relevantes em múltiplas escalas. Esses mecanismos de atenção compensam efetivamente a possível perda da abstração hierárquica de características devido à arquitetura mais rasa.

O codificador foi inicializado com operações duplas Conv2D para extração inicial de características dos tensores de entrada X(C, H×W). A configuração alternada de três módulos especializados foi implementada: Esquema de Comutação Baseado em Vision Mamba de Alta Ordem (H-VSS), Rede Paralela Flexível Multi-Profundidade (PMFlex) e Rede de Fusão de Atenção Dilatada Multi-Escala (MSDAFN).

O modelo utiliza estatísticas do ImageNet (média e desvio padrão) para normalização, evitando a necessidade de recalcular para cada conjunto de dados, melhorando assim a eficiência computacional. Ele garante estabilidade e generalizabilidade, aproveitando o uso extensivo do ImageNet em tarefas de visão computacional. Essa escolha simplifica o design ao reduzir a complexidade do pré-processamento e aprimora a transferibilidade entre conjuntos de dados, permitindo que o modelo se generalize efetivamente entre diversas imagens de lesões cutâneas.

Implementação do esquema de comutação baseado em mamba de visão de alta ordem (H-VSS)                

O módulo H-VSS foi implementado de acordo com a arquitetura da Figura 2. A Normalização de Camada (LN) e a ativação Hardswish (HS) foram configuradas com conexões residuais seguindo a Equação (1):

figure-protocol-1

O componente Local Espacial Descriptor (LSD) foi implementado para manter a coerência espacial. O módulo de Varredura Espacial Seletiva 2D (SS2D) foi configurado com padrões de varredura multidirecionais seguindo a Equação (2):

figure-protocol-2

O processamento Multi-Layer Perceptron (MLP) foi adicionado com conexões residuais conforme especificado na Equação (3):

figure-protocol-3

O mecanismo de Varredura Seletiva 2D de Alta Ordem (H-SS2D) projeta recursos de entrada para o espaço bidimensional para modelagem contextual aprimorada.

Implementação de rede flexível paralela multi-profundidade (PMFlex)

O módulo PMFlex foi configurado de acordo com as especificações da Figura 3 . A Normalização de Camada foi aplicada aos mapas de características de entrada X(C, H×W), depois particionada em quatro segmentos ao longo da dimensão do canal seguindo a Equação (4):

figure-protocol-4

Cada Y_i segmentada de recurso era processada por meio de módulos compartilhados do Visual Mamba (VMamba). As saídas processadas foram concatenadas, e o refinamento foi aplicado por meio da Normalização de Camada e projeção, conforme descrito na Equação (5):

figure-protocol-5

Implementação da rede de fusão de atenção dilatada em múltiplas escalas (MSDAFN)

O módulo MSDAFN foi implementado seguindo a arquitetura da Figura 4. Operações de convolução paralelas foram configuradas com taxas de dilatação de 6, 12 e 18 para extração de características em múltiplas escalas de acordo com a Equação (6):

figure-protocol-6

Recursos multiescala foram integrados por meio de concatenação de canais conforme especificado na Equação (7):

figure-protocol-7

Mecanismos de atenção dupla foram implementados para recalibração de características. Os pesos de atenção dos canais foram calculados usando o agrupamento médio global seguindo a Equação (8):

figure-protocol-8

A ponderação de atenção do canal foi aplicada conforme descrito na Equação (9):

figure-protocol-9

A atenção espacial foi configurada por meio de operações de convolução seguindo a Equação (10):

figure-protocol-10

A atenção do canal e espacial foi combinada conforme especificado na Equação (11):

figure-protocol-11

Configuração e otimização do treinamento

Configuração do ambiente

O ambiente experimental foi configurado em um sistema Ubuntu 20.04 com GPU (32 GB de VRAM). Python 3.8, framework de deep learning (RRID: SCR_018536) e CUDA 11.8 foram instalados. O tamanho da imagem de entrada foi definido para 256 × 256 pixels para tarefas de lesões cutâneas.

Função de perda e configuração do otimizador

A função de perda do BceDice foi implementada para otimização de treinamento. O otimizador AdamW foi configurado com taxa inicial de aprendizado de 0,001, tamanho de lote de 8 e 250 épocas de treinamento. Foi aplicada uma redução de peso de 1 × 10⁻5 para regularização.

Para a configuração base, este estudo refere-se ao trabalho de Liu et al. (2024) no modelo Vmamba, que foi usado como modelo visual de espaço de estados para a tarefa11 de classificação de imagens médicas. As configurações exatas e scripts usados para implementar o Vmamba são baseados em seus trabalhos publicados e adaptados para este estudo, com ajustes específicos para melhor se adequar ao conjunto de dados de imagem médica.

O escalonamento da taxa de aprendizado foi configurado usando recozimento cosseno com reinicializações em quente. Configure T_0 = 10 épocas para o período inicial de reinício, T_mult = 2 para multiplicação de períodos, e η_min = 1 × 10⁻6 para a taxa mínima de aprendizado.

Otimização de hiperparâmetros

Para garantir reprodutibilidade e consistência, todos os experimentos foram realizados usando uma semente aleatória fixa de 42. A otimização sistemática dos hiperparâmetros foi conduzida focando no tamanho do lote, taxa de aprendizado e taxa de caminho de drop. Foram avaliados os tamanhos dos lotes 4, 8, 16 e 32. As taxas de aprendizado de 0,0005, 0,001, 0,0015 e 0,002 foram testadas. O desempenho da validação foi monitorado usando o Coeficiente de Similaridade de Dados (DSC) como métrica principal. Tamanhos de lote maiores que 8 podem levar ao excesso de memória em GPUs com menos de 32 GB de VRAM.

Avaliação de modelos e avaliação de desempenho

Configuração das métricas de avaliação

Métricas de avaliação abrangentes, incluindo Interseção Média sobre União (mIoU), Coeficiente de Similaridade de Dados (DSC), Sensibilidade (Sen), Especificidade (Spe) e Precisão (Acc), foram implementadas. As métricas foram calculadas segundo as seguintes formulações:

A Interseção Média sobre União (mIoU) quantifica a sobreposição entre a segmentação de verdade prevista e a segmentação de verdade:

figure-protocol-12

O Coeficiente de Similaridade de Dados (DSC) mede a consistência da segmentação. Os valores variam de 0 a 1, com valores mais altos indicando melhor desempenho:

figure-protocol-13

Sensibilidade (Sen) mede a capacidade do modelo de detectar amostras positivas:

figure-protocol-14

A especificidade S(Spe) avalia o reconhecimento correto negativo da amostra:

figure-protocol-15

A precisão (Acc) mede a correção geral da previsão:

figure-protocol-16

Parâmetros (M) refletem a complexidade do modelo, medindo parâmetros totais treináveis:

figure-protocol-17

onde Pi é o número de parâmetros na i-ésima camada, e N é o número total de camadas. Contagens menores de parâmetros indicam modelos mais leves, adequados para implantação clínica.

Protocolo do estudo de ablação

Estudos ablativos de ablação foram realizados para validar contribuições dos componentes arquitetônicos após o desenho experimental na Tabela 1. Quatro variantes arquitetônicas foram avaliadas: H-MUNet (linha de base sem MSDAFN e PMFlex), HP-MUNet (sem MSDAFN), HM-MUNet (sem PMFlex) e HMP-MUNet (modelo completo).

Parâmetros de treinamento idênticos foram configurados em todas as variantes: taxa de aprendizado 0,001, tamanho do lote 8, 250 épocas. A convergência do treinamento foi monitorada e melhorias de desempenho foram validadas para cada adição de componente.

Análise de eficiência computacional

As métricas de eficiência computacional, incluindo contagem de parâmetros, FLOPs e tempo de inferência entre diferentes arquiteturas, foram medidas. A avaliação do tempo de inferência do modelo em uma GPU de grau clínico padrão mostra que, embora tenha melhor desempenho em GPUs de alto desempenho, o modelo é aproximadamente 70% mais lento em hardware mais comumente utilizado. No entanto, ainda é capaz de velocidades de inferência eficientes, tornando-o adequado para implantação clínica prática. Monitore o uso da memória da GPU durante o treinamento para garantir a estabilidade do sistema. Mínimo recomendado de 16 GB de memória GPU para tamanho 8 do lote.

Validação e análise

Benchmarking de desempenho

O desempenho do HMP-MUNet foi comparado com métodos de ponta em ambos os conjuntos de dados. Todos os modelos comparados foram implementados e treinados sob os mesmos protocolos de divisão de dados, pré-processamento, aumento de dados e treinamento para garantir que as diferenças de desempenho fossem exclusivamente devido a diferenças arquitetônicas. Os resultados quantitativos, incluindo melhorias de 2,89% e 5,25% nos conjuntos de dados ISIC2018 e PH2, foram documentados, respectivamente. O estudo validou que a contagem de parâmetros foi reduzida 4,55 vezes em comparação com a linha de base do U-Net.

Análise estatística

Testes de significância estatística foram realizados usando testes t pareados para comparações de desempenho. Intervalos de confiança foram calculados para as métricas relatadas. A reprodutibilidade foi garantida por meio de múltiplas corridas de treinamento com diferentes sementes aleatórias.

As configurações ótimas de hiperparâmetros foram registradas como tamanho de lote 8 e taxa de aprendizado 0,001, alcançando um pico de DSC de 0,9585 no conjunto de dados PH2 e 0,9044 no conjunto de dados ISIC2018, conforme documentado nos resultados experimentais. Dados de validação suficientes foram garantidos para evitar sobreajustamento. Curvas de perda de validação foram monitoradas para aplicar critérios de parada precoce.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Projeto da arquitetura HMP-MUNet para segmentação de imagens médicas

A arquitetura proposta HMP-MUNet demonstrou desempenho excepcional em tarefas automatizadas de segmentação de lesões cutâneas. A Figura 1 ilustra toda a arquitetura da rede, apresentando a estrutura hierárquica codificador-decodificador em forma de U com expansão progressiva de canal de 8 para 256 canais. A integração de três módulos especializad...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Este estudo apresenta o HMP-MUNet (High-order Multi-scale Parallel Vision Mamba U-Net), uma nova estrutura de aprendizado profundo que aborda desafios fundamentais no diagnóstico assistido por computador (CAD) para segmentação de lesões cutâneas por meio da integração inovadora de Modelos de Estado-Espaço (SSMs) com componentesarquitetônicos avançados 1. A abordagem descrita aqui demonstra que combinar mecanismos de interação de características de alta ordem com a...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Os autores declaram que não têm conflitos de interesse relacionados a essa pesquisa. Não existem relações financeiras entre os autores e quaisquer entidades comerciais que possam influenciar inadequadamente a obra apresentada neste manuscrito. Esta pesquisa foi conduzida de forma independente, e os achados e conclusões são exclusivamente dos autores. O texto deste manuscrito foi revisado e aprimorado com a ajuda do ChatGPT, já que o inglês não é a língua nativa dos autores. Os autores confirmam que o uso da assistência de IA se limitou à edição de linguagem e não envolveu nenhuma geração ou análise de conteúdo que pudesse afetar a integridade científica do trabalho.

Agradecimentos

Os autores agradecem com gratidão o apoio financeiro fornecido pelo Projeto de Pesquisa Científica do Departamento de Educação da Província de Liaoning sob a Bolsa LJ212510149013 e Programa Geral da Fundação Nacional de Ciências Naturais da Província de Liaoning 2024-MSLH-377, que tornou essa pesquisa possível. Agradecemos aos participantes e instituições da pesquisa que contribuíram para os conjuntos de dados públicos utilizados neste estudo, que permitiram a validação abrangente da metodologia proposta.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
CUDA 11.8NVIDIA Corporation, Santa Clara, CA, EUASoftware
GPU (32 GB VRAM)NVIDIASistema operacional
ISIC2017 Conjunto de DadosDesafio ISIChttps://challenge.isic-archive.com/dataConjuntos de dados
ISIC2018 Conjunto de DadosDesafio ISIChttps://challenge.isic-archive.com/dataConjuntos de dados
NVIDIA V100 GPUNVIDIA Corporation, Santa Clara, CA, EUAHardware
Conjunto de Dados PH2Universidade Do Portohttps://www.fc.up.pt/addi/ph2Conjuntos de dados
Python 3.8PythonRRID:SCR_018536Software
PyTorch 1.13.0PyTorchRRID:SCR_018536Software
Ubuntu 20.04CanônicoHardware

Referências

  1. Maurya, S., et al. A review on recent developments in cancer detection using machine learning and deep learning models. Biomed Signal Process Control. 80 (2), 104398(2023).
  2. Siegel, R. L., Miller, K. D., Wagle, N. S., Jemal, A. Cancer statistics, 2023. CA Cancer J Clin. 73 (1), 17-48 (2023).
  3. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542 (7639), 115-118 (2017).
  4. Haenssle, H. A., et al. against machine: diagnostic performance of a deep learning convolutional neural network for dermoscopic melanoma recognition in comparison to 58 dermatologists. Ann Oncol. 29 (8), 1836-1842 (2018).
  5. Argenziano, G., et al. Dermoscopy of pigmented skin lesions: results of a consensus meeting via the Internet. J Am Acad Dermatol. 48 (5), 679-693 (2003).
  6. Naeem, A., et al. SNC_Net: skin cancer detection by integrating handcrafted and deep learning-based features using dermoscopy images. Mathematics. 12 (7), 1030(2024).
  7. Celebi, M. E., et al. A state-of-the-art survey on lesion border detection in dermoscopy images. Dermoscopy Image Anal. 10, 97-129 (2015).
  8. Nachbar, F., et al. The ABCD rule of dermatoscopy: high prospective value in the diagnosis of doubtful melanocytic skin lesions. J Am Acad Dermatol. 30 (4), 551-559 (1994).
  9. Ronneberger, O., Fischer, P., Brox, T. U-net: convolutional networks for biomedical image segmentation. Med Image Comput Comput Assist Interv. 9351, 234-241 (2015).
  10. Gu, A., Dao, T. Mamba:linear-time sequence modeling with selective state spaces. arXiv. , (2023).
  11. Liu, Y., et al. Vmamba: visual state space model. Adv Neural Inf Process Syst. 37, 103031-103063 (2024).
  12. Zhang, J., Zhu, H., Wang, P., Ling, X. ATT squeeze U-net: a lightweight network for forest fire detection and recognition. IEEE Access. 9, 10858-10870 (2021).
  13. U-net v2: rethinking the skip connections of U-net for medical image segmentation. Peng, Y., Chen, D. Z., Sonka, M. 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, , (2025).
  14. Zhou, Z., et al. UNet++: a nested U-net architecture for medical image segmentation. Deep Learn Med Image Anal Multimodal Learn Clin Decis Support (2018). 11045, 3-11 (2018).
  15. Hu, S., Liao, Z., Xia, Y. Devil is in channels: contrastive single domain generalization for medical image segmentation. Medical Image Computing and Computer Assisted Intervention – MICCAI 2023. , Springer. Cham. (2023).
  16. Xu, W., Wang, Z. SCRNet:spatial-channel regulation network for medical ultrasound image segmentation. arXiv. arXiv. , (2025).
  17. Yue, Y., Li, Z. MedMamba: vision mamba for medical image classification. arXiv. , (2024).
  18. Efficiently modeling long sequences with structured state spaces. Gu, A., Goel, K., Ré, C. Proc Int Conf Mach Learn, 162, 8098-8109 (2022).
  19. Wu, R., Liu, Y., Liang, P., Chang, Q. UltraLight VM-UNet: parallel vision mamba significantly reduces parameters for skin lesion segmentation. arXiv. , (2024).
  20. Wu, R., Liu, Y., Liang, P., Chang, Q. H-vmunet:high-order vision mamba unet for medical image segmentation. Neurocomput. 624, 129447(2025).
  21. Fully convolutional networks for semantic segmentation. Long, J., Shelhamer, E., Darrell, T. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, , (2015).
  22. Chen, J., et al. TransUNet: transformers make strong encoders for medical image segmentation. arXiv. , (2021).
  23. Cao, H., et al. Swin-unet:unet-like pure transformer for medical image segmentation. Lect Notes Comput Sci. 13803, 205-218 (2023).
  24. Ibtehaz, N., Rahman, M. S. MultiResUNet: rethinking the U-net architecture for multimodal biomedical image segmentation. Neural Netw. 121, 74-87 (2020).
  25. Aruk, I., Pacal, I., Toprak, A. N. A novel hybrid ConvNeXt-based approach for enhanced skin lesion classification. Expert Syst Appl. 283, 127721(2025).
  26. Pacal, I., et al. A novel CNN-ViT-based deep learning model for early skin cancer diagnosis. Biomed Signal Process Control. 104, 107627(2025).
  27. Zhang, D. Y., et al. Implementation of digital pathology and artificial intelligence in routine pathology practice. Lab Invest. 104 (9), 102111(2024).
  28. Malunet: a multi-attention and lightweight unet for skin lesion segmentation. Ruan, J., Xiang, S., Xie, M., Liu, T., Fu, Y. 2022 IEEE International Conference on Bioinformatics and Biomedicine (BIBM), Las Vegas, NV, USA, , (2022).
  29. Wu, R., et al. Mhorunet:high-order spatial interaction unet for skin lesion segmentation. Biomed Signal Process Control. 88, 105517(2024).
  30. Pacal, I., Attallah, O. Hybrid deep learning model for automated colorectal cancer detection using local and global feature extraction. Knowl Based Syst. 319, 113625(2025).
  31. Pacal, I., Attallah, O. InceptionNeXt-transformer: a novel multi-scale deep feature learning architecture for multimodal breast cancer diagnosis. Biomed Signal Process Control. 110, 108116(2025).
  32. Vaswani, A., et al. Attention is all you need. Adv Neural Inf Process Syst. 30, 5998-6008 (2017).
  33. Phillips, M., et al. Assessment of accuracy of an artificial intelligence algorithm to detect melanoma in images of skin lesions. JAMA Netw Open. 2 (10), e1913436(2019).
  34. Wang, S., et al. Linformer:self-attention with linear complexity. arXiv. , (2020).
  35. A simple framework for contrastive learning of visual representations. Chen, T., et al. Proceedings of the 37th International Conference on Machine Learning, 119, Vienna, Austria. 1597-1607 (2020).
  36. Huang, S. C., et al. Fusion of medical imaging and electronic health records using deep learning: a systematic review and implementation guidelines. NPJ Digit Med. 3, 136(2020).
  37. Litjens, G., et al. A survey on deep learning in medical image analysis. Med Image Anal. 42, 60-88 (2017).
  38. Campanella, G., et al. Clinical-grade computational pathology using weakly supervised deep learning on whole slide images. Nat Med. 25 (8), 1301-1309 (2019).
  39. Gulshan, V., et al. Development and validation of a deep learning algorithm for detection of diabetic retinopathy in retinal fundus photographs. JAMA. 316 (22), 2402-2410 (2016).
  40. McKinney, S. M., et al. International evaluation of an AI system for breast cancer screening. Nat. 577 (7788), 89-94 (2020).
  41. Krizhevsky, A., Sutskever, I., Hinton, G. E. ImageNet classification with deep convolutional neural networks. Commun ACM. 60 (6), 84-90 (2017).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Arquitetura U NetModelos de Espa o de EstadosProcessamento MultiescalaMecanismos de Aten oDiagn stico Auxiliado por ComputadorExtra o de Caracter sticasVision Mamba

Artigos relacionados