A segmentação de imagens médicas é uma tarefa fundamental nos campos de visão computacional e análise de imagensmédicas 1,2,3. Envolve a partição de uma imagem em múltiplas regiões ou objetos para análise e processamento posteriores. Essa tecnologia é particularmente importante em imagem médica porque auxilia os profissionais a identificar e localizar regiões patológicas, melhorando assim a precisão diagnóstica e o planejamento do tratamento. Com o avanço das tecnologias de imagem médica, como ressonância magnética (MRI), tomografia computorizada (TC) e tomografia por emissão de pósitrons (PET), a demanda por técnicas precisas de segmentação de imagens médicas continuou a aumentar. Os métodos atuais para segmentação de imagens médicas podem ser amplamente categorizados em três abordagens principais: métodos baseados em redes neurais convolucionais (CNN) 4, métodos baseados emTransformer 5 e métodos baseados em modelos de espaço de estados (SSM) 6,7. Métodos baseados em CNN normalmente empregam arquiteturas de rede em formato de U para segmentação de imagens médicas. A arquitetura mais amplamente utilizada nessa categoria é aU-Net 8, que demonstrou a eficácia de uma arquitetura codificador-decodificador em formato de U para segmentação de imagens biomédicas. O U-Net3+ combina conexões de salto denso do UNet++9 com conexões de salto em escala real para aprimorar a agregação de características multiescala. No entanto, métodos baseados em CNN têm capacidade limitada de capturar dependências de longo alcance e, portanto, podem não modelar efetivamente informações contextuais de longo alcance.
Métodos baseados em transformadores capturam efetivamente dependências de longo alcance por meio do mecanismo de autoatenção, que permite computação paralela e atribui diferentes pesos de atenção a diferentes regiões de interesse. O UNETR++10 introduz o módulo de Atenção Eficiente em Pares (EPA) para reduzir o número de parâmetros e o custo computacional. nnFormer11 combina operações convolucionais intercaladas e de autoatenção, e introduz um mecanismo de autoatenção local–global baseado em volume para aprender representações volumétricas em segmentação de imagens médicas tridimensionais (3D). O H2Former12 propõe um transformador de visão híbrido hierárquico eficiente que combina mecanismos de atenção com extração de características baseada em CNN no codificador. No entanto, métodos baseados em transformadores exibem complexidade computacional quadrática com o aumento do comprimento da sequência, resultando em custos computacionais substancialmente maiores. A Figura 1 ilustra a motivação para o MVM-UNet e compara a estratégia proposta de varredura multiview com os frameworks de segmentação baseados em SSM já existentes.

Figura 1. Comparação do MVM-UNet com arquiteturas de segmentação baseadas em modelos puros de espaço de estados (SSM) existentes. Comparação entre um modelo convencional de segmentação baseado em modelo puro de espaço de estados (SSM) e a arquitetura proposta Multi-View Mamba U-Net (MVM-UNet). O painel superior ilustra o MVM-UNet, no qual o módulo Multi-View 4-Directional (MV4D) extrai características complementares usando pares de varredura em ziguezague, hierárquica, espiral e radial que são integrados pelo Spatial Fusion Mamba (SFusion Mamba), enquanto o Multistage Fusion Mamba (MFusion Mamba) agrega características do codificador multiescala antes da decodificação. O painel inferior mostra uma arquitetura representativa baseada em SSM puro usando módulos de Varredura Seletiva 2-Dimensional (SS2D) com varredura cruzada. A figura destaca as diferenças arquitetônicas entre redes convencionais de segmentação baseadas em SSM e o proposto MVM-UNet. Por favor, clique aqui para ver uma versão ampliada desta figura.
Métodos baseados em SSM combinam a capacidade global de modelagem dos Transformers com complexidade computacional linear. A arquitetura Mamba processa seletivamente as informações de entrada usando um modelo seletivo de espaço de estados (Selective-SSM), permitindo que o modelo ajuste dinamicamente seus parâmetros de acordo com a entrada, filtrando informações irrelevantes e enfatizando características informativas. O Vim13 e oVMamba 14 adaptam a arquitetura Mamba para tarefas de visão computacional. O U-Mamba15 emprega uma arquitetura híbrida CNN–SSM para explorar a aplicação dos SSMs na segmentação de imagens médicas, enquanto o Mamba-UNet16 adota uma arquitetura codificador-decodificador totalmente baseada em SSM para segmentação de imagens médicas. Esses métodos alcançam desempenho competitivo utilizando substancialmente menos parâmetros. No entanto, os métodos atuais baseados em SSM/Mamba extraem principalmente características de imagem usando patches simples e estratégias de varredura SS2D, que apresentam várias limitações para a segmentação de imagens médicas. Primeiro, as técnicas SS2D e baseadas em patches são projetadas principalmente para tarefas gerais de visão computacional. O Mamba17 Local e o Mamba 18 do Movimento sugeriram que a estratégia de varredura SS2D é insuficiente para todas as tarefas visuais porque diferentes estratégias capturam diferentes tipos de informações visuais. Segundo, a estratégia de varredura SS2D é relativamente simples, baseando-se apenas em direções horizontais e verticais de varredura. Consequentemente, pode não capturar adequadamente relações espaciais complexas e detalhes estruturais finos. A segmentação de imagens médicas requer modelagem simultânea tanto do contexto espacial global quanto das características anatômicas locais precisas. Além disso, os métodos atuais baseados em SSM/Mamba proporcionam uma fusão limitada de características entre o codificador e o decodificador. Arquiteturas como UNet++ e FATNet melhoram a precisão da segmentação por meio da fusão de características, destacando a importância de uma integração eficaz de características para segmentação de imagens médicas.
Para abordar essas limitações, este artigo propõe uma nova estrutura de segmentação de imagens médicas baseada em Mamba, denominada MVM-UNet. Como mostrado na Figura 1, o módulo Multi-View Four-Directional (MV4D) proposto serve como o componente central de extração de características do MVM-UNet e é projetado especificamente para segmentação de imagens médicas, integrando informações de quatro estratégias de varredura distintas. Cada estratégia de varredura extrai recursos complementares da imagem e representa uma visão diferente da imagem de entrada. A varredura emziguezague 19 alterna a direção de percurso no final de cada linha ou coluna, equilibrando assim informações espaciais locais e globais. Em contraste, os esquemas de varredura espiral e radial20 proporcionam cobertura abrangente ao se estender para fora a partir do centro ou para dentro a partir da periferia. A varredura hierárquica18 captura características locais e globais em múltiplas escalas. Para melhorar a robustez de cada estratégia de varredura, pares de varredura são fundidos antes de serem inseridos no Bloco S6. O módulo Scan-view Fusion Mamba (SFusion Mamba) integra posteriormente as características extraídas das quatro modalidades de varredura. Para utilizar eficazmente recursos de codificadores multiescala, este artigo propõe ainda um módulo de fusão Mamba multiescala (MFusion Mamba), que acumula e funde as saídas de cada estágio do codificador antes de passar as características fundidas para o decodificador. MVM-UNet foi avaliado nos conjuntos de dados ISIC 2017, ISIC 2018 e Synapse. Resultados experimentais demonstram que o MVM-UNet alcança desempenho competitivo em segmentação nos conjuntos de dados ISIC 2017, ISIC 2018 e Synapse.
Arquiteturas de segmentação representativa avançaram ainda mais a segmentação de imagens médicas. O U-Net também foi aplicado com sucesso em tarefas de análise de imagens biomédicas, como contagem celular, detecção emorfometria 21. Arquiteturas CNN aprimoradas pela atenção, como oCA-Net 22, melhoram a representação de características por meio de mecanismos abrangentes de atenção. Frameworks representativos de segmentação baseados em Transformers, incluindo TransUNet23, Pyramid MedicalTransformer 24, Swin U-Net25, TransAttUNet26 e TransCUNet27, demonstram ainda mais a eficácia da modelagem global de características baseada em atenção para segmentação de imagens médicas.
O design do MVM-UNet é motivado por duas limitações dos métodos de segmentação baseados em SSM/Mamba. Primeiro, muitos modelos atuais do Vision Mamba dependem de estratégias simples de varredura bidimensional, que podem ser insuficientes para imagens médicas contendo limites irregulares de lesões, pequenas regiões alvo e estruturas anatômicas multiescala. Segundo, arquiteturas convencionais codificador–decodificador em formato de U transferem principalmente características por meio de conexões de salto correspondentes, limitando o uso direto de informações do codificador multiestágio durante a decodificação. Portanto, o MVM-UNet introduz o MV4D para aprimorar a modelagem espacial multiview e o MFusion Mamba para agregar explicitamente as características do codificador multiestágio. Esse design tem como objetivo adaptar a modelagem de longo alcance baseada em Mamba aos requisitos específicos da segmentação de imagem médica.
Embora o MVM-UNet seja construído sobre o paradigma geral codificador–decodificador e a modelagem de sequências baseada em Mamba, sua novidade está em como esses componentes são adaptados e integrados para segmentação de imagens médicas. Em vez de simplesmente incorporar um bloco Mamba padrão em uma espinha dorsal de rede em formato de U, a estrutura proposta redesenha o processo de modelagem espacial por meio de múltiplos ramificações de pares de varredura orientados a tarefas, introduz o SFusion Mamba para integrar representações específicas de varredura, aprimora o MVV Block com caminhos residuais e de projeção, e insere MFusion Mamba entre o codificador e o decodificador para agregar características do codificador multiestágio antes da decodificação. Este design em nível arquitetônico visa abordar os limites irregulares, pequenas regiões-alvo e estruturas anatômicas multiescala comumente observadas em imagens médicas.
Este protocolo é mais adequado para tarefas de segmentação que exigem modelagem simultânea de informações contextuais de longo alcance, limites irregulares de objetos e estruturas anatômicas multiescala em imagens médicas bidimensionais. Comparado aos métodos de segmentação baseados em CNN, o design codificador–decodificador baseado em Mamba oferece um mecanismo eficaz de modelagem de contexto, mantendo um fluxo de trabalho em formato de U familiar para pesquisadores de segmentação de imagens médicas. Comparado aos métodos baseados em Transformer, o framework proposto evita o uso direto da autoatenção quadrática e é destinado a pesquisadores que buscam modelagem contextual global usando um mecanismo relativamente eficiente de modelagem de sequências. Assim, esse protocolo é adequado para segmentação de lesões de pele, segmentação de órgãos abdominais e tarefas médicas bidimensionais semelhantes de segmentação de imagens médicas, nas quais tanto a informação estrutural global quanto os detalhes locais dos limites são importantes.
Esse protocolo também possui limitações que devem ser consideradas antes do uso. Pode não ser necessário para tarefas de segmentação relativamente simples, nas quais uma CNN leve já oferece desempenho suficiente. Além disso, não é projetado diretamente para segmentação volumétrica tridimensional completa sem adaptação arquitetônica. Pesquisadores com dados anotados muito limitados, recursos limitados de unidades de processamento gráfico (GPU) ou necessidade de modelos clássicos altamente interpretáveis também devem considerar essas restrições antes de aplicar o protocolo. No geral, este método é destinado a pesquisadores que buscam reproduzir e avaliar uma estrutura de segmentação em forma de U baseada em Mamba, que equilibra modelagem de contexto de longo alcance, representação local de fronteira e fusão de características em múltiplos estágios.
As contribuições principais são as seguintes:
1. Este artigo apresenta uma nova estrutura de segmentação de imagens médicas baseada em Mamba, denominada MVM-UNet. Diferentemente de abordagens que incorporam diretamente blocos Mamba baseados em SS2D ou padrão, o MVM-UNet introduz o MV4D para modelar características de imagem médica a partir de quatro visões complementares de pares de varredura, incluindo varredura em ziguezague, hierárquica, espiral e radial.
2. Este artigo projeta o SFusion Mamba e o MVV Block para integrar representações específicas de varredura e aprimorar a transformação de características. O SFusion Mamba funde as características extraídas de diferentes ramificações de par de varredura, enquanto os ramos residual e de Projeção Up-Down dentro do Bloco MVV fornecem caminhos complementares de características que estabilizam e enriquecem representações de características.
3. Este artigo apresenta o MFusion Mamba como um módulo intermediário de fusão multiestágio entre o codificador e o decodificador. Diferentemente das conexões de salto convencionais, que transferem principalmente características correspondentes do estágio, o MFusion Mamba agrega explicitamente características do codificador multiestágio por meio da fusão grosseira a fina e fornece informações enriquecidas para decodificação.
4. Resultados experimentais extensos demonstram que o MVM-UNet proposto alcança desempenho de segmentação competitiva nos conjuntos de dados ISIC 2017 e ISIC 2018 e forte desempenho no conjunto de dados de segmentação multiorgânânico Synapse. Além disso, estudos ablativos de ablação validam a contribuição de cada componente dentro do MVM-UNet.