$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
A intervenção clínica contemporânea, incluindo o diagnóstico de doenças, a formulação de planos de tratamento e o rastreamento dos resultados do tratamento, depende da segmentação precisa das imagens médicas1. No entanto, as complexas relações estruturais entre os órgãos abdominais2tornam uma tarefa desafiadora alcançar a segmentação precisa de vários órgãos abdominais3. Nas últimas décadas, os desenvolvimentos florescentes em imagens médicas e visão computacional apresentaram novas oportunidades e desafios no campo da segmentação abdominal de múltiplos órgãos. A tecnologia de Ressonância Magnética (RM)4 e Tomografia Computadorizada (TC)5 nos permite adquirir imagens abdominais de alta resolução. A segmentação precisa de múltiplos órgãos a partir de imagens de TC tem valor clínico significativo para a avaliação e tratamento de órgãos vitais, como fígado, rins, baço, pâncreas, etc.6,7,8,9,10 No entanto, a anotação manual dessas estruturas anatômicas, especialmente aquelas que requerem intervenção de radiologistas ou oncologistas de radiação, é demorada e suscetível a influências subjetivas11. Portanto, há uma necessidade urgente de desenvolver métodos automatizados e precisos para segmentação abdominal de múltiplos órgãos.
Pesquisas anteriores sobre segmentação de imagens dependiam predominantemente de redes neurais convolucionais (CNNs), que melhoram a eficiência da segmentação empilhando camadas e introduzindo o ResNet12. Em 2020, a equipe de pesquisa do Google apresentou o modelo Vision Transformer (VIT)13, marcando um exemplo pioneiro de incorporação da arquitetura Transformer ao domínio visual tradicional para uma variedade de tarefas visuais14. Embora as operações convolucionais possam contemplar apenas informações de recursos locais, o mecanismo de atenção em Transformers permite a consideração abrangente de informações de recursos globais.
Considerando a superioridade das arquiteturas baseadas em Transformers sobre as redes convolucionais tradicionais15, várias equipes de pesquisa realizaram uma extensa exploração na otimização da sinergia entre os pontos fortes dos Transformers e as redes convolucionais 16,17,18,19. Chen et al. introduziram o TransUNet para tarefas de segmentação de imagens médicas16, que aproveita os Transformers para extrair recursos globais de imagens. Devido ao alto custo do treinamento de rede e à falha em utilizar o conceito de hierarquia de extração de recursos, as vantagens do Transformer não foram totalmente realizadas.
Para resolver esses problemas, muitos pesquisadores começaram a experimentar a incorporação de Transformers como a espinha dorsal para treinar redes de segmentação. Liu et al.17 introduziram o Transformador Swin, que empregava um método de construção hierárquica para extração de características em camadas. O conceito de Windows Multi-Head Self-Attention (W-MSA) foi proposto, reduzindo significativamente o custo computacional, particularmente na presença de mapas de recursos de nível superficial maiores. Embora essa abordagem reduzisse os requisitos computacionais, ela também isolava a transmissão de informações entre diferentes janelas. Para resolver esse problema, os autores introduziram ainda o conceito de Shifted Windows Multi-Head Self-Attention (SW-MSA), permitindo a propagação de informações entre janelas adjacentes. Com base nessa metodologia, Cao et al. formularam o Swin-UNet18, substituindo as convoluções 2D em U-Net por módulos Swin e incorporando W-MSA e SW-MSA nos processos de codificação e decodificação, alcançando resultados de segmentação louváveis.
Por outro lado, Zhou et al. destacaram que a vantagem da operação conv não pode ser ignorada ao processar imagens de alta resolução19. Seu nnFormer proposto emprega um método de computação de auto-atenção baseado em blocos de imagem tridimensionais locais, constituindo um modelo Transformer caracterizado por uma estrutura em forma de cruz. A utilização da atenção baseada em blocos tridimensionais locais reduziu significativamente a carga de treinamento na rede.
Dados os problemas com o estudo acima, uma estrutura hierárquica híbrida eficiente para segmentação de imagens médicas 3D, denominada Swin-PSAxialNet, é proposta. Este método incorpora um bloco de redução de amostragem, bloco Space-to-depth (SPD)20 , capaz de extrair informações globais21. Além disso, adiciona um módulo de atenção axial compartilhada por parâmetros (PSAA), que reduz a contagem de parâmetros de aprendizado de quadrático para linear e terá um bom efeito na precisão do treinamento da rede e na complexidade dos modelos de treinamento22.
Rede Swin-PSAxialNet
A arquitetura geral da rede adota a estrutura em forma de U do nnU-Net23, consistindo em estruturas de codificador e decodificador. Essas estruturas se envolvem na extração de características locais e na concatenação de características de imagens de grande e pequena escala, conforme ilustrado na Figura 1.

Figura 1: Diagrama esquemático Swin-PSAxialNet da arquitetura de rede. Clique aqui para ver uma versão maior desta figura.
Na estrutura do codificador, o bloco Conv tradicional é combinado com o bloco SPD20 para formar um volume de downsampling. A primeira camada do codificador incorpora Patch Embedding, um módulo que particiona os dados 3D em patches
3D, (P1, P2, P3) representa patches não sobrepostos neste contexto,
significa o comprimento da sequência de patches 3D. Após a camada de incorporação, a próxima etapa envolve uma unidade de redução de amostragem convolucional não sobreposta, compreendendo um bloco convolucional e um bloco SPD. Nessa configuração, o bloco convolucional tem um passo definido como 1 e o bloco SPD é empregado para dimensionamento de imagem, levando a uma redução de quatro vezes na resolução e um aumento de duas vezes nos canais.
Na estrutura do decodificador, cada bloco de upsample após a camada de Feição de Gargalo consiste em uma combinação de um bloco de upsampling e um bloco PSAA. A resolução do mapa de recursos é aumentada duas vezes e a contagem de canais é reduzida pela metade entre cada par de estágios do decodificador. Para restaurar informações espaciais e melhorar a representação de recursos, a fusão de recursos entre imagens de grande e pequena escala é realizada entre os blocos de aumento de amostragem. Por fim, os resultados do upsampling são alimentados na camada Head para restaurar o tamanho da imagem original, com um tamanho de saída de (H × W × D × C, C = 3).
Arquitetura de bloco SPD
Nos métodos tradicionais, a seção de redução da amostragem emprega uma única passada com um tamanho de passo de 2. Isso envolve o agrupamento convolucional em posições locais na imagem, limitando o campo receptivo e confinando o modelo à extração de recursos de pequenos patches de imagem. Este método utiliza o bloco SPD, que divide finamente a imagem original em três dimensões. A imagem 3D original é segmentada uniformemente ao longo dos eixos x, y e z, resultando em quatro corpos de subvolume. (Figura 2) Posteriormente, os quatro volumes são concatenados por meio da operação "cat", e a imagem resultante sofre uma convolução 1 × 1 × 1 para obter a imagem com amostragemreduzida 20.

Figura 2: Diagrama de blocos SPD. Clique aqui para ver uma versão maior desta figura.
Arquitetura de blocos PSAA
Em contraste com as redes tradicionais da CNN, o bloco PSAA proposto é mais eficaz na condução do foco global de informações e mais eficiente no aprendizado e treinamento da rede. Isso permite a captura de imagens e recursos espaciais mais ricos. O bloco PSAA inclui aprendizado de atenção axial com base no compartilhamento de parâmetros em três dimensões: Altura, Largura e Profundidade. Em comparação com o mecanismo de atenção convencional que realiza o aprendizado de atenção para cada pixel da imagem, esse método conduz o aprendizado de atenção de forma independente para cada uma das três dimensões, reduzindo a complexidade da autoatenção de quadrática para linear. Além disso, um mecanismo de compartilhamento de parâmetros de consultas de chaves que podem ser aprendidas é empregado, permitindo que a rede execute operações de mecanismo de atenção em paralelo nas três dimensões, resultando em uma representação de recursos mais rápida, superior e eficaz.