Este estudo apresenta uma variante U-Net leve com precisão de segmentação aprimorada usando convolução híbrida e atenção de canal, alcançando resultados de última geração em MoNuseg e GlaS com menos parâmetros.
Artigo de método
Este estudo apresenta uma variante U-Net leve com precisão de segmentação aprimorada usando convolução híbrida e atenção de canal, alcançando resultados de última geração em MoNuseg e GlaS com menos parâmetros.
A tecnologia de processamento de imagem de computador baseada em rede neural artificial desenvolveu-se rapidamente nos últimos anos e encontrou aplicações generalizadas em vários campos. No processamento de imagens médicas, a UNet e suas variantes mostraram grande sucesso na detecção de lesões, segmentação celular e tarefas de segmentação de pólipos. Esta pesquisa apresenta uma rede em forma de U modificada com parâmetros de rede reduzidos alcançados diminuindo a profundidade da rede e aumentando os canais de rede para melhorar a capacidade de aprendizado do modelo. Para neutralizar a redução na capacidade de aprendizado causada pela compressão de profundidade, um módulo convolucional de canal híbrido é introduzido para substituir o módulo convolucional da rede original. O modelo introduz um mecanismo de atenção de canal entre a camada e a camada de convolução pontual para melhorar a capacidade prática de extração de recursos de canal. O artigo também conclui que o uso da convolução de profundidade mista pode efetivamente resolver a extensão de tamanho do alvo de segmentação, dificultando que um modelo seja adequado para vários conjuntos de dados. O modelo proposto alcança resultados de última geração em dois conjuntos de dados públicos populares, MoNuseg e GlaS, com um aumento médio de dados de 1,0% e 1,37%, respectivamente. Os parâmetros totais do modelo modificado são reduzidos para 1,71M, representando uma redução de 38,6x em relação ao UCtransNet, com 65,6M de parâmetros.
A segmentação de imagens médicas é fundamental em várias aplicações clínicas, incluindo diagnóstico, planejamento de tratamento e monitoramento de doenças. Os métodos tradicionais de processamento de imagem baseados em algoritmos de engenharia de recursos não são mais adequados para lidar com grandes volumes de dados gerados em ambientes modernos de saúde. Felizmente, o avanço da tecnologia de rede neural artificial e as melhorias nos recursos de hardware do computador tornaram possível treinar e implantar modelos de rede neural em larga escala. Como resultado, algoritmos de processamento de visão computacional baseados em modelos de aprendizado de máquina estão sendo continuamente desenvolvidos e aplicados em vários campos.
A estrutura de modelo mais representativa na segmentação semântica de imagens médicas é a UNet1 com uma arquitetura de codificação-decodificação. O modelo primeiro usa um codificador de vários níveis para extrair recursos de diferentes escalas da imagem de entrada. Em seguida, o decodificador aumenta as amostras passo a passo enquanto combina os recursos semânticos gerados pelo codificador do nível correspondente como uma conexão de salto. No entanto, o desempenho da arquitetura UNet pode ser melhorado ainda mais com a aplicação de vários métodos. Por exemplo, os mecanismos de atenção demonstraram ser eficazes na melhoria do desempenho de redes neurais convolucionais. Esses mecanismos podem enfatizar seletivamente os recursos essenciais nos dados de entrada, levando a um melhor aprendizado de representação e precisão de segmentação.
Atualmente, muitos pesquisadores se concentram em fundir efetivamente os recursos extraídos pelo codificador no estágio de decodificação. Algumas das variantes mais comuns do UNet incluem Attention UNet2, Recurrent UNet3 e V-Net4. Essas abordagens empregam mecanismos de atenção5, como atenção espacial, para destacar regiões informativas dos mapas de recursos e suprimir as regiões não informativas. Além disso, algumas variantes incorporam redes neurais recorrentes para modelar a natureza sequencial das imagens médicas e melhorar as representações de recursos. Modelos de pré-treinamento, como VGG6, ResNet7 e DenseNet8, têm sido amplamente utilizados para melhorar o desempenho de redes em forma de U, aproveitando seu rico conhecimento aprendido em conjuntos de dados em larga escala. Além disso, mecanismos transformadores, como autoatenção e atenção de várias cabeças, foram introduzidos em dependências de modelo de longo alcance e capturam informações contextuais globais, levando a um melhor desempenho de segmentação.
No entanto, embora essas variantes tenham melhorado em relação ao UNet1 original, elas ainda têm certas limitações no manuseio de imagens médicas complexas com escalas e formas variadas. Além disso, o aumento da complexidade dessas variantes geralmente leva a custos computacionais mais altos e tempos de treinamento mais longos, o que limita sua aplicabilidade em ambientes práticos.
Para aprimorar a arquitetura UNet1 , é proposto um modelo modificado denominado MixKNet (Mix Kernel Size U-shape Net), que reduz a profundidade da rede enquanto aumenta o número de canais para melhorar a capacidade de aprendizado. No entanto, a redução na profundidade pode levar a um declínio no desempenho geral. Para mitigar esse problema, um módulo convolucional de canal híbrido é introduzido, substituindo o módulo neural convolucional original. Este módulo incorpora um mecanismo de atenção de canal entre as camadas de convolução em profundidade e pontual, com o objetivo de fortalecer a capacidade do modelo de extrair características de canal eficazes.
Para orientar a aplicabilidade prática, é importante notar que o método proposto foi avaliado em conjuntos de dados de imagens médicas de escala relativamente pequena, com resoluções de imagem individuais variando de 500 × 500 a 1000 × 1000 pixels. Para treinamento de modelos, todas as imagens foram redimensionadas para 224 × 224 pixels. A implementação foi realizada usando PyTorch em uma única GPU NVIDIA RTX 3090. Esses parâmetros operacionais sugerem que o método é computacionalmente viável para configurações experimentais moderadas e adaptável a tamanhos limitados de conjuntos de dados.
Em conclusão, este artigo apresenta uma nova modificação na estrutura de rede em forma de U e apresenta um módulo de convolução de canal híbrido junto com um mecanismo de atenção de canal, ambos os quais melhoram o desempenho de segmentação em conjuntos de dados de imagens médicas. As principais contribuições deste trabalho são as seguintes: (1) Propor uma estrutura de rede em forma de U modificada com um módulo de convolução híbrido de raciocínio profundo que substitui o módulo neural convolucional original. (2) Introduzir um mecanismo de atenção de canal entre a camada de convolução de raciocínio profundo e a camada de convolução de raciocínio pontual para melhorar a capacidade efetiva de extração de recursos de canal do modelo. (3) Alcançar resultados de última geração simultaneamente em dois conjuntos de dados públicos populares no conjunto de dados de segmentação nuclear MoNuseg9 com significativamente menos parâmetros de modelo (em comparação com UCtransNet10 com 64M parâmetros) e desempenho aprimorado no conjunto de dados de segmentação de glândulas GlaS11 .
O restante deste artigo está organizado da seguinte forma. A etapa 2 fornece uma revisão abrangente de estudos anteriores sobre UNet1 e suas variações na segmentação de imagens médicas. Os pontos fortes e as limitações das abordagens existentes são examinados, juntamente com trabalhos relacionados sobre mecanismos de atenção, redes convolucionais de profundidade mista e suas aplicações em modelos de segmentação. A etapa 3 detalha a arquitetura do modelo MixKNet proposto, incluindo modificações na estrutura da UNet, a integração de um mecanismo de atenção de canal e o uso de convolução de profundidade mista. A etapa 4 relata os resultados de experimentos extensivos, acompanhados de uma discussão e um estudo de ablação para avaliar as contribuições de cada componente. Finalmente, a etapa 5 conclui o artigo e descreve possíveis direções para pesquisas futuras.
Esta seção começa com uma revisão de estudos anteriores sobre UNet e suas variantes na segmentação de imagens médicas, descrevendo os pontos fortes e as limitações dos métodos existentes. Além disso, pesquisas relacionadas sobre mecanismos de atenção e suas aplicações em modelos de segmentação são discutidas. Desenvolvimentos recentes envolvendo técnicas de convolução em profundidade para melhorar o desempenho da segmentação também são examinados. Uma análise comparativa do MixKNet proposto (c) e outros modelos é apresentada na Figura 1, onde as linhas tracejadas indicam conexões de salto.
UNet e suas variações
A arquitetura UNet foi proposta pela primeira vez por Ronneberger et al. em 20151 e desde então tem sido amplamente utilizada na segmentação de imagens médicas. O modelo consiste em um caminho de codificação e um caminho de decodificação. O codificador extrai recursos de alto nível da imagem de entrada enquanto o decodificador aumenta a amostragem e combina os recursos para gerar um mapa de segmentação. Desde então, várias modificações foram feitas na arquitetura da UNet para melhorar seu desempenho na segmentação de imagens médicas. Uma das modificações mais comuns é a introdução de conexões de salto, que demonstraram melhorar a precisão da segmentação. Zhou et al.12 propuseram uma variante UNet que usa conexões de salto densas, permitindo que o modelo preserve melhor as informações espaciais.
Outra modificação popular na arquitetura UNet é a adição de mecanismos de atenção. Esses mecanismos podem ajudar o modelo a enfatizar seletivamente os recursos mais importantes, levando a um melhor aprendizado de representação e precisão de segmentação. Alguns exemplos de variantes com mecanismos de atenção incluem Attention UNet2, ResUNet com portas de atenção13 e Dense-UNet com portas de atenção14. Além das modificações acima, muitas outras variantes da arquitetura UNet foram propostas para segmentação de imagens médicas. O UCTransNet10 é uma variante da arquitetura U-Net que incorpora conexões de salto e um módulo Transformer. As conexões de salto no UCTransNet10 são repensadas de uma perspectiva de canal, o que permite uma melhor reutilização de recursos e reduz o número de parâmetros. O módulo Transformer é adicionado para capturar dependências de longo alcance e melhorar a qualidade da tradução. O UCTransNet10 demonstrou alcançar resultados de última geração em vários benchmarks de tradução automática. Zihan et al. propuseram um modelo de aprendizado profundo chamado LViT15, que eles aplicaram a tarefas de análise de imagens médicas. Para estender a versão semi-supervisionada do LViT15 e compensar a deficiência de qualidade nos dados de imagem, eles propuseram o mecanismo Exponential Pseudo Label Iteration (EPI). Além disso, para preservar as características locais das imagens, eles propuseram o Pixel-Level Attention Module (PLAM), que se concentra seletivamente em características importantes da imagem.
Mecanismo de atenção
Os mecanismos de atenção têm sido amplamente estudados no aprendizado de máquina, particularmente no processamento de linguagem natural e visão computacional. Nos últimos anos, os mecanismos de atenção também têm sido aplicados a tarefas de análise de imagens médicas, incluindo segmentação de imagens. Bahdanau et al.16 introduziram um mecanismo de atenção na tradução automática neural para melhorar a qualidade da tradução. O mecanismo permite que o modelo se concentre seletivamente em partes relevantes da sequência de entrada, melhorando a qualidade da tradução. Desde então, vários mecanismos de atenção foram propostos para tarefas de análise de imagens. Um tipo comum de mecanismo de atenção é o mecanismo de atenção espacial, que envolve a aplicação de um peso a cada pixel no mapa de recursos com base em sua importância. Por exemplo, Guo et al.17 propuseram um mecanismo de atenção espacial para a tarefa de segmentação de vasos da retina. O mecanismo usa um mecanismo de gating para ajustar a ponderação dos recursos espaciais, melhorando a capacidade do modelo de distinguir entre os pixels do vaso e do não-recipiente. Outro tipo de mecanismo de atenção é a atenção do canal, que se concentra no ajuste dos pesos dos mapas de recursos entre canais. Hu et al.18 propuseram uma rede de compressão e excitação (SENet) que aplica atenção por canal aos mapas de recursos, melhorando o desempenho da tarefa de classificação de imagens. Mais recentemente, os mecanismos de atenção foram combinados com redes neurais convolucionais (CNNs) para tarefas de segmentação de imagens. Por exemplo, Chen et al.19 propuseram uma rede guiada pela atenção para segmentação de tumores cerebrais que combina mecanismos de atenção espaciais e de canal.
Avanços recentes no aprendizado semi-supervisionado e multimodal para análise de imagens médicas e sensoriamento remoto demonstraram melhorias promissoras de desempenho. Yang et al.20 propuseram o UMSCS, uma nova estrutura de segmentação multimodal não emparelhada que aproveita a aprendizagem generativa entre modalidades e estratégias semi-supervisionadas. Zhang et al. introduziram várias técnicas de ponta: um modelo de consistência tri-branch aprimorado por evidências para segmentação semi-supervisionada21, uma estrutura de aprendizado prototípica autoconsciente e de amostra cruzada para segmentação de imagens médicas22 e uma abordagem de otimização de recursos hierárquicos com reconhecimento de frequência de tempo para reconhecimento de interferência de radar de abertura sintética (SAR) no domínio aeroespacial23. Esses trabalhos destacam coletivamente a importância da supervisão híbrida e da modelagem de recursos com reconhecimento de domínio em tarefas de imagem médica e de engenharia.
Convolução em profundidade
A convolução em profundidade foi projetada para capturar correlações por canal nos mapas de recursos de entrada e demonstrou melhorar a eficiência e a precisão das redes neurais convolucionais.
Um dos primeiros e mais influentes modelos de convolução em profundidade é o MobileNet24, proposto por Howard et al. em 2017. O MobileNet usa a convolução separável em profundidade, que aplica uma convolução em profundidade seguida por uma convolução pontual, para reduzir o número de parâmetros e a computação necessária para camadas convolucionais. Isso permite que o MobileNet obtenha precisão de última geração em tarefas de classificação de imagens, usando significativamente menos parâmetros do que as redes neurais convolucionais tradicionais. Desde a introdução do MobileNet, várias outras arquiteturas de convolução em profundidade foram propostas, incluindo ShuffleNet25, Xception26 e ResNeXt27. Esses modelos variam em sua implementação específica de convolução profunda, mas todos compartilham o objetivo de reduzir a complexidade computacional das camadas convolucionais, mantendo ou melhorando a precisão. A convolução profunda também foi aplicada à tarefa de segmentação semântica, com modelos como o PSPNet28 usando convolução separável em profundidade para reduzir os requisitos de computação e memória de camadas convolucionais de grande escala. O MixNet29 estende ainda mais a ideia de convolução profunda, introduzindo uma convolução mista em profundidade, que utiliza vários tamanhos de kernel para capturar recursos em diferentes escalas. Foi demonstrado que ele supera outros modelos de última geração, mantendo parâmetros e FLOPs comparáveis. Esses modelos demonstraram melhorias significativas na precisão e eficiência em relação às redes neurais convolucionais tradicionais em várias tarefas de segmentação semântica.
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Esta seção descreve a arquitetura MixKNet proposta para segmentação de imagens médicas. O modelo MixKNet estende a arquitetura UNet, incorporando mecanismos de atenção e camadas mistas de convolução em profundidade. O software utilizado neste estudo está listado na Tabela de Materiais.
1. Arquitetura geral
2. Forma de U achatada
NOTA: Reduza a profundidade da arquitetura da rede neural para diminuir a complexidade computacional e o tamanho do modelo, estando ciente de que isso pode reduzir a capacidade de aprender representações de dados complexas.
3. Misture o tamanho do kernel para o codificador
4. Canalize a atenção
5. Conjuntos de dados
NOTA: Dois conjuntos de dados de imagens médicas disponíveis publicamente, conforme apresentado na Tabela 1 e na Tabela 2, são utilizados neste estudo: GlaS (Sirinukunwattana et al.11) e MoNuSeg (Kumar et al.9).
6. Detalhes de implementação
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Comparação com métodos de última geração
A arquitetura MixKNet foi avaliada em dois conjuntos de dados de segmentação de imagens médicas, GlaS e MoNuSeg, e comparada com métodos de última geração no campo. A avaliação foi realizada relatando os escores de dados e IoU do método proposto e vários modelos comparáveis, conforme mostrado na Tabela 3. Os resultados indicam que a arquitetura MixKNet supera os outros modelos, alcançando as maiores pontuações m...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Este estudo apresenta o MixKNet, uma nova modificação da arquitetura UNet1 para segmentação de imagens médicas, integrando convolução de profundidade mista e um mecanismo de atenção de canal para melhorar o desempenho da segmentação e reduzir significativamente a complexidade computacional. A convolução de canal híbrido combina vários núcleos convolucionais operando em grupos de canais separados. Esse design permite que a rede capture diversas características espa...
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Os autores declaram não haver interesses financeiros concorrentes ou outros conflitos de interesse.
O segundo lote dos Projetos de Pesquisa de Bem-Estar Social de 2023 da cidade de Ningbo: Pesquisa e Aplicação de Tecnologias-Chave para Identificação de Fraudes em Redes de Telecomunicações com Base em Ontologia e PNL (2023S169).
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
| Nome | Empresa | Número de catálogo | Comentários |
|---|---|---|---|
| Sistema operacional Linux (Ubuntu 22.04) | Vários (Comunidade de código aberto) | N/A(Versão 22.04 LTS) | Sistema operacional de código aberto para desenvolvimento https://releases.ubuntu.com/22.04/ |
| NVIDIA RTX 3090 GPU | NVIDIA | 3090 | GPU de alto desempenho para aprendizado profundo https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090/ |
| Python | Python Software Foundation | N/A (Versão ≥ 3.8) | Linguagem de programação para desenvolvimento de IA/ML https://www.python.org/ |
| PyTorch | Meta AI | N/A (Versão 1.13) | Estrutura de aprendizado de máquina de código aberto https://pytorch.org/ |
| Visual Studio Code (VS Code) | Microsoft | N/A | Editor de código leve e poderoso https://code.visualstudio.com/ |
Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.
Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE
Solicitar permissão