$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Este estudo utilizou um conjunto de dados anonimizado disponível publicamente; portanto, o consentimento informado não foi necessário. A abordagem proposta compreende seis componentes: pré-processamento, módulo de convolução, módulo de atenção, integração de módulos de convolução e atenção e camadas totalmente conectadas (FC). A Figura 1 ilustra o fluxo de trabalho completo do nosso método.
Aquisição do conjunto de dados
Imagens de ressonância magnética (RM) cerebrais rotuladas são obtidas de um conjunto de dados Kaggle disponível publicamente, composto por quatro categorias de tumores e tecido normal.
Pré-processamento de dados
As imagens são redimensionadas para uma resolução uniforme e normalizadas em intensidade. Augmentação opcional (rotação, inversão, zoom) é aplicada para melhorar a generalização. O conjunto de dados é dividido em conjuntos de treinamento (70%) e teste (30%).
Arquitetura do modelo
Três redes neurais convolucionais (CNN) pré-treinadas no ImageNet - MobileNetV2, EfficientNetV1 e Inception-ResNet-V2 - foram usadas para classificar tumores cerebrais em quatro categorias usando imagens de RM. MobileNetV2 e EfficientNetV1 foram configurados com uma dimensão de entrada de 224 × 224 pixels, enquanto Inception-ResNet-V2 exigia um tamanho de entrada de 299 × 299 pixels. No processo de transferência de aprendizado, as camadas convolucionais iniciais foram congeladas no início para reter características generalizadas de imagem, enquanto as camadas superiores foram ajustadas para adaptar o modelo para a classificação de tumores cerebrais. Cada backbone foi emparelhado com uma cabeça de classificação leve que incluía Global Average Pooling, camadas densas, dropout para regularização e uma função de ativação Softmax para prever quatro classes. O dropout foi implementado para mitigar o sobreajuste e melhorar a generalização. A arquitetura projetada efetivamente fundiu a extração eficiente de características com demandas computacionais mais baixas, facilitando a classificação precisa, enquanto permanecia adequada para implantação em cenários com recursos limitados e prova de conceito.
Extração de características baseada em atenção
As imagens de entrada são processadas através de uma camada convolucional inicial seguida por um módulo de atenção personalizado. O pooling máximo e médio paralelos capturam características salientes e contextuais, que são concatenadas e refinadas via convolução para enfatizar regiões relevantes para o tumor.
Backbone convolucional e fusão
As características ponderadas por atenção são encaminhadas para backbones pré-treinados (MobileNetV2, EfficientNetV1 ou Inception-ResNet-V2). As camadas convolucionais de alto nível são logicamente fundidas para reduzir o acesso à memória e melhorar a eficiência computacional.
Classificação
As características achatadas são passadas por camadas totalmente conectadas com ativação ReLU6 e dropout, produzindo uma representação compacta para a classificação softmax final de quatro classes.
Avaliação
O desempenho do modelo é avaliado no conjunto de teste usando precisão, recall, F1-score e matrizes de confusão.
Desenvolvimento de framework
A solução proposta é implementada em Python e usa Keras para execução. Tabela 1 ilustra os hiperparâmetros. O conjunto de dados é dividido em um conjunto de treinamento e um conjunto de teste seguindo uma proporção de 70:30. Cinco diferentes divisões arbitrárias de treinamento/teste são usadas para exibir o desempenho final equilibrado para cada conjunto de dados.
Pré-processamento
As imagens de entrada devem ser atualizadas porque o framework MobileNetV2 serve como base para a solução proposta. Para extrair características de alta resolução de fotografias, o modelo MobileNetV2 pré-treinado é usado com sua dimensão de entrada. Cada imagem de entrada é então dimensionada para 224 × 224 pixels na faixa [-1, 1].
O modelo de convolução
MobileNetV2 melhora o reconhecimento de imagem aproveitando uma arquitetura eficiente de Rede Neural Convolucional (CNN) projetada para minimizar as demandas computacionais. Enquanto as CNNs tradicionais alcançam alta precisão, elas frequentemente requerem memória substancial e poder de processamento. MobileNetV1 introduziu o conceito de convolução separável por profundidade, que separa a convolução padrão em duas operações distintas: convolução por profundidade para filtrar entradas e convolução pontual para integrar recursos. MobileNetV2 se baseia nessa ideia, incorporando blocos residuais em gargalo que consistem em camadas de expansão, convolução por profundidade, camadas de projeção e conexões residuais. A camada de projeção comprime os canais de características, enquanto as conexões residuais facilitam um melhor fluxo de informações por toda a rede. Para melhorar a estabilidade e aprimorar o desempenho de aprendizagem, a ativação ReLU6 e a normalização por lote são aplicadas após as operações convolucionais.
Nesta pesquisa, MobileNetV2, pré-treinado em ImageNet, foi usado como o modelo de backbone para extrair características, entregando representações semânticas de alto nível eficazes, mantendo os custos computacionais baixos para a classificação de tumores cerebrais. Após cada camada de convolução, há uma camada de ativação ReLU6, que é uma adaptação da função de ativação ReLU, onde o tamanho é maximizado em seis, e uma camada de normalização por lote. A convolução comum de 1x1, o pooling médio e as camadas de classificação são aplicadas a 17 dos blocos de gargalo restantes, formando a arquitetura completa do MobileNetV2. Usamos MobileNetV2 como a rede de backbone pré-treinada em ImageNet. Nesse caso, o mapa convolucional é obtido do último bloco residual após passar pela camada convolucional MobileNetV2. Bloques de nível inferior produzem mapas de características menores. Tais blocos não contribuem para nossa pesquisa porque eles não coletam dados de alto nível para a identificação geral da imagem. Durante a construção e o treinamento do modelo, as camadas que precedem as camadas convolucionais que geram um mapa de características 3D de 7 × 7 são mantidas fixas. Matematicamente, isso é expresso abaixo na Eq (1):
F1(I) = Conv(I) (1)
Aqui, F1(I) representa a característica convolucional extraída da imagem de entrada, I.
O módulo de foco
O mecanismo de atenção do cérebro humano, que implica que as pessoas naturalmente se concentram mais em entradas visuais significativas do que em cada detalhe em uma imagem, serve como base para o design desta rede de transformação. Numerosos modelos baseados em atenção foram criados na pesquisa de aprendizado profundo devido a essa ideia. O mecanismo de atenção proposto destaca as correlações espaciais vistas nas representações de tumores cerebrais. Enquanto o módulo de atenção por canal captura a informação mais importante relacionada ao tumor através dos canais de características, a unidade de atenção regional identifica as regiões mais informativas da imagem de RM. Usando um método de atenção estruturado, a unidade de foco proposta se concentra em áreas que contêm informações discriminativas do tumor.
Para melhorar a representação de características, técnicas como Top Activation Pooling e extração de características equilibrada são usadas antes da fase de detecção