Method Article

Framework de Aprendizagem por Transferência Guiada por Atenção para Classificação de Tumores Cerebrais de Quatro Classes Usando Ressonância Magnética

DOI:

10.3791/69087

July 10th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo apresenta uma estrutura de aprendizagem profunda baseada em atenção leve para classificação de tumores cerebrais em quatro classes a partir de imagens de ressonância magnética usando aprendizado por transferência com MobileNetV2, EfficientNetV1 e Inception-ResNet-V2. O modelo alcança alta precisão de classificação com complexidade computacional reduzida, apoiando aplicações de suporte à decisão clínica com recursos limitados.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O objetivo desta pesquisa é desenvolver uma estrutura de aprendizado profundo leve, mas precisa, para classificar tumores cerebrais em quatro categorias—gliomas, meningiomas, tumores hipofisários e tecido cerebral saudável—usando dados de ressonância magnética (RM). A metodologia proposta combina aprendizado de transferência com três modelos de rede neural convolucional pré-treinados—MobileNetV2, EfficientNetV1 e Inception-ResNet-V2—integrados com um mecanismo de atenção que emula a capacidade do sistema visual humano de se concentrar em regiões clinicamente relevantes de uma imagem. Esta abordagem orientada por atenção melhora a localização do tumor enquanto suprime informações de fundo irrelevantes. O framework é avaliado em um grande conjunto de dados de RM cerebral disponível publicamente, contendo milhares de imagens rotuladas nas quatro classes. Pré-processamento padrão, aumento de dados e protocolos de treinamento são empregados para permitir a replicação direta do método proposto. Os resultados experimentais demonstram que o EfficientNetV1 alcança o mais alto desempenho de classificação, atingindo uma precisão superior em comparação com o MobileNetV2 e o Inception-ResNet-V2. O estudo conclui que o framework leve baseado em atenção proposto equilibra efetivamente a precisão e a complexidade computacional, tornando-o altamente adequado para aplicações de saúde em tempo real e móveis, particularmente em ambientes com recursos limitados.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
```html

A classificação precisa de tumores cerebrais usando ressonância magnética (RM) desempenha um papel crítico no diagnóstico clínico, planejamento de tratamento e estimativa de prognóstico1. Tumores cerebrais, incluindo glioma, meningioma e tumores hipofisários, exibem características patológicas e respostas ao tratamento distintas; portanto, a identificação precoce e confiável é essencial para melhorar os resultados terapêuticos e reduzir a progressão da doença. A RM é amplamente preferida para avaliação de tumores cerebrais devido ao seu contraste superior de tecidos moles, natureza não invasiva e capacidade de visualizar a morfologia do tumor em múltiplos planos anatômicos. No entanto, a interpretação manual de exames de RM é frequentemente demorada e altamente dependente da expertise radiológica, particularmente quando as fronteiras do tumor são irregulares ou quando existem semelhanças visuais entre classes de tumores. Consequentemente, sistemas automatizados de diagnóstico assistido por computador tornaram-se cada vez mais importantes para auxiliar radiologistas na classificação precisa e eficiente de tumores.

Técnicas de análise de imagem baseadas em aprendizado profundo (AD) avançaram significativamente a classificação automatizada de doenças em aplicações biomédicas e de visão computacional2,3. Em neuro-oncologia, técnicas de aprendizado de máquina e transferência de aprendizado demonstraram desempenho promissor para detecção, segmentação e tarefas de classificação de tumores4. As redes neurais convolucionais (CNNs), em particular, mostraram capacidade superior em extrair automaticamente características hierárquicas de imagens diretamente de exames de RM sem depender de engenharia de características manual. Arquiteturas de CNN podem aprender representações discriminativas relacionadas a tumores a partir de dados de imagem, melhorando assim o desempenho de classificação em comparação com abordagens convencionais de aprendizado de máquina. Avanços recentes em AD permitiram o desenvolvimento de sistemas de classificação de imagem de alto desempenho capazes de processar grandes conjuntos de dados de imagem com precisão aprimorada e menor intervenção humana.

Apesar desses avanços, arquiteturas convencionais de CNN profundas frequentemente requerem recursos computacionais substanciais, incluindo alto consumo de memória, complexidade de parâmetros aumentada e tempo de treinamento extensivo5. Tais demandas computacionais restringem sua implementação em ambientes clínicos com recursos limitados e sistemas de saúde móvel. Além disso, arquiteturas de rede neural convolucional leves têm atraído crescente atenção devido à sua complexidade computacional reduzida e adequação para implantação em aplicações de baixos recursos5. Vários estudos recentes exploraram estratégias otimizadas de CNN, mecanismos eficientes de extração de características e estruturas de implantação leves para melhorar a eficiência de classificação sem comprometer significativamente a precisão preditiva6,7,8. No entanto, equilibrar eficiência computacional com desempenho robusto de classificação multiclasse de tumores permanece um desafio maior na análise de tumores cerebrais baseada em RM9.

Estruturas de aprendizado profundo baseadas em atenção emergiram como soluções eficazes para melhorar a representação de características na análise de imagens médicas10. Mecanismos de atenção permitem que as redes neurais seletivamente enfatizem regiões de imagem diagnosticamente relevantes enquanto suprimem informações de fundo irrelevantes. Inspirados no sistema visual humano, arquiteturas guiadas por atenção melhoram o aprendizado de características discriminativas, direcionando o foco computacional para regiões espaciais específicas de tumores e características contextuais. Tais mecanismos são particularmente benéficos para análise de RM de tumores cerebrais, pois os tecidos tumorais frequentemente exibem padrões de intensidade heterogêneos, morfologia irregular e características visuais sobrepostas entre categorias de tumores. Consequentemente, integrar módulos de atenção em arquiteturas baseadas em CNN pode melhorar a precisão de classificação e melhorar o desempenho de localização de características.

Vários estudos recentes demonstraram o potencial de estruturas de AD para diagnóstico automatizado de tumores cerebrais e classificação de tumores baseada em RM11,12. Gao et al. desenvolveram e validaram um modelo de AD para diagnóstico de tumores cerebrais usando dados de RM, demonstrando forte capacidade de classificação para análise de neuroimagem automatizada11. Da mesma forma, Abdusalomov et al. investigaram abordagens de detecção de tumores cerebrais baseadas em AD usando exames de RM e relataram desempenho diagnóstico promissor12. Embora esses estudos tenham alcançado melhor precisão de classificação, limitações relacionadas à diversidade de conjuntos de dados, generalização do modelo e requisitos computacionais permanecem não resolvidas. Em muitos casos, os conjuntos de dados de treinamento eram limitados em tamanho ou derivados de fontes clínicas restritas, aumentando o risco de sobreajuste e reduzindo a robustez em populações heterogêneas de pacientes.

Para melhorar a visualização de tumores e extração de características, técnicas de análise e reconstrução multimodal de RM também foram exploradas13,14. Sun et al. investigaram avaliação multimodal de glioma baseada em RM usando uma estrutura de reconstrução de aprendizado profundo combinada com estratégias de desruído13. Seu trabalho demonstrou a importância do aprimoramento da qualidade de imagem para melhorar a precisão de detecção de glioma. Da mesma forma, Srinivas e Rao propuseram uma estrutura de segmentação baseada em DL para análise multimodal de sub-regiões de tumores cerebrais de RM14. Sua abordagem melhorou a delineação da sub-região do tumor e contribuiu para o planejamento de tratamento individualizado. No entanto, estruturas multimodais geralmente requerem pré-processamento extensivo, recursos computacionais aumentados e registro preciso de imagens entre modalidades de imagem, o que pode limitar sua aplicabilidade em ambientes clínicos práticos.

Métodos de fusão multimodal guiados por atenção também foram propostos para melhorar a precisão da segmentação e integração de características de RM15,16,17,18. Zhou et al. introduziram uma estrutura de fusão baseada em mecanismo de atenção para segmentação multimodal de tumores cerebrais15. O estudo demonstrou melhor desempenho de segmentação por meio de aprendizado de características contextuais; no entanto, a abordagem focou principalmente na segmentação, não na classificação leve de tumores. Da mesma forma, Zhou e Du propuseram uma rede 3D multimodal para reconstrução acelerada de RM16, enquanto Huang et al. desenvolveram AMF-Net, uma rede de fusão adaptativa de multisequências para diagnóstico multimodal de tumores cerebrais17. Zhou et al. propuseram ainda MLMFNet para reconstrução acelerada de RM multimodal18. Embora esses métodos tenham melhorado a qualidade de reconstrução e a capacidade de fusão de características, eles dependiam fortemente de múltiplas modalidades de RM, arquiteturas profundas e operações de fusão computacionalmente caras. Tais requisitos podem reduzir sua viabilidade para implantação em sistemas de saúde com recursos limitados e plataformas de diagnóstico baseadas em edge.

Estudos adicionais

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudo utilizou um conjunto de dados anonimizado disponível publicamente; portanto, o consentimento informado não foi necessário. A abordagem proposta compreende seis componentes: pré-processamento, módulo de convolução, módulo de atenção, integração de módulos de convolução e atenção e camadas totalmente conectadas (FC). A Figura 1 ilustra o fluxo de trabalho completo do nosso método.

Aquisição do conjunto de dados
Imagens de ressonância magnética (RM) cerebrais rotuladas são obtidas de um conjunto de dados Kaggle disponível publicamente, composto por quatro categorias de tumores e tecido normal.

Pré-processamento de dados
As imagens são redimensionadas para uma resolução uniforme e normalizadas em intensidade. Augmentação opcional (rotação, inversão, zoom) é aplicada para melhorar a generalização. O conjunto de dados é dividido em conjuntos de treinamento (70%) e teste (30%).

Arquitetura do modelo
Três redes neurais convolucionais (CNN) pré-treinadas no ImageNet - MobileNetV2, EfficientNetV1 e Inception-ResNet-V2 - foram usadas para classificar tumores cerebrais em quatro categorias usando imagens de RM. MobileNetV2 e EfficientNetV1 foram configurados com uma dimensão de entrada de 224 × 224 pixels, enquanto Inception-ResNet-V2 exigia um tamanho de entrada de 299 × 299 pixels. No processo de transferência de aprendizado, as camadas convolucionais iniciais foram congeladas no início para reter características generalizadas de imagem, enquanto as camadas superiores foram ajustadas para adaptar o modelo para a classificação de tumores cerebrais. Cada backbone foi emparelhado com uma cabeça de classificação leve que incluía Global Average Pooling, camadas densas, dropout para regularização e uma função de ativação Softmax para prever quatro classes. O dropout foi implementado para mitigar o sobreajuste e melhorar a generalização. A arquitetura projetada efetivamente fundiu a extração eficiente de características com demandas computacionais mais baixas, facilitando a classificação precisa, enquanto permanecia adequada para implantação em cenários com recursos limitados e prova de conceito.

Extração de características baseada em atenção
As imagens de entrada são processadas através de uma camada convolucional inicial seguida por um módulo de atenção personalizado. O pooling máximo e médio paralelos capturam características salientes e contextuais, que são concatenadas e refinadas via convolução para enfatizar regiões relevantes para o tumor.

Backbone convolucional e fusão
As características ponderadas por atenção são encaminhadas para backbones pré-treinados (MobileNetV2, EfficientNetV1 ou Inception-ResNet-V2). As camadas convolucionais de alto nível são logicamente fundidas para reduzir o acesso à memória e melhorar a eficiência computacional.

Classificação
As características achatadas são passadas por camadas totalmente conectadas com ativação ReLU6 e dropout, produzindo uma representação compacta para a classificação softmax final de quatro classes.

Avaliação
O desempenho do modelo é avaliado no conjunto de teste usando precisão, recall, F1-score e matrizes de confusão.

Desenvolvimento de framework
A solução proposta é implementada em Python e usa Keras para execução. Tabela 1 ilustra os hiperparâmetros. O conjunto de dados é dividido em um conjunto de treinamento e um conjunto de teste seguindo uma proporção de 70:30. Cinco diferentes divisões arbitrárias de treinamento/teste são usadas para exibir o desempenho final equilibrado para cada conjunto de dados.

Pré-processamento
As imagens de entrada devem ser atualizadas porque o framework MobileNetV2 serve como base para a solução proposta. Para extrair características de alta resolução de fotografias, o modelo MobileNetV2 pré-treinado é usado com sua dimensão de entrada. Cada imagem de entrada é então dimensionada para 224 × 224 pixels na faixa [-1, 1].

O modelo de convolução
MobileNetV2 melhora o reconhecimento de imagem aproveitando uma arquitetura eficiente de Rede Neural Convolucional (CNN) projetada para minimizar as demandas computacionais. Enquanto as CNNs tradicionais alcançam alta precisão, elas frequentemente requerem memória substancial e poder de processamento. MobileNetV1 introduziu o conceito de convolução separável por profundidade, que separa a convolução padrão em duas operações distintas: convolução por profundidade para filtrar entradas e convolução pontual para integrar recursos. MobileNetV2 se baseia nessa ideia, incorporando blocos residuais em gargalo que consistem em camadas de expansão, convolução por profundidade, camadas de projeção e conexões residuais. A camada de projeção comprime os canais de características, enquanto as conexões residuais facilitam um melhor fluxo de informações por toda a rede. Para melhorar a estabilidade e aprimorar o desempenho de aprendizagem, a ativação ReLU6 e a normalização por lote são aplicadas após as operações convolucionais.

Nesta pesquisa, MobileNetV2, pré-treinado em ImageNet, foi usado como o modelo de backbone para extrair características, entregando representações semânticas de alto nível eficazes, mantendo os custos computacionais baixos para a classificação de tumores cerebrais. Após cada camada de convolução, há uma camada de ativação ReLU6, que é uma adaptação da função de ativação ReLU, onde o tamanho é maximizado em seis, e uma camada de normalização por lote. A convolução comum de 1x1, o pooling médio e as camadas de classificação são aplicadas a 17 dos blocos de gargalo restantes, formando a arquitetura completa do MobileNetV2. Usamos MobileNetV2 como a rede de backbone pré-treinada em ImageNet. Nesse caso, o mapa convolucional é obtido do último bloco residual após passar pela camada convolucional MobileNetV2. Bloques de nível inferior produzem mapas de características menores. Tais blocos não contribuem para nossa pesquisa porque eles não coletam dados de alto nível para a identificação geral da imagem. Durante a construção e o treinamento do modelo, as camadas que precedem as camadas convolucionais que geram um mapa de características 3D de 7 × 7 são mantidas fixas. Matematicamente, isso é expresso abaixo na Eq (1):

F1(I) = Conv(I)      (1)

Aqui, F1(I) representa a característica convolucional extraída da imagem de entrada, I.

O módulo de foco
O mecanismo de atenção do cérebro humano, que implica que as pessoas naturalmente se concentram mais em entradas visuais significativas do que em cada detalhe em uma imagem, serve como base para o design desta rede de transformação. Numerosos modelos baseados em atenção foram criados na pesquisa de aprendizado profundo devido a essa ideia. O mecanismo de atenção proposto destaca as correlações espaciais vistas nas representações de tumores cerebrais. Enquanto o módulo de atenção por canal captura a informação mais importante relacionada ao tumor através dos canais de características, a unidade de atenção regional identifica as regiões mais informativas da imagem de RM. Usando um método de atenção estruturado, a unidade de foco proposta se concentra em áreas que contêm informações discriminativas do tumor.

Para melhorar a representação de características, técnicas como Top Activation Pooling e extração de características equilibrada são usadas antes da fase de detecção

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Três modelos de aprendizado profundo pré-treinados, nomeadamente MobileNetV2, EfficientNetV1 e Inception-ResNet-V2, foram avaliados para a classificação de tumores cerebrais em quatro classes usando imagens de ressonância magnética.

Conjunto de Dados Utilizado
A estrutura proposta foi avaliada usando um conjunto de dados de ressonância magnética de tumor cerebral publicamente disponível obtido da plataforma Kaggle. O conjunto de dados consistia em 835 imagens de ressonância magnética de cérebros normais, 826 imagens de glioma, 822 imagens de meningioma e 827 imagens de tumores hipofisários. Amostras representativas de ressonância magnética do conjunto de dados são mostradas em Figura 2.

MobileNetV2
O modelo MobileNetV2 continha 2.263.108 parâmetros totais, incluindo 2.228.996 treináveis e 34.112 não treináveis. As métricas de desempenho de classificação são apresentadas na Tabela 2. O modelo alcançou uma precisão geral de classificação de 97%, com F1 Scores médios macro e ponderados comparáveis. A matriz de confusão mostrada na Tabela 3 demonstra um forte desempenho de classificação em todas as quatro categorias de tumores, com relativamente poucas classificações erradas entre glioma e meningioma.

Figura 3 apresenta as curvas de precisão/perda de treinamento e validação para MobileNetV2. O modelo demonstrou convergência estável após várias épocas de treinamento, com o desempenho de validação melhorando gradualmente.

Inception-ResNet-V2
O modelo Inception-ResNet-V2 tinha 54.342.884 parâmetros totais, incluindo 54.282.340 treináveis e 60.544 não treináveis. As métricas de classificação são resumidas na Tabela 4. O modelo alcançou uma precisão geral de classificação de 98%, demonstrando melhor desempenho em comparação com o MobileNetV2.

A matriz de confusão na Tabela 5 indica alta precisão de classificação em todas as categorias de tumores com taxas de classificação errada reduzidas. Melhor discriminação entre classes de tumores foi observada em comparação com o modelo MobileNetV2. Figura 4 ilustra as curvas de desempenho de treinamento e validação para Inception-ResNet-V2. O modelo exibiu comportamento de aprendizagem estável e convergência consistente ao longo das épocas de treinamento.

EfficientNetV1
O modelo EfficientNetV1 continha 6.580.363 parâmetros totais, incluindo 6.518.308 treináveis e 62.055 não treináveis. As métricas de classificação resumidas na Tabela 6 demonstram o melhor desempenho entre os modelos avaliados, alcançando aproximadamente 99% de precisão, precisão, recall e F1-score.

A matriz de confusão na Tabela 7 demonstra um forte desempenho de classificação em todas as quatro classes de tumores, com mínima classificação errada. O modelo classificou corretamente a maioria das imagens de glioma, meningioma, sem tumor e tumor hipofisário.

Figura 5 apresenta as curvas de precisão/perda de treinamento e validação para EfficientNetV1. O modelo alcançou convergência estável com menores flutuações de validação em comparação com as outras arquiteturas avaliadas.

Comparação Geral
Entre os modelos avaliados, o EfficientNetV1 alcançou o melhor desempenho de classificação, mantendo uma complexidade computacional menor do que o Inception-ResNet-V2. O MobileNetV2 demonstrou um desempenho leve eficiente com requisitos de parâmetro reduzidos, enquanto o Inception-ResNet-V2 alcançou uma precisão de classificação melhorada à custa de uma complexidade de modelo substancialmente maior. Os resultados indicam que o EfficientNetV1 fornece o melhor equilíbrio entre precisão de classificação e eficiência computacional para a classificação de tumores cerebrais em quatro classes usando ressonância magnética.

Disponibilidade de Dados
O conjunto de dados de ressonância magnética cerebral analisado neste estudo está disponível publicamente através da plataforma Kaggle. Todos os dados gerados e analisados durante este estudo, incluindo resultados de classificação, métricas de desempenho, matrizes de confusão e resultados de treinamento/validação, são apresentados nas figuras e tabelas deste artigo. O código personalizado usado para o desenvolvimento e avaliação do modelo está disponível mediante solicitação razoável ao autor correspondente.

Figura 1
Figura 1: Framework de aprendizado por transferência guiado por atenção para classificação de tumor cerebral em quatro classes. O fluxo de trabalho ilustra o pré-processamento, extração de características baseada em atenção, aprendizado de características convolucionais, fusão de características e camadas de classificação totalmente conectadas usadas para classificação de tumor baseada em ressonância magnética. Por favor, clique aqui para ver uma versão maior desta figura.

Figura 2
Figura 2: Imagens de ressonância magnética representativas do conjunto de dados de tumor cerebral em quatro classes.
São apresentadas varreduras de ressonância magnética de amostra correspondentes às classes de glioma, meningioma, tumor hipofisário e cérebro normal usadas para treinamento e avaliação do modelo. Por favor, clique aqui para ver uma versão maior desta figura.

Figura 3
Figura 3: Curvas de precisão/perda de treinamento e validação para MobileNetV2. Os gráficos demonstram o comportamento de convergência do MobileNetV2 durante o treinamento, incluindo mudanças na precisão de classificação e perda ao longo das épocas. Por favor, clique aqui para ver uma versão maior desta figura.

Figura 4
Figura

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
```html

A avaliação de desempenho, baseada em precisão, recall, F1-score e precisão, revela que tanto o MobileNetV2 quanto o Inception-ResNet-V2 atingem resultados comparáveis na classificação de tumores cerebrais, cada um alcançando uma precisão agregada e média ponderada de 97–98%. Em contraste, o EfficientNet supera os outros modelos, atingindo 99% de precisão em métricas macro e média ponderada, graças à sua generalização aprimorada e estratégia de escalamento composto. Esses resultados são consistentes com estudos anteriores que demonstram a eficácia das arquiteturas EfficientNet para classificação de tumores de ressonância magnética multiclasse e aprendizado de características computacionalmente eficiente22. Da mesma forma, estruturas de MobileNetV2 baseadas em transferência de aprendizado já demonstraram forte desempenho em tarefas de classificação de tumores cerebrais leves, mantendo baixa complexidade computacional21.

O desempenho aprimorado do EfficientNetV1 pode ser atribuído ao seu equilíbrio no dimensionamento da profundidade da rede, largura e resolução de entrada, o que permite uma extração eficiente de características discriminativas relacionadas a tumores. Observações comparáveis sobre as vantagens das estratégias de dimensionamento composto foram relatadas em estudos anteriores de otimização de CNN7,8. Além disso, a integração do módulo de extração de características guiado por atenção provavelmente contribuiu para uma melhor localização das regiões relevantes para tumores, suprimindo informações de fundo irrelevantes, o que está alinhado com os resultados de estudos de classificação de imagens médicas baseados em atenção10,15.

Apesar desses resultados, vários desafios permanecem na classificação de tumores cerebrais, incluindo a diferenciação precisa de tumores irregulares, a segmentação de subregiões além do núcleo do tumor e a classificação precisa entre diversos tipos de tecido cerebral. Estudos anteriores também destacaram limitações relacionadas à diversidade do conjunto de dados, capacidade de generalização e complexidade computacional em sistemas de classificação de tumores baseados em ressonância magnética9,11,12. Além disso, estruturas de ressonância magnética multimodal demonstraram melhor representação de características e visualização de tumores, embora esses métodos frequentemente exijam pré-processamento extensivo e recursos computacionais mais altos13,17,18,20.

Tabela 8 apresenta uma análise consolidada de validação cruzada do MobileNetV2, Inception-ResNet-V2 e EfficientNetV1 com validação de 5 dobras. A tabela apresenta a média e o desvio padrão de precisão, precisão, recall e F1-score, juntamente com precisões por dobra. O MobileNetV2 demonstra desempenho estável, mas comparativamente menor, enquanto o Inception-ResNet-V2 melhora tanto a precisão quanto a consistência. O EfficientNetV1 atinge a maior precisão média (0,989 ± 0,003) com a menor variância, indicando excelente capacidade de generalização. Suas precisões por dobra consistentemente altas (0,986–0,992) demonstram desempenho robusto e estável em várias divisões de dados, estabelecendo-o como o modelo mais eficaz para classificação de ressonância magnética de tumores cerebrais de quatro classes neste estudo.

Limitações do estudo
A avaliação atual da estrutura depende apenas da adição de dados online, o que pode limitar sua robustez no manuseio de uma maior variabilidade de dados em cenários do mundo real. Além disso, o estudo explora principalmente a extração de características das camadas convolucionais finais, sem avaliar os benefícios potenciais da incorporação de fusão de características multicamadas. A pesquisa também está restrita a conjuntos de dados de ressonância magnética estática e não foi validada em um fluxo de trabalho clínico ao vivo, o que pode apresentar desafios de integração.

Direções para Pesquisas Futuras
Trabalhos futuros devem explorar a agregação de características de várias camadas do MobileNetV2 e de outros backbones para melhorar ainda mais a precisão da classificação. Estender a estrutura para suportar dados de imagem multimodais e validar seu desempenho em ambientes clínicos em tempo real fortalecerá sua aplicabilidade prática. Além disso, otimizar a arquitetura para implantação em plataformas móveis e IoT, juntamente com técnicas avançadas de aumento e conjuntos de dados de pacientes do mundo real, pode permitir diagnósticos de tumores cerebrais escaláveis e de alto desempenho em diversos ambientes de saúde.

Conclusão
Este estudo apresenta uma estrutura leve de aprendizado por transferência guiada por atenção para classificação de quatro classes de tumores cerebrais usando imagens de ressonância magnética. Ao aproveitar o aprendizado por transferência com MobileNetV2, EfficientNetV1 e Inception-ResNet-V2, o modelo atinge alta precisão mantendo eficiência computacional, tornando-o potencialmente adequado para ambientes clínicos com recursos limitados. Experimentos em um conjunto de dados de ressonância magnética equilibrado de quatro classes demonstram que o EfficientNetV1 entrega os melhores resultados, atingindo 99% de precisão, precisão, recall e F1-score. A arquitetura proposta efetivamente equilibra desempenho e uso de recursos, oferecendo uma abordagem promissora para cenários de imagem médica com recursos limitados.

```

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores não têm conflitos de interesse a declarar.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Nenhum financiamento externo foi recebido para este estudo.

Materials

```html

List of materials used in this article
NameCompanyCatalog NumberComments
Brain MRI DatasetIEEEhttps://dx.doi.org/10.21227/q2vt-tf46O conjunto de dados é baixado com acesso ao instituto. O conjunto de dados de ressonância magnética contém quatro classes: glioma, meningioma, tumor hipofisário e cérebro normal
CNN Accelerator (Layer Fusion)Trabalho propostoFusão lógica das camadas convolucionais superiores para reduzir o acesso à memória e melhorar a eficiência computacional
Custom Attention ModuleTrabalho propostoMecanismo de atenção que integra max-pooling e average-pooling para enfatizar as regiões relevantes do tumor
EfficientNetV1GooglePré-treinado (ImageNet)Arquitetura de CNN escalável que oferece um equilíbrio ideal entre precisão e eficiência
Google ColaboratoryGooglehttps://colab.research.google.com/Ambiente baseado em nuvem usado para treinamento de modelo, avaliação e experimentação com suporte a GPU
Inception-ResNet-V2GooglePré-treinado (ImageNet)Arquitetura de CNN híbrida profunda que combina módulos Inception com conexões residuais
KerasGooglev2.6.0API de rede neural de alto nível construída sobre TensorFlow para prototipagem rápida de modelos
MatplotlibMatplotlib Developersv3.4.3Biblioteca de visualização usada para plotar curvas de treinamento, matrizes de confusão e métricas de desempenho
MobileNetV2GooglePré-treinado (ImageNet)Estrutura de backbone de CNN leve otimizada para implantação móvel e de borda
NumPyNumPy Developersv1.21.4Biblioteca de computação científica central usada para operações numéricas
PandasPandas Development Teamv1.3.4Biblioteca de manipulação e tratamento de dados usada para organização de conjunto de dados e processamento de metadados
PythonPython Software Foundationv3.8.10Linguagem de programação principal usada para pré-processamento de dados, desenvolvimento de modelos e avaliação
Scikit-learnScikit-learn DevelopersVersão mais recente estávelUsado para métricas de avaliação de desempenho, como precisão, recall, F1-score e matrizes de confusão
SeabornSeaborn DevelopersVersão mais recente estávelBiblioteca de visualização estatística de alto nível usada para análise gráfica aprimorada
TensorFlowGooglev2.6.0Framework de aprendizado profundo completo usado para implementar backbones de CNN e módulos de atenção
```

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Cancer ResearchMobileNetV2EfficientNetV1Inception ResNet V2transfer learningbrain tumor

Related Articles