Artigo de método

Um método explicável de aprendizado de transferência baseado em IA para a previsão do câncer de mama

DOI:

10.3791/70011

22 de junho de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Um protocolo explicável de transferência de aprendizagem usando EfficientNet-B0 e Grad-CAM foi desenvolvido para classificar imagens de ultrassom mamário em categorias benignas, malignas e normais, fornecendo mapas de calor diagnósticos interpretáveis adequados para aplicações de suporte à decisão clínica.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A identificação do câncer de mama por meio de imagens ultrassonizadas exige alta precisão e transparência para auxiliar os profissionais na tomada de decisões adequadas. Este trabalho demonstra um sistema de aprendizado profundo para classificação de imagens de ultrassom mamário em imagens benignas, malignas e normais usando a arquitetura EfficientNet-B0 ajustada no conjunto de dados Breast Ultrasound Identification (BUSI). Para mitigar o desequilíbrio de classes e estabilizar a rede, é aplicada a ampliação de dados, incluindo inversão horizontal aleatória, rotação e jittering de cor. O Mapeamento de Ativação de Classes ponderado por gradiente (Grad-CAM) é utilizado para gerar explicações visuais identificando regiões de interesse, como margens tumorais e padrões de textura. O modelo alcançou uma precisão média de 99%, demonstrando alta eficácia na detecção de lesões. A integração da IA Explicável (XAI) não só melhora a confiança no diagnóstico, mas também faz a ponte entre a prática clínica e a IA. Os resultados comprovam o potencial de combinar modelos de aprendizado profundo de alto desempenho com métodos de interpretabilidade no desenvolvimento de ferramentas confiáveis para diagnóstico de câncer de mama, adequadas para a prática clínica real.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O câncer de mama é uma das doenças mais significativas que ameaçam a vida e afetam mulheres em todo o mundo. De acordo com a Organização Mundial da Saúde (OMS), o câncer de mama contribui para a maioria das mortes relacionadas ao câncer, e o diagnóstico precoce é fundamental para aumentar a taxa desobrevivência 1. A ultrassom por imagem tornou-se um procedimento diagnóstico rotineiro para câncer de mama porque é segura, barata e pode produzir imagens em tempo real. Ao contrário da mamografia, o ultrassom é extremamente eficaz na diferenciação de massas sólidas e crescimento que contêm líquido e, portanto, serve como um excelente auxílio diagnóstico na presença de patologia mamária. A interpretação de imagens por ultrassom é altamente subjetiva e depende de conhecimento de alto nível, causando variabilidade no diagnóstico e possível erro humano.

Nos últimos anos, a IA e o deep learning demonstraram vastas capacidades na automação da análise de imagens médicas. Modelos baseados em deep learning, especialmente CNNs, se destacam em segmentação, detecção e classificaçãode objetos 2. No entanto, a adoção da IA na saúde é inibida pela natureza "caixa-preta" desses modelos. O termo "caixa preta" refere-se à falta de transparência em como um modelo chega a uma conclusão específica; Embora as entradas e saídas sejam conhecidas, a lógica interna e as características específicas usadas para fazer uma previsão clínica permanecem ocultas do usuário.

A motivação para esse trabalho vem da necessidade urgente de instrumentos confiáveis para apoiar o diagnóstico precoce do câncer de mama, que continua sendo uma das principais causas de mortalidade feminina globalmente. Embora os modelos de aprendizado profundo sejam altamente eficazes, sua falta de interpretabilidade limita a integração em ambientesclínicos 3. O presente trabalho preenche essas lacunas empregando o EfficientNet-B0 para classificação de alto desempenho e integrando técnicas de IA Explicável (XAI), como o Grad-CAM, para fornecer insights visuais sobre o processo de tomada de decisão do modelo. Ao equilibrar transparência e precisão, este estudo visa desenvolver um sistema de IA confiável que ofereça suporte diagnóstico sólido aos clínicos. Os métodos XAI revelam o raciocínio subjacente das previsões dos modelos, permitindo que os clínicos verifiquem os resultados e preencham a lacuna entre a prática clínica e sistemasautomatizados 4. Na classificação por ultrassom de mama, essa interpretabilidade garante que os diagnósticos baseados em IA sejam tanto precisos quanto clinicamente justificáveis.

Apesar dos avanços no aprendizado profundo, a classificação de imagens por ultrassom da mama não está isenta de desafios, incluindo desequilíbrio de classes, onde classes minoritárias como tumores malignos são sub-representadas, levando a modelostendenciosos 5. A falta de interpretabilidade nos modelos de deep learning torna difícil aplicá-los na prática clínica, pois os clínicos exigem tomada de decisão transparente. Restrições no conjunto de dados, como tamanho e diversidade limitados, limitam a generalização dos modelos, enquanto as características complexas das imagens em ultrassom, como bordas tumorais e textura, são difíceis de aprender6. As soluções para os problemas mencionados exigem uma estrutura robusta e interpretável, garantindo alta precisão com uma compreensão clara da previsãodo modelo 7.

O estudo visa desenvolver uma estrutura de aprendizado profundo capaz de classificar imagens de ultrassom mamário em categorias benignas, malignas e normais, ao mesmo tempo em que melhora a generalização por meio de aumento direcionado para classes minoritárias. A estrutura integra o Mapeamento de Ativação de Classes ponderado por gradiente para fornecer explicações visuais das previsões e avaliar o desempenho usando precisão, exatidão, recordação e pontuação F1, demonstrando sua adequação como um sistema de apoio à decisão clínica interpretável. Em contraste com os estudos explicáveis baseados em ultrassom sobre câncer de mama realizados anteriormente, onde o Grad-CAM é utilizado principalmente como visualizaçãopós-hoc 8, a estrutura proposta combina pré-processamento consciente da lesão e aprendizagem consciente da classe na fase de treinamento. Máscaras de base do conjunto de dados Breast Ultrasound Images (BUSI) são sobrepostas às imagens de ultrassom para destacar os limites das lesões e padrões internos de eco ao extrair características, e o aumento seletivo é usado em grupos diagnósticos minoritários para reduzir o desequilíbrio nas classes sem alterar características de aparência clinicamentesignificativas 9. Essa combinação de aumento de lesões impulsionado por lesões, aprendizado por transferência EfficientNet-B0 e explicabilidade Grad-CAM é uma combinação que melhora a robustez diagnóstica e produz interpretações consistentes com a morfologia da lesão, o que justifica a hipótese de que o aprimoramento e explicabilidade da lesão guiados anatomicamente podem tornar o diagnóstico do câncer de mama assistido por IA confiávele confiável 10.

A imagem médica tradicional tradicionalmente se baseava em métodos convencionais de processamento de imagem, incorporando filtragem, segmentação e operações morfológicas para identificar estruturas visíveis para o diagnóstico11. No entanto, esses processos geralmente exigiam ajuste manual e tinham dificuldade para acomodar a variabilidade e complexidade inerentes das imagens médicas. Por exemplo, a interpretação por ultrassom mamário dependia historicamente da expertise subjetiva dos radiologistas, onde a identificação de lesões malignas e benignas dependia de representações visuais propensas a erros humanos ou má interpretação.

O advento do aprendizado profundo catalisou uma revolução transformadora na imagem médica, principalmente por meio da implantação das Redes Neurais Convolucionais (CNNs)12. Entre eles, o EfficientNet-B0 representa uma inovação significativa, utilizando um método de escalonamento composto que equilibra profundidade, largura e resolução da rede para alcançar cálculos altamente eficientes e precisos. No contexto da imagem por ultrassom mamário, o modelo utiliza camadas convolucionais sequenciais para aprender automaticamente características hierárquicas, eliminando efetivamente a necessidade de extração manual subjetiva de características, ao mesmo tempo em que melhora significativamente a precisão e confiabilidadediagnósticas 13. Apesar desse potencial impressionante, o deep learning em imagem médica continua sendo um campo em evolução com desafios não resolvidos. A qualidade e a disponibilidade dos dados são fundamentais, pois modelos de deep learning exigem vastos repositórios de imagens anotadas para garantir uma generalização bem-sucedida. Além disso, a natureza "caixa-preta" desses modelos representa obstáculos significativos à aceitação clínica; Preocupações éticas sobre possíveis vieses nos dados de treinamento também podem levar a previsões diagnósticas enviesadasou discriminatórias 14. Consequentemente, essa pesquisa exige protocolos rigorosos de teste e validação para garantir que os modelos permaneçam objetivos e clinicamente sólidos. Para enfrentar essas limitações, os desenvolvimentos atuais em deep learning focam em melhorar a interpretabilidade e robustez dos modelos. Técnicas como o Mapeamento de Ativação de Classes ponderado por gradiente (Grad-CAM), conforme aplicado neste estudo, permitem a visualização de regiões específicas da imagem que influenciam os resultados do modelo, promovendo assim uma compreensão mais profunda do comportamento do modelo e apoiando a tomada de decisões clínicas. Além disso, avanços em frameworks de aprendizagem federada facilitam colaborações conscientes da privacidade entre instituições, permitindo o uso de dados heterogêneos sem a necessidade de compartilhar conjuntos de dados brutos. Esses avanços estão permitindo progressivamente aplicações de aprendizado profundo mais confiáveis, interpretáveis e imparciais em imagem médica, aprimorando, em última análise, os critérios clínicos e o cuidado ao paciente 15.

A importância dos sistemas de decisão médicainterpretáveis 16 foi destacada por avanços recentes em inteligência artificial explicável. Estruturas interpretáveis baseadas em fusão demonstraram melhor classificação e transparência por meio da combinação de mais de uma representação de características e mais de um mecanismode explicação 17. Pesquisas recentes demonstraram um alto potencial de utilização de modelos de aprendizado profundo em conjunto com os métodos XAI para aumentar a confiança no diagnóstico de câncer de mama e outras tarefas de predição médica. Esses artigos reforçam a necessidade de ter tanto um raciocínio preditivo quanto interpretável por parte dos clínicos, o que é consistente com o objetivo do estudo atual de criar um sistema de classificação por ultrassom eficaz ecompreensível 18.

A Tabela 1 apresenta a revisão da literatura e as tecnologias existentes.

EstudoObjetivoObservação
Humayra Afrin et al.(2023)19Revise aplicações de aprendizado profundo para diagnóstico e prognóstico de ultrassom de massa mamária.A classificação das lesões apresentou o maior desempenho, com menos estudos sobre prognóstico.
Gelan Ayana et al. (2022)20Revise os nanotransportadores guiados por ultrassom para quimioterapia do câncer de mama.Nanotransportadores responsivos ao ultrassom melhoram a administração de medicamentos, mas enfrentam barreiras fisiológicas.
Valerio Di Paola et al. (2022)21Analise técnicas de imagem para obter uma N-estadiação precisa no câncer de mama.Ressonância magnética e ultrassom desempenham papéis fundamentais, mas falsos positivos/negativos afetam a precisão do diagnóstico.
Adyasha Sahu et al. (2024)22Propõe um classificador de aprendizado profundo em conjunto para a detecção do câncer de mama.Alcançou alta precisão usando AlexNet, ResNet e MobileNetV2 com LoG e alta pressão.
Alireza Rezazadeh et al.(2022)23Desenvolva um pipeline explicável de ML para diagnóstico de câncer de mama usando imagens de ultrassom.Utiliza características de textura e conjuntos de árvores de decisão para melhorar a interpretabilidade das previsões.
Asaf Raza et al. (2023)24Desenvolva o DeepBreastCancerNet para uma detecção robusta do câncer de mama.Alcançou 99,63% de precisão usando arquitetura de 24 camadas com múltiplas otimizações.
Kiran Jabeen et al. (2022)25Proponha uma framework de deep learning usando DarkNet-53 e fusão de recursos.Alcançou 99,1% de precisão usando técnicas otimizadas de seleção de recursos.
Gelan Ayana et al. (2022)26Desenvolver aprendizagem por transferência em múltiplos estágios (MSTL) para classificação de câncer de mama por ultrassom.Melhoria da precisão usando aprendizado de transferência baseado em imagens médicas com EfficientNetB2, InceptionV3 e ResNet50.
Saksham Gupta et al. (2023)27Use ResNet50 modificado para classificação de câncer de mama por ultrassom.Atingiu 97,8% de precisão, reduzindo o tempo de diagnóstico e melhorando a detecção precoce.
Karl Kratkiewicz et al. (2022)28Revise métodos avançados de imagem como tomografia por ultrassom (UST) e tomografia fotoacústica (PAT).UST e PAT aprimoram a detecção do câncer de mama com imagens quantitativas.

Tabela 1: Mostra a literatura e revisão das tecnologias existentes.

O modelo sugerido baseia-se nas conquistas do aprendizado profundo na classificação de imagens de ultrassom mamário, que superam os principais desafios desta pesquisa, incluindo a qualidade dos dados, a interpretabilidade de um modelo e a eficiência dos cálculos. Em contraste com as técnicas antigas, onde a extração manual de características é usada, neste trabalho, os autores aproveitam o EfficientNet-B0, a arquitetura mais recente, que combina profundidade, largura e resolução no melhor esquema de trabalho. O modelo utiliza o Grad-CAM para visualizar a explicação de sua previsão, o que aumenta sua transparência e confiança clínica. Embora as soluções atuais, incluindo modelos de conjunto e aprendizado por transferência, tenham se tornado altamente precisas, elas não podem ser facilmente interpretadas ou podem exigir grande poder de processamento. O trabalho apresentado aborda essas lacunas, pois é altamente preciso (99) e interpretável, garantindo que o modelo seja confiável e viável nos aspectos práticos da tomada de decisão clínica. A abordagem proposta ao focar no desequilíbrio entre as aulas e o uso prático é um novo padrão de diagnóstico de câncer de mama impulsionado por IA.

O artigo utiliza um BUSI disponível publicamente, um conjunto previamente coletado de imagens clínicas anonimizadas. Não havia indivíduos humanos e animais diretos neste estudo, e, portanto, não havia necessidade de aprovação ética institucional (IRB/IACUC). Todas as operações estão de acordo com padrões comuns de uso secundário dos dados públicos de imagem médica.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Características do conjunto de dados

O estudo utilizou o conjunto de dados público Breast Ultrasound Images (BUSI), que forneceu um repositório bem documentado para a análise e classificação do câncerde mama 29. Esse conjunto de dados se mostrou particularmente apropriado, pois incorporou uma vasta coleção de imagens de ultrassom necessárias para estabelecer e validar modelos de aprendizado profundo para imagens médicas. O conjunto de dados compreendia 780 imagens de ultrassom coletadas de 600 mulheres de 25 a 75 anos, representando uma população diversificada para o diagnóstico de câncer de mama. Todas as imagens mantinham uma resolução média de 500 x 500 pixels e utilizavam o formato PNG para preservar dados visuais de alta qualidade para análise. A Figura 1 ilustra o fluxo de trabalho geral do framework proposto, incluindo pré-processamento, aumentação, extração de características EfficientNet-B0, classificação e interpretabilidade Grad-CAM.

figure-protocol-1
Figura 1: Amostras representativas do conjunto de dados BUSI. (A) Imagens benignas, (B) malignas e (C) normais. Painéis ilustram a diversidade morfológica usada para o treinamento. Por favor, clique aqui para ver uma versão ampliada desta figura.

2. Fluxo de trabalho experimental

Para garantir a reprodutibilidade, a investigação executou o pipeline de processamento em etapas sequenciais. Primeiro, o sistema carregou as imagens de ultrassom BUSI e as máscaras de precisão do solo correspondentes, redimensionando-as para 224×224 pixels, seguido pela normalização ImageNet. Segundo, a estrutura sobrepôs cada imagem com sua máscara para enfatizar as regiões da lesão antes de dividir o conjunto de dados em subconjuntos de treinamento (70%), validação (15%) e testes (15%) usando amostragem estratificada. Terceiro, o estudo aplicou aumento direcionado consistindo em inversão horizontal, rotação (±15°) e vibração de cor principalmente para as classes minoritárias. Quarto, os pesquisadores ajustaram o modelo EfficientNet-B0, que foi pré-treinado no ImageNet, substituindo a camada final de classificação por uma camada de saída de três classes. O processo de treinamento utilizava o otimizador Adam (taxa de aprendizado 0,00005), decaimento da taxa de aprendizado em etapas (γ = 0,1 a cada 7 épocas), perda de entropia cruzada, tamanho de lote de 8 e parada precoce com paciência de 2. Por fim, o Grad-CAM gerou mapas de calor de atenção a partir da última camada convolucional para visualizar regiões diagnosticamente relevantes e apoiar a interpretação clínica. A Tabela de Materiais lista os conjuntos de dados essenciais, bibliotecas de software e configurações de hardware necessárias para reproduzir a estrutura de classificação e interpretabilidade por ultrassons mamários do estudo.

O conjunto de dados BUSI apresentou um desequilíbrio natural de classes, uma característica frequentemente observada em conjuntos de dados médicos. A distribuição favoreceu a classe benigna, seguida pelos casos malignos e normais. Especificamente, o conjunto de dados continha 487 imagens benignas, 210 malignas e 133 imagens normais. Embora a ampliação de dados tenha aumentado a variabilidade do treinamento, ela não alterou a contagem fundamental da amostra em cada turma. Essa distribuição refletia cenários clínicos do mundo real, onde condições benignas ocorrem com mais frequência do que tumores malignos. Embora tal desequilíbrio tenha retratado com precisão a prevalência de anormalidades mamárias em ambientes clínicos, ele apresentava desafios para o treinamento em aprendizado profundo, pois podia levar a previsões tendenciosas e desempenho subótimo para classes minoritárias. Consequentemente, mitigar esse desequilíbrio tornou-se essencial para formular um modelo eficaz e generalizável que atuasse de forma eficiente em todas as categorias diagnósticas. A Figura 2 mostra imagens representativas de ultrassom do conjunto de dados, ilustrando exemplos de amostras de tecido mamário benigno, maligno e normal.

figure-protocol-2
Figura 2: Fluxo de trabalho proposto do modelo. Pipeline sequencial desde o pré-processamento de entrada e sobreposição de máscaras até o treinamento EfficientNet-B0 e a saída Grad-CAM. Por favor, clique aqui para ver uma versão ampliada desta figura.

3. Pré-processamento de dados

O estudo redimensionou todas as imagens para 224 x 224 pixels, seguindo as dimensões padrão de entrada para a arquitetura EfficientNet-B0. Esse redimensionamento garantiu consistência do conjunto de dados e redução dos requisitos computacionais, conforme definido pela equação 1.

figure-protocol-3     

A estrutura normalizou os valores dos pixels usando a média e o desvio padrão do conjunto de dados ImageNet ([0,485, 0,456, 0,406] para média e [0,229, 0,224, 0,225] para std). Essa normalização escalou os dados de entrada para aumentar a estabilidade do treinamento e a velocidade de convergência, calculadas de acordo com a equação 2.

figure-protocol-4      

Para melhorar a extração de características e a identificação de regiões de interesse, os pesquisadores sobrepuseram as imagens originais sobre suas máscaras de verdade de base correspondentes. A Figura 3 ilustra as máscaras de lesões com precisão no terreno e as imagens de ultrassom sobrepostas que destacaram os limites tumorais.

figure-protocol-5
Figura 3: Máscara e imagens sobrepostas. (A) Ultrassom original, (B) máscara de verdade no solo e (C) sobreposição resultante que destaca os limites tumorais para atenção espacial. Por favor, clique aqui para ver uma versão ampliada desta figura.

Essa sobreposição identificou regiões críticas, como margens tumorais e padrões de textura, fornecendo ao modelo contexto espacial localizado para melhorar a precisão da classificação, conforme mostrado na equação 3.

figure-protocol-6      

O estudo utilizou a operação de sobreposição de máscara exclusivamente durante a preparação dos dados de treinamento para complementar o conhecimento da fronteira da lesão durante o aprendizado de características. Em contraste, as fases de validação e inferência empregaram apenas as imagens originais de ultrassom sem máscaras, mantendo um pipeline convencional de classificação de imagens. Como as máscaras de segmentação binária no conjunto de dados BUSI representavam estruturas já inerentes às imagens de ultrassom, elas não introduziram novos rótulos de classe. Para evitar vazamento de informações, a investigação dividiu o conjunto de dados em conjuntos de treinamento, validação e teste, garantindo que nenhum pares sobreposto de imagens ou máscaras fossem compartilhados entre subconjuntos. Consequentemente, a sobreposição funcionava como um guia de atenção espacial que destacava áreas anatomicamente significativas sem comprometer a independência dos dados de avaliação.

4. Ampliação de Dados

O estudo implementou aumento de dados direcionado para mitigar o desequilíbrio de classes dentro do conjunto de treinamento, focando especificamente nas classes malignas e normais de minorias. A estrutura utilizou uma ampla gama de transformações para aumentar artificialmente a variabilidade dos dados de treinamento e melhorar a capacidade do modelo de generalizar entre diversas condições de imagem.

Primeiro, o sistema realizou inversão horizontal com uma probabilidade de 0,9 (90%), permitindo que o modelo reconhecesse características independentemente da direção da varredura. Essa transformação seguiu a equação 4:

figure-protocol-7      

Segundo, a investigação aplicou rotações aleatórias dentro de uma faixa de ±15° para simular variações nos ângulos de varredura e no posicionamento dos pacientes. Esse processo forçou o modelo a aprender características invariantes à rotação, como margens tumorais e padrões de textura, conforme definido pela equação 5:

figure-protocol-8      

Terceiro, os pesquisadores utilizaram o tremor de cor para simular variações na iluminação, contraste e equilíbrio de cores. A estrutura ajustava brilho, contraste e saturação por um fator de 0,2, e matiz por 0,1. Esses ajustes estocásticos melhoraram a robustez do modelo a mudanças de aparência, calculadas de acordo com a equação 6:

figure-protocol-9      

A seleção desses intervalos específicos de hiperparâmetros (inversão horizontal 0,9, rotação +15, -15, brilho/contraste/saturação 0,2, matiz 0,1) resultou de uma avaliação empírica de estabilidade. A investigação determinou que essas configurações otimizavam o equilíbrio entre geração de diversidade e realismo anatômico, garantindo convergência constante e precisão estável de validação sem induzir deformações irreais das lesões.

5. Arquitetura de Modelos

O estudo utilizou o EfficientNet-B0, um modelo moderno de CNN reconhecido por sua eficiência, escalabilidade e desempenho em comparação com outras arquiteturas de classificação de imagens. Esse modelo empregava um método de escalar proporcionalmente a profundidade, largura e resolução da rede, o que permitia alta precisão com um número significativamente reduzido de parâmetros em comparação com arquiteturas padrão como ResNet e VGG. Essa abordagem de escalonamento permitiu que a estrutura lidasse com imagens de alta resolução mantendo-se computacionalmente eficiente, atendendo às necessidades específicas da imagem médica. A Figura 4 ilustra a arquitetura do EfficientNet-B0, destacando a sequência de blocos convolucionais e MBConv usados para extração hierárquica de características.

figure-protocol-10
Figura 4: Arquitetura EfficientNet-B0. Esquema dos blocos MBConv e fatores de escalonamento compostos usados para extração hierárquica de características. Por favor, clique aqui para ver uma versão ampliada desta figura.

Para modificar o EfficientNet-B0 para a tarefa de classificação por ultrassom de mama, os pesquisadores introduziram ajustes específicos na estrutura do modelo. O sistema trocou a camada inicial de classificação, destinada ao conjunto de dados ImageNet de 1.000 classes, por uma camada totalmente conectada (densa) composta por 3 neurônios de saída. A investigação definiu todas as camadas da espinha dorsal pré-treinada EfficientNet-B0 como treináveis e as otimizou conjuntamente com a nova camada de classificação, seguindo uma estratégia completa de ajuste fino. O processo de treinamento não aplicou congelamento em etapas ou descongelamento gradual. O framework realizava treinamento usando o otimizador Adam com taxa de aprendizado de 0,00005 e um escalonador de taxa de aprendizado por etapas que reduzia a taxa por um fator de 0,1 a cada 7 épocas. Esses neurônios correspondiam às três classes-alvo dentro do conjunto de dados BUSI: benignos, normais e malignos. O modelo utilizou uma ativação SoftMax na camada de saída, transformando as pontuações brutas em distribuições de probabilidade, conforme calculado na equação 7. A Tabela 2 mostra a descrição da arquitetura do modelo.

figure-protocol-11      

Tipo de camadaDescrição
Camada de EntradaAceita imagens de tamanho 224 x 224 x 3
Camadas convolucionaisInclui blocos de convolução inicial e MBConv para extração de características.
Agrupamento Médio GlobalReduz as dimensões espaciais a um vetor de características 1D.
Camada Totalmente ConectadaMapeia o vetor de características para 3 neurônios de saída (normal, benigno, maligno).
Ativação SoftMaxConverte logits em probabilidades para classificação multiclasse.

Tabela 2: Mostra a descrição da arquitetura do modelo.

Os parâmetros usados para treinar o modelo foram o otimizador de Adam, uma taxa inicial de aprendizado de 0,00005, e a perda categórica de entropia cruzada (três classes), calculada matematicamente conforme a equação 9. Pesos pré-treinados do ImageNet foram usados para inicializar o EfficientNet-B0, e totalmente treinados, e todas as camadas da espinha dorsal foram treinadas e nenhum congelamento em etapas foi aplicado. O classificador inicial foi substituído por uma camada totalmente conectada e três neurônios de saída e, finalmente, ativação SoftMax, que representava as classes benigna, maligna e normal. As imagens foram reduzidas para 224 x 224 pixels, e depois normalizadas pela média e desvio padrão do ImageNet, sendo carregadas em mini-lotes de 8. Um agendador de taxa de aprendizado por etapas diminuiu a taxa de aprendizado em 0,1 a cada 7 épocas. A perda de validação foi usada para parar cedo com paciência de 2 épocas para evitar sobreajustamento. Ativações Grad-CAM foram produzidas com base na última camada convolucional, calculando gradientes, agrupamento de médias globais para obter pesos dos canais e ampliando os mapas de ativação para resolução de entrada.

Para confirmar essa estabilidade, o treinamento era repetido ao longo de várias execuções com desempenho de validação de correspondência. O monitoramento das curvas de perda de treinamento e validação foi usado para identificar sobreajuste, e um conjunto de testes estratificados de resistência não dependeu do treinamento foi usado para realizar a avaliação final. A diferença entre o desempenho da validação e o desempenho do teste é pequena, o que demonstra convergência consistente e reprodutibilidade de otimização. A Equação 10 define um cronograma de taxa de aprendizado em etapas específicas. A Equação 15 indica dois aumentos consecutivos na perda de validação, indicando possível sobreajuste.

figure-protocol-12      

figure-protocol-13      

figure-protocol-14      

figure-protocol-15      

figure-protocol-16      

figure-protocol-17      

figure-protocol-18      

O EfficientNet-B0 é particularmente flexível para a tarefa de classificação por ultrassonografia mamária, pois a arquitetura inclui vários aspectos arquitetônicos inovadores que possibilitam a eficiência e a rapidez da arquitetura. A parte central é o MBConv, que une convoluções separáveis em profundidade com módulos de compressão e excitação para proporcionar menor complexidade computacional sem perda de precisão. O modelo também suporta uma escalonação de compostos que escala profundidade, largura e resolução de forma uniforme para ter desempenho ótimo em todos os tipos de restrições de recursos, e o modelo também é ágil de tarefas, sendo matematicamente derivado conforme a seguinte equação 8. O modelo já contém pesos treinados no conjunto de dados ImageNet e, portanto, pode ser transferido para aprender e, em grande medida, não é necessário treinar o modelo em pequenos conjuntos de dados médicos. Essa combinação de recursos de alto nível, assim como o ambiente de treinamento personalizado, que também contém as mudanças na camada final de classificação, o uso do otimizador Adam, do escalonador de taxa de aprendizado e da parada antecipada, garante que o modelo seja altamente preciso, mas ao mesmo tempo, eficiente computacionalmente. Essa combinação de inventividade arquitetônica e abordagens de treinamento permitirá que o modelo aprenda de forma eficiente com base em informações deficientes de imagem médica e, assim, se mostre um instrumento útil na categorização do ultrassom de mama.

Algoritmo 1: Classificação de Imagens por Ultrassom de Mama usando EfficientNet-B0 e Grad-CAM

Entrada: Imagens de ultrassom de mama.
Resultado: Classificação (normal, benigno, maligno) e mapas de calor Grad-CAM.
1. Pré-processamento de imagens:
Redimensione para 224×224224×224.
Normalize usando a média e a std do ImageNet.
Aumente com inversão de volume, rotação e tremor de cor.
2. Inicializar o modelo:
Load EfficientNet-B0 (pré-treinado, exclua camada superior).
Adicione o Global Average Pooling e uma camada densa (3 neurônios, SoftMax).
3. Modelo do Trem:
Otimizador: Adam (taxa de aprendizado = 0,00005).
Perda: Entropia cruzada.
Treine por 18 épocas com paradas cedo (paciência = 2).
4. Visualização Grad-CAM:
Calcule os gradientes da classe alvo.
Gerar e sobrepor mapas de calor nas imagens de entrada.

O algoritmo fornece o fluxo de trabalho de classificação de imagens de ultrassom mamário com EfficientNet-B0 e Grad-CAM, incluindo pré-processamento, treinamento e inferência do modelo, além do mapa de calor interpretável para validação clínica.

6. Grad-CAM como IA explicável

Uma ferramenta poderosa utilizada no estudo é capaz de adicionar interpretabilidade ao modelo de aprendizado profundo, o Mapeamento de Ativação de Classes ponderado por gradiente. Considerando uma solução para a atual necessidade urgente de XAI em imagem clínica, o método utiliza o Grad-CAM para permitir que os clínicos compreendam intuitivamente a tomada de decisão do modelo por meio de mapas de calor visuais explicáveis nas regiões mais significativas de uma imagem utilizada na previsão do modelo. Essa convergência de interpretabilidade será fundamental para construir confiança nos sistemas de IA, especialmente em sistemas de alto risco como a saúde, onde responsabilidade e transparência são essenciais. A Figura 5 apresenta mapas de calor Grad-CAM destacando as regiões da imagem que mais influenciaram as previsões do modelo para casos benignos, malignos e normais.

figure-protocol-19
Figura 5: Mapas de calor de ativação do Grad-CAM. (A) Benignos, (B) Malignos e (C) Casos normais. Cores quentes (vermelho) indicam alta influência diagnóstica; cores frias (azul) indicam menor atenção. Por favor, clique aqui para ver uma versão ampliada desta figura.

Todas as imagens Grad-CAM são exibidas além da imagem de entrada que o modelo recebeu. A Figura 5 apresenta a imagem original do ultrassom e a imagem de entrada do modelo para garantir que as regiões de atenção próxima estejam diretamente relacionadas à entrada processada considerada na previsão. Para obter importância por canal, o Grad-CAM é usado para calcular gradientes da classe prevista usando mapas de características da camada convolucional final. Esses gradientes são mediados mundialmente para obter os coeficientes de ponderação e então multiplicados pelos respectivos mapas de características para produzir um mapa de calor de localização (equações 16 e 17). O mapa de calor é então upamostrado para a resolução de entrada e sobreposto à imagem do ultrassom para indicar áreas de interesse diagnóstico (ou seja, margens tumorais, mudanças na textura, etc.) na imagem. Essa visualização oferece uma compreensão espacial das áreas que são usadas para fazer a previsão no modelo. Este artigo mede a interpretabilidade, por meio da análise visual, da localização da atenção. Eles não incluíram medidas quantitativas de localização e avaliação baseada em clínicos, que ainda são vias valiosas para validação futura da relevância clínica.

figure-protocol-20      

figure-protocol-21      

O Grad-CAM fornece previsões sobre como um modelo funciona visualmente, destacando áreas de uma imagem que contribuíram para a previsão. Os mapas de calor podem ser usados para confirmar que a rede se concentra em estruturas clinicamente relevantes que incluem margens tumorais e padrões acústicos. Em falsos alarmes, as visualizações podem ajudar a perceber o foco em áreas irrelevantes, auxiliando na avaliação e otimização do modelo. Essa correspondência entre características médicas e a atenção do modelo aumenta a interpretabilidade do diagnóstico assistido por IA. A Figura 6 mostra a visualização do GradCAM.

figure-protocol-22
Figura 6: Visualização GradCAM. Mapa de calor Grad-CAM mostrando regiões importantes (vermelho = alto, azul = baixo) para classificação; Intensidade de cor indica importância das características. Por favor, clique aqui para ver uma versão ampliada desta figura.

Grad-CAM é adicionado para aumentar a interpretabilidade do modelo EfficientNet-B0, destacando regiões de imagem que contribuem ao máximo para as escolhas de classificação. Os mapas de calor resultantes indicam estruturas clinicamente significativas das margens tumorais e mudanças na textura, o que facilita uma análise clara das previsões dos modelos. Essa alta precisão de classificação e interpretabilidade visual tornam essa estrutura proposta mais forte em termos de confiabilidade na análise das imagens ultrassonizadas da mama.

7. Análise Estatística

O modelo é avaliado com base em um grande conjunto de métricas, como precisão, como medida da precisão das previsões positivas; recordar, como medida da eficácia do modelo na identificação de todos os casos relevantes; e a pontuação F1, a média harmônica da precisão e da recordação, fornecendo uma medida equilibrada do desempenho geral que é calculada matematicamente conforme as equações 18–21.

figure-protocol-23      

figure-protocol-24      

figure-protocol-25      

figure-protocol-26      

O Erro Absoluto Médio (MAE) quantifica a diferença absoluta média entre previsões e valores verdadeiros, calculada matematicamente conforme a equação 22.

figure-protocol-27      

O erro quadrático médio da raiz (RMSE) mede o desvio médio das previsões em relação aos valores verdadeiros, calculado matematicamente conforme a equação 23.

figure-protocol-28      

O Erro Absoluto Médio (MAE) quantifica a diferença absoluta média entre previsões e valores verdadeiros, calculada matematicamente conforme a equação 24.

figure-protocol-29      

A matriz de confusão é utilizada para fornecer uma divisão detalhada dos verdadeiros positivos, verdadeiros negativos, falsos positivos e falsos negativos por classe, fornecendo mais informações sobre como o modelo classificao 30. Essas medidas de avaliação combinadas fornecem uma avaliação geral do erro do modelo, força e generalização com dados não observados, tornando-as uma ferramenta confiável para classificar imagens de um ultrassom mamário. A disponibilidade de máscaras de lesão no conjunto de dados BUSI implica que, no futuro, medidas quantitativas de localização, por exemplo, a interseção sobre união, poderão ser introduzidas para avaliar objetivamente a precisão da explicação. A validação estratificada de retenção foi escolhida para preservar a independência entre os subconjuntos de treinamento e avaliação que mantêm a distribuição das classes. A razão para não usar a validação cruzada foi evitar a exposição repetitiva das amostras de validação ao processo de otimização, mas em estudos futuros a validação cruzada repetida ou aninhada será usada para determinar ainda mais variações no desempenho.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A padronização das dimensões de entrada para 24 x 224 pixels e a normalização baseada no ImageNet facilitaram um comportamento de treinamento estável e a convergência suave das curvas de perda. A aplicação da operação de sobreposição de máscara em amostras de treinamento aumentou significativamente a visibilidade dos limites das lesões em comparação com imagens de ultrassom brutas. Essa observação apoiou a hipótese de que o aprimoramento guiado por anatomia melhora a separabilidade das c...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A estrutura proposta utiliza uma arquitetura EfficientNet-B0 ajustada integrada com o Mapeamento de Ativação de Classes Ponderado por Gradiente (Grad-CAM) para fornecer um sistema de alto desempenho e interpretável para a classificação de ultrassons de mama. Essa pesquisa avança o campo científico ao aproximar modelos de deep learning "caixa-preta" e a transparência clínica, demonstrando que a eficiência computacional não precisa ser sacrificada pelaexplicabilidade 40

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não têm conflitos de interesse.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores gostariam de expressar sua sincera gratidão às suas respectivas instituições e colegas pelo apoio e incentivo contínuos durante toda esta pesquisa. Os autores também reconhecem os criadores do Conjunto de Dados de Ultrassom da Mama BUSI por fornecerem o conjunto de dados público que possibilitou este estudo. Este trabalho foi apoiado pelo Projeto de Apoio número (PNURSP2026R432) dos Pesquisadores da Universidade Princess Nourahbint Abdulrahman, Universidade Princess Nourah bint Abdulrahman, Riad, Arábia Saudita. Os autores expressam seu agradecimento ao Decano de Pesquisa e Estudos de Pós-Graduação da King Khalid University pelo financiamento deste trabalho por meio de Large Group Research sob o número de bolsa RGP2/749/46.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Breast Ultrasound Images (BUSI Dataset)N/A780 PNG images (487 Benign, 210 Malignant, 133 Normal)
MatplotlibMatplotlib DevelopersN/AVersão 3.7.1
NumPyNumPy DevelopersN/AVersão 1.23.5
NVIDIA Tesla T4 GPUNVIDIAN/A16GB VRAM
OpenCVOpenCV.orgN/AVersão 4.7.0
Pillow (PIL)Python Imaging LibraryN/AVersão 9.4.0
PythonPython Software FoundationN/AVersão 3.9.12
PyTorchMeta AIN/AVersão 2.0.1+cu117
Scikit-learnScikit-learn DevelopersN/AVersão 1.2.2
SeabornSeaborn DevelopersN/AVersão 0.12.2
Ubuntu OSCanonicalN/A64-bit

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wilkinson, L., Gathani, T. Understanding breast cancer as a global health concern. Br J Radiol. 95 (1130), 20211033(2021).
  2. Ud din, N. M., Dar, R. A., Rasool, M., Assad, A. Breast cancer detection using deep learning: datasets, methods, and challenges ahead. Comput Biol Med. 149, 106073(2022).
  3. Jin, W., Li, X., Fatehi, M., Hamarneh, G. Guidelines and evaluation of clinical explainable AI in medical image analysis. Med Image Anal. 84, 102684(2023).
  4. Ghasemi, A., Hashtarkhani, S., Schwartz, D. L., Shaban-Nejad, A. Explainable artificial intelligence in breast cancer detection and risk prediction: a systematic scoping review. Cancer Innov. 3 (5), (2024).
  5. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimedia tools and applications. 84 (21), 24079-24190 (2025).
  6. Singh, V. K., et al. Breast tumor segmentation in ultrasound images using contextual-information-aware deep adversarial learning framework. Expert Systems with Applications. 162, 113870(2020).
  7. Wani, N. A., Kumar, R., Bedi, J. Harnessing fusion modeling for enhanced breast cancer classification through interpretable artificial intelligence and in-depth explanations. Engineering Applications of Artificial Intelligence. 136, 108939(2024).
  8. Kikani, K., Desai, M., Desai, B. Early Detection and Personalized Risk Assessment of Breast Cancer: An Integrative Review and Comparative Evaluation of AI Models Using Clinical and Imaging Data. Archives of Computational Methods in Engineering. , 1-29 (2025).
  9. Singh, R., Gupta, S., Yamsani, N., Manwal, M., Bansal, G. Automated Breast Cancer Classification using a Custom CNN Architecture on the BUSI Dataset. IEEE Xplore. , 1185-1190 (2025).
  10. Ali, A., et al. Exploring AI approaches for breast cancer detection and diagnosis: A review Article. Breast Cancer: Targets and Therapy. , 927-947 (2025).
  11. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimed Tools Appl. , (2024).
  12. Sienicki, K. Comment on the paper titled ‘The origin of quantum mechanical statistics: insights from research on human language’. Preprints. , (2024).
  13. Ahn, J. S., et al. Artificial intelligence in breast cancer diagnosis and personalized medicine. Journal of breast cancer. 26 (5), 405(2023).
  14. Qureshi, S. A., et al. Breast cancer detection using mammography: image processing to deep learning. IEEE Access. , (2024).
  15. Dihmani, H., Bousselham, A., Bouattane, O. A new computer-aided diagnosis system for breast cancer detection from thermograms using metaheuristic algorithms and explainable AI. Algorithms. 17 (10), 462(2024).
  16. Nakach, F. Z., Idri, A., Goceri, E. A comprehensive investigation of multimodal deep learning fusion strategies for breast cancer classification. Artif Intell Rev. 57 (12), 327(2024).
  17. Mondol, R. K. Deep learning based prognosis and explainability for breast cancer. , UNSW Sydney. Doctoral dissertation (2025).
  18. Ayana, G., Ryu, J., Choe, S. Ultrasound-responsive nanocarriers for breast cancer chemotherapy. Micromachines. 13 (9), 1508(2022).
  19. Afrin, H., Larson, N. B., Fatemi, M., Alizad, A. Deep Learning in Different Ultrasound Methods for Breast Cancer, from Diagnosis to Prognosis: Current Trends, Challenges, and an Analysis. Cancers. 15 (12), 3139(2023).
  20. Ayana, G., Ryu, J., Choe, S. Ultrasound-responsive nanocarriers for breast cancer chemotherapy. Micromachines. 13 (9), 1508(2022).
  21. Di Paola, V., et al. Beyond N staging in breast cancer: importance of MRI and ultrasound-based imaging. Cancers. 14 (17), 4270(2022).
  22. Sahu, A., Das, P. K., Meher, S. Efficient deep learning scheme for breast cancer detection using mammogram and ultrasound images. Biomed Signal Process Control. 87, 105377(2024).
  23. Rezazadeh, A., Jafarian, Y., Kord, A. Explainable ensemble machine learning for breast cancer diagnosis using ultrasound texture features. Forecasting. 4 (1), 262-274 (2022).
  24. Raza, A., et al. Deep Breast Cancer Net: a novel deep learning model for ultrasound breast cancer detection. Appl Sci. 13 (4), 2082(2023).
  25. Jabeen, K., et al. Breast cancer classification from ultrasound images using optimal deep learning feature fusion. Sensors. 22 (3), 807(2022).
  26. Ayana, G., Park, J., Jeong, J. W., Choe, S. Multistage transfer learning for ultrasound breast cancer image classification. Diagnostics. 12 (1), 135(2022).
  27. Gupta, S., Agrawal, S., Singh, S. K., Kumar, S. Transfer learning-based model for ultrasound breast cancer classification. Comput Vis Bio-Inspired Comput. , 511-523 (2023).
  28. Kratkiewicz, K., Pattyn, A., Alijabbari, N., Mehrmohammadi, M. Ultrasound and photoacoustic imaging of breast cancer: clinical systems and challenges. J Clin Med. 11 (5), 1165(2022).
  29. Al-Dhabyani, W., Gomaa, M., Khaled, H., Fahmy, A. Dataset of breast ultrasound images. Data Brief. 28, 104863(2020).
  30. R, M. T. Enhancing Diagnostic Accuracy in Breast Ultrasound Imaging through Deep Learning and Image Augmentation Techniques. IEEE ICERCS, , 1-6 (2024).
  31. Balasubramaniam, S., Velmurugan, Y., Jaganathan, D., Dhanasekaran, S. A Modified LeNet CNN for Breast Cancer Diagnosis in Ultrasound Images. Diagnostics. 13 (17), 2746(2023).
  32. Atrey, K., Singh, B. K., Bodhey, N. K. Multimodal classification of breast cancer using feature level fusion of mammogram and ultrasound images in machine learning paradigm. Multimedia Tools and Applications. 83 (7), 21347-21368 (2023).
  33. Vigil, N., et al. Dual-Intended Deep Learning Model for Breast Cancer Diagnosis in Ultrasound Imaging. Cancers. 14 (11), 2663(2022).
  34. Uysal, F., Köse, M. M. Classification of Breast Cancer Ultrasound Images with Deep Learning-Based Models. ASEC 2022, , 8(2022).
  35. Boulenger, A., et al. Deep learning-based system for automatic prediction of triple-negative breast cancer from ultrasound images. Medical & Biological Engineering & Computing. 61 (2), 567-578 (2022).
  36. Işık, G., Paçal, İ Few-shot classification of ultrasound breast cancer images using meta-learning algorithms. Neural Computing and Applications. 36 (20), 12047-12059 (2024).
  37. Liu, H., et al. Artificial Intelligence-Based Breast Cancer Diagnosis Using Ultrasound Images and Grid-Based Deep Feature Generator. International Journal of General Medicine. 15, 2271-2282 (2022).
  38. Zourhri, M., et al. Deep Learning Technique for Classification of Breast Cancer using Ultrasound Images. IEEE IRASET, , (2023).
  39. Taleghamar, H., Jalalifar, S. A., Czarnota, G. J., Sadeghi-Naini, A. Deep learning of quantitative ultrasound multi-parametric images at pre-treatment to predict breast cancer response to chemotherapy. Scientific Reports. 12 (1), (2022).
  40. Sharafaddini, A. M., Esfahani, K. K., Mansouri, N. Deep learning approaches to detect breast cancer: a comprehensive review. Multimed Tools Appl. , (2024).
  41. Al-Dhabyani, W., Gomaa, M., Khaled, H., Fahmy, A. Dataset of breast ultrasound images. Data Brief. 28, 104863(2020).
  42. Mondol, S. S., Hasan, M. K. Enhancing B-mode-based breast cancer diagnosis via cross-attention fusion of H-scan and Nakagami imaging with multi-CAM-QUS-Driven XAI. Physics in Medicine & Biology. 70 (17), 175011(2025).
  43. Shifa, N. Explainable breast cancer detection in mammograms using lightweight EfficientNet-B0 with Grad-CAM and LIME. , Qatar University. (2025).
  44. Haghighat, F., Nemati, Z., Rambodrad, A., Negareshifard, P., Jafari, E. Multimodal deep learning and data fusion in precision breast oncology: clinical Applications, fusion Strategies, and future directions. InfoScience Trends. 2 (10), 81-115 (2025).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

Ultrasound ImagesDeep LearningEfficientNet B0Data AugmentationGrad CAMLesion DetectionClinical Diagnosis

Artigos relacionados