$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Características do conjunto de dados
O estudo utilizou o conjunto de dados público Breast Ultrasound Images (BUSI), que forneceu um repositório bem documentado para a análise e classificação do câncerde mama 29. Esse conjunto de dados se mostrou particularmente apropriado, pois incorporou uma vasta coleção de imagens de ultrassom necessárias para estabelecer e validar modelos de aprendizado profundo para imagens médicas. O conjunto de dados compreendia 780 imagens de ultrassom coletadas de 600 mulheres de 25 a 75 anos, representando uma população diversificada para o diagnóstico de câncer de mama. Todas as imagens mantinham uma resolução média de 500 x 500 pixels e utilizavam o formato PNG para preservar dados visuais de alta qualidade para análise. A Figura 1 ilustra o fluxo de trabalho geral do framework proposto, incluindo pré-processamento, aumentação, extração de características EfficientNet-B0, classificação e interpretabilidade Grad-CAM.

Figura 1: Amostras representativas do conjunto de dados BUSI. (A) Imagens benignas, (B) malignas e (C) normais. Painéis ilustram a diversidade morfológica usada para o treinamento. Por favor, clique aqui para ver uma versão ampliada desta figura.
2. Fluxo de trabalho experimental
Para garantir a reprodutibilidade, a investigação executou o pipeline de processamento em etapas sequenciais. Primeiro, o sistema carregou as imagens de ultrassom BUSI e as máscaras de precisão do solo correspondentes, redimensionando-as para 224×224 pixels, seguido pela normalização ImageNet. Segundo, a estrutura sobrepôs cada imagem com sua máscara para enfatizar as regiões da lesão antes de dividir o conjunto de dados em subconjuntos de treinamento (70%), validação (15%) e testes (15%) usando amostragem estratificada. Terceiro, o estudo aplicou aumento direcionado consistindo em inversão horizontal, rotação (±15°) e vibração de cor principalmente para as classes minoritárias. Quarto, os pesquisadores ajustaram o modelo EfficientNet-B0, que foi pré-treinado no ImageNet, substituindo a camada final de classificação por uma camada de saída de três classes. O processo de treinamento utilizava o otimizador Adam (taxa de aprendizado 0,00005), decaimento da taxa de aprendizado em etapas (γ = 0,1 a cada 7 épocas), perda de entropia cruzada, tamanho de lote de 8 e parada precoce com paciência de 2. Por fim, o Grad-CAM gerou mapas de calor de atenção a partir da última camada convolucional para visualizar regiões diagnosticamente relevantes e apoiar a interpretação clínica. A Tabela de Materiais lista os conjuntos de dados essenciais, bibliotecas de software e configurações de hardware necessárias para reproduzir a estrutura de classificação e interpretabilidade por ultrassons mamários do estudo.
O conjunto de dados BUSI apresentou um desequilíbrio natural de classes, uma característica frequentemente observada em conjuntos de dados médicos. A distribuição favoreceu a classe benigna, seguida pelos casos malignos e normais. Especificamente, o conjunto de dados continha 487 imagens benignas, 210 malignas e 133 imagens normais. Embora a ampliação de dados tenha aumentado a variabilidade do treinamento, ela não alterou a contagem fundamental da amostra em cada turma. Essa distribuição refletia cenários clínicos do mundo real, onde condições benignas ocorrem com mais frequência do que tumores malignos. Embora tal desequilíbrio tenha retratado com precisão a prevalência de anormalidades mamárias em ambientes clínicos, ele apresentava desafios para o treinamento em aprendizado profundo, pois podia levar a previsões tendenciosas e desempenho subótimo para classes minoritárias. Consequentemente, mitigar esse desequilíbrio tornou-se essencial para formular um modelo eficaz e generalizável que atuasse de forma eficiente em todas as categorias diagnósticas. A Figura 2 mostra imagens representativas de ultrassom do conjunto de dados, ilustrando exemplos de amostras de tecido mamário benigno, maligno e normal.

Figura 2: Fluxo de trabalho proposto do modelo. Pipeline sequencial desde o pré-processamento de entrada e sobreposição de máscaras até o treinamento EfficientNet-B0 e a saída Grad-CAM. Por favor, clique aqui para ver uma versão ampliada desta figura.
3. Pré-processamento de dados
O estudo redimensionou todas as imagens para 224 x 224 pixels, seguindo as dimensões padrão de entrada para a arquitetura EfficientNet-B0. Esse redimensionamento garantiu consistência do conjunto de dados e redução dos requisitos computacionais, conforme definido pela equação 1.
A estrutura normalizou os valores dos pixels usando a média e o desvio padrão do conjunto de dados ImageNet ([0,485, 0,456, 0,406] para média e [0,229, 0,224, 0,225] para std). Essa normalização escalou os dados de entrada para aumentar a estabilidade do treinamento e a velocidade de convergência, calculadas de acordo com a equação 2.
Para melhorar a extração de características e a identificação de regiões de interesse, os pesquisadores sobrepuseram as imagens originais sobre suas máscaras de verdade de base correspondentes. A Figura 3 ilustra as máscaras de lesões com precisão no terreno e as imagens de ultrassom sobrepostas que destacaram os limites tumorais.

Figura 3: Máscara e imagens sobrepostas. (A) Ultrassom original, (B) máscara de verdade no solo e (C) sobreposição resultante que destaca os limites tumorais para atenção espacial. Por favor, clique aqui para ver uma versão ampliada desta figura.
Essa sobreposição identificou regiões críticas, como margens tumorais e padrões de textura, fornecendo ao modelo contexto espacial localizado para melhorar a precisão da classificação, conforme mostrado na equação 3.
O estudo utilizou a operação de sobreposição de máscara exclusivamente durante a preparação dos dados de treinamento para complementar o conhecimento da fronteira da lesão durante o aprendizado de características. Em contraste, as fases de validação e inferência empregaram apenas as imagens originais de ultrassom sem máscaras, mantendo um pipeline convencional de classificação de imagens. Como as máscaras de segmentação binária no conjunto de dados BUSI representavam estruturas já inerentes às imagens de ultrassom, elas não introduziram novos rótulos de classe. Para evitar vazamento de informações, a investigação dividiu o conjunto de dados em conjuntos de treinamento, validação e teste, garantindo que nenhum pares sobreposto de imagens ou máscaras fossem compartilhados entre subconjuntos. Consequentemente, a sobreposição funcionava como um guia de atenção espacial que destacava áreas anatomicamente significativas sem comprometer a independência dos dados de avaliação.
4. Ampliação de Dados
O estudo implementou aumento de dados direcionado para mitigar o desequilíbrio de classes dentro do conjunto de treinamento, focando especificamente nas classes malignas e normais de minorias. A estrutura utilizou uma ampla gama de transformações para aumentar artificialmente a variabilidade dos dados de treinamento e melhorar a capacidade do modelo de generalizar entre diversas condições de imagem.
Primeiro, o sistema realizou inversão horizontal com uma probabilidade de 0,9 (90%), permitindo que o modelo reconhecesse características independentemente da direção da varredura. Essa transformação seguiu a equação 4:
Segundo, a investigação aplicou rotações aleatórias dentro de uma faixa de ±15° para simular variações nos ângulos de varredura e no posicionamento dos pacientes. Esse processo forçou o modelo a aprender características invariantes à rotação, como margens tumorais e padrões de textura, conforme definido pela equação 5:
Terceiro, os pesquisadores utilizaram o tremor de cor para simular variações na iluminação, contraste e equilíbrio de cores. A estrutura ajustava brilho, contraste e saturação por um fator de 0,2, e matiz por 0,1. Esses ajustes estocásticos melhoraram a robustez do modelo a mudanças de aparência, calculadas de acordo com a equação 6:
A seleção desses intervalos específicos de hiperparâmetros (inversão horizontal 0,9, rotação +15, -15, brilho/contraste/saturação 0,2, matiz 0,1) resultou de uma avaliação empírica de estabilidade. A investigação determinou que essas configurações otimizavam o equilíbrio entre geração de diversidade e realismo anatômico, garantindo convergência constante e precisão estável de validação sem induzir deformações irreais das lesões.
5. Arquitetura de Modelos
O estudo utilizou o EfficientNet-B0, um modelo moderno de CNN reconhecido por sua eficiência, escalabilidade e desempenho em comparação com outras arquiteturas de classificação de imagens. Esse modelo empregava um método de escalar proporcionalmente a profundidade, largura e resolução da rede, o que permitia alta precisão com um número significativamente reduzido de parâmetros em comparação com arquiteturas padrão como ResNet e VGG. Essa abordagem de escalonamento permitiu que a estrutura lidasse com imagens de alta resolução mantendo-se computacionalmente eficiente, atendendo às necessidades específicas da imagem médica. A Figura 4 ilustra a arquitetura do EfficientNet-B0, destacando a sequência de blocos convolucionais e MBConv usados para extração hierárquica de características.

Figura 4: Arquitetura EfficientNet-B0. Esquema dos blocos MBConv e fatores de escalonamento compostos usados para extração hierárquica de características. Por favor, clique aqui para ver uma versão ampliada desta figura.
Para modificar o EfficientNet-B0 para a tarefa de classificação por ultrassom de mama, os pesquisadores introduziram ajustes específicos na estrutura do modelo. O sistema trocou a camada inicial de classificação, destinada ao conjunto de dados ImageNet de 1.000 classes, por uma camada totalmente conectada (densa) composta por 3 neurônios de saída. A investigação definiu todas as camadas da espinha dorsal pré-treinada EfficientNet-B0 como treináveis e as otimizou conjuntamente com a nova camada de classificação, seguindo uma estratégia completa de ajuste fino. O processo de treinamento não aplicou congelamento em etapas ou descongelamento gradual. O framework realizava treinamento usando o otimizador Adam com taxa de aprendizado de 0,00005 e um escalonador de taxa de aprendizado por etapas que reduzia a taxa por um fator de 0,1 a cada 7 épocas. Esses neurônios correspondiam às três classes-alvo dentro do conjunto de dados BUSI: benignos, normais e malignos. O modelo utilizou uma ativação SoftMax na camada de saída, transformando as pontuações brutas em distribuições de probabilidade, conforme calculado na equação 7. A Tabela 2 mostra a descrição da arquitetura do modelo.
| Tipo de camada | Descrição |
| Camada de Entrada | Aceita imagens de tamanho 224 x 224 x 3 |
| Camadas convolucionais | Inclui blocos de convolução inicial e MBConv para extração de características. |
| Agrupamento Médio Global | Reduz as dimensões espaciais a um vetor de características 1D. |
| Camada Totalmente Conectada | Mapeia o vetor de características para 3 neurônios de saída (normal, benigno, maligno). |
| Ativação SoftMax | Converte logits em probabilidades para classificação multiclasse. |
Tabela 2: Mostra a descrição da arquitetura do modelo.
Os parâmetros usados para treinar o modelo foram o otimizador de Adam, uma taxa inicial de aprendizado de 0,00005, e a perda categórica de entropia cruzada (três classes), calculada matematicamente conforme a equação 9. Pesos pré-treinados do ImageNet foram usados para inicializar o EfficientNet-B0, e totalmente treinados, e todas as camadas da espinha dorsal foram treinadas e nenhum congelamento em etapas foi aplicado. O classificador inicial foi substituído por uma camada totalmente conectada e três neurônios de saída e, finalmente, ativação SoftMax, que representava as classes benigna, maligna e normal. As imagens foram reduzidas para 224 x 224 pixels, e depois normalizadas pela média e desvio padrão do ImageNet, sendo carregadas em mini-lotes de 8. Um agendador de taxa de aprendizado por etapas diminuiu a taxa de aprendizado em 0,1 a cada 7 épocas. A perda de validação foi usada para parar cedo com paciência de 2 épocas para evitar sobreajustamento. Ativações Grad-CAM foram produzidas com base na última camada convolucional, calculando gradientes, agrupamento de médias globais para obter pesos dos canais e ampliando os mapas de ativação para resolução de entrada.
Para confirmar essa estabilidade, o treinamento era repetido ao longo de várias execuções com desempenho de validação de correspondência. O monitoramento das curvas de perda de treinamento e validação foi usado para identificar sobreajuste, e um conjunto de testes estratificados de resistência não dependeu do treinamento foi usado para realizar a avaliação final. A diferença entre o desempenho da validação e o desempenho do teste é pequena, o que demonstra convergência consistente e reprodutibilidade de otimização. A Equação 10 define um cronograma de taxa de aprendizado em etapas específicas. A Equação 15 indica dois aumentos consecutivos na perda de validação, indicando possível sobreajuste.
O EfficientNet-B0 é particularmente flexível para a tarefa de classificação por ultrassonografia mamária, pois a arquitetura inclui vários aspectos arquitetônicos inovadores que possibilitam a eficiência e a rapidez da arquitetura. A parte central é o MBConv, que une convoluções separáveis em profundidade com módulos de compressão e excitação para proporcionar menor complexidade computacional sem perda de precisão. O modelo também suporta uma escalonação de compostos que escala profundidade, largura e resolução de forma uniforme para ter desempenho ótimo em todos os tipos de restrições de recursos, e o modelo também é ágil de tarefas, sendo matematicamente derivado conforme a seguinte equação 8. O modelo já contém pesos treinados no conjunto de dados ImageNet e, portanto, pode ser transferido para aprender e, em grande medida, não é necessário treinar o modelo em pequenos conjuntos de dados médicos. Essa combinação de recursos de alto nível, assim como o ambiente de treinamento personalizado, que também contém as mudanças na camada final de classificação, o uso do otimizador Adam, do escalonador de taxa de aprendizado e da parada antecipada, garante que o modelo seja altamente preciso, mas ao mesmo tempo, eficiente computacionalmente. Essa combinação de inventividade arquitetônica e abordagens de treinamento permitirá que o modelo aprenda de forma eficiente com base em informações deficientes de imagem médica e, assim, se mostre um instrumento útil na categorização do ultrassom de mama.
Algoritmo 1: Classificação de Imagens por Ultrassom de Mama usando EfficientNet-B0 e Grad-CAM
Entrada: Imagens de ultrassom de mama.
Resultado: Classificação (normal, benigno, maligno) e mapas de calor Grad-CAM.
1. Pré-processamento de imagens:
Redimensione para 224×224224×224.
Normalize usando a média e a std do ImageNet.
Aumente com inversão de volume, rotação e tremor de cor.
2. Inicializar o modelo:
Load EfficientNet-B0 (pré-treinado, exclua camada superior).
Adicione o Global Average Pooling e uma camada densa (3 neurônios, SoftMax).
3. Modelo do Trem:
Otimizador: Adam (taxa de aprendizado = 0,00005).
Perda: Entropia cruzada.
Treine por 18 épocas com paradas cedo (paciência = 2).
4. Visualização Grad-CAM:
Calcule os gradientes da classe alvo.
Gerar e sobrepor mapas de calor nas imagens de entrada.
O algoritmo fornece o fluxo de trabalho de classificação de imagens de ultrassom mamário com EfficientNet-B0 e Grad-CAM, incluindo pré-processamento, treinamento e inferência do modelo, além do mapa de calor interpretável para validação clínica.
6. Grad-CAM como IA explicável
Uma ferramenta poderosa utilizada no estudo é capaz de adicionar interpretabilidade ao modelo de aprendizado profundo, o Mapeamento de Ativação de Classes ponderado por gradiente. Considerando uma solução para a atual necessidade urgente de XAI em imagem clínica, o método utiliza o Grad-CAM para permitir que os clínicos compreendam intuitivamente a tomada de decisão do modelo por meio de mapas de calor visuais explicáveis nas regiões mais significativas de uma imagem utilizada na previsão do modelo. Essa convergência de interpretabilidade será fundamental para construir confiança nos sistemas de IA, especialmente em sistemas de alto risco como a saúde, onde responsabilidade e transparência são essenciais. A Figura 5 apresenta mapas de calor Grad-CAM destacando as regiões da imagem que mais influenciaram as previsões do modelo para casos benignos, malignos e normais.

Figura 5: Mapas de calor de ativação do Grad-CAM. (A) Benignos, (B) Malignos e (C) Casos normais. Cores quentes (vermelho) indicam alta influência diagnóstica; cores frias (azul) indicam menor atenção. Por favor, clique aqui para ver uma versão ampliada desta figura.
Todas as imagens Grad-CAM são exibidas além da imagem de entrada que o modelo recebeu. A Figura 5 apresenta a imagem original do ultrassom e a imagem de entrada do modelo para garantir que as regiões de atenção próxima estejam diretamente relacionadas à entrada processada considerada na previsão. Para obter importância por canal, o Grad-CAM é usado para calcular gradientes da classe prevista usando mapas de características da camada convolucional final. Esses gradientes são mediados mundialmente para obter os coeficientes de ponderação e então multiplicados pelos respectivos mapas de características para produzir um mapa de calor de localização (equações 16 e 17). O mapa de calor é então upamostrado para a resolução de entrada e sobreposto à imagem do ultrassom para indicar áreas de interesse diagnóstico (ou seja, margens tumorais, mudanças na textura, etc.) na imagem. Essa visualização oferece uma compreensão espacial das áreas que são usadas para fazer a previsão no modelo. Este artigo mede a interpretabilidade, por meio da análise visual, da localização da atenção. Eles não incluíram medidas quantitativas de localização e avaliação baseada em clínicos, que ainda são vias valiosas para validação futura da relevância clínica.
O Grad-CAM fornece previsões sobre como um modelo funciona visualmente, destacando áreas de uma imagem que contribuíram para a previsão. Os mapas de calor podem ser usados para confirmar que a rede se concentra em estruturas clinicamente relevantes que incluem margens tumorais e padrões acústicos. Em falsos alarmes, as visualizações podem ajudar a perceber o foco em áreas irrelevantes, auxiliando na avaliação e otimização do modelo. Essa correspondência entre características médicas e a atenção do modelo aumenta a interpretabilidade do diagnóstico assistido por IA. A Figura 6 mostra a visualização do GradCAM.

Figura 6: Visualização GradCAM. Mapa de calor Grad-CAM mostrando regiões importantes (vermelho = alto, azul = baixo) para classificação; Intensidade de cor indica importância das características. Por favor, clique aqui para ver uma versão ampliada desta figura.
Grad-CAM é adicionado para aumentar a interpretabilidade do modelo EfficientNet-B0, destacando regiões de imagem que contribuem ao máximo para as escolhas de classificação. Os mapas de calor resultantes indicam estruturas clinicamente significativas das margens tumorais e mudanças na textura, o que facilita uma análise clara das previsões dos modelos. Essa alta precisão de classificação e interpretabilidade visual tornam essa estrutura proposta mais forte em termos de confiabilidade na análise das imagens ultrassonizadas da mama.
7. Análise Estatística
O modelo é avaliado com base em um grande conjunto de métricas, como precisão, como medida da precisão das previsões positivas; recordar, como medida da eficácia do modelo na identificação de todos os casos relevantes; e a pontuação F1, a média harmônica da precisão e da recordação, fornecendo uma medida equilibrada do desempenho geral que é calculada matematicamente conforme as equações 18–21.
O Erro Absoluto Médio (MAE) quantifica a diferença absoluta média entre previsões e valores verdadeiros, calculada matematicamente conforme a equação 22.
O erro quadrático médio da raiz (RMSE) mede o desvio médio das previsões em relação aos valores verdadeiros, calculado matematicamente conforme a equação 23.
O Erro Absoluto Médio (MAE) quantifica a diferença absoluta média entre previsões e valores verdadeiros, calculada matematicamente conforme a equação 24.
A matriz de confusão é utilizada para fornecer uma divisão detalhada dos verdadeiros positivos, verdadeiros negativos, falsos positivos e falsos negativos por classe, fornecendo mais informações sobre como o modelo classificao 30. Essas medidas de avaliação combinadas fornecem uma avaliação geral do erro do modelo, força e generalização com dados não observados, tornando-as uma ferramenta confiável para classificar imagens de um ultrassom mamário. A disponibilidade de máscaras de lesão no conjunto de dados BUSI implica que, no futuro, medidas quantitativas de localização, por exemplo, a interseção sobre união, poderão ser introduzidas para avaliar objetivamente a precisão da explicação. A validação estratificada de retenção foi escolhida para preservar a independência entre os subconjuntos de treinamento e avaliação que mantêm a distribuição das classes. A razão para não usar a validação cruzada foi evitar a exposição repetitiva das amostras de validação ao processo de otimização, mas em estudos futuros a validação cruzada repetida ou aninhada será usada para determinar ainda mais variações no desempenho.