A doença mais grave do mundo é o tumor cerebral. Um diagnóstico preciso pode ser benéfico para a sobrevivência dos pacientes. Ainda assim, há necessidade de um sistema diagnóstico preciso capaz de detectar tumores cerebrais em estágio inicial. Para resolver esse problema, foi proposta uma técnica mais confiável para detecção precisa de tumores cerebrais em seus estágios iniciais, utilizando um mecanismo híbrido de aprendizado profundo duplo com hiperparâmetros otimizados e camadas ajustadas com base nos modelos DenseNet121 e EfficientNetB7. A abordagem proposta utiliza imagens de RM 2D como entrada e fornece como saída uma previsão de presença ou ausência de tumor para o conjunto de dados de classificação binária Br35H, e a categorização do tumor para outros quatro conjuntos de dados de classificação multiclasse. Assim, esta seção demonstra os principais passos da abordagem proposta, desde a coleta de dados até a saída final, incluindo aquisição de dados, pré-processamento de dados, divisão dos dados, seleção do modelo, extração de características, predição do tumor e avaliação do modelo proposto, conforme mostrado na Figura 1.

Figura 1: Fluxo da metodologia proposta. Este diagrama mostra a arquitetura geral do modelo proposto, incluindo aquisição e pré-processamento de dados; dois modelos pré-treinados para extração de características; concatenação de suas características; e ajuste fino de hiperparâmetros para classificação e tipo de tumor. Clique aqui para visualizar uma versão ampliada desta figura.
Aquisição de dados
Em qualquer pesquisa experimental, o primeiro passo é a aquisição de dados. Para isso, foram escolhidos cinco conjuntos de dados diferentes disponíveis publicamente, incluindo Br35H24, Figshare25, Sartaj26, Masoud27 e o conjunto de dados baseado em imagens de ressonância magnética de tumores cerebrais da biblioteca de código aberto Kaggle28, que já foram utilizados por muitos pesquisadores para o diagnóstico da detecção de tumores cerebrais. O conjunto de dados Br35H possui 3.000 imagens divididas em duas classes: imagens saudáveis e não saudáveis (com tumor), com 1.500 imagens em cada classe, enquanto o conjunto de dados Figshare possui 3.064 imagens, divididas em três grupos com base no tipo de tumor: 1.426 imagens de glioma, 708 imagens de meningioma e 930 imagens de tumores de hipófise. O conjunto de dados Sartaj possui 3.264 imagens categorizadas em quatro classes de tumores: gliomas (926 imagens), meningiomas (937 imagens), tumores de hipófise (901 imagens) e saudável ou sem tumor (500 imagens). Além disso, o conjunto de dados Masoud também compreende quatro classes diferentes de tumores, cujas imagens foram extraídas dos três conjuntos de dados mencionados anteriormente, totalizando 7.023 imagens, que são subdivididas em glioma (1.621 imagens), meningioma (1.645 imagens), hipófise (1.757 imagens) e saudável ou sem tumor (2.000 imagens). O último conjunto de dados escolhido é um conjunto baseado em imagens de ressonância magnética, que também possui quatro classes com um total de 5.248 imagens, divididas igualmente em tipos de tumores, incluindo 1.312 imagens de glioma, 1.312 imagens de meningioma, 1.312 imagens de hipófise e 1.312 imagens saudáveis ou sem tumor, sendo considerado um conjunto de dados balanceado.
Pré-processamento de dados
Após a aquisição dos dados, a próxima etapa é o pré-processamento, que é essencial para obter melhores resultados e mais útil para abordagens computacionais extraírem e aprenderem as melhores características dos dados, produzindo resultados mais precisos. O primeiro passo aplicado foi o redimensionamento das imagens. Foram escolhidos cinco conjuntos de dados publicamente disponíveis com diferentes classes e tamanhos de imagem, mesmo dentro do mesmo conjunto de dados, para diferentes classes de tumores, que foram uniformemente redimensionados para 224 x 224 para melhor interpretação e aprendizado do modelo. Além disso, foi aplicada a ampliação de dados (data augmentation) a todos os conjuntos de dados, gerando amostras adicionais a partir de diferentes ângulos, melhorando assim a extração de características e o aprendizado pelos modelos de aprendizado profundo (DL). Para isso, foi aplicado um intervalo de rotação de 7% a todas as imagens, girando-as até 7 graus. Além disso, foi aplicado um deslocamento aleatório de 5% a todas as imagens, horizontal e verticalmente, com um deslocamento de 5% na altura e largura em relação às imagens originais. Em seguida, as imagens foram ampliadas em 10% em relação às imagens originais e, finalmente, todas as imagens foram invertidas horizontal e verticalmente. A principal razão para realizar a ampliação de dados29 é superar o sobreajuste (overfitting) e melhorar a generalização dos modelos, treinando-os com várias versões transformadas das amostras de dados originais. Antes de dividir os conjuntos de dados em treinamento e validação, foi aplicada a codificação de rótulos (label encoding), o que é mais útil para calcular a perda (loss) durante o treinamento e a validação, além de tornar as amostras de dados mais adequadas para que os modelos processem corretamente os rótulos. Adicionalmente, o conjunto de dados foi particionado em conjuntos de treinamento e validação, com uma proporção de 80% para 20%30, respectivamente, e Tabela 2 mostra a distribuição geral das amostras de dados e suas proporções de treinamento e validação.
| Conjunto de dados | Classes de tumor | Total de imagens | Imagens de treinamento | Imagens de validação |
| Br35H | Saudável | 1500 | 1200 | 300 |
| Tumor | 1500 | 1200 | 300 |
| Total de imagens | 3000 | 2400 | 600 |
| Figshare | Glioma | 1426 | 1141 | 285 |
| Meningioma | 708 | 566 | 142 |
| Hipófise | 930 | 744 | 186 |
| Total de imagens | 3064 | 2451 | 613 |
| Sartaj | Glioma | 926 | 741 | 185 |
| Meningioma | 937 | 749 | 188 |
| Sem tumor | 500 | 400 | 100 |
| Hipófise | 901 | 721 | 180 |
| Total de imagens | 3264 | 2611 | 653 |
| Masoud | Glioma | 1621 | 1297 | 324 |
| Meningioma | 1645 | 1316 | 329 |
| Sem tumor | 2000 | 1600 | 400 |
| Hipófise | 1757 | 1405 | 352 |
| Total de imagens | 7023 | 5618 | 1405 |
| Conjunto de dados equilibrado de tumores cerebrais (BBT-Dataset) | Glioma | 1312 | 1050 | 262 |
| Meningioma | 1312 | 1050 | 262 |
| Sem tumor | 1312 | 1050 | 262 |
| Hipófise | 1312 | 1050 | 262 |
| Total de imagens | 5248 | 4200 | 1048 |
Tabela 2: Distribuição do conjunto de dados. A tabela apresenta estatísticas por classe sobre os totais, treinamento e contagens de imagens de validação em conjuntos de dados de tumores cerebrais.
O conjunto de dados Br35H consiste em 3000 imagens, sendo 2400 selecionadas para treinamento e 600 para validação. O conjunto de dados Figshare compreende 3064 imagens. Dentre todas as imagens, 2451 foram selecionadas para treinamento e as restantes 613 para validação. O conjunto de dados Sartaj possui um total de 3264 imagens, com 2611 utilizadas para treinamento e as restantes 653 para validação. O conjunto de dados Masoud possui um total de 7023 imagens; dessas, 5618 foram utilizadas para treinamento e as restantes 1405 para validação. O conjunto de dados BBT possui um total de 5248 imagens. Dentre o total de imagens, 4200 foram consideradas para fins de treinamento, enquanto as demais 1048 imagens foram consideradas para fins de validação. Além disso, Figura 2 abaixo ilustra as diversas imagens de tumores cerebrais.

Figura 2: Imagens de tumores cerebrais, incluindo tipos de tumores. O conjunto de dados contém quatro imagens de tecido cerebral saudável e três imagens tumorais: glioma, meningioma e pituitário. Clique aqui para visualizar uma versão maior desta figura.
Modelo proposto
Após a etapa de pré-processamento, o próximo passo é sugerir um modelo de treinamento eficaz exclusivamente para a classificação de tumores cerebrais. Para isso, foi proposto um modelo eficiente de treinamento, especificamente voltado para classificar tumores cerebrais. Nesse sentido, propõe-se um novo modelo híbrido e eficiente baseado em fusão de características pré-treinado, incluindo DenseNet12131,32 e EfficientNetB733, os quais foram utilizados para extrair características das imagens; posteriormente, essas características extraídas foram concatenadas e encaminhadas a diferentes hiperparâmetros ajustados finamente, incluindo camadas treináveis e não treináveis, com o objetivo de diagnosticar tumores cerebrais com precisão, e foram implementadas em cinco conjuntos de dados diferentes de acesso público, os quais foram discutidos nas seções relacionadas acima. Além disso, o modelo DenseNet121 foi desenvolvido por Gao Huang e seus colaboradores em 2017 e possui 121 camadas. O objetivo principal desse modelo era concentrar-se na maximização do reuso de características e na prevenção do problema do gradiente que desaparece34. As camadas nesse modelo são organizadas em blocos densos, cada um contendo múltiplas camadas convolucionais que extraem e aprendem características. Cada camada recebe o mapa de características de todas as camadas anteriores como entrada, e sua saída é conectada às saídas dessas camadas e repassada como entrada para as camadas subsequentes no mesmo bloco, de maneira feed-forward. Além disso, camadas de transição são inseridas entre os blocos densos, sendo cada uma composta por uma camada convolucional 1 × 1, uma camada de Normalização em Lote (BatchNormalization) e camadas de agrupamento médio (pooling) 2 × 2, que reduzem o mapa de características para controlar a complexidade do modelo. Adicionalmente, uma camada final é acrescentada com função de ativação SoftMax (AF) antes de uma camada de agrupamento médio global para classificação. O design fundamental do modelo DenseNet121 é apresentado na Figura 334 abaixo.

Figura 3: Detalhe da arquitetura DenseNet12134. Esta figura mostra o detalhe arquitetônico do modelo DenseNet121, incluindo todos os blocos densos e de transição. Clique aqui para visualizar uma versão maior desta figura.
Além disso, o modelo EfficientNetB7 foi criado por Tan e Lee em 2019. Ele pertence à família EfficientNet, com variantes de B0 a B7, e seu objetivo principal é superar outros modelos utilizando menos parâmetros e menor poder computacional. A largura do modelo (número de canais por camada), profundidade (número de camadas) e resolução podem ser ajustadas por meio da escala composta, que é a característica central do modelo. Além disso, este modelo é composto por blocos MBConv (convolução com inversão de bottleneck móvel), que possuem uma camada de expansão convolucional 1 × 1 responsável por expandir os canais, uma convolução separável por profundidade que aplica a convolução separadamente a cada canal e uma camada de projeção convolucional 1 × 1 que reduz o número de canais ao valor original. Ademais, cada bloco MBConv inclui blocos de Compressão e Excitação (Squeeze and Excitation, SE)35, que recalibram as características por canal, ajudando a rede a se concentrar nas mais importantes. Além disso, em vez da função sigmoide ou qualquer outra FA, utiliza-se a função Swish, que apresenta desempenho superior ao ReLU ao permitir valores negativos, o que auxilia no fluxo do gradiente. Além disso, uma camada de saída final é adicionada com uma FA SoftMax antes de uma camada de agrupamento por média global para fins de classificação. Figura 435 mostra o design básico do modelo EfficientNetB7, enquanto Figura 5 mostra a arquitetura recomendada do modelo.

Figura 4: Detalhe arquitetônico do EfficientNetB735. Esta figura mostra o detalhe arquitetônico do modelo EfficientNetB7, incluindo todos os blocos convolucionais com inversão de gargalo móvel. Clique aqui para visualizar uma versão maior desta figura.

Figura 5: Arquitetura proposta do modelo híbrido fundido. A arquitetura proposta ilustra como imagens pré-processadas são encaminhadas para o extrator de características, que consiste em três blocos personalizados com diferentes hiperparâmetros, seguidos por uma camada de saída. Clique aqui para visualizar uma versão maior desta figura.
Além disso, primeiramente, características foram extraídas dos modelos pré-treinados DenseNet121 e EfficientNetB7. Os pesos atualizados dos modelos pré-treinados foram carregados nos modelos treinados, e as camadas base não treináveis dos modelos foram congeladas para impedir que o modelo fosse treinado novamente. Isso deve ajudar o modelo a manter seus melhores conhecimentos anteriores, adaptá-los à luz de novas amostras de dados para melhorar a convergência e concentrar-se nas camadas adicionais para treinar e extrair características avançadas. As equações 1 e 2 abaixo mostram o funcionamento dos modelos DenseNet121 e EfficientNetB7.
(1)
(2)
As equações 1 e 2 acima mostram o funcionamento do modelo pré-treinado em relação à extração de características; F1 denota os mapas de características de saída produzidos pelo modelo DenseNet121 pré-treinado e F2 denota os mapas de características de saída produzidos pelo modelo EfficientNetB7 pré-treinado mediante a aplicação de processamento às imagens de entrada, representadas por X. Além disso, W1 e W2 são os parâmetros ou pesos ajustáveis associados aos primeiros blocos e camadas dos modelos DenseNet121 e EfficientNetB7, respectivamente. Além disso, ∈ RN ×H1×W1×C1 e ∈ RN ×H2×W2×C2 representam a dimensionalidade dos mapas de características de saída dos modelos DenseNet121 e EfficientNetB7, respectivamente, com dimensões de H1 ×N×W1×C1 e H2 ×N×W2×C2, onde N representa o tamanho do lote de imagens, considerado como 16. Além disso, H1×W1 representa a altura e largura das imagens, respectivamente, para o modelo DenseNet121, e H2×W2 representa a altura e largura das imagens para o modelo EfficientNetB7, sendo selecionadas com tamanhos de altura e largura de 224 × 224. C1 e C2 representam o canal de cor para os modelos DenseNet121 e EfficientNetB7, respectivamente. Após obter os mapas de características de saída do modelo — 2560 canais do EfficientNetB7 e 1024 do DenseNet121 —, aplica-se a camada de agrupamento médio global 2D36 aos mapas de características de saída para reduzir a dimensão espacial, tomando a média de todas as dimensões espaciais em um único vetor, o que é mais conveniente para passar à próxima camada, permitindo melhor extração de características e reconhecimento de padrões em termos de características interpretáveis.
(3)
(4)
As equações 3 e 4 acima mostram o funcionamento da camada de agrupamento médio global 2D aplicada aos modelos DenseNet121 e EfficientNetB7, respectivamente, onde
e
mostram o procedimento de normalização da soma, dividindo pelo número total de posições espaciais em ambos os modelos, garantindo que a saída agrupada seja uma média e não uma soma simples.
e
representam o somatório ao longo das dimensões espaciais dos mapas de características, enquanto i e j servem apenas para iterar sobre altura e largura, respectivamente, a fim de somar os mapas de características em ambos os modelos. Além disso, F1(i, j, :) e F2(i, j, :) representam os valores dos mapas de características em posições espaciais específicas (i, j) em todos os canais, para os modelos DenseNet121 e EfficientNetB7, respectivamente. Essa operação de agrupamento agrega informações espaciais em uma representação mais compacta e precisa, preservando as características mais importantes em cada imagem. Além disso, as saídas das camadas de agrupamento médio global são concatenadas para produzir um único vetor de características para cada amostra, o que é frequentemente usado para fundir características de diferentes modelos, melhorando o desempenho ao aproveitar os pontos fortes de ambos; a Equação 5 mostra como isso funciona.
(5)
A equação acima 5 mostra o procedimento de concatenação de dois vetores de características de modelos diferentes [G1, G2], onde G1 representa o vetor de características do modelo DenseNet121 e G2 representa o vetor de características do modelo EfficientNetB7, enquanto a forma do vetor de características concatenado é representada por RN ×(C1+ C2), onde N é o tamanho do lote, que representa o número de amostras que prosseguem em paralelo, e (C1+ C2) é o número total de características obtidas dos modelos 1 e 2, respectivamente, cerca de 3584, que são processadas em paralelo, e o vetor de características de saída concatenado é representado por G. Além disso, três blocos diferentes foram adicionados para modificar o modelo fundido, a fim de extrair características mais complexas, melhorar a generalização e prevenir overfitting, apenas para obter resultados mais precisos e eficientes. Cada bloco é composto por uma camada densa com um número diferente de neurônios, sendo que o primeiro bloco possui 1024 neurônios em suas camadas densas, que se concentram em capturar uma ampla gama de características e padrões mais genéricos nos dados, enquanto o segundo bloco possui 512 neurônios em sua camada densa, que refinam especificamente as características, reduzindo a dimensionalidade e focando em padrões mais específicos. O terceiro bloco contém 256 neurônios em sua camada densa, que destilam ainda mais as características, garantindo que apenas as características e padrões mais relevantes sejam transmitidos à camada de saída para realizar uma tarefa mais pertinente. Além disso, abordagens de regularização L237 são adicionadas a cada camada densa em cada bloco para prevenir overfitting, penalizando pesos maiores, o que também torna o modelo mais complexo. Uma camada de dropout38 também é introduzida após cada bloco, com o objetivo de ignorar aleatoriamente 30%, 20% e 10% dos neurônios nos blocos 1, 2 e 3, respectivamente, o que força as redes a desenvolverem características mais robustas, que não dependem de um único neurônio. Além disso, para estabilizar o processo de treinamento, uma camada de BatchNormalization39 é aplicada após cada camada densa, o que garante que as ativações permaneçam dentro de uma faixa estável e também ajuda o modelo a evitar problemas como gradientes que desaparecem ou explodem durante a fase de treinamento. Adicionalmente, essa camada de BatchNormalization também acelera o processo de treinamento, permitindo que o modelo convirja mais rapidamente ao suavizar a paisagem de perda, o que facilita a obtenção de mínimos globais pelos otimizadores. Além disso, em cada bloco, para gerar não linearidade, é utilizada a ativação leaky ReLU40, que permite ao modelo aprender padrões complexos, e a leaky ReLU apresenta vantagens sobre outras funções de ativação, garantindo que o neurônio não fique inativo ao permitir um pequeno gradiente não nulo para entradas negativas. Além disso, a equação abaixo 6 mostra o funcionamento dos diferentes blocos integrados ao modelo híbrido fundido.
(6)
Após obter o vetor concatenado, G é processado pela camada densa do bloco 1 (totalmente conectada) com 1024 neurônios, onde a matriz de pesos W1 transforma o vetor de entrada G em um vetor de saída de 1024 dimensões, sendo cada elemento do vetor de saída uma combinação linear das características de entrada. Em seguida, o vetor de viés b1 é somado a cada um dos 1024 elementos do vetor de saída, o que permite ao modelo deslocar a saída das características de entrada de forma independente. Além disso, o termo de regularização L2: λ||W1||22 penaliza os pesos elevados, o que desencoraja o modelo a depender excessivamente de um único neurônio, ajudando assim a evitar o sobreajuste. Nesse contexto, a matriz de pesos de uma camada específica é W1 na rede neural, enquanto ||W1||22 denota a norma L2 quadrada da matriz de pesos W1 e λ é o parâmetro de regularização que controla o grau de regularização aplicado, sendo definido como 0,1 em todos os blocos. Z1 torna-se a nova representação de características após a aplicação da camada densa e da regularização L2 na entrada proveniente do vetor concatenado G, conforme mostrado na equação 6.
Após obter a saída da camada densa do bloco 1 como Z1, aplicou-se a camada de BatchNormalization, utilizada para acelerar o processo de treinamento, e a equação 7 abaixo mostra como ela funciona.
(7)
σ2 representa a variância da saída da última camada Z1 ao longo do lote, enquanto μ é a média da saída Z1, calculada separadamente para cada neurônio, que era 1024 na primeira camada densa. Já ε é uma constante pequena incorporada para garantir a estabilidade numérica e evitar a divisão por zero. A saída normalizada pode ser ajustada pelo modelo por meio do parâmetro escalável aprendível γ, enquanto a saída normalizada pode ser deslocada pelo parâmetro de deslocamento aprendível β. Por fim, após aplicar a camada de Normalização por Lote à saída da camada densa, a saída normalizada Z1 assegura que as ativações tenham uma distribuição consistente ao longo das diferentes camadas, o que ajuda a estabilizar e acelerar o treinamento. Após a Normalização por Lote, a saída normalizada Z1 passa pela função de ativação Leaky ReLU, que introduz não linearidade na rede, ajudando a aprender padrões complexos nos dados. Em vez de escolher ReLU ou outra função de ativação, optou-se pela Leaky ReLU, que é uma versão modificada da função ReLU e considera também pequenos valores negativos, em vez de torná-los zero como faz a função de ativação ReLU, superando assim o problema do "ReLU morto". A Equação 8 abaixo mostra como ela funciona.
(8)
Onde Z1 pertence à saída da camada de Normalização por Lote, que é repassada à Leaky ReLU como entrada para executar a não linearidade, enquanto ∝ é uma constante pequena utilizada para determinar a inclinação da parte negativa da função. Além disso, A1 representa a saída obtida após a aplicação da não linearidade. Por fim, uma camada de dropout é aplicada à saída A1 recebida como entrada da ativação Leaky ReLU, conforme mostrado na equação 9.
(9)
Onde A1 é a saída original da função de ativação recebida da última função de ativação ReLu, e onde p é a taxa de dropout, que varia entre 0 e 1 e foi definida como 0,3, 0,2 e 0,1 para três camadas de bloco, respectivamente, apenas para descartar uma fração dos neurônios. Além disso, A1′ mostra a saída modificada após a aplicação da camada de dropout, na qual alguns neurônios foram definidos como 0. A principal vantagem de utilizá-la é apenas prevenir problemas de overfitting, bem como reduzir a coadaptação. Adicionalmente, a saída do bloco1 A1′ é encaminhada para o próximo bloco novamente para extrair características ainda mais abstratas, aplicando-se os mesmos parâmetros usados no bloco 1, com algumas diferenças: 512 neurônios na camada densa em vez de 1024 e uma taxa de dropout de 0,2 em vez de 0,3; as demais sequências operacionais são as mesmas, conforme descrito nas equações 10 a 13 abaixo.
(10)
(11)
(12)
(13)
Após obter a saída do bloco 1 como A1′, que passa pela camada densa (totalmente conectada) do bloco 2 com 512 neurônios, onde a matriz de pesos W2 transforma o vetor de entrada A1′ em um vetor de saída de 512 dimensões, sendo cada elemento do vetor de saída uma combinação linear das características de entrada. Em seguida, o vetor de bias b2 é adicionado a cada um dos 512 elementos da saída, o que permite ao modelo deslocar a saída das características de entrada independentemente. Além disso, a regularização L2 também é aplicada, onde: λ||W2||22 penaliza os pesos elevados, servindo para mitigar o sobreajuste, impedindo que o modelo dependa excessivamente de qualquer neurônio específico neste bloco. Nesse contexto, W2 é a matriz de pesos de uma camada específica da rede neural, enquanto λ é o parâmetro de regularização que controla o grau de regularização aplicado, definido como 0,1. Z2 torna-se a nova representação de características após a aplicação da camada densa e da regularização L2 na entrada proveniente do bloco 1, conforme mostrado na equação 10.
Além disso, a camada de Normalização por Lote (BatchNormalization) foi aplicada à nova característica Z2, utilizada para acelerar o processo de treinamento, onde σ22 representa a variância ao longo do lote, enquanto μ2 é a média da saída Z2. Embora ε seja uma constante pequena incorporada para garantir a estabilidade numérica, γ é um parâmetro de escala ajustável que permite ao modelo modificar a saída normalizada, e β é um parâmetro de deslocamento ajustável que permite ao modelo transladar a saída normalizada. Finalmente, após a aplicação da camada de Normalização por Lote, conforme mostrado na equação 11, a saída normalizada Z2 passou pela função de ativação ReLU com vazamento (leaky ReLU AF), o que introduziu não linearidade na rede, conforme ilustrado na equação 12. Nesse contexto, Z2 corresponde à saída da camada de Normalização por Lote, que é fornecida como entrada à função Leaky ReLU para introduzir não linearidade. Enquanto isso, A2 representa a saída obtida após a aplicação da não linearidade.
Finalmente, uma camada de dropout é aplicada à saída A2 recebida como entrada da ativação Leaky ReLU, conforme mostrado na equação 13. Onde A2 é a saída recebida da última função de ativação ReLU, e onde p2 é a taxa de dropout, escolhida como 0,2 para este bloco, apenas para descartar uma fração dos neurônios. Além disso, A2′ representa a saída modificada após a aplicação da camada de dropout, na qual alguns neurônios foram definidos como 0. Em seguida, a saída do bloco 2, A2′, é enviada ao terceiro bloco novamente para extrair características ainda mais abstratas, aplicando-se os mesmos parâmetros utilizados no bloco 2, com algumas diferenças: 256 neurônios na camada densa em vez de 512 e uma taxa de dropout de 0,1 em vez de 0,2; as demais sequências operacionais são iguais, conforme descrito nas equações abaixo, de 14 a 17.
(14)
(15)
(16)
(17)
Após obter a saída do bloco 2 como A2′, que é passada pela camada densa (totalmente conectada) do bloco 3 com 256 neurônios, onde a matriz de pesos W3 transforma o vetor de entrada A2′ em um vetor de saída de 256 dimensões, e cada elemento no vetor de saída é uma combinação linear das características de entrada. Em seguida, o vetor de viés b3 é adicionado a cada um dos 256 elementos na saída, o que permite ao modelo deslocar a saída das características de entrada de forma independente. Além disso, a regularização L2 também é aplicada, onde: λ||W3||22 penaliza os pesos elevados, o que desencoraja o modelo a depender excessivamente de um único neurônio, ajudando assim a evitar o sobreajuste. Nesse contexto, W3 é a matriz de pesos de uma camada específica na rede neural, enquanto o grau de regularização empregado é controlado pelo parâmetro de regularização λ, que foi definido como 0,01. Z3 torna-se a nova representação de características após a aplicação da camada densa, bem como da regularização L2, na entrada proveniente do bloco 3, conforme mostrado na equação 14.
Além disso, a camada de Normalização por Lote foi aplicada à nova característica Z3, utilizada para acelerar o processo de treinamento, em que σ32 representa a variância ao longo do lote, enquanto μ3 é a média da saída Z3. O valor ε é uma constante pequena adicionada para garantir a estabilidade numérica. A saída normalizada pode ser ajustada pelo modelo utilizando o parâmetro de escala aprendível γ3 e deslocada utilizando o parâmetro de deslocamento aprendível β3. Por fim, após a aplicação da camada de Normalização por Lote, conforme mostrado na equação 15, a saída normalizada Z3 passa pela função de ativação ReLU com vazamento (leaky ReLU), que introduz não linearidade na rede, conforme mostrado na equação 16. Nesse caso, Z3 corresponde à saída da camada de Normalização por Lote, que é fornecida como entrada à função Leaky ReLU para introduzir a não linearidade. Já A3 representa a saída obtida após a aplicação da não linearidade.
Finalmente, uma camada de dropout é aplicada à saída A3 recebida como entrada da ativação Leaky ReLU, conforme mostrado na equação 17. Em que A3 é a saída recebida da última função de ativação ReLU, e em que p3 é a taxa de dropout, escolhida como 0,1 para este bloco, com o objetivo de descartar uma fração dos neurônios. Além disso, A3′ representa a saída modificada após a aplicação da camada de dropout, na qual alguns neurônios foram definidos como 0.
Além disso, a saída do bloco 3 A3′ passa pela última camada densa para fins de classificação, com um número K de neurônios que representa o número real de classes no conjunto de dados, conforme descrito na equação 18 abaixo.
(18)
A matriz de pesos associada à camada densa é Wk, responsável por transformar o vetor de 256 dimensões A3′ em um vetor de k dimensões, que representa as características aprendidas no bloco anterior e é gerado como saída. Além disso, bk representa o vetor de viés que ajusta a predição para garantir que a função de ativação tenha uma saída diferente de zero quando a entrada for zero, e Zk é a saída da camada final antes da aplicação da função de ativação, gerando os logits para cada classe; por fim, foi aplicado o classificador SoftMax41, que converte o logit Zk na probabilidade de cada classe, conforme mostrado nas equações 19 e 20.
(19)
(20)
Onde a probabilidade prevista da classe iésima é representada por yi, K é o número de classes, enquanto Zk, i é o logito para a classe iésima, e eZk, i é a exponencial do logito da classe iésima. y mostra a distribuição de probabilidade de todas as classes possíveis e garante que a soma das probabilidades seja 1. A Tabela 3 abaixo fornece os detalhes dos hiperparâmetros utilizados para treinar o modelo híbrido proposto, incluindo os detalhes arquiteturais adotados para melhorar a reprodutibilidade e o desempenho.
| Parâmetros Hyper | Modelo Proposto (FusionNetX) |
| Tamanho da imagem | 224 × 224 |
| Arquitetura do Backbone | EfficientNetB7 e DenseNet121 pré-treinados como BBA1 e BBA2 |
| Aumento de dados | Intervalo de rotação = 7, |
| Intervalo de deslocamento de largura/altura até 0,05, |
| Intervalo de zoom até 0,01, |
| Inversão horizontal/vertical |
| Razão de divisão dos dados | 80% para treinamento e 20% para validação com amostragem estratificada e randome_state fixo = 42 |
| Extração e fusão de características | Aplica-se o agrupamento médio global na saída de cada backbone: 2560 para BBA1 e 1024 para BBA2, fundidos para obter vetores de características conjuntas de 3584. |
| Composição do bloco totalmente conectado | 3 blocos totalmente conectados com 1 camada de saída. Cada bloco contém regularização L2 (λ=0,01), Normalização por Lote, LeakyReLU (α=0,01), Dropout de (0,3, 0,2 e 0,1) e dimensão oculta de (1024, 512, 256), respectivamente. Nenhuma conexão Skip adicional introduzida no cabeçote de fusão |
| Função de ativação | Leaky ReLU & SoftMax |
| Otimizador e taxa de aprendizado | Adam com taxa de aprendizado fixa de 0,00001, sem agendador de taxa de aprendizado. |
| Função de perda | sparse_categorical_crossentropy |
| Tamanho do lote | 16 |
| Épocas | 100 épocas fixas para cada conjunto de dados |
| Plataforma utilizada | Caderno Kaggle com GPU P100 e 16 GB de VRAM, utilizando as plataformas TensorFlow e Keras. |
Tabela 3: Hiperparâmetros utilizados para treinar o modelo proposto e detalhes arquiteturais propostos. Esta tabela fornece os detalhes estruturais e arquiteturais do modelo proposto, juntamente com os parâmetros ajustados e o ambiente de implementação.