Опухоль головного мозга является одним из самых опасных заболеваний в мире. Точная диагностика может существенно повысить выживаемость пациентов. Тем не менее, существует потребность в надежной диагностической системе, способной выявлять опухоли головного мозга на ранней стадии. Для решения этой проблемы был предложен более надежный метод точного обнаружения опухолей на ранних этапах с использованием гибридного механизма двойного глубокого обучения с оптимизированными гиперпараметрами и точно настроенными слоями на основе моделей DenseNet121 и EfficientNetB7. Предложенный подход принимает на вход 2D-МРТ-изображения и выдает прогноз о наличии или отсутствии опухоли для набора данных бинарной классификации Br35H, а также категорию опухоли для четырех других наборов данных многоклассовой классификации. Таким образом, в данном разделе представлены основные этапы предлагаемого подхода — от сбора данных до конечного результата, включая получение данных, предварительную обработку, разделение данных, выбор модели, извлечение признаков, прогнозирование опухоли и оценку предложенной модели, как показано на Рисунке 1.

Рисунок 1: Схема предлагаемой методологии. На данной схеме представлена общая архитектура предлагаемой модели, включающая сбор и предварительную обработку данных, две предобученные модели для извлечения признаков, конкатенацию полученных признаков, а также тонкую настройку гиперпараметров для классификации опухоли и определения ее типа. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Сбор данных
Первым этапом любого экспериментального исследования является сбор данных. Для этого были выбраны пять различных общедоступных наборов данных, включая Br35H24, Figshare25, Sartaj26, Masoud27 и набор данных МРТ-изображений опухолей головного мозга из открытой библиотеки Kaggle28, которые уже использовались многими исследователями для диагностики опухолей головного мозга. Набор данных Br35H содержит 3 0 изображений, разделенных на два класса: изображения здорового мозга и мозга с патологией (опухолью), по 1 50 в каждом классе, в то время как набор данных Figshare состоит из 3 064 изображений, разделенных на три группы по типу опухоли: 1 426 изображений глиомы, 708 изображений менингиомы и 930 изображений опухолей гипофиза. Набор данных Sartaj содержит 3 264 изображения, распределенных по четырем классам опухолей: глиомы (926 изображений), менингиомы (937 изображений), опухоли гипофиза (901 изображение), а также здоровый мозг или отсутствие опухоли (50 изображений). Кроме того, набор данных Masoud также включает четыре различных класса опухолей, изображения для которых были взяты из трех вышеупомянутых наборов данных; всего представлено 7 023 изображения, которые далее разделены на глиомы (1 621 изображение), менингиомы (1 645 изображений), опухоли гипофиза (1 757 изображений) и здоровый мозг или отсутствие опухоли (2 0 изображений). Последним был выбран набор данных на основе МРТ-изображений, который также содержит четыре класса с общим количеством 5 248 изображений, разделенных по типам опухолей: 1 312 изображений глиомы, 1 312 изображений менингиомы, 1 312 изображений опухолей гипофиза и 1 312 изображений здорового мозга или отсутствия опухоли; данный набор данных является сбалансированным, так как изображения распределены по типам опухолей в равных пропорциях.
Предобработка данных
После сбора данных следующим этапом является их предварительная обработка, которая необходима для получения более качественных результатов и более эффективна для вычислительных подходов при извлечении и изучении наиболее значимых признаков данных, что обеспечивает более точные результаты. Первым этапом было изменение размера изображений. Пять общедоступных наборов данных с различными классами и размерами изображений (даже в пределах одного набора данных для разных классов опухолей) были выбраны и единообразно приведены к размеру 24 x 24 для улучшения интерпретации и обучения модели. Кроме того, ко всем наборам данных была применена аугментация данных путем создания дополнительных образцов под разными углами, что улучшило извлечение признаков и обучение моделями глубокого обучения (DL). Для этого ко всем изображениям был применен диапазон поворота 7%, при котором они поворачивались на угол до 7 градусов. Далее ко всем изображениям был применен случайный сдвиг 5% по горизонтали и вертикали, со сдвигом по высоте и ширине на 5% относительно исходных изображений. После этого изображения были масштабированы с увеличением на 10% относительно оригиналов, и, наконец, все изображения были зеркально отражены по горизонтали и вертикали. Основной целью аугментации данных29 является преодоление переобучения и улучшение обобщающей способности моделей за счет обучения на различных преобразованных версиях исходных образцов данных. Перед разделением наборов данных на обучающую и валидационную выборки было выполнено кодирование меток, что более эффективно при расчете функции потерь в процессе обучения и валидации, а также делает образцы данных более подходящими для корректной обработки меток моделями. Кроме того, наборы данных были разделены на обучающую и валидационную выборки в соотношении 80% к 20%30 соответственно; в Таблице 2 показано общее распределение образцов данных и их соотношение в обучающей и валидационной выборках.
| Набор данных | Классы опухолей | Общее количество изображений | Обучающие изображения | Валидационные изображения |
| Br35H | Здоровый | 1500 | 1200 | 300 |
| Опухоль | 1500 | 1200 | 300 |
| Общее количество изображений | 3000 | 2400 | 600 |
| Figshare | Глиома | 1426 | 1141 | 285 |
| Менингиома | 708 | 566 | 142 |
| Гипофиз | 930 | 744 | 186 |
| Общее количество изображений | 3064 | 2451 | 613 |
| Сартаж | Глиома | 926 | 741 | 185 |
| Менингиома | 937 | 749 | 188 |
| Опухоль отсутствует | 500 | 400 | 100 |
| Гипофиз | 901 | 721 | 180 |
| Общее количество изображений | 3264 | 2611 | 653 |
| Масуд | Глиома | 1621 | 1297 | 324 |
| Менингиома | 1645 | 1316 | 329 |
| Опухоль отсутствует | 2000 | 1600 | 400 |
| Гипофиз | 1757 | 1405 | 352 |
| Общее количество изображений | 7023 | 5618 | 1405 |
| Сбалансированный набор данных по опухолям головного мозга (BBT-Dataset) | Глиома | 1312 | 1050 | 262 |
| Менингиома | 1312 | 1050 | 262 |
| Опухоль отсутствует | 1312 | 1050 | 262 |
| Гипофиз | 1312 | 1050 | 262 |
| Общее количество изображений | 5248 | 4200 | 1048 |
Таблица 2: Распределение наборов данных. В таблице представлены статистические данные по классам относительно общего количества изображений, а также количества изображений для обучения и валидации в наборах данных по опухолям головного мозга.
Набор данных Br35H состоит из 30 изображений, из которых 240 выбрано для обучения и 60 — для валидации. Набор данных Figshare включает 3064 изображения. Из всех изображений 2451 было выбрано для обучения, а остальные 613 — для валидации. Набор данных Sartaj содержит в общей сложности 3264 изображения, из которых 261 использованы для обучения, а остальные 653 — для валидации. Набор данных Masoud содержит всего 7023 изображения; из них 5618 были использованы для обучения, а остальные 1405 — для валидации. Набор данных BBT содержит в общей сложности 5248 изображений. Из общего числа изображений 420 были предназначены для обучения, в то время как остальные 1048 изображений были предназначены для валидации. Кроме того, на рисунке 2 ниже представлены различные изображения опухолей головного мозга.

Рисунок 2Изображения опухолей головного мозга, включая типы опухолей. Набор данных содержит четыре изображения здоровой ткани мозга и три изображения опухолей: глиомы, менингиомы и гипофизарной опухоли. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Предлагаемая модель
После этапа предварительной обработки следующим шагом является предложение модели обучения, эффективной именно для классификации опухолей головного мозга. Для этой цели была предложена эффективная модель обучения, специально предназначенная для классификации опухолей головного мозга. В частности, предлагается новая эффективная предобученная модель на основе гибридного слияния признаков, включающая DenseNet12131,32 и EfficientNetB73, которые использовались для извлечения признаков из изображений; далее эти извлеченные признаки объединялись (конкатенировались) и передавались в различные тонко настроенные гиперпараметры, включая обучаемые и необучаемые слои, для точной диагностики опухолей головного мозга, что было реализовано на пяти различных общедоступных наборах данных, рассмотренных в вышеуказанных соответствующих разделах. Кроме того, модель DenseNet121 была разработана Гао Хуангом и его коллегами в 2017 году и состоит из 121 слоя. Основная цель данной модели заключалась в максимальном повторном использовании признаков и предотвращении проблемы затухающего градиента34. Слои в этой модели организованы в плотные блоки (dense blocks), каждый из которых содержит несколько сверточных слоев, извлекающих и изучающих признаки. Каждый слой принимает на вход карту признаков всех предыдущих слоев, а его выход соединяется с выходами этих слоев и передается в качестве входных данных последующим слоям в том же блоке по принципу прямой связи. Кроме того, между плотными блоками добавляются переходные слои, каждый из которых состоит из сверточного слоя 1 × 1, слоя BatchNormalization и слоев усредняющего пулинга 2 × 2, которые уменьшают карту признаков для контроля сложности модели. Кроме того, перед слоем глобального усредняющего пулинга для классификации добавляется финальный слой с функцией активации (AF) SoftMax. Базовая архитектура модели DenseNet121 показана на рисунке 334 ниже.

Рисунок 3Архитектурные особенности DenseNet12134. На данном рисунке представлена детальная архитектура модели DenseNet121, включая все плотные блоки и переходные блоки. Пожалуйста, нажмите здесь, чтобы просмотреть эту фигуру в увеличенном размере.
Кроме того, модель EfficientNetB7 была разработана Tan и Lee в 2019 году. Она принадлежит к семейству EfficientNet, включающему варианты от B0 до B7, и ее основной целью является превосходство над другими моделями при использовании меньшего количества параметров и меньших вычислительных мощностей. Ширина модели (количество каналов на слой), глубина (количество слоев) и разрешение могут быть точно настроены с помощью комбинированного масштабирования, которое является ключевой особенностью модели. Более того, эта модель состоит из блоков MBConv (mobile inverted bottleneck convolutional — мобильный инвертированный сверточный блок с «бутылочным горлышком»), которые включают слой свертки 1 × 1 для расширения каналов, глубинный разделяемый сверточный слой (depthwise separable convolution), отвечающий за применение свертки к каждому каналу в отдельности, и проекционный сверточный слой 1 × 1, который возвращает количество каналов к исходному. Кроме того, каждый блок MBConv содержит блоки Squeeze and Excitation (SE)35, которые перекалибровывают признаки по каналам, помогая сети сосредоточиться на наиболее важных из них. Далее, вместо сигмоиды или любой другой функции активации используется функция Swish, которая работает эффективнее, чем ReLU, за счет допуска отрицательных значений, что способствует более стабильному градиентному потоку. Кроме того, для целей классификации перед слоем глобального усредняющего пулинга (global average pooling) добавляется финальный выходной слой с функцией активации SoftMax. На рисунке 435 представлена базовая схема модели EfficientNetB7, а на рисунке 5 показана рекомендуемая архитектура модели.

Рисунок 4Архитектурные особенности EfficientNetB735. На этом рисунке представлена детальная архитектура модели EfficientNetB7, включая все мобильные инвертированные сверточные блоки с узким местом (MBConv). Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5Предлагаемая архитектура гибридной комбинированной модели. Предложенная архитектура иллюстрирует процесс передачи предварительно обработанных изображений в экстрактор признаков, который состоит из трех специализированных блоков с различными гиперпараметрами, за которыми следует выходной слой. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Кроме того, первичные признаки были извлечены с помощью предобученных моделей DenseNet121 и EfficientNetB7. Обновленные веса предобученных моделей были загружены в обученные модели, при этом базовые слои моделей были заморожены, чтобы предотвратить их повторное обучение. Это должно помочь модели сохранить наилучшие накопленные знания, адаптировать их с учетом новых выборок данных для улучшения сходимости и сосредоточиться на обучении дополнительных слоев для извлечения более сложных признаков. Приведенные ниже уравнения 1 и 2 демонстрируют принципы работы моделей DenseNet121 и EfficientNetB7.
(1)
(2)
Приведенные выше уравнения 1 и 2 описывают работу предобученной модели в части извлечения признаков; F1 обозначает выходные карты признаков, полученные с помощью предобученной модели DenseNet121, а F2 — выходные карты признаков, полученные с помощью предобученной модели EfficientNetB7 при обработке входных изображений, которые представлены как X. Кроме того, W1 и W2 являются обучаемыми параметрами или весами, связанными с первыми блоками и слоями моделей DenseNet121 и EfficientNetB7 соответственно. Далее, ∈ RN ×H1×W1×C1 и ∈ RN ×H2×W2×C2 представляют размерность выходных карт признаков моделей DenseNet121 и EfficientNetB7 соответственно, с размерностью H1 ×N×W1×C1 и H2 ×N×W2×C2, где N обозначает размер пакета (batch size) изображений, который был принят равным 16. Кроме того, H1×W1 представляет высоту и ширину изображений соответственно для модели DenseNet121, а H2×W2 — высоту и ширину изображений для модели EfficientNetB7, которые были выбраны в размере 24 × 24. C1 и C2 обозначают цветовые каналы для моделей DenseNet121 и EfficientNetB7 соответственно. После получения выходных карт признаков из моделей (2560 каналов для EfficientNetB7 и 1024 для DenseNet121), к этим картам применяется слой глобального двумерного среднего пулинга (global average pooling 2D36) для уменьшения пространственной размерности путем вычисления среднего значения всех пространственных измерений в один вектор, что более удобно для передачи на следующий слой с целью более эффективного извлечения признаков и распознавания интерпретируемых паттернов.
(3)
(4)
Вышеприведенные уравнения 3 и 4 демонстрируют принцип работы слоя глобального усредняющего пулинга 2D (global average pooling 2D), примененного к моделям DenseNet121 и EfficientNetB7 соответственно, где
и
показана процедура нормализации суммы путем деления на общее количество пространственных позиций для обеих моделей; это необходимо для того, чтобы объединенный результат представлял собой среднее значение, а не простую сумму.
и
представляет собой суммирование по пространственным измерениям карт признаков, в то время как i, и j Эти циклы используются только для итерации по высоте и ширине соответственно с целью суммирования карт признаков для обеих моделей. Кроме того, F1(i, j, :) и F2(i, j, :) представляет значения карт признаков в конкретных пространственных позициях (i, j) по всем каналам для моделей DenseNet121 и EfficientNetB7 соответственно. Эта операция пулинга объединяет пространственную информацию в более компактное и точное представление, сохраняя наиболее важные признаки для каждого изображения. Далее выходы слоев глобального усредняющего пулинга объединяются (конкатенируются) для создания единого вектора признаков для каждого образца; такой подход часто используется для слияния признаков из разных моделей с целью повышения производительности за счет использования сильных сторон обеих моделей; принцип этой работы показан в уравнении 5.
(5)
Выше в уравнении 5 показана процедура конкатенации двух различных векторов признаков моделей [G1, G2], где G1 представляет вектор признаков модели DenseNet121, а G2 — вектор признаков модели EfficientNetB7; при этом размерность конкатенированного вектора признаков представлена как RN ×(C1+ C2), где N — размер пакета (batch size), определяющий количество параллельно обрабатываемых образцов, а (C1+ C2) — общее количество признаков, полученных из моделей 1 и 2 соответственно, что составляет примерно 3584, которые обрабатываются параллельно; конкатенированный выходной вектор признаков обозначен как G. Далее, для модификации объединенной модели были добавлены три различных блока с целью извлечения более сложных признаков, улучшения обобщающей способности и предотвращения переобучения для достижения более точных и эффективных результатов. Каждый блок состоит из полносвязного слоя с определенным количеством нейронов: первый блок имеет 1024 нейрона в полносвязном слое, что позволяет фиксировать широкий спектр признаков и более общие закономерности в данных; второй блок имеет 512 нейронов в полносвязном слое, что служит для уточнения признаков путем снижения размерности и фокусировки на более специфических паттернах. Третий блок содержит 256 нейронов в полносвязном слое, которые осуществляют более детальную дистилляцию признаков, чтобы на выходной слой для выполнения конкретной задачи передавались только наиболее значимые признаки и закономерности. Кроме того, в каждый полносвязный слой каждого блока добавлены методы L2-регуляризации37 для предотвращения переобучения путем штрафования за слишком большие веса, что также делает модель более сложной. После каждого блока также введен слой дропаута (dropout layer)38 для случайного игнорирования 30%, 20% и 10% нейронов в блоках 1, 2 и 3 соответственно, что заставляет сети вырабатывать более устойчивые признаки, не зависящие от одного нейрона. Более того, для стабилизации процесса обучения после каждого полносвязного слоя применяется слой пакетной нормализации (BatchNormalization)39, который гарантирует, что активации остаются в стабильном диапазоне, а также помогает модели избежать таких проблем, как затухание или взрыв градиентов в фазе обучения. Дополнительно слой BatchNormalization ускорил процесс обучения, что позволило модели быстрее сходиться за счет сглаживания ландшафта функции потерь, облегчая оптимизаторам поиск глобального минимума. Далее, в каждом блоке для обеспечения нелинейности используется функция активации leaky ReLU40, которая позволяет модели изучать сложные закономерности; leaky ReLU имеет преимущества перед другими функциями активации, так как предотвращает инактивизацию нейрона, допуская небольшой ненулевой градиент для отрицательных входных значений. Далее в уравнении 6 показан принцип работы различных блоков, интегрированных в гибридную объединенную модель.
(6)
После получения конкатенированного вектора G он проходит через полносвязный слой (dense layer) блока 1 с 1024 нейронами, где матрица весов W1 преобразует входной вектор G в выходной вектор размерности 1024, при этом каждый элемент выходного вектора представляет собой линейную комбинацию входных признаков. Далее к каждому из 1024 элементов выхода добавляется вектор смещения b1, что позволяет модели независимо смещать выходные значения входных признаков. Кроме того, член L2-регуляризации λ||W1||22 штрафует большие веса, что препятствует чрезмерной зависимости модели от одного нейрона и помогает избежать переобучения. Здесь W1 — матрица весов конкретного слоя в нейронной сети, ||W1||22 обозначает квадрат L2-нормы матрицы весов W1, а λ — параметр регуляризации, контролирующий степень применяемой регуляризации, который для всех блоков был установлен равным 0.1. Z1 становится новым представлением признаков после применения полносвязного слоя и L2-регуляризации к входным данным, переданным из конкатенированного вектора G, что показано в уравнении 6.
После получения выходных данных от плотного слоя блока 1 в виде Z1 был применен слой BatchNormalization, который использовался для ускорения процесса обучения; уравнение 7 ниже демонстрирует принцип его работы.
(7)
σ2 представляет собой дисперсию выходных данных последнего слоя Z1 по всему пакету, в то время как μ — это среднее значение выхода Z1, которое рассчитывается отдельно для каждого нейрона (их количество в первом полносвязном слое составляло 1024). ε представляет собой малую константу, которая вводится для обеспечения численной стабильности и предотвращения деления на ноль. Модель может корректировать нормированный выход путем изменения обучаемого параметра масштабирования γ, а также смещать его с помощью обучаемого параметра сдвига β. В конечном итоге применение слоя BatchNormalization к выходу полносвязного слоя гарантирует, что нормированный выход Z1 имеет согласованное распределение активаций в различных слоях, что способствует стабилизации и ускорению процесса обучения. После BatchNormalization нормированный выход Z1 проходит через функцию активации leaky ReLU, которая вносит в сеть нелинейность, позволяя извлекать сложные закономерности из данных. Вместо ReLU или другой функции активации была выбрана leaky ReLU — модифицированная версия функции ReLU, которая учитывает небольшие отрицательные значения вместо того, чтобы обнулять их, как это делает стандартная функция ReLU, что позволяет преодолеть проблему «отмирания ReLU» (dying ReLU problem). Принцип ее работы показан в уравнении 8 ниже.
(8)
Где Z1 представляет собой выход слоя BatchNormalization, который передается в Leaky ReLU в качестве входных данных для обеспечения нелинейности, а ∝ — это малая константа, используемая для определения наклона отрицательной части функции. Далее, A1 обозначает результат, полученный после применения нелинейности. Наконец, к выходу A1, полученному в результате активации Leaky ReLu, применяется слой dropout, что показано в уравнении 9.
(9)
Здесь A1 — исходный выход функции активации, полученный от последней функции активации ReLu, а p — вероятность исключения (dropout rate), которая варьируется от 0 до 1 и была выбрана как 0,3, 0,2 и 0,1 для трех слоев блоков соответственно, чтобы исключить определенную долю нейронов. Далее, A1′ представляет собой измененный выход после применения слоя dropout, в котором некоторые нейроны были обнулены. Основным преимуществом использования данного метода является предотвращение переобучения, а также снижение коадаптации. Кроме того, выход из первого блока A1′ снова передается в следующий блок для повторного извлечения более абстрактных признаков с применением тех же параметров, что и в блоке 1, за исключением использования 512 нейронов в полносвязном слое вместо 1024 и вероятности исключения 0,2 вместо 0,3; остальные последовательности операций идентичны, что описано в уравнениях 10–13 ниже.
(10)
(11)
(12)
(13)
После получения выходных данных из блока 1 в виде A1′, они передаются через полносвязный слой (dense layer) блока 2 с 512 нейронами, где матрица весов W2 преобразует входной вектор A1′ в 512-мерный выходной вектор, и каждый элемент этого вектора представляет собой линейную комбинацию входных признаков. Далее к каждому из 512 элементов выхода добавляется вектор смещения b2, что позволяет модели независимо смещать выходные значения входных признаков. Кроме того, применяется L2-регуляризация, где член λ||W2||22 штрафует большие значения весов, что служит для уменьшения переобучения, предотвращая чрезмерную зависимость модели от любого конкретного нейрона в данном блоке. Здесь W2 — матрица весов определенного слоя нейронной сети, а λ — параметр регуляризации, контролирующий степень применяемой регуляризации, который был установлен равным 0.1. Z2 становится новым представлением признаков после применения полносвязного слоя и L2-регуляризации к входным данным, переданным из блока 1, что показано в уравнении 10.
Кроме того, слой BatchNormalization был применен к новому признаку Z2 для ускорения процесса обучения, где σ22 представляет собой дисперсию по пакету, а μ2 — среднее значение выходного сигнала Z2. В то время как ε является малой константой, введенной для обеспечения численной устойчивости, γ представляет собой обучаемый параметр масштабирования, позволяющий модели изменять нормализованный выход, а β — обучаемый параметр сдвига, позволяющий модели смещать нормализованный выход. Наконец, после применения слоя BatchNormalization, описанного в уравнении 1, нормализованный выход Z2 проходит через функцию активации leaky ReLU, которая обеспечивает нелинейность сети, что показано в уравнении 12. Здесь Z2 является выходом слоя BatchNormalization, который поступает на вход Leaky ReLU для реализации нелинейности. При этом A2 обозначает результат, полученный после применения нелинейности.
Наконец, к выходу A2, полученному на вход от активации Leaky ReLU, применяется слой исключения (dropout), что показано в уравнении 13. Здесь A2 — это выход, полученный от последней функции активации ReLU, а p2 — коэффициент исключения, который для данного блока был выбран равным 0.2 для отсечения части нейронов. Далее A2′ представляет собой модифицированный выход после применения слоя исключения, в котором некоторые нейроны были обнулены. Затем выход из блока 2 A2′ снова передается в третий блок для повторного извлечения более абстрактных признаков; при этом используются те же параметры, что и в блоке 2, за исключением того, что в плотном слое используется 256 нейронов вместо 512, а коэффициент исключения составляет 0.1 вместо 0.2. Остальные операционные последовательности идентичны, что описано в уравнениях 14–17 ниже.
(14)
(15)
(16)
(17)
После получения на выходе блока 2 значения A2′, оно передается через полносвязный слой (dense layer) блока 3 с 256 нейронами, где матрица весов W3 преобразует входной вектор A2′ в 256-мерный выходной вектор, при этом каждый элемент выходного вектора представляет собой линейную комбинацию входных признаков. Далее к каждому из 256 элементов выхода добавляется вектор смещения b3, что позволяет модели независимо смещать выходные значения входных признаков. Кроме того, применяется L2-регуляризация, где λ||W3||22 штрафует большие веса, что препятствует чрезмерной зависимости модели от одного нейрона и помогает избежать переобучения. Здесь W3 — матрица весов конкретного слоя нейронной сети, а степень применяемой регуляризации контролируется параметром регуляризации λ, который был установлен на уровне 0.01. Z3 становится новым представлением признаков после применения полносвязного слоя и L2-регуляризации к входным данным, переданным из блока 3, что показано в уравнении 14.
Кроме того, к новому признаку Z3 был применен слой BatchNormalization, который использовался для ускорения процесса обучения; σ32 представляет собой дисперсию по батчу, в то время как μ3 — среднее значение выходного сигнала Z3. При этом ε — малая константа, добавляемая для обеспечения численной устойчивости. Нормализованный выход может быть скорректирован моделью с помощью обучаемого параметра масштабирования γ3 и смещен с помощью обучаемого параметра сдвига β3. Наконец, после применения слоя BatchNormalization, что показано в уравнении 15, нормализованный выход Z3 проходит через функцию активации leaky ReLU, которая обеспечивает нелинейность в сети, что показано в уравнении 16. Здесь Z3 является выходом слоя BatchNormalization, который поступает на вход Leaky ReLU для реализации нелинейности, а A3 представляет собой результат после применения нелинейности.
Наконец, к выходу A3, полученному на вход от функции активации Leaky ReLU, применяется слой дропаута (dropout), что показано в уравнении 17. Здесь A3 — это выход, полученный от последней функции активации ReLU, а p3 — вероятность исключения (dropout rate), которая для данного блока была выбрана равной 0.1 для исключения определенной доли нейронов. Далее A3′ представляет собой модифицированный выход после применения слоя дропаута, в котором значения некоторых нейронов были установлены в 0.
Кроме того, выход из блока 3 A3′ проходит через последний плотный слой для целей классификации с количеством нейронов K, которое соответствует фактическому количеству классов в наборе данных, что описано в уравнении 18 ниже.
(18)
Матрица весов, связанная с толстым слоем, — это Wk, которая отвечает за преобразование 256-мерного вектора A3′ в k-мерный вектор, представляющий извлеченные признаки из предыдущего блока и являющийся выходным значением. Кроме того, bk представляет собой вектор смещения, который корректирует предсказание, чтобы функция активации имела ненулевой выход при нулевом входном сигнале, а Zk является выходом последнего слоя перед применением функции активации; он генерирует логиты для каждого класса, и в конце был применен классификатор SoftMax41, который преобразует логит Zk в вероятность каждого класса, что показано в уравнениях 19 и 20.
(19)
(20)
Здесь прогнозируемая вероятность ith класса представлена как yi, K — количество классов, Zk, i — логит для ith класса, а eZk, i — экспонента логита ith класса. y отображает распределение вероятностей всех возможных классов и обеспечивает, чтобы сумма вероятностей была равна 1. В Таблице 3 ниже приведены сведения о гиперпараметрах, использованных для обучения предлагаемой гибридной модели, включая архитектурные детали, принятые для повышения воспроизводимости и производительности.
| Гиперпараметры | Предлагаемая модель (FusionNetX) |
| Размер изображения | 224 × 224 |
| Архитектура базовой сети | Предобученные модели EfficientNetB7 и DenseNet121 в качестве BBA1 и BBA2 |
| Аугментация данных | Диапазон вращения = 7, |
| Ширина/высота – диапазон сдвига до 0,05, |
| Диапазон масштабирования до 0,01, |
| Отражение по горизонтали/вертикали |
| Коэффициент разделения данных | 80% для обучения и 20% для валидации с использованием стратифицированной выборки и фиксированным randome_state = 42 |
| Извлечение и объединение признаков | Глобальный усредняющий пулинг применяется к выходным данным каждой базовой сети: 2560 для BBA1 и 1024 для BBA2, которые затем объединяются для получения совместных векторов признаков размерностью 3584. |
| Состав полносвязного блока | 3 полносвязных блока с одним выходным слоем. Каждый блок содержит L2-регуляризацию (λ=0,01), пакетную нормализацию (BatchNormalization), LeakyReLU (α=0,01), Dropout (0,3, 0,2 и 0,1 соответственно) и скрытую размерность (1024, 512, 256 соответственно). Дополнительные перекрестные связи (Skip connections) в объединяющей головке (fusion head) не используются. |
| Функция активации | Leaky ReLU (линейный выпрямитель с утечкой) & SoftMax |
| Оптимизатор и скорость обучения | Adam с фиксированным значением 0,01 без планировщика скорости обучения. |
| Функция потерь | разреженная категориальная перекрестная энтропия |
| Размер партии | 16 |
| Эпохи | 10 фиксированных эпох для каждого набора данных |
| Используемая платформа | Блокнот Kaggle с графическим процессором P10 и 16 ГБ видеопамяти (VRAM) с использованием платформ TensorFlow и Keras. |
Таблица 3: Гиперпараметры, использованные для обучения предлагаемой модели, и предлагаемые архитектурные особенности.В этой таблице приведены структурные и архитектурные характеристики предлагаемой модели, а также точно настроенные параметры и среда реализации.