$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании использовался общедоступный, анонимизированный набор данных; поэтому информированное согласие не требовалось. Предлагаемый подход состоит из шести компонентов: предварительной обработки, свёртки, модуля внимания, интеграции модулей свёртки и внимания, а также полностью связанных (FC) уровней. Рисунок 1 иллюстрирует полный рабочий процесс нашего метода.
Сбор наборов данных
Маркированные изображения МРТ мозга получаются из общедоступного набора данных Kaggle, включающего четыре категории опухолей и нормальную ткань.
Предварительная обработка данных
Изображения изменяются до равномерного разрешения и нормализации интенсивности. Для улучшения обобщения применяется опциональное дополнение (вращение, переворот, масштабирование). Набор данных разделён на обучающие (70%) и тестовые (30%) наборы.
Архитектура модели
Три магистральных CNN, предварительно обученных на ImageNet — MobileNetV2, EfficientNetV1 и Inception-ResNet-V2 — были использованы для классификации опухолей мозга в четыре категории с помощью МРТ-изображений. MobileNetV2 и EfficientNetV1 были настроены с размером входа 224 × 224 пикселя, тогда как Inception-ResNet-V2 требовал входного размера 299 × 299 пикселей. В процессе трансферного обучения начальные сверточные слои замораживались в начале для сохранения обобщённых особенностей изображения, а верхние слои были тонко настроены для адаптации модели для классификации опухолей мозга. Каждый магистраль сочетался с лёгкой головкой классификации, включавшей глобальное среднее пулирование, плотные слои, выпадание для регуляризации и функцию активации Softmax для прогнозирования четырёх классов. Отпадание было внедрено для снижения переоборудования и улучшения обобщения. Разработанная архитектура эффективно сочетала эффективное извлечение признаков с более низкими вычислительными требованиями, обеспечивая точную классификацию при сохранении пригодности для внедрения в условиях ограниченных ресурсов и демонстрации концепции.
Извлечение признаков на основе внимания
Входные изображения обрабатываются через начальный сверточный слой, за которым следует модуль индивидуального внимания. Параллельное максимальное пулирование и среднее пулирование фиксируют заметные и контекстуальные особенности, которые соединяются и уточняются с помощью свёртки для выделения областей, релевантных для опухоли.
Сверточный магистраль и слияние
Функции, ориентированные на внимание, пересылаются на заранее обученные магистрали (MobileNetV2, EfficientNetV1 или Inception-ResNet-V2). Высокоуровневые свёрточные слои логически объединяются для уменьшения доступа к памяти и повышения вычислительной эффективности.
Классификация
Плоские элементы проходят через полностью связанные слои с активацией и выпадением ReLU6, создавая компактное представление для финальной четырёхклассной классификации softmax.
Оценка
Производительность модели оценивается на тестовом наборе с использованием точности, точности, воспоминания, результатов F1 и матриц путаницы.
Разработка фреймворка
Предлагаемое решение реализовано на Python и использует Keras для выполнения. Таблица 1 иллюстрирует гиперпараметры. Набор данных разделён на обучающий и тестовый набор в соотношении 70:30. Пять различных произвольных разделений поездов/тестов используются для отображения итоговой сбалансированной производительности каждого набора данных.
Предварительная обработка
Входные изображения необходимо обновить, поскольку фреймворк MobileNetV2 служит основой для предлагаемого решения. Для извлечения высококачественных характеристик из фотографий используется предварительно обученная модель MobileNetV2 с её входной размерностью. Каждое входное изображение затем масштабируется до 224×224 пикселей в диапазоне [-1, 1].
Модель свёртки
MobileNetV2 улучшает распознавание изображений, используя эффективную архитектуру сверточной нейронной сети (CNN), предназначенную для минимизации вычислительных затрат. Хотя традиционные CNN достигают высокой точности, они часто требуют значительной памяти и вычислительной мощности. MobileNetV1 ввела концепцию глубинно разделяемой свёртки, которая разделяет стандартную свёртку на две отдельные операции: глубинную свёртку для фильтрации входных данных и попунктную свёртку для интеграции признаков. MobileNetV2 развивает эту идею, включая остаточные блоки узкого места, состоящие из слоёв расширения, глубинной свёртки, проекционных слоёв и остаточных соединений. Проекционный слой сжимает функциональные каналы, а остаточные соединения способствуют лучшему потоку информации по всей сети. Для повышения стабильности и повышения эффективности обучения после сверточных операций применяются активация ReLU6 и пакетная нормализация.
В этом исследовании MobileNetV2, предварительно обученный на ImageNet, был использован как основная модель для извлечения признаков, обеспечивая эффективные семантические представления высокого уровня при сохранении вычислительных затрат при классификации опухолей мозга низкими. После каждого слоя свёртки находится слой активации ReLU6, который является адаптацией функции активации ReLU, где размер максимизируется на шести, и слой пакетной нормализации. Общие слои свёртки 1x1, среднего пула и классификации применяются к 17 оставшимся узким блокам, формируя полную архитектуру MobileNetV2. Мы использовали MobileNetV2 как основную сеть, предварительно обученную на ImageNet. В таком случае сверточное отображение получается из последнего остаточного блока после прохождения сверточного слоя MobileNetV2. Нижние уровни остаточных блоков создают меньшие карты объектов. Такие блоки не вносят вклад в наши исследования, поскольку они не собирают высокоуровневые данные для общей идентификации изображений. Во время построения и обучения моделей слои, предшествующие сверточным слоям, которые формируют 3D-карту 7 × 7, остаются фиксированными. В математических терминах это выражено ниже в уравнении (1):
F1(I) = выпуклость(I) (1)
Здесь F1(I) обозначает сверточную особенность, извлеченную из входного изображения I.
Модуль фокуса
Механизм внимания человеческого мозга, который подразумевает, что люди естественным образом больше сосредотачиваются на значимых визуальных вводах, чем на каждой детали изображения, служит основой для проектирования этой трансформационной сети. Благодаря этой идее в исследованиях глубокого обучения было создано множество моделей, основанных на внимании. Пространственные корреляции, наблюдаемые в представлениях опухолей мозга, выделяются предполагаемым механизмом внимания. В то время как модуль внимания канала фиксирует наиболее важную информацию, связанную с опухолями, по ключевым каналам, региональный блок внимания определяет наиболее информативные области изображения МРТ. Используя метод структурированного внимания, рекомендуемая единица фокуса сосредоточена на областях, содержащих дискриминационную информацию о опухоли.
Для улучшения представления признаков перед фазой обнаружения пространственных признаков применяются такие методы, как пул активации верха и сбалансированное извлечение признаков. Эта стратегия повышает способность модели выделять клинически значимые области опухолей при минимизации несущественных фоновых деталей, тем самым повышая точность классификации и эффективность изучения признаков. Второй — это конкатенация тензоров с максимальным пулом и среднего пула. Наконец, функция активации сигма, в сочетании с сверточным фильтром размером 7x7, будет использована для активации визуальных стимулов внутри визуальных эффектов. Различные этапы модуля фокусировки обозначаются уравнениями (2) и (3). где сбалансированные Pool(F) ∈ RHxWx1 представляют среднюю операцию пулирования, а MaxPool(F) ∈ RHxWx1 описывает операцию максимального пулирования.
F2(I) = [AvgPool(F); MaxPool(F)] (2)
Эти два элементных отображения можно объединить в 3D для создания элементной карты
F2(I) = ∈ RHxwx1. F3(I) = σ(f7x7(F2(I))) (3)
где σ — функция активации, указывающая на сигму. Характеристики внимания, которые представлены тензором высоты HxWxC (V), шириной (W) и толщиной (C), представлены F3(I), тогда как f7x7 — операцию свёртки размера фильтра (7x7).
Слияние внимания и модели свёртки
В отличие от сети, основанной на одном энкодере, мультимодальный блок слияния может извлекать гораздо более эффективную и полную информацию для подавляющего большинства модальностей. Термоядерный блок предназначен для направления к максимально необходимым кросс-модальным особенностям; поэтому он выявит области для удаления опухолевых областей. Это простая конкатенация отдельных латентных представлений, но часть информации теряется. Таким образом, комбинированное отображение объектов было создано путём объединения отображений признаков модулей свёртки и наблюдения с использованием базового метода конкатенации признаков Ситаулы и др. Эти две карты признаков отражали различия в различных свойствах изображения, поэтому мы решили использовать простой метод конкатенации вместо стратегий на основе максимальной, минимальной или суммы. Это также делает его вычислительно легче по сравнению с альтернативными методами, использующими билинейные методы как форму вычисления тензорного произведения. Когда такие две признаки объединяются, результант называется тензором признаков. Математическое выражение агрегированного тензорного выхода символов T задаётся уравнением (4).
[F1(I), F3(I)] = T(I) (4)
Где F1(I) ∈ RHxWx1 и F2(I) ∈ RHxWx1280. Это трёхмерные тензоры одинаковой ширины (W) и высоты (H). Кроме того, их можно объединить в 3D k для создания 3D тензоров, где T(I) ∈ LxWx1281.
Полностью связанные слои (FC)
Мы использовали серию слоёв FC после слияния признаков, чтобы преобразовать объёмный тензор, переформированный в линейный вектор признаков. Глава классификации состоит из слоя глобального среднего пулирования, полностью связанных плотных слоев, регуляризации dropout и выходного слоя Softmax. Используется функция активации ReLU6 с 128 единицами и вероятностью выбывания 50%.