Research Article

Предобработка изображений и чувствительность оптимизаторов: значение для сверточных нейронных сетей при диагностике опухолей мозга

DOI:

10.3791/69459

February 17th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном исследовании используется контролируемая структура для оценки конвейеров и оптимизаторов предобработки в рамках фиксированной архитектуры, с целью определить, как классическая предобработка влияет на оптимизаторов и сверточные нейронные сети (CNN) в классификации опухолей мозга.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Классификация опухолей мозга с помощью магнитно-резонансной томографии (МРТ) представляет собой сложности из-за различий в размерах, форме и текстуре опухоли. Хотя традиционные методы предварительной обработки изображений часто используются для улучшения качества входа, их влияние на поведение оптимизаторов и производительность CNN пока не изучено тщательно. В данном исследовании рассматривается влияние предварительной обработки на сходимость, обобщение и точность классификации различных оптимизаторов. Мы используем общедоступный набор данных Kaggle для создания двух конвейеров предварительной обработки: базового конвейера, который меняет размер только изображений, и традиционного, который преобразует изображения в оттенки серого, размывает их и применяет морфологическую фильтрацию. Затем мы проверяем, как эти конвейеры влияют на три оптимизатора: Адама, Root Average Square Propagation (RMSProp) и стохастический градиентный спуск (SGD). Для разделения протокольных переменных используется фиксированная архитектура CNN. Результаты оцениваются с помощью точности, точности, воспоминания и оценки F1, валидируемых пятикратной перекрёстной валидацией. Результаты показывают, что базовая предобработка стабильно обеспечивает более высокую точность и более стабильную сходимость среди всех оптимизаторов, при этом RMSProp и SGD достигают самой высокой средней точности 99,53% при пятикратной перекрёстной валидации. Результаты рассматривают недостаточно изученное влияние предобработки на производительность оптимизаторов, подчёркивая необходимость стратегий обучения, ориентированных на предобработку, для повышения надёжности и интерпретируемости в анализе медицинских изображений.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Классификация опухолей мозга с помощью магнитно-резонансной томографии (МРТ) является ключевой задачей в нейроонкологии, где ранняя и точная диагностика напрямую влияют на планирование лечения и исходы дляпациентов 1. CNN стали доминирующим подходом для автоматизации этого процесса благодаря своей способности изучать иерархические пространственные и текстурные особенности непосредственно на основе исходных данныхизображений 2. Тем не менее, качество входных данных остаётся ключевым фактором производительности модели. Классические методы предварительной обработки — такие как преобразование в оттенках серого, гауссовское размытие, пороговое определение и морфологические операции — регулярно применяются для снижения шума и акцентирования структурных границ 3,4,5. Гангадхаран и др. провели сравнительный анализ моделей глубокого обучения для прогнозирования опухолей мозга, подчеркнув вариабельность производительности между архитектурами и важность характеристик наборов данных для формированиярезультатов 6. Куреши и др. предложили ультралёгкую CNN для многоклассового обнаружения опухолей, делая акцент на вычислительной эффективности и применимости в реальном времени без ущерба точностидиагностики 7. Выходя за рамки структурной визуализации, Куреши и др. исследовали радиогеномную классификацию с использованием объединённых мультиомических признаков многопараметрических МРТ для прогнозирования статуса промотора метилтрансферазы метилгуанина и ДНК (MGMT), демонстрируя потенциал интегрированных методов данных для неинвазивного профилированияопухолей 8. Несмотря на их повсеместность, дальнейшее влияние этих трансформаций на динамику обучения CNN, поведение оптимизаторов и интерпретируемость остаётся недостаточно изученным.

Недавние достижения в классификации опухолей мозга сосредоточены на архитектурной сложности, гибридах сегментации и классификации и трансферном обучении. MultiFeNet, например, использует многомасштабное объединение признаков для улучшения пространственногопредставления 9, тогда как ансамблевые модели и 3D-CNN обеспечивают высокую точность за счёт увеличения вычислительных накладныхрасходов 10,11. Недавние исследования гибридных методов, таких как вейвлет-преобразование с помощью Support Vector Machine (SVM) и обнаружение краёв на основе клеточных автоматов, обычно требуют ручной работы или многоступенчатую обработку12,13. Сравнительные исследования несбалансированных наборов данных выявили сложности достижения классовыхобобщений 14. Методы трансферного обучения с использованием предварительно обученных сетей, таких как VGG и ResNet, показали перспективы в классификацииМРТ 15,16,17; однако они часто рассматривают предварительную обработку как фиксированный этап вверх по потоку. Эти модели редко вылучают, как входные преобразования влияют на сходимость оптимизатора или семантического удержания.

Исследования, учитывающие предобработку, начали выявлять этот разрыв. Иванеску и др. показали, что чрезмерная фильтрация может снижать чувствительность CNN к тонким опухолям3. Ву и др. показали, что преобразование и изменение размера в оттенках серого могут отбрасывать контекстную информацию, что влияет на точностьдиагностики 4. Хупер и соавторы выяснили, что фильтрация компьютерной томографии (КТ) в восходящей области индуцирует вариабельность производительности, что подчёркивает хрупкость CNN к доменнымсдвигам 5. Кунду и др. предложили гауссовские преобразования интенсивности для улучшениясегментации 18; однако они не оценивали чувствительность оптимизатора. Тем временем Асири и др. и Аамир и др. оптимизировали гиперпараметры CNN для обнаружения опухолеймозга 16,17, отмечая превосходящие результаты Адама без анализа его реакции на изменения предварительной обработки. Инструменты объяснимости, такие как отображение активации классов с градиентным взвешенным уровнем (Grad-CAM) и SHapley Additive exPlanations (SHAP), продвинули наше понимание принятия решений CNN, визуализируя классово-дискриминирующие области19,20. Эти методы необходимы для проверки того, улучшает ли предобработка или искажает семантическое удержание.

Однако немногие исследования систематически изучали, как предобработка влияет на сходимость оптимизаторов, обобщение и интерпретируемость при фиксированной архитектуре — вопросы, которые имеют как клиническую, так и вычислительную значимость. Клинически чрезмерное сглаживание или преобразования интенсивности могут ослабить диагностически значимые текстуры и пространственные градиенты, снижая точность локализации и доверие к клиницистам. С вычислительной точки зрения оптимизаторы по-разному реагируют на изменения масштаба признаков и градиентной дисперсии; Несоответствия между сложностью входных данных и динамикой оптимизаторов могут привести к нестабильной сходимости или худшему обобщению.

Для решения этой проблемы мы вводим двухпутную структуру, которая систематически сравнивает базовые (только с изменением размера) и традиционные конвейеры предобработки между тремя оптимизаторами — Adam, RMSProp и SGD — используя согласованную архитектуру CNN и набор данных BR35HKaggle 21. Мы оцениваем эффективность классификации, скорость сходимости и интерпретируемость с помощью Grad-CAM, валидируемого через пятикратную кросс-валидацию. В отличие от предыдущих работ, смешивающих архитектурные и предобработочные изменения, этот протокол изолирует предобработку как независимую переменную, показывая, что агрессивная фильтрация может затруднять работу оптимизатора и пространственного внимания.

Представленная здесь структура предлагает несколько преимуществ по сравнению с существующими моделями. Во-первых, он явно оценивает взаимодействие между стратегиями предварительной обработки и оптимизаторами — измерение, часто упускаемое из виду в исследованиях ансамблевого и трансферногообучения 15,16,17. Во-вторых, он поддерживает фиксированную архитектуру CNN, что имитирует реальные ограничения развертывания, где перенастройка обычнонепрактична. В-третьих, он интегрирует методы визуальной атрибуции для оценки семантического удержания, дополняя предыдущие работы по радиомическим и ручным исследованиямпризнаков 23. Наконец, фреймворк предлагает воспроизводимые представления о стратегиях обучения, ориентированных на предобработку, что повышает как устойчивость, так и интерпретируемость.

Синтезируя данные из методов предварительнойобработки 3,4,5, оптимизирующихисследований 16,17 и инструментовобъяснимости 19,20, эта работа представляет практический и интерпретируемый конвейер классификации опухолей мозга, балансирующий точность, стабильность и клиническую значимость.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

На рисунке 1 представлен обзор рабочего процесса протокола. В данном исследовании рассматривается влияние классической предварительной обработки изображений на работу CNN и поведение оптимизаторов при классификации опухолей мозга с помощью МРТ. Протокол включает подготовку наборов данных, конвейеры предварительной обработки с двумя путями, архитектуру модели, конфигурацию оптимизаторов, оценку производительности и проверку интерпретируемости. Все эксперименты проводились на Python 3.10.12 с использованием версии Keras 2.13.1 с бэкендом TensorFlow, OpenCV версии 4.8.0 и Matplotlib версии 3.8.0.

Подготовка наборов данных
В этом исследовании использовался набор данных BR35H по МРТ опухолей мозга изKaggle 21, состоящий из 3000 изображений, поровну разделённых на классы с опухолями ("да") и отсутствующие опухоли ("нет"). Все изображения были изменены до 128 × 128 пикселей с помощью функции cv2.resize OpenCV для стандартизации входных размеров в экспериментах. Стратифицированная выборка с помощью train_test_split Scikit-learn обеспечивала сбалансированное представление между обучающим набором (80%) и валидационным набором (20%), тем самым сохраняя согласованность распределения классов по каждой сгибательной системе.

В дополнение к публичному набору данных BR35H, мы проверили этот протокол с помощью независимого набора данных, собранных из Ultralytics Brain Tumor Dataset (https://docs.ultralytics.com/datasets/detect/brain-tumor/). Этот набор данных состоит из действительного обучающего набора из 878 изображений и тестового набора из 223 изображений, с двумя чётко определёнными классами: Негативные (изображения без опухолей мозга) и Положительные (изображения с опухолями мозга). Включение этого независимого набора данных позволило нам дополнительно оценить обобщимость и надёжность фреймворка за пределами исходных данных.

Конвейеры предварительной обработки
Были реализованы два отдельных конвейера предварительной обработки для оценки влияния классической обработки изображений. Конвейер базовой предварительной обработки (BP) просто изменял размер изображений до 128 × 128 пикселей без дальнейших преобразований, сохраняя тем самым интенсивность исходного пикселя и структурные особенности как контрольное условие. Конвейер традиционной предварительной обработки (TP) применял последовательность классических этапов обработки изображений с использованием функций OpenCV: преобразование в оттенках серого (cv2.cvtColor) для уменьшения размерности канала, гауссово размытие (cv2). GaussianBlur) для подавления шума и усиленияконтраста 24, порогов (cv2.threshold) для сегментации высокоинтенсивных структур25, морфологические операции (cv2.erode, cv2.dilate) для уточнения краёв и уменьшения артефактов26, а также обнаружение контуров (cv2.findContours) для выявления интересующих областей. Этот конвейер повышал контраст и уменьшал визуальный беспорядок, хотя рисковал подавлять диагностически значимую текстуру.

Архитектура модели
Был реализован индивидуальный CNN, который оставался постоянным во всех экспериментах, чтобы выделить эффекты предобработки и выбора оптимизатора. Архитектура состояла из входного слоя (128 × 128 × 1), трёх сверточных слоёв (первый с 32 фильтрами, а следующие два — с 64 фильтрами, все с 2 × 2 ядрами и активацией Rectified Linear Unit (ReLU), каждое из которых следовало 2 × 2 максимального пула. Выход выравнивался и проходил через плотный слой из 128 единиц с активацией ReLU, затем слой dropout (скорость = 0,5), и, наконец, один сигмовидный блок для бинарной классификации. Эта конструкция обеспечивает баланс между интерпретируемостью и вычислительной эффективностью, что делает её подходящей для клинического оборудования с ограниченными ресурсами.

Конфигурация оптимизатора
Три оптимизатора оценивались с фиксированными гиперпараметрами: Адам (скорость обучения = 0,001, β1 = 0,9, β2 = 0,999, эпсилон = 1e−07), RMSProp (скорость обучения = 0,001, rho = 0,9, эпсилон = 1e−07) и SGD (скорость обучения = 0,005, импульс = 0,9, Нестеров отключён). Параметры обучения оставались постоянными в экспериментах: размер партии составлял 32, 50 эпох, а ранняя остановка (терпение = 10) реализовывалась с помощью обратных вызовов Keras для предотвращения перенагона.

Оценка эффективности
Производительность оценивалась с помощью точности, точности, воспоминания и результата F1, рассчитанных с помощью classification_report Scikit-learn. Кривые обучающих и валидационных потерь были построены с помощью Matplotlib для оценки скорости сходимости и обнаружения перенагона. Результаты были зафиксированы и визуализированы для сравнения чувствительности оптимизатора при различных условиях предварительной обработки.

Валидация интерпретируемости
Интерпретируемость верифицировалась с помощью визуализаций Grad-CAM, сгенерированных на последнем сверточном слое. Тепловые карты генерировались с помощью функций Keras и TensorFlow, а затем накладывались на исходные изображения МРТ с помощью Matplotlib. Этот шаг обеспечил согласование пространственного внимания CNN с клинически значимыми областями опухоли, тем самым поддерживая прозрачность и диагностическое доверие.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Оптимизатор Adam — базовая предобработка:
Рисунок 2 иллюстрирует производительность модели классификации опухолей мозга с использованием оптимизатора Адама с базовой предварительной обработкой. Матрица путаницы показывает почти идеальное разделение между опухолями и неопухолевыми случаями, с лишь 8 ошибками из 600 образцов. Сопроводимый отчёт по классификации подтверждает это точностью, отзывом и результатами F1, все они достигают 0,98 и...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Успех классификации опухолей мозга на основе CNN в этом исследовании был в первую очередь обусловлен двумя компонентами протокола: проектированием предварительной обработки и выбором оптимизаторов. Базовая предобработка — состоящая исключительно из изменения размера изображения — сохраняла нативную интенсивность пикселей и пространственную структуру, позволяя модели изучать клинически значимые признаки. В отличие от этого, традиционные методы предварительной обработки (такие как преобраз...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторам нечего раскрывать.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают свою признательность и искреннюю благодарность Университету ГИТАМ, руководящей команде, декану и заведующему кафедрой компьютерных наук и инженерии кампуса Вишакхапатнам за их постоянную поддержку и поощрение исследований и разработок.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Обёртка APIКерас2.13.1 (RRID:SCR_016345)Высокоуровневый API для архитектуры и обучения CNN
Инструмент атрибуцииРеализация Grad-CAMCustom (через Keras)Визуальное объяснение внимания CNN
Набор данных BR35H по опухолям мозга МРТ  Кагглhttps://www.kaggle.com/ahmedhamada0/brain-tumor-detectionИсточник маркированных МРТ-изображений для классификации 
Набор данных по опухолям мозга Ultralyticshttps://docs.ultralytics.com/datasets/detect/brain-tumor/
Библиотека глубокого обученияTensorFlow2.15.0 (RRID:SCR_018345)Бэкенд для реализации модели CNN
Обработка изображенийOpenCV4.8.0 (RRID:SCR_015526)Предварительная обработка: оттенки серого, размытие, порог, морфология
Язык программированияPython3.10.12 (RRID:SCR_008394)Среда выполнения всех экспериментов
ВизуализацияMatplotlib3.8.0 (RRID:SCR_008624)Построение кривых потерь и наложений Grad-CAM

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Devkota, B., et al. Image segmentation for early stage brain tumor detection using mathematical morphological reconstruction. Procedia Comput Sci. 125, 115-123 (2018).
  2. Antony, A., Minla, K. S. Brain tumor detection from MRI images using CNN. Int J Creat Res Thoughts. 10 (4), 95-100 (2022).
  3. Ivanescu, R. C. A statistical evaluation of the preprocessing medical images impact on a deep learning network's performance. Ann Univ Craiova Math Comput Sci Ser. 49 (2), 411-421 (2022).
  4. Vu, H. A. Integrating preprocessing methods and convolutional neural networks for effective tumor detection in medical imaging. arXiv. , (2024).
  5. Hooper, S. M., et al. Impact of upstream medical image processing on downstream performance of a head CT triage neural network. Radiol Artif Intell. 3 (4), e200229(2021).
  6. Comparative analysis of deep learning-based brain tumor prediction models using MRI scan. Gangadharan, S. M. P., et al. 2023 3rd International Conference on Innovative Sustainable Computational Technologies (CISCT), Dehradun, India, , (2023).
  7. Qureshi, S. A., et al. Intelligent ultra-light deep learning model for multi-class brain tumor detection. Appl Sci. 12 (8), 1-22 (2022).
  8. Qureshi, S. A., et al. Radiogenomic classification for MGMT promoter methylation status using multi-omics fused feature space for least invasive diagnosis through mpMRI scans. Sci Rep. 13, 3291(2023).
  9. Agrawal, T., et al. MultiFeNet: multi-scale feature scaling in deep neural network for the brain tumour classification in MRI images. Int J Imaging Syst Technol. 34 (1), 1-15 (2023).
  10. Brain tumor detection using U-Net and 3D CNN architecture. Ghanshala, A., et al. 2022 International Conference on Computing, Communication, and Intelligent Systems (ICCCIS), Greater Noida, India, , (2022).
  11. Medical image denoising and brain tumor detection using CNN and U-Net. Shivahare, B. D., et al. 2023 3rd International Conference on Innovative Sustainable Computational Technologies (CISCT), , Dehradun, India. (2023).
  12. Kumar, S., et al. Enhancing brain tumor segmentation using Berkeley wavelet transformation and improved SVM. Open Bioinform J. 18, e18750362358232(2025).
  13. Cellular automata based edge-detection for brain tumor. Diwakar, M., Patel, P. K., Gupta, K. 2013 International Conference on Advances in Computing, Communications and Informatics (ICACCI, Mysore, India, , (2013).
  14. Agrawal, T., et al. A comparative study of brain tumor classification on unbalanced dataset using deep neural networks. Biomed Signal Process Control. 94, 106256(2024).
  15. Khan, M. A., et al. Transfer learning for accurate brain tumor classification in MRI: a step forward in medical diagnostics. Discov Onc. 16, 1040(2025).
  16. Asiri, A. A., et al. Enhancing brain tumor diagnosis: an optimized CNN hyperparameter model for improved accuracy and reliability. PeerJ Comput Sci. 10, e1878(2024).
  17. Aamir, M., et al. Brain tumor detection and classification using an optimized convolutional neural network. Diagnostics. 14 (16), 1714(2024).
  18. Kundu, S., Das, B., Balas, V. E. Data conditioning to improve segmentation of brain MRI using CNN. Computer Vision and Image Processing. CVIP 2024. Communications in Computer and Information Science. , Springer. Cham. (2025).
  19. Grad-CAM: visual explanations from deep networks via gradient-based localization. Selvaraju, R. R., et al. 2017 IEEE International Conference on Computer Vision (ICCV), Venice, Italy, , (2017).
  20. Iftikhar, S., et al. Explainable CNN for brain tumor detection and classification through XAI based key features identification. Brain Inform. 12, 10(2025).
  21. BR35H: brain tumor detection 2020. , Kaggle Dataset. https://www.kaggle.com/ahmedhamada0/brain-tumor-detection (2021).
  22. Zhang, D., et al. Neural networks-based fixed-time control for a robot with uncertainties and input dead zone. Neurocomputing. 390, 139-147 (2020).
  23. Tabassum, M., et al. Radiomics and machine learning in brain tumors and their habitat: a systematic review. Cancers. 15 (15), 3845(2023).
  24. Gonzalez, R. C., Woods, R. E. Digital Image Processing. , Pearson. Upper Saddle River, NJ. (2008).
  25. Otsu, N. A threshold selection method from gray-level histograms. IEEE Trans Syst Man Cybern. 9 (1), 62-66 (1979).
  26. Haralick, R. M., et al. Image analysis using mathematical morphology. IEEE Trans Pattern Anal Mach Intell. 9 (4), 532-550 (1987).
  27. Esteva, A., et al. Dermatologist-level classification of skin cancer with deep neural networks. Nature. 542, 115-118 (2017).
  28. Tjoa, E., Guan, C. A survey on explainable artificial intelligence (XAI): toward medical XAI. IEEE Trans Neural Netw Learn Syst. 32 (11), 4793-4813 (2021).
  29. Maier-Hein, L., et al. Metrics reloaded: recommendations for image analysis validation. Nat Methods. 21 (2), 195-212 (2024).
  30. Pineau, J., et al. Improving reproducibility in machine learning research. J Mach Learn Res. 22 (164), 1-20 (2021).
  31. Yaqub, M., et al. State-of-the-art CNN optimizer for brain tumor segmentation in magnetic resonance images. Brain Sci. 10 (7), 1-20 (2020).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Brain Tumor ClassificationImage PreprocessingConvolutional Neural NetworksMRI Brain TumorsOptimizer SensitivityCNN PerformanceRMSProp OptimizerStochastic Gradient DescentFive Fold Cross ValidationMedical Image Analysis

Related Articles