Методическая статья

Радиомический выбор признаков с использованием градиентной потери глубокой нейронной сети для обнаружения стадий рака лёгких

DOI:

10.3791/70181

30 апреля 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь представлен метод выбора признаков на основе глубокого обучения, который использует градиенты функции потери нейронных сетей относительно входных признаков для выявления и приоритизации тех, которые наиболее сильно влияют на выявление стадий рака лёгких.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Радиомика позволяет извлекать количественные биомаркеры визуализации из медицинских изображений и стала важным инструментом для компьютерной диагностики рака. Однако наборы данных радиомикрофоны обычно имеют большие размерности и ограниченные размеры выборки, что делает выбор признаков критически важным этапом для построения надёжных предиктивных моделей. В данном исследовании предлагается схема рекурсивного устранения признаков с потерей градиента (GL-RFE), интегрирующая анализ градиентной чувствительности из глубокой нейронной сети для выявления наиболее влиятельных радиомических признаков для выявления стадий рака легких. Всего было извлечено 106 радиомических признаков с помощью компьютерной томографии грудной клетки (КТ) с использованием расширения PyRadiomics платформы 3D Slicer. Предлагаемый метод оценивает важность признаков путём вычисления градиентов потерь сети относительно входных признаков и рекурсивно исключает признаки с минимальным вкладом. Полученные топ-15 радиомических признаков используются для обучения классификатора глубоких нейронных сетей для различения рака лёгких на ранних и поздних стадиях. Предлагаемая структура обеспечивает высокую классификационную эффективность: точность 90,22%, точность 90,10%, воспоминание 90,24% и результат F1 90,16% на тестовом наборе данных. Визуализационный анализ, включая тепловые карты корреляции и графики распределения, дополнительно подтверждают снижение избыточности признаков и улучшенную сепарабельность по классам. По сравнению с традиционными методами выбора признаков, GL-RFE эффективно фиксирует нелинейные взаимодействия признаков и улучшает обобщение моделей. Представленный протокол предоставляет воспроизводимую и интерпретируемую методологию для обнаружения стадий рака на основе радиомики. Он особенно подходит для биомедицинских наборов данных с крупными размерами, с малыми выборками, и имеет потенциал применения в других областях, таких как геномика и мультимодальный клинический анализ.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Рак лёгких остаётся одним из основных видов рака, вызывая серьёзные проблемы со здоровьем и часто приводящий ксмерти 1. Радиомика позволяет количественно характеризуть медицинские изображения, выделяя большие наборы признаков, описывающих форму, текстуру и интенсивностьопухоли 2,3. Эти признаки, также называемые ручной работы, служат потенциальными биомаркерами для диагностики, прогноза и ответа на лечение рака лёгких. Однако наборы данных радиомики обычно имеют большое количество размеров и ограничены выборками, что приводит к избыточным и шумным функциям, ухудшающим производительностьмодели 4,5,6,7. Поэтому эффективный и объяснимый выбор признаков крайне важен для разработки надёжных прогностических моделей на основе радиомики.

Традиционные методы выбора признаков, такие как методы фильтрации (например, корреляционный анализ, анализ дисперсии [ANOVA], взаимная информация) и методы обёртки (например, последовательный отбор признаков, рекурсивное устранение признаков), широко используются для моделей обнаружения рака на основерадиомики 4,8,9. Однако они часто не охватывают нелинейные взаимодействия признаков и глубокие контекстуальные зависимости, присущие даннымрадиомики 9,10,11. Методы обучения по ансамблевым признакам были изучены для классификации медицинских изображений, но достигли умеренной точности, что можно было бы дополнительноулучшить 12.

Методы глубокого обучения, особенно глубокие нейронные сети (DNN), продемонстрировали превосходную способность моделировать нелинейные и иерархические связи между признаками и результатами, что делает их идеальными для отбора признаков и предоставления точных моделей обнаружения рака13,14. В этом контексте рассматривается потенциал использования сверточной нейронной сети, мультимодальных техник искусственного интеллекта и VCG-16, предварительно обученной модели для диагностики рака 1,15,16. Была предложена, обучена и протестирована гибридная модель глубокого обучения17, включающая предварительно обученную модель VGG-19 и сети долгосрочной краткосрочной памяти (LSTM), на большом количестве изображений, достигнув точности более 99%.

Помимо выявления рака, проводились исследования по стадированию рака. Хьюго и др.18 разработали модель нейронной сети с прямой передачей на базе данных НМРЛ из 300 пациентов для классификации рака стадий I, II и III с точностью 74,52% в модельном тестировании. Был представлен радиомический метод инверсиибаеса 3 для выявления стадий рака лёгких с использованием набора данных NLST на выборке размером 200 человек. Предлагаемый метод достиг точности 86%. Обзор литературы показал, что большинство исследований по выявлению рака были сосредоточены исключительно на классификации доброкачественных и злокачественных опухолей, и лишь немногие касались классификации стадий рака с точностью менее 90%, которую можно дополнительно улучшить. В данной исследовательской работе рассматривается вышеупомянутый пробел в исследованиях и предлагается надёжная радиомическая система классификации на основе признаков для точного выявления стадий рака лёгких.

В этом исследовании была внедрена структура рекурсивного устранения признаков на основе градиентных потерь (GL-RFE), интегрирующая градиентное обратное распространение от нейронных сетей в процесс RFE. В отличие от традиционных методов RFE, основанных на статических метриках важности признаков, GL-RFE использует градиенты функции потерь по каждому входному признаку для измерения того, насколько сильно каждая из них влияет на прогнозы модели. Путём итеративного удаления признаков с минимальными градиентными изменениями, представленная модель выполняет выбор признаков из 15 лучших диагностических признаков, оптимизированных для обнаружения стадий рака легких по 2 классам (вместе — стадии I и II, а также стадий IIIa и IIIb вместе). Схема рабочих процессов выполненной работы приведена на рисунке 1. Выбранный набор данных по раку лёгких для представленной модели — NSCLCRadiomics 19, содержащий 411 томов формата цифровой визуализации и коммуникаций в медицине (DICOM) с клинической информацией о стадиях рака. Всего 106 3D-радиомикрофонных функций каждого тома DICOM при раке лёгких извлекаются с помощью PyRadiomics20 — расширения открытого программного обеспечения 3D Slicer21. Эти признаки относятся к семи классампризнаков 22, включая форму, метод разницы уровней серого (GLDM), матрицу совместного возникновения серого уровня (GLCM), матрицу первого порядка, матрицу длины серого уровня (GLRLM), матрицу зон размера серого уровня (GLSZM), матрицу разницы серых оттенков по соседству (NGTDM). Данные радиомикрофоны класса меньшинства (стадии I и II) были передискретированы с помощью синтетической техники передискретизации меньшинств (SMOTE)23.

Новизна предлагаемой структуры GL-RFE заключается в интеграции градиентного анализа чувствительности, полученного из обучения нейронных сетей, в процесс рекурсивного устранения признаков. В отличие от традиционных подходов RFE, основанных на статических мерах важности, GL-RFE динамически оценивает релевантность признаков через обратные градиенты функции потерь. Это позволяет выявлять признаки, напрямую влияющие на прогнозы моделей стадии рака, сохраняя при этом интерпретируемость и вычислительные возможности для относительно небольших медицинских наборов данных.

Набор данных, используемый для обучения и тестирования предлагаемой структуры, представляет собой общедоступный набор КТ-изображений 422 пациентов с раком лёгких, известный как NSCLCRadiomics 17. Для каждого пациента набор данных включает объем КТ, набор структур радиотерапии DICOM (RTSTRUCT) и файл сегментации DICOM (SEG). Эти файлы содержат ручные разграничения, проведённые радиационным онкологом, трёхмерного объёма первичного объёма опухоли (GTV-1), а также изображение легких. Набор данных является предварительно обработанным, а размеры изображений составляют 512 x 512 пикселей.

Из-за нелинейного характера ручных радиомических признаков эти особенности нельзя напрямую использовать с моделями глубокого обучения для диагностики рака, и их присущие шаблоны данных должны фиксироваться с помощью технологий ИИ. GL-RFE ранжирует признаки на основе величины градиента потери модели L по каждой входнойпризнаке x i.

Для каждой входной признака xi средний абсолютный градиент рассчитывается следующим образом:

figure-introduction-1(1)

Здесь N — общее количество образцов. Lj — это потеря для j-го образца. xij — это i-я особенность j-го образца. figure-introduction-2 представляет чувствительность потерь относительно входной особенности.

Особенности с низкой градиентной величиной оказывают минимальное влияние на обновления моделей и рекурсивно убираются. Предложенный рабочий процесс по устранению радиомических особенностей с низким градиентом с помощью многослойного перцептрона (MLP) и обучения нейронной сети глубокого обучения (DNN) по 15 ключевым функциям показан на рисунке 1. Затем оценивается производительность метода GL-RFE для выбора признаков.

Упомянутая модель глубокого обучения с методом GL–RFE реализована в ноутбуке Jupyter на Google Colab, который позволяет писать и выполнять код на Python в онлайн-среде. Для компиляции кода необходимо скачать различные пакеты, входящие в протокол и материалы. Используя метод, описанный в разделе «Протокол», определяются 15 основных радиомических признаков для обнаружения рака легких для достижения точного обнаружения рака на тестовых данных.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Извлечение радиомикрофонных признаков с помощью расширения 3D Slicer PyRadiomics

ПРИМЕЧАНИЕ: Следующие шаги предназначены для вычисления радиомических особенностей DICOM-файла лёгких с использованием расширения 3D Slicer PyRadiomics и сохранения в файле в формате csv.

  1. Установите и откройте 3D Slicer (используйте последний стабильный релиз от https://download.slicer.org/.
  2. Установите расширение PyRadiomics и RT Slicer.
    1. В меню перейдите в View > Extensions Manager. Затем ищите Radiomics или SlicerRadiomics и RT Slicer.
    2. Нажмите «Установить », чтобы установить библиотеки RT Slicer и PyRadiomics. Перезапусти 3D-слайсер после установки.
  3. Скачайте NSCLC RADIOMICS.
    1. Скачайте наборы данных КТ лёгких DICOM вместе с файлами SEG и RTSTRUCT 422 пациентов из https://www.cancerimagingarchive.net/collection/nsclc-radiomics/
  4. Загрузить данные КТ лёгких, DICOM.
    1. Перейдите в модуль DICOM. Нажмите Импорт и выберите папку, содержащую срезы DICOM CT и их файл SEG в модальности RTSTRUCT.
    2. После импорта дважды кликните по пациенту/исследованию/сериалу, чтобы загрузить его в сцену слайсера. Громкость 3D CT должна быть видна на панели просмотра, как показано на рисунке 2.
  5. Проверьте геометрию выравнивания.
    1. В модуле Data расширьте как объём CT, так и сегментацию. Убедитесь, что сегментация находится точно над КТ (без смещения).
  6. Откройте модуль радиомики .
    1. Выберите модуль Radiomics из раздела модуля (или ищите его в строке поиска модуля). В объёме входного изображения выберите желаемый объём CT.
    2. В разделе Input Label/Segmentation выберите узел сегментации (ROI).
  7. Настройте параметры настройки извлечения.
    1. Установите Resampled пиксельное расстояние = [1,1,1] (обеспечивает изотропные воксели) и ширину Bin = 25 (стандарт для CT). Установить размер ядра LoG =2.0, 3.0, 4.0, 5.0.
  8. Запустите извлечение признаков.
    1. Нажмите «Применить». Теперь программное обеспечение будет вычислять 3D-функции первого порядка, формы и текстуры (GLCM, GLRLM, GLSZM, GLDM и NGTDM). Отобразите таблицу для проверки вычисленных таблиц, как показано на рисунке 3. Выведите csv-файл со всеми извлечёнными функциями.
    2. Повторите вышеуказанный процесс для всех томов DICOM, загруженных из набора данных NSCLC RADIOMICS, и сохраняйте его в виде одного файла «radiomics.csv».

2. Разработка модели обнаружения рака на основе радиомики с использованием библиотек Python

ПРИМЕЧАНИЕ: Следующие шаги обобщены для разработки, обучения и тестирования модели обнаружения рака с использованием библиотек Python с радиомиозными особенностями наборов данных КТ.

  1. Отформатируйте сохранённый набор данных radiomics в формате csv так, чтобы каждая строка представляла одного пациента/образца, а каждый столбец — особенность. Включите один столбец для меток классов.
  2. Откройте новый ноутбук Jupyter в среде Colab и начните писать код, объявив приведённые ниже определения функций и встроенные функции Python на шаге 2.3.
  3. Дайте команду установить Pytorch, torchvision, scikit-learn, numpy, pandas matplotlib и imbalanced-learn поверх блокнота Jupyter.
  4. Запишите функцию files.upload(), чтобы взять вводный csv-файл пользователя и хранить его в переменных x и y.
  5. Нормализуйте хранящиеся данные с помощью функционального масштабера = StandardScaler() и scaler.fit_transform().
  6. Определим многослойную функцию перцептрона MLP(nn. Module()) с настраиваемыми скрытыми слоями.
  7. Определите обучающую функцию def train_epoch() для вычисления потерь обратного распространения из модели MLP с помощью входных данных.
  8. Для ряда эпох определите функцию def compute_input_gradients() для вычисления средних градиентов потерь по входным признакам и итеративно отбрасывают признак с наименьшим градиентом, то есть с меньшей значимостью, пока не останется 15 признаков.
  9. Разделите данные в соотношении 80% и 20% с помощью функции train_test_split() с выбранными 15 признаками. Примените пятикратную кросс-валидацию с помощью StratifiedKFold(n_splits=5) к обучающим данным для обеспечения надёжности.
  10. Создайте большую нейронную сеть MLP final_model = DNN().
  11. Оценить производительность обученной модели с помощью тестовых данных с помощью следующих функций: def plot_confusion_matrix(), accuracy_score(), precision_score(), recall_score(), f1_score(), heatmap().

3. Запуск Jupyter-ноутбука для построения и тестирования модели

  1. Запустите код на Python в блокноте Jupyter. Поступает запрос на загрузку файла radiomics csv, как показано на рисунке 4.
  2. Загрузите radiomics.csv.
  3. Сохраняйте результаты классификации и сгенерированные графики.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сводка по набору данных
Набор данных по радиомоике НМРЛ включает 422 тома КТ пациентов с раком лёгких стадий I, II и III. В то время как количество наборов данных КТ с ранними стадиями рака (I, II) составляет 134, выборки данных с поздней стадией рака (IIIa, IIIb) — 288. Набор даты демонстрировал значительный дисбаланс классов, с большим количеством случаев на поздней стадии (стадия III) по сравнению с случаями на ранних стадиях (стадии I и II). Для устранения этого д...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Надёжность и надёжность предлагаемой структуры очевидны по высоким значениям показателей оценки, включая точность, воспоминание, точность и результатF-1 24. Все результаты показали более 90% результатов по данным теста, при этом во время обучения MLP применялось пятикратное резюме.

Производительность и достоверность предлагаемой структуры GL-RFE дополнительно подтверждались методами визуализации. Тепловые карты

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конкурирующих финансовых интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Не применимо

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Программное обеспечение 3D SlicerОфициальный веб-сайт5.xВизуализация медицинских изображений, сегментация и извлечение областей интереса для радиомического анализа
Пакет Imbalanced-learnPyPI0.11+Обработка несбалансированности классов (напр., SMOTE)
Пакет Matplotlib PyPI3.xПостроение графиков кривых обучения и важности признаков
Пакет NumPyPyPI1.26.xЧисленные операции и управление матрицей признаков
Пакет PandasPyPI2.xПредварительная обработка данных и управление структурированными наборами данных
Пакет PyRadiomicsPyPI3.xИзвлечение радиомических признаков из КТ-изображений
Пакет PyTorch PyPI2.xФреймворк для глубокого обучения с MLP и вычислением градиента
Пакет Scikit-learnPyPI1.3.xОценка моделей (точность, точность, полнота, F1-оценка)
Пакет SciPy PyPI1.11+Статистический анализ и валидация
Пакет Seaborn PyPI0.13.xТепловые карты для анализа корреляции признаков
Модуль Torch.nn PyPI2.xАрхитектура нейронной сети (слои, активации)
Модуль Torch.optimPyPI2.xАлгоритмы оптимизации (напр., Adam)

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Kumar, S., Singh, J., Ravi, V., Singh, P., Al Mazroa, A., et al. Deep learning and MRI biomarkers for precise lung cancer cell detection and diagnosis. Open Bioinforma J. 17, (2024).
  2. Avanzo, M., Stancanello, J., Pirrone, G. Radiomics and deep learning in lung cancer. Strahlenther Onkol. 196, 879-887 (2020).
  3. Shakir, H., Deng, Y., Rasheed, H., et al. Radiomics based likelihood functions for cancer diagnosis. Sci Rep. 9, 9501 (2019).
  4. Shakir, H., Aijaz, B., Khan, T. M., Hussain, M. A deep learning-based cancer survival time classifier for small datasets. Computers in Biology and Medicine. 160, 106896 (2023).
  5. Liu, Z., Wang, S., Dong, D., Wei, J., Fang, C., et al. Applications of radiomics in precision diagnosis and treatment of oncology: opportunities and challenges. Theranostics. 9 (5), 1303-1322 (2019).
  6. Perniciano, A., Loddo, A., Di Ruberto, C., et al. Insights into radiomics: impact of feature selection and classification. Multimed Tools Appl. 84, 31695-31721 (2025).
  7. Shakir, H., Rasheed, H., Khan, T. M. R. Radiomic feature selection for lung cancer classifiers. J Intell Fuzzy Syst. 38 (5), 5847-5855 (2020).
  8. Noroozi, Z., Orooji, A., Erfannia, L. Analyzing the impact of feature selection methods on machine learning algorithms for heart disease prediction. Sci Rep. 13, 22588 (2023).
  9. Dhal, P., Azad, C. A comprehensive survey on feature selection in various fields of machine learning. Appl Intell. 52, 4543-4581 (2022).
  10. Papadimitroulas, P., Brocki, L., Chung, N. C., Marchadour, W., Vermet, F., et al. Artificial intelligence: deep learning in oncological radiomics and challenges of interpretability and data harmonization. Phys Med. 83, 108-121 (2021).
  11. Oliveira, C., et al. Preselection of robust radiomic features does not improve outcome modelling in non-small cell lung cancer based on clinical routine FDG-PET imaging. EJNMMI Res. 11, 79 (2021).
  12. Kolukisa, B., Bakir-Gungor, B. Ensemble feature selection and classification methods for machine learning-based coronary artery disease diagnosis. Comput Stand Interfaces. 84, 103706 (2023).
  13. Chen, Z., et al. Feature selection may improve deep neural networks for the bioinformatics problems. Bioinformatics. 36 (5), 1542-1552 (2020).
  14. Roy, D., Murty, K. S. R., Mohan, C. K. Feature selection using deep neural networks. , (2015).
  15. Kapoor, V., et al. Lung cancer detection using VGG16 and CNN. , 758-762 (2023).
  16. Mishra, N., et al. A comprehensive review of CNN and multimodal AI techniques for skin and lung cancer diagnosis. , 1-4 (2025).
  17. Alsheikhy, A. A., Said, Y., Shawly, T., Alzahrani, A. K., Lahza, H. A CAD system for lung cancer detection using hybrid deep learning techniques. Diagnostics (Basel). 13 (6), 1174 (2023).
  18. Cheung, E. Y. W., et al. Overall staging prediction for non-small cell lung cancer (NSCLC): a local pilot study with artificial neural network approach. Cancers (Basel). 17 (3), 523 (2025).
  19. Hugo, A., et al. Data from NSCLC-Radiomics. The Cancer Imaging Archive. , (2015).
  20. Van Griethuysen, J. J. M., et al. Computational radiomics system to decode the radiographic phenotype. Cancer Res. 77, e104-e107 (2017).
  21. Kikinis, R., Pieper, S. D., Vosburgh, K. G. 3D Slicer: A Platform for Subject-Specific Image Analysis, Visualization, and Clinical Support. Intraoperative Imaging and Image-Guided Therapy. , (2014).
  22. Lei, M., et al. Benchmarking various radiomic toolkit features while applying the image biomarker standardization initiative toward clinical translation of radiomic analysis. J Digit Imaging. 34 (5), 1156-1170 (2021).
  23. Elreedy, D., Atiya, A. F., Kamalov, F. A theoretical distribution analysis of synthetic minority oversampling technique (SMOTE) for imbalanced learning. Mach Learn. 113, 4903-4923 (2024).
  24. Opitz, J. A closer look at classification evaluation metrics and a critical reflection of common evaluation practice. Trans Assoc Comput Linguist. 12, 820-836 (2024).
  25. He, Y., et al. Integrative radiomics clustering analysis to decipher breast cancer heterogeneity and prognostic indicators through multiparametric MRI. NPJ Breast Cancer. 10, 72 (2024).
  26. Gao, J., Cheng, Y., Gao, J. Predicting sport event outcomes using deep learning. PeerJ Comput Sci. 11, e3011 (2025).
  27. Stafoggia, M., et al. Spie charts, target plots, and radar plots for displaying comparative outcomes of health care. J Clin Epidemiol. 64 (7), 770-778 (2011).
  28. Kuzudisli, C., Bakir-Gungor, B., Bulut, N., Qaqish, B., Yousef, M. Review of feature selection approaches based on grouping of features. PeerJ. 11, e15666 (2023).
  29. Tomar, D., Prasad, Y., Thakur, M. K., Biswas, K. K. Feature selection using autoencoders. , 56-60 (2017).
  30. Raptis, S., Ilioudis, C., Theodorou, K. Biomedical physics & engineering express. Biomed Phys Eng Express. 10 (3), 035016 (2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи