Method Article

Радиомический выбор признаков с использованием градиентной потери глубокой нейронной сети для обнаружения стадий рака лёгких

DOI:

10.3791/70181

April 30th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Здесь представлен метод выбора признаков на основе глубокого обучения, который использует градиенты функции потери нейронных сетей относительно входных признаков для выявления и приоритизации тех, которые наиболее сильно влияют на выявление стадий рака лёгких.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Радиомика позволяет извлекать количественные биомаркеры визуализации из медицинских изображений и стала важным инструментом для компьютерной диагностики рака. Однако наборы данных радиомикрофоны обычно имеют большие размерности и ограниченные размеры выборки, что делает выбор признаков критически важным этапом для построения надёжных предиктивных моделей. В данном исследовании предлагается схема рекурсивного устранения признаков с потерей градиента (GL-RFE), интегрирующая анализ градиентной чувствительности из глубокой нейронной сети для выявления наиболее влиятельных радиомических признаков для выявления стадий рака легких. Всего было извлечено 106 радиомических признаков с помощью компьютерной томографии грудной клетки (КТ) с использованием расширения PyRadiomics платформы 3D Slicer. Предлагаемый метод оценивает важность признаков путём вычисления градиентов потерь сети относительно входных признаков и рекурсивно исключает признаки с минимальным вкладом. Полученные топ-15 радиомических признаков используются для обучения классификатора глубоких нейронных сетей для различения рака лёгких на ранних и поздних стадиях. Предлагаемая структура обеспечивает высокую классификационную эффективность: точность 90,22%, точность 90,10%, воспоминание 90,24% и результат F1 90,16% на тестовом наборе данных. Визуализационный анализ, включая тепловые карты корреляции и графики распределения, дополнительно подтверждают снижение избыточности признаков и улучшенную сепарабельность по классам. По сравнению с традиционными методами выбора признаков, GL-RFE эффективно фиксирует нелинейные взаимодействия признаков и улучшает обобщение моделей. Представленный протокол предоставляет воспроизводимую и интерпретируемую методологию для обнаружения стадий рака на основе радиомики. Он особенно подходит для биомедицинских наборов данных с крупными размерами, с малыми выборками, и имеет потенциал применения в других областях, таких как геномика и мультимодальный клинический анализ.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Рак лёгких остаётся одним из основных видов рака, вызывая серьёзные проблемы со здоровьем и часто приводящий ксмерти 1. Радиомика позволяет количественно характеризуть медицинские изображения, выделяя большие наборы признаков, описывающих форму, текстуру и интенсивностьопухоли 2,3. Эти признаки, также называемые ручной работы, служат потенциальными биомаркерами для диагностики, прогноза и ответа на лечение рака лёгких. Однако наборы данных радиомики обычно имеют большое количество размеров и ограничены выборками, что приводит к избыточным и шумным функциям, ухудшающим производительностьмодели 4,5,6,7. Поэтому эффективный и объяснимый выбор признаков крайне важен для разработки надёжных прогностических моделей на основе радиомики.

Традиционные методы выбора признаков, такие как методы фильтрации (например, корреляционный анализ, анализ дисперсии [ANOVA], взаимная информация) и методы обёртки (например, последовательный отбор признаков, рекурсивное устранение признаков), широко используются для моделей обнаружения рака на основерадиомики 4,8,9. Однако они часто не охватывают нелинейные взаимодействия признаков и глубокие контекстуальные зависимости, присущие даннымрадиомики 9,10,11. Методы обучения по ансамблевым признакам были изучены для классификации медицинских изображений, но достигли умеренной точности, что можно было бы дополнительноулучшить 12.

Методы глубокого обучения, особенно глубокие нейронные сети (DNN), продемонстрировали превосходную способность моделировать нелинейные и иерархические связи между признаками и результатами, что делает их идеальными для отбора признаков и предоставления точных моделей обнаружения рака13,14. В этом контексте рассматривается потенциал использования сверточной нейронной сети, мультимодальных техник искусственного интеллекта и VCG-16, предварительно обученной модели для диагностики рака 1,15,16. Была предложена, обучена и протестирована гибридная модель глубокого обучения17, включающая предварительно обученную модель VGG-19 и сети долгосрочной краткосрочной памяти (LSTM), на большом количестве изображений, достигнув точности более 99%.

Помимо выявления рака, проводились исследования по стадированию рака. Хьюго и др.18 разработали модель нейронной сети с прямой передачей на базе данных НМРЛ из 300 пациентов для классификации рака стадий I, II и III с точностью 74,52% в модельном тестировании. Был представлен радиомический метод инверсиибаеса 3 для выявления стадий рака лёгких с использованием набора данных NLST на выборке размером 200 человек. Предлагаемый метод достиг точности 86%. Обзор литературы показал, что большинство исследований по выявлению рака были сосредоточены исключительно на классификации доброкачественных и злокачественных опухолей, и лишь немногие касались классификации стадий рака с точностью менее 90%, которую можно дополнительно улучшить. В данной исследовательской работе рассматривается вышеупомянутый пробел в исследованиях и предлагается надёжная радиомическая система классификации на основе признаков для точного выявления стадий рака лёгких.

В этом исследовании была внедрена структура рекурсивного устранения признаков на основе градиентных потерь (GL-RFE), интегрирующая градиентное обратное распространение от нейронных сетей в процесс RFE. В отличие от традиционных методов RFE, основанных на статических метриках важности признаков, GL-RFE использует градиенты функции потерь по каждому входному признаку для измерения того, насколько сильно каждая из них влияет на прогнозы модели. Путём итеративного удаления признаков с минимальными градиентными изменениями, представленная модель выполняет выбор признаков из 15 лучших диагностических признаков, оптимизированных для обнаружения стадий рака легких по 2 классам (вместе — стадии I и II, а также стадий IIIa и IIIb вместе). Схема рабочих процессов выполненной работы приведена на рисунке 1. Выбранный набор данных по раку лёгких для представленной модели — NSCLCRadiomics 19, содержащий 411 томов формата цифровой визуализации и коммуникаций в медицине (DICOM) с клинической информацией о стадиях рака. Всего 106 3D-радиомикрофонных функций каждого тома DICOM при раке лёгких извлекаются с помощью PyRadiomics20 — расширения открытого программного обеспечения 3D Slicer21. Эти признаки относятся к семи классампризнаков 22, включая форму, метод разницы уровней серого (GLDM), матрицу совместного возникновения серого уровня (GLCM), матрицу первого порядка, матрицу длины серого уровня (GLRLM), матрицу зон размера серого уровня (GLSZM), матрицу разницы серых оттенков по соседству (NGTDM). Данные радиомикрофоны класса меньшинства (стадии I и II) были передискретированы с помощью синтетической техники передискретизации меньшинств (SMOTE)23.

Новизна предлагаемой структуры GL-RFE заключается в интеграции градиентного анализа чувствительности, полученного из обучения нейронных сетей, в процесс рекурсивного устранения признаков. В отличие от традиционных подходов RFE, основанных на статических мерах важности, GL-RFE динамически оценивает релевантность признаков через обратные градиенты функции потерь. Это позволяет выявлять признаки, напрямую влияющие на прогнозы моделей стадии рака, сохраняя при этом интерпретируемость и вычислительные возможности для относительно небольших медицинских наборов данных.

Набор данных, используемый для обучения и тестирования предлагаемой структуры, представляет собой общедоступный набор КТ-изображений 422 пациентов с раком лёгких, известный как NSCLCRadiomics 17. Для каждого пациента набор данных включает объем КТ, набор структур радиотерапии DICOM (RTSTRUCT) и файл сегментации DICOM (SEG). Эти файлы содержат ручные разграничения, проведённые радиационным онкологом, трёхмерного объёма первичного объёма опухоли (GTV-1), а также изображение легких. Набор данных является предварительно обработанным, а размеры изображений составляют 512 x 512 пикселей.

Из-за нелинейного характера ручных радиомических признаков эти особенности нельзя напрямую использовать с моделями глубокого обучения для диагностики рака, и их присущие шаблоны данных должны фиксироваться с помощью технологий ИИ. GL-RFE ранжирует признаки на основе величины градиента потери модели L по каждой входнойпризнаке x i.

Для каждой входной признака xi средний абсолютный градиент рассчитывается следующим образом:

figure-introduction-1(1)

Здесь N — общее количество образцов. Lj — это потеря для j-го образца. xij — это i-я особенность j-го образца. figure-introduction-2 представляет чувствительность потерь относительно входной особенности.

Особенности с низкой градиентной величиной оказывают минимальное влияние на обновления моделей и рекурсивно убираются. Предложенный рабочий процесс по устранению радиомических особенностей с низким градиентом с помощью многослойного перцептрона (MLP) и обучения нейронной сети глубокого обучения (DNN) по 15 ключевым функциям показан на рисунке 1. Затем оценивается производительность метода GL-RFE для выбора признаков.

Упомянутая модель глубокого обучения с методом GL–RFE реализована в ноутбуке Jupyter на Google Colab, который позволяет писать и выполнять код на Python в онлайн-среде. Для компиляции кода необходимо скачать различные пакеты, входящие в протокол и материалы. Используя метод, описанный в разделе «Протокол», определяются 15 основных радиомических признаков для обнаружения рака легких для достижения точного обнаружения рака на тестовых данных.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Извлечение радиомикрофонных признаков с помощью расширения 3D Slicer PyRadiomics

ПРИМЕЧАНИЕ: Следующие шаги предназначены для вычисления радиомических особенностей DICOM-файла лёгких с использованием расширения 3D Slicer PyRadiomics и сохранения в файле в формате csv.

  1. Установите и откройте 3D Slicer (используйте последний стабильный релиз от https://download.slicer.org/.
  2. Установите расширение PyRadiomics и RT Slicer.
    1. В меню перейдите в View > Extensions Manager. Затем ищите Radiomics или SlicerRadiomics и RT Slicer.
    2. Нажмите «Установить », чтобы установить библиотеки RT Slicer и PyRadiomics. Перезапусти 3D-слайсер после установки.
  3. Скачайте NSCLC RADIOMICS.
    1. Скачайте наборы данных КТ лёгких DICOM вместе с файлами SEG и RTSTRUCT 422 пациентов из https://www.cancerimagingarchive.net/collection/nsclc-radiomics/
  4. Загрузить данные КТ лёгких, DICOM.
    1. Перейдите в модуль DICOM. Нажмите Импорт и выберите папку, содержащую срезы DICOM CT и их файл SEG в модальности RTSTRUCT.
    2. После импорта дважды кликните по пациенту/исследованию/сериалу, чтобы загрузить его в сцену слайсера. Громкость 3D CT должна быть видна на панели просмотра, как показано на рисунке 2.
  5. Проверьте геометрию выравнивания.
    1. В модуле Data расширьте как объём CT, так и сегментацию. Убедитесь, что сегментация находится точно над КТ (без смещения).
  6. Откройте модуль радиомики .
    1. Выберите модуль Radiomics из раздела модуля (или ищите его в строке поиска модуля). В объёме входного изображения выберите желаемый объём CT.
    2. В разделе Input Label/Segmentation выберите узел сегментации (ROI).
  7. Настройте параметры настройки извлечения.
    1. Установите Resampled пиксельное расстояние = [1,1,1] (обеспечивает изотропные воксели) и ширину Bin = 25 (стандарт для CT). Установить размер ядра LoG =2.0, 3.0, 4.0, 5.0.
  8. Запустите извлечение признаков.
    1. Нажмите «Применить». Теперь программное обеспечение будет вычислять 3D-функции первого порядка, формы и текстуры (GLCM, GLRLM, GLSZM, GLDM и NGTDM). Отобразите таблицу для проверки вычисленных таблиц, как показано на рисунке 3. Выведите csv-файл со всеми извлечёнными функциями.
    2. Повторите вышеуказанный процесс для всех томов DICOM, загруженных из набора данных NSCLC RADIOMICS, и сохраняйте его в виде одного файла «radiomics.csv».

2. Разработка модели обнаружения рака на основе радиомики с использованием библиотек Python

ПРИМЕЧАНИЕ: Следующие шаги обобщены для разработки, обучения и тестирования модели обнаружения рака с использованием библиотек Python с радиомиозными особенностями наборов данных КТ.

  1. Отформатируйте сохранённый набор данных radiomics в формате csv так, чтобы каждая строка представляла одного пациента/образца, а каждый столбец — особенность. Включите один столбец для меток классов.
  2. Откройте новый ноутбук Jupyter в среде Colab и начните писать код, объявив приведённые ниже определения функций и встроенные функции Python на шаге 2.3.
  3. Дайте команду установить Pytorch, torchvision, scikit-learn, numpy, pandas matplotlib и imbalanced-learn поверх блокнота Jupyter.
  4. Запишите функцию files.upload(), чтобы взять вводный csv-файл пользователя и хранить его в переменных x и y.
  5. Нормализуйте хранящиеся данные с помощью функционального масштабера = StandardScaler() и scaler.fit_transform().
  6. Определим многослойную функцию перцептрона MLP(nn. Module()) с настраиваемыми скрытыми слоями.
  7. Определите обучающую функцию def train_epoch() для вычисления потерь обратного распространения из модели MLP с помощью входных данных.
  8. Для ряда эпох определите функцию def compute_input_gradients() для вычисления средних градиентов потерь по входным признакам и итеративно отбрасывают признак с наименьшим градиентом, то есть с меньшей значимостью, пока не останется 15 признаков.
  9. Разделите данные в соотношении 80% и 20% с помощью функции train_test_split() с выбранными 15 признаками. Примените пятикратную кросс-валидацию с помощью StratifiedKFold(n_splits=5) к обучающим данным для обеспечения надёжности.
  10. Создайте большую нейронную сеть MLP final_model = DNN().
  11. Оценить производительность обученной модели с помощью тестовых данных с помощью следующих функций: def plot_confusion_matrix(), accuracy_score(), precision_score(), recall_score(), f1_score(), heatmap().

3. Запуск Jupyter-ноутбука для построения и тестирования модели

  1. Запустите код на Python в блокноте Jupyter. Поступает запрос на загрузку файла radiomics csv, как показано на рисунке 4.
  2. Загрузите radiomics.csv.
  3. Сохраняйте результаты классификации и сгенерированные графики.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сводка по набору данных
Набор данных по радиомоике НМРЛ включает 422 тома КТ пациентов с раком лёгких стадий I, II и III. В то время как количество наборов данных КТ с ранними стадиями рака (I, II) составляет 134, выборки данных с поздней стадией рака (IIIa, IIIb) — 288. Набор даты демонстрировал значительный дисбаланс классов, с большим количеством случаев на поздней стадии (стадия III) по сравнению с случаями на ранних стадиях (стадии I и II). Для устранения этого д...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Надёжность и надёжность предлагаемой структуры очевидны по высоким значениям показателей оценки, включая точность, воспоминание, точность и результатF-1 24. Все результаты показали более 90% результатов по данным теста, при этом во время обучения MLP применялось пятикратное резюме.

Производительность и достоверность предлагаемой структуры GL-RFE дополнительно подтверждались методами визуализации. Тепловые карты

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конкурирующих финансовых интересов.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Не применимо

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
Программное обеспечение для 3D-слайсеровОфициальный сайт5.xВизуализация медицинских изображений, сегментация и извлечение ROI для анализа радиомики
Пакет небалансированного обученияPyPI0.11+Обработка дисбаланса классов (например, SMOTE)
Matplotlib  ПакетPyPI3.xПостроение обучающих кривых и важность признаков
Пакет NumPyPyPI1.26.xЧисленные операции и обработка матриц признаков
Пакет PandasPyPI2.xПредобработка данных и управление структурированными наборами данных
Пакет PyRadiomicsPyPI3.xИзвлечение радиомических особенностей из КТ-изображений
PyTorch  ПакетPyPI2.xФреймворк глубокого обучения для MLP и градиентных вычислений
Пакет Scikit-learnPyPI1.3.xОценка модели (точность, точность, отзыв, оценка F1)
SciPy  ПакетPyPI1.11+Статистический анализ и валидация
Seaborn  ПакетPyPI0.13.xТепловые карты для анализа корреляции признаков
Torch.nn Module PyPI2.xАрхитектура нейронных сетей (слои, активации)
Модуль Torch.optimPyPI2.xАлгоритмы оптимизации (например, Адам)

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Radiomic Feature SelectionGradient LossDeep Neural NetworkLung Cancer DetectionCancer Stage DetectionRecursive Feature EliminationQuantitative Imaging BiomarkersComputed TomographyFeature ImportanceModel Generalization

Related Articles