$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Рак лёгких остаётся одним из основных видов рака, вызывая серьёзные проблемы со здоровьем и часто приводящий ксмерти 1. Радиомика позволяет количественно характеризуть медицинские изображения, выделяя большие наборы признаков, описывающих форму, текстуру и интенсивностьопухоли 2,3. Эти признаки, также называемые ручной работы, служат потенциальными биомаркерами для диагностики, прогноза и ответа на лечение рака лёгких. Однако наборы данных радиомики обычно имеют большое количество размеров и ограничены выборками, что приводит к избыточным и шумным функциям, ухудшающим производительностьмодели 4,5,6,7. Поэтому эффективный и объяснимый выбор признаков крайне важен для разработки надёжных прогностических моделей на основе радиомики.
Традиционные методы выбора признаков, такие как методы фильтрации (например, корреляционный анализ, анализ дисперсии [ANOVA], взаимная информация) и методы обёртки (например, последовательный отбор признаков, рекурсивное устранение признаков), широко используются для моделей обнаружения рака на основерадиомики 4,8,9. Однако они часто не охватывают нелинейные взаимодействия признаков и глубокие контекстуальные зависимости, присущие даннымрадиомики 9,10,11. Методы обучения по ансамблевым признакам были изучены для классификации медицинских изображений, но достигли умеренной точности, что можно было бы дополнительноулучшить 12.
Методы глубокого обучения, особенно глубокие нейронные сети (DNN), продемонстрировали превосходную способность моделировать нелинейные и иерархические связи между признаками и результатами, что делает их идеальными для отбора признаков и предоставления точных моделей обнаружения рака13,14. В этом контексте рассматривается потенциал использования сверточной нейронной сети, мультимодальных техник искусственного интеллекта и VCG-16, предварительно обученной модели для диагностики рака 1,15,16. Была предложена, обучена и протестирована гибридная модель глубокого обучения17, включающая предварительно обученную модель VGG-19 и сети долгосрочной краткосрочной памяти (LSTM), на большом количестве изображений, достигнув точности более 99%.
Помимо выявления рака, проводились исследования по стадированию рака. Хьюго и др.18 разработали модель нейронной сети с прямой передачей на базе данных НМРЛ из 300 пациентов для классификации рака стадий I, II и III с точностью 74,52% в модельном тестировании. Был представлен радиомический метод инверсиибаеса 3 для выявления стадий рака лёгких с использованием набора данных NLST на выборке размером 200 человек. Предлагаемый метод достиг точности 86%. Обзор литературы показал, что большинство исследований по выявлению рака были сосредоточены исключительно на классификации доброкачественных и злокачественных опухолей, и лишь немногие касались классификации стадий рака с точностью менее 90%, которую можно дополнительно улучшить. В данной исследовательской работе рассматривается вышеупомянутый пробел в исследованиях и предлагается надёжная радиомическая система классификации на основе признаков для точного выявления стадий рака лёгких.
В этом исследовании была внедрена структура рекурсивного устранения признаков на основе градиентных потерь (GL-RFE), интегрирующая градиентное обратное распространение от нейронных сетей в процесс RFE. В отличие от традиционных методов RFE, основанных на статических метриках важности признаков, GL-RFE использует градиенты функции потерь по каждому входному признаку для измерения того, насколько сильно каждая из них влияет на прогнозы модели. Путём итеративного удаления признаков с минимальными градиентными изменениями, представленная модель выполняет выбор признаков из 15 лучших диагностических признаков, оптимизированных для обнаружения стадий рака легких по 2 классам (вместе — стадии I и II, а также стадий IIIa и IIIb вместе). Схема рабочих процессов выполненной работы приведена на рисунке 1. Выбранный набор данных по раку лёгких для представленной модели — NSCLCRadiomics 19, содержащий 411 томов формата цифровой визуализации и коммуникаций в медицине (DICOM) с клинической информацией о стадиях рака. Всего 106 3D-радиомикрофонных функций каждого тома DICOM при раке лёгких извлекаются с помощью PyRadiomics20 — расширения открытого программного обеспечения 3D Slicer21. Эти признаки относятся к семи классампризнаков 22, включая форму, метод разницы уровней серого (GLDM), матрицу совместного возникновения серого уровня (GLCM), матрицу первого порядка, матрицу длины серого уровня (GLRLM), матрицу зон размера серого уровня (GLSZM), матрицу разницы серых оттенков по соседству (NGTDM). Данные радиомикрофоны класса меньшинства (стадии I и II) были передискретированы с помощью синтетической техники передискретизации меньшинств (SMOTE)23.
Новизна предлагаемой структуры GL-RFE заключается в интеграции градиентного анализа чувствительности, полученного из обучения нейронных сетей, в процесс рекурсивного устранения признаков. В отличие от традиционных подходов RFE, основанных на статических мерах важности, GL-RFE динамически оценивает релевантность признаков через обратные градиенты функции потерь. Это позволяет выявлять признаки, напрямую влияющие на прогнозы моделей стадии рака, сохраняя при этом интерпретируемость и вычислительные возможности для относительно небольших медицинских наборов данных.
Набор данных, используемый для обучения и тестирования предлагаемой структуры, представляет собой общедоступный набор КТ-изображений 422 пациентов с раком лёгких, известный как NSCLCRadiomics 17. Для каждого пациента набор данных включает объем КТ, набор структур радиотерапии DICOM (RTSTRUCT) и файл сегментации DICOM (SEG). Эти файлы содержат ручные разграничения, проведённые радиационным онкологом, трёхмерного объёма первичного объёма опухоли (GTV-1), а также изображение легких. Набор данных является предварительно обработанным, а размеры изображений составляют 512 x 512 пикселей.
Из-за нелинейного характера ручных радиомических признаков эти особенности нельзя напрямую использовать с моделями глубокого обучения для диагностики рака, и их присущие шаблоны данных должны фиксироваться с помощью технологий ИИ. GL-RFE ранжирует признаки на основе величины градиента потери модели L по каждой входнойпризнаке x i.
Для каждой входной признака xi средний абсолютный градиент рассчитывается следующим образом:
(1)
Здесь N — общее количество образцов. Lj — это потеря для j-го образца. xij — это i-я особенность j-го образца.
представляет чувствительность потерь относительно входной особенности.
Особенности с низкой градиентной величиной оказывают минимальное влияние на обновления моделей и рекурсивно убираются. Предложенный рабочий процесс по устранению радиомических особенностей с низким градиентом с помощью многослойного перцептрона (MLP) и обучения нейронной сети глубокого обучения (DNN) по 15 ключевым функциям показан на рисунке 1. Затем оценивается производительность метода GL-RFE для выбора признаков.
Упомянутая модель глубокого обучения с методом GL–RFE реализована в ноутбуке Jupyter на Google Colab, который позволяет писать и выполнять код на Python в онлайн-среде. Для компиляции кода необходимо скачать различные пакеты, входящие в протокол и материалы. Используя метод, описанный в разделе «Протокол», определяются 15 основных радиомических признаков для обнаружения рака легких для достижения точного обнаружения рака на тестовых данных.