Исследовательская статья

Новый подход с использованием AI-vision Transformer для анализа компьютерной томографии с целью выявления рака лёгких

DOI:

10.3791/69302

28 ноября 2025 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Использование трансформеров зрения в этом исследовании позволяет классифицировать рак лёгких по КТ-снимкам, достигая точности 98,18% при 1 190 сканированиях. Модель сохранила удовлетворительный уровень надёжности с точностью от 80 до 88% при шумных и размытых изображениях по сравнению со стандартными моделями сверточной нейронной сети (CNN) в диагностике потребительского здоровья.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Диагностика рака лёгких остаётся сложной из-за тонких различий между доброкачественным и злокачественным заболеванием на основе визуализации. Хотя традиционные сверточные нейронные сети (CNN) были основой медицинского анализа визуализации, они всё ещё имеют ограниченную применимость и устойчивость к разнообразию методов визуализации. Развитие машинного обучения трансформирует традиционные методы диагностики в ориентированных на потребителей медицинских технологий, меняет процессы доступности и персонализированного ухода за пациентами. В этой статье описывается использование Vision Transformers (ViTs) для задачи классификации рака лёгких с помощью КТ, связанных с медицинскими приложениями потребителей. Модель Vision Transformer была обучена на полном наборе данных из 1 190 КТ-изображений и достигла уровня классификации 98,18% с коэффициентом корреляции Мэттьюса 0,9676. Кроме того, производительность модели верифицировалась на смоделированных сценариях реального времени с использованием шумов в реальном времени и размытых наборов данных. Несмотря на сохранение методов валидации с высокой диагностической точностью, по всему набору данных ViT-модель также превзошла традиционный валидированный метод, показав точность от 80 до 88% для различия между шумными и размытыми изображениями даже в таких условиях. Хотя первоначальные результаты дают обнадёживающую информацию о устойчивости ViT при работе с вариацией изображений, всё же следует проявлять осторожный подход к контекстуализации результатов, поскольку оценки проводились в относительно небольшом наборе данных и симуляционных условиях. Для будущих исследований будет полезно использовать более крупные наборы данных, более репрезентативные для реальных клинических состояний, и клинически валидированные наборы данных, чтобы определить, являются ли ViT полезными для клинической идентификации онкологической диагностики и улучшить раннее выявление.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Рак лёгких несёт значительную глобальную нагрузку, затрагивая миллионы жизней ежегодно. Из-за агрессивного характера рака и частого позднего заболевания смертность, связанная с раком лёгких, высока. Раннее выявление важно, поскольку такое вмешательство значительно повышает эффективность лечения и показателивыживаемости 1. Традиционный подход к предварительному скринингу и диагностике остаётся использованием компьютерной томографии (КТ) для более детальной визуализации легочных структур. Однако оценка КТ-изображений сложна и полностью зависит от рецензентов как радиологов. Вариабельность опухолей по таким характеристикам, как размер, форма и плотность, также снижает достоверность любых человеческих наблюдений. Факторы окружающей среды могут ставить под сомнение точность и воспроизводимость принятия решений на основе анализа человека.
Учитывая эти ограничивающие факторы, недавняя литература активно продвигает применение искусственного интеллекта (ИИ) в медицинской визуализации, уделяя больше внимания моделям глубокого обучения (DL). DL, особенно с помощью сверточных нейронных сетей (CNN), нарушило схему наблюдений в медицинской визуализации, изменив анализизображений 2. CNN значительно усовершенствовали диагностические процессы в онкологии, демонстрируя способность выявлять тонкие и сложные признаки в данных визуализации, которые часто неразличимы человеческим глазом. Несмотря на эти достижения, CNN сталкиваются с ограничениями из-за перенастройки небольших наборов данных, сниженной устойчивости при переменных условиях приобретения и зависимостью от локальных рецептивных полей, которые могут упускать глобальные зависимости. Хотя гибридные подходы CNN-Transformer пытаются объединить сверточные априоры с механизмами внимания, они всё же наследуют предвзятости сверточных архитектур. На рисунке 1 показаны несколько экземпляров из набора данных, показывающих разные классы.

figure-introduction-1
Рисунок 1: Визуальная иллюстрация различных классов, показывающая репрезентативные срезы КТ нормальных, доброкачественных и злокачественных лёгких, подчёркивающие их сходства и различия. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой рисунка.

Репрезентативные КТ-изображения показаны для нормальных, доброкачественных и злокачественных случаев. Хотя явная маркировка дискриминационных областей могла бы помочь визуальной интерпретации, ручная аннотация требует опытных радиологов и выходила за рамки данного исследования.

Визуальные трансформеры (ViTs), изначально представленные для классификации естественныхизображений 3, представляют собой перспективную альтернативу. В отличие от CNN или гибридов CNN-Transformer, ViT использует полностью ориентированную на внимание фреймворк, которая фиксирует глобальную контекстную информацию на всём изображении. Это исследование особенно актуально для КТ-визуализации, где диффузный и нерегулярный характер характеристик опухоли может распространяться по всем регионам, а не ограничиваться только локальными рецептивными полями. В то время как гибридные сети CNN-Transformer стабилизируют сверточное индуктивное смещение, Vision Transformers (ViTs) реализуют полностью ориентированную на внимание архитектуру, позволяющую ViT-модели фиксировать дальние зависимости на всех КТ-изображениях — что является преимуществом при оценке диффузных или нерегулярных характеристик опухолей легких.

Появление моделей на основе трансформаторов в области медицинской визуализации произошло недавно, с примерами в мягкой радиологии и гистопатологии,4,5,6, которые проявили заметные преимущества в устойчивости к шуму, размытию и изменчивости между сканерами по сравнению с традиционными системами CNN, что подтверждает обоснование ViT в таком клиническом контексте без чрезмерного акцента на новизне. Учитывая более строгий подход к визуализации рака лёгких по сравнению с потребительскими медицинскими приложениями, это исследование направлено на обоснование практичности в устойчивой области медицины, основанной на доказательствах, при этом занимая место среди не слишком обширной литературы, недавно появившейся по трансформерам и их применению. Предыдущая литература показала, что точность диагностических методов CNN резко снижается из-за вариативностиприобретения 7, где соответствующий ViT показывает лучшие результаты с теми же возмущениями,8 что подтверждает концепцию использования ViT в методах оценки и предлагает возможность повысить воспроизводимость в диагностических процессах. Кроме того, практические вопросы, такие как требуемый размер наборов данных, вычислительная нагрузка и обобщаемость для различных клинических условий, явно учитываются в исследовании с помощью таких методов, как дополнение данных, трансферное обучение и эффективные вариантыViT 9,10, чтобы решить эти потенциальные проблемы в реальном использовании.

Данное исследование основывается на этом достижении, внедряя ViT для стадирования рака легких с использованием данных КТ-изображений и изучая надёжность и обобщимость модели в условиях реальных проблем визуализации. Данные КТ могут включать артефакты, шум и размытие в общей степени, что может скрывать значимые для клиницистов особенности. Изучая устойчивость к этим изменениям в визуализации, данное исследование стремится предложить дополнительную систему стадирования, на которую можно опираться на практике при принятии решений, связанных с уходом и лечением.

Вклад этого исследования включает: i) конкретное выявление рака лёгких с помощью КТ-изображений в наборе данных IQ-OTH/NCCD с использованием и изучения эффективности модели трансформера зрения; ii) оценка эффективности модели в реальных клинических сценариях визуализации, характерных для данных КТ, таких как шум и размытость; iii) сравнение точности, чувствительности и специфичности ViT как альтернативы традиционным моделям CNN.

Структура остальной части этой статьи следующая: Раздел II рассматривает обзор литературы, содержащий предыдущие исследования, связанные с выявлением рака легких с использованием технологий глубокого обучения и переходом от CNN к более продвинутым архитектурам, таким как ViT. Раздел III представляет подход, использованный для этой работы, включающий предварительную обработку данных, информацию об архитектуре модели и детали процедур обучения. Раздел IV представляет результаты, специально рассматривающие предписывающие характеристики ViTs как клинического метода и то, как он может повысить точность и надёжность скринингов рака легких. Раздел V резюмирует результаты и вклад в практику, а также обсуждает будущие направления в контексте глубокого обучения в медицинской среде.

СВЯЗАННЫЕ РАБОТЫ:

Глубокое обучение (DL) произвело революцию в медицинской визуализации за последние десять лет, особенно в диагностике рака лёгких. Изначально дисциплина опиралась на традиционные методы машинного обучения, такие как Support Vector Machines (SVM) и деревья принятия решений, которые были ограничены необходимостью хорошо проработанных и правильно полученных функций. Эти материалы плохо справлялись с тонкостями медицинских картин и часто внедрили субъективность.

Значительное изменение произошло с изобретением сверточных нейронных сетей (CNN), которые позволили автоматически извлекать иерархические характеристики из данных11. CNN широко применяются для установки стадии рака на основе КТ, обнаружения узлов и классификации как доброкачественных или злокачественных. CNN успешны, но у них есть ограничения. К ним относятся различия в настройках сбора изображений и необходимость больших аннотированных наборов данных, которые трудно получить из-за проблем конфиденциальности и трудоёмкого характера медицинской аннотации. Таблица 1 12,13,14,15,16,17,18,19,20 содержит краткое изложение недавних исследований, проведённых в области диагностики рака легких.

Краста, Лавина Джин, Рупал Нима и Элвин Рошан Паис (2024) [20]Представить новую систему глубокого обучения для обнаружения и классификации рака лёгких с использованием КТ-изображений [20].В статье представлен 3D-VNet для сегментации и 3D-ResNet для классификации, демонстрируя улучшения точности и устойчивости по сравнению с предыдущими методами.
Краста, Лавина Джин, Рупал Нима и Элвин Рошан Паис (2024) [20]Представить новую систему глубокого обучения для обнаружения и классификации рака лёгких с использованием КТ-изображений [20].В статье представлен 3D-VNet для сегментации и 3D-ResNet для классификации, демонстрируя улучшения точности и устойчивости по сравнению с предыдущими методами.

Таблица 1: Краткое изложение недавних исследований, описывающих используемые методы и отчётные результаты для контекста.

Используя процессы самовнимания, учитывающие весь контекст изображения одновременно, Vision Transformers (ViT) начинают становиться конкурентной альтернативой CNN в задачах, связанных с изображением. ViT особенно перспективны для медицинской визуализации, поскольку значимость некоторых регионов может зависеть от более отдалённых участков картины из-за их глобальных возможностей обработки. Однако, несмотря на их способность справляться со сложными задачами, такими как распознавание корреляций между множеством признаков заболеваний при сканировании, ViT всё ещё недостаточно изучены в области медицинской визуализации.

ViT не были широко изучены в сфере потребительских медицинских устройств. Данное исследование направлено на преодоление разрыва между высокой точностью и меньшей задержкой для потребительских медицинских устройств, где они могут работать хорошо и давать точные прогнозы в реальном времени.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Набор данных включает всего 1 190 срезов КТ из 110 случаев, разделённых на три класса: нормальные (55 случаев), доброкачественные (15 случаев) и злокачественные (40 случаев). Каждый случай состоит из нескольких КТ-срезов (примерно от 80 до 200 срезов на каждый), предлагающих разнообразные осевые виды грудной клетки. КТ-изображения были получены в DICOM с помощью сканера SOMATOM со стандартными параметрами изображения: напряжение трубки = 120 кВ, толщина среза = 1 мм, ширина окна = 350–1 200 единиц Хаунсфилда (HU), значения центра окна = 50–600 HU, во время полной задержки дыхания.

Все изображения были полностью деидентифицированы перед анализом, чтобы убрать любую личную идентификационную информацию (PII). Набор данных был этически одобрен институциональными контрольными советами участвующих медицинских центров, при этом письменное согласие было отклонено надзорным советом. Среди случаев были люди из разных слоёв общества, такие как государственные служащие, фермеры и жители нескольких иракских провинций (включая Багдад, Васит, Диялу, Салахуддин и Вавилон), с разнообразием по полу, возрасту, уровню образования и статусу жизни.

Поскольку набор данных общедоступен и деактивирован, дополнительное этическое одобрение для его использования в этом исследовании не требовалось. Набор даних соответствует условиям и положениям, указанным его первоначальными участниками и хостинговой платформой.

Методология этого исследования использует многоступенчатый процесс, предназначенный для создания модели прогнозирования с помощью набора данных IQ-OTH/NCCD по раку легких 21. Эта методология создаёт прочную основу для потребительских медицинских устройств, где требуется меньшая задержка, что обеспечивает лучшую точность. Рисунок 2 показывает рабочий механизм предлагаемой модели.

figure-protocol-1
Рисунок 2: Схема рабочего процесса предлагаемой модели, показывающая этапы предварительной обработки, дополнения, классификации Vision Transformer и оценки. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой рисунка.

1. Описание набора данных

Набор данных по раку лёгких IQ-OTH/NCCD был собран осенью 2019 года в Иракском онкологическом учебном госпитале/Национальном центре онкологических заболеваний. Обучающая часть используемого набора данных содержала 1 097 изображений, описание которых приведено в Таблице 2, которая иллюстрирует количество экземпляров различных классов.

КлассКоличество изображений
Нормальный416
Доброкачественный120
Злокачественный561

Таблица 2: Примеры примеров нормальных, доброкачественных и злокачественных КТ изображений из набора данных.

Набор данных по раку лёгких IQ-OTH/NCCD был выбран за полное представление нормальных, доброкачественных и злокачественных КТ. Хотя доступны и другие наборы данных, такие как LIDC-IDRI и NSCLC-радиомики, они либо сосредоточены преимущественно на обнаружении узлов, либо не имеют достаточного количества образцов доброкачественных случаев. Набор данных IQ-OTH/NCCD особенно подходит для нашего исследования, так как позволяет Vision Transformer изучать дискриминационные признаки во всех трёх классах, что обеспечивает надёжную классификацию тонких закономерностей на изображениях лёгких.

2. Предобработка данных

Предобработка — важный шаг для повышения производительности модели за счёт согласованности и соответствующих корректировок данных, которые будут обрабатываться через нейронную сеть. Для обеспечения единообразия размера входа для нейронной сети мы масштабировали все изображения до одинаковых размеров 256 x 256 пикселей и нормализовали данные до значения пикселей между 0 и 1 в надежде улучшить обучение и сходимость моделей. Таблица 3 содержит значения техники аугментации.

ТехникаЦенность
Нормализация-
Изменение размераimage_size x image_size
Случайное вращениемножитель=0,02
RandomZoomheight_factor=0,2, width_factor=0,2

Таблица 3: Применение методов аугментации с диапазонами параметров.

Для повышения устойчивости модели против перенагона и повышения её способности к обобщению применяются методы расширения данных, такие как случайные вращения и увеличения, имитирующие различные углы и размеры проявления рака лёгких, как они могут возникать у разных пациентов. В этом исследовании применялись случайные вращения с углами, равномерно отобранные от 0,02 радиана, и случайные преобразования с увеличением с разными коэффициентами высоты и ширины. Изображения после увеличения показаны на рисунке 3.

figure-protocol-2
Рисунок 3: КТ-изображения после увеличения, демонстрирующие вращение, масштабирование и нормализацию для улучшения обобщения моделей. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Эти методы предварительной обработки необходимы, и дополнение использовалось во всех классах для обеспечения надёжности модели.

3. Архитектура модели

Адаптируя новый фреймворк Vision Transformer (ViT) для эффективной обработки сложных данных изображений, архитектура модели предназначена для разделения КТ-сканов на три категории: нормальные, доброкачественные и злокачественные. С помощью этого метода обрабатываются входные изображения размером 256 x 256 пикселей. Для обеспечения согласованности и повышения эффективности обучения модели каждое изображение проходит через несколько операций предварительной обработки, таких как изменение размера и нормализация. Для повышения устойчивости модели к изменениям масштаба и ориентации изображения дизайн начинается с слоя дополнения данных, использующего такие методы, как нормализация, изменение размера, случайные вращения на 0,02 радиана и случайные зумы до 20%. После дополнения модель убирает 16 патчей размером 16 пикселей с каждого снимка, то есть на каждом изображении их 256.

Алгоритм 1 определяет рабочий процесс, предлагаемую модель, а также способы её построения и тонкой настройки, выполняемой относительно модели.

Алгоритм 1: Классификация рака легких с помощью трансформеров зрения
Вход: набор КТ-изображений I из набора данных IQ-OTH/NCCD
Вывод: Результаты классификации C по категориям: нормальные, доброкачественные, злокачественные
Предварительная обработка:
   for each image i in I do
i <- Resize(i, 256 x 256)         // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i)        // Apply random rotations and zooms
   end for

Настройка модели:
  Initialize Vision Transformer (ViT) Model
  Set number of patches P = 16 x 16
  Set number of heads H = 6 in multi-head attention

Тренировка:
  for epoch = 1 to MaxEpochs do
    for each batch b in I do
      Patches <- ExtractPatches(b, P)
      EncodedPatches <- PatchEncoder(Patches)
      AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
      ClassLogits <- TransformerEncoder(AttentionWeights)
      Loss <- ComputeLoss(ClassLogits, TrueLabels)
      UpdateModelWeights(Loss)
    end for
    if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
      break
    end if
  end for

Ратификация:
  Split data into TrainingSet (80%) and ValidationSet (20%)
  ComputeValidationMetrics(ValidationSet)

Оценка:
  C <- Classify(I)
  ComputePerformanceMetrics(C)
  Return C

Чтобы сохранить пространственные отношения между участками, эти участки сплющаются (уравнение 1) в 768-мерные векторы (поскольку каждый участок имеет 16 x 16 x 3 = 768), а затем передаются через слой кодирования патча, который проецирует каждый вектор в 64-мерное пространство путём интеграции позиционных вложений. Ядро архитектуры состоит из восьми слоёв трансформаторов, каждый из которых оснащён многоголовным механизмом внимания с шестью головами, позволяя модели одновременно фокусироваться на разных частях изображения и захватывать широкий спектр признаков. Он представлен с помощью уравнений 2, 3 и 4.

figure-protocol-3

Где μ — среднее значение, σ2 — дисперсия входа x, а ε — малая константа, предотвращающая деление на ноль.

figure-protocol-4

Где Q — матрица запроса, K — матрица ключей, V — матрица значений, а dk — размерность векторов ключей.

figure-protocol-5
figure-protocol-6

где WiQ,W iK и WiV — изученные матрицы весов для запросов, ключей и значений соответственно, а WO — матрица выходных весов.

Блок-схема предлагаемой модели показана на рисунке 4.

figure-protocol-7
Рисунок 4: Блок-схема модели Vision Transformer с головкой MLP, подробно описывающая основные уровни обработки и архитектуру. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.

Каждый слой трансформатора включает многоуровневое восприятие (MLP), где скрытые единицы сначала масштабируются до 128, а затем обратно до 64, что фактически расширяет и сжимает информационный поток для захвата сложных зависимостей.

Выброса из школы стратегически применяется с частотой 0,1 в механизмах внимания и MLP, чтобы предотвратить перенасыщение. Выход от энкодера трансформатора обрабатывается через MLP-головку, состоящую из двух плотных слоёв с 2 048 и 1 024 единицами соответственно, с использованием гауссовых линейных блоков ошибок (GELU) для активации, что показало хорошие результаты в приложениях глубокого обучения. Это достигается с помощью уравнения 5.

figure-protocol-8

Где W1 иW 2 — это матрицы веса, b1 иb 2 — смещения, а GELU — используемая функция активации.

В слоях трансформаторов использовался дропаут 0.1, чтобы предотвратить перенагон, не теряя важной информации о функциях. Функция активации GELU использовалась для его гладких нелинейных характеристик, которые способствуют градиентному потоку и сходимости в моделях на основе трансформаторов. Выпадание регуляризируется с помощью уравнения 6.figure-protocol-9

Где p — это частота выброса (например, 0,1 или 0,5), а слой выброса случайным образом устанавливает долю p входных единиц равной нулю во время обучения.

Частота выброса 0,5 в этих слоях дополнительно помогает снизить перенагон. Последний слой модели — это слой логита (уравнение 7), который выводит три классовых логита, соответствующих категориям нормальных, доброкачественных и злокачественных, с использованием разреженной категориальной функции потерь перекрестной энтропии (уравнение 8), подходящей для этой многоклассовой классификации.

figure-protocol-10

figure-protocol-11

Где zi — логитовый вектор класса i, SoftMax(zi)) — предсказанные вероятности, а yi — истинная метка класса.

Модель компилируется с помощью оптимизатора AdamW (уравнения 9, 10, 11, 12 и 13), расширения оптимизатора Адама, которое более эффективно справляется с затуханием веса, с частотой обучения 0,001 и затуханием веса 0,0001, оптимизируя как скорость обучения, так и стабильность модели.

figure-protocol-12

figure-protocol-13
figure-protocol-14
figure-protocol-15
figure-protocol-16

Где mt и vt — первые и вторые моменты градиентов figure-protocol-17, а figure-protocol-18 — скорректированные смещением, η — скорость обучения, а ε — малая константа, предотвращающая деление на ноль.

Модель при обучении использует размер партии 32 для ускорения GPU для более быстрого расчёта и настроена на обучение на 100 эпох.

Однако у обучения есть ранний механизм остановки при потере валидации, чтобы ограничить обучение, когда модель перестает совершенствоваться, чтобы сэкономить вычислительные ресурсы и избежать переобучения 5 последовательных эпох. Производительность модели отслеживается с помощью таких метрик, как разреженная категориальная точность и точность топ-2, которые определяют способность модели к классификации по наиболее вероятным прогнозируемым категориям. Обратные вызовы для обучения модели включают контрольные точки, которые сохраняют самую эффективную модель в соответствии с точностью валидации, чтобы сохранить наиболее успешную версию после завершения процесса обучения. Эта надёжная и хорошо спланированная архитектура использует возможности трансформаторов для обработки медицинских данных визуализации с высокопродвинутым подходом к применению современных методов искусственного интеллекта для основных применений в диагностике здравоохранения.

4. Обучение и валидация

Модель была обучена в среде Kaggle с использованием видеокарты NVIDIA P100, а в процессе обучения использовался мини-пакетный градиентный спуск с размером 32. Оптимизатором, использовавшимся во время обучения, был AdamW с скоростью обучения 0,001 и снижением веса 0,0001; Это был хороший баланс между быстрой конвергенцией и некоторой регулярностью. Модель была обучена для 100 эпох, однако использовалась ранняя остановка при потере валидации с терпением в 5 эпох. Проще говоря, если обучение не улучшало потерю валидации в течение 5 непрерывных эпох, обучение прекращалось из-за перенастройки и вычислительной эффективности. В большинстве случаев эта модель восстанавливала веса эпохи с наименьшими потерями валидации, что указывало на оптимальную работу и не требовало запускать все 100 эпох. Всего на обучение модели уходит около 32 минут.

Во время обучения показатели включали разрежённую категориальную точность и топ-2 точности, отслеживаемые как на обучающем, так и на валидационном наборах. Эти метрики дают представление о том, как часто модель предсказывает правильный класс и находится ли правильный класс в двух верхних прогнозах, что важно в медицине, поскольку неправильные классификации с высокой достоверностью могут иметь значительные последствия. Кривые обучения по потерям и точности визуализированы на рисунке 5.

.figure-protocol-19

Рисунок 5: Точность и кривые потерь обучения и валидации за 50 эпох, показывающие стабильное обучение и минимальную перенагонку. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.

В настоящем исследовании перекрёстная валидация не проводилась. Такая схема позволила эффективно экспериментировать с архитектурой модели, включая корректировки слоёв трансформаторов и размеров головок MLP, при этом обеспечивая хорошее обобщение модели на невидимых данных валидации.

5. Статистический анализ

Производительность модели Vision Transformer была статистически проанализирована на основе набора данных по раку лёгких IQ-OTH/NCCD. Точность, воспоминание, F1-балл и точность рассчитывались с использованием уравнений 14, 15, 16, 17 соответственно. Эти четыре метода считаются традиционными методами для классификационных задач, поскольку они могут раскрывать информацию о результатах модели при классификации и классификации по классам для каждого класса.

figure-protocol-20
figure-protocol-21
figure-protocol-22
figure-protocol-23

Воспоминание — это мера способности модели выявлять все релевантные экземпляры класса, тогда как точность — это доля положительных идентификаций, которые действительно были верными. Счёт Формулы-1 балансирует между воспоминанием и точностью, когда оба важны.
Для этого задания использовались показатели эффективности коэффициента корреляции Мэттьюса (MCC) по уравнению 18 и уравнение Каппа Коэна 19.

figure-protocol-24
figure-protocol-25

где P0 — наблюдаемое согласие, а Pe — ожидаемое согласие.

MCC — это всеобъемлющая оценка эффективности классификации, учитывающая как истинные положительные, так и отрицательные, ложноположительные и ложноотрицательные результаты. Его значение может быть от -1 до 1, где 1 — идеальное предсказание, 0 — случайное предсказание, а -1 — полное несоответствие между предсказанными и истинными метками. MCC был полезен для сравнения различных характеристик моделей при применении к несбалансированным наборам данных и обеспечивал сбалансированную меру независимо от разных размеров классов.

В рамках дополнительного статистического анализа был вычислен балл F2, с приоритетом воспоминания, как показано в уравнении 20.

figure-protocol-26

Производительность модели также количественно оценивалась с помощью средней квадратической ошибки (MSE), корневой средней квадратической ошибки (RMSE) и средней абсолютной ошибки (MAE) — которые обычно являются измерениями для регрессионных задач, но здесь модифицированы для классификации, чтобы количественно оценить среднюю величину ошибки без учёта направления.

Чтобы определить, будет ли целесообразно интегрировать ViT в потребительские медицинские устройства, мы провели обширные результаты оценки производительности, сосредоточившись исключительно на временной эффективности модели. Мы создали функции для отчёта времени, необходимого для прогнозирования одного или нескольких изображений, поскольку это особенно актуально для приложений в реальном времени. Для каждого изображения перед началом прогнозирования данные предварительно обрабатываются в форме входного изображения, желаемой моделью. Время начала предсказания и время его завершения мы записывали, чтобы получить результаты по времени и задержке. Время и средняя задержка были рассчитаны с помощью уравнений 21 и 22 соответственно.

figure-protocol-27
figure-protocol-28

Где:

  • N — количество изображений (образцов).
  • Trend — это время, зафиксированное после предсказания i-го изображения.
  • Tstart — это время, зафиксированное до предсказания i-го изображения.

Были проведены дополнительные эксперименты для оценки надёжности предложенной нами модели Vision Transformer, систематически добавляя дополнительный шум и размытие в изображения. Гауссовский шум добавлялся к каждому пикселю с коэффициентом шума 0,4, при этом значения пикселей обрезали в диапазоне [0,1]. Коэффициент размытия уменьшался за счёт гауссового размытия с размером ядра 45× 45. Эти эксперименты направлены на всестороннюю оценку модели при смоделированном перцептивном ухудшении качества изображения.

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Модель Vision Transformer показала исключительные результаты на множественных метриках оценки в наборах данных IQ-OTH/NCCD по раку лёгких, эффективно различая нормальные, доброкачественные и злокачественные КТ-изображения. Общая производительность модели достигла высокой точности 98,18% по всему тестовому набору данных, состоящем из 220 изображений. Эта чрезвычайно высокая точность свидетельствует о том, что модель способна очень эффективно обобщать и, сл...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Он достиг выдающихся результатов в оценке и внедрении модели Vision Transformer на наборе данных по раку лёгких IQ-OTH/NCCD с высокой точностью. Общая точность классификации КТ как нормального, доброкачественного и злокачественного составляет 98,18% по этой модели.

Эта превосходная точность дополнительно подтверждается результатами модели по другим ключевым показателям, таким как 100% точность при выявлении злокачественных случаев, что очень важно для ранней д...

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы заявляют, что у них нет конфликта интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Эта работа была поддержана проектом поддержки исследователей Университета принцессы Нуры бинт Абдулрахман (номер PNURSP2025R432), Университета принцессы Нуры бинт Абдулрахман, Эр-Рияд, Саудовская Аравия.  Авторы выражают благодарность декану аспирантуры и научных исследований Университета Наджран за финансирование этой работы в рамках грантового кода Программы финансирования роста (NU/GP/SERC/13/575-6).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Видеокарта A100 (CUDA)NVIDIACUDA Версия 11.6Ускорение GPU для обучения и оценки моделей.
Процессор AMD EPYC-7502PAMDН/ДПроцессор, используемый для высокопроизводительных вычислений.
Gigabit EthernetIntelН/ДСети для защищённой связи между лицами в CPS.
MatplotlibФонд программного обеспечения PythonВерсия 3.5Библиотека визуализации для построения результатов.
Криптосистема ПайеОткрытый исходный код (реализован через TenSEAL)Н/ДПозволяет аддитивное гомоморфное шифрование градиентов.
PySyftOpenMinedВерсия 0.6.0Дифференциальная приватность и федеративная библиотека обучения.
Python (распределение Anaconda)Anaconda IncВерсия 3.9Включает предустановленные пакеты и инструменты управления окружением, используется для скриптов и разработки фреймворков.
PyTorchMeta AIВерсия 1.12Фреймворк глубокого обучения для обучающих моделей.
RAMCorsair256 гигабайт (GB) Высокая поддержка памяти для интенсивных тренировок.
Scikit-learnФонд программного обеспечения PythonВерсия 1.1Инструменты машинного обучения для оценки производительности.
СиборнФонд программного обеспечения PythonВерсия 0.11Библиотека визуализации статистических данных.
SSD-хранилищеSeagate1 терабайт (TB)Для быстрого хранения и извлечения данных.
TenSEALOpenMinedВерсия 0.3Библиотека гомоморфного шифрования для безопасной агрегации.
TensorFlowGoogleВерсия 2.9Фреймворк глубокого обучения для моделей диффузии.
Ubuntu OSКаноническийВерсия 20.04 LTSОперационная система, используемая для всех экспериментов.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wang, L., et al. Transformer-based deep learning model for the diagnosis of suspected lung cancer in primary care based on electronic health record data. EBioMedicine. 110, 105442(2024).
  2. Kshatri, S. S., Singh, D. Convolutional neural network in medical image analysis: a review. Arch. Comput. Methods Eng. 30 (4), 2793-2810 (2023).
  3. Atabansi, C. C., et al. A survey of transformer applications for histopathological image analysis: new developments and future directions. Biomed. Eng. Online. 22 (1), 1-26 (2023).
  4. Xu, H., et al. Vision transformers for computational histopathology. IEEE Rev. Biomed. Eng. 17, 63-79 (2024).
  5. Xia, K., Wang, J. Recent advances of transformers in medical image analysis: a comprehensive review. MedComm Future Med. 2 (1), e38(2023).
  6. Kim, J. W., et al. Systematic review of hybrid vision transformer architectures for radiological image analysis. J. Imaging Inform. Med. , (2025).
  7. Suresh, S., Mohan, S. ROI-based feature learning for efficient true positive prediction using convolutional neural network for lung cancer diagnosis. Neural Comput. Appl. 32 (20), 15989-16009 (2020).
  8. Fanizzi, A., et al. Comparison between vision transformers and convolutional neural networks to predict non-small lung cancer recurrence. Sci. Rep. 13 (1), 48004(2023).
  9. Alijani, S., et al. Vision transformers in domain adaptation and domain generalization: a study of robustness. Neural Comput. Appl. 36 (29), 17979-18007 (2024).
  10. Rane, N. Transformers for medical image analysis: applications, challenges, and future scope. SSRN Electron. J. , (2023).
  11. Taye, M. M. Theoretical understanding of convolutional neural network: concepts, architectures, applications, future directions. Computation. 11 (3), 52(2023).
  12. Mothkur, R., Veerappa, B. N. Classification of lung cancer using lightweight deep neural networks. Procedia Comput. Sci. 218, 1869-1877 (2023).
  13. Alsadoon, A., et al. DFCV: a framework for evaluation deep learning in early detection and classification of lung cancer. Multimed. Tools Appl. , (2023).
  14. Mohamed, T. I. A., et al. Automatic detection and classification of lung cancer CT scans based on deep learning and ebola optimization search algorithm. PLoS ONE. 18 (8), e0285796(2023).
  15. Sangeetha, S. K. B., et al. An enhanced multimodal fusion deep learning neural network for lung cancer classification. Syst. Soft Comput. 6, 200068(2024).
  16. Raza, R., et al. Lung-EffNet: lung cancer classification using EfficientNet from CT-scan images. Eng. Appl. Artif. Intell. 126, 106902(2023).
  17. Dunn, B., et al. Automated classification of lung cancer subtypes using deep learning and CT-scan based radiomic analysis. Bioengineering. 10 (6), 690(2023).
  18. Wani, N. A., et al. DeepXplainer: an interpretable deep learning based approach for lung cancer detection using explainable artificial intelligence. Comput. Methods Programs Biomed. 243, 107879(2024).
  19. Subash, J., Kalaivani, S. Dual-stage classification for lung cancer detection and staging using hybrid deep learning techniques. Neural Comput. Appl. 36 (14), 8141-8161 (2024).
  20. Yin, P., et al. Imaging of tumor boundary based on multielements and molecular fragments heterogeneity in lung cancer. IEEE Trans. Instrum. Meas. 70, 1-7 (2021).
  21. AL-Huseiny, M. S., Sajit, A. S. Transfer learning with GoogLeNet for detection of lung cancer. Indones. J. Electr. Eng. Comput. Sci. 22 (2), 1078-1086 (2021).
  22. Gupta, A., et al. UDCT: lung cancer detection and classification using U-net and DARTS for medical CT images. Multimed. Tools Appl. 84 (18), 19065-19085 (2024).
  23. Bagheri Tofighi, A., et al. Improving lung cancer detection via MobileNetV2 and stacked-GRU with explainable AI. Int. J. Inf. Technol. 17 (2), 1189-1196 (2024).
  24. Kareem, H. F., et al. Evaluation of SVM performance in the detection of lung cancer in marked CT scan dataset. Indones. J. Electr. Eng. Comput. Sci. 21 (3), 1731-1738 (2021).
  25. Lung tumor detection and recognition using deep convolutional neural networks. Solyman, S., Schwenker, F. Pan-Afr. Conf. Artif. Intell, , 79-91 (2023).
  26. Das, S., et al. Automated prediction of lung cancer using deep learning algorithms. Applied Artificial Intelligence. , 93-120 (2023).
  27. Abe, A. A., et al. A robust deep learning algorithm for lung cancer detection from computed tomography images. SSRN Electron. J. , (2023).
  28. Mathews, A. B., Karani, K. P. Lung cancer segmentation and classification using integration of convolutional neural network & U-net network over CT images: a deep learning approach. Int. J. Manag. Technol. Soc. Sci. , 520-534 (2022).
  29. MAT-VIT: a vision transformer with MAE-based self-supervised auxiliary task for medical image classification. Han, Y., et al. 27th Int. Conf. Comput. Support Coop. Work Des. (CSCWD), , 2046-2052 (2024).
  30. Ko, J., et al. Optimization of vision transformer-based detection of lung diseases from chest X-ray images. BMC Med. Inform. Decis. Mak. 24 (1), 1-15 (2024).
  31. Apostolidis, K. D., Papakostas, G. A. A survey on adversarial deep learning robustness in medical image analysis. Electronics. 10 (17), 2132(2021).
  32. Hybrid design of CNN and vision transformer: a review. Long, H. 7th Int. Conf. Comput. Inf. Sci. Artif. Intell, , 121-127 (2024).
  33. Papanastasiou, G., et al. Is attention all you need in medical image analysis? A review. IEEE J. Biomed. Health Inform. 28 (3), 1398-1411 (2024).
  34. Advancing healthcare in low-resource environments through an optimization and deployment framework for medical multimodal large language models. El Mir, A., et al. 2024 IEEE EMBS Int. Conf. Biomed. Health Inform. (BHI), , 1-8 (2024).

Доступ ограничен. Войдите в систему или начните пробный период, чтобы просмотреть этот контент.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

Похожие статьи