$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Набор данных включает всего 1 190 срезов КТ из 110 случаев, разделённых на три класса: нормальные (55 случаев), доброкачественные (15 случаев) и злокачественные (40 случаев). Каждый случай состоит из нескольких КТ-срезов (примерно от 80 до 200 срезов на каждый), предлагающих разнообразные осевые виды грудной клетки. КТ-изображения были получены в DICOM с помощью сканера SOMATOM со стандартными параметрами изображения: напряжение трубки = 120 кВ, толщина среза = 1 мм, ширина окна = 350–1 200 единиц Хаунсфилда (HU), значения центра окна = 50–600 HU, во время полной задержки дыхания.
Все изображения были полностью деидентифицированы перед анализом, чтобы убрать любую личную идентификационную информацию (PII). Набор данных был этически одобрен институциональными контрольными советами участвующих медицинских центров, при этом письменное согласие было отклонено надзорным советом. Среди случаев были люди из разных слоёв общества, такие как государственные служащие, фермеры и жители нескольких иракских провинций (включая Багдад, Васит, Диялу, Салахуддин и Вавилон), с разнообразием по полу, возрасту, уровню образования и статусу жизни.
Поскольку набор данных общедоступен и деактивирован, дополнительное этическое одобрение для его использования в этом исследовании не требовалось. Набор даних соответствует условиям и положениям, указанным его первоначальными участниками и хостинговой платформой.
Методология этого исследования использует многоступенчатый процесс, предназначенный для создания модели прогнозирования с помощью набора данных IQ-OTH/NCCD по раку легких 21. Эта методология создаёт прочную основу для потребительских медицинских устройств, где требуется меньшая задержка, что обеспечивает лучшую точность. Рисунок 2 показывает рабочий механизм предлагаемой модели.

Рисунок 2: Схема рабочего процесса предлагаемой модели, показывающая этапы предварительной обработки, дополнения, классификации Vision Transformer и оценки. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой рисунка.
1. Описание набора данных
Набор данных по раку лёгких IQ-OTH/NCCD был собран осенью 2019 года в Иракском онкологическом учебном госпитале/Национальном центре онкологических заболеваний. Обучающая часть используемого набора данных содержала 1 097 изображений, описание которых приведено в Таблице 2, которая иллюстрирует количество экземпляров различных классов.
| Класс | Количество изображений |
| Нормальный | 416 |
| Доброкачественный | 120 |
| Злокачественный | 561 |
Таблица 2: Примеры примеров нормальных, доброкачественных и злокачественных КТ изображений из набора данных.
Набор данных по раку лёгких IQ-OTH/NCCD был выбран за полное представление нормальных, доброкачественных и злокачественных КТ. Хотя доступны и другие наборы данных, такие как LIDC-IDRI и NSCLC-радиомики, они либо сосредоточены преимущественно на обнаружении узлов, либо не имеют достаточного количества образцов доброкачественных случаев. Набор данных IQ-OTH/NCCD особенно подходит для нашего исследования, так как позволяет Vision Transformer изучать дискриминационные признаки во всех трёх классах, что обеспечивает надёжную классификацию тонких закономерностей на изображениях лёгких.
2. Предобработка данных
Предобработка — важный шаг для повышения производительности модели за счёт согласованности и соответствующих корректировок данных, которые будут обрабатываться через нейронную сеть. Для обеспечения единообразия размера входа для нейронной сети мы масштабировали все изображения до одинаковых размеров 256 x 256 пикселей и нормализовали данные до значения пикселей между 0 и 1 в надежде улучшить обучение и сходимость моделей. Таблица 3 содержит значения техники аугментации.
| Техника | Ценность |
| Нормализация | - |
| Изменение размера | image_size x image_size |
| Случайное вращение | множитель=0,02 |
| RandomZoom | height_factor=0,2, width_factor=0,2 |
Таблица 3: Применение методов аугментации с диапазонами параметров.
Для повышения устойчивости модели против перенагона и повышения её способности к обобщению применяются методы расширения данных, такие как случайные вращения и увеличения, имитирующие различные углы и размеры проявления рака лёгких, как они могут возникать у разных пациентов. В этом исследовании применялись случайные вращения с углами, равномерно отобранные от 0,02 радиана, и случайные преобразования с увеличением с разными коэффициентами высоты и ширины. Изображения после увеличения показаны на рисунке 3.

Рисунок 3: КТ-изображения после увеличения, демонстрирующие вращение, масштабирование и нормализацию для улучшения обобщения моделей. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Эти методы предварительной обработки необходимы, и дополнение использовалось во всех классах для обеспечения надёжности модели.
3. Архитектура модели
Адаптируя новый фреймворк Vision Transformer (ViT) для эффективной обработки сложных данных изображений, архитектура модели предназначена для разделения КТ-сканов на три категории: нормальные, доброкачественные и злокачественные. С помощью этого метода обрабатываются входные изображения размером 256 x 256 пикселей. Для обеспечения согласованности и повышения эффективности обучения модели каждое изображение проходит через несколько операций предварительной обработки, таких как изменение размера и нормализация. Для повышения устойчивости модели к изменениям масштаба и ориентации изображения дизайн начинается с слоя дополнения данных, использующего такие методы, как нормализация, изменение размера, случайные вращения на 0,02 радиана и случайные зумы до 20%. После дополнения модель убирает 16 патчей размером 16 пикселей с каждого снимка, то есть на каждом изображении их 256.
Алгоритм 1 определяет рабочий процесс, предлагаемую модель, а также способы её построения и тонкой настройки, выполняемой относительно модели.
Алгоритм 1: Классификация рака легких с помощью трансформеров зрения
Вход: набор КТ-изображений I из набора данных IQ-OTH/NCCD
Вывод: Результаты классификации C по категориям: нормальные, доброкачественные, злокачественные
Предварительная обработка:
for each image i in I do
i <- Resize(i, 256 x 256) // Normalize and resize images
i <- Normalize(i)
i <- DataAugmentation(i) // Apply random rotations and zooms
end for
Настройка модели:
Initialize Vision Transformer (ViT) Model
Set number of patches P = 16 x 16
Set number of heads H = 6 in multi-head attention
Тренировка:
for epoch = 1 to MaxEpochs do
for each batch b in I do
Patches <- ExtractPatches(b, P)
EncodedPatches <- PatchEncoder(Patches)
AttentionWeights <- MultiHeadAttention(EncodedPatches, H)
ClassLogits <- TransformerEncoder(AttentionWeights)
Loss <- ComputeLoss(ClassLogits, TrueLabels)
UpdateModelWeights(Loss)
end for
if EarlyStoppingCriteriaMet (Val_Loss No Improvement Patience = 5 Epochs) then
break
end if
end for
Ратификация:
Split data into TrainingSet (80%) and ValidationSet (20%)
ComputeValidationMetrics(ValidationSet)
Оценка:
C <- Classify(I)
ComputePerformanceMetrics(C)
Return C
Чтобы сохранить пространственные отношения между участками, эти участки сплющаются (уравнение 1) в 768-мерные векторы (поскольку каждый участок имеет 16 x 16 x 3 = 768), а затем передаются через слой кодирования патча, который проецирует каждый вектор в 64-мерное пространство путём интеграции позиционных вложений. Ядро архитектуры состоит из восьми слоёв трансформаторов, каждый из которых оснащён многоголовным механизмом внимания с шестью головами, позволяя модели одновременно фокусироваться на разных частях изображения и захватывать широкий спектр признаков. Он представлен с помощью уравнений 2, 3 и 4.

Где μ — среднее значение, σ2 — дисперсия входа x, а ε — малая константа, предотвращающая деление на ноль.

Где Q — матрица запроса, K — матрица ключей, V — матрица значений, а dk — размерность векторов ключей.


где WiQ,W iK и WiV — изученные матрицы весов для запросов, ключей и значений соответственно, а WO — матрица выходных весов.
Блок-схема предлагаемой модели показана на рисунке 4.

Рисунок 4: Блок-схема модели Vision Transformer с головкой MLP, подробно описывающая основные уровни обработки и архитектуру. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
Каждый слой трансформатора включает многоуровневое восприятие (MLP), где скрытые единицы сначала масштабируются до 128, а затем обратно до 64, что фактически расширяет и сжимает информационный поток для захвата сложных зависимостей.
Выброса из школы стратегически применяется с частотой 0,1 в механизмах внимания и MLP, чтобы предотвратить перенасыщение. Выход от энкодера трансформатора обрабатывается через MLP-головку, состоящую из двух плотных слоёв с 2 048 и 1 024 единицами соответственно, с использованием гауссовых линейных блоков ошибок (GELU) для активации, что показало хорошие результаты в приложениях глубокого обучения. Это достигается с помощью уравнения 5.

Где W1 иW 2 — это матрицы веса, b1 иb 2 — смещения, а GELU — используемая функция активации.
В слоях трансформаторов использовался дропаут 0.1, чтобы предотвратить перенагон, не теряя важной информации о функциях. Функция активации GELU использовалась для его гладких нелинейных характеристик, которые способствуют градиентному потоку и сходимости в моделях на основе трансформаторов. Выпадание регуляризируется с помощью уравнения 6.
Где p — это частота выброса (например, 0,1 или 0,5), а слой выброса случайным образом устанавливает долю p входных единиц равной нулю во время обучения.
Частота выброса 0,5 в этих слоях дополнительно помогает снизить перенагон. Последний слой модели — это слой логита (уравнение 7), который выводит три классовых логита, соответствующих категориям нормальных, доброкачественных и злокачественных, с использованием разреженной категориальной функции потерь перекрестной энтропии (уравнение 8), подходящей для этой многоклассовой классификации.


Где zi — логитовый вектор класса i, SoftMax(zi)) — предсказанные вероятности, а yi — истинная метка класса.
Модель компилируется с помощью оптимизатора AdamW (уравнения 9, 10, 11, 12 и 13), расширения оптимизатора Адама, которое более эффективно справляется с затуханием веса, с частотой обучения 0,001 и затуханием веса 0,0001, оптимизируя как скорость обучения, так и стабильность модели.





Где mt и vt — первые и вторые моменты градиентов
, а
— скорректированные смещением, η — скорость обучения, а ε — малая константа, предотвращающая деление на ноль.
Модель при обучении использует размер партии 32 для ускорения GPU для более быстрого расчёта и настроена на обучение на 100 эпох.
Однако у обучения есть ранний механизм остановки при потере валидации, чтобы ограничить обучение, когда модель перестает совершенствоваться, чтобы сэкономить вычислительные ресурсы и избежать переобучения 5 последовательных эпох. Производительность модели отслеживается с помощью таких метрик, как разреженная категориальная точность и точность топ-2, которые определяют способность модели к классификации по наиболее вероятным прогнозируемым категориям. Обратные вызовы для обучения модели включают контрольные точки, которые сохраняют самую эффективную модель в соответствии с точностью валидации, чтобы сохранить наиболее успешную версию после завершения процесса обучения. Эта надёжная и хорошо спланированная архитектура использует возможности трансформаторов для обработки медицинских данных визуализации с высокопродвинутым подходом к применению современных методов искусственного интеллекта для основных применений в диагностике здравоохранения.
4. Обучение и валидация
Модель была обучена в среде Kaggle с использованием видеокарты NVIDIA P100, а в процессе обучения использовался мини-пакетный градиентный спуск с размером 32. Оптимизатором, использовавшимся во время обучения, был AdamW с скоростью обучения 0,001 и снижением веса 0,0001; Это был хороший баланс между быстрой конвергенцией и некоторой регулярностью. Модель была обучена для 100 эпох, однако использовалась ранняя остановка при потере валидации с терпением в 5 эпох. Проще говоря, если обучение не улучшало потерю валидации в течение 5 непрерывных эпох, обучение прекращалось из-за перенастройки и вычислительной эффективности. В большинстве случаев эта модель восстанавливала веса эпохи с наименьшими потерями валидации, что указывало на оптимальную работу и не требовало запускать все 100 эпох. Всего на обучение модели уходит около 32 минут.
Во время обучения показатели включали разрежённую категориальную точность и топ-2 точности, отслеживаемые как на обучающем, так и на валидационном наборах. Эти метрики дают представление о том, как часто модель предсказывает правильный класс и находится ли правильный класс в двух верхних прогнозах, что важно в медицине, поскольку неправильные классификации с высокой достоверностью могут иметь значительные последствия. Кривые обучения по потерям и точности визуализированы на рисунке 5.
.
Рисунок 5: Точность и кривые потерь обучения и валидации за 50 эпох, показывающие стабильное обучение и минимальную перенагонку. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этого рисунка.
В настоящем исследовании перекрёстная валидация не проводилась. Такая схема позволила эффективно экспериментировать с архитектурой модели, включая корректировки слоёв трансформаторов и размеров головок MLP, при этом обеспечивая хорошее обобщение модели на невидимых данных валидации.
5. Статистический анализ
Производительность модели Vision Transformer была статистически проанализирована на основе набора данных по раку лёгких IQ-OTH/NCCD. Точность, воспоминание, F1-балл и точность рассчитывались с использованием уравнений 14, 15, 16, 17 соответственно. Эти четыре метода считаются традиционными методами для классификационных задач, поскольку они могут раскрывать информацию о результатах модели при классификации и классификации по классам для каждого класса.




Воспоминание — это мера способности модели выявлять все релевантные экземпляры класса, тогда как точность — это доля положительных идентификаций, которые действительно были верными. Счёт Формулы-1 балансирует между воспоминанием и точностью, когда оба важны.
Для этого задания использовались показатели эффективности коэффициента корреляции Мэттьюса (MCC) по уравнению 18 и уравнение Каппа Коэна 19.


где P0 — наблюдаемое согласие, а Pe — ожидаемое согласие.
MCC — это всеобъемлющая оценка эффективности классификации, учитывающая как истинные положительные, так и отрицательные, ложноположительные и ложноотрицательные результаты. Его значение может быть от -1 до 1, где 1 — идеальное предсказание, 0 — случайное предсказание, а -1 — полное несоответствие между предсказанными и истинными метками. MCC был полезен для сравнения различных характеристик моделей при применении к несбалансированным наборам данных и обеспечивал сбалансированную меру независимо от разных размеров классов.
В рамках дополнительного статистического анализа был вычислен балл F2, с приоритетом воспоминания, как показано в уравнении 20.

Производительность модели также количественно оценивалась с помощью средней квадратической ошибки (MSE), корневой средней квадратической ошибки (RMSE) и средней абсолютной ошибки (MAE) — которые обычно являются измерениями для регрессионных задач, но здесь модифицированы для классификации, чтобы количественно оценить среднюю величину ошибки без учёта направления.
Чтобы определить, будет ли целесообразно интегрировать ViT в потребительские медицинские устройства, мы провели обширные результаты оценки производительности, сосредоточившись исключительно на временной эффективности модели. Мы создали функции для отчёта времени, необходимого для прогнозирования одного или нескольких изображений, поскольку это особенно актуально для приложений в реальном времени. Для каждого изображения перед началом прогнозирования данные предварительно обрабатываются в форме входного изображения, желаемой моделью. Время начала предсказания и время его завершения мы записывали, чтобы получить результаты по времени и задержке. Время и средняя задержка были рассчитаны с помощью уравнений 21 и 22 соответственно.


Где:
- N — количество изображений (образцов).
- Trend — это время, зафиксированное после предсказания i-го изображения.
- Tstart — это время, зафиксированное до предсказания i-го изображения.
Были проведены дополнительные эксперименты для оценки надёжности предложенной нами модели Vision Transformer, систематически добавляя дополнительный шум и размытие в изображения. Гауссовский шум добавлялся к каждому пикселю с коэффициентом шума 0,4, при этом значения пикселей обрезали в диапазоне [0,1]. Коэффициент размытия уменьшался за счёт гауссового размытия с размером ядра 45× 45. Эти эксперименты направлены на всестороннюю оценку модели при смоделированном перцептивном ухудшении качества изображения.