$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Это исследование было одобрено Институциональным обзорным советом Шэньчжэньской университетской общей больницы (одобрение IRB No KYLL-2026-077-1). Требование письменного информированного согласия было отменено из-за ретроспективного дизайна исследования.
1. Учебный набор
Пациенты с острым ишемическим инсультом (АИС), прошедшие мультипараметрическое МРТ, были ретроспективно идентифицированы из институциональной клинической базы данных. Общий рабочий процесс исследования, включая разбиение наборов данных, разработку моделей визуализации, построение клинической модели и мультимодальное слияние, иллюстрируется на рисунке 1.

Рисунок 1: Рабочий процесс мультимодального фреймворка прогнозирования результатов. (A) Сбор данных. Пациенты с острым ишемическим инсультом (АИС), соответствующие заранее установленным критериям включения, были идентифицированы задним числом. Набор данных был разделён на когорту для обучения и валидации (n = 250), внутреннюю независимую тестовую когорту (n = 50) и внешнюю тестовую когорту (n = 37). Стратифицированная пятикратная кросс-валидация была проведена внутри когорты обучения-валидации. (B) Разработка моделей визуализации. Многопараметрические последовательности МРТ, включая диффузионно-взвешенную визуализацию (DWI), коэффициент видимой диффузии (ADC) и восстановление инверсии с ослабленной жидкостью T2 (T2-FLAIR), были обработаны с использованием гибридной архитектуры сверточной нейронной сети и трансформера зрения (CNN-ViT) для прогнозирования результатов. (C) Разработка клинической модели. Структурированные клинические переменные использовались для обучения моделей машинного обучения с целью прогнозирования 90-дневного функционального результата. (D) Стратегия мультимодального синтеза. Прогнозы, полученные с помощью моделей визуализации и клинической практики, были интегрированы с помощью мета-обучающего с логистической регрессией для получения конечных прогнозов результатов. Пожалуйста, нажмите здесь, чтобы увидеть увеличенную версию этой фигуры.
МРТ-исследования проводились с использованием клинических систем МРТ. Для получения изображений использовалась специальная катушка фазированной решетки. Все последовательности получались в осевой плоскости с помощью согласованного позиционирования срезов по модальности. Диффузионно-взвешенная визуализация (DWI) была получена с помощью однократной последовательности спин-эхо эхо-планарной визуализации с временем повторения (TR) 3 000–5 000 мс и временем эха (TE) 80–90 мс. Диффузионная сенсибилизация применялась с использованием b-значений 0 и 800–1 000 с/мм² как минимум в трёх ортогональных направлениях. Поле зрения варьировалось от 220 до 240 мм, размер матрицы — 128 × 128. Толщина срезов составляла 5–6 мм с промежуточным зазором 1–1,5 мм. Было получено от двух до четырёх средних сигналов.
Карты коэффициента видимой диффузии (ADC) автоматически генерировались из данных DWI на рабочей станции сканера с использованием моноэкспоненциального подгонки на основе полученных b-значений. Значения АЦП рассчитывались по вокселям и экспортировались для количественного анализа. Изображения восстановления инверсии с ослабленной жидкостью T2 (T2-FLAIR) были получены с помощью последовательности восстановления инверсии с TR 8 000–10 000 мс, TE 80–140 мс и временем инверсии 2 200–2 600 мс. Поле зрения варьировалось от 220 до 240 мм, а матрица — 192 × 192 до 256 × 256. Толщина срезов составляла 4–5 мм с промежуточным зазором 1–1,5 мм.
2. Предобработка данных
Клинические данные импортировались из структурированных таблиц, содержащих идентификаторы случаев, результаты mRS, метки разделения наборов данных, а также демографические и клинические переменные. Идентификаторы падежа были стандартизированы для обеспечения согласованности с имиджами файлов. Клинические переменные включали демографические характеристики, тяжесть инсульта, измеренную с помощью шкалы инсульта Национального института здравоохранения (NIHSS), сосудистые факторы риска и сопутствующие состояния, зафиксированные при поступлении.
Первичным результатом было функциональное состояние через 90 дней после начала инсульта, измеренное с использованием модифицированной шкалы Ранкина (mRS). Благоприятный исход определялся как mRS ≤ 2, а отрицательный — как mRS > 2. Набор данных был случайным образом разделён на когорты для обучения-валидации и внутреннего независимого тестирования с использованием стратифицированной выборки на основе распределения mRS для сохранения баланса результатов. Внешняя тестовая когорта обрабатывалась отдельно и не использовалась при разработке модели. В когорте обучения-валидации применялась стратифицированная k-кратная кросс-валидация для поддержания единообразного распределения результатов между сгибами.
Все тома DWI, ADC и T2-FLAIR были предварительно обработаны перед обучением модели для обеспечения пространственной и числовой согласованности между модальностями. Тот же конвейер предварительной обработки применялся к когортам обучения-валидации, внутреннего тестирования и внешнего тестирования без изменений. Изображения были переориентированы на каноническую RAS ориентацию и преобразованы в массивы с плавающей запятой. Пространственное разрешение в плоскости было передискретизировано до 256 × 256 с использованием линейной интерполяции. Размерность сквозной плоскости была стандартизирована до 20 срезов с использованием стратегии центра: объемы с более чем 20 срезами были обрезаны по центру, тогда как объемы с менее чем 20 срезами симметрично имели нулевое покрытие. Итоговый размер объёма составил 256 × 256 × 20.
Нормализация интенсивности проводилась независимо для каждого объёма с помощью нормализации z-score:

где x обозначает интенсивность вокселя, μ — средняя интенсивность объёма, а σ — стандартное отклонение. Если σ = 0, нормализация не применялась для предотвращения численной нестабильности. Обработанные тома сохранялись в формате NIfTI с использованием стандартизированной аффинной матрицы для анализа глубокого обучения в дальнейшем потоке.
3. Разработка клинической модели
Структурированные клинические переменные использовались для разработки моделей машинного обучения для прогнозирования результатов. Кандидат-предикторы включали демографические характеристики, сосудистые факторы риска, этиологию инсульта и исходные клинические показатели тяжести. Непрерывные переменные были вычислены с помощью медианных значений и стандартизированы. Категориальные переменные вводились с использованием наиболее частой категории и кодировались с помощью one-hot кодирования.
Были оценены несколько алгоритмов машинного обучения, включая логистическую регрессию, случайный лес, градиентное бустинг, машину с опорным вектором (SVM), усиление экстремального градиента и модели машин с ускорением светлого градиента. Разработка модели следовала стратифицированной пятикратной структуре кросс-валидации в когорте обучения-валидации для оценки эффективности обобщения. Окончательные прогнозы для внутренних и внешних тестовых когорт были получены путем усреднения прогнозов моделей, обученных на каждом кросс-валидационном фолде. Внешние тестовые образцы не использовались при перекрёстной валидации или выборе модели.
4. Архитектура модели глубокого обучения
Была реализована трёхмерная гибридная архитектура CNN-ViT для прогнозирования результатов из мультимодальных объёмов МРТ. Сеть была разработана для объединения локального извлечения пространственных признаков с глобальным контекстным моделированием в единой структуре. Входные объемы состояли из многоканальных трёхмерных изображений, обработанных сквозь в конец.
Изначально выделение признаков осуществлялось с использованием иерархического трёхмерного сверточного магистрали, состоящего из 4 стадий. Каждый этап включал 2 сверточных слоя с размером ядра 3 × 3 × 3 и заполнением 1 вокселя, после чего следовала пакетная нормализация и активация ректифицированных линейных единиц. Пространственное разрешение постепенно снижалось с помощью трёхмерных слоёв максимального пулирования, применяемых после первых трёх этапов, а глубина канала признаков увеличивалась на каждом уровне для захвата семантических представлений более высокого уровня. Регуляризация дропаута (частота выпадения = 0,1) применялась после финального сверточного этапа для снижения перенагонки. Сверточная магистраль преобразовывала входный объём размеров C × D × H × W в компактное высокоуровневое представление признаков с уменьшенными пространственными размерами.
Полученная карта признаков была преобразована в последовательность токенов путём уравнивания пространственных размеров так, чтобы количество токенов соответствовало:
N = D' x H' x W'
Глобальные контекстные связи между токенами моделировались с помощью слоёв кодировщиков трансформеров, состоящих из сетей с несколькими головами самовнимания и передачи сигнала. Самосознание вычислялось следующим образом:

где Q, K и V обозначают соответственно матрицы запроса, ключа и значения, а d представляет размерность вложения. Нормализация слоёв и дроп-аут применялись внутри каждого слоя энкодера для повышения стабильности обучения. Модуль Transformer состоял из 3 слоёв энкодера с 8 головками внимания и размером вложения 256.
После кодирования трансформаторов извлекалось и нормализовалось представление, соответствующее классификационному токене. Полностью связанный линейный слой обеспечивал один логит-выход для бинарной классификации.
Предлагаемая гибридная архитектура CNN-ViT была намеренно разработана как лёгкая и эффективная по параметрам модель для баланса между репрезентативной способностью и риском перенагона. Модель включала 3,79 миллиона обучаемых параметров (примерно 14,4 МБ в точности fp32), включая 1,38 миллиона в сверточном магистрали и 2,37 миллиона в конвертерном энкодере.
5. Обучение моделей визуализации
Обучение модели визуализации проводилось с использованием стратифицированной пятикратной кросс-валидационной системы для сохранения распределения результатов по сгибам при одновременном повышении устойчивости оценки производительности. Набор данных был разделён на когорту для обучения и валидации и внутреннюю независимую тестовую когорту с использованием стратифицированного выборки на основе распределения результатов. В когорте обучения-валидации применялась стратифицированная пятикратная кросс-валидация. Для каждого фолда модель визуализации обучалась с использованием обучающего подмножества и оценивалась с использованием соответствующего подмножества валидации, тогда как когорта теста была зарезервирована исключительно для окончательной оценки производительности.
Оптимизация модели проводилась с использованием фреймворка глубокого обучения на рабочей станции с GPU и оптимизатором AdamW, скорость обучения 3 × 10⁻5 и снижение веса 3 × 10⁻4. Обучение проводилось с использованием партии 8 человек для до 200 эпох. В качестве функции потерь использовалась бинарная кросс-энтропия с логитами.
Для устранения дисбаланса классов для каждого фолда был вычислен коэффициент веса положительного класса на основе отношения отрицательных и положительных выборок и включался в функцию потерь. Для улучшения численной устойчивости при оптимизации применялось градиентное обрезывание норм с максимальной нормой 0,5. Было реализовано автоматическое обучение смешанной точности для повышения вычислительной эффективности.
Ранняя остановка применялась, когда производительность валидации не улучшалась как минимум на 1 × 10⁻4 за 30 последовательных эпох. Лучшая контрольная точка модели из каждого сгибания сохранялась. После завершения всех сгибов прогнозы для внутренних и внешних тестовых когорт были получены с использованием каждой специфической модели для складок, а итоговые вероятности получались путем усреднения прогнозов по пяти моделям для получения ансамблевых результатов.
6. Модель мультимодального синтеза
Была внедрена стратегия стекированного слияния для интеграции прогнозов, полученных на основе визуализации, со структурированной клинической информацией. Модель глубокого обучения и модель клинического прогнозирования служили базовыми обучающими, а их предсказанные вероятности использовались как входные характеристики для мета-обучающегося с логистической регрессией. Дополнительные характеристики взаимодействия, включая продукт и абсолютную разницу предсказанных вероятностей, были включены для получения дополнительной информации между визуализацией и клиническими прогнозами.
Чтобы предотвратить утечку информации, мета-обучающийся проходил обучение с использованием внекратно предсказанных вероятностей, полученных из когорты обучения-валидации. Перекрёстно валидированные внеотвержённые вероятности из моделей визуализации и клинических моделей были объединены идентификатором пациента для создания мета-учебного набора данных. Для внутренней и внешней когорты теста соответствующие вероятности тестового набора из моделей визуализации и клинических моделей использовались в качестве входных данных обученному мета-обучающемуся для генерации объединённых вероятностей. Обученный мета-ученик применялся к обеим тестовым когортам без перенастройки.
7. Абляционное исследование
Были проведены абляционные эксперименты для оценки вклада отдельных последовательностей МРТ и компонента Vision Transformer с использованием идентичных обучающих и оценочных условий в качестве основной модели. Абляции последовательностей включали модели с одной последовательностью, модели с оставшей одну последовательность и полную мультипараметрическую модель. Для оценки вклада модуля Vision Transformer предложенная гибридная архитектура была дополнительно сравнивана с базовой линией только CNN, при которой энкодер Transformer был снят с сохранением той же сверточной основы.
8. Статистический анализ
Производительность модели оценивалась отдельно во внутренней независимой когорте тестирования и внешней когорте с использованием площади под кривой операционной характеристики приёмника (AUC) в качестве основного показателя различения. Кривые операционной характеристики приёмника (ROC) были построены на основе предсказанных вероятностей, сгенерированных каждой моделью. Дополнительно были рассчитаны чувствительность, специфичность и общая точность для характеристики классификационной эффективности.
Бинарные результаты были получены с использованием порогов, определяемых по индексу Юдена. Чувствительность, специфичность и точность впоследствии были рассчитаны на оптимальном пороге. Все статистические анализы, разработка моделей машинного обучения и обучение моделей глубокого обучения были реализованы с использованием стандартных программ для научных вычислений и машинного обучения.