Дизайн исследования и популяция пациентов
В данном ретроспективном исследовании были проанализированы результаты ультразвукового исследования щитовидной железы, полученные в период с 13 июня 2024 г. по 13 января 2025 г. Протокол исследования был одобрен комитетом по этике больницы Дружбы в Пекине при Столичном медицинском университете (номер одобрения BFHHZS20240300) и проводился в соответствии с этическими принципами, изложенными в Хельсинкской декларации; получение информированного согласия было отменено в связи с ретроспективным дизайном исследования. Набор данных включал 68 узлов щитовидной железы у 63 пациентов (30 доброкачественных и 38 злокачественных), при этом единицей анализа являлся узел. Референтные диагнозы основывались на результатах тонкоигольной аспирационной цитологии (ТИАЦ) под контролем УЗИ. Группа злокачественных образований состояла из 38 узлов, по данным ТИАЦ идентифицированных как папиллярный рак щитовидной железы.
Критерии включения
Пациенты, подходящие для участия в исследовании, должны были соответствовать всем следующим критериям: (1) прохождение стандартного серошкального и допплеровского ультразвукового исследования с последующим проведением КУЗИ с удовлетворительным качеством изображения, позволяющим провести последующий анализ визуализации микрососудистого кровотока; (2) наличие цитопатологического диагноза PTC, подтвержденного тонкоигольной аспирационной биопсией, с сопутствующим положительным или отрицательным результатом теста на мутацию BRAFV600E; либо наличие цитологического результата Bethesda Category III (атипия неопределенного значения) при одновременном положительном результате теста на мутацию BRAFV600E; (3) наличие цитопатологического диагноза доброкачественных пролиферативных узлов, аденоматозных узлов или доброкачественных фолликулярных узлов категории Bethesda Category II без сопутствующего положительного результата теста на мутацию BRAFV600E.
Критерии исключения
Пациенты исключались из исследования при наличии любого из следующих условий: (1) низкое качество изображений при КУС-УЗИ или недостаточный сигнал от микропузырьков, препятствующий надежной оценке микрососудистого кровотока; (2) отсутствие результатов цитологического или патоморфологического исследований; (3) гистопатологический диагноз редкого или специального подтипа рака щитовидной железы (например, анапластических вариантов); (4) цитологические признаки, указывающие на фолликулярное новообразование (IV категория по Bethesda) или любое образование с неопределенным фолликулярным происхождением, независимо от мутационного статуса; (5) тиреоидит Хашимото
Сбор данных УЗИ, КУЗИ и SRUS
Все исследования проводились с использованием указанной системы ультразвукового исследования и линейного датчика. Пациенты находились в положении лежа на спине с разгибанием шеи. Целевой узел локализовали и измерили в B-режиме УЗИ; фиксировали наличие микрокальцинатов, после чего в той же плоскости сканирования, центрированной на образовании, оценивали интранодулярную васкуляризацию с помощью цветного доплеровского картирования.
После установления внутривенного доступа система была переведена в режим CEUS/URM с низким механическим индексом (URM означает визуализацию с помощью микроскопии сверхвысокого разрешения). CEUS проводили путем внутривенного болюсного введения 1.2 mL SonoVue с последующим немедленным промыванием 5ml физиологическим раствором; в момент введения болюса был запущен экранный таймер и начался непрерывный захват киноциклов. Датчик удерживали в фиксированной плоскости с минимальным давлением, а пациента просили не глотать во время фаз накопления и вымывания контраста.
Для количественного КУВУ с целью получения параметров время-интенсивности использовалась область интереса, ограниченная пределами очага. Для СРУЗ рабочий процесс URM локализовал и отслеживал сигналы микропузырьков после контроля движения, а также генерировал показатели соотношения сосудов, сложности, микрососудистой плотности, индекса перфузии и скорости кровотока. На экспортированных репрезентативных изображениях были указаны настройки: VSP 4, RES 2, CTR 3, SM 2, VEN 3 и CPT 10 s; соответствующие настройки для остальных исследований отсутствовали.
25 переменных входных данных модели перечислены в Таблице 1 и сгруппированы по методу получения данных: возраст и пол; микрокальцинаты в B-режиме; внутриузловая васкуляризация при цветовом доплеровском картировании; качественный CEUS; количественный CEUS и 11 показателей микроциркуляции при SRUS.
Отбор признаков
Все 25 количественных признаков были сохранены в моделях машинного обучения. Использовались только числовые признаки; имена пациентов, регистрационные номера и поля с размером очага были исключены. Отбор признаков на основе данных не проводился, и в каждый классификатор вводились одни и те же заранее определенные предикторы.
Стандартизация признаков
Перед перекрестной проверкой не применялись преобразования, импутация или глобальное масштабирование. Стандартизация применялась только к SVM с радиально-базисной функцией через конвейер StandardScaler. Масштабирование проводилось на обучающих узлах каждого фолда, а затем применялось к валидационным узлам этого фолда. Классификаторы на основе деревьев получали данные в исходном числовом масштабе:

где x — исходное значение признака, µ — среднее значение по обучающей выборке, а σ — стандартное отклонение по обучающей выборке. Предварительная обработка по фолдам позволила исключить влияние валидационных наблюдений на параметры масштабирования SVM.
Разбиение данных
Первичная оценка эффективности проводилась с использованием пятикратной перекрестной проверки StratifiedGroupKFold с параметрами shuffle = True и random_state = 42. Идентификатор пациента определял 63 группы, при этом все узлы одного и того же пациента назначались в один и тот же фолд. Ни один пациент не предоставлял узлы одновременно для обучающей и валидационной выборок внутри одного фолда.
Обучение и валидация модели
Протокол обучения
Было оценено пять классификаторов: случайный лес (100 деревьев; random_state = 42), SVM с радиально-базисной функцией (C = 1.0; gamma = scale; probability = True; конвейер StandardScaler; random_state = 42), дерево решений (критерий Gini; неограниченная глубина; random_state = 42), XGBoost (100 итераций; learning_rate = 0.3; max_depth = 6; subsample = 1.0; colsample_bytree = 1.0; random_state = 42) и градиентный бустинг (100 итераций; learning_rate = 0.1; max_depth = 3; random_state = 42). Поиск по сетке, байесовская оптимизация, настройка порога или вложенный отбор моделей не проводились.
Кросс-валидация
В рамках пяти перекрестных выборок, сгруппированных по пациентам, модели обучались на остальных группах пациентов и оценивались на выделенных группах. Для каждой выборки рассчитывались точность (accuracy), чувствительность (sensitivity), специфичность (specificity), прецизионность (precision), F1-мера (F1-score) и ROC-AUC, которые затем суммировались как среднее значение ± SD. Предсказания вне выборки (OOF) были объединены по всем 68 узлам для построения одной кросс-валидированной ROC-кривой и одной матрицы ошибок для каждой модели.
Оценка эффективности
Метрики оценки
Эффективность модели оценивали в каждой группе валидационного фолда по пациентам, а также на основе объединенных OOF-предсказаний, используя следующие метрики:
Точность: Общая доля правильных прогнозов

Чувствительность (полнота): доля истинно злокачественных узлов, которые были определены верно

Специфичность: Доля истинно доброкачественных узлов, которые были определены верно

Точность (положительная прогностическая ценность): доля предсказанных злокачественных случаев, которые действительно оказались злокачественными

F1-мера: Гармоническое среднее точности и полноты

Площадь под кривой рабочих характеристик приемника (ROC-AUC): показатель способности модели дифференцировать доброкачественные и злокачественные узлы при всех порогах классификации
где TP = истинно положительные результаты (правильно идентифицированные злокачественные узлы), TN = истинно отрицательные результаты (правильно идентифицированные доброкачественные узлы), FP = ложноположительные результаты (доброкачественные узлы, ошибочно классифицированные как злокачественные), и FN = ложноотрицательные результаты (злокачественные узлы, ошибочно классифицированные как доброкачественные).
Анализ матрицы ошибок
Матрицы ошибок OOF были сформированы путем объединения прогнозов, сделанных для каждого узла только в том фолде, в котором этот пациент был исключен. Таким образом, для каждого узла был получен прогноз от модели, обученной на узлах других пациентов.
Анализ значимости признаков
Для модели Random Forest показатели важности признаков рассчитывались на основе среднего снижения индекса Gini по всем решающим деревьям. Были определены и ранжированы 15 наиболее значимых признаков, чтобы установить, какие микрососудистые параметры в наибольшей степени повлияли на эффективность классификации.
Поисковый анализ SHAP
Для SVM был проведен сфокусированный OOF SHAP-анализ с использованием эксплейнера на основе перестановок. Для каждого исключенного узла в качестве фонового распределения использовались только соответствующие наблюдения из обучающей выборки (128 антитетических перестановок; случайное число seed = 20260716). Средние абсолютные значения SHAP обобщали величину вклада, а знаковые значения указывали на направление. Данный анализ носил исследовательский характер и не использовался для вывода о причинно-следственной связи, идентификации независимых биомаркеров или определения клинических пороговых значений.
Статистический анализ
Сравнительный анализ
Эффективность модели была обобщена с помощью дескриптивного анализа по пяти валидационным фолдам, сгруппированным по пациентам, а также на основе объединенных прогнозов OOF. Формальное гипотетическое тестирование между моделями или ранжирование на основе P-значений не проводилось, поскольку фолды взаимосвязаны, а когорта невелика.
Для сравнения исходных показателей групп нормальность распределения непрерывных переменных в каждой группе показателей оценивали с помощью критерия Шапиро-Уилка. Критерий Уэлча t тест применялся в случаях, когда данные в обеих группах соответствовали закону нормального распределения; в противном случае использовался двухсторонний U-критерий Манна-Уитни U использовался тест. Категориальные переменные оценивали с помощью критерия хи-квадрат Пирсона, а для разреженных таблиц 2 x 2 применяли точный критерий Фишера. Значения P были двусторонними, эксплораторными и не скорректированными (альфа = 0,05).
Воспроизводимость
Воспроизводимость была обеспечена за счет четкого определения группы пациентов, фиксированного значения генератора случайных чисел (42), фиксированных конфигураций классификатора и предварительной обработки данных по блокам (фолдам). Идентификаторы использовались только для группировки; они не вводились в качестве предикторов и не экспортировались вместе с результатами модели.