$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Пациенты и дизайн исследования
Первый набор данных этого исследования был получен из базы данных Национального опроса по здравоохранению и питанию (NHANES) за период 2017–2018 годов. Этот конкретный временной промежуток был выбран потому, что данные опроса включали измерения транзиентной эластографии печени ультразвука с использованием технологии FibroScan®. NHANES использует стратифицированный, многоступенчатый дизайн вероятностной выборки и служит общенациональным, популяционным опросом, проводимым раз в два года. Он систематически собирает национально репрезентативные данные о здравоохранении о неинституционализированном населении США для оценки питательного и состояния здоровья гражданского населенияСША 1. NHANES — это национально репрезентативное кросс-секционное исследование, проводимое Национальным центром статистики здравоохранения (NCHS). Протокол опроса получил одобрение Совета по этике исследований NCHS, при этом все участники получили задокументированное информированное согласие. Исследование проводилось в соответствии с Декларациями Хельсинки и Стамбула и было одобрено этическим комитетом Первой аффилированной больницы Вэньчжоуского медицинского университета (2016–246, 1 декабря 2016 года), при этом от каждого участника было получено письменное информированное согласие.
Первый набор данных включал 5494 человека из опроса NHANES 2017–2018 годов, прошедших фибро-сканирование. После приведённого ниже исключения в анализ было включено всего 2677 участников, из которых 718 человек с NAFLD и 1959 человек с не-NAFLD. Эти участники затем случайным образом делили на тренировочный набор (n = 1785) и тестовый набор (n = 892). Второй набор данных включал 582 человека из кафедры инфекционных заболеваний Первой аффилированной больницы Вэньчжоуского медицинского университета (2018–2020). После применения тех же критериев исключения было включено всего 200 человек, из которых 159 человек с НАЖБП и 41 человек с не-НАЖБП. Эта когорта использовалась как независимый набор валидации. Дизайн исследования был разработан для построения и валидации модели с использованием многоцентровых данных, что повышало надёжность и обобщаемость результатов. Исходные клинические характеристики групп с НАЖБП и не-НАЖБП были обобщены с помощью пакета таблицы один (Таблица 1). Кроме того, процесс отбора пациентов и общий ход исследования показаны на рисунке 1.
Диагностические критерии и критерии исключения НАЖБП
Диагноз НАЖБП основывался на следующихкритериях: 16: возраст 18 лет и старше, участие в скрининге временной эластографии (FibroScan) с приемом алкоголя ограничен ≤140 г/недель для женщин и ≤ 210 г/недель для мужчин за предыдущие 12 месяцев, значение контролируемого параметра затухания (CAP) ≥ 302 дБ/м, измеренное с помощью системы FibroScan 502 V2 Touch (Echosens, Париж, Франция) с помощью либо среднего (M) или сверхбольшого (XL) зонда, либо с диагнозом, подтверждённым биопсией печени в отделении инфекционных заболеваний Первой аффилированной больницы Вэньчжоускогомедицинского университета 23.
Критерии исключения НАЖБП изложены следующим образом:Высокое потребление алкоголя (среднее ежедневное потребление > 20 г для женщин и > 30 г для мужчин согласно опросу NHANES5), наличие гепатита B или C, ВИЧ-инфекции, аутоиммунного гепатита, первичного билиарного холангита, болезни Вильсона, длительного применения нестероидных противовоспалительных препаратов, блокаторов кальциевых каналов, тамоксифена, амиодарона, кортикостероидов, изониазида или метотрексата, беременности или грудного вскармливания, а также диагноз рака печени или любой другой доброкачественной или злокачественной опухоли.
Сбор данных и выбор переменных
Потенциальные предикторные переменные, включённые в это исследование, перечислены ниже:
Демографические характеристики (то есть возраст и пол); индекс массы тела (ИМТ); Значения CAP участников базы данных NHANES; Общие биохимические тесты [например, альбумин (ALB), глобулин (GLO), общий белок (TP), лактатдегидрогеназа (LDH), азот мочевины в крови (BUN), мочевой кислота (UA), гамма-глутамилтрансфераза (GGT), триглицерид (TG), сывороточная глюкоза (Glu), креатинин в сыворотке (SCr), общий билирубин (TBIL), натрий (Na⁺), хлорид (Cl⁻), калий (K⁺), кальций (Ca), бикарбонат (HCO₃), общий холестерин (TC), аспартатаминотрансферазу (AST) и аланинаминотрансферазу (ALT)]; Стандартные гематологические параметры [например, количество эритроцитов (эритроцитов), лейкоцитов (лейкоцит), количество лейтрофилов (NEUT), эозинофилы (EOS), лимфоцитов (LYM), моноцитов (MON), ширина распределения эритроцитов (RDW) и количество тромбоцитов (PLT)]; История гипертонии и сахарного диабета (СД). Среди участников исследования диагностические критерии диабета и гипертонии были получены из предыдущего исследования на основе машинного обучения с моделью прогнозирования, сосредоточенного наНАЖБП 24.
Отсутствующая обработка данных и выбор признаков
В когортных данных, использованных в этом исследовании, были отсутствующие значения. Исключение всех неполных записей не только уменьшит размер выборки анализа, но и ухудшит качество данных и может повлиять на результаты прогнозов. Поэтому любые данные с отсутствующими значениями свыше 20% были исключены. Для наборов данных с отсутствующими значениями ≤20%) применялись различные методы импутации в зависимости от типа данных: «norm» для непрерывных переменных, «logreg» для бинарных переменных классификации и «polyreg» для многоклассовых переменных. Эти инпутации проводились с использованием пакета «мыши» в R для множественнойимпутации 25. В этом исследовании все непрерывные переменные были дихотомичены на бинарные, при этом оптимальные пороги классификации определялись с помощью анализа операционной характеристики приёмника (ROC). В частности, в качестве оптимального критерия классификации была выбрана точка среза, соответствующая максимальному индексу Юдена на кривой ROC, что позволило оптимизировать эффективность классификации при сохранении соответствующего баланса между чувствительностью и специфичностью. Впоследствии был применён дискриминантный анализ с частичными наименьшими квадратами (PLS-DA) для эффективной кластеризации данных.
Для дальнейшего выбора функций участники случайным образом распределялись по обучающим и тестовым наборам с соотношением 7:3 с использованием пакета «caret». Во-первых, для выбора признаков была использована регрессия оператора наименьшей абсолютной усадки и отбора (LASSO), что позволило выявить 14 ключевых переменных для последующего анализа. Далее применялся ChatGPT-4 для присвоения значения каждой переменной. Для систематической оценки важности признаков при одновременном контроле потенциальных смещений и стохастических вариаций был внедрён стандартизированный протокол оценки. Конкретная задача, предоставленная модели, звучала так: «На основе установленной клинической литературы по неалкогольной жировой болезни печени (НАЖБХ) присвоите оценку важности от 1 (самая низкая) до 10 (самая высокая) для каждой из следующих 14 переменных, выявленных с помощью регрессии LASSO.» Ограничив оценку исключительно переменными, предварительно выбранными регрессией LASSO, риск включения галлюцинируемых или нерелевантных признаков был минимизирован. Чтобы строго предотвратить потенциальную утечку данных и непреднамеренное использование распространённости результатов, языковая модель была полностью ослеплена для эмпирического набора данных. Оценка была связана с синтезом уже существующих медицинских знаний об названиях переменных. Эта процедура усиливает традиционные методы, такие как выбор устойчивости LASSO или обрезка на основе SHAP, обеспечивая устойчивость чисто данных-основанных признаков до окончательной интеграции модели. Кроме того, для снижения дисперсии одного ответа эта процедура была повторена 10 раз независимо от употребления. Средний балл для каждой переменной рассчитывался по этим итерациям, обеспечивая целевую приоритизацию. Переменные затем ранжировались в убывающем порядке на основе их средних баллов. Наконец, выбор был сужен до включения только тех переменных со средним баллом важности выше 5, что привело к 8 ключевым переменным: SCr, UA, GGT, Glu, гипертония, диабет, ТГ и ИМТ.
Разработка моделей прогнозирования на основе AutoML для NAFLD
В этом исследовании был интегрирован комплексный набор классических и продвинутых алгоритмов машинного обучения с использованием H2O AutoML для эффективной диагностики NAFLD. Используя возможности AutoML платформы H2O.ai, были проведены анализы машинного обучения для задач бинарной классификации. Используемые алгоритмы включали экстремальное усиление градиента (XGBoost), машину градиентного бустинга (GBM), обобщённую линейную модель (GLM), чрезвычайно случайные деревья (XRT), глубокое обучение (DL) и стекированный ансамбль. Эти алгоритмы систематически оценивались для определения оптимальной модели диагностики заболевания. Для обеспечения строгой методологической воспроизводимости параметры выполнения H2O AutoML были чётко определены. Автоматический поиск был ограничен максимальным временем выполнения 11 687 секунд и максимумом 302 моделями, используя фиксированный случайный сид 13. Внутренние флаги предобработки включали автоматическую импутацию остаточных недостающих значений с использованием алгоритмов среднего/режима, а также целевую кодировку для категориальных переменных с высокой мощностью. Выбранная оптимальная архитектура (обозначенная как GBM_grid_1_model77) представляла собой машину с градиентным бустингом со следующими специфическими гиперпараметрами: всего 28 деревьев, максимальная глубина дерева 5 и скорость обучения 0,1.
Для повышения устойчивости модели и снижения рисков перепрогонки был реализован фреймворк AutoML, включающий систематические протоколы настройки и валидации гиперпараметров. Процесс начался с автоматизированного изучения 200 различных конфигураций моделей с помощью оптимизации гиперпараметров, с использованием пятикратной кросс-валидации, при которой обучающий набор даты был разбит на пять взаимоисключающих подмножеств. Во время итеративного обучения каждая конфигурация использовала четыре подмножества (80%) для построения модели, при этом один подмножество (20%) резервировала для валидации, при этом эта валидационная роль вращалась последовательно по всем складкам. Для баланса вычислительной эффективности с оптимизацией производительности была реализована динамическая ранняя остановка на основе площади под метрикой кривой ROC (AUC). Этот механизм приостанавливал обучение, когда улучшения AUC опускались ниже порога 0,001 в течение трёх последовательных циклов, применяясь как к уточнению отдельных моделей, так и к общему процессу поиска AutoML. Окончательный выбор модели приоритизировал конфигурации, демонстрирующие максимальное среднее AUC как для обучающих, так и для валидационных наборов, одновременно требуя согласованной производительности между этими наборами и минимальной дисперсии метрик между итерациями кросс-валидации. Этот интегрированный подход обеспечивал оптимальную точность прогнозирования, сохраняя при этом высокую обобщаемость благодаря строгим протоколам валидации и автоматизированным оптимизационным ограничениям.
Оценка производительности модели и интерпретация результатов прогноза
Производительность модели и интерпретация результатов прогнозов были всесторонне оценены с использованием кривых ROC, оценок F1 и анализа SHapley Additive Explanation (SHAP). Производительность модели и интерпретация её результатов прогнозов были всесторонне оценены с использованием кривых ROC, оценок F1 и анализа SHapley Additive Explanation (SHAP). Изначально прогнозы генерировались на тестовом наборе данных с использованием обученной модели, и предсказанные вероятности для положительного класса (то есть класса 1) извлекались (pred_prob). Кривая ROC была построена с использованием пакета pROC, и был рассчитан AUC модели вместе с 95% доверительным интервалом. Оптимальный порог на кривой ROC определялся с использованием статистики J Юдена (J = чувствительность + специфичность − 1) для определения бинарной классификационной метки. Основываясь на этом пороге, полученном из кривой ROC, предсказанные вероятности преобразовывались в бинарные метки предсказания (0 или 1), и впоследствии формировалась матрица путаницы. Балл F1 на тестовом наборе вычислялся с помощью функции матрицы путаницы, и была создана и сохранена визуализация матрицы путаницы. Кроме того, модель была дополнительно валидирована на независимом внешнем валидационном наборе данных, состоящем из 200 случаев (из Первой аффилированной больницы Медицинского университета Вэньчжоу). Значения SHAP анализировались с помощью пакета «shapviz» для выяснения влияния каждой переменной на результаты прогнозирования модели, что дало представление о интерпретации отдельных прогнозов вероятности НАЖБП.
Статистические методы
«Статистический анализ и разработка программного обеспечения проводились с использованием версии R 4.2.3 (R Foundation for Statistical Computing, Вена, Австрия). Непрерывные переменные изначально оценивались на нормальность с помощью теста Шапиро-Уилка или визуального осмотра графиков Q-Q. Обычно распределённые данные представлялись как среднее ± стандартное отклонение (SD), а сравнения между двумя независимыми группами проводились с использованием независимых t-тестов выборок. Для множественных сравнений применялся односторонний ANOVA с пост-хок тестами Тьюки на HSD, когда это было уместно. Ненормально распределенные непрерывные данные суммировались как медиана [межквартильный диапазон (IQR), P25–P75], а сравнения групп проводились с использованием теста Манна-Уитни U для двух независимых групп или теста Крускаля–Уоллиса для нескольких групп, а при необходимости следовал пост-хок тест Данна. Категориальные переменные выражались в частотах и процентах (%), а сравнение пропорций между группами анализировалось с помощью теста хи-квадрата (тест χ2 ) или точного теста Фишера, когда ожидаемое количество клеток было менее 5. Уровень значимости был установлен на уровне α = 0,05 (двусторонняя), а p-значение < 0,05 считалось статистически значимым.