Это исследование было одобрено Институциональным обзорным советом Первой аффилированной больницы Медицинского университета Бэнбу (номер одобрения: 2023YJS162). Письменное информированное согласие было получено от всех участников до сбора образца.
Сбор данных
Данные транскриптома, использованные в этом исследовании, были получены из базы данных Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). Основной обучающий набор данных, GSE150910, был сгенерирован с использованием платформы Illumina NovaSeq 6000 (GPL24676) и включал 103 образца IPF и 103 нормальных образца легких. Для подтверждения результатов были использованы независимые наборы данных GSE24206, GSE110147, GSE93606 и GSE38958. Подробная информация о каждом наборе данных приведена в Таблице 1. Кроме того, из ранее опубликованного исследования14 было отобрано всего 636 GRG.
Дифференциальный анализ экспрессии и функциональная характеристика ДЭГ, связанных с гликозилированием
Дифференциальный анализ экспрессии между образцами тканей легких IPF и нормальными из набора данных GSE150910 был проведён с использованием пакета R DESeq2 (RRID: SCR_015687). Гены с скорректированным P-значением (padj) < 0,05 и |log2FoldChange| > 0,5 считались дифференциально экспрессированными генами (DEG). Связанные с гликозилированием DEGs (GR-DEGs) были выявлены путём пересечения DEG с заранее определённым набором из 636 GRG. Для дальнейшего изучения биологической роли этих генов были проведены анализ обогащения генной онтологии (GO) и анализ путей Киотской энциклопедии генов и геномов (KEGG), чтобы выяснить их функциональные роли и вовлечённость путей. С использованием базы данных STRING (RRID: SCR_005223)15 была создана сеть взаимодействия между белками и белками (PPI) с порогом доверия > 0,7 для выяснения молекулярных взаимодействий и потенциальных регуляторных механизмов GR-DEGs в IPF.
Скрининг ключевых генов и построение диагностической модели
Для скрининга ключевых генов IPF из GR-DEG мы использовали несколько алгоритмов машинного обучения. Изначально регрессия LASSO (RRID: SCR_003418) была оснащена бинарной логистической регрессией (семейство = «биномиальное»), а оптимальный штрафный параметр λ выбирался путём 10-кратной перекрёстной проверки (n-кратно = 10). Окончательными результатами выбора были признаки с ненулевой коэффициентами, соответствующими λ_(min) (0.01700442). Для SVM-RFE использовалась функция RFE из карета пакета R в пакете. Рекурсивное устранение признаков проводилось с помощью 10-кратной перекрестной валидации (метод = «cv», число = 10), постепенно фильтруя признаки от 1 до 126, с точностью для определения оптимального подмножества признаков. В XGBoost целевая функция была установлена как бинарная логистическая регрессия (objective = «бинарный: логистический»), метрика оценки была установлена как log loss (eval_metric = «logloss»), количество итераций (nrounds) — 100, а скорость обучения (eta) — 0.1. Топ-20 генов были отобраны на основе их показателей важности признаков (Gain). Путём пересечения результатов этих методов был выявлен усовершенствованный набор ключевых генов. На основе этого набора генов была построена диагностическая модель XGBoost с использованием обучающего набора данных (GSE150910), а её предиктивная эффективность оценивалась с помощью анализа рабочих характеристик приёмника (ROC) на внешних валидационных наборах данных (GSE110147, GSE24206, GSE93606 и GSE38958). Кроме того, была разработана номограмма для визуализации вклада каждого выбранного гена в вероятность заболевания, а клиническая полезность модели дополнительно оценивалась с помощью калибровочных кривых и анализа кривой принятия решения (DCA).
Исследование биологических путей ключевых генов
Исследовать биологический контекст ключевых генов, выявленных с помощью машинного обучения. Анализ обогащения наборов генов (GSEA)16 был проведён на основе списков генов из базы данных молекулярных сигнатур (MSigDB) (RRID: SCR_016863)17, а пути были отскринированы на NES > 1. Верхние обогатённые пути визуализировались с помощью функции обогащенного графика.
Изучение биологических функций и различий в иммунном ландшафте в подтипах IPF на основе ключевых оценок генов
На основе профилей экспрессии выявленных ключевых генов были рассчитаны и использованы баллы одиночного анализа обогащения наборов генов (SSGSEA) для стратификации пациентов с IPF на группы с высоким и низким баллом на основе медианного результата. Был проведен дифференциальный анализ экспрессии между двумя группами, затем GSEA (RRID: SCR_003199)18 для проведения анализа биологических процессов GO (GOBP) и обогащения путей KEGG на DEGs.
Анализ инфильтрации иммунных клеток и ключевых различий экспрессии генов
После стратификации подгрупп на основе баллов ssGSEA были оценены различия иммунной инфильтрации между группами с высоким и низким баллом. Сначала мы рассчитали относительную численность 22 типов иммунных клеток в образцах с использованием алгоритма CIBERSORT (RRID: SCR_016955)19 в сочетании с матрицей признаков LM22. В частности, для вычислений использовалась функция deconv_tme в R-пакете IOBR (параметры: method = «cibersort», arrays = FALSE, perm = 200), а также были созданы бокс-графики с использованием пакета ggpubr (RRID: SCR_021139) для оценки различий в инфильтрации иммунных клеток между группами с высоким и низким баллом. Кроме того, функция gsva в R-пакете GSVA (с использованием метода ssGSEA) использовалась для расчёта оценок обогащения для 28 типов иммунных клеток. Эти показатели затем нормализовались с помощью масштабирования Min-Max для сопоставления с интервалом [0, 1], что облегчало сравнение между типами клеток. Наконец, были проведены тесты с суммой ранга Уилкоксона для сравнения экспрессии ключевых генов между нормальными образцами и пациентами с IPF в наборах данных GSE150910 и GSE110147, что позволило провести всесторонний анализ различий в инфильтрации иммунных клеток и экспрессии генов между подгруппами IPF.
Валидация ключевых генов у пациентов с IPF с помощью RT-qPCR анализа
Для подтверждения диагностической значимости выявленных генов были выбраны шесть генов с наивысшими баллами важности алгоритма XGBoost для валидации уровня экспрессии у пациентов с IPF и здоровых контрольных групп с помощью количественной ПЦР с обратной транскрипцией (RT-qPCR). Всего было взято 20 образцов крови, включая 9 от пациентов с IPF и 11 от здоровых людей, из Первой аффилированной больницы Медицинского университета Бэнбу. Из образцов крови была извлечена общая РНК, а концентрация РНК измерена с помощью многофункционального считывателя микропластин. Качество РНК оценивалось перед последующим анализом. Геномная ДНК была удалена во время обратной транскрипции, а праймерные последовательности, используемые для RT-qPCR, приведены в таблице 2. Специфичность праймера была подтверждена анализом кривой расплава. GAPDH использовался в качестве внутреннего эталонного гена. Относительные уровни экспрессии генов рассчитывались с помощью метода 2-ΔΔCt . Этот этап валидации обеспечивает предварительное экспериментальное подтверждение дифференциальной экспрессии и потенциальной диагностической значимости выявленных генов в IPF.
Статистический анализ
Данные анализировались в R, и тест Уилкоксона использовался для выявления различий между двумя группами. Анализ обогащения GSEA, GO и KEGG проводился с использованием пакета R clusterProfiler (RRID: SCR_016884). p-значение < 0,05 считалось значимым, если не указано иное.