Общедоступные наборы данных Gene Expression Omnibus (GEO), проанализированные в данном исследовании, содержали деидентифицированные транскриптомные данные из ранее опубликованных работ и не требовали дополнительного этического одобрения. Комитет по этике Университета Хуайхуа одобрил независимое валидационное исследование количественной обратной транскрипции с последующей ПЦР (qRT-PCR) на образцах тканей легких человека (номер одобрения 2024(A05112)). До сбора образцов от всех участников или их законных представителей было получено письменное информированное согласие. Процедуры одобрения и получения согласия распространялись на все 20 образцов тканей легких с легочной артериальной гипертензией (ЛАГ) и 20 контрольных образцов тканей легких, включенных в валидацию методом qRT-PCR. Инструменты исследования, использованные в данном протоколе, перечислены в Таблице материалов.
1. Сбор и предварительная обработка общедоступных транскриптомных наборов данных
Наборы данных микрочипов GSE22356, GSE33463 и GSE48149, связанные с легочной гипертензией (ЛГ), были получены из базы данных GEO. Образцы с ЛГ/легочной артериальной гипертензией (ЛАГ) и контрольные образцы были извлечены в соответствии с исходными фенотипическими аннотациями. Матрицы экспрессии и файлы аннотаций платформ были загружены с помощью воспроизводимых R-скриптов и пакета GEOquery.
Аннотация зондов и сопоставление с символами генов проводились единообразно для всех наборов данных. В случаях, когда несколько зондов соответствовали одному гену, рассчитывалось среднее значение экспрессии. Была применена квантильная нормализация, а гены с низким уровнем экспрессии или малой вариабельностью были удалены. Наборы данных были объединены, а пакетные эффекты скорректированы с помощью алгоритма ComBat из пакета sva8. Оценка коррекции проводилась с использованием диаграмм размаха («boxplots») и анализа главных компонентов.
2. Идентификация дифференциально экспрессируемых генов
Для сравнения уровней экспрессии между образцами PH и контрольными образцами в матрице экспрессии с поправкой на батч-эффект использовали пакет limma9. Была построена линейная модель и применены методы эмпирического Байесовского анализа. Дифференциально экспрессируемыми генами считались гены с скорректированным значением P <0,05 и абсолютным значением log2 fold change > 0,585. Результаты были визуализированы с помощью графиков «вулкан» (volcano plots) и тепловых карт.
3. Построение взвешенной сети коэкспрессии генов
С использованием пакета WGCNA10 была построена взвешенная сеть коэкспрессии генов. Для выявления выбросов был проведен кластеринг образцов. Параметр мягкого порога (soft-thresholding power) выбирался на основе индекса соответствия безмасштабной топологии. Модули генов были идентифицированы с помощью алгоритма динамического отсечения дерева. Собственные гены модулей коррелировали с фенотипом PH, и был выбран модуль, связанный с заболеванием, который продемонстрировал наиболее сильную корреляцию. Гены в ключевом модуле были пересечены с дифференциально экспрессируемыми генами для получения консенсусных генов.
4. Анализ функционального обогащения
Категории биологических процессов, клеточных компонентов и молекулярных функций Gene Ontology были проанализированы с помощью clusterProfiler11. Для идентификации сигнальных путей был проведен анализ обогащения путей Kyoto Encyclopedia of Genes and Genomes12. В качестве порогов обогащения использовались значения P < 0.05 и q < 0.2, а обогащенные термины были визуализированы с помощью пузырьковых диаграмм11.
5. Построение сети белок-белковых взаимодействий и идентификация хаб-генов
Согласованный список генов был загружен в базу данных STRING с выбором вида Homo sapiens и порогом достоверности взаимодействия > 0.413. Файл взаимодействий был импортирован в Cytoscape, после чего с помощью плагина CytoHubba была проведена ранжировка генов по степени узла. Гены с высокой степенью связности были определены как хабовые гены.
6. Отбор диагностических genes-признаков с использованием машинного обучения
Были применены три независимых алгоритма отбора признаков. Во-первых, была выполнена логистическая регрессия с использованием метода наименьшего абсолютного сжатия и отбора (LASSO) с помощью пакета glmnet и 10-кратной перекрестной проверки для выявления генов с ненулевыми коэффициентами14. Во-вторых, был применен метод рекурсивного исключения признаков с использованием метода опорных векторов для удаления избыточных признаков и выбора подмножества признаков, обеспечивающего максимальную точность перекрестной проверки15. В-третьих, была построена модель случайного леса, и признаки были ранжированы по среднему снижению индекса примеси Джини16. Пересечение наборов генов, полученных с помощью трех алгоритмов, было использовано для определения окончательного набора основных генов-признаков. Пакет pROC использовался для построения рабочих характеристик приемника (ROC-кривых) и расчета значений площади под кривой (AUC)17.
7. Валидация ключевых генов с использованием независимых наборов данных объемного и одноклеточного секвенирования
GSE117261 использовался в качестве независимой внешней валидационной когорты образцов легочной ткани, содержащей 58 образцов при ЛА и 25 контрольных образцов от доноров, не прошедших отбор18. Этот набор данных не использовался при анализе дифференциальной экспрессии для поиска генов, построении взвешенной сети коэкспрессии генов или отборе признаков с помощью машинного обучения. Матрица экспрессии была нормализована и аннотирована, а анализ дифференциальной экспрессии проводился с использованием limma v3.68.0. По всему аннотированному транскриптому была применена коррекция ложноположительных результатов по методу Бенджамини-Хохберга. ROC-кривые (рабочие характеристики приемника) для отдельных генов рассчитывались с использованием pROC v1.19.0.1, 95% доверительных интервалов по методу Делонга и пороговых значений индекса Юдена. В рамках GSE117261 была построена исследовательская модель логистической регрессии на основе пяти генов, и ее внутренняя эффективность была дополнительно оценена с помощью повторной вложенной перекрестной проверки.
GSE210248 (Таблица 1) использовался в качестве валидационного набора данных одноклеточного секвенирования легочной артерии, содержащего образцы от трех пациентов с ЛАГ и трех здоровых доноров19. Обработка данных осуществлялась с помощью Seurat v5.5.1 для контроля качества, нормализации, снижения размерности, кластеризации и аннотации клеток20. Были идентифицированы основные популяции клеток, включая эндотелиальные клетки, гладкомышечные клетки, фибробласты, моноциты/макрофаги, а также Т-клетки и натуральные киллеры. Анализ межклеточного взаимодействия проводился с использованием CellChat v2.1.2 и базы данных лигандов и рецепторов CellChatDB.human21. Объект CellChat был создан на основе нормализованной матрицы экспрессии Seurat и метаданных о типах клеток. Были определены сверхэкспрессируемые гены и взаимодействия лиганд-рецептор; рассчитаны вероятности взаимодействия; удалены взаимодействия с участием групп клеток, содержащих менее 10 клеток; а также выведены и агрегированы сети взаимодействия на уровне сигнальных путей. Данный набор данных использовался только для внешней механистической валидации и не применялся для обучения модели.
| Элемент | Описание |
| Набор данных | GSE210248 |
| Тип данных | Секвенирование РНК единичных клеток на основе капель 10x Genomics; высокопроизводильное транскриптомное профилирование |
| Образцы человеческого происхождения | Три образца легочной артерии пациентов с ЛАГ и три образца легочной артерии здоровых доноров |
| Источник ткани | Ткань легочной артерии ex vivo, преимущественно отражающая клеточную экологию стенки легочных сосудов и процесс сосудистого ремоделирования |
| Основная аналитическая цель | Локализация по типам клеток, фенотипическое переключение гладкомышечных клеток, взаимодействие между иммунными и структурными клетками и валидация механистической согласованности генов-кандидатов |
Таблица 1: Основная информация о наборе данных для одноклеточной валидации GSE210248. В таблице представлены номер доступа к набору данных, платформа секвенирования, источник ткани, состав образцов и цель анализа при валидации одноклеточного анализа легочной артерии.
8. Валидация экспрессии генов с помощью qRT-PCR
Валидация методом qRT-PCR включала 20 биологически независимых образцов ткани легких при ПАГ от пациентов с ЛГ/ПАГ и 20 биологически независимых контрольных образцов ткани легких. Экстракцию общей РНК проводили с использованием Total RNA Extraction Kit. Концентрацию и чистоту РНК оценивали с помощью спектрофотометра, а целостность РНК — методом электрофореза в агарозном геле. В анализ включали только образцы РНК со значениями A260/280 от 1,8 до 2,1 и отсутствием видимой деградации.
Равные количества РНК были подвергнуты обратной транскрипции в комплементарную ДНК с использованием набора Solarbio Universal RT-PCR Kit (AMV; кат. № RP1200). Количественная ПЦР для CXCL10, JUN, IFIH1, MX1 и TLR7 проводилась с использованием SYBR Green PCR Master Mix на системе ПЦР в реальном времени. Каждый биологический образец анализировали в трех технических повторностях вместе с контролями без матрицы и без обратной транскрипции. Среднее значение Ct трех технических повторностей использовали для последующего анализа; технические повторности не рассматривались как независимые наблюдения. Использовали праймеры, перекрывающие экзон-экзонные стыки и дающие ампликоны размером 80–200 bp (Таблица 2). Специфичность праймеров проверяли с помощью NCBI Primer-BLAST и анализа кривых плавления22.
β-actin (ACTB) использовался в качестве внутреннего референсного гена для нормализации уровней экспрессии целевых генов. Относительная экспрессия рассчитывалась с использованием метода 2-ΔΔCt23. Для межгрупповых сравнений, исходя из распределения данных, применялись двухсторонние U-критерии Манна-Уитни, а для пяти генов была проведена коррекция ложноположительных результатов по методу Бенджамини-Хохберга. ROC-кривые для отдельных генов были построены с 95% доверительными интервалами по методу ДеЛонга, а оптимальные пороговые значения выбирались с помощью индекса Юдена. Модель логистической регрессии для пяти генов изначально подбиралась и оценивалась на тех же 40 биологических образцах; эта оценка была определена как кажущаяся эффективность внутри выборки. Для оценки возможного переобучения было выполнено 100 повторений стратифицированной пятикратной перекрестной проверки с использованием модели логистической регрессии с L2-регуляризацией, после чего была рассчитана совокупная эффективность ROC вне выборки.
| Ген | номер доступа RefSeq | Прямой праймер (5′–3′) | Обратный праймер (5′–3′) | Размер продукта (п. н.) | Tm (°C) | перекрывающие экзоны |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Да |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Да |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Да |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Да |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Да |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Да |
Таблица 2: Последовательности праймеров, использованных для количественной обратной транскрипции и ПЦР. В таблице приведены целевые гены, номера доступа RefSeq, последовательности прямых и обратных праймеров, размеры продуктов, температуры плавления и статус охвата экзонов для праймеров, использованных в qRT-PCR.
9. Скрининг соединений-кандидатов и молекулярный докинг
Сигнатуры основных генов с повышенной и пониженной экспрессией были загружены в базу данных Connectivity Map для поиска малых молекул, которые, согласно прогнозам, могут обратить экспрессионный профиль, связанный с ЛС7. Кандидаты были ранжированы по показателю Logit и вероятности прогноза.
Трехмерная структура BRD-K91900765/VX-745 была получена из базы данных PubChem под идентификатором CID 303852524. Фармакологическая информация о соединении была собрана из открытых баз данных лекарственных средств, а структурные дескрипторы были рассчитаны с помощью DrugBank и SwissADME25,26. Структуры белков были получены из RCSB Protein Data Bank с использованием следующих PDB-идентификаторов: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; и MAPK14/p38α, 1OUK27. Поиск слепых полостей и молекулярный докинг проводились с использованием CB-Dock2 v2.0 с оценочным движком AutoDock Vina v1.2.028,29. Файлы белков и лигандов были загружены в CB-Dock2, кандидатные полости определялись автоматически, и докинг выполнялся в рамках специфических для каждой полости боксов, созданных сервером. Для каждого белка регистрировались идентификатор полости, оценка Vina (Vina score), объем полости, центр бокса докинга, размеры бокса докинга и файл комплекса белок-лиганд. Поза с наиболее отрицательным значением Vina score была выбрана в качестве наиболее приоритетной предсказанной конформации. MAPK14/p38α был включен как установленная фармакологическая мишень и положительный контрольный белок для докинга VX-745. Докинг в отношении CXCL10, JUN, IFIH1, MX1 и TLR7 носил исследовательский характер и не интерпретировался как доказательство прямого фармакологического воздействия, связывания, ингибирования или эффективности.
10. Статистический анализ и контроль воспроизводимости
Все статистические анализы проводились в R, если не указано иное. Двусторонние значения P < 0.05 считались статистически значимыми. Поправка на множественное тестирование применялась к анализам дифференциальной экспрессии, обогащения, внешней валидации и qRT-PCR, как указано выше. Для оценки стабильности моделей машинного обучения и комбинированных моделей qRT-PCR использовалась кросс-валидация.