$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Обзор аналитического процесса
Общий дизайн анализа на основе транскриптомики и машинного обучения в данном исследовании иллюстрируется на рисунке 1, включающем ключевые этапы: сбор генов, связанных с системой ренин-ангиотензина (RASRG); скрининг дифференциально экспрессируемых генов (RASRDEGs) из наборов данных по гипертонии; функциональный анализ обогащения (GO/KEGG/GSEA); анализ иммунной инфильтрации (CIBERSORT); построение белок-белкового взаимодействия (ИПП) и регулирующих сетей; отбор ключевых генов на основе машинного обучения (логистическая регрессия, случайный лес [RF]); и оценка модели диагностики гипертонии. Полный список программного обеспечения, баз данных и онлайн-инструментов, использованных в данном исследовании, приведён в Таблице материалов.
Скачать данные
Наборы данных по гипертонии GSE753608 и GSE74144 (Homo sapiens) были получены через R-пакет GEOquery9 из базы данных GEO10. GSE75360, полученные из периферических мононуклеарных клеток крови (платформа: GPL10558), включали 10 образцов гипертонии и 11 контрольных образцов; GSE74144, полученные из лейкоцитов (платформа: GPL13497), включали 14 образцов гипертония и 8 контрольных образцов (Таблица 1). Белок-кодирующие RASRG (1 264) изначально были идентифицированы с помощью GeneCards11 (ключевое слово: «Система ренин-ангиотензина») и PubMed (ключевое слово: «система ренин-ангиотензина»)12,13. Пересечение этих RASRG с генами в GSE75360/GSE74144 дало 1 159 конечныхRASRG 14. Оба набора данных обрабатывались отдельно, так как они генерировались на разных микрокристальных платформах. Аннотация на зонде проводилась согласно соответствующим файлам аннотаций платформы GPL, а для последующих анализов использовались нормализованные матрицы экспрессии генов. Для сравнения распределений выражений до и после нормализации использовались коробочные диаграммы.
Гены, связанные с гипертензией, связанные с ренин-ангиотензином, дифференциально экспрессируемые
Выборки из GSE75360 набора данных были классифицированы на группу с гипертонией и контрольную группу. Программное обеспечение limma использовалось для проведения дифференциального анализа экспрессии генов между двумягруппами 14, при этом дифференциально экспрессированные гены (DEGs) идентифицировались по порогу |logFC| > 0,45, p-значение < 0,05. Результаты этого дифференциального анализа визуализировались с помощью вулканических графиков (генерируемых с использованием пакета R ggplot2).
Для получения RASRDEG DEG, соответствующие вышеуказанному порогу (|logFC| > 0,45, p-значение < 0,05), были сопоставлены с генами, связанными с RAS, а результат пересечения представлен с помощью диаграммы Венна. Впоследствии паттерны экспрессии идентифицированных RASRDEG визуализировались в виде тепловой карты с использованием pheatmap пакета R, а хромосомная локализация RASRDEGs отображалась с помощью хромосомных карт, сгенерированных с помощью R-пакета RCircos15.
Дифференциально экспрессированная валидация генов и анализ кривой ROC
Был построен межгрупповый график для анализа различий в экспрессии RASRDEG между гипертонией и контролем GSE7536016 pROC пакета R использовался для построения кривых ROC и расчёта AUC (0,5–0,7: низкая точность; 0,7–0,9: умеренная; >0,9: высокая) для диагностической эффективности RASRDEG.
Корреляционный анализ
Корреляционный анализ Спирмана проводился по экспрессии RASRDEG в GSE75360 году; Результаты визуализировались с помощью тепловой карты (пакет R, ggplot2) (|r| < 0,3: отсутствие/слабая корреляция; 0,3–0,5: слабая; 0,5–0,8: умеренная; >0,8: сильная).
Анализ обогащения GO и KEGG
GO (Gene Ontology, выпуск 2024 года, http://geneontology.org/) — широко используемый ресурс для масштабного функционального обогащения, охватывающий три области: биологические процессы (BP), клеточные компоненты (CC) и молекулярные функции (MF)17. KEGG (Kyoto Encyclopedia of Genes and Genomes, выпуск 109.0, 2024, https://www.genome.jp/kegg/) хранит данные о геномах, биопутях, болезнях илекарствах 18.
RASRDEG подвергались аннотации GO и анализу обогащения путей KEGG с использованием кластера пакетаRProfiler 19. Метод теста на обогащение: гипергеометрический тест; метод коррекции множественных тестов: метод Бенжамини-Хохберга (BH). Критерий скрининга: скорректированное p-значение < 0,05.
Анализ обогащения множества генов (GSEA)
Для когортного уровня GSEA все гены, протестированные в анализе дифференциальной экспрессии GSE75360, были ранжированы в порядке убывания logFC и использовались в качестве входного списка генов дляclusterProfiler 19. До GSEA предварительная фильтрация DEG не применялась. Коллекция множества генов c2 из MSigDB20. Параметры: семя = 2022, 10–500 генов на набор; критерии скрининга: исправлено p < 0,05 (метод Бенжамини-Хохберга, BH), FDR < 0,2521.
Построение модели диагностики гипертензии
Для выявления ключевых генов, связанных с гипертонией, мы использовали два типа алгоритмов машинного обучения: логистическую регрессию и случайные леса (RF). Логистическая регрессия (бинарно-зависимая переменная: гипертония/контроль) скринировала RASRDEG с p < 0,05. Случайный лес (RF, пакет R randomForest): параметры set.seed(520), ntree = 1000; Был извлечен индикатор переменной важности (MeanReductionGini), а также отобраны топ-15 RASRDEG. RASRDEG были отсеяны с p-значением < 0,05 в качестве стандарта.
Алгоритм RF (Random Forest), метод ансамблевого обучения в категории Bagging (интегрирующий несколько деревьев решений), применялся через R-пакетrandomForest 22 (параметры: set.seed(520), ntree = 1000). Был извлечен MeanReductionGini (отражающий переменную важность при среднем снижении чистоты при разделении узлов) признаковых генов, и отобраны топ-15 RASRDEG. Наконец, была построена диаграмма Венна генов, скринингируемых с помощью логистической регрессии и РЧ, для выявления ключевых генов, связанных с гипертонией.
Валидация модели диагностики гипертонии
Была построена модель логистической регрессии на основе ключевых генов; Линейное прогнозируемое значение (η) рассчитывалось следующим образом:

Пакет R pROC16 использовался для построения кривых ROC и оценки эффективности модели в прогнозировании риска гипертонии. С помощью R-пакета rms23 была создана номограмма для визуализации вклада каждого ключевого гена в логистическую регрессионную модель (отражающую связь между ключевыми генами и риском гипертонии). Были созданы калибровочные кривые для оценки согласованности между предсказанными и реальными вероятностями гипертонии; Анализ кривой принятия решения (DCA, пакет RggDCA 24) был проведён для оценки клинической полезности модели (чистой выгоды) в GSE75360 и GSE74144 году.
Одногенный GSEA
GSEA исследует роль генов, связанных с конкретным геном, в биологических процессах/путях/заболеваниях, анализируя его экспрессию, что помогает понять функциональную роль гена. Для каждого фокального гена в GSE75360 образцы были разделены в медиане на группы с высокой и низкой экспрессией. Затем был проведён дифференциальный анализ экспрессии для всех протестированных генов, и значения logFC по всему геному ранжировались от самых высоких к самым низким до GSEA с кластеромProfiler 19. До GSEA предварительная фильтрация DEG не применялась. Параметры: семя = 2020, 10–500 генов на набор (сбор наборов генов c2 из MSigDB21). Критерии скрининга: p < 0,05 (прик. p исправлено методом BH).
Анализ иммунной инфильтрации (CIBERSORT)
АлгоритмCIBERSORT 25 (основанный на линейной регрессии поддерживающих векторов) депутировал матрицу транскриптома для оценки состава иммунных клеток в смешанных выборках (были выбраны данные с баллом обогащения иммунных клеток > 0). Итоговая матрица инфильтрации иммунных клеток GSE75360 визуализировала с помощью пропорциональной столбчатой таблицы. Корреляция Спирмана была использована для анализа иммунных клеток-иммунных клеток и ключевых ассоциаций ген-иммунных клеток, результаты которых были представлены в виде тепловой карты корреляции (R package pheatmap) и корреляционного пузырькового графика (R package ggplot2) соответственно.
Сеть взаимодействия белков и белков (ИПП)
Сети ИПП — это системы взаимосвязанных белков, регулирующих биологические процессы через взаимодействия. Используя базу данныхSTRING 26, была построена сеть PPI для ключевых генов (минимальный балл взаимодействия: 0,150, низкая уверенность). Гены, связанные с ренин-ангиотензином, были отобраны путём скрининга взаимодействующих генов. База данныхGeneMANIA 27, которая идентифицирует функционально схожие гены с помощью геномных и протеомных наборов данных, была использована для прогнозирования функционально схожих генов ключевых генов RAS и построения сети взаимодействия белков.
Строительство регулирующей сети
мРНК-ТФ-сеть: транскрипционные факторы (ТФ) регулируют экспрессию генов через посттранскрипционное взаимодействие с целевой целью. TF, направленные на хаб-гены и их регуляторные связи, были извлечены из базы данныхChIPBase 28, а сеть mRNA-TF визуализирована с помощью Cytoscape29.
Сеть мРНК-миРНК: миРНК модулируют несколько целевых генов (отдельные мишени могут регулироваться несколькими миРНК). StarBase v3.030 использовался для идентификации miRNA, связанных с RASRDEGs, а сеть mRNA-miRNA визуализовалась с помощью Cytoscape.
Сеть мРНК-препаратов: Токсикогеномные базыданных 31 использовались для прогнозирования прямых и косвенных мишеней для генов хаба. Сеть мРНК-препаратов (показывающая взаимодействия генов и лекарств) была визуализирована с помощью Cytoscape для завершения построения сети.
Модель HUVEC, индуцированная Ang II,
Эндотелиальные клетки человеческой пуповиной вены (HUVEC) поддерживались при 37°C в увлажнённом инкубаторе с 5%CO2. Клетки содержались в полной эндотелиальной культурной среде с добавлением сыворотки плода и антибиотиков согласно инструкциям поставщика. Для установления модели эндотелиального повреждения, связанного с гипертензией in vitro, HUVEC лечили ангиотензином II (Ang II; 100 нМ) в течение 48 часов. В качестве контрольной группы использовались ячейки, обработанные транспортными средствами.
Для экспериментов с генным вмешательством малые интерферирующие РНК, нацеленные на CST3 или FURIN (si-CST3 и si-FURIN), соответствующие отрицательные контрольные siRNA (si-NC), CST3 или FURIN с переэкспрессией (oe-CST3 и oe-FURIN), а также соответствующую контрольную пустую векторную систему (oe-NC), трансфекцировались в HUVEC с использованием коммерческого трансфекционного реагента согласно протоколу производителя. После трансфекции клетки подвергались воздействию Ang II, а затем собирали для валидации экспрессии и проведения функциональных тестов. Эффективность нокдауна и переэкспрессии была подтверждена qRT-PCR и вестерн-блоттингом.
qRT-PCR
Общая РНК была выделена из HUVEC с помощью стандартного реагента для экстракции РНК, а комплементарная ДНК была получена с помощью комплекта обратной транскрипции. Для qRT-PCR использовалась химия SYBR Green. Уровни экспрессии LRP1, CTSD, MTHFR, AUTS2, FURIN, CST3, FCER1G, TBXAS1, IL-6, TNF-α, VCAM1, ICAM1 и eNOS были нормализованы до GAPDH и рассчитаны методом 2−ΔΔCt .
Вестерн блоттинг
Для анализа вестерн-блот белки экстракцировались с помощью буфера лизиса RIPA и количественно оценивались с помощью анализа BCA. Равные количества белков были разложены с помощью SDS-PAGE и перенесены на мембраны PVDF. После блокировки мембраны инкубировали первичными антителами против CST3, FURIN, TBXAS1 или GAPDH, а затем подходящими вторичными антителами. Полосы были обнаружены с помощью хемилюминесценции, и денситометрия нормализовалась до GAPDH. Секретируемый CST3 в культурных супернатантах количественно оценивался с помощью комплекта ELISA согласно протоколу производителя.
Жизнеспособность клеток
Жизнеспособность клеток оценивалась с помощью анализа Cell Counting Kit-8 (CCK-8). Кратко, трансфицированные и обработанные Ang II HUVEC были засеяны в пластины с 96 лунками, а поглощение на 450 нм измерялось через 0, 24, 48 и 72 часа после добавления реагента CCK-8. Миграция клеток оценивалась с помощью камер Трансвелла. После указанных вмешательств клетки были посеяны в верхние камеры, а мигрирующие клетки на нижней поверхности мембраны фиксировались, окрашивались и подсчитывались под микроскопом в случайно выбранных полях.
Воспалительный тест
Для оценки воспалительной активации, окислительного стресса и эндотелиальной функции, IL-6, TNF-α, VCAM1, ICAM1 и eNOS.Уровни мРНК были обнаружены с помощью qRT-PCR. Уровни оксида азота (NO) в культурном супернатанте измерялись с помощью коммерческого NO-теста, а внутриклеточные уровни реактивных кислородных форм (ROS) были обнаружены с помощью флуоресценции DCF согласно инструкциям производителя.
Статистический анализ
Транскриптомическая обработка и моделирование проводились в R. Непрерывные переменные оценивались на нормальность с помощью теста Шапиро-Уилка. Для двухгрупповых сравнений для нормально распределенных переменных использовались t-тесты независимых выборок, тогда как для ненормальных переменных применялись тесты Уилкоксона с суммой ранга. Для трёх и более групп применялся односторонний анализ дисперсии с соответствующим пост-хок тестированием при выполнении предположений о нормальности и однородности дисперсии; в противном случае применялся тест Крускаля-Уоллиса. Данные по временному курсу CCK-8 анализировались с использованием двухстороннего анализа дисперсии. Коэффициенты корреляции Спирмана были рассчитаны для анализа ассоциаций. Если не указано иное, экспериментальные результаты показаны как средние ± SD, а двухсторонний p < 0,05 считался значимым.