$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Исследование было проведено в соответствии с Хельсинкской декларацией, а протокол был утверждён Этическим комитетом Третьей больницы Хэбэйского медицинского университета (W2025-065-1) в ноябре 2024 года. Было получено информированное согласие от всех участников исследования.
Источник данных и предварительная обработка
Были получены данные РНК-секвенации, связанные с HF, включая два набора микрочипов из Gene Expression Omnibus (https://www.ncbi.nlm.nih.gov/geo/). Были выбраны два периферических набора данных по микрочипу крови: GSE59867 (34 образца HF и 30 контрольных) использовался в качестве обучающего набора данных; GSE57338 (177 HF-образцов и 136 контрольных) использовался в качестве валидационного набора данных. Клиническая информация, доступная для GSE57338, включая возраст, пол и состояние заболевания, была получена из GEO и суммирована в дополнительной таблице 1. Кроме того, из базы данных dbPTM (https://awi.cuhk.edu.cn/dbPTM/index.php) (Дополнительная таблица 2) было получено всего 3 893 гена, связанных с SUMOilation (SRG), а также 2 030 генов, связанных с митохондриями (MRG), на основе предыдущегоисследования 24 (Дополнительная таблица 3). Далее пакет R GEOquery (v 2.72.0)25 использовался для загрузки наборов данных из базы данных GEO, извлечения матрицы выражений и получения образцовой информации о фенотипе. Аннотация выполнялась путём отображения файла аннотации и сопоставления идентификаторов генов. Недействительные идентификаторы генов были удалены, а наиболее выраженные зонды остались.
Ключевой отбор генов с помощью машинного обучения
Для отбора генов, связанных с HF, SUMOilation и митохондриями, использовался многоступенчатый подход. Во-первых, общие гены между обучающим набором данных, SRG и MRG были выявлены с помощью анализа пересечения. Потенциальная функция общих генов была определена с помощью анализа обогащения генов (Gene Ontology Ontology (GO) и Kyoto Encyclopedia of Genes and Genomes (KEGG) с использованием пакета R ClusterProfiler (v 4.12.6)26. Затем были применены три подхода машинного обучения — регрессия LASSO, XGBoost и случайный лес (RF) — для дальнейшей фильтрации генов. В регрессии LASSO оптимальный параметр регуляризации λ выбирался с помощью перекрёстной валидации для выявления генетических признаков с наибольшей прогностической ценностью. Гены с ненулевой коэффициентом были отобраны для последующего анализа. Затем алгоритмы XGBoost и RF использовались для расчёта показателей важности признаков и скрининга топ-20 генов.
Построение и оценка диагностических моделей
Диагностическая модель была построена с использованием логистической регрессии на основе GSE59867 набора данных. Затем модель применялась для прогнозирования состояния заболевания и расчёта вероятностных оценок. Для проверки модели из GSE57338 набора данных извлекали те же ключевые гены, нормализовали для соответствия обучающему набору данных и использовали для внешнего прогнозирования. Производительность модели оценивалась с помощью кривых рабочей характеристики приёмника (ROC), матрицы путаницы, кривой калибровки и анализа кривой принятия решения (DCA).
Анализ обогащения множества генов (GSEA) и субклеточная локализация
Для выявления коррелированных генов каждого ключевого гена использовался корреляционный анализ Спирмана. Анализ GSEA проводился с использованием пакета R ClusterProfiler (версия 4.12.6) на родственных генах ключевых генов. Тем временем, чтобы определить точную субклеточную локализацию ключевых генов внутри клетки, их субклеточная локализация была определена с помощью базы данных GeneCards (https://www.genecards.org/).
Ассоциация ген-заболеваний и прогнозирование лекарств
Для оценки клинической значимости выявленных ключевых генов были проведены систематические анализы ассоциаций заболеваний и взаимодействия лекарств. Ассоциации заболеваний и генов были изучены с помощью Сравнительной токсикогеномной базы данных (CTD; https://ctdbase.org/), результаты ранжированы как по результатам вывода, так и по референсным количеству (в топ-10 зарегистрированных ассоциациях). Данные о взаимодействии генов и лекарственных средств для ключевых генов были получены из базы данных Drug-Gene Interaction (DGIdb), а лекарства исключались на основе оценки взаимодействия < 0,5. Впоследствии мы скачали 3D-структуры белков, соответствующих ключевым генам, из базы данных PDB (https://www.rcsb.org/) и молекулярные структуры потенциальных лекарств из PubChem (https://pubchem.ncbi.nlm.nih.gov/). Далее был проведён анализ молекулярного стыкинга с использованиемCB-Dock2 27 (https://cadd.labshare.cn/cb-dock2/php/index.php) для расчёта показателей связывания потенциальных препаратов и белков. Меньшая свободная энергия связывания указывает на более стабильное взаимодействие, что говорит о том, что соединение может иметь больший потенциал таргетинга.
Анализ иммунной инфильтрации
Инфильтрация иммунных клеток оценивалась с помощью трёх комплементарных методов: Microenvironment Cell Populations-counter (MCP-counter)28, идентификация типа клеток путём оценки относительных подмножеств РНК-транскриптов (CIBERSORT)29 и анализ обогащения с одним образцом (ssGSEA)30. Анализ MCP-счетчика и CIBERSORT проводился с использованием R-пакета IOBR (v 0.99.0)31. MCP-счетчик использовался для оценки численности иммунных и стромальных клеток, а CIBERSORT — для количественной оценки относительных пропорций 22 типов иммунных клеток. ssGSEA проводился с использованием пакета GSVA (v1.52.3)32 для оценки обогащения иммунных подтипов на уровне образца.
Построение конкурирующей регуляторной сети эндогенных РНК (цеРНК)
Для изучения потенциальных регуляторных ролей miRNA–lncРНК, связанных с ранее выявленными ключевыми генами, была создана регуляторная сеть ceRNA. Пакет R multiMiR (v 1.26.0)33 использовался для прогнозирования потенциальных взаимодействий микроРНК (miRNA)–mRNA для ключевых генов, интегрируя данные из PITA (https://omictools.com/pita-tool/) и базы данных miRDB (https://mirdb.org/). Были отобраны пары miRNA–mRNA с высокой уверенностью и стабильностью. Впоследствии взаимодействия lncRNA и miRNA были извлечены из базы данных StarBase (https://rnasysu.com/encori/) и отфильтрованы по взаимодействиям, поддерживаемым ≥ 10 экспериментами CLIP-seq, и классифицированы как lincRNA. Сеть ceRNA была построена путём интеграции взаимодействий lncRNA-miRNA-mRNA.
qPCR-валидация
Для подтверждения экспрессии ключевых генов были собраны образцы крови пациентов с HF и здоровых контрольных групп из клинической когорты (n = 6 на группу) в Третьей больнице Медицинского университета Хэбэя (W2025-065-1) по утверждённым протоколам и информированному согласию. Общая РНК была выделена с помощью реагента TRIzol в сочетании с хлороформом и изопропанолом. После извлечения РНК растворялась в воде, обработанной DEPC, а её концентрация и чистота оценивались с помощью спектрофотометра NanoDrop. Для транскрипционного анализа РНК была обратно транскрипирована в кДНК с помощью быстрой смеси синтеза кДНК первой цепи для RT (с использованием dsDNase). Впоследствии было проведено количественное ПЦР с использованием Fast Taq qPCR SYBR Green Mix. Конкретные последовательности грунтов подробно описаны в Таблице материалов. Относительные уровни экспрессии генов рассчитывались с помощью метода 2-ΔΔCT с соответствующей нормализацией.
Статистический анализ
Все статистические анализы проводились с использованием программного обеспечения R и GraphPad Prism. Статистические сравнения между двумя независимыми группами проводились либо с помощью t-теста Студента, либо теста Mann-Whitney U, в зависимости от распределения данных. p-значение менее 0,05 считалось статистической значимостью.