Исследование проводилось в соответствии с Хельсинкской декларацией. Протокол был утверждён Этическим комитетом Клинического центра общественного здравоохранения Аньхой 19 сентября 2025 года (ID одобрения: PJ-YX2025-062). Письменное информированное согласие было получено от всех участников перед забором крови. Местная когорта включала восемь пациентов с острым инфарктом миокарда (ОМП) и восемь здоровых контрольных групп. Исследовательские инструменты, используемые в протоколе, перечислены в Таблице материалов.
1. Источники данных и обработка
Наборы данных по секвенированию РНК, связанные с инфарктом миокарда, были получены из Gene Expression Omnibus (GEO). Наборы данных GSE59867 и GSE48060 использовались для массового транскриптомического анализа, а GSE269269 набор данных по секвенированию одноклеточных РНК — для анализов на клеточном уровне (Таблица 1). Набор из 255 генов, связанных с кальмодулином, был получен из Атласа белков человека для последующих анализов генетических наборов.
| Набор данных | Тип образца | Сэмпл (контрольные) | Выборка (пациенты) | Платформа секвенирования |
| GSE59867 | Bulk RNA-seq | 46 | 111 | GPL6244 |
| GSE48060 | Bulk RNA-seq | 21 | 31 | GPL570 |
| GSE269269 | scRNA-seq (периферическая кровь) | | 10 | GPL24676 |
Таблица 1: Характеристики используемых в исследовании наборов данных. В таблице перечислены номера присоединения к набору данных, типы выборок, количество контрольных и пациентных образцов, а также платформы секвенирования для массовых наборов секвенирования РНК и одноклеточных РНК. РНК-секвенирование, секвенирование РНК; scRNA-seq, секвенирование одиночных клеток РНК.
Межвыборочная вариабельность в объёмных транскриптомных наборах данных была исправлена с помощью функции normalizeBetweenArrays в пакете limma версии 3.60.6. Затем был проведен дифференциальный анализ экспрессии генов с помощью лиммы. Дифференциально экспрессированные гены (DEGs) определялись с использованием порогов P < 0,05 и |log₂ fold change| > 0,5. Полученные DEG были визуализированы с помощью вулканических диаграмм и тепловых карт и классифицированы как значительно повышенные, значительно сниженные или без существенных изменений.
2. Анализ обогащения наборов генов на основе одной выборки и взвешенный анализ коэкспрессии генов
Анализ обогащения набора генов на основе одного образца (ssGSEA) проводился с использованием 255 генов, связанных с кальмодулином. Пакет GSVA использовался для расчёта шкалы гена, связанного с кальмодулином, обозначенного как Calmodulin_score, для каждого AMI и контрольного образца. Различия в Calmodulin_score между группами AMI и контрольной группы оценивались с помощью теста Уилкоксона на сумму ранга.
Анализ взвешенной коэкспрессии генов (WGCNA) был проведён с использованием объёмных транскриптомических данных пациентов с AMI. Были исключены гены со средним значением фрагментов на килобазу транскрипта на миллион отображённых чтений ≤0,5. Образцы были сгруппированы для выявления и удаления выбросов.
Была выбрана степень мягкого порога, обеспечивающая безмасштабное соответствие топологии R² > 0,8. Затем была построена топологическая матрица перекрытий. Генные модули были идентифицированы с помощью алгоритма динамического вырезания деревьев с минимальным размером модуля 200. Модули с очень похожими собственными генами объединялись с использованием порога корреляции >0,75, что соответствует порогу слияния модулей 0,25.
Взаимосвязи между собственными генами модуля и клиническими признаками, включая Calmodulin_score, оценивались с помощью корреляционного анализа Пирсона. Полученные взаимоотношения между модулями и признаками отображались в тепловой карте, аннотированной коэффициентами корреляции и соответствующими значениями P. Для каждого гена рассчитывались принадлежность к модулям и значимость гена. Были созданы диаграммы рассеяния принадлежности к модулям по значимости генов для выявления генов с высокой внутримодульной связностью и значимостью признаков.
3. Идентификация генов, связанных с AMI, связанных с кальмодулином
Гены, связанные с кальмодулином, ассоциированными с AMI, были выявлены путём пересечения DEG с генами модулей WGCNA, значительно коррелируемыми с Calmodulin_score. Перекрывающиеся гены сохранялись для дальнейших анализов.
Функциональный анализ обогащения проводился с использованием пакета clusterProfiler. Аннотации Gene Ontology и Kyoto Encyclopedia of Genes and Genomes использовались для идентификации биологических процессов, молекулярных функций, клеточных компонентов и сигнальных путей, связанных с перекрывающимися генами.
4. Идентификация и валидация ключевых генов с помощью машинного обучения
Был проведён одномерный логистический регрессионный анализ с использованием перекрывающихся генов. Затем три алгоритма машинного обучения применялись независимо с использованием следующих R-пакетов и параметров: случайный лес, XGBoost и поддерживающая векторная машина.
Каждый алгоритм использовался для приоритизации генов с предиктивной значимостью для AMI. Кандидат-ключевые гены определялись как гены, идентифицированные всеми тремя алгоритмами. Гены, которые также демонстрировали значительную и направленно согласованную дифференциальную экспрессию как в наборе данных GSE59867 обучения, так и в GSE48060 внешнем валидационном наборе данных, были сохранены в качестве окончательных ключевых генов.
5. Создание и оценка диагностических моделей
Была построена логистическая регрессионная модель с использованием выявленных ключевых генов и функции lrm. С использованием функции регплота была создана номограмма для отображения вклада каждого гена признаков в предсказанную вероятность АМИ.
Различение модели оценивалось с помощью анализа операционных характеристик приёмника с использованием пакета pROC. Площадь под кривой рабочей характеристики приёмника была рассчитана для оценки способности модели отличать AMI от контрольных образцов.
Были сгенерированы калибровочные кривые для сравнения предсказанных вероятностей с наблюдаемыми результатами. Анализ кривой принятия решения был проведён для оценки чистой клинической выгоды модели в диапазоне пороговых вероятностей.
6. Анализ обогащения генных множеств и конкурирующая эндогенные РНК-сети
Анализ обогащения множества генов проводился отдельно для каждого ключевого гена с использованием его матрицы корреляции генов и пакета clusterProfiler. Результаты обогащения путей в Киотской энциклопедии генов и геномов были ранжированы по абсолютному нормированному баллу обогащения. Для каждого гена отображались пять самых высокоранговых путей.
Функциональные ассоциации и сети взаимодействия генов были изучены с помощью GeneMANIA. Потенциальные регуляторы микроРНК ключевых генов были предсказаны с помощью miRanda, miRTarBase, TargetScan и miRDB. Кандидаты на взаимодействия микроРНК и мРНК были выявлены путём пересечения предсказаний из четырёх баз данных.
Длительные некодирующие взаимодействия РНК-микроРНК были получены с помощью SpongeScan. Длинные некодируемые отношения РНК-микроРНК и микроРНК-мРНК были затем интегрированы для создания конкурирующей эндогенной РНК-регуляторной сети. Сеть визуализировалась в виде диаграммы Санки с использованием пакета ggalluvial.
7. Прогнозирование препаратов и молекулярное стыковывание
Взаимодействия лекарств и генов предсказывались с помощью базы данных взаимодействия лекарств-ген. Полученная сеть взаимодействия визуализировалась с помощью программного обеспечения для анализа сети.
Идентификатор белка UniProt для CCL4 был извлечен как P13236. Соответствующая трёхмерная структура белка была получена в формате Protein Data Bank (PDB) под номером присоединения 1HUM (человеческая MIP-1β, рентгеновская дифракционная структура), который был выбран для стыковки. Цепь A, представляющая биологически релевантный мономер, была выбрана для стыковки. Подготовка белка проводилась с использованием модуля Prepare Protein в CB-Dock2, который включает удаление молекул воды, добавление полярных водородов и назначение зарядов Гастайгера. Трёхмерные химические структуры кандидатных соединений (клодроновая кислота и эпоэтин альфа) были извлечены из базы данных PubChem в формате Structure-Data File (SDF). Симуляции стыковки проводились с помощью онлайн-платформы CB-Dock2, которая использует алгоритм AutoDock Vina для слепой стыковки. Место стыковки было установлено так, чтобы покрыть всю поверхность белка для беспристрастного выявления потенциальных карманов связывания. Аффинность связывания рассчитывалась как предсказанная свободная энергия связывания (ΔG) в ккал/моль. Финальные позы стыковки и взаимодействия белк-лиганд (например, водородные связи, гидрофобные контакты) визуализировались с помощью встроенного просмотра взаимодействий PyMOL и CB-Dock2.
8. Предобработка данных секвенирования РНК для одной клетки
Контроль качества проводился до анализа секвенирования отдельных клеток РНК. Клетки сохранялись, когда количество обнаруженных генов составляло от 200 до 10 000, общее количество уникальных молекулярных идентификаторов составляло ≥1 000, а доля митохондриальных транскриптов — ≤20%.
Клетки, экспрессирующие менее 200 генов, и гены, обнаруженные менее чем в трёх клетках, были исключены. Эти фильтры применялись для снижения включения ячеек низкого качества и технического шума. Значения экспрессии генов нормализовались с помощью функции NormalizeData в пакете Seurat. Высоковариабельные гены были идентифицированы с помощью функции FindVariableFeatures. Экспрессионные значения для высоковариабельных генов были центрированы и стандартизированы с помощью функции ScaleData.
Пакетные эффекты, связанные с экспериментальной или секвенирующей вариацией, корректировались с помощью функции RunHarmony из интеграционного фреймворкаHarmony 17.
9. Редукция, кластеризация и аннотация размерности по одной ячейке
Анализ основных компонентов был впервые применён для уменьшения размерности одноклеточного набора данных секвенирования РНК. Впоследствии для визуализации клеточной гетерогенности использовались равномерное приближение и проекция многообразия, а также t-распределённое стохастическое вложение соседей.
Транскрипционно похожие клетки были сгруппированы с использованием функций FindNeighbors и FindClusters в Seurat. Дифференциально экспрессированные маркерные гены для каждого кластера были идентифицированы с помощью функции FindAllMarkers путём сравнения каждого кластера со всеми оставшимися кластерами.
Типы клеток присваивались с помощью канонических маркерных генов, полученных из опубликованной литературы и установленных баз данных клеточных маркеров. Пространственное распределение и уровни экспрессии ключевых генов были визуализированы с помощью функцииFeaturePlot 18.
10. Количественный анализ полимеразных цепных реакций
Периферические образцы крови были получены у 8 пациентов с AMI и 8 здоровых контрольных групп в Клиническом центре общественного здравоохранения Аньхой. Группа AMI включала пациентов, диагностированных по Четвёртому универсальному определению инфаркта миокарда, с симптомами, соответствующими ишемии миокарда и повышенным уровнем тропонина I в сердце выше верхней референсной границы 99-го процентила. В контрольную группу входили здоровые люди с возрастом и полу, не имевшие истории сердечно-сосудистых заболеваний, нормальные электрокардиограммы и отклонения в рутинных анализах крови, функции печени или почек. У пациентов с АМИ в течение 24 часов после госпитализации было собрано 3 мл крови с этиледиаминтетрауксусной кислотой, антикоагулянной кислотой. Тот же объём был собран у здоровых контрольных групп в соответствующий период исследования.
Общая РНК была выделена из периферической крови согласно протоколу, предоставленному в наборе для выделения крови РНК. Концентрация и чистота РНК оценивались с помощью спектрофотометра NanoDrop, а целостность РНК проверялась с помощью электрофореза агарозного геля. Для последующих анализов использовались только образцы с соотношением A260/A280 от 1,8 до 2,1. Всего 500 нг РНК было обратно транскрибировано в комплементарную ДНК с помощью реагента для синтеза комплементарной ДНК первой цепочки. Полученная комплементарная ДНК была разбавена до конечной концентрации 150 нг/мл. Количественная амплификация полимеразной цепной реакции проводилась при общем объёме реакции 10 мкл с использованием мастер-смеси на основе SYBR Green без пассивного эталонного красителя. Все qPCR-реакции проводились дважды в технических дубликатах, а последующие расчёты основывались на средних значениях КТ.
Амплификация проводилась с помощью прибора полимеразной цепной реакции в реальном времени. Условия циклирования включали начальную денатурацию при 95 °C в течение 5 минут, затем 40 циклов денатурации при 95 °C в течение 10 секунд, отжиг при 60 °C в течение 30 с и удлинение при 72 °C в течение 30 секунд. Анализ кривой расплава проводился после амплификации.
Уровни экспрессии генов были нормализованы до β-актина. Относительная экспрессия была рассчитана с помощью метода 2−ΔΔCt .
11. Статистический анализ
Статистический анализ проводился в R. Визуализации сетей создавались с помощью программного обеспечения для анализа сети. Различия между двумя группами оценивались с помощью теста Уилкоксона, если не указано иное. Непрерывные переменные с нормальным распределением сравнивались с помощью t-теста Стьюдента. Ненормально распределённые непрерывные переменные сравнивались с помощью теста Манна-Уитни U, также известного как тест ранговой суммы Уилкоксона. Все статистические тесты были двусторонними. Значение P в <0,05 считалось статистическизначимым 19.