Идентификация перекрывающихся генов, анализ обогащения и построение сети белок-белковых взаимодействий (PPI)
На основе набора данных GSE54837 было выявлено 3 371 ДЭГ, включая 1 675 гены с повышенной экспрессией и 1 696 гены с пониженной экспрессией. Топ-10 генов с наиболее значимым повышением и понижением экспрессии показаны на рисунке 1A. Была выполнена иерархическая кластеризация данных GSE54837 (дополнительный рисунок 1A), и для обеспечения безмасштабной топологии сети была применена степень мягкого порога 10 (рисунок 1B). Модули коэкспрессии генов были построены с использованием метода динамического отсечения дерева с минимальным размером модуля 50 генов, и каждому модулю был присвоен отдельный цвет (дополнительный рисунок 1B). Модули с корреляцией собственных генов > 0,75 были впоследствии объединены (дополнительный рисунок 1C, рисунок 1C), в результате чего было получено 14 отдельных модулей. На основании анализа корреляции Пирсона между собственными генами модулей и клиническими характеристиками модуль MEsalmon (состоящий из 5 226 генов) продемонстрировал наиболее значимую положительную корреляцию с ХОБЛ (r = 0,35, p = 7 x 10⁻8, рисунок 1D). Анализ диаграммы Венна выявил 160 перекрывающихся генов среди 3 371 ДЭГ, 5 226 генов модуля MEsalmon и 2 118 ac4C-RG (рисунок 1E). Функциональный анализ обогащения этих 160 генов показал, что значимые термины GO включали связывание одноцепочечной РНК, регуляцию метаболических процессов мРНК и сигнальный путь RIG-I (рисунок 1F). Кроме того, анализ KEGG продемонстрировал, что эти гены были преимущественно обогащены в процессах Fc gamma R-опосредованного фагоцитоза, пути контроля мРНК и фокальной адгезии (рисунок 1G). Сеть PPI перекрывающихся генов содержала 118 узлов и 196 ребер (рисунок 1H).
Идентификация шести ключевых генов при ХОБЛ
Для дальнейшего выявления потенциальных ключевых генов среди 160 перекрывающихся кандидатов были применены три алгоритма машинного обучения. Сначала была использована LASSO-регрессия, при этом для определения оптимального параметра штрафа (λ) ≈ 0.091 применялась кросс-валидация (Рисунок 2A). График профиля коэффициентов показал, что при оптимальном значении λ было сохранено 17 генов (Рисунок 2B). Анализ XGBoost позволил выявить 30 генов с наибольшим приростом (gain), среди которых PTRF, WBP11 и LDOC1L продемонстрировали высокую прогностическую ценность (Рисунок 2C). Алгоритм RF аналогичным образом ранжировал 30 лучших генов в соответствии с показателями важности Джини (Gini importance), при этом PTRF, RFX5 и PRKCDBP оказались одними из наиболее прогностически значимых (Рисунок 2D). Анализ пересечения генов, отобранных тремя методами, позволил выявить шесть ключевых перекрывающихся генов: PTRF, PRKCDBP, UPP1, TOR3A, FAM168B и B4GALT2 (Рисунок 2E).
Построение диагностической модели и анализ экспрессии ключевых генов
Используя 70% набора данных GSE54837 в качестве обучающей выборки, была построена модель логистической регрессии, включающая шесть ключевых генов. Анализ ROC-кривых показал умеренную диагностическую эффективность: значения AUC составили 0,766 (95% ДИ: 0,691–0,8417), 0,759 (95% ДИ: 0,6368–0,8817) и 0,723 (95% ДИ: 0,6085–0,8596) для обучающей, внутренней тестовой и внешней валидационной выборок соответственно (Рисунок 3A–C). Калибровочный анализ подтвердил высокую надежность, а DCA продемонстрировал выраженную чистую клиническую пользу в широком диапазоне пороговых вероятностей как в обучающей выборке (Рисунок 3D–E), так и в валидационных выборках (Рисунок 3F–G). Для визуализации вклада каждого гена и облегчения индивидуальной оценки риска была построена номограмма (Рисунок 3H). Анализ экспрессии показал, что B4GALT2, PRKCDBP и UPP1 были значительно повышены в образцах с ХОБЛ, тогда как экспрессия FAM168B, PTRF и TOR3A была снижена (Рисунок 3I).
Регуляторная сеть и функциональный анализ ключевых генов при ХОБЛ
С помощью анализа GeneMANIA была построена сеть функциональных взаимодействий, включающая 20 наиболее тесно связанных с выявленными хаб-генами генов (Рисунок 4A). Большинство связей пришлось на физические взаимодействия, за которыми следуют корреляции коэкспрессии и общие белковые домены. Функциональная аннотация указала на значительное обогащение таких процессов, как катаболический процесс малых молекул, содержащих нуклеиновые основания, катаболический процесс нуклеозидов и рафты плазматической мембраны. Посттранскрипционная регуляция исследовалась путем пересечения прогнозов miRNA из баз данных DIANA-microT и miRanda, что позволило выявить восемь перекрывающихся miRNA (Рисунок 4B). Впоследствии была построена регуляторная ось lncRNA-miRNA-mRNA. Согласно диаграмме Санки, две из выявленных miRNA, обе связанные с регуляцией FAM168B, по прогнозам, являются мишенями семи lncRNA; для остальных пяти хаб-генов подобных регуляторных взаимодействий выявлено не было (Рисунок 4C). Транскрипционная регуляция дополнительно изучалась с помощью платформы ChEA3, которая предсказала вышестоящие факторы транскрипции (TF) для B4GALT2, UPP1, FAM168B и TOR3A. Для построения регуляторной сети TF-мишень были выбраны десять наиболее значимых TF для каждого гена (Рисунок 4D). Для исследования биологических функций шести ключевых генов был проведен анализ GSEA. UPP1 был значительно обогащен в таких биологических процессах, как метаболический процесс диацилглицерина и биосинтетический процесс пуриновых нуклеозидтрифосфатов, а также в путях, включающих протеасому и метаболизм ксенобиотиков цитохромом P450 (Рисунок 4E–F). Результаты обогащения для остальных пяти ключевых генов представлены на Дополнительном рисунке 2A–J.
Иммунная инфильтрация UPP1 и прогнозирование мишеней лекарственных препаратов при ХОБЛ
С помощью алгоритма ssGSEA были оценены уровни инфильтрации 28 типов иммунных клеток в контрольной группе и группе с ХОБЛ. У пациентов с ХОБЛ наблюдались значимо более высокие показатели обогащения B-клеток памяти, миелоидных супрессорных клеток и активированных дендритных клеток. Напротив, Т-хелперы 1 типа, активированные B-клетки и незрелые B-клетки продемонстрировали значимо более низкие показатели обогащения (Рисунок 5A). Следует отметить, что ssGSEA предоставляет относительные оценки обогащения иммунных клеток на основе транскриптомных данных, а не прямые измерения пропорций иммунных клеток. Корреляционный анализ показал, что шесть ключевых генов демонстрировали различные паттерны связи с подмножествами иммунных клеток. В частности, UPP1, PRKCDBP и B4GALT2 положительно коррелировали с уровнями инфильтрации B-клеток памяти, активированных дендритных клеток и миелоидных супрессорных клеток (Spearman ρ > 0.4, p < 0.05), в то время как PTRF, TOR3A и FAM168B показали отрицательную корреляцию с Т-хелперами 1 типа и активированными B-клетками (Spearman ρ < −0.3, p < 0.05). Полная корреляционная матрица представлена на тепловой карте (Рисунок 5B). Анализ предсказания лекарственных взаимодействий определил UPP1 как единственный ген из шести кандидатов с предсказанными взаимодействиями с малыми молекулами. В базе данных были выявлены три соединения, включая фторурацил, капецитабин и 5-бензилацилуридин, в качестве потенциальных соединений, взаимодействующих с UPP1 (Рисунок 5C). Эти соединения в основном используются в онкологии или в экспериментальных целях, и их значимость при ХОБЛ требует дальнейшего изучения. Расчеты свободной энергии связывания показали, что 5-бензилацилуридин обладает наивысшим сродством к связыванию, что указывает на относительно более высокую предсказанную аффинность связывания (Таблица 3). Визуализация молекулярного докинга для всех трех соединений указала на благоприятные предсказанные конформации связывания с UPP1, что согласуется с результатами компьютерного докинга, а не с экспериментальной валидацией (Рисунок 5D–F). Кроме того, анализ CTD показал, что все шесть ключевых генов тесно связаны с различными фенотипами заболеваний, включая отсроченные эффекты пренатального воздействия, потерю веса, гепатомегалию и воспаление (Рисунок 5G–L).
Валидация ключевых диагностических генов в клинических образцах с помощью RT-qPCR
Для подтверждения уровней экспрессии ключевых генов были собраны образцы крови восьми пациентов с ХОБЛ и восьми лиц из контрольной группы; данный анализ считался предварительной валидацией в связи с ограниченным размером выборки. Как показано на Рисунке 6A–F, в образцах с ХОБЛ наблюдалось значимое снижение экспрессии PTRF, TOR3A и FAM168B, в то время как экспрессия PRKCDBP и UPP1 была значительно повышена, что согласуется с тенденциями, выявленными в ходе биоинформатического анализа. Напротив, значимых различий в экспрессии B4GALT2 между двумя группами обнаружено не было. Это расхождение может быть связано с ограниченным размером выборки или различиями в типах образцов между наборами данных и клиническими специменами.
ЗАЯВЛЕНИЕ О ДОСТУПНОСТИ ДАННЫХ:
Все данные секвенирования РНК были получены из базы данных Gene Expression Omnibus (GEO, https://www.ncbi.nlm.nih.gov), при этом GSE54837 был выбран в качестве обучающей выборки, а GSE112811 — в качестве валидационной выборки. Код, использованный в данном анализе, можно получить по адресу https://doi.org/10.5281/zenodo.21771476.

Рисунок 1: Идентификация перекрывающихся генов, анализ обогащения и построение сети PPI. (A) График вулканов (volcano plot) дифференциально экспрессируемых генов (DEGs) в наборе данных GSE54837. (B) Скрининг мягкого порога. (C) Дендрограмма кластеризации модулей (после слияния). (D) Тепловая карта корреляции между модулями и признаками. (E) Диаграмма Венна для идентификации перекрывающихся генов. (F) Диаграмма Mulberry анализа обогащения GO, показывающая основные результаты обогащения пересекающихся генов в категориях MF, CC и BP. (G) Леденцовая диаграмма (lollipop diagram) анализа обогащения сигнальных путей KEGG, где размер пузырька представляет количество обогащенных генов. (H) Сеть PPI перекрывающихся генов; узлы представляют белки, а ребра — белок-белковые взаимодействия. Сокращения: DEGs = дифференциально экспрессируемые гены; PPI = белок-белковое взаимодействие; GO = Gene Ontology; MF = молекулярная функция; CC = клеточный компонент; BP = биологический процесс; KEGG = Киотская энциклопедия генов и геномов; ac4C-RGs = гены, связанные с N4-ацетилцитидином. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Идентификация шести ключевых генов при ХОБЛ. (A) Кривая кросс-валидации LASSO. (B) Диаграмма траекторий коэффициентов регрессии LASSO. С увеличением λ коэффициенты неважных генов стремятся к 0. (C) Рейтинг важности признаков XGBoost. Ось X представляет значение прироста (gain), ось Y — название гена, а глубина цвета отражает степень важности. (D) Рейтинг важности признаков RF. Ось X представляет среднее снижение индекса Джини (mean decrease in Gini). (E) Диаграмма Венна перекрывающихся генов, полученных в результате перекрестного анализа трех алгоритмов. Сокращения: LASSO = метод наименьшего абсолютного сжатия и отбора; XGBoost = экстремальный градиентный бустинг; RF = случайный лес. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Построение диагностической модели и анализ экспрессии ключевых генов. (A) ROC-кривая обучающей выборки. (B) ROC-кривая внутренней тестовой выборки. (C) ROC-кривая внешней валидационной выборки. (D) Калибровочная кривая обучающей выборки. (E) DCA обучающей выборки. (F) Калибровочная кривая внешней валидационной выборки. (G) DCA внешней валидационной выборки. (H) Номограмма шести ключевых генов. Для прогнозирования индивидуального риска ХОБЛ каждому гену присваивается соответствующий балл. (I) Анализ экспрессии шести ключевых генов в образцах с ХОБЛ и контрольных образцах из набора данных GSE54837. Сокращения: ROC = операционная характеристика приемника; AUC = площадь под кривой; DCA = анализ кривой принятия решений; ХОБЛ = хроническая обструктивная болезнь легких. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Регуляторная сеть и функциональная значимость ключевых генов при ХОБЛ. (A) Результаты анализа 6 ключевых генов в GeneMANIA. Цвет линий указывает на корреляцию между генами, а цвет узлов — на различные функциональные категории. (B) Диаграмма Венна перекрестного анализа баз данных DIANA-microT и miRanda. (C) Диаграмма Санки регуляторной сети ceRNA. (D) Потенциальная регуляторная сеть факторов транскрипции. Синие узлы представляют факторы транскрипции, оранжевые узлы — гены-мишени. (E) Анализ обогащения GSEA для одного гена UPP1, включая GO. (F) Анализ обогащения GSEA для одного гена UPP1, включая KEGG. Сокращения: GO = Gene Ontology; KEGG = Kyoto Encyclopedia of Genes and Genomes. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 5: Иммунная инфильтрация ключевых генов и прогнозирование мишеней лекарственных препаратов при ХОБЛ. (A) Различия в обилии иммунных клеток между группами. (B) Тепловая карта корреляции между иммунными клетками и ключевыми генами. (C) Сеть взаимодействий между ключевыми генами и прогнозируемыми препаратами. (D) Молекулярный докинг фторурацила с UPP1. (E) Молекулярный докинг капецитабина с UPP1. (F) Молекулярный докинг 5-бензилацилуридина с UPP1. Для каждого соединения на левом изображении показана общая конформация докинга, на правом — локальные взаимодействия при связывании. (G) CTD-анализ B4GALT2. (H) CTD-анализ FAM168B. (I) CTD-анализ PRKCDBP. (J) CTD-анализ PTRF. (K) CTD-анализ TOR3A. (L) CTD-анализ UPP1. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Валидация экспрессии ключевых генов методом RT-qPCR в образцах при ХОБЛ и контрольных образцах. (A) Относительная экспрессия PTRF. (B) Относительная экспрессия PRKCDBP. (C) Относительная экспрессия UPP1. (D) Относительная экспрессия TOR3A. (E) Относительная экспрессия FAM168B. (F) Относительная экспрессия B4GALT2. ns = статистически не значимо, p > 0.05; * p < 0.05; ** p < 0.01; *** p < 0.001; **** p < 0.0001. Сокращение: RT-qPCR = количественная полимеразная цепная реакция с обратной транскрипцией. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Дополнительный рисунок 1: Образцы набора данных GSE54837 и кластеризация генных модулей. (A) Диаграмма кластеризации образцов набора данных GSE54837. (B) Дендрограмма кластеризации модулей до объединения. Гены были сгруппированы с использованием метода динамического разреза дерева для идентификации отдельных модулей. (C) Дендрограмма иерархической кластеризации собственных генов модулей. Модули с похожими паттернами экспрессии были кластеризованы на основе сходства их собственных генов.Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Дополнительная фигура 2: Анализ обогащения GSEA. (A) GO-анализ PRKCDBP. (B) KEGG-анализ PRKCDBP. (C) GO-анализ PTRF. (D) KEGG-анализ PTRF. (E) GO-анализ TOR3A. (F) KEGG-анализ TOR3A. (G) GO-анализ FAM168B. (H) KEGG-анализ FAM168B. (I) GO-анализ B4GALT2. (J) KEGG-анализ B4GALT2. Сокращения: GO = Gene Ontology (генная онтология); KEGG = Kyoto Encyclopedia of Genes and Genomes (Киотская энциклопедия генов и геномов).Пожалуйста, нажмите здесь, чтобы скачать этот файл.
| Набор данных | Контроль | Пациенты | Платформа для секвенирования |
| GSE54837 | 90 | 136 | GPL570 |
| GSE112811 | 44 | 20 | GPL570 |
Таблица 1: Наборы данных экспрессии генов, использованные в исследовании. Характеристики наборов данных GSE54837 и GSE112811, использованных соответственно для разработки/внутреннего тестирования модели и внешней валидации.
| Пациент | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| Пол (Ж/М) | М | М | М | F | М | М | M | М |
| Возраст (лет) | 69 | 72 | 75 | 73 | 68 | 70 | 69 | 71 |
| Статус курения | Да | Да | Отказ от курения (2 года) | Нет | Да | Да | Да | Отказ от курения (5 лет) |
| Пачка-лет | 20 в день / 30 лет | 15 в день / 35 лет | 20 в день / 50 лет | | 20 в день / 40 лет | 30 в день / 40 лет | 15 в день / 40 лет | 20 в день / 30 лет |
| Группа ХОБЛ | 2 | 3 | 3 | 2 | 2 | 3 | 2 | 3 |
Таблица 2: Исходные характеристики участников исследования.Исходные демографические и клинические характеристики пациентов с ХОБЛ и здоровых лиц из контрольной группы, включенных в валидацию методом RT-qPCR.
| Название молекулы | Ген | Балл (ккал/моль) |
| 5-бензилацилуридин | UPP1 | -9.6 |
| Капецитабин | UPP1 | -6.1 |
| Флуороурацил | UPP1 | -5.5 |
Таблица 3: Результаты молекулярного докинга UPP1 и соединений-кандидатов.
Предполагаемые результаты молекулярного докинга при взаимодействии UPP1 с фторурацилом, капецитабином и 5-бензилацилуридином, включая их аффинность связывания.