$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
В этом исследовании использовались общедоступные, деидентифицированные клинические и транскриптомические данные из Атласа генома рака и Omnibus по экспрессии генов. Все участвующие исследования имели предварительное одобрение институционального контрольного совета и информированное согласие. Поскольку проводился только вторичный анализ анонимизированных данных, дополнительное этическое одобрение не требовалось. Базы данных и используемое программное обеспечение перечислены в Таблице материалов.
1. Загрузка данных
Исследования использовалинабор данных EC (TCGA-Uterus Corpus Corpus Endometry Carcinoma (TCGA-UCEC)), который состоит из 589 образцов, включая 554 образца опухолевых тканей от пациентов UCEC (группа UCEC) и данные секвенирования из 35 соседних нормальных тканей (нормальная группа). База данных UCSC Xena использовалась для восстановления соответствующих клинических данных11, исключая тех, у которых не было полной клинической информации. В итоге для анализа было доступно 577 образцов с клиническими данными. Подробная базовая информация приведена в Таблице 1.
Дополнительные наборы данных, связанные с EC, GSE115810 и GSE6367812, были загружены с помощью пакета GEOquery13. Набор данных GSE115810 и GSE63678 были объединены для создания Объединённых наборов данных для дальнейшего анализа (Таблица 2).
Гены, связанные с метаболизмом NAD+ (NMRG), расположены после записиGeneCards 14 и соответствующейлитературы 15. Используя «метаболизм ниацинамида» в качестве поискового запроса в GeneCards, было выявлено 345 НМРГ с показателями релевантности выше 4. Объединение и удаление дубликатов из 42 НМРГ, найденных в литературе, привело к составлению всего 371 НМРГ (Дополнительная таблица 1). Клинические данные были собраны как фенотипические файлы tsv; данные загружались в формате HTSeq-FPKM. Исключённые образцы имели отсутствующее более 20% клинических данных. FPKM был преобразован вlog 2 и преобразован в TPM (транскрипты на миллион). Идентификаторы зондов сопоставлялись с генными символами для наборов данных GEO, а дублирующиеся зонды усреднялись.
2. Дифференциально экспрессируемые гены метаболизма никотинамида
Исследования начались с примененияR-множества sva16 для устранения владений множествами после GSE115810 и GSE63678 наборов данных, что привело к созданию взаимного набора данных, содержащего 31 EC (UCEC) и 8 соседних нормальных образцов. Далее — использование лимма-набора 17 для проведения экспрессии генов с несоответствием на наборе данных TCGA-UCEC.
Пересечение DEGs из анализа TCGA-UCEC с 337 NMRG позволяет определить DEG, связанные с метаболизмом никотинамидов. Это привело к списку генов, связанных с метаболизмом ниацинамид (NMRDEG), которые были изображены на иллюстрации Венна. Результаты исследования внешнего вида расхождений были проиллюстрированы пакетом ggplot2 R18, а тепловая карта NMRDEG была сгенерирована с использованием множества pheatmap19. Дисперсия между наборами данных устраняется пакетной коррекцией с помощью ComBat (эмпирического Байеса). В анализе DEG была использована эмпирическая линейная модель Байеса на основе лиммы. Явно применяемые пороги дифференциального выражения:
|log2FC| ≥ 1
FDR меньше 0,05.
Список NMRG пересекался только с DEG, которые соответствовали обоим требованиям. Графики вулканов и тепловые карты, сделанные с помощью ggplot2 и pheatmap.
3. Исследование функции NMRDEG (GO), улучшения путей (KEGG)
Исследования GO20 и KEGG21были проведены набором 22 clusterProfiler. Для обоих анализов пороги значимости были отмечены при p. adjust< 0,05 и FDR (q-значение) < 0,25. Исследования также интегрировали значения logFC в анализ обогащения, представляя результаты в виде круговых и хордовых диаграмм. Пороги значимости обогащения: p-значение скорректировано < 0,05 FDR < 0,25 (q-значение). Cluster Profiler использовался для исследований GO и KEGG. Направленность генов отображается с помощью графиков хорд и кругов, которые включают данныелогарифмичных изменений в 2 раза.
4. Анализ обогащения множества генов (GSEA)
Тип наследственных наборов факторов, внесших наибольший вклад в фенотип, можно определить с помощьюGSEA 23. Для этого анализа набор данных TCGA-UCEC был ранжирован на основе значений logFC, а анализ улучшения был проведён с использованием пакета clusterProfiler . Ключевые ограничения включали исходную стоимость 2022 года и 10 000 вариантов. Набор генов MSigDB "c2.all.v2022.1.Hs.symbols.gmt"использовался 24. Наиболее обогащённые пути, включая гены, вызванные гипоксией Манало, старение, вызванное окислительным стрессом, гликолиз и апоптоз, были визуализированы с помощью горного графика. До GSEA гены порядковались пологарифмичному двукратному изменению. В анализе использовалось 10 000 перестановок. c2.all.v2022.1.Hs.symbols.gmt — это коллекция MSigDB. Для воспроизводимости использовалось фиксированное случайное семя (2022). Значимые пути были с p < 0,05 и q < 0,25.
5. Конструкция модели Кокс и сопутствующий прогнозный анализ
Для определения прогностической ценности дифференциально экспрессируемых генов (NMRDEG) при эндметриальной карциноме (UCEC) учёные использовали одномерный регрессионный анализ Кокса для первой классификации наследственных факторов; те с пропорцией опасности (HR) > 1 и p-значением < 0,1 были признаны подходящими для многомерной относительной структуры рисков Кокса.
Критерии для одномерного отбора Кокса: p < 0,10 и HR > 1. В многомерной модели Кокса использовались нормированные значения экспрессии Log 2-TPM. Для определения риска используется линейная комбинация коэффициентов Кокса × экспрессии генов. В калибровке номограммы применялись вероятности ОС за 1, 3 и 5 лет. Значения AUC за 1, 3 и 5 лет применялись в зависящих от времени ROC. Для определения порогов выживаемости применялся подход surv_cutpoint max-static. И анализы КМ, и РОК использовали одинаковые пороги.
Был создан номограф на основе многомерной модели Кокса для оценки её точности или прогнозной способности и расчёта шансов на 1, 3 и 5 лет общего существования. Стандартизационные дуги используются для оценки устойчивости между прогнозируемыми перспективами и реальными последствиями, а для измерения медицинской полезности структуры применялся анализ кривой принятия решений (DCA).
Уровни экспрессии мРНК определялись как нормализованные лог₂-преобразованные записи на миллион (TPM) с помощью пакета DESeq2. TPM учитывали сложность секвенирования и измерение генов, чтобы обеспечить надёжные и объективные оценки уровней экспрессии между образцами.
Используя коэффициенты многомерной модели Кокса, прогностическая оценка риска каждого пациента была определена следующим образом:
riskScore = коэффициент σi (генi) *экспрессия мРНК (генi) (1)
Дуги существования Каплана-Мейера (KM) были подготовлены для оценки общей выносливости высоких и низкоопасных кластеров, созданных по определённым рейтингам опасности. Временно-зависящие характеристики приёмника (ROC) были получены при оценке рутинной работы фреймворков на 1, 3- и 5-летних периодическихидеях 26, 27.
Для классификации экспрессии генов по коллекциям с высокой и низкой экспрессией для стратификации выживаемости используется роль surv_cut точки после пакета R из выживших. Эта функция определяет наибольшее сроговое значение за счёт максимизации стандартизированной статистики логарифмического ранга, давая бесприкосную, статистически оптимальную точку среза.
Пороговые значения, полученные для каждого прогностического гена, отображаются в ROC-кривых пунктирными линиями. Исследования применяли одинаковые пороги для всех анализов выживаемости и ROC.
TCGA RNA-seq был загружен в формате HTSeq-FPKM; клинические данные импортировались в виде фенотипных файлов TSV; FPKM был преобразован в TPM и преобразован log₂; Наборы данных GEO отображались от идентификаторов зонда к символам генов с помощью аннотаций платформы; Дублирующиеся зонды усреднялись для одного значения гена; были исключены образцы с отсутствующей клинической информацией более 20%; ComBat (эмпирический Bayes) использовался для пакетной коррекции наборов данных GSE; Для проверки успешности пакетной коррекции использовались PCA и boxplots. нормализация TPM с использованием стандартных методов преобразования выражений; пакетная коррекция с использованием ComBat с началом набора данных в качестве переменной пакета; дифференциальная экспрессия, рассчитанная с помощью линейного моделирования лиммы (матрица опухоли против нормального дизайна); ранжированные списки генов, полученные из изменений fold log₂ для входных данных GSEA; а также одномерные и многомерные регрессии Кокса, проведённые с использованием инструментов анализа выживаемости
6. Анализ вариации генных наборов (GSVA)
GSVA 28 был использован для измерения способов улучшения между кластерами. В наборе данных TCGA-UCEC было обогащено 50 характерных путей, из которых 41 показал значительные изменения между бинарными сборками. GSVA использовался с характерными наборами генов для оценки активности путей на образец; Данные взаимодействия белков STRING были импортированы в Cytoscape; алгоритм MCC использовался для идентификации генов хаба; оценки риска рассчитывались как сумма значений экспрессии генов, умноженная на их коэффициенты Кокса; временно-зависящие кривые ROC были сгенерированы с помощью рутин, связанных с выживанием временем. Для каждой выборки GSVA вычислял оценки обогащения на уровне пути. Тест Уилкоксона с суммой ранга используется для оценки различий в активности характерных путей. Из пятидесяти сигнатурных путей сорок один отличался значительно (скорректированный p < 0,05).
7. Система взаимодействия белков и белков (ИПП)
Была создана система PPI, содержащая важные гены (AURKA, CDKN3, FOXM1, CDKN2A, TK1 и CDK1), используя файл STRING29 и порог значения коммуникации 0,70, что указывает на высокую достоверность. Эта сеть была создана с использованием Cytoscape30, выделивая взаимодействия, которые могут играть ключевую роль в патогенезе UCEC. Метод максимальной центральности клик (MCC)31 был полезен для ранжирования наследуемого фактора, созданного по их показателям взаимодействия в сети. Была распознана верхняя 10 белковых последовательностей с наивысшими показателями интерфейса, включая CDK2, CDK4, CCNA2, CCNB1, CCNE1, CDK1, TP53 и FOXM1. Эти гены были дополнительно проанализированы на предмет их участия в критически важных биологических процессах. ПлатформаGeneMANIA 32 также использовалась для прогнозирования дополнительных взаимодействий белков и предоставления более широкого контекста роли ключевых генов в прогрессировании UCEC. Порог доверия STRING: >0,70 (высокая уверенность). Cytoscape отображает сеть. Метод максимальной центральности клик (MCC) используется для ранжирования генов хаба. Рейтинг MCC использовался для выявления наиболее взаимодействующих генов (CDK2, CCNA2, TP53 и др.). Дополнительные прогнозы взаимодействия делаются с помощью GeneMANIA.
8. Технологическая дорожная карта
Общий рабочий процесс и методы, использованные в этом исследовании, обобщены в дорожной карте технологий, показанной на рисунке 1. Эта дорожная карта описывает этапы от сбора наборов данных и анализа дифференциальных выражений до построения прогностических моделей и анализа обогащения.
9. Статистический анализ
Обработка данных и статистическая оценка осуществлялись с помощью программы R (v4.3.0). Тест Mann-Whitney U или t-тест независимого студента использовался для сравнения в двух группах; тест Крускаля-Уоллиса применялся для трёх и более сборок. Описательные данные оценивались с помощью хи-квадрата или точного теста Фишера. Кроме того, были проведены корреляции Спирмана и анализ выживаемости Каплана-Майера; p < 0,05 считался значимым.
Применение статистических тестов в соответствии с распределением данных: обычные данные с использованием t-теста ученика. Тест Mann-Whitney U на данные, которые не являются нормальными. Тест Крускал-Уоллис более чем для трёх групп. Точность Фишера и хи-квадрат для категориальных данных. Статистическая значимость определяется как p < 0,05.
Надёжность данных поддерживается контрольными точками предварительной обработки, где boxplot должен показывать согласованную дисперсию экспрессии между образцами, а PCA-графики — отсутствие пакетно-специфических кластеров после корректировки ComBat. Для валидации ДЕГ необходимы тепловые карты, демонстрирующие группировку нормальных опухолей, и вулканические графики, чётко иллюстрирующие регуляцию генов вверх/вниз. Для модели проекции Кокса графики калибровки должны совпадать с прогнозируемой и фактической выживаемостью, значения AUC ROC должны превышать 0,65, а дуги КМ должны показывать значительную разницу в выживаемости. Различные активности по маршрутам между группами риска должны быть показаны с помощью анализа GSVA, в соответствии с установленными механизмами, такими как расширение или клеточные циклы. Для проверки устойчивости сети в сети PPI должны располагаться в центре, а гены хаба, определяемые MCC, должны соответствовать физиологически значимым регуляторам.