$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Все данные, использованные в этом исследовании, были получены из общедоступных баз данных (TCGA, GEO и METABRIC). Участники или животные не участвовали; поэтому одобрение Институционального контрольного совета и информированное согласие не требовались.
Сбор и предобработка данных
Данные экспрессии генов, связанные с резистентностью к тамоксифену, были получены из базы данных Gene Expression Omnibus (GEO) 10. Набор данных GSE67916 (Affymetrix Human Genome U133 Plus 2.0 Array) включает 18 образцов клеток рака молочной железы: 8 необработанных контрольных образцов и 10 образцов с резистентностью к тамоксифену, полученных в результате длительного воздействия лекарств. Данные секвенирования РНК и соответствующая клиническая информация для когорты инвазивной карциномы молочной железы (TCGA-BRCA) были скачаны из Атласа генома рака (TCGA)11.
Необработанные микрочиповые CEL-файлы обрабатывались в R (версия 4.4.2) с помощью пакета affy. Коррекция фона и нормализация выполнялись с помощью алгоритма Robust Multi-array Average (RMA), включая преобразование log2 и нормализацию квантиль. Идентификаторы зонда сопоставлялись с генными символами с помощью аннотационных файлов платформы; Для генов с несколькими зондами использовалось среднее значение экспрессии. Для данных TCGA RNA-seq значения транскриптов на миллион (TPM) были преобразованы в log2 [log2(TPM + 1)]. Были исключены образцы с неполной информацией о выживаемости или отсутствующими клиническими переменными.
Идентификация дифференциально экспрессированных генов
Дифференциальная экспрессия между образцами, устойчивыми к тамоксифену, и контрольными образцами оценивалась с использованием пакета limmaR 12 с эмпирической байесовской модерацией. Гены с изменением |log2 fold| > 1 и скорректированное значение P < 0,05 (Бенджамини–Хохберг FDR) были определены как дифференциально экспрессированные гены (DEG).
Анализ функционального обогащения
Анализы Gene Ontology (GO)13и Kyoto Encyclopedia of Genes and Genomes (KEGG)14 были проведены с использованием пакета clusterProfiler15 R. Категории ГО включали биологический процесс (БП), клеточный компонент (CC) и молекулярную функцию (MF). Скорректированные значения P < 0,05 считались значимыми.
Выбор признаков на основе машинного обучения
Для идентификации хабовых генов были применены три алгоритма машинного обучения: (1) регрессияLASSO 16 (пакет glmnet) с 10-кратной перекрёстной валидацией для выбора оптимального штрафного параметра (lambda.min); (2) Поддержка векторного машинно-рекурсивного устранения признаков (SVM-RFE)17 (пакет e1071) с пятикратной перекрёстной валидацией для выявления минимального подмножества генов с наименьшей ошибкой классификации; (3) Случайный лес (RF)18 (пакет randomForest) с 500 деревьями (ntree = 500); гены ранжировали по MeanReductionGini. Гены, идентифицированные всеми тремя методами, были определены как хаб-гены.
Построение модели прогностического риска
Была построена многогенная прогностическая модель риска с использованием данных экспрессии и выживаемости генов TCGA-BRCA. Гены, связанные с выживаемостью, были скринингированы с помощью унивариантной регрессии Кокса, затем многомерной регрессии Кокса для формирования окончательной подписи. Формула оценки риска была рассчитана следующим образом: Risk score = (0.01297 × CAMK1D) + (0.03021 × CHAC1) + (0.02018 × KIAA0513) + (0.00647 × MED13) + (0.00108 × NDRG1) + (0.04551 × STXBP5). Пациенты были стратифицированы на группы с высоким и низким риском на основе медианного рейтинга риска.
Оценка и валидация прогностической модели
Общие различия в выживаемости между группами оценивались с помощью анализа Каплана–Майера и логарифмического теста. Предиктивная производительность оценивалась с помощью кривых ROC (пакет pROC) и анализа ROC, зависящего от времени, (пакет timeROC). С использованием пакета RMS была построена номограмма, интегрирующая оценки риска и клинические переменные. Калибровочные кривые оценивали соответствие между предсказанными и наблюдаемыми вероятностями выживаемости. Внешняя валидация проводилась в независимой когорте19 Международного консорциума по молекулярной таксономии рака молочной железы (METABRIC) с использованием той же формулы и порога.
Анализ иммунной инфильтрации
Инфильтрация иммунных клеток оценивалась с помощьюCIBERSORT 20 с 1000 перестановками на основе данных TCGA. Были включены образцы с P < 0,05. Различия в составе иммунных клеток между группами с высоким и низким риском оценивались с помощью теста Уилкоксона ранг-сумма, а корреляции между экспрессией генов хаба и численностью иммунных клеток оценивались с помощью корреляции ранга Спирмана.
Статистический анализ
Все анализы проводились в R. Непрерывные переменные сравнивались с помощью теста ранга Уилкоксона, а категориальные переменные — с помощью теста хи-квадрата. Двустороннее P < 0,05 считалось статистически значимым.