В данном исследовании использовались общедоступные обезличенные данные из TCGA, HPA и других баз данных с открытым доступом; работа не предусматривала набора новых участников-людей, проведения экспериментов на животных или использования идентифицируемой частной информации. Таким образом, дополнительного одобрения институционального комитета по этике и информированного согласия не требовалось. Подробная информация об инструментах, использованных в протоколе, представлена в Таблице материалов.
1. Общедоступные наборы данных и биоинформационный анализ
Были использованы общедоступные наборы данных; прямых исследований с участием людей или животных не проводилось. Транскриптомные и клинические данные были получены из проекта The Cancer Genome Atlas Kidney Renal Clear Cell Carcinoma (TCGA-KIRC), а данные об экспрессии белков — из базы Human Protein Atlas. Данный вычислительный подход позволил эффективно проскринировать крупномасштабные транскриптомные и клинические наборы данных, способствовал предварительному выявлению потенциальных биомаркеров и заложил основу для последующей экспериментальной валидации. Все вычислительные анализы были выполнены с использованием статистического программного обеспечения.
2. Сбор данных и выбор образцов
Был осуществлен доступ к порталу данных Genomic Data Commons, где был выбран проект TCGA-KIRC. Были загружены данные профилирования транскриптома и соответствующая клиническая информация для светлоклеточного почечно-клеточного рака (ccRCC). Для последующего транскриптомного анализа использовались данные об экспрессии матричной РНК, нормализованные по количеству транскриптов на миллион (TPM). Значения экспрессии ARHGAP22 были извлечены из транскриптомной матрицы TCGA-KIRC и сопоставлены с соответствующими клиническими записями с помощью штрихкодов образцов TCGA. В анализ были включены ткани первичной опухоли и прилегающие нормальные ткани почки, для которых были доступны данные об экспрессии ARHGAP22 и клинические аннотации. Образцы с отсутствующими значениями экспрессии ARHGAP22, неполной ключевой клинической информацией или данными о выживаемости, дублирующимися записями или временем выживаемости менее 30 дней были исключены. После фильтрации для дальнейшего анализа было оставлено 533 образца опухоли и 72 образца прилегающей нормальной ткани.
3. Панрак-анализ экспрессии
Панрак-анализ экспрессии ARHGAP22 проводили с помощью модуля Gene_DE программы TIMER2.0 (http://timer.cistrome.org/; доступ 12 апреля 2026 г.). Данные РНК-секвенирования TCGA использовали для сравнения экспрессии ARHGAP22 в опухолевых тканях и соответствующих нормальных тканях при различных типах рака. Значения экспрессии были представлены как log2(TPM), а дифференциальная экспрессия оценивалась с помощью критерия суммы рангов Уилкоксона, реализованного в TIMER2.0. Двустороннее значение P менее 0,05 считалось статистически значимым.
4. Внешняя валидация по данным GEO
Внешняя валидация была проведена с использованием набора данных GSE167573 из базы Gene Expression Omnibus с помощью онлайн-платформы BEST (https://rookieutopia.hiplot.com.cn/app_direct/BEST/; доступна 9 июля 2026 г.). Экспрессию ARHGAP22 в тканях ccRCC и нормальных тканях почек сравнивали с использованием нормализованных данных экспрессии, предоставленных платформой, и оценивали с помощью непарированного t-критерия Стьюдента. Для анализа выживаемости пациенты были разделены на группы с высокой и низкой экспрессией с использованием метода оптимального порога данной платформы; общая выживаемость оценивалась с помощью анализа Каплана–Мейера с применением логарифмического рангового критерия. Двустороннее значение P менее 0,05 считалось статистически значимым.
5. Анализ экспрессии ARHGAP22
Данные об экспрессии матричной РНК ARHGAP22, нормализованные по TPM, были извлечены из когорты TCGA-KIRC и преобразованы в log2(TPM + 1) перед проведением статистического анализа. Была оценена разница в экспрессии ARHGAP22 между тканями первичной опухоли и прилегающими нормальными тканями почек. Для непарных сравнений между опухолевыми и нормальными тканями использовался критерий суммы рангов Уилкоксона. Для парного анализа с помощью штрих-кодов пациентов TCGA были определены соответствующие пары «опухоль-норма», и для сравнения экспрессии ARHGAP22 между прилегающими нормальными тканями и соответствующими опухолевыми тканями применялся критерий знаковых рангов Уилкоксона. Двустороннее значение P < 0,05 считалось статистически значимым.
6. Анализ выживаемости и рабочих характеристик приемника
Анализ выживаемости и зависящий от времени анализ рабочих характеристик приемника (ROC-анализ) проводили с использованием образцов опухолей TCGA-KIRC с имеющимися данными клинического наблюдения. Общая продолжительность выживаемости была переведена из дней в годы. Пациенты были разделены на группы с высокой и низкой экспрессией ARHGAP22 с использованием медианного значения экспрессии ARHGAP22; этот же порог последовательно применялся во всех анализах, включающих группировку на основе экспрессии. Кривые Каплана-Мейера были построены с использованием пакетов survival и survminer. Различия между группами оценивали с помощью лог-рангового критерия. Регрессия пропорциональных рисков Кокса использовалась для оценки отношений рисков и 95% доверительных интервалов. Зависящие от времени ROC-кривые были построены с помощью пакета timeROC. Площади под кривой для периодов в 1, 3 и 5 лет рассчитывали методом взвешивания Алена. Двустороннее значение P менее 0,05 считалось статистически значимым.
7. Анализ клинико-патологических ассоциаций
Связь между экспрессией ARHGAP22 и клинико-патологическими характеристиками анализировали с использованием образцов опухолей TCGA-KIRC. Нормальные образцы были исключены. Возраст разделили на две категории: 65 лет и моложе, а также старше 65 лет. Образцы с неизвестными или отсутствующими аннотациями исключали из соответствующего анализа. Для сравнения двух групп использовали критерий ранговых сумм Уилкоксона, а для сравнения трех и более групп — критерий Краскела — Уоллиса. Скрипичные диаграммы (violin plots) создавали с помощью пакетов ggpubr, ggplot2 и scales. Для визуализации тепловой карты пациентов разделили на группы с высокой и низкой экспрессией ARHGAP22, используя медианное значение в качестве порога. Связи между группами экспрессии и клинико-патологическими переменными оценивали с помощью критерия хи-квадрат. Тепловые карты генерировали с использованием ComplexHeatmap после предварительной обработки с помощью limma. Двустороннее значение P < 0,05 считали статистически значимым.
8. Построение номограммы
Прогностическая номограмма была построена путем интеграции экспрессии ARHGAP22 с имеющимися клинико-патологическими характеристиками в модели регрессии пропорциональных рисков Кокса. Модель использовалась для оценки общей выживаемости через 1, 3 и 5 лет в когорте TCGA-KIRC. Индивидуальные показатели риска пациентов рассчитывались с использованием построенной модели Кокса. Калибровочные кривые для общей выживаемости через 1, 3 и 5 лет были созданы методом Каплана–Мейера с 1000 итерациями бутстреп-ресемплинга. Оценивалось соответствие между вероятностями выживаемости, предсказанными номограммой, и наблюдаемыми исходами выживаемости. Регрессия Кокса выполнялась с использованием пакета survival. Визуализация номограммы и калибровочный анализ проводились с помощью regplot и rms. Двустороннее значение P менее 0,05 считалось статистически значимым.
9. Анализ коэкспрессии
Транскриптомные данные образцов опухолей TCGA-KIRC были использованы для оценки взаимосвязей коэкспрессии между ARHGAP22 и всеми остальными генами с помощью корреляционного анализа Пирсона. Гены с абсолютным коэффициентом корреляции Пирсона более 0,6 и значением P менее 0,001 были определены как значимо коэкспрессируемые гены. Значимо коэкспрессируемые гены были ранжированы в соответствии с абсолютным значением коэффициента корреляции. Гены с наивысшим рангом были выбраны для построения корреляционной матрицы, а для визуализации сети коэкспрессии, связанной с ARHGAP22, была построена хордовая диаграмма.
10. Анализ дифференциально экспрессируемых генов и функционального обогащения
Анализ дифференциальной экспрессии между группами с высоким и низким уровнем экспрессии ARHGAP22 проводили с использованием критерия суммы рангов Вилкоксона с поправкой на ложную скорость обнаружения (FDR). Гены с абсолютным значением log2 кратности изменения (fold change) более 1 и FDR менее 0,05 определялись как статистически значимо дифференциально экспрессируемые гены. Результаты визуализировали с помощью графика «вулкан» (volcano plot) и тепловой карты. Анализ обогащения по Gene Ontology и Kyoto Encyclopedia of Genes and Genomes проводили с использованием пакета clusterProfiler. Символы генов были преобразованы в идентификаторы Entrez с помощью org.Hs.eg.db. Термины Gene Ontology и пути Kyoto Encyclopedia of Genes and Genomes, имеющие номинальное значение P менее 0,05 и скорректированное по FDR значение P менее 0,05, считались статистически значимо обогащенными. Анализ обогащения наборов генов (GSEA) проводили с использованием наборов генов Kyoto Encyclopedia of Genes and Genomes из файла базы данных молекулярных сигнатур c2.cp.kegg.v7.4.symbols.gmt. Гены ранжировали по значению log2 кратности изменения, а наборы генов с номинальным P-value < 0,05 считали статистически значимо обогащенными.
11. Анализ иммунной инфильтрации и иммунных контрольных точек
Анализ иммунной инфильтрации и иммунных контрольных точек проводили с использованием образцов опухолей TCGA-KIRC. Значения StromalScore, ImmuneScore и ESTIMATEScore рассчитывали с помощью пакета estimate. Доли иммунных клеток оценивали с помощью R-скрипта CIBERSORT с использованием 1 000 перестановок и квантильной нормализации. Были отобраны образцы, для которых P-значение деконволюции CIBERSORT было меньше 0,05. Пациентов разделили на группы с высокой и низкой экспрессией ARHGAP22 (ARHGAP22-high и ARHGAP22-low) в соответствии с медианным уровнем экспрессии ARHGAP22. Различия в показателях ESTIMATE и долях иммунных клеток между двумя группами оценивали с помощью критерия суммы рангов Уилкоксона. Корреляцию между экспрессией ARHGAP22 и генами иммунных контрольных точек оценивали методом корреляционного анализа Пирсона. P-значения при множественных сравнениях иммунных клеток и тестах корреляции иммунных контрольных точек корректировали с помощью метода FDR Бенджамина–Хохберга; статистически значимым считался показатель FDR менее 0,05. Значимые по FDR гены иммунных контрольных точек визуализировали с помощью тепловых карт корреляции, построенных с помощью corrplot. Предобработка и визуализация данных выполнялись преимущественно с использованием limma, ggpubr и corrplot.
12. Прогнозирование чувствительности к препаратам
Данные транскриптомики опухолей TCGA-KIRC использовались после исключения образцов нормальной ткани. Значения расчетной полумаксимальной ингибирующей концентрации вычисляли с помощью пакета oncoPredict и эталонного набора данных Genomics of Drug Sensitivity in Cancer 2. Пациентов разделили на группы с высоким и низким уровнем экспрессии ARHGAP22, используя медианное значение экспрессии ARHGAP22. Сравнение расчетных значений полумаксимальной ингибирующей концентрации между группами проводили с помощью критерия суммы рангов Вилкоксона. Значения P при сравнении нескольких препаратов корректировали методом Бенджамини — Хохберга; статистически значимым считали уровень FDR менее 0.05. Результаты интерпретировали как расчетные оценки чувствительности к препаратам, а не как экспериментально подтвержденные или клинически наблюдаемые ответы на терапию.
13. Валидация по атласу белков человека (Human Protein Atlas)
Был осуществлен доступ к базе данных Human Protein Atlas и проведен поиск по ARHGAP22. Был изучен раздел «Ткани» (Tissue) для оценки экспрессии белка ARHGAP22 в нормальной ткани почки. Затем был открыт раздел «Патология» (Pathology), выбрана светлоклеточная почечно-клеточная карцинома и изучена экспрессия белка ARHGAP22 в опухолевой ткани. Были получены и отобраны репрезентативные иммуногистохимические изображения нормальной ткани почки и ткани ccRCC для включения в рукопись с целью сравнения экспрессии белка ARHGAP22 в нормальных и опухолевых тканях.