Cette étude a utilisé des données publiques dé-identifiées provenant de TCGA, de HPA et d'autres bases de données en accès libre, et n'a pas impliqué de recrutement supplémentaire de participants humains, d'expériences sur des animaux ni d'informations personnelles identifiables. Par conséquent, aucune approbation éthique institutionnelle ni consentement éclairé supplémentaire n'était requise. Des informations détaillées sur les outils utilisés dans le protocole sont fournies dans le Tableau des matériaux.
1. Ensembles de données publiques et analyse bioinformatique
Des ensembles de données accessibles publiquement ont été utilisés, et aucune recherche directe impliquant des participants humains ou des animaux n’a été menée. Les données transcriptomiques et cliniques ont été obtenues auprès du projet du Cancer Genome Atlas sur le carcinome rénal à cellules claires (TCGA-KIRC), et les données d'expression protéique ont été extraites de l'Atlas des protéines humaines. Cette approche computationnelle a permis un criblage efficace de grands ensembles de données transcriptomiques et cliniques, a soutenu l'identification préliminaire de biomarqueurs candidats et a fourni une base pour la validation expérimentale ultérieure. Toutes les analyses computationnelles ont été effectuées à l'aide de logiciels statistiques.
2. Acquisition des données et sélection des échantillons
Le portail de données du Genomic Data Commons a été consulté et le projet TCGA-KIRC a été sélectionné. Les données de profilage transcriptomique et les informations cliniques correspondantes pour le carcinome rénal à cellules claires (ccRCC) ont été téléchargées. Les données d'expression de l'ARN messager normalisées en transcripts par million (TPM) ont été utilisées pour les analyses transcriptomiques ultérieures. Les valeurs d'expression d'ARHGAP22 ont été extraites de la matrice transcriptomique TCGA-KIRC et appariées aux dossiers cliniques correspondants à l'aide des codes-barres des échantillons TCGA. Les tissus tumoraux primitifs et les tissus rénaux normaux adjacents disposant de données d'expression d'ARHGAP22 et d'annotations cliniques ont été inclus. Ont été exclus les échantillons dont les valeurs d'expression d'ARHGAP22 étaient manquantes, qui présentaient des informations cliniques ou de survie incomplètes, des doublons ou des durées de survie inférieures à 30 jours. Après filtration, 533 échantillons tumoraux et 72 échantillons de tissus normaux adjacents ont été conservés pour les analyses ultérieures.
3. Analyse d'expression pancancéreuse
Une analyse d'expression pancancéreuse de ARHGAP22 a été réalisée à l'aide du module Gene_DE de TIMER2.0 (http://timer.cistrome.org/; consulté le 12 avril 2026). Les données de séquençage ARN du projet TCGA ont été utilisées pour comparer l'expression de ARHGAP22 entre les tissus tumoraux et les tissus normaux correspondants dans plusieurs types de cancer. Les valeurs d'expression sont présentées sous forme de log2(TPM), et l'expression différentielle a été évaluée à l'aide du test de Wilcoxon-Mann-Whitney intégré à TIMER2.0. Une valeur de P bilatérale inférieure à 0,05 a été considérée comme statistiquement significative.
4. Validation externe sur GEO
La validation externe a été réalisée à l'aide du jeu de données Gene Expression Omnibus GSE167573, via la plateforme en ligne BEST (https://rookieutopia.hiplot.com.cn/app_direct/BEST/; consulté le 9 juillet 2026). L'expression d'ARHGAP22 dans les tissus de ccRCC et les tissus rénaux normaux a été comparée à l'aide des données d'expression normalisées fournies par la plateforme, et évaluée par un test t de Student non apparié. Pour l'analyse de survie, les patients ont été répartis en deux groupes, à expression élevée et faible, selon la méthode de seuil optimal de la plateforme, et la survie globale a été évaluée par une analyse de Kaplan-Meier avec le test du log-rang. Une valeur de P bilatérale inférieure à 0,05 a été considérée comme statistiquement significative.
5. Analyse de l'expression d'ARHGAP22
Les données d'expression de l'ARN messager d'ARHGAP22 normalisées par TPM ont été extraites de la cohorte TCGA-KIRC et transformées selon log2(TPM + 1) avant l'analyse statistique. L'expression différentielle d'ARHGAP22 entre les tissus tumoraux primitifs et les tissus rénaux normaux adjacents a été évaluée. Le test de Wilcoxon a été utilisé pour les comparaisons non appariées entre tissus tumoraux et tissus normaux. Pour l'analyse appariée, des paires tumorales-normales appariées ont été identifiées à l'aide des codes-barres patients de TCGA, et le test de Wilcoxon pour échantillons appariés a été appliqué afin de comparer l'expression d'ARHGAP22 entre les tissus normaux adjacents et les tissus tumoraux correspondants. Une valeur P bilatérale inférieure à 0,05 a été considérée comme statistiquement significative.
6. Analyse de survie et de caractéristique opérationnelle du récepteur
Les analyses de survie et de caractéristique opérationnelle du récepteur (ROC) dépendante du temps ont été réalisées à l’aide d’échantillons tumoraux TCGA-KIRC pour lesquels des données de suivi clinique étaient disponibles. La durée de survie globale a été convertie de jours en années. Les patients ont été répartis en groupes d’expression élevée ou faible de ARHGAP22 en utilisant la valeur médiane d’expression de ARHGAP22, et le même seuil a été appliqué de manière cohérente dans toutes les analyses impliquant un regroupement selon l’expression. Les courbes de Kaplan-Meier ont été générées à l’aide du package survival et du package survminer. Les différences entre groupes ont été évaluées par le test du log-rank. Une régression de Cox aux risques proportionnels a été utilisée pour estimer les rapports de risques et les intervalles de confiance à 95 %. Les courbes ROC dépendantes du temps ont été générées à l’aide du package timeROC. Les aires sous la courbe à 1, 3 et 5 ans ont été calculées selon la méthode de pondération d’Aalen. Une valeur P bilatérale inférieure à 0,05 a été considérée comme statistiquement significative.
7. Analyse de l'association clinicopathologique
L'association entre l'expression d'ARHGAP22 et les caractéristiques clinicopathologiques a été analysée à l'aide des échantillons tumoraux de TCGA-KIRC. Les échantillons normaux ont été exclus. L'âge a été catégorisé en deux groupes : 65 ans ou moins, et plus de 65 ans. Les échantillons dont les annotations étaient inconnues ou manquantes ont été exclus de l'analyse correspondante. Le test de Wilcoxon-Mann-Whitney a été utilisé pour les comparaisons entre deux groupes, et le test de Kruskal-Wallis pour les comparaisons impliquant trois groupes ou plus. Les diagrammes en violon ont été générés à l'aide des packages ggpubr, ggplot2 et scales. Pour la visualisation sous forme de carte thermique, les patients ont été classés en groupes d'expression élevée ou faible d'ARHGAP22 en utilisant le seuil médian. Les associations entre les groupes d'expression et les variables clinicopathologiques ont été évaluées à l'aide de tests du chi-deux. Les cartes thermiques ont été générées à l'aide de ComplexHeatmap, après prétraitement avec limma. Une valeur de P bilatérale inférieure à 0,05 a été considérée comme statistiquement significative.
8. Construction du nomogramme
Un nomogramme pronostique a été construit en intégrant l'expression d'ARHGAP22 avec les caractéristiques clinicopathologiques disponibles dans un modèle de régression de Cox aux risques proportionnels. Le modèle a été utilisé pour estimer la survie globale à 1, 3 et 5 ans dans la cohorte TCGA-KIRC. Les scores de risque individuels des patients ont été calculés à l’aide du modèle de Cox ajusté. Des courbes de calibration pour la survie globale à 1, 3 et 5 ans ont été générées selon la méthode de Kaplan-Meier avec 1 000 itérations de rééchantillonnage bootstrap. La concordance entre les probabilités de survie prédites par le nomogramme et les résultats observés a été évaluée. La régression de Cox a été réalisée à l’aide du package survival. La visualisation du nomogramme et les analyses de calibration ont été effectuées à l’aide des packages regplot et rms. Une valeur de P bilatérale inférieure à 0,05 a été considérée comme statistiquement significative.
9. Analyse de co-expression
Les données transcriptomiques provenant des échantillons tumoraux de TCGA-KIRC ont été utilisées pour évaluer les relations de co-expression entre ARHGAP22 et tous les autres gènes par analyse de corrélation de Pearson. Les gènes présentant un coefficient de corrélation de Pearson absolu supérieur à 0,6 et une valeur P inférieure à 0,001 ont été définis comme des gènes co-exprimés de manière significative. Les gènes co-exprimés de manière significative ont été classés selon la valeur absolue du coefficient de corrélation. Les gènes les mieux classés ont été sélectionnés pour construire une matrice de corrélation, et un diagramme en cordes a été généré afin de visualiser le réseau de co-expression associé à ARHGAP22.
10. Analyse des gènes différentiellement exprimés et analyses d'enrichissement fonctionnel
Une analyse d'expression différentielle entre les groupes à expression élevée et faible de ARHGAP22 a été réalisée à l'aide du test de Wilcoxon avec correction du taux de fausses découvertes (FDR). Les gènes présentant une variation absolue du log2 supérieur à 1 et un FDR inférieur à 0,05 ont été considérés comme significativement différentiellement exprimés. Les résultats ont été visualisés à l'aide d'un diagramme en volcan et d'une carte thermique. Des analyses d'enrichissement de l'Ontologie des gènes et de l'Encyclopédie de Kyoto des gènes et des génomes (KEGG) ont été effectuées à l'aide de clusterProfiler. Les symboles des gènes ont été convertis en identifiants Entrez à l'aide de org.Hs.eg.db. Les termes de l'Ontologie des gènes et les voies de KEGG présentant à la fois une valeur P nominale inférieure à 0,05 et une valeur P ajustée par FDR inférieure à 0,05 ont été considérés comme significativement enrichis. L'analyse d'enrichissement de l'ensemble des gènes a été réalisée à l'aide des ensembles de gènes KEGG extraits du fichier de la base de signatures moléculaires c2.cp.kegg.v7.4.symbols.gmt. Les gènes ont été classés selon leur variation du log2, et les ensembles de gènes ayant une valeur P nominale < 0,05 ont été considérés comme significativement enrichis.
11. Analyse de l'infiltration immunitaire et des points de contrôle immunitaires
Les analyses de l'infiltration immunitaire et des points de contrôle immunitaires ont été réalisées à l'aide d'échantillons tumoraux provenant de TCGA-KIRC. Les valeurs StromalScore, ImmuneScore et ESTIMATEScore ont été calculées à l'aide du package estimate. Les fractions de cellules immunitaires ont été estimées à l'aide du script R CIBERSORT, avec 1 000 permutations et une normalisation par quantiles. Les échantillons présentant une valeur P de déconvolution CIBERSORT inférieure à 0,05 ont été conservés. Les patients ont été répartis en deux groupes, ARHGAP22-élevé et ARHGAP22-faible, selon le niveau médian d'expression d'ARHGAP22. Les différences de scores ESTIMATE et de fractions de cellules immunitaires entre les deux groupes ont été évaluées à l'aide du test de Wilcoxon. Les corrélations entre l'expression d'ARHGAP22 et les gènes des points de contrôle immunitaires ont été analysées par corrélation de Pearson. Les valeurs P issues des comparaisons multiples de cellules immunitaires et des tests de corrélation des points de contrôle immunitaires ont été ajustées selon la méthode FDR de Benjamini–Hochberg, et une FDR inférieure à 0,05 a été considérée comme statistiquement significative. Les gènes des points de contrôle immunitaires significatifs au seuil de FDR ont été visualisés à l'aide de cartes thermiques de corrélation générées avec corrplot. Le prétraitement et la visualisation des données ont été principalement effectués à l'aide des packages limma, ggpubr et corrplot.
12. Prédiction de la sensibilité aux médicaments
Les données transcriptomiques tumorales de TCGA-KIRC ont été utilisées après exclusion des échantillons de tissus normaux. Les valeurs de concentration inhibitrice demi-maximale prédites par calcul ont été déterminées à l’aide du package oncoPredict et du jeu de données de référence Genomics of Drug Sensitivity in Cancer 2. Les patients ont été répartis en groupes ARHGAP22-fort et ARHGAP22-faible selon la valeur médiane d’expression d’ARHGAP22. Les valeurs prédites de concentration inhibitrice demi-maximale ont été comparées entre les groupes à l’aide du test de Wilcoxon. Les valeurs de p issues de comparaisons multiples de médicaments ont été ajustées selon la méthode de Benjamini–Hochberg, et un FDR inférieur à 0,05 a été considéré comme statistiquement significatif. Les résultats ont été interprétés comme des estimations informatiques de la sensibilité aux médicaments, et non comme des réponses médicamenteuses validées expérimentalement ou observées cliniquement.
13. Validation par l'Atlas des protéines humaines
La base de données de l'Atlas des protéines humaines a été consultée et ARHGAP22 a été recherché. La section Tissus a été examinée afin d'évaluer l'expression protéique de ARHGAP22 dans le tissu rénal normal. La section Pathologie a été ouverte, le carcinome rénal à cellules claires a été sélectionné, et l'expression protéique de ARHGAP22 dans le tissu tumoral a été analysée. Des images immunohistochimiques représentatives de tissu rénal normal et de tissu de CCRc ont été récupérées et choisies pour être incluses dans le manuscrit, afin de comparer l'expression protéique de ARHGAP22 entre les tissus normaux et tumoraux.