Questo studio ha utilizzato dati pubblicamente disponibili e anonimizzati provenienti da TCGA, HPA e altri database ad accesso aperto, e non ha comportato il reclutamento di nuovi partecipanti umani, esperimenti su animali né l'uso di informazioni private identificabili. Pertanto, non è stato necessario ottenere un'ulteriore approvazione etica istituzionale né il consenso informato. Informazioni dettagliate sugli strumenti utilizzati nel protocollo sono fornite nella Tabella dei Materiali.
1. Dati pubblici e analisi bioinformatica
Sono stati utilizzati set di dati pubblicamente disponibili, e non è stata condotta alcuna ricerca diretta su partecipanti umani o animali. I dati trascrittomici e clinici sono stati ottenuti dal progetto The Cancer Genome Atlas Kidney Renal Clear Cell Carcinoma (TCGA-KIRC), mentre i dati sull'espressione proteica sono stati recuperati dalla Human Protein Atlas. Questo approccio computazionale ha permesso uno screening efficiente di ampi set di dati trascrittomici e clinici, ha supportato l'identificazione preliminare di biomarcatori candidati e ha fornito una base per successive validazioni sperimentali. Tutte le analisi computazionali sono state eseguite utilizzando software statistici.
2. Acquisizione dei dati e selezione del campione
È stato consultato il portale dati del Genomic Data Commons ed è stato selezionato il progetto TCGA-KIRC. Sono stati scaricati i dati di profilazione del trascrittoma e le corrispondenti informazioni cliniche relativi al carcinoma a cellule chiare del rene (ccRCC). Per le analisi trascrittomique successive sono stati utilizzati dati di espressione dell'RNA messaggero normalizzati in base ai trascritti per milione (TPM). I valori di espressione di ARHGAP22 sono stati estratti dalla matrice trascrittomica di TCGA-KIRC e abbinati ai corrispondenti record clinici utilizzando i codici a barre dei campioni TCGA. Sono stati inclusi tessuti tumorali primari e tessuti renali normali adiacenti per cui erano disponibili dati sull'espressione di ARHGAP22 e annotazioni cliniche. Sono stati esclusi i campioni con valori di espressione di ARHGAP22 mancanti, informazioni cliniche o di sopravvivenza chiave incomplete, record duplicati o tempi di sopravvivenza inferiori a 30 giorni. Dopo il filtraggio, sono stati mantenuti 533 campioni tumorali e 72 campioni di tessuto normale adiacente per le analisi successive.
3. Analisi dell'espressione pan-cancro
L'analisi dell'espressione pan-cancro di ARHGAP22 è stata eseguita utilizzando il modulo Gene_DE di TIMER2.0 (http://timer.cistrome.org/; accesso 12 aprile 2026). I dati di RNA-sequenziamento del TCGA sono stati utilizzati per confrontare l'espressione di ARHGAP22 tra tessuti tumorali e tessuti normali corrispondenti in diversi tipi di cancro. I valori di espressione sono stati presentati come log2(TPM) e l'espressione differenziale è stata valutata mediante il test di Wilcoxon rank-sum implementato in TIMER2.0. Un valore P bilaterale inferiore a 0,05 è stato considerato statisticamente significativo.
4. Validazione esterna su GEO
La validazione esterna è stata eseguita utilizzando il dataset Gene Expression Omnibus GSE167573 tramite la piattaforma online BEST (https://rookieutopia.hiplot.com.cn/app_direct/BEST/; accesso del 9 luglio 2026). L'espressione di ARHGAP22 nei tessuti di ccRCC e nei tessuti renali normali è stata confrontata utilizzando i dati di espressione normalizzati forniti dalla piattaforma e valutata mediante test t di Student non appaiato. Per l'analisi della sopravvivenza, i pazienti sono stati suddivisi in gruppi ad alta e bassa espressione utilizzando il metodo di cutoff ottimale della piattaforma, e la sopravvivenza complessiva è stata valutata mediante analisi di Kaplan-Meier con il test log-rank. Un valore P bilaterale inferiore a 0,05 è stato considerato statisticamente significativo.
5. Analisi dell'espressione di ARHGAP22
I dati di espressione dell'RNA messaggero di ARHGAP22, normalizzati per TPM, sono stati estratti dal cohort TCGA-KIRC e trasformati come log2(TPM + 1) prima dell'analisi statistica. È stata valutata l'espressione differenziale di ARHGAP22 tra tessuti tumorali primari e tessuti renali normali adiacenti. Il test del rango sommato di Wilcoxon è stato utilizzato per confronti non appaiati tra tessuti tumorali e normali. Per l'analisi appaiata, sono state identificate coppie tumorali-normali corrispondenti utilizzando i codici a barre dei pazienti TCGA, e il test del rango con segno di Wilcoxon è stato applicato per confrontare l'espressione di ARHGAP22 tra tessuti normali adiacenti e i corrispondenti tessuti tumorali. Un valore P bilaterale inferiore a 0,05 è stato considerato statisticamente significativo.
6. Analisi della sopravvivenza e della caratteristica operativa del ricevitore
Le analisi della sopravvivenza e della caratteristica operativa del ricevitore (ROC) dipendente dal tempo sono state effettuate utilizzando campioni tumorali di TCGA-KIRC con dati clinici di follow-up disponibili. Il tempo di sopravvivenza complessivo è stato convertito da giorni a anni. I pazienti sono stati suddivisi in gruppi ad alta e bassa espressione di ARHGAP22 utilizzando il valore mediano di espressione di ARHGAP22, e lo stesso cutoff è stato applicato in modo coerente in tutte le analisi che prevedevano il raggruppamento in base all'espressione. Le curve di Kaplan-Meier sono state generate utilizzando il pacchetto survival e il pacchetto survminer. Le differenze tra i gruppi sono state valutate mediante il test log-rank. La regressione dei rischi proporzionali di Cox è stata utilizzata per stimare i rapporti di rischio e gli intervalli di confidenza al 95%. Le curve ROC dipendenti dal tempo sono state generate utilizzando il pacchetto timeROC. Le aree sotto la curva a 1, 3 e 5 anni sono state calcolate utilizzando il metodo di ponderazione di Aalen. Un valore P bilaterale inferiore a 0,05 è stato considerato statisticamente significativo.
7. Analisi dell'associazione clinicopatologica
L'associazione tra l'espressione di ARHGAP22 e le caratteristiche clinicopatologiche è stata analizzata utilizzando campioni tumorali di TCGA-KIRC. I campioni normali sono stati esclusi. L'età è stata suddivisa in due categorie: 65 anni o meno e oltre 65 anni. I campioni con annotazioni sconosciute o mancanti sono stati esclusi dall'analisi corrispondente. Per i confronti tra due gruppi è stato utilizzato il test di Wilcoxon rank-sum, mentre per i confronti tra tre o più gruppi è stato impiegato il test di Kruskal-Wallis. I grafici a violino sono stati generati utilizzando i pacchetti ggpubr, ggplot2 e scales. Per la visualizzazione tramite heatmap, i pazienti sono stati classificati in gruppi ad alta e bassa espressione di ARHGAP22 utilizzando la soglia mediana. Le associazioni tra i gruppi di espressione e le variabili clinicopatologiche sono state valutate mediante test del chi-quadrato. Le heatmap sono state generate con ComplexHeatmap, dopo un pre-elaborazione effettuata con limma. Un valore P bilaterale inferiore a 0,05 è stato considerato statisticamente significativo.
8. Costruzione del nomogramma
Un nomogramma prognostico è stato costruito integrando l'espressione di ARHGAP22 con le caratteristiche clinicopatologiche disponibili in un modello di regressione dei rischi proporzionali di Cox. Il modello è stato utilizzato per stimare la sopravvivenza complessiva a 1, 3 e 5 anni nel coorte TCGA-KIRC. I punteggi di rischio individuali dei pazienti sono stati calcolati utilizzando il modello di Cox stimato. Le curve di calibrazione per la sopravvivenza complessiva a 1, 3 e 5 anni sono state generate mediante il metodo di Kaplan-Meier con 1.000 iterazioni di ricampionamento bootstrap. È stata valutata la concordanza tra le probabilità di sopravvivenza predette dal nomogramma e i risultati osservati di sopravvivenza. La regressione di Cox è stata eseguita utilizzando il pacchetto survival. La visualizzazione del nomogramma e le analisi di calibrazione sono state effettuate utilizzando regplot e rms. Un valore P bilaterale inferiore a 0,05 è stato considerato statisticamente significativo.
9. Analisi di co-espressione
I dati trascrittomici provenienti dai campioni tumorali di TCGA-KIRC sono stati utilizzati per valutare le relazioni di co-espressione tra ARHGAP22 e tutti gli altri geni mediante analisi di correlazione di Pearson. I geni con un coefficiente di correlazione di Pearson assoluto maggiore di 0,6 e un valore P inferiore a 0,001 sono stati definiti come geni significativamente co-espressi. I geni significativamente co-espressi sono stati ordinati in base al valore assoluto del coefficiente di correlazione. I geni con il punteggio più alto sono stati selezionati per costruire una matrice di correlazione, e un diagramma a corde è stato generato per visualizzare la rete di co-espressione associata ad ARHGAP22.
10. Analisi dei geni differenzialmente espressi e arricchimento funzionale
L'analisi dell'espressione differenziale tra i gruppi con alta e bassa espressione di ARHGAP22 è stata effettuata utilizzando il test della somma dei ranghi di Wilcoxon con correzione per il tasso di falsa scoperta (FDR). I geni con un valore assoluto del log2 fold change maggiore di 1 e un FDR inferiore a 0,05 sono stati definiti come geni differenzialmente espressi in modo significativo. I risultati sono stati visualizzati mediante un grafico a vulcano e una mappa termica. Le analisi di arricchimento per Gene Ontology e Kyoto Encyclopedia of Genes and Genomes sono state eseguite utilizzando clusterProfiler. I simboli dei geni sono stati convertiti in identificatori Entrez mediante org.Hs.eg.db. I termini di Gene Ontology e i percorsi di Kyoto Encyclopedia of Genes and Genomes con un valore P nominale inferiore a 0,05 e un valore P corretto per FDR inferiore a 0,05 sono stati considerati significativamente arricchiti. L'analisi di arricchimento dei set di geni è stata effettuata utilizzando i set di geni di Kyoto Encyclopedia of Genes and Genomes presenti nel file della Molecular Signatures Database c2.cp.kegg.v7.4.symbols.gmt. I geni sono stati ordinati in base al log2 fold change e i set di geni con un valore P nominale < 0,05 sono stati considerati significativamente arricchiti.
11. Analisi dell'infiltrazione immunitaria e dei checkpoint immunitari
Le analisi dell'infiltrazione immunitaria e dei checkpoint immunitari sono state effettuate utilizzando campioni tumorali di TCGA-KIRC. I valori di StromalScore, ImmuneScore e ESTIMATEScore sono stati calcolati mediante il pacchetto estimate. Le frazioni delle cellule immunitarie sono state stimate usando lo script R CIBERSORT, con 1.000 permutazioni e normalizzazione quantilica. Sono stati mantenuti i campioni con un valore P di deconvoluzione CIBERSORT inferiore a 0,05. I pazienti sono stati suddivisi in gruppi ARHGAP22-alto e ARHGAP22-basso in base al livello mediano di espressione di ARHGAP22. Le differenze nei punteggi ESTIMATE e nelle frazioni delle cellule immunitarie tra i due gruppi sono state valutate mediante il test di Wilcoxon per ranghi. Le correlazioni tra l'espressione di ARHGAP22 e i geni dei checkpoint immunitari sono state analizzate tramite il coefficiente di correlazione di Pearson. I valori P derivanti dai confronti multipli tra cellule immunitarie e dai test di correlazione dei checkpoint immunitari sono stati corretti con il metodo FDR di Benjamini–Hochberg, considerando statisticamente significativo un FDR inferiore a 0,05. I geni dei checkpoint immunitari significativi per FDR sono stati visualizzati mediante mappe termiche di correlazione generate con corrplot. La pre-elaborazione e la visualizzazione dei dati sono state eseguite principalmente utilizzando limma, ggpubr e corrplot.
12. Previsione della sensibilità ai farmaci
I dati trascrittomici dei tumori TCGA-KIRC sono stati utilizzati dopo l'esclusione dei campioni di tessuto normale. I valori predetti computazionalmente della concentrazione inibitoria massima al 50% sono stati calcolati utilizzando il pacchetto oncoPredict e il set di dati di riferimento basato sul Genomics of Drug Sensitivity in Cancer 2. I pazienti sono stati suddivisi in gruppi ARHGAP22-alto e ARHGAP22-basso in base al valore mediano di espressione di ARHGAP22. I valori predetti della concentrazione inibitoria massima al 50% sono stati confrontati tra i gruppi mediante il test della somma dei ranghi di Wilcoxon. I valori P derivanti dai confronti multipli tra farmaci sono stati corretti utilizzando il metodo di Benjamini–Hochberg, e un FDR inferiore a 0,05 è stato considerato statisticamente significativo. I risultati sono stati interpretati come stime computazionali della sensibilità ai farmaci, piuttosto che come risposte farmacologiche validate sperimentalmente o osservate clinicamente.
13. Validazione tramite Human Protein Atlas
È stato consultato il database Human Protein Atlas ed è stato cercato ARHGAP22. È stata esaminata la sezione Tessuti per valutare l'espressione proteica di ARHGAP22 nel tessuto renale normale. È stata aperta la sezione Patologia, è stato selezionato il carcinoma a cellule chiare del rene e l'espressione proteica di ARHGAP22 nel tessuto tumorale è stata analizzata. Sono state recuperate e selezionate immagini rappresentative di immunohistochimica di tessuto renale normale e di tessuto di ccRCC da includere nel manoscritto, al fine di confrontare l'espressione proteica di ARHGAP22 tra tessuti normali e tumorali.