Este estudio utilizó datos de acceso público y desidentificados de TCGA, HPA y otras bases de datos de acceso abierto, y no implicó la reclutación de nuevos participantes humanos, experimentos con animales ni información privada identificable. Por lo tanto, no se requirió aprobación ética institucional adicional ni consentimiento informado. La información detallada sobre las herramientas utilizadas en el protocolo se proporciona en la Tabla de Materiales.
1. Conjuntos de datos públicos y análisis bioinformáticos
Se utilizaron conjuntos de datos disponibles públicamente, y no se realizó ninguna investigación directa con participantes humanos ni animales. Los datos transcriptómicos y clínicos se obtuvieron del proyecto del Atlas del Genoma del Cáncer de Carcinoma de Células Claras del Riñón (TCGA-KIRC), y los datos de expresión proteica se recuperaron del Atlas de Proteínas Humanas. Este enfoque computacional permitió la selección eficiente de grandes conjuntos de datos transcriptómicos y clínicos, apoyó la identificación preliminar de biomarcadores candidatos y proporcionó una base para la validación experimental posterior. Todos los análisis computacionales se realizaron utilizando software estadístico.
2. Adquisición de datos y selección de muestras
Se accedió al Portal de Datos del Genomic Data Commons y se seleccionó el proyecto TCGA-KIRC. Se descargaron los datos de perfilado transcriptómico y la información clínica correspondiente para el carcinoma de células claras de riñón (ccRCC). Para los análisis transcriptómicos posteriores, se utilizaron datos de expresión de ARNm normalizados en transcripciones por millón (TPM). Los valores de expresión de ARHGAP22 se extrajeron de la matriz transcriptómica de TCGA-KIRC y se asociaron con los registros clínicos correspondientes utilizando los códigos de barras de las muestras de TCGA. Se incluyeron tejidos tumorales primarios y tejidos normales adyacentes al riñón con datos disponibles de expresión de ARHGAP22 y anotaciones clínicas. Se excluyeron las muestras con valores de expresión de ARHGAP22 faltantes, información clínica o de supervivencia incompleta, registros duplicados o tiempos de supervivencia inferiores a 30 días. Tras el filtrado, se conservaron 533 muestras tumorales y 72 muestras de tejido normal adyacente para los análisis posteriores.
3. Análisis de expresión pan-cancero
Se realizó un análisis de expresión pan-cancero de ARHGAP22 utilizando el módulo Gene_DE de TIMER2.0 (http://timer.cistrome.org/; acceso el 12 de abril de 2026). Se utilizaron datos de secuenciación de ARN del proyecto TCGA para comparar la expresión de ARHGAP22 entre tejidos tumorales y tejidos normales correspondientes en múltiples tipos de cáncer. Los valores de expresión se presentaron como log2(TPM), y la expresión diferencial se evaluó mediante la prueba de suma de rangos de Wilcoxon implementada en TIMER2.0. Se consideró estadísticamente significativo un valor P bilateral menor a 0.05.
4. Validación externa en GEO
Se realizó una validación externa utilizando el conjunto de datos del Gene Expression Omnibus GSE167573 a través de la plataforma en línea BEST (https://rookieutopia.hiplot.com.cn/app_direct/BEST/; acceso el 9 de julio de 2026). La expresión de ARHGAP22 en tejidos de ccRCC y riñón normal se comparó utilizando los datos de expresión normalizados proporcionados por la plataforma y se evaluó mediante una prueba t de Student no pareada. Para el análisis de supervivencia, los pacientes se dividieron en grupos de alta y baja expresión utilizando el método de corte óptimo de la plataforma, y la supervivencia global se evaluó mediante análisis de Kaplan-Meier con la prueba de log-rango. Se consideró estadísticamente significativo un valor P bilateral inferior a 0,05.
5. Análisis de la expresión de ARHGAP22
Los datos de expresión del ARN mensajero de ARHGAP22 normalizados por TPM se extrajeron de la cohorte TCGA-KIRC y se transformaron como log2(TPM + 1) antes del análisis estadístico. Se evaluó la expresión diferencial de ARHGAP22 entre tejidos tumorales primarios y tejidos renales normales adyacentes. La prueba de suma de rangos de Wilcoxon se utilizó para comparaciones no apareadas entre tejidos tumorales y normales. Para el análisis apareado, se identificaron pares tumor-normales correspondientes utilizando los códigos de barras de pacientes de TCGA, y se aplicó la prueba de rangos con signo de Wilcoxon para comparar la expresión de ARHGAP22 entre tejidos normales adyacentes y los tejidos tumorales correspondientes. Se consideró estadísticamente significativo un valor P bilateral inferior a 0,05.
6. Análisis de supervivencia y de la característica operativa del receptor
Se realizaron análisis de supervivencia y de la característica operativa del receptor (ROC) dependiente del tiempo utilizando muestras tumorales de TCGA-KIRC con datos clínicos de seguimiento disponibles. El tiempo de supervivencia global se convirtió de días a años. Los pacientes se dividieron en grupos de alta y baja expresión de ARHGAP22 utilizando el valor mediano de expresión de ARHGAP22, y el mismo umbral se aplicó de forma consistente en todos los análisis que implicaron agrupación por expresión. Las curvas de Kaplan-Meier se generaron utilizando los paquetes survival y survminer. Las diferencias entre grupos se evaluaron mediante la prueba log-rank. Se utilizó la regresión de riesgos proporcionales de Cox para estimar las razones de riesgo y los intervalos de confianza del 95 %. Las curvas ROC dependientes del tiempo se generaron utilizando el paquete timeROC. Las áreas bajo la curva a 1, 3 y 5 años se calcularon utilizando el método de ponderación de Aalen. Se consideró estadísticamente significativo un valor P bilateral inferior a 0,05.
7. Análisis de asociación clinicopatológica
La asociación entre la expresión de ARHGAP22 y las características clinicopatológicas se analizó utilizando muestras tumorales de TCGA-KIRC. Se excluyeron las muestras normales. La edad se clasificó como 65 años o menos y mayor de 65 años. Las muestras con anotaciones desconocidas o faltantes se excluyeron del análisis correspondiente. Para las comparaciones entre dos grupos se utilizó la prueba de suma de rangos de Wilcoxon, y para las comparaciones que involucraban tres o más grupos se empleó la prueba de Kruskal-Wallis. Los gráficos de violín se generaron utilizando los paquetes ggpubr, ggplot2 y scales. Para la visualización en mapa de calor, los pacientes se clasificaron en grupos de alta y baja expresión de ARHGAP22 utilizando el valor mediano como punto de corte. Las asociaciones entre los grupos de expresión y las variables clinicopatológicas se evaluaron mediante pruebas de chi-cuadrado. Los mapas de calor se generaron usando ComplexHeatmap, tras el preprocesamiento con limma. Se consideró estadísticamente significativo un valor de P bilateral inferior a 0,05.
8. Construcción del nomograma
Se construyó un nomograma pronóstico integrando la expresión de ARHGAP22 con las características clínico-patológicas disponibles en un modelo de regresión de riesgos proporcionales de Cox. El modelo se utilizó para estimar la supervivencia global a 1, 3 y 5 años en la cohorte TCGA-KIRC. Se calcularon las puntuaciones de riesgo individuales de los pacientes mediante el modelo de Cox ajustado. Se generaron curvas de calibración para la supervivencia global a 1, 3 y 5 años utilizando el método de Kaplan-Meier con 1.000 iteraciones de remuestreo bootstrap. Se evaluó la concordancia entre las probabilidades de supervivencia predichas por el nomograma y los resultados observados de supervivencia. La regresión de Cox se realizó utilizando el paquete survival. La visualización del nomograma y los análisis de calibración se llevaron a cabo utilizando regplot y rms. Se consideró estadísticamente significativo un valor de P bilateral inferior a 0,05.
9. Análisis de coexpresión
Se utilizaron datos transcriptómicos de muestras tumorales de TCGA-KIRC para evaluar las relaciones de coexpresión entre ARHGAP22 y todos los demás genes mediante un análisis de correlación de Pearson. Se definieron como genes con coexpresión significativa aquellos con un coeficiente absoluto de correlación de Pearson mayor a 0,6 y un valor de P inferior a 0,001. Los genes con coexpresión significativa se ordenaron según el valor absoluto del coeficiente de correlación. Se seleccionaron los genes con mayor puntuación para construir una matriz de correlación, y se generó un diagrama de acordes para visualizar la red de coexpresión asociada a ARHGAP22.
10. Análisis de genes diferencialmente expresados y enriquecimiento funcional
Se realizó un análisis de expresión diferencial entre los grupos de alta y baja expresión de ARHGAP22 utilizando la prueba de suma de rangos de Wilcoxon con corrección por tasa de descubrimiento falso (FDR). Se definieron como genes diferencialmente expresados de forma significativa aquellos con un cambio absoluto en el log2 de la razón mayor a 1 y un FDR menor a 0,05. Los resultados se visualizaron mediante un gráfico de volcan y un mapa de calor. Los análisis de enriquecimiento de Gene Ontology y del Kyoto Encyclopedia of Genes and Genomes se realizaron utilizando clusterProfiler. Los símbolos de los genes se convirtieron a identificadores Entrez utilizando org.Hs.eg.db. Se consideraron significativamente enriquecidos los términos de Gene Ontology y las vías del Kyoto Encyclopedia of Genes and Genomes que presentaran un valor P nominal menor a 0,05 y un valor P ajustado por FDR menor a 0,05. El análisis de enriquecimiento de conjuntos de genes se realizó utilizando conjuntos de genes del Kyoto Encyclopedia of Genes and Genomes del archivo c2.cp.kegg.v7.4.symbols.gmt de la Molecular Signatures Database. Los genes se ordenaron según el valor del log2 de la razón, y se consideraron significativamente enriquecidos los conjuntos de genes con un valor P nominal < 0,05.
11. Análisis de infiltración inmunitaria y de puntos de control inmunitario
Se realizaron análisis de infiltración inmunitaria y de puntos de control inmunitario utilizando muestras tumorales de TCGA-KIRC. Los valores de StromalScore, ImmuneScore y ESTIMATEScore se calcularon mediante el paquete estimate. Las fracciones de células inmunitarias se estimaron utilizando el script R de CIBERSORT, con 1.000 permutaciones y normalización por cuantiles. Se conservaron las muestras con un valor P de desconvolución de CIBERSORT inferior a 0,05. Los pacientes se dividieron en grupos ARHGAP22-alto y ARHGAP22-bajo según el nivel mediano de expresión de ARHGAP22. Las diferencias en las puntuaciones ESTIMATE y en las fracciones de células inmunitarias entre los dos grupos se evaluaron mediante la prueba de suma de rangos de Wilcoxon. Las correlaciones entre la expresión de ARHGAP22 y los genes de puntos de control inmunitario se analizaron mediante el coeficiente de correlación de Pearson. Los valores P obtenidos de las comparaciones múltiples de células inmunitarias y de las pruebas de correlación de puntos de control inmunitario se ajustaron mediante el método FDR de Benjamini-Hochberg, y se consideró estadísticamente significativo un FDR inferior a 0,05. Los genes de puntos de control inmunitario significativos según FDR se visualizaron mediante mapas de calor de correlación generados con corrplot. El preprocesamiento y la visualización de los datos se realizaron principalmente utilizando limma, ggpubr y corrplot.
12. Predicción de sensibilidad a fármacos
Se utilizaron los datos transcriptómicos de tumores TCGA-KIRC tras excluir las muestras de tejido normal. Los valores computacionalmente predichos de la concentración inhibitoria media se calcularon mediante el paquete oncoPredict y el conjunto de datos de referencia basado en Genomics of Drug Sensitivity in Cancer 2. Los pacientes se dividieron en grupos de expresión alta y baja de ARHGAP22 utilizando el valor mediano de expresión de ARHGAP22. Los valores predichos de la concentración inhibitoria media se compararon entre grupos mediante la prueba de suma de rangos de Wilcoxon. Los valores de p obtenidos de múltiples comparaciones de fármacos se ajustaron utilizando el método de Benjamini–Hochberg, y se consideró estadísticamente significativo un FDR inferior a 0,05. Los resultados se interpretaron como estimaciones computacionalmente predichas de sensibilidad a fármacos, y no como respuestas a fármacos validadas experimentalmente o observadas clínicamente.
13. Validación del Atlas de Proteínas Humanas
Se accedió a la base de datos del Atlas de Proteínas Humanas y se buscó ARHGAP22. Se revisó la sección de Tejidos para evaluar la expresión de la proteína ARHGAP22 en tejido renal normal. Se abrió la sección de Patología, se seleccionó el carcinoma de células claras de riñón y se revisó la expresión de la proteína ARHGAP22 en tejido tumoral. Se recuperaron y seleccionaron imágenes inmunohistoquímicas representativas de tejido renal normal y de tejido de CCRcc para incluirlas en el manuscrito, con el fin de comparar la expresión de la proteína ARHGAP22 entre tejidos normales y tumorales.