Adquisición desde la base de datos TCGA
Los datos de secuenciación de ARN y la información clínica para la cohorte de carcinoma invasivo de mama del Proyecto del Genoma del Cáncer (TCGA-BRCA) se obtuvieron del portal Genomic Data Commons14. Se extrajeron los datos de ARN-seq del flujo de trabajo STAR en formato de transcritos por millón (TPM), junto con las anotaciones clínicas emparejadas. Se excluyeron las muestras de ARN-seq que carecían de información clínica correspondiente. Para los análisis basados en la expresión, los valores de TPM se transformaron como log2(TPM + 1). La expresión de MPO se extrajo utilizando el símbolo génico MPO y el identificador génico Ensembl ENSG00000005381.8. Para los análisis que requerían agrupamiento en MPO-alto y MPO-bajo, solo se incluyeron muestras tumorales de TCGA-BRCA, excluyéndose las muestras normales adyacentes de la asignación de grupo. Las muestras tumorales se dividieron según el valor mediano de la expresión de MPO transformada a log2(TPM + 1) entre las muestras tumorales de TCGA-BRCA. Las muestras con expresión de MPO mayor o igual que la mediana se asignaron al grupo MPO-alto, mientras que las muestras por debajo de la mediana se asignaron al grupo MPO-bajo. Esta estrategia de agrupamiento basada en la mediana se utilizó para el análisis de supervivencia, el análisis de expresión diferencial, el análisis de enriquecimiento, el agrupamiento por metilación y las comparaciones de enriquecimiento de células inmunitarias, salvo que se indique lo contrario. Las características clínico-patológicas, incluyendo sexo, edad, etnia, estadio patológico T, grado histológico, subtipo PAM50, estadio patológico, estado del tumor y puntos finales de supervivencia, incluyendo supervivencia global (OS), intervalo libre de progresión (PFI) y supervivencia específica para la enfermedad (DSS), se analizaron utilizando la versión 4.2.1 de R.
Recuperación Pública de Imágenes de Inmunohistoquímica
Se utilizaron imágenes representativas de inmunohistoquímica de mieloperoxidasa (MPO) de tejido mamario normal adyacente y tejido de cáncer de mama como referencias cualitativas a nivel proteico. Estas imágenes no se incluyeron en análisis morfométricos cuantitativos ni estadísticos. Las áreas delimitadas indican regiones mostradas con mayor aumento. Las barras de escala indican 100 µm en las imágenes de 20× y 50 µm en las imágenes de 40×.
Análisis de correlación de expresión
Se utilizó el conjunto de datos TCGA-BRCA para examinar los genes que covarían con la expresión de MPO en el cáncer de mama. Se calcularon coeficientes de correlación de Pearson a nivel genómico entre MPO y los genes que codifican proteínas, y se seleccionaron los 30 genes con mayor correlación positiva y los 30 con mayor correlación negativa para su visualización. En los análisis de correlación que implicaron múltiples genes evaluados, los valores p nominales se ajustaron mediante el método de tasa de descubrimiento falso de Benjamini-Hochberg. La red de interacción proteína-proteína (PPI) asociada a MPO se construyó utilizando la herramienta de búsqueda para la recuperación de genes/proteínas interactuantes (base de datos STRING), conservándose para la visualización los pares de proteínas con puntuaciones de interacción superiores a 0,4015.
Análisis de enriquecimiento funcional
Los genes diferencialmente expresados (DEG) se identificaron comparando los grupos de tumores MPO-alto y MPO-bajo de TCGA-BRCA utilizando umbrales de |log2FC| > 1 y un valor p ajustado por Benjamini-Hochberg < 0,05. El análisis de enriquecimiento funcional de los DEG se realizó utilizando el paquete de R clusterProfiler versión 4.4.4, que incluyó análisis de procesos biológicos, componentes celulares y funciones moleculares de la ontología genética (GO), así como análisis de vías de la Enciclopedia de Kioto de genes y genomas (KEGG)16,17,18,19,20. Los términos GO y KEGG enriquecidos se consideraron significativos cuando el valor p ajustado fue < 0,05.
Se realizó un análisis de enriquecimiento de conjuntos de genes (GSEA) utilizando una lista previamente ordenada de genes basada en estadísticas de expresión diferencial entre los grupos con alto y bajo contenido de MPO. Se utilizó la colección de vías canónicas C2 de MSigDB c2.cp.all.v2022.1.Hs.symbols.gmt, correspondiente a MSigDB v2022.1.Hs y que contiene 3.050 conjuntos de genes21,22. Los términos enriquecidos se consideraron significativos según un valor p ajustado por Benjamini–Hochberg < 0,05, un valor q de FDR < 0,25 y un |valor de enriquecimiento normalizado| > 1. Cuando fue aplicable, se calcularon las puntuaciones Z para los términos enriquecidos significativamente utilizando el paquete GOplot para la visualización.
Análisis del enriquecimiento de células inmunitarias en tumores
Los componentes inmunitarios y estromales en la cohorte TCGA-BRCA se evaluaron mediante el algoritmo ESTIMATE implementado en el paquete de R estimate versión 1.0.13. Se utilizaron como entrada datos de expresión transformados mediante log2(TPM + 1), y se calcularon la puntuación inmunitaria, la puntuación estromal y la puntuación ESTIMATE para cada muestra tumoral. Se empleó TIMER/TIMER2.0 para evaluar las asociaciones entre la expresión de MPO y los niveles estimados de infiltración de poblaciones principales de células inmunitarias en la cohorte TCGA-BRCA, incluyendo células B, células T CD8+, células T CD4+, macrófagos, neutrófilos y células dendríticas23,24,25. Los resultados basados en TIMER se interpretaron como estimaciones de infiltración inmunitaria derivadas del recurso en línea correspondiente. Para el análisis de enriquecimiento de células inmunitarias en 24 tipos de células inmunitarias, se implementó un análisis de enriquecimiento de conjuntos de genes para una sola muestra (ssGSEA) utilizando el paquete de R GSVA versión 1.46.026. La matriz de firmas de células inmunitarias LM22 utilizada para la desconvolución basada en CIBERSORT de 22 tipos de células inmunitarias se proporciona en la Tabla Suplementaria 1. Las correlaciones entre la expresión de MPO y las puntuaciones de enriquecimiento de células inmunitarias se evaluaron mediante la correlación de rangos de Spearman. Las diferencias en las puntuaciones de enriquecimiento de células inmunitarias entre los grupos tumorales definidos por la mediana como MPO-alto y MPO-bajo se compararon utilizando la prueba de suma de rangos de Wilcoxon. En los análisis que involucraron múltiples tipos de células inmunitarias, los valores p se ajustaron mediante el método de tasa de descubrimientos falsos de Benjamini–Hochberg.
Metilación del ADN del gen MPO
Los patrones de metilación del ADN dentro del locus MPO se evaluaron utilizando MethSurv. Los valores beta de metilación de los sitios CpG y las asociaciones con la supervivencia para TCGA-BRCA se obtuvieron de la plataforma MethSurv. Se visualizaron los sitios CpG relacionados con MPO seleccionados y se evaluaron sus asociaciones con los resultados de supervivencia mediante los análisis de supervivencia proporcionados por MethSurv27. Para los análisis que involucraron múltiples sitios CpG, los valores p se ajustaron a través de los sitios CpG relacionados con MPO evaluados utilizando el método de tasa de descubrimiento falso de Benjamini-Hochberg. Estos análisis de metilación se interpretaron como anotaciones epigenéticas exploratorias.
Construcción de la red PPI y análisis de correlación de genes relacionados con neutrófilos
Para examinar la asociación entre MPO y la biología relacionada con los neutrófilos, se realizó un análisis de red sistemático. Se seleccionó un conjunto de genes que comprende mediadores establecidos de la activación de neutrófilos y procesos inflamatorios asociados, a partir de la literatura actual. La lista completa de genes relacionados con neutrófilos se proporciona en Tabla Suplementaria 2. Los símbolos de los genes se armonizaron con los símbolos oficiales, se eliminaron las entradas duplicadas y los genes disponibles se intersectaron con la matriz de expresión TCGA-BRCA antes del análisis STRING/PPI, la priorización de genes centrales (hub genes) y el análisis de correlación entre MPO y genes centrales. La red PPI entre estos genes se construyó utilizando la base de datos STRING (versión 11.5) con un umbral de confianza media para la puntuación de interacción (>0.40). Los genes centrales dentro de esta red se priorizaron algorítmicamente en función de la centralidad de grado, que cuantifica el número de interacciones directas por nodo. Los 20 genes principales con las puntuaciones de grado más altas se seleccionaron para el análisis de correlación posterior.
Posteriormente, se extrajeron los perfiles de expresión de estos genes centrales y de MPO a partir del conjunto de datos transcriptómicos TCGA-BRCA. La asociación entre MPO y cada gen central se evaluó estadísticamente mediante la correlación de rangos de Spearman. Para caracterizar los patrones de correlación entre los propios genes centrales, se calculó una matriz de correlación de Spearman por pares en todas las muestras tumorales. Estos análisis de correlación proporcionaron la base cuantitativa para las visualizaciones posteriores, incluyendo el gráfico de bastones de las correlaciones entre MPO y los genes centrales y el diagrama de acordes/mapa de calor que muestra los patrones de correlación entre los genes centrales.
Predicción de factores de transcripción y miARNs upstream que dirigen MPO
Se utilizó la base de datos KnockTF (https://bio.liclab.net/KnockTF/index.php)28,29, la base de datos ChIP (http://chip-atlas.org/)30,31 y la base de datos GTRD32,33 (https://gtrd.biouml.org/#!) para predecir los TFs diana de MPO. Además, se utilizó la base de datos TargetScan (https://www.targetscan.org/vert_80/) para predecir los sitios potenciales de unión de miARN que dirigen a MPO. Los diagramas de Venn se generaron utilizando el sitio web MicroBioinformatics (https://www.bioinformatics.com.cn/static/others/jvenn/example.html)34.
Análisis de una sola célula de MPO
El conjunto de datos específico GSE161529 proviene del Gene Expression Omnibus (GEO). El preprocesamiento de los datos comenzó con un filtrado a nivel celular para excluir células de baja calidad—aquellas que cumplían con alguno de los siguientes criterios: expresión de genes mitocondriales superior al 25 %, recuento total de identificadores moleculares únicos (UMI) inferior a 5000 o menos de 2500 genes detectados. Posteriormente, se corrigió la contaminación por ARN ambiental y los efectos técnicos por lotes35. Se realizó un análisis de componentes principales (PCA) para reducir la dimensionalidad y evaluar la similitud celular, seguido de UMAP para la agrupación y visualización de células. Luego, según los genes marcadores típicos de las células, los diferentes grupos se anotaron con tipos celulares11. El conjunto de genes asociados a MPO utilizado para la puntuación de firmas a nivel de célula individual se proporciona en el Archivo Suplementario 1. Antes de la puntuación, los símbolos de los genes se armonizaron con los símbolos oficiales, se eliminaron las entradas duplicadas y se intersectaron los genes disponibles con la matriz de expresión de GSE161529. Se utilizaron AUCell, Seurat AddModuleScore y ssGSEA para calcular las puntuaciones asociadas a MPO en cada célula. Las puntuaciones obtenidas mediante los tres métodos se normalizaron mediante puntuación Z, se escalaron a un rango comparable y se integraron para generar una puntuación compuesta asociada a MPO destinada a análisis descriptivos posteriores. Se analizaron redes de interacción entre células para comparar los patrones inferidos de comunicación ligando–receptor que involucran células tumorales epiteliales estratificadas según la señal asociada a MPO y diversos tipos celulares compañeros. Estos resultados se interpretaron como patrones descriptivos de comunicación, y no como evidencia de que las células que expresan MPO median directamente la comunicación intercelular.
Supresión virtual a nivel de célula individual de MPO y análisis de enriquecimiento de vías mediante scTenifoldKnk
Se realizó un silenciamiento virtual a nivel de célula individual de MPO mediante la integración de Seurat y scTenifoldKnk. Tras un control de calidad estándar (200–6.000 genes por célula; fracción mitocondrial < 10%), los datos fueron normalizados mediante logaritmo, y se seleccionaron 2.000 genes altamente variables para la reducción de dimensionalidad y agrupamiento. Para enriquecer contextos relevantes para MPO, se conservaron las células que se ubicaron en el 50 % superior de un módulo génico de mieloide/neutrófilo. A partir de estas células, se definió un subconjunto vecino de MPO mediante la expansión desde semillas positivas para MPO utilizando k = 40 vecinos más cercanos en el espacio del PCA. Este subconjunto expandido no fue considerado como una población puramente positiva para MPO, y no se obtuvieron conclusiones sobre la proporción de tipos celulares a partir de este paso de expansión por KNN. Este subconjunto fue sometido a análisis de silenciamiento virtual mediante scTenifoldKnk, utilizando la unión de los genes altamente variables y MPO (expresado en ≥25 células) como conjunto génico. Se identificaron genes significativamente perturbados (FDR < 0,05, ajustado por BH). Los genes resultantes se analizaron posteriormente en cuanto al enriquecimiento funcional en Procesos Biológicos de GO y vías KEGG (q < 0,05).
Recuperación exploratoria de interacciones fármaco-gen y anotación ADMET
Se consultó DGIdb para obtener registros preliminares de interacciones fármaco-gen o químico-gen asociadas a MPO. Dado que las listas de interacciones derivadas de bases de datos pueden incluir entradas respaldadas por tipos heterogéneos de evidencia y pueden no corresponder directamente a agentes terapéuticos clínicamente accionables, los compuestos recuperados se consideraron anotaciones exploratorias en lugar de candidatos a tratamiento prioritarios. Posteriormente, se utilizaron SwissADME y ADMETlab para resumir las propiedades fisicoquímicas, farmacocinéticas y toxicológicas predichas. Estas anotaciones in silico se emplearon para proporcionar un contexto preliminar para la interpretación a nivel de compuesto y para destacar la necesidad de una mayor curación farmacológica, toxicológica y clínica antes de que pueda considerarse alguna relevancia terapéutica36.