Aquisição a partir do banco de dados TCGA
Os dados de sequenciamento de RNA e informações clínicas para a coorte de carcinoma invasivo de mama do TCGA (TCGA-BRCA) foram obtidos no portal Genomic Data Commons14. Os dados de RNA-seq do fluxo de trabalho STAR no formato de transcritos por milhão (TPM) foram extraídos juntamente com as anotações clínicas correspondentes. Amostras de RNA-seq sem informações clínicas correspondentes foram excluídas. Para as análises baseadas em expressão, os valores de TPM foram transformados como log2(TPM + 1). A expressão de MPO foi extraída utilizando o símbolo gênico MPO e o ID do gene Ensembl ENSG00000005381.8. Para análises que exigiam agrupamento em MPO-alto e MPO-baixo, apenas amostras tumorais do TCGA-BRCA foram incluídas, e amostras normais adjacentes foram excluídas da atribuição de grupo. As amostras tumorais foram divididas de acordo com o valor mediano da expressão de MPO transformada por log2(TPM + 1) entre as amostras tumorais do TCGA-BRCA. Amostras com expressão de MPO maior ou igual à mediana foram atribuídas ao grupo MPO-alto, enquanto amostras abaixo da mediana foram atribuídas ao grupo MPO-baixo. Essa estratégia de agrupamento baseada na mediana foi utilizada para análise de sobrevida, análise de expressão diferencial, análise de enriquecimento, agrupamento por metilação e comparações de enriquecimento de células imunes, salvo indicação em contrário. As características clínico-patológicas, incluindo sexo, idade, etnia, estágio patológico T, grau histológico, subtipo PAM50, estágio patológico, status do tumor e desfechos de sobrevida, incluindo sobrevida global (OS), intervalo livre de progressão (PFI) e sobrevida específica para a doença (DSS), foram analisadas utilizando o R versão 4.2.1.
Recuperação Pública de Imagens de Imunohistoquímica
Imagens representativas de imuno-histoquímica de mieloperoxidase (MPO) de tecido mamário normal adjacente e tecido de câncer de mama foram utilizadas como referências qualitativas em nível proteico. Essas imagens não foram incluídas nas análises morfométricas quantitativas ou estatísticas. As áreas delimitadas indicam regiões mostradas em maior aumento. As barras de escala indicam 100 µm nas imagens de 20× e 50 µm nas imagens de 40×.
Análise de correlação de expressão
O conjunto de dados TCGA-BRCA foi utilizado para examinar genes que variam conjuntamente com a expressão de MPO no câncer de mama. Foram calculados coeficientes de correlação de Pearson em todo o genoma entre MPO e genes codificadores de proteínas, e os 30 genes com maior correlação positiva e os 30 com maior correlação negativa foram selecionados para visualização. Para análises de correlação envolvendo múltiplos genes testados, os valores de p nominais foram ajustados utilizando o método da taxa de falsa descoberta de Benjamini-Hochberg. A rede de interação proteína-proteína (PPI) associada a MPO foi construída utilizando a ferramenta de busca para recuperação de genes/proteínas interagentes (banco de dados STRING), mantendo-se para visualização pares de proteínas com escores de interação superiores a 0,4015.
Análise de enriquecimento funcional
Genes diferencialmente expressos (GDEs) foram identificados comparando os grupos de tumores MPO-alto e MPO-baixo do TCGA-BRCA utilizando limiares de |log2FC| > 1 e valor de p ajustado por Benjamini-Hochberg < 0,05. A análise de enriquecimento funcional dos GDEs foi realizada utilizando o pacote R clusterProfiler versão 4.4.4, incluindo análises de processo biológico, componente celular e função molecular da ontologia genética (GO) e análises de vias da Enciclopédia de Quioto de Genes e Genomas (KEGG)16,17,18,19,20. Os termos GO e KEGG enriquecidos foram considerados significativos quando o valor de p ajustado foi < 0,05.
A análise de enriquecimento de conjuntos de genes (GSEA) foi realizada utilizando uma lista de genes pré-ordenada com base em estatísticas de expressão diferencial entre os grupos MPO-alto e MPO-baixo. A coleção de vias canônicas C2 do MSigDB c2.cp.all.v2022.1.Hs.symbols.gmt, correspondente ao MSigDB v2022.1.Hs e contendo 3.050 conjuntos de genes, foi utilizada21,22. Os termos enriquecidos foram considerados significativos de acordo com valor-p ajustado por Benjamini–Hochberg < 0,05, valor-q FDR < 0,25 e |pontuação de enriquecimento normalizada| > 1. Quando aplicável, os escores Z para os termos significativamente enriquecidos foram calculados utilizando o pacote GOplot para visualização.
Análise do enriquecimento de células imunes em tumores
Os componentes imunes e estromais na coorte TCGA-BRCA foram avaliados utilizando o algoritmo ESTIMATE implementado no pacote R estimate versão 1.0.13. Dados de expressão transformados por log2(TPM + 1) foram utilizados como entrada, e os escores imune, estromal e ESTIMATE foram calculados para cada amostra tumoral. O TIMER/TIMER2.0 foi utilizado para avaliar as associações entre a expressão de MPO e os níveis estimados de infiltração das principais populações de células imunes na coorte TCGA-BRCA, incluindo células B, células T CD8+, células T CD4+, macrófagos, neutrófilos e células dendríticas23,24,25. Os resultados baseados no TIMER foram interpretados como estimativas de infiltração imune derivadas do recurso online correspondente. Para a análise de enriquecimento de células imunes em 24 tipos de células imunes, a análise de enriquecimento de conjunto de genes de amostra única (ssGSEA) foi implementada utilizando o pacote R GSVA versão 1.46.026. A matriz de assinatura de células imunes LM22 utilizada para a desconvolução baseada no CIBERSORT de 22 tipos de células imunes está disponível na Tabela Suplementar 1. As correlações entre a expressão de MPO e os escores de enriquecimento de células imunes foram avaliadas utilizando o coeficiente de correlação de postos de Spearman. As diferenças nos escores de enriquecimento de células imunes entre os grupos de tumores definidos como MPO-alto e MPO-baixo com base na mediana foram comparadas utilizando o teste de soma de postos de Wilcoxon. Para análises envolvendo múltiplos tipos de células imunes, os valores de p foram ajustados utilizando o método de taxa de falsa descoberta de Benjamini–Hochberg.
Metilação do DNA do gene MPO
Padrões de metilação de DNA no locus MPO foram avaliados utilizando o MethSurv. Valores beta de metilação de CpG e associações com sobrevida para TCGA-BRCA foram obtidos a partir da plataforma MethSurv. Os sítios de CpG relacionados ao MPO selecionados foram visualizados, e suas associações com desfechos de sobrevida foram avaliadas utilizando as saídas de análise de sobrevida fornecidas pelo MethSurv27. Para análises envolvendo múltiplos sítios de CpG, os valores-p foram ajustados entre os sítios de CpG relacionados ao MPO testados utilizando o método de taxa de descoberta falsa de Benjamini-Hochberg. Essas análises de metilação foram interpretadas como anotações epigenéticas exploratórias.
Construção da rede PPI e análise de correlação de genes relacionados a neutrófilos
Para examinar a associação entre MPO e a biologia relacionada aos neutrófilos, foi realizada uma análise de rede sistemática. Um conjunto de genes composto por mediadores estabelecidos da ativação de neutrófilos e processos inflamatórios associados foi compilado a partir da literatura atual. A lista completa de genes relacionados aos neutrófilos está disponível na Tabela Suplementar 2. Os símbolos gênicos foram harmonizados com os símbolos oficiais, entradas duplicadas foram removidas e os genes disponíveis foram intersectados com a matriz de expressão TCGA-BRCA antes da análise STRING/PPI, priorização de genes centrais (hub) e análise de correlação entre MPO e genes centrais. A rede de interação proteína-proteína (PPI) entre esses genes foi construída utilizando o banco de dados STRING (versão 11.5), com um limiar médio de pontuação de interação de confiança (>0,40). Os genes centrais dessa rede foram priorizados algoritmicamente com base na centralidade de grau, que quantifica o número de interações diretas por nó. Os 20 principais genes com as pontuações de grau mais altas foram selecionados para análise de correlação subsequente.
Posteriormente, os perfis de expressão desses genes centrais e da MPO foram extraídos do conjunto de dados transcriptômicos TCGA-BRCA. A associação entre a MPO e cada gene central foi avaliada estatisticamente utilizando a correlação de postos de Spearman. Para caracterizar os padrões de correlação entre os próprios genes centrais, foi calculada uma matriz de correlação de Spearman aos pares em todas as amostras tumorais. Essas análises de correlação forneceram a base quantitativa para visualizações subsequentes, incluindo o gráfico de bala das correlações entre MPO e genes centrais e o diagrama de cordas/mapa de calor que retrata os padrões de correlação entre os genes centrais.
Previsão de fatores de transcrição e miRNAs reguladores superiores que direcionam MPO
O banco de dados KnockTF (https://bio.liclab.net/KnockTF/index.php)28,29, o banco de dados ChIP (http://chip-atlas.org/)30,31 e o banco de dados GTRD32,33 (https://gtrd.biouml.org/#!) foram utilizados para prever os TFs alvo do MPO. Além disso, o banco de dados TargetScan (https://www.targetscan.org/vert_80/) foi utilizado para prever os sítios de ligação de miRNA potenciais que direcionam o MPO. Diagramas de Venn foram gerados utilizando o site MicroBioinformatics (https://www.bioinformatics.com.cn/static/others/jvenn/example.html)34.
Análise de célula única de MPO
O conjunto de dados específico GSE161529 origina-se do Gene Expression Omnibus (GEO). A pré-processamento dos dados realizou primeiro uma filtragem em nível celular para excluir células de baixa qualidade—aquelas que atendiam a qualquer um dos seguintes critérios: expressão de genes mitocondriais superior a 25%, contagem total de identificadores moleculares únicos (UMI) abaixo de 5000 ou menos de 2500 genes detectados. Posteriormente, foram corrigidas a contaminação por RNA ambiental e os efeitos técnicos de lote35. A análise de componentes principais (PCA) foi realizada para redução da dimensionalidade e avaliação da similaridade celular, seguida por UMAP para agrupamento e visualização celular. Em seguida, com base nos genes marcadores típicos das células, os diferentes agrupamentos foram anotados em tipos celulares11. O conjunto de genes associados à MPO utilizado para pontuação de assinatura em única célula está fornecido no Arquivo Suplementar 1. Antes da pontuação, os símbolos gênicos foram harmonizados para os símbolos oficiais, entradas duplicadas foram removidas e os genes disponíveis foram intersectados com a matriz de expressão do GSE161529. AUCell, Seurat AddModuleScore e ssGSEA foram utilizados para calcular as pontuações associadas à MPO por célula. As pontuações obtidas pelos três métodos foram normalizadas por escore Z, escalonadas para uma faixa comparável e integradas para gerar uma pontuação composta associada à MPO para análises descritivas posteriores. Redes de interação entre células foram analisadas para comparar os padrões inferidos de comunicação ligante–receptor envolvendo células tumorais epiteliais estratificadas pelo sinal associado à MPO e diversos tipos celulares parceiros. Essas saídas foram interpretadas como padrões descritivos de comunicação, e não como evidência de que células que expressam MPO mediam diretamente a comunicação intercelular.
Extinção virtual em célula única de MPO e análise de enriquecimento de vias usando scTenifoldKnk
O silenciamento virtual de célula única de MPO foi realizado integrando Seurat e scTenifoldKnk. Após controle padrão de qualidade (200–6.000 genes por célula; fração mitocondrial < 10%), os dados foram normalizados por logaritmo, e 2.000 genes altamente variáveis foram selecionados para redução de dimensionalidade e agrupamento. Para enriquecer contextos relevantes para MPO, foram mantidas células com pontuação nos 50% superiores para um módulo de genes mieloide/neutrófilo. A partir dessas células, um subconjunto de vizinhança de MPO foi definido expandindo-se a partir de sementes positivas para MPO usando k = 40 vizinhos mais próximos no espaço do PCA. O subconjunto expandido não foi tratado como uma população puramente positiva para MPO, e nenhuma conclusão sobre proporção de tipos celulares foi feita a partir dessa etapa de expansão por KNN. Esse subconjunto foi submetido à análise de silenciamento virtual por meio do scTenifoldKnk, utilizando a união dos genes altamente variáveis e MPO (expressos em ≥25 células) como conjunto de genes. Genes significativamente perturbados foram identificados (FDR < 0,05, ajustado por BH). Os genes resultantes foram analisados adicionalmente quanto ao enriquecimento funcional em Processos Biológicos GO e vias KEGG (q < 0,05).
Recuperação exploratória de interações fármaco-gene e anotação ADMET
O DGIdb foi consultado para obter registros preliminares de interações droga-gene ou químico-gene associadas ao MPO. Como as listas de interações derivadas de bancos de dados podem incluir entradas apoiadas por tipos heterogêneos de evidência e podem não corresponder diretamente a agentes terapêuticos clinicamente acionáveis, os compostos recuperados foram tratados como anotações exploratórias, e não como candidatos prioritários a tratamento. Posteriormente, utilizaram-se o SwissADME e o ADMETlab para resumir as propriedades físico-químicas, farmacocinéticas e toxicológicas previstas. Essas anotações in silico foram usadas para fornecer um contexto preliminar à interpretação em nível de composto e para destacar a necessidade de curadoria farmacológica, toxicológica e clínica adicional antes que qualquer relevância terapêutica possa ser considerada36.