Artigo de método

Análise baseada em dados TCGA e dados de célula única, tomando o TRPM4 como exemplo

DOI:

10.3791/69304

5 de dezembro de 2025

* These authors contributed equally

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Aqui, apresentamos um protocolo para analisar minuciosamente o papel de um único gene no câncer de bexiga (BLCA), com base na análise do transcriptoma e análise de célula única, juntamente com a utilização de 101 algoritmos de aprendizado de máquina, para construir um modelo prognóstico para o único gene mencionado.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Neste artigo, é introduzido um método de análise baseado em conjuntos de dados transcriptômicos públicos e de conjunto de dados unicelulares, que pode ser usado para descrever de forma abrangente o papel de genes individuais em tumores, incluindo a formação do microambiente imune tumoral, a modelação de subtipos moleculares tumorais e a previsão do prognóstico de pacientes tumorais. Ao mesmo tempo, a introdução de dados de um único gene pode não apenas evitar a aleatoriedade e heterogeneidade causadas pela análise de um único transcriptoma, mas também permitir uma exploração mais profunda de quais clusters específicos de células o gene é expresso, além de pesquisas adicionais sobre o papel do gene na via. Considerando que muitos pesquisadores podem não ser proficientes em análise de célula única, um site online é apresentado neste artigo de método, chamado TISCH2 (http://tisch.compbio.cn/), ajudando assim todos a concluir a análise de célula única. Além disso, a aplicação de 101 métodos de aprendizado de máquina desempenhou um papel indispensável na construção do modelo prognóstico mais preciso. Em conclusão, acredita-se que esse método integrado de análise de gene único, que combina análise de bioinformática, aprendizado de máquina e análise de células únicas, pode desempenhar um papel indispensável e crucial no estudo das funções de genes individuais na progressão tumoral, bem como no estudo das funções de genes individuais em vias de vias individuais.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Como todos sabemos, o câncer de bexiga (BLCA) é um dos tumores malignos mais agressivos e metastáticos do mundo, e ainda existem problemas com os biomarcadores atuais para câncer de bexiga, como imprecisão e assimpor diante. Para identificar o prognóstico dos pacientes com BLCA e prever os desfechos deles, a busca por biomarcadores para câncer de bexiga e o estabelecimento de modelos prognósticos são de grande importância. Embora as pessoas tenham desenvolvido alguns métodos de pesquisa para biomarcadores, a maioria desses métodos atualmente está limitada à transcriptômica, o que inevitavelmente leva à heterogeneidade nasamostras 2. Além disso, estudar apenas dados de transcriptômica frequentemente falha em investigar os papéis desempenhados por diferentes subpopulações celulares, assim como as funções dos genes em diferentes vias no nível de célula única, o que torna pesquisas anteriores menos precisas eeficazes 3. Considerando que a análise de célula única pode ser desafiadora para iniciantes, uma plataforma online foi lançada para análise de célula única para ajudá-los a aprender as habilidadesrapidamente 4. Por último, mesmo que um único gene seja encontrado como biomarcador adequado por meio de análise de transcriptoma e análise de célula única, não há garantia de que o biomarcador será aplicável a todas as coortes, portanto é necessário construir modelos prognósticos associados ao biomarcador para tornar as conclusões mais universalmenteaplicáveis 5. O algoritmo de aprendizado de máquina 101 refere-se à construção de modelos de prognóstico 101 usando uma combinação de 10 algoritmos diferentes de aprendizado de máquina, com o objetivo de identificar o modelo de prognóstico ideal. A inclusão de algoritmos como random forest, XGBoost e SVM, que são mais capazes de lidar com dados complexos e apresentam maior estabilidade, resultou em um algoritmo combinado demonstrando estabilidade notável. Para tornar esse modelo prognóstico mais preciso e relevante para o biomarcador, uma análise de correlação é realizada entre todos os genes e o biomarcador, depois seleciona cerca de 20-30 genes com base nos requisitos e, em seguida, utiliza um algoritmo de aprendizado de máquina 101 para construir o modelo prognóstico, seguida por uma série de análises para finalizar os resultados.

Comparados aos biomarcadores previstos pela análise transcriptômica simples dosúltimos 6 anos, os biomarcadores da análise de célula única e transcriptômica permitem uma quebra imparcial dos tecidos ou amostras em seus componentes celulares básicos. Ela possibilita a diferenciação clara de diferentes tipos celulares (como células T, células B e macrófagos) e a descoberta de novas subpopulações (como células T exauridas e células T reguladoras), bem como a captura de processos dinâmicos contínuos (como trajetórias de diferenciação celular)4. É semelhante a organizar frutas e leite separadamente, permitindo uma visualização clara de cada componente e sua quantidade. Comparado com os modelos deCox 7 de coorte única, o modelo prognóstico construído usando aprendizado de máquina 101 também é mais preciso e cientificamente sólido, pois pode aprender automaticamente sobre as interações complexas e não lineares entre variáveis a partir dos dados. Por exemplo, o impacto de uma mutação genética específica pode ser significativo apenas em pacientes de certas idades e tamanhos de tumor. Modelos de aprendizado de máquina, como florestas aleatórias e redes neurais, podem capturar automaticamente essas interações de alta ordem sem a necessidade de especificaçãomanual 8. As principais restrições de aplicabilidade de sinalização que o conjunto de dados usado para análise devem incluir a grande maioria dos genes, com o número de genes não sendo muito baixo e o número de genes usados para construir modelos prognósticos não sendo muito alto, geralmente mantido em torno de 20-30, sendo o ideal. O padrão de controle de qualidade do conjunto de células individuais deve ser maior que 1000, a contagem de UMI por célula deve ser maior que 1000 e o número de genes por célula deve ser superior a 5009.

Aqui, é apresentada uma abordagem passo a passo para a identificação de novos biomarcadores a partir de conjuntos de dados transcriptômicos públicos e de conjuntos de dados de célula única, tomando como exemplo o papel do TRPM4 na BLCA. Múltiplos métodos de pesquisa são empregados e conjuntos de dados diversos — incluindo o conjunto de dados Cancer Genome Atlas-Bladder Cancer (TCGA-BLCA), o conjunto de dados de células únicas GSE145281 e os conjuntos de dados BLCA GSE32894 e GSE31684 — para aprimorar a precisão e aplicabilidade dos biomarcadores em oncologia sob múltiplas perspectivas e avançar o estudo do TRPM4 no BLCA. O conjunto de dados TCGA-BLCA foi obtido no site Xena da Universidade da Califórnia, Santa Cruz (UCSC Xena). GSE32894 e GSE31684 foram baixados do Gene Expression Omnibus (GEO), e os dados de células únicas GSE145281 foram obtidos do Tumor Immune Single-Cell Hub 2 (TISCH2). Além disso, dados sobre subtipos moleculares de BLCA e respostas ao tratamento foram extraídos de arquivos suplementares de planilha de um artigo relevante. Em seguida, são realizadas análises de bioinformática, análise de célula única e aprendizado de máquina, estabelecendo uma metodologia integrada de pesquisa em gene único.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

NOTA: Todos os códigos usados neste artigo podem ser encontrados no site https://github.com/YaoGeng-nmu/Analysis-of-TRPM4-based-on-TCGA-data-and-single-cell-data-in-BLCA/blob/main/code.

1. Preparação de dados de transcriptômica

  1. Preparação do conjunto de dados TCGA-BLCA
    1. Baixe todos os conjuntos de dados TCGA do site UCSC Xena (https://xenabrowser.net/datapages/)10. Os conjuntos de dados baixados são pré-processados, eliminando a necessidade de trabalhos adicionais, como a anotação de genes11.
    2. Selecione o conjunto de dados TCGA e depois clique nos dados TCGA-BLCAt. Depois, acesse a página do conjunto de dados TCGA-BLCA, clique em RNA-seq de Expressão Gênica e baixe os dados clínicos e os perfis de expressão gênica do conjunto de dados TCGA-BLCA. Neste conjunto de dados, certifique-se de que haja dados de expressão de mRNA de 400 pacientes com BLCA.
    3. Para diferenciar amostras tumorais das amostras de tecido normal adjacentes, separe-se as amostras com terminações 01 e 11, pois amostras com 01 indicam amostras tumorais, enquanto as amostras com 11 indicam tecidos adjacentes ao câncer (amostras normais).
  2. Preparação de GSE32894 e GSE31684
    1. Clique no site da GEO (https://www.ncbi.nlm.nih.gov) para baixar o conjunto de dados BLCA GSE32894 e GSE3168412,13.
    2. Depois de clicar nas Respectivas Entradas no canto superior direito, certifique-se de mover para as páginas dos conjuntos de dados GSE32894 e GSE31684.
    3. Em seguida, baixe os respectivos dados de mRNA, dados clínicos e dados de sobrevivência para GSE32894. Clique no botão http do conjunto de dados GSE32894. Além disso, baixe os dados da plataforma GPL6947 usando o botão da plataforma. Clique no(s) botão (s) Arquivo da Matriz Série e baixe GSE32894 após clicar no botão GSE32894_series_matrix.txt.gz ao baixar dados de mRNA, dados clínicos e dados de sobrevivência para GSE32894.
    4. Baixe os respectivos dados de mRNA, dados clínicos e dados de sobrevivência para GSE31684. Clique no botão http do conjunto de dados GSE31684. Além disso, baixe os dados da plataforma GPL570 usando o botão da plataforma. Clique no (s) botão(s) Arquivo da Matriz da Série e baixe GSE31684 após clicar no botão GSE31684_series_matrix.txt.gz ao baixar dados de mRNA, dados clínicos e dados de sobrevivência para GSE31684.
    5. Na etapa de filtragem, remova genes sem sentido, como aqueles com nível de expressão zero ou próximo de zero. Utilize o método ComBat, que é baseado no pacoteSVA 14, para correção em lote.

2. Preparação da análise de célula única

  1. Preparação de GSE145281
    1. Para conduzir pesquisas em nível de célula única, encontre o conjunto de dados de células únicas do BLCA, considerando que os dados do transcriptoma sozinhos são insuficientes para determinar qual agrupamento celular expressa TRPM4 de forma mais significativa.
    2. Aqui, acesse o TISCH2 (http://tisch.compbio.cn/), um site online para análise de tumores por células únicas.
    3. De acordo com as necessidades experimentais, selecione o tipo de câncer necessário, usando o BLCA como exemplo neste caso.
    4. Clique no botão BLCA , escolhendo o conjunto de dados chamado GSE145281.

3. Preparação dos subtipos moleculares do BLCA e dados de resposta às escolhas terapêuticas

  1. Baixe os dados sobre os subtipos moleculares do BLCA e a resposta às escolhas terapêuticas do artigo referenciadoaqui 15.
  2. Abra o site do PubMed (https://pubmed.ncbi.nlm.nih.gov/). Procure o artigo e clique em Tabelas Suplementares. Há um total de 18 arquivos neste pacote de arquivos comprimidos.

4. Análise do microambiente imunológico BLCA do TRPM4

  1. Gráfico de mapa de calor da expressão de 133 imunomoduladores em diferentes grupos TRPM4
    1. De acordo com a expressão do TRPM4, divida-se todas as amostras de BLCA em grupo de alto TRPM4 e grupo de baixo TRPM4 .
    2. Copie todos os nomes das amostras e os dados de expressão do TRPM4 separadamente, depois ordene-os em ordem decrescente de expressão do TRPM4 e categorize a primeira metade das amostras no grupo de alto TRPM4 e a segunda metade no grupo de baixo TRPM4 na coluna do grupo, de acordo com a expressão do TRPM4 . Todas as identificações dos pacientes com TCGA-BLCA estão listadas na Tabela Suplementar 1.
    3. Instale os pacotes R necessários para a análise de dados transcriptômicos. Faça pequenas modificações no código fornecido, como mudar a localização do arquivo, e então execute o código. Verifique cuidadosamente se os IDs de genes e os IDs dos imunomoduladores estão corretamente correspondidos, garantindo que não haja espaços ou outros fatores discretos após os IDs de genes, pois esses são as principais causas da falha na geração do mapa de calor.
  2. Análise estromala e imunológica de amostras tumorais usando o pacote ESTIMATE R
    1. Certifique-se de que todos os pacotes R necessários para a análise de dados transcriptômicos estejam instalados. De acordo com os requisitos do código, nomeie os dados necessários com os nomes correspondentes e então clique no botão Executar .
      NOTA: É importante lembrar que este site também oferece recursos de análise online. Embora seja possível obter os resultados desejados visitando o site (https://bioinformatics.mdanderson.org/estimate/rpackage.html), esse método não é adequado para analisar dados coletados por conta própria.
    2. Clique no botão Doença e escolha a opção Carcinoma Urotelial da Bexiga . Depois, selecione o botão da plataforma RNA-seq-V2 . Baixe todas as amostras de escore estromal, escore imune e estimativa de pontuação.
  3. Gráfico de violino da expressão entre diferentes grupos TRPM4
    1. Instale todos os pacotes R necessários para análise de dados transcriptômicos. Todos os pacotes R necessários estão listados na Tabela Suplementar 2. De acordo com os requisitos do código, nomeie os dados necessários com os nomes correspondentes e então clique no botão Executar.
    2. Certifique-se de verificar cuidadosamente se os IDs de genes estão inseridos corretamente, garantindo que não haja espaços ou outros fatores discretos ao final dos IDs de genes, pois esses são as principais causas de falhas na criação de gráficos de violino.
  4. Gráfico de mapa de calor triangular entre diferentes grupos TRPM4
    1. Instale todos os pacotes R necessários para a análise de dados transcriptômicos. Certifique-se de preparar os dados de expressão de vários genes de checkpoint imunológico, como TIGIT e CD80. Abra os dados do transcriptoma TCGA-BLCA e então pesquise cada entrada individualmente, dado que o número de genes de checkpoint imunológico não é extenso.
    2. De acordo com os requisitos do código, nomeie os dados necessários com os nomes correspondentes e então clique no botão Executar .
  5. Gráfico de correlação entre diferentes genes e TRPM4
    1. Instale todos os pacotes R necessários para a análise de dados transcriptômicos. Preencha TRPM4 como o primeiro gene e adicione o gene que está sendo pesquisado como o segundo gene, que neste caso é CD3E .
    2. Após clicar no botão Correr , certifique-se de trocar CD3E para outros genes que precisam ser analisados, como CTLA4.

5. Análise de célula única do TRPM4 no conjunto de dados GSE145281

  1. Análise de GSE145281 de conjunto de dados BLCA usando análise de célula única
    1. Entre no site e clique em BLCA. A análise de célula única permite uma exploração mais aprofundada de qual agrupamento celular apresenta alta expressão de TRPM4 em comparação com a análise transcriptômica. Certifique-se de que os dados de análise de célula única sejam coletados do GSE130001 e verifique o padrão de controle de qualidade que indica que o número de células por conjunto de dados deve ser maior que 1000, a contagem de UMI por célula deve ser maior que 1000 e o número de genes por célula deve ser maior que 500. Os genes diferencialmente expressos de cada cluster em comparação com todas as outras células são identificados com base na mudança de dobra transformada logarítmica (|logFC| >= 0,25), e a resolução de agrupamento deve ser 0,5.
  2. Anotação celular para diferentes agrupamentos celulares
    1. Certifique-se de que todos os clusters de células estejam anotados. Por exemplo, as células B podem ser anotadas por CD19, MS4A1, CD27, IGHD, IGHM, TCL1A e FCRL5. Todos os genes usados para anotação celular podem ser encontrados na Tabela Suplementar 3.
    2. Depois, escolha GSE145281 e baixe todos os resultados do TRPM4. Clique no botão Geral e baixe o gráfico UMAP de GSE145281 de diferentes agrupamentos e tipos de células.
    3. Clique no botão Gene e escolha o gene único que será analisado. Clique no botão GSEA e observe as funções desse único gene em várias vias, como a via KEGG e a viaHallmark 16,17.
    4. Clique no botão CCI e encontre o gráfico de chat celular e o gráfico de bolha do chat celular do cluster que expressam fortemente um único gene.
    5. Clique no botão de enriquecimento TF para ver o Fator de Transcrição enriquecido para cada cluster.

6. 101 Aprendizado de máquina para construir um modelo prognóstico relacionado ao TRPM4

  1. Instale todos os pacotes R necessários para análise de dados transcriptômicos. Considerando que uma única abordagem de aprendizado de máquina pode nem sempre ser o método ideal para prever prognóstico, um modelo prognóstico pode ser construído usando técnicas de aprendizado de máquina 101. Realizar uma análise de correlação entre todos os genes da coorte TCGA-BLCA e as coortes GSE32894 e GSE31684 e TRPM4.
  2. Com base no número de genes fortemente associados ao TRPM4, selecione todos os genes com correlação maior ou igual a 0,6 ou menor ou igual a -0,6 com TRPM4. Selecione todos os genes fortemente associados ao TRPM4 em todas as coortes.
  3. Combine todos os dados de GSE32894 e GSE31684 coortes para formar um conjunto de validação e use o TCGA-BLCA como conjunto de treinamento.
  4. De acordo com os requisitos do código, nomeie os dados necessários com os nomes correspondentes e então clique no botão Executar .

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

É bem conhecido que o benefício central do uso da transcriptômica para analisar o microambiente imune de genes individuais é que permite uma correlação direta entre genes individuais e as interações dinâmicas com células e moléculas imunes no nível da expressão gênica, possibilitando a observação direta das características imunes e a identificação de diferenças na proporção de células imunes infiltradas entre grupos com alta ou baixa expressão de genes individuais ou mudanças na expressã...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Em estudos anteriores, a análise bioinformática de genes individuais frequentemente enfrentou questões como superficialidade, imprecisão e aplicabilidadelimitada 19. Além disso, pesquisas anteriores sobre genes individuais geralmente se limitaram a dados do transcriptoma. Além disso, ao focar exclusivamente nos dados do transcriptoma, podem surgir questões como heterogeneidade e aleatoriedade da amostra, dificultando a identificação de padrõesuni...

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores declaram que não têm conflito de interesses.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gostaríamos de agradecer ao BioBean Informatics Consortium por desenvolver uma estrutura analítica inteligente (disponível em http://www.sxdyc.com/). Sua infraestrutura computacional inovadora acelerou substancialmente o fluxo de trabalho de pesquisa por meio de análises de precisão e módulos automatizados de interpretação de dados.

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
R 4.3.3nenhumnenhumnenhum

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhang, C., et al. Identification of multicohort-based predictive signature for NMIBC recurrence reveals SDCBP as a novel oncogene in bladder cancer. Ann Med. 57 (1), 2458211(2025).
  2. Han, M. H., et al. Plasma GFAP and Amyloid Pathology Predict Cognitive Response to Multidomain Interventions in MCI. Aging Dis. , (2025).
  3. Xie, S., et al. Towards Precision Aging Biology: Single-Cell Multi-Omics and Advanced AI-Driven Strategies. Aging Dis. , (2025).
  4. Han, Y., et al. TISCH2: expanded datasets and new tools for single-cell transcriptome analyses of the tumor microenvironment. Nucleic Acids Res. 51 (D1), D1425-D1431 (2023).
  5. Yao, Y., et al. Advances in prognostic models for osteosarcoma risk. Heliyon. 10 (7), e28493(2024).
  6. Ding, X., et al. Glutamine metabolism reprogramming promotes bladder cancer progression via PYCR1: a multi-omics and functional validation study. J Transl Med. 23 (1), 1277(2025).
  7. Zhu, T., et al. Methylparaben and propylparaben promote bladder cancer invasion via MMP2 and PPARG modulation. Ecotoxicol Environ Saf. 306, 119383(2025).
  8. Xie, J. H., et al. Deciphering cutaneous melanoma prognosis through LDL metabolism: Single-cell transcriptomics analysis via 101 machine learning algorithms. Exp Dermatol. 33 (4), e15070(2024).
  9. Sun, D., et al. TISCH: a comprehensive web resource enabling interactive single-cell transcriptome visualization of tumor microenvironment. Nucleic Acids Res. 49 (D1), D1420-D1430 (2021).
  10. Cao, X., et al. D-Mannose Upregulates Testin via the NF-κB Pathway to Inhibit Breast Cancer Proliferation. J Biochem Mol Toxicol. 39 (8), e70398(2025).
  11. Goldman, M. J., et al. Visualizing and interpreting cancer genomics data via the Xena platform. Nat Biotechnol. 38 (6), 675-678 (2020).
  12. Yu, Q., et al. GREM1 may be a biological indicator and potential target of bladder cancer. Sci Rep. 14 (1), 23280(2024).
  13. Wu, Q., et al. Membrane palmitoylated protein MPP1 inhibits immune escape by regulating the USP12/ CCL5 axis in urothelial carcinoma. Int Immunopharmacol. 146, 113802(2025).
  14. Johnson, W. E., Li, C., Rabinovic, A. Adjusting batch effects in microarray expression data using empirical Bayes methods. Biostatistics. 8 (1), 118-127 (2007).
  15. Hu, J., et al. Siglec15 shapes a non-inflamed tumor microenvironment and predicts the molecular subtype in bladder cancer. Theranostics. 11 (7), 3089-3108 (2021).
  16. Kanehisa, M., Sato, Y., Morishima, K. BlastKOALA and GhostKOALA: KEGG Tools for Functional Characterization of Genome and Metagenome Sequences. J Mol Biol. 428 (4), 726-731 (2016).
  17. Munkley, J., et al. Hallmarks of glycosylation in cancer. Oncotarget. 7 (23), 35478-35489 (2016).
  18. Da, Y., et al. A high stroma-tumor ratio is associated with an immunosuppressive tumor microenvironment and a poor prognosis in bladder cancer. Front Oncol. 15, 1604609(2025).
  19. Chen, C., et al. Bioinformatics Methods for Mass Spectrometry-Based Proteomics Data Analysis. Int J Mol Sci. 21 (8), 2873(2020).
  20. Jonauskaite, D., et al. Universal Patterns in Color-Emotion Associations Are Further Shaped by Linguistic and Geographic Proximity. Psychol Sci. 31 (10), 1245-1260 (2020).
  21. Zhu, W., et al. Integrated machine learning identifies epithelial cell marker genes for improving outcomes and immunotherapy in prostate cancer. J Transl Med. 21 (1), 782(2023).
  22. Zhao, J., et al. Bioinformatics prediction and experimental verification of key biomarkers for diabetic kidney disease based on transcriptome sequencing in mice. PeerJ. 10, e13932(2022).

Acesso restrito. Inicie sessão ou comece um teste para visualizar este conteúdo.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

TCGA DataSingle Cell DataTRPM4 GeneTumor Immune MicroenvironmentTumor Molecular SubtypesPrognostic ModelMachine LearningBioinformatics AnalysisSingle Gene AnalysisTISCH2 Website

Artigos relacionados