$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
O câncer de mama é uma doença heterogênea com diversas estratégias de prognóstico e tratamento em diferentes subtipos moleculares, em que a patogênese e o desenvolvimento estão provavelmente associados a mecanismos moleculares distintos1,2 , 3. Entretanto, identificar um alvo terapêutico toma geralmente anos, ou mesmo décadas, da descoberta inicial na pesquisa básica ao uso clínico4. A ampla aplicação do genoma da tecnologia de sequenciamento de alto débito para o genoma do câncer avançou muito no processo de busca de biomarcadores valiosos ou alvos terapêuticos 5.
A quantidade esmagadora de dados de genômica de câncer gerada a partir das plataformas de genômica de câncer em grande escala, como o ICGC (consórcio internacional do genoma do câncer) e o TCGA (o Atlas do genoma do câncer), está colocando um grande desafio para os pesquisadores realizarem dados exploração, integração e análise, especialmente para usuários que não possuem treinamento intensivo em informática e computação6,7,8,9,10. Nos últimos anos, bases de dados emergentes, (por exemplo, ONCOMINE, bcGenExMiner v 4.0, e Kaplan-Meier plotter, etc.) foram projetados e desenvolvidos para reduzir a barra para abordar os intrincados conjuntos de dados genóricos do cancro, assim, facilitando os investigadores para analisar e interpretar os genes, amostras e dados clínicos em vários tipos de câncer11. O objetivo deste protocolo é descrever uma estratégia de pesquisa que integrou com múltiplos níveis de informação genética de uma série de bases de dados de acesso aberto, que têm sido amplamente reconhecidas por um grande número de pesquisadores, para identificar os potenciais biomarcadores e fatores prognósticos para o cancro da mama.
A base de dados de oncomine é uma plataforma Web-baseada da mineração do dado com informação do microarray do cancro e é projetada facilitar a descoberta de biomarcadores novos e de alvos terapêuticos11. Atualmente, há mais de 48 milhões medições de expressão gênica de conjuntos de dados de expressão de genes 65 neste banco de dados11,12. O bcGenExMiner v 4.0 (uma ferramenta livre para a instituição sem fins lucrativos), também chamado de câncer de mama gene-Expression Miner, é um aplicativo baseado na Web de fácil utilização compreendendo resultados de Microarrays de DNA de 3.414 recuperado pacientes com câncer de mama e 1.209 experimentou um evento pejorativo13. Ele é projetado para melhorar o desempenho da análise de prognóstico genético com R software estatístico e pacotes.
O GOBO é uma ferramenta on-line multifuncional de fácil utilização com informações de Microarrays (por exemplo, Affymetrix U133A) de um conjunto de linha celular de câncer de mama de 51 amostras e um conjunto de dados de tumor de mama 1881-Sample, que permite uma ampla variedade de análises14. Há uma variedade de aplicações disponíveis na base de dados de gobo, que incluem a análise rápida de perfis da expressão de gene em subtipos moleculars diferentes de tumores da mama e de linhas de pilha, a seleção para genes coexpressados para a criação de Metagenes potenciais, e análise de correlação entre o desfecho e os níveis de expressão gênica de genes únicos, conjuntos de genes ou assinaturas genéticas no conjunto de dados de câncer de mama15.
O Atlas da proteína humana é um programa de acesso aberto projetado para que os cientistas explorem o Proteome humano, que tem contribuído já a um grande número publicações no campo da biologia humana e da doença. O Atlas da proteína humana é reconhecido como um recurso Central Europeu para a comunidade de Ciências da vida16,17.
O plotador de Kaplan Meier é uma ferramenta em linha que integra a expressão genética e os dados clínicos simultaneamente que permite a avaliação do efeito prognóstico de 54.675 genes baseados em 10.461 amostras do cancro, que incluem 1.065 gastric, 2.437 pulmão, 1.816 ovariano e 5.143 pacientes com câncer de mama com seguimento médio de 33/49/40/69 meses18. Informações de expressão gênica, sobrevida livre de recaídas (RFS) e sobrevida global (os) estão disponíveis para download a partir deste banco de dados19,20.
Aqui, nós descrevemos um procedimento prático da operação de usar bases de dados publicamente acessíveis múltiplas para comparar, analisar e Visualizar testes padrões das alterações na expressão do gene do interesse através dos estudos múltiplos do cancro, com o objetivo de resumir perfis de expressão, valores prognósticos e potenciais funções biológicas no cancro da mama. Por exemplo, estudos recentes indicaram as propriedades oncogênicas de proteínas de identificação em tumores e foram associadas a características malignas, incluindo transformação celular, imortalização, proliferação aumentada e metástase21, 22,23. Entretanto, cada membro da família da identificação joga papéis distintos em tipos diferentes de tumores contínuos, e seu papel no cancro da mama permanece obscuro24. Em estudos prévios, explorados através deste método, verificou-se que o ID1 foi um indicador prognóstico significativo no câncer de mama25. Portanto, o protocolo levará ID1 como um exemplo para introduzir os métodos de mineração de dados.
A análise começa a partir de consultar o padrão de expressão do gene de interesse em amostras cancerosas versus amostras normais em ONCOMINE. Em seguida, a correlação de expressão de genes de interesse em câncer de mama foi realizada utilizando-se o BC-GenExMiner v 4.0, GOBO e ONCOMINE. Em seguida, os perfis de expressão de ID1 foram estratificados de acordo com diferentes subgrupos utilizando as três bases de dados acima. Finalmente, a associação entre a expressão de ID1 e a sobrevida foi analisada utilizando-se o BC-GenExMiner v 4.0, o Atlas de proteínas humanas e o plotter de Kaplan-Meier. O procedimento de operação foi mostrado como o fluxograma na Figura 1.