A adoção generalizada de tecnologias de sequenciamento de alto rendimento influenciou significativamente nossa compreensão da biologia e da heterogeneidade do câncer1. Este avanço inovador na biotecnologia não apenas aprofundou nosso conhecimento científico, mas também revolucionou o campo da pesquisa médica. Ao permitir que os cientistas sequenciem grandes quantidades de material genético com rapidez e precisão, o sequenciamento de alto rendimento acelerou a descoberta de novos genes, mutações e vias biológicas. Um crescente corpo de pesquisa delineou assinaturas moleculares específicas associadas à progressão da doença, prognóstico do paciente e capacidade de resposta terapêutica a partir de dados de sequenciamento 2,3,4. Essas assinaturas específicas oferecem um cenário abrangente de compreensão da rede regulatória transcricional subjacente à biologia do tumor, incluindo origem do tumor, diferenciação, migração e resistência ao tratamento5. Essas características são frequentemente diversas e variadas, abrangendo múltiplas facetas, em vez de se limitarem a uma única exposição. Isso dificulta a triagem e a identificação de genes específicos altamente associados à doença. Assim, há uma necessidade urgente de estratégias computacionais sensatas para rastrear genes cruciais implicados na doença.
O aprendizado de máquina (ML) é um ramo da inteligência artificial que se concentra na construção de sistemas que podem aprender com conjuntos de dados complexos, identificar padrões e desenvolver um modelo preditivo com alta precisão para fornecer uma referência para a tomada de decisões6. Recentemente, o desenvolvimento de modelos baseados em aprendizado de máquina a partir de dados de transcriptoma para prever resultados de pacientes ou diagnosticar doenças avançou rapidamente em uma variedade de doenças 7,8,9,10. O desempenho desses modelos geralmente varia muito devido aos diferentes conjuntos de dados e algoritmos usados para treinamento. Selecionar o modelo ideal para experimentos subsequentes e aplicações clínicas surgiu como um desafio urgente. Uma abordagem viável envolve comparar o desempenho de vários modelos e selecionar o mais promissor para posterior utilização 7,11. Além disso, a diversidade de parâmetros e formatos de resultados suportados em várias estruturas de computação apresenta desafios significativos para a análise comparativa. No entanto, atualmente não existe um software que integre algoritmos de aprendizado de máquina de ponta para comparar os pontos fortes e fracos de diferentes modelos e simplificar o processo de seleção de parâmetros, facilitando o acesso dos usuários. Assim, há uma necessidade de desenvolvimento de software amigável que possa facilitar a integração de dados transcricionais com diversos algoritmos de aprendizado de máquina, ao mesmo tempo em que aborda as limitações atuais de seleção de biomarcadores e interpretação de modelos. Esses avanços expandirão muito nossa capacidade de fornecer informações valiosas sobre os campos de pesquisa atuais e, em última análise, melhorar os resultados dos pacientes.
Neste estudo, desenvolvemos um pacote R de código aberto chamado Mime12, que demonstra desempenho robusto em conjuntos de dados e visa agilizar a integração de conjuntos de dados de transcriptoma com vários algoritmos de aprendizado de máquina, simplificando assim os processos associados. Para identificar potenciais candidatos a partir de dados de transcriptoma em larga escala e desenvolver modelos ideais, o Mime oferece quatro funções de aplicação: um modelo de prognóstico ideal construído pela integração de 10 algoritmos de aprendizado de máquina; um modelo de resposta binária construído usando sete algoritmos de aprendizado de máquina; principais recursos relacionados ao prognóstico identificados usando oito algoritmos de aprendizado de máquina; e visualização do desempenho de cada modelo.