L'adozione diffusa di tecnologie di sequenziamento ad alto rendimento ha influenzato in modo significativo la nostra comprensione della biologia e dell'eterogeneità del cancro1. Questo progresso rivoluzionario nel campo della biotecnologia non solo ha approfondito le nostre conoscenze scientifiche, ma ha anche rivoluzionato il campo della ricerca medica. Consentendo agli scienziati di sequenziare grandi quantità di materiale genetico in modo rapido e accurato, il sequenziamento ad alto rendimento ha accelerato la scoperta di nuovi geni, mutazioni e percorsi biologici. Un numero crescente di ricerche ha delineato specifiche firme molecolari associate alla progressione della malattia, alla prognosi dei pazienti e alla risposta terapeutica dai dati di sequenziamento 2,3,4. Queste firme specifiche offrono un panorama completo per comprendere la rete regolatoria trascrizionale alla base della biologia tumorale, tra cui l'origine, la differenziazione, la migrazione e la resistenza al trattamento del tumore5. Queste caratteristiche sono spesso diverse e variegate, comprendono molteplici sfaccettature piuttosto che essere confinate a una singola mostra. Ciò rende difficile lo screening e l'identificazione di geni specifici altamente associati alla malattia. Pertanto, c'è un urgente bisogno di strategie computazionali sensate per lo screening di geni cruciali implicati nella malattia.
L'apprendimento automatico (ML) è una branca dell'intelligenza artificiale che si concentra sulla creazione di sistemi in grado di apprendere da set di dati complessi, identificare modelli e sviluppare un modello predittivo con elevata precisione per fornire un riferimento per prendere decisioni6. Recentemente, lo sviluppo di modelli basati sull'apprendimento automatico dai dati del trascrittoma per prevedere gli esiti dei pazienti o diagnosticare malattie è avanzato rapidamente in una varietà di malattie 7,8,9,10. Le prestazioni di questi modelli spesso variano notevolmente a causa dei diversi set di dati e algoritmi utilizzati per l'addestramento. La selezione del modello ottimale per gli esperimenti successivi e le applicazioni cliniche è emersa come una sfida urgente. Un approccio praticabile comporta il confronto delle prestazioni di vari modelli e la selezione di quello più promettente per un ulteriore utilizzo 7,11. Inoltre, la diversità dei parametri e dei formati dei risultati supportati nei vari framework di calcolo pone sfide significative per l'analisi comparativa. Tuttavia, al momento non esiste un software che integri algoritmi di apprendimento automatico all'avanguardia per confrontare i punti di forza e di debolezza dei diversi modelli e semplificare il processo di selezione dei parametri, facilitando l'accesso da parte degli utenti. Pertanto, è necessario lo sviluppo di un software di facile utilizzo in grado di facilitare l'integrazione dei dati trascrizionali con diversi algoritmi di apprendimento automatico, affrontando al contempo gli attuali limiti della selezione dei biomarcatori e dell'interpretazione dei modelli. Tali progressi amplieranno notevolmente la nostra capacità di fornire preziose informazioni sugli attuali campi di ricerca e, in ultima analisi, miglioreranno i risultati dei pazienti.
In questo studio, abbiamo sviluppato un pacchetto R open source denominato Mime12, che dimostra prestazioni solide in tutti i set di dati e mira a semplificare l'integrazione dei set di dati del trascrittoma con vari algoritmi di apprendimento automatico, semplificando così i processi associati. Per identificare potenziali candidati da dati di trascrittoma su larga scala e sviluppare modelli ottimali, Mime offre quattro funzioni applicative: un modello di prognosi ottimale costruito integrando 10 algoritmi di apprendimento automatico; un modello di risposta binario costruito utilizzando sette algoritmi di apprendimento automatico; caratteristiche principali relative alla prognosi identificate utilizzando otto algoritmi di apprendimento automatico; e visualizzazione delle prestazioni di ciascun modello.