L’adoption généralisée des technologies de séquençage à haut débit a considérablement influencé notre compréhension de la biologie et de l’hétérogénéité du cancer1. Cette avancée révolutionnaire en biotechnologie a non seulement approfondi nos connaissances scientifiques, mais a également révolutionné le domaine de la recherche médicale. En permettant aux scientifiques de séquencer rapidement et avec précision de grandes quantités de matériel génétique, le séquençage à haut débit a accéléré la découverte de nouveaux gènes, mutations et voies biologiques. De plus en plus de recherches ont permis de délimiter des signatures moléculaires spécifiques associées à la progression de la maladie, au pronostic des patients et à la réponse thérapeutique à partir des données de séquençage 2,3,4. Ces signatures spécifiques offrent un paysage complet de compréhension du réseau de régulation transcriptionnelle sous-jacent à la biologie tumorale, y compris l’origine, la différenciation, la migration et la résistance au traitementdes tumeurs 5. Ces caractéristiques sont souvent diverses et variées, englobant de multiples facettes plutôt que d’être confinées à une seule exposition. Il est donc difficile de dépister et d’identifier des gènes spécifiques fortement associés à la maladie. Il est donc urgent de mettre au point des stratégies informatiques sensées pour dépister les gènes cruciaux impliqués dans la maladie.
L’apprentissage automatique (ML) est une branche de l’intelligence artificielle qui se concentre sur la création de systèmes capables d’apprendre à partir d’ensembles de données complexes, d’identifier des modèles et de développer un modèle prédictif de haute précision pour fournir une référence pour la prise de décisions6. Récemment, le développement de modèles basés sur l’apprentissage automatique à partir de données de transcriptome pour prédire les résultats des patients ou diagnostiquer des maladies a progressé rapidement dans une variété de maladies 7,8,9,10. Les performances de ces modèles varient souvent considérablement en raison des différents ensembles de données et algorithmes utilisés pour l’entraînement. La sélection du modèle optimal pour les expériences ultérieures et les applications cliniques est apparue comme un défi pressant. Une approche viable consiste à comparer les performances de différents modèles et à sélectionner le plus prometteur pour une utilisation ultérieure 7,11. De plus, la diversité des paramètres et des formats de résultats pris en charge dans divers cadres de calcul pose des défis importants pour l’analyse comparative. Cependant, il n’existe actuellement aucun logiciel qui intègre des algorithmes d’apprentissage automatique de pointe pour comparer les forces et les faiblesses de différents modèles et simplifier le processus de sélection des paramètres, ce qui facilite l’accès des utilisateurs. Il est donc nécessaire de développer des logiciels conviviaux capables de faciliter l’intégration des données transcriptionnelles avec divers algorithmes d’apprentissage automatique, tout en s’attaquant aux limites actuelles de la sélection des biomarqueurs et de l’interprétation des modèles. De telles avancées élargiront considérablement notre capacité à fournir des informations précieuses sur les domaines de recherche actuels et, en fin de compte, à améliorer les résultats pour les patients.
Dans cette étude, nous avons développé un package R open source nommé Mime12, qui démontre des performances robustes sur l’ensemble des ensembles de données et vise à rationaliser l’intégration des ensembles de données de transcriptome avec divers algorithmes d’apprentissage automatique, simplifiant ainsi les processus associés. Pour identifier des candidats potentiels à partir de données de transcriptome à grande échelle et développer des modèles optimaux, Mime propose quatre fonctions applicatives : un modèle de pronostic optimal construit en intégrant 10 algorithmes d’apprentissage automatique ; un modèle de réponse binaire construit à l’aide de sept algorithmes d’apprentissage automatique ; les principales caractéristiques liées au pronostic identifiées à l’aide de huit algorithmes d’apprentissage automatique ; et visualisation des performances de chaque modèle.