Die weit verbreitete Einführung von Hochdurchsatz-Sequenzierungstechnologien hat unser Verständnis der Biologie und der Heterogenität von Krebs erheblich beeinflusst1. Dieser bahnbrechende Fortschritt in der Biotechnologie hat nicht nur unsere wissenschaftlichen Kenntnisse vertieft, sondern auch das Feld der medizinischen Forschung revolutioniert. Durch die schnelle und genaue Sequenzierung großer Mengen an genetischem Material hat die Hochdurchsatz-Sequenzierung die Entdeckung neuer Gene, Mutationen und biologischer Signalwege beschleunigt. Eine wachsende Zahl von Forschungsarbeiten hat anhand von Sequenzierungsdaten spezifische molekulare Signaturen im Zusammenhang mit dem Krankheitsverlauf, der Patientenprognose und dem therapeutischen Ansprechen abgegrenzt 2,3,4. Diese spezifischen Signaturen bieten ein umfassendes Verständnis des transkriptionellen regulatorischen Netzwerks, das der Tumorbiologie zugrunde liegt, einschließlich Tumorursprung, Differenzierung, Migration und Behandlungsresistenz5. Diese Merkmale sind oft vielfältig und vielfältig und umfassen mehrere Facetten, anstatt auf ein einzelnes Exponat beschränkt zu sein. Dies erschwert das Screening und die Identifizierung spezifischer Gene, die in hohem Maße mit der Krankheit assoziiert sind. Daher besteht ein dringender Bedarf an vernünftigen Computerstrategien, um wichtige Gene zu screenen, die an Krankheiten beteiligt sind.
Maschinelles Lernen (ML) ist ein Zweig der künstlichen Intelligenz, der sich auf den Aufbau von Systemen konzentriert, die aus komplexen Datensätzen lernen, Muster erkennen und ein Vorhersagemodell mit hoher Genauigkeit entwickeln können, um eine Referenz für die Entscheidungsfindung zu liefern6. In jüngster Zeit hat die Entwicklung von auf maschinellem Lernen basierenden Modellen aus Transkriptomdaten zur Vorhersage von Patientenergebnissen oder zur Diagnose von Krankheiten bei einer Vielzahl von Krankheiten rasche Fortschritte gemacht 7,8,9,10. Die Leistung dieser Modelle variiert aufgrund der unterschiedlichen Datensätze und Algorithmen, die für das Training verwendet werden, oft stark. Die Auswahl des optimalen Modells für nachfolgende Experimente und klinische Anwendungen hat sich als drängende Herausforderung herausgestellt. Ein praktikabler Ansatz besteht darin, die Leistung verschiedener Modelle zu vergleichen und das vielversprechendste Modell für die weitere Nutzung auszuwählen 7,11. Darüber hinaus stellt die Vielfalt der Parameter und Ergebnisformate, die von verschiedenen Computing-Frameworks unterstützt werden, eine erhebliche Herausforderung für die vergleichende Analyse dar. Derzeit gibt es jedoch keine Software, die modernste Algorithmen des maschinellen Lernens integriert, um die Stärken und Schwächen verschiedener Modelle zu vergleichen und den Prozess der Parameterauswahl zu vereinfachen, wodurch der Zugriff für die Benutzer erleichtert wird. Daher besteht ein Bedarf an der Entwicklung einer benutzerfreundlichen Software, die die Integration von Transkriptionsdaten mit verschiedenen Algorithmen des maschinellen Lernens erleichtern und gleichzeitig die derzeitigen Einschränkungen bei der Auswahl von Biomarkern und der Interpretation von Modellen angehen kann. Solche Fortschritte werden unsere Fähigkeit, wertvolle Einblicke in aktuelle Forschungsbereiche zu liefern und letztendlich die Patientenergebnisse zu verbessern, erheblich erweitern.
In dieser Studie haben wir ein Open-Source-R-Paket namens Mime12 entwickelt, das eine robuste Leistung über Datensätze hinweg demonstriert und darauf abzielt, die Integration von Transkriptom-Datensätzen mit verschiedenen Algorithmen des maschinellen Lernens zu rationalisieren und dadurch die damit verbundenen Prozesse zu vereinfachen. Um potenzielle Kandidaten aus umfangreichen Transkriptomdaten zu identifizieren und optimale Modelle zu entwickeln, bietet Mime vier Anwendungsfunktionen: ein optimales Prognosemodell, das durch die Integration von 10 Algorithmen des maschinellen Lernens erstellt wird; ein binäres Antwortmodell, das unter Verwendung von sieben Algorithmen des maschinellen Lernens erstellt wurde; Kernfunktionen im Zusammenhang mit der Prognose, die mithilfe von acht Algorithmen des maschinellen Lernens identifiziert wurden; und Visualisierung der Leistung jedes Modells.