De wijdverbreide acceptatie van high-throughput sequencing-technologieën heeft ons begrip van biologie en kankerheterogeniteit aanzienlijk beïnvloed1. Deze baanbrekende vooruitgang in de biotechnologie heeft niet alleen onze wetenschappelijke kennis verdiept, maar heeft ook een revolutie teweeggebracht op het gebied van medisch onderzoek. Door wetenschappers in staat te stellen grote hoeveelheden genetisch materiaal snel en nauwkeurig te sequencen, heeft high-throughput sequencing de ontdekking van nieuwe genen, mutaties en biologische routes versneld. Een groeiend aantal onderzoeken heeft specifieke moleculaire handtekeningen afgebakend die verband houden met ziekteprogressie, patiëntprognose en therapeutische respons op basis van sequentiegegevens 2,3,4. Deze specifieke handtekeningen bieden een uitgebreid landschap van begrip van het transcriptionele regulerende netwerk dat ten grondslag ligt aan tumorbiologie, inclusief tumoroorsprong, differentiatie, migratie en behandelingsresistentie5. Deze kenmerken zijn vaak divers en gevarieerd en omvatten meerdere facetten in plaats van beperkt te zijn tot een enkele tentoonstelling. Dit maakt het moeilijk om specifieke genen te screenen en te identificeren die sterk geassocieerd zijn met de ziekte. Er is dus dringend behoefte aan verstandige computationele strategieën om cruciale genen die betrokken zijn bij ziekte te screenen.
Machine learning (ML) is een tak van kunstmatige intelligentie die zich richt op het bouwen van systemen die kunnen leren van complexe datasets, patronen kunnen identificeren en een voorspellend model met hoge nauwkeurigheid kunnen ontwikkelen om een referentie te bieden voor het nemen van beslissingen6. Onlangs is de ontwikkeling van op machine learning gebaseerde modellen op basis van transcriptoomgegevens om patiëntresultaten te voorspellen of ziekten te diagnosticeren snel gevorderd bij een verscheidenheid aan ziekten 7,8,9,10. De prestaties van deze modellen variëren vaak sterk vanwege de verschillende datasets en algoritmen die voor training worden gebruikt. Het selecteren van het optimale model voor latere experimenten en klinische toepassingen is een dringende uitdaging gebleken. Een haalbare aanpak omvat het vergelijken van de prestaties van verschillende modellen en het selecteren van de meest veelbelovende voor verder gebruik 7,11. Bovendien vormt de diversiteit in parameters en resultaatformaten die in verschillende computerframeworks worden ondersteund, aanzienlijke uitdagingen voor vergelijkende analyse. Er is momenteel echter geen software die geavanceerde machine learning-algoritmen integreert om de sterke en zwakke punten van verschillende modellen te vergelijken en het parameterselectieproces te vereenvoudigen, waardoor het voor gebruikers gemakkelijker toegankelijk wordt. Er is dus behoefte aan de ontwikkeling van gebruiksvriendelijke software die de integratie van transcriptionele gegevens met diverse machine learning-algoritmen kan vergemakkelijken, terwijl ook de huidige beperkingen van biomarkerselectie en modelinterpretatie worden aangepakt. Dergelijke ontwikkelingen zullen ons vermogen om waardevolle inzichten te verschaffen in de huidige onderzoeksgebieden aanzienlijk vergroten en uiteindelijk de patiëntresultaten verbeteren.
In deze studie hebben we een open-source R-pakket ontwikkeld met de naam Mime12, dat robuuste prestaties laat zien in alle datasets en tot doel heeft de integratie van transcriptoomdatasets met verschillende machine learning-algoritmen te stroomlijnen, waardoor de bijbehorende processen worden vereenvoudigd. Om potentiële kandidaten te identificeren op basis van grootschalige transcriptoomgegevens en optimale modellen te ontwikkelen, biedt Mime vier toepassingsfuncties: een optimaal prognosemodel dat is geconstrueerd door 10 machine learning-algoritmen te integreren; een binair responsmodel dat is geconstrueerd met behulp van zeven machine learning-algoritmen; kernkenmerken met betrekking tot prognose geïdentificeerd met behulp van acht machine learning-algoritmen; en visualisatie van de prestaties van elk model.