Powszechne zastosowanie wysokoprzepustowych technologii sekwencjonowania znacząco wpłynęło na nasze zrozumienie biologii i heterogeniczności nowotworów1. Ten przełomowy postęp w biotechnologii nie tylko pogłębił naszą wiedzę naukową, ale także zrewolucjonizował dziedzinę badań medycznych. Umożliwiając naukowcom szybkie i dokładne sekwencjonowanie dużych ilości materiału genetycznego, sekwencjonowanie o wysokiej przepustowości przyspieszyło odkrywanie nowych genów, mutacji i szlaków biologicznych. Coraz więcej badań wskazuje na specyficzne sygnatury molekularne związane z postępem choroby, rokowaniem pacjenta i reakcją terapeutyczną na podstawie danych sekwencjonowania 2,3,4. Te specyficzne sygnatury oferują kompleksowy krajobraz zrozumienia transkrypcyjnej sieci regulacyjnej leżącej u podstaw biologii nowotworu, w tym pochodzenia guza, różnicowania, migracji i oporności na leczenie5. Cechy te są często zróżnicowane i zróżnicowane, obejmują wiele aspektów, a nie ograniczają się do jednego eksponatu. Utrudnia to badania przesiewowe i identyfikację konkretnych genów silnie związanych z chorobą. W związku z tym istnieje pilna potrzeba opracowania rozsądnych strategii obliczeniowych w celu zbadania kluczowych genów związanych z chorobą.
Uczenie maszynowe (ML) to gałąź sztucznej inteligencji, która koncentruje się na budowaniu systemów, które mogą uczyć się na podstawie złożonych zestawów danych, identyfikować wzorce i opracowywać model predykcyjny z dużą dokładnością, aby zapewnić odniesienie do podejmowania decyzji6. Ostatnio nastąpił szybki postęp w rozwoju modeli opartych na uczeniu maszynowym na podstawie danych transkryptomu w celu przewidywania wyników leczenia pacjentów lub diagnozowania chorób 7,8,9,10. Wydajność tych modeli często różni się znacznie ze względu na różne zestawy danych i algorytmy używane do trenowania. Wybór optymalnego modelu do kolejnych eksperymentów i zastosowań klinicznych okazał się pilnym wyzwaniem. Opłacalne podejście polega na porównaniu wydajności różnych modeli i wybraniu najbardziej obiecującego z nich do dalszego wykorzystania 7,11. Co więcej, różnorodność parametrów i formatów wyników obsługiwanych w różnych strukturach obliczeniowych stanowi poważne wyzwanie dla analizy porównawczej. Jednak obecnie nie ma oprogramowania, które integrowałoby najnowocześniejsze algorytmy uczenia maszynowego w celu porównania mocnych i słabych stron różnych modeli oraz uproszczenia procesu wyboru parametrów, ułatwiając użytkownikom dostęp. W związku z tym istnieje potrzeba opracowania przyjaznego dla użytkownika oprogramowania, które może ułatwić integrację danych transkrypcyjnych z różnymi algorytmami uczenia maszynowego, a jednocześnie rozwiązać obecne ograniczenia w doborze biomarkerów i interpretacji modelu. Takie postępy znacznie poszerzą naszą zdolność do dostarczania cennych informacji na temat obecnych dziedzin badań i ostatecznie poprawią wyniki leczenia pacjentów.
W tym badaniu opracowaliśmy pakiet R o otwartym kodzie źródłowym o nazwie Mime12, który wykazuje solidną wydajność w zestawach danych i ma na celu usprawnienie integracji zestawów danych transkryptomu z różnymi algorytmami uczenia maszynowego, upraszczając w ten sposób powiązane procesy. Aby zidentyfikować potencjalnych kandydatów na podstawie danych transkryptomu na dużą skalę i opracować optymalne modele, Mime oferuje cztery funkcje aplikacji: optymalny model prognostyczny skonstruowany przez integrację 10 algorytmów uczenia maszynowego; binarny model odpowiedzi skonstruowany przy użyciu siedmiu algorytmów uczenia maszynowego; podstawowe cechy związane z prognozowaniem zidentyfikowane za pomocą ośmiu algorytmów uczenia maszynowego; i wizualizacja wydajności każdego modelu.