Yüksek verimli dizileme teknolojilerinin yaygın olarak benimsenmesi, biyoloji ve kanser heterojenliği anlayışımızı önemli ölçüde etkilemiştir1. Biyoteknolojideki bu çığır açan ilerleme, yalnızca bilimsel bilgimizi derinleştirmekle kalmadı, aynı zamanda tıbbi araştırma alanında da devrim yarattı. Bilim adamlarının büyük miktarda genetik materyali hızlı ve doğru bir şekilde sıralamasını sağlayarak, yüksek verimli dizileme yeni genlerin, mutasyonların ve biyolojik yolların keşfini hızlandırdı. Büyüyen bir araştırma grubu, sıralama verilerindenhastalığın ilerlemesi, hasta prognozu ve terapötik yanıt ile ilişkili spesifik moleküler imzaları tanımlamıştır 2,3,4. Bu özel imzalar, tümör kökeni, farklılaşması, göçü ve tedavi direnci5 dahil olmak üzere tümör biyolojisinin altında yatan transkripsiyonel düzenleyici ağı anlamak için kapsamlı bir manzara sunar. Bu özellikler genellikle çeşitli ve çeşitlidir, tek bir sergiyle sınırlı kalmak yerine birden fazla yönü kapsar. Bu, hastalıkla yüksek oranda ilişkili spesifik genlerin taranmasını ve tanımlanmasını zorlaştırır. Bu nedenle, hastalıkta rol oynayan önemli genleri taramak için mantıklı hesaplama stratejilerine acil bir ihtiyaç vardır.
Makine öğrenimi (ML), karmaşık veri kümelerinden öğrenebilen, kalıpları tanımlayabilen ve karar vermek için bir referans sağlamak üzere yüksek doğrulukta tahmine dayalı bir model geliştirebilen sistemler oluşturmaya odaklanan bir yapay zeka dalıdır6. Son zamanlarda, hasta sonuçlarını tahmin etmek veya hastalıkları teşhis etmek için transkriptom verilerinden makine öğrenimi tabanlı modellerin geliştirilmesi, çeşitli hastalıklarda hızla ilerlemiştir 7,8,9,10. Bu modellerin performansı, eğitim için kullanılan farklı veri kümeleri ve algoritmalar nedeniyle genellikle büyük ölçüde değişir. Sonraki deneyler ve klinik uygulamalar için en uygun modeli seçmek acil bir zorluk olarak ortaya çıkmıştır. Uygulanabilir bir yaklaşım, çeşitli modellerin performansını karşılaştırmayı ve daha fazla kullanım için en umut verici olanı seçmeyi gerektirir 7,11. Ayrıca, çeşitli bilgi işlem çerçevelerinde desteklenen parametreler ve sonuç biçimlerindeki çeşitlilik, karşılaştırmalı analiz için önemli zorluklar ortaya çıkarmaktadır. Bununla birlikte, şu anda farklı modellerin güçlü ve zayıf yönlerini karşılaştırmak ve parametre seçim sürecini basitleştirmek için son teknoloji makine öğrenimi algoritmalarını entegre ederek kullanıcıların erişmesini kolaylaştıran bir yazılım bulunmamaktadır. Bu nedenle, transkripsiyonel verilerin çeşitli makine öğrenimi algoritmalarıyla entegrasyonunu kolaylaştırabilecek ve aynı zamanda biyobelirteç seçimi ve model yorumlamanın mevcut sınırlamalarını ele alabilecek kullanıcı dostu yazılımların geliştirilmesine ihtiyaç vardır. Bu tür ilerlemeler, mevcut araştırma alanlarına değerli bilgiler sağlama ve nihayetinde hasta sonuçlarını iyileştirme yeteneğimizi büyük ölçüde artıracaktır.
Bu çalışmada, veri kümeleri arasında sağlam performans gösteren ve transkriptom veri kümelerinin çeşitli makine öğrenimi algoritmalarıyla entegrasyonunu kolaylaştırmayı ve böylece ilgili süreçleri basitleştirmeyi amaçlayan Mime12 adlı açık kaynaklı bir R paketi geliştirdik. Büyük ölçekli transkriptom verilerinden potansiyel adayları belirlemek ve en uygun modelleri geliştirmek için Mime dört uygulama işlevi sunar: 10 makine öğrenimi algoritmasının entegre edilmesiyle oluşturulan optimal bir prognoz modeli; yedi makine öğrenimi algoritması kullanılarak oluşturulmuş bir ikili yanıt modeli; sekiz makine öğrenimi algoritması kullanılarak tanımlanan prognozla ilgili temel özellikler; ve her modelin performansının görselleştirilmesi.