أثر الاعتماد الواسع النطاق لتقنيات التسلسل عالية الإنتاجية بشكل كبير على فهمنا لعلم الأحياء وعدم تجانس السرطان1. لم يعمق هذا التقدم الرائد في التكنولوجيا الحيوية معرفتنا العلمية فحسب ، بل أحدث أيضا ثورة في مجال البحث الطبي. من خلال تمكين العلماء من تسلسل كميات كبيرة من المواد الوراثية بسرعة ودقة ، أدى التسلسل عالي الإنتاجية إلى تسريع اكتشاف جينات وطفرات ومسارات بيولوجية جديدة. حددت مجموعة متزايدة من الأبحاث التوقيعات الجزيئية المحددة المرتبطة بتطور المرض ، وتشخيص المريض ، والاستجابة العلاجية من بيانات التسلسل2،3،4. توفر هذه التوقيعات المحددة مشهدا شاملا لفهم الشبكة التنظيمية النسخية الكامنة وراء بيولوجيا الورم ، بما في ذلك أصل الورم والتمايز والهجرة ومقاومة العلاج5. غالبا ما تكون هذه الميزات متنوعة ومتنوعة ، وتشمل جوانب متعددة بدلا من أن تقتصر على معرض واحد. هذا يجعل من الصعب فحص وتحديد جينات معينة مرتبطة ارتباطا وثيقا بالمرض. وبالتالي ، هناك حاجة ملحة لاستراتيجيات حسابية معقولة لفحص الجينات الحاسمة المتورطة في المرض.
التعلم الآلي (ML) هو فرع من فروع الذكاء الاصطناعي يركز على بناء الأنظمة التي يمكنها التعلم من مجموعات البيانات المعقدة وتحديد الأنماط وتطوير نموذج تنبؤي بدقة عالية لتوفير مرجع لاتخاذ القرارات6. في الآونة الأخيرة ، تقدم تطوير النماذج القائمة على التعلم الآلي من بيانات النسخ للتنبؤ بنتائج المرضى أو تشخيص الأمراض بسرعة في مجموعة متنوعة من الأمراض7،8،9،10. غالبا ما يختلف أداء هذه النماذج اختلافا كبيرا بسبب مجموعات البيانات والخوارزميات المختلفة المستخدمة في التدريب. ظهر اختيار النموذج الأمثل للتجارب والتطبيقات السريرية اللاحقة كتحد ملح. يستلزم النهج القابل للتطبيق مقارنة أداء النماذج المختلفة واختيار أكثرها واعدا لمزيد من الاستخدام7،11. علاوة على ذلك ، فإن التنوع في المعلمات وتنسيقات النتائج المدعومة عبر أطر الحوسبة المختلفة يطرح تحديات كبيرة للتحليل المقارن. ومع ذلك ، لا يوجد حاليا برنامج يدمج خوارزميات التعلم الآلي المتطورة لمقارنة نقاط القوة والضعف في النماذج المختلفة وتبسيط عملية اختيار المعلمات ، مما يسهل على المستخدمين الوصول إليها. وبالتالي ، هناك حاجة لتطوير برامج سهلة الاستخدام يمكن أن تسهل تكامل بيانات النسخ مع خوارزميات التعلم الآلي المتنوعة ، مع معالجة القيود الحالية لاختيار العلامات الحيوية وتفسير النموذج. ستعمل هذه التطورات على توسيع قدرتنا بشكل كبير على تقديم رؤى قيمة في مجالات البحث الحالية وتحسين نتائج المرضى في نهاية المطاف.
في هذه الدراسة ، قمنا بتطوير حزمة R مفتوحة المصدر تسمى Mime12 ، والتي توضح أداء قويا عبر مجموعات البيانات وتهدف إلى تبسيط تكامل مجموعات بيانات النسخ مع خوارزميات التعلم الآلي المختلفة ، وبالتالي تبسيط العمليات المرتبطة بها. لتحديد المرشحين المحتملين من بيانات النسخ واسعة النطاق وتطوير النماذج المثلى ، يقدم Mime أربع وظائف تطبيقية: نموذج التشخيص الأمثل الذي تم إنشاؤه من خلال دمج 10 خوارزميات للتعلم الآلي. نموذج استجابة ثنائي تم إنشاؤه باستخدام سبع خوارزميات للتعلم الآلي ؛ السمات الأساسية المتعلقة بالتشخيص التي تم تحديدها باستخدام ثماني خوارزميات للتعلم الآلي. وتصور أداء كل نموذج.