Широкое внедрение технологий высокопроизводительного секвенирования существенно повлияло на наше понимание биологии и гетерогенности рака1. Этот революционный прогресс в биотехнологии не только углубил наши научные знания, но и произвел революцию в области медицинских исследований. Позволяя ученым быстро и точно секвенировать большие объемы генетического материала, высокопроизводительное секвенирование ускорило открытие новых генов, мутаций и биологических путей. Растущий объем исследований определил конкретные молекулярные сигнатуры, связанные с прогрессированием заболевания, прогнозом пациента и терапевтической реакцией на основе данных секвенирования 2,3,4. Эти специфические сигнатуры предлагают всеобъемлющий ландшафт для понимания транскрипционной регуляторной сети, лежащей в основе биологии опухоли, включая происхождение опухоли, дифференцировку, миграцию и резистентность к лечению5. Эти особенности часто разнообразны и разнообразны, охватывают множество аспектов, а не ограничиваются одним экспонатом. Это затрудняет скрининг и идентификацию конкретных генов, тесно связанных с заболеванием. Таким образом, существует острая потребность в разумных вычислительных стратегиях для скрининга ключевых генов, участвующих в заболевании.
Машинное обучение (ML) — это отрасль искусственного интеллекта, которая фокусируется на создании систем, которые могут обучаться на сложных наборах данных, выявлять закономерности и разрабатывать прогностическую модель с высокой точностью, чтобы обеспечить основу для принятия решений6. В последнее время разработка моделей на основе машинного обучения на основе данных транскриптома для прогнозирования исходов лечения пациентов или диагностики заболеваний быстро продвигается вперед при различных заболеваниях 7,8,9,10. Производительность этих моделей часто сильно различается из-за различных наборов данных и алгоритмов, используемых для обучения. Выбор оптимальной модели для последующих экспериментов и клинических применений стал насущной проблемой. Жизнеспособный подход заключается в сравнении производительности различных моделей и выборе наиболее перспективной из них для дальнейшего использования 7,11. Кроме того, разнообразие параметров и форматов результатов, поддерживаемых различными вычислительными фреймворками, создает значительные проблемы для сравнительного анализа. Тем не менее, в настоящее время не существует программного обеспечения, которое интегрирует передовые алгоритмы машинного обучения для сравнения сильных и слабых сторон различных моделей и упрощения процесса выбора параметров, облегчая доступ для пользователей. Таким образом, существует потребность в разработке удобного для пользователя программного обеспечения, которое может облегчить интеграцию транскрипционных данных с различными алгоритмами машинного обучения, а также устранить текущие ограничения выбора биомаркеров и интерпретации моделей. Такие достижения значительно расширят наши возможности по предоставлению ценной информации в текущих областях исследований и, в конечном итоге, улучшат результаты лечения пациентов.
В этом исследовании мы разработали пакет R с открытым исходным кодом под названием Mime12, который демонстрирует высокую производительность при работе с наборами данных и направлен на оптимизацию интеграции наборов данных транскриптома с различными алгоритмами машинного обучения, тем самым упрощая связанные с этим процессы. Для выявления потенциальных кандидатов на основе крупномасштабных данных транскриптома и разработки оптимальных моделей Mime предлагает четыре прикладные функции: оптимальную модель прогноза, построенную путем интеграции 10 алгоритмов машинного обучения; модель двоичного отклика, построенная с использованием семи алгоритмов машинного обучения; основные особенности, связанные с прогнозированием, идентифицированные с помощью восьми алгоритмов машинного обучения; и визуализация производительности каждой модели.