La adopción generalizada de tecnologías de secuenciación de alto rendimiento ha influido significativamente en nuestra comprensión de la biología y la heterogeneidad del cáncer1. Este avance revolucionario en biotecnología no solo ha profundizado nuestro conocimiento científico, sino que también ha revolucionado el campo de la investigación médica. Al permitir a los científicos secuenciar grandes cantidades de material genético de forma rápida y precisa, la secuenciación de alto rendimiento ha acelerado el descubrimiento de nuevos genes, mutaciones y vías biológicas. Un creciente cuerpo de investigación ha delineado firmas moleculares específicas asociadas con la progresión de la enfermedad, el pronóstico del paciente y la capacidad de respuesta terapéutica a partir de los datos de secuenciación 2,3,4. Estas firmas específicas ofrecen un panorama completo de la comprensión de la red reguladora transcripcional subyacente a la biología tumoral, incluido el origen tumoral, la diferenciación, la migración y la resistencia al tratamiento5. Estas características son a menudo diversas y variadas, abarcando múltiples facetas en lugar de limitarse a una sola exhibición. Esto dificulta el cribado y la identificación de genes específicos altamente asociados con la enfermedad. Por lo tanto, existe una necesidad urgente de estrategias computacionales sensatas para detectar genes cruciales implicados en la enfermedad.
El aprendizaje automático (ML) es una rama de la inteligencia artificial que se centra en la construcción de sistemas que puedan aprender de conjuntos de datos complejos, identificar patrones y desarrollar un modelo predictivo con alta precisión para proporcionar una referencia para la toma de decisiones6. Recientemente, el desarrollo de modelos basados en el aprendizaje automático a partir de datos de transcriptoma para predecir los resultados de los pacientes o diagnosticar enfermedades ha avanzado rápidamente en una variedad de enfermedades 7,8,9,10. El rendimiento de estos modelos a menudo varía mucho debido a los diferentes conjuntos de datos y algoritmos utilizados para el entrenamiento. La selección del modelo óptimo para experimentos y aplicaciones clínicas posteriores se ha convertido en un desafío apremiante. Un enfoque viable implica comparar el rendimiento de varios modelos y seleccionar el más prometedor para su posterior utilización 7,11. Además, la diversidad de parámetros y formatos de resultados admitidos en varios marcos informáticos plantea desafíos significativos para el análisis comparativo. Sin embargo, actualmente no existe ningún software que integre algoritmos de aprendizaje automático de última generación para comparar las fortalezas y debilidades de diferentes modelos y simplificar el proceso de selección de parámetros, lo que facilita el acceso de los usuarios. Por lo tanto, existe la necesidad de desarrollar un software fácil de usar que pueda facilitar la integración de los datos transcripcionales con diversos algoritmos de aprendizaje automático, al tiempo que aborda las limitaciones actuales de la selección de biomarcadores y la interpretación de modelos. Estos avances ampliarán en gran medida nuestra capacidad para proporcionar información valiosa sobre los campos de investigación actuales y, en última instancia, mejorar los resultados de los pacientes.
En este estudio, desarrollamos un paquete de R de código abierto llamado Mime12, que demuestra un rendimiento sólido en conjuntos de datos y tiene como objetivo agilizar la integración de conjuntos de datos de transcriptomas con varios algoritmos de aprendizaje automático, simplificando así los procesos asociados. Para identificar candidatos potenciales a partir de datos de transcriptoma a gran escala y desarrollar modelos óptimos, Mime ofrece cuatro funciones de aplicación: un modelo de pronóstico óptimo construido mediante la integración de 10 algoritmos de aprendizaje automático; un modelo de respuesta binaria construido utilizando siete algoritmos de aprendizaje automático; características principales relacionadas con el pronóstico identificadas mediante ocho algoritmos de aprendizaje automático; y visualización del rendimiento de cada modelo.