$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
La secuenciación masiva de ARN permite comparar los niveles de expresión de miles de genes en una población de células de casos frente a una población de células de control. Los experimentos generalmente están diseñados para incluir al menos muestras triplicadas, idealmente réplicas biológicas, aunque las réplicas técnicas pueden ser suficientes. Este diseño tiene en cuenta la variabilidad biológica y reduce el impacto de las muestras de valores atípicos. El análisis de estos patrones de expresión proporciona una visión detallada del efecto de la enfermedad de interés en los procesos celulares normales y puede permitir potencialmente la predicción de terapias relevantes.
El preprocesamiento de datos de secuenciación de ARN masivos generalmente incluye: control de calidad de lecturas de secuenciación (para repeticiones, adaptadores de secuenciación, GC%, etc.), recorte de lectura y extracción de adaptadores, mapeo / cuantificación de lectura 1,2,3 y análisis de expresión diferencial 4,5,6. Afortunadamente, se han automatizado una variedad de procesos analíticos para reducir el trabajo manual asociado con estos pasos 7,8,9. Una vez completado el preprocesamiento, los análisis posteriores que se realizan comúnmente incluyen análisis de sobrerrepresentación funcional con ontologías genéticas, enriquecimiento de vías de señalización y variación en el empalme. Estos análisis posteriores resumen y facilitan la interpretación de los resultados de expresión diferencial a un nivel de granularidad más alto que las listas de genes por sí solas.
Se han desarrollado varias herramientas con el objetivo de reutilizar las terapias existentes para un tipo o subtipo de enfermedad bien definido. Esto se logra entrenando el algoritmo en tipos de datos ómicos múltiples para la enfermedad prevista. Desafortunadamente, tales esfuerzos para mejorar la especificidad y la sensibilidad en una enfermedad prevista a menudo hacen que el uso de las herramientas en contextos más generales no sea óptimo10,11. Otro conjunto de herramientas es más ampliamente aplicable a los casos en que los perfiles de expresión génica coinciden con las firmas existentes de expresión génica12,13 o con los efectos cuantificados de las terapias actuales14,15. Sin embargo, estas herramientas de aplicación más amplia a menudo logran una especificidad y sensibilidad reducidas en una amplia gama de enfermedades y/o fueron entrenadas con datos obsoletos.
Por el contrario, el algoritmo Pathway2Targets se ha aplicado previamente para predecir posibles objetivos terapéuticos en el linfoma de células B, la periodontitis, el cáncer de mama con estrógenos positivos, el cáncer de mama triple negativo y el virus chikungunya 16,17,18,19,20,21. Los resultados de estos estudios demuestran que esta herramienta es capaz de predecir objetivos robustos y biológicamente relevantes. Impresionantemente, Pathway2Targets predijo 392 posibles objetivos farmacológicos para el cáncer de mama triple negativo, entre los cuales 60 se probaron en ensayos clínicos; así como 828 medicamentos individuales para TBNC, con 37 en pruebas17. En el estudio de linfoma, este algoritmo predijo 915 medicamentos, 461 de los cuales están aprobados por la FDA19.
El objetivo del trabajo actual es describir un protocolo computacional que permitirá a más investigadores, que pueden beneficiarse del acceso a instrucciones más descriptivas sobre la ejecución de programas en la línea de comandos, utilizar de manera efectiva el algoritmo Pathway2Targets recientemente desarrollado (Figura 1). Pathway2Targets predice objetivos para una afección determinada mediante la combinación de datos de expresión diferencial, asociaciones gen-enfermedad, información de ensayos clínicos, datos públicos de objetivos22, información de vías y otras métricas. Es importante destacar que este algoritmo incorpora un esquema de ponderación único y personalizable, que permite a los usuarios determinar las ~20 métricas relacionadas con el objetivo que prefieren enfatizar en su análisis, como el número de asociaciones de enfermedades, el número de vías de señalización, el número de fármacos únicos, el número de terapias en cada fase de los ensayos clínicos, etc.23. Como ejemplo de caso de uso para este protocolo, volveremos a analizar un conjunto de datos de cáncer colorrectal existente24.