$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Después de la ejecución exitosa del flujo de trabajo, se generan varias tablas y figuras como se indica en la Figura 2. Las figuras se colocan en la carpeta /figures (Figura 6, Figura 7, Figura 8, Figura complementaria 1, Figura complementaria 2, Figura complementaria 3, Figura complementaria 4) y las tablas se colocarán en la carpeta /results especificada.
En caso de que la ejecución del flujo de trabajo no se ejecute correctamente, esto puede deberse principalmente a: errores técnicos causados, por ejemplo, por memoria insuficiente (especialmente en el primer paso donde se carga un conjunto de datos de una sola celda grande), datos con formato incorrecto (por ejemplo, columnas de sample_id no coincidentes entre conjuntos de datos) o especificaciones incorrectas en los archivos de configuración (por ejemplo, exclusión de muchas funciones). En este caso, normalmente, se producirá un mensaje de error dentro del script de Jupyter-notebook durante la ejecución y no se generarán gráficos ni datos. Se recomienda utilizar los archivos de configuración predeterminados tal como se generaron durante la ejecución del script y solo modificar parámetros específicos como se describe en el protocolo.
Una ejecución exitosa se indica mediante la generación de los gráficos y tablas resultantes, y cada paso revelará información adicional sobre los datos y los principales patrones de varianza inherentes a ellos. Sin embargo, no necesariamente cada ejecución producirá resultados biológicamente útiles e interpretables. A menudo, los datos se caracterizan por grandes efectos técnicos y diferentes distribuciones, que deben tenerse en cuenta en el paso "Preprocesamiento y armonización de datos" o en el "Modelo MOFA9 " (que también permite especificar diferentes distribuciones para los tipos de datos de entrada) para poder extraer la variación de los datos que refleja los procesos biológicos subyacentes.
Dentro del flujo de trabajo presentado, se pueden utilizar diferentes conjuntos de datos multiómicos como entrada. Actualmente, el flujo de trabajo acepta el popular formato de archivo .h5ad para datos de una sola celda y un formato de archivo .csv muy general para todos los demás conjuntos de datos como entrada (Figura 3). Es común que los diferentes conjuntos de datos ómicos tengan formatos de archivo muy diferentes. Para no limitar la ejecución del flujo de trabajo a formatos de archivo específicos, .csv utiliza como un formato muy general. Por lo tanto, se pueden usar todos los tipos de conjuntos de datos ómicos diferentes como entrada para el flujo de trabajo, pero deben convertirse al formato de .csv correspondiente, como se indica en la figura 3 , antes de su uso dentro de este flujo de trabajo. Esto se puede preparar utilizando una hoja de cálculo o un software específico de omic. Para preprocesar los diferentes conjuntos de datos ómicos, hay varias opciones disponibles dentro del flujo de trabajo para aplicar diferentes pasos de preprocesamiento y normalización (por ejemplo, ajuste del tamaño de la biblioteca, transformación de registros, normalización de cuantiles de muestra) en los diferentes conjuntos de datos de entrada mediante la configuración del archivo de 02_Pre_Processing_Configs.csv y 02_Pre_Processing_Configs_SC.csv (Figura 2). Sin embargo, las opciones disponibles aquí se basan principalmente en los datos de entrada específicos disponibles en el conjunto de datos presentado aquí (scRNA-seq, ensayo de citocinas, proteómica, prime-seq). En caso de que se utilicen otros tipos de datos o ómicas, puede ser necesario aplicar pasos de normalización específicos de ómica adicionales de acuerdo con las prácticas recomendadas existentes. En este caso, los datos se pueden entregar al flujo de trabajo en un formulario ya preprocesado y se integrarán junto con los otros conjuntos de datos sin aplicar más pasos de preprocesamiento. En muchos casos, la aplicación del paso Normalización cuantil de características es útil para alinear la distribución de todos los tipos de datos con una distribución normal y hacer que el análisis descendente entre las diferentes características de entrada sea más comparable y compatible con la especificación del modelo de ruido gaussiano .
Durante la ejecución del flujo de trabajo, se generan varios gráficos y salidas que apoyan el proceso de integración de datos y la posterior interpretación biológica posterior. En el caso de los datos de scRNA-seq, el gráfico de FIG01_Amount_of_Cells_Overview (Figura 6) indica qué tipos de células podrían incluir muy pocas células por muestra y tipo de célula para medir de forma fiable una señal de expresión génica, ya que para los análisis posteriores, el valor medio de todas las células de un tipo de célula por muestra se utiliza como estimación de la expresión (enfoque psedobulk). En este caso de uso, excluimos los tipos de células que tienen menos de tres células en la mayoría de las muestras.
El FIG03_Overview_Variance_Decomposition del gráfico de descomposición de la varianza (Figura 7, Figura 1 complementaria) puede indicar qué tan bien se integran las diferentes fuentes de datos y qué parte de la varianza en las diferentes fuentes de datos es compartida y única para cada fuente de datos. Por ejemplo, al probar diferentes estrategias de preprocesamiento en el conjunto de datos utilizado aquí, se muestra, por ejemplo, que la eliminación del paso de normalización de cuantiles de características del preprocesamiento conduce a factores latentes que se centran más en vistas de datos específicas y reduce la integración de los datos proteómicos con las otras fuentes de datos. Esto se puede ver en la cantidad reducida de varianza explicada (Figura suplementaria 1B). La ejecución del modelo MOFA sin ningún filtrado de características o sin normalización conduce a una menor varianza compartida entre las diferentes vistas capturadas por los factores latentes (Figura complementaria 1C). Esto indica que los factores latentes reflejan predominantemente efectos técnicos específicos del tipo de datos. Además de eso, el propio modelo MOFA9 también podría devolver advertencias en caso de datos mal preprocesados. En la Figura complementaria 1 se muestra un ejemplo de esta advertencia para las configuraciones de preprocesamiento alternativas MI_v2 y MI_v3 (los archivos de configuración de ejemplo específicos se almacenan en el repositorio de GitHub clonado en la carpeta config_examples ).
Además, después de ejecutar el modelo MOFA, los resultados se pueden evaluar en varios análisis posteriores asociando el factor con metainformación biológica conocida sobre las muestras, así como con covariables técnicas y otras covariables de confusión (04_Downstream_Factor_Analysis) para identificar la causa probable de la variación capturada por los factores. Por ejemplo, si uno de los factores de los modelos MOFA se asocia fuertemente con una de las covariables técnicas (como la información de lotes), esto podría indicar que este factor capta más bien la variación técnica dentro de los datos en lugar de la variación biológica.
Para reducir la interpretación biológica en la parte de análisis posterior, aquí se describen un par de hallazgos basados en el conjunto de datos de entrada (se puede encontrar una interpretación más refinada en la publicación original11). En el primer paso, pudimos observar que con la estrategia de preprocesamiento aplicada, encontramos varios factores que capturan la varianza entre múltiples tipos de celdas, pero también otros tipos de datos ómicos (Figura 7A). Por ejemplo, el factor 2 captura la varianza en las características de entrada clínica y en varios tipos de células del conjunto de datos scRNA-seq. Asociando los tres primeros factores con covariables clínicas relevantes como 'PCR' y 'CK' (Figura 7B) e investigando las diferencias en los valores de los factores para los diferentes subgrupos de pacientes: 'Control (incluyendo CCS y no CCS) vs. 'ACS' medidos en los diferentes puntos temporales (TP1-TP4) (Figura 7C), también encontramos que el Factor2 se asocia significativamente con el valor de 'CK' y el Factor3 con el valor de 'PCR'. Al mismo tiempo, las muestras de 'ACS' en TP1 y TP2 (que reflejan la fase aguda de la respuesta inmunitaria al infarto de miocardio (IM)) muestran un aumento en los valores de los factores en comparación con las muestras 'Control' y de puntos temporales posteriores (TP3/TP4). La CK es un marcador conocido de daño miocárdico y se caracteriza típicamente por un aumento de los valores de TP1/TP2, similar al patrón capturado por Factor2.
Para generar información sobre los procesos biológicos que dan forma al Factor2, evaluamos las características de mayor rango del factor observando la tabla de ponderaciones de características generada por el modelo (03_Weight_Data.csv). Analizando el 1% superior de las características con los pesos absolutos más altos en el factor, encontramos principalmente CD4. MTC y CD14. Las características monoderivadas están sobrerrepresentadas en comparación con su número total de características de entrada (Figura 8A), lo que indica que estos tipos de células son altamente relevantes en el proceso inflamatorio después de la IM (NOTA: en caso de que no se haya aplicado una normalización cuantílica de características en el preprocesamiento, diferentes distribuciones de las características también podrían afectar este resultado y la evaluación debe realizarse por separado por tipo de datos). Analizando las características mejor clasificadas del CD4. Tipo de célula TCM en el factor, encontramos varios genes interesantes como EIF3E18 requerido para la activación robusta de las células T y HMGB119, que promueve la expansión y activación de las células T (Figura 8B). A continuación, ejecutamos el análisis de enriquecimiento de vías utilizando vías inmunitarias de la base de datos REACTOME20 como un conjunto de vías (Prepared_Pathway_Data.csv). Encontramos enriquecimiento para varias vías de 'interleucina', incluida la señalización de 'interleucina-6'. Los niveles de expresión de varios genes en diferentes tipos de células de los datos de scRNA-seq y los valores de citocinas 'IL6' medidos por el ensayo de citocinas contribuyeron a este resultado (Figura 8C). La identificación de estos patrones compartidos entre tipos de datos pone de manifiesto el valor añadido de un análisis integrado. En general, este enfoque también puede identificar varios otros factores que reflejan el estado de la enfermedad o asocian el resultado del tratamiento y los programas inmunes multicelulares subyacentes, como se describe más en detalle en la publicación correspondiente11.
Para enfatizar aún más la ventaja de los análisis integrados en múltiples ómicas, también se ejecutó el mismo flujo de trabajo, solo incluyendo los datos de entrada de proteómica (Figura 4 suplementaria). Al analizar los factores resultantes, encontramos de manera similar al análisis integrado un factor (Factor1) que se correlaciona fuertemente con el valor de 'PCR'. Este patrón describe la principal fuente de variación dentro de los datos proteómicos y también está alineado con algunas de las variaciones en los otros conjuntos de datos capturados por 'Factor3' en el análisis integrado (Figura 7C). Sin embargo, un patrón similar al indicado por Factor2 que captura el curso temporal de la inflamación en el análisis integrado no se puede identificar únicamente sobre la base de datos proteómicos.
El flujo de trabajo introducido y el propio modelo MOFA9 son altamente personalizables con muchos parámetros ajustables. Por lo tanto, es importante visualizar y comparar sistemáticamente los resultados producidos por diferentes configuraciones. Para facilitar esta tarea, el resultado final que puede generar el flujo de trabajo es una comparación de diferentes ejecuciones con nombre de la canalización con diferentes parámetros en el preprocesamiento y la estimación del modelo. Por ejemplo, el modelo MOFA se puede estimar con diferentes números de factores latentes (Figura complementaria 2A) o se pueden ponderar vistas con un número menor de características (Figura complementaria 3A). La configuración y ejecución del último script del flujo de trabajo '07_Compare_Models' produce varios gráficos para evaluar la similitud entre diferentes ejecuciones de canalización. FIG07_Variance_Model_Comparison (Figura suplementaria 2B, Figura suplementaria 3B) muestra una comparación de la varianza total explicada para cada vista para diferentes ejecuciones. La correlación de los valores de los factores y las ponderaciones de los factores de características entre las diferentes ejecuciones puede indicar cuánto cambian los resultados al modificar un determinado parámetro (Figura complementaria 2C, Figura complementaria 3C). En este caso, la modificación del número de factores solo provoca cambios menores en los valores estimados de los factores y las ponderaciones de las características (Figura complementaria 2C). La modificación de la ponderación de la vista de datos da como resultado una varianza explicada mucho mayor en las vistas con un menor número de características, por ejemplo, la vista "clínica" (Figura complementaria 3B). Sin embargo, las características relevantes dentro de los tres primeros factores todavía están altamente correlacionadas con las inferidas con la versión no ponderada (Figura suplementaria 3C).
Con los archivos de .csv de salida del modelo generados en la carpeta de resultados (por ejemplo, el factor estimado y los pesos de las características), se pueden realizar más análisis posteriores individuales. Todo el código y los archivos de configuración necesarios (incluida la documentación) están disponibles en GitHub en https://github.com/heiniglab/mofa_workflow. La imagen de singularidad que se creó para permitir una fácil instalación de los paquetes conda necesarios para el análisis se puede descargar desde https://doi.org/10.5281/zenodo.10815146. Un pequeño conjunto de datos de ejemplo que se puede utilizar para realizar una prueba inicial de la canalización también se puede descargar desde el mismo registro de zenodo.

Figura 7: Análisis de salida de MOFA. Después de la ejecución del modelo MOFA (03_Run_MOFA.ipynb) y el análisis posterior de los valores de los factores (04_Downstream_Factor_Analysis.ipynb) se generan varios gráficos: (A) FIG03_Overview_Variance_Decomposition: devuelve una visualización de la varianza explicada de los factores MOFA estimados dentro de las diferentes vistas. Mapa de calor (izquierda): muestra el porcentaje de la varianza total de una vista capturada por un factor para cada vista. Diagrama de barras (derecha): muestra el porcentaje total de varianza que capturan todos los factores para cada vista. (B) FIG04_Factor_Association_Numerical_Features: muestra la correlación de Pearson de los valores de los factores con las covariables numéricas de la muestra elegidas, aquí: variables clínicas (PCR, CK). (C) FIG04_Factor_Association_Categorical_Features: muestra la diferencia en los valores de los factores para las covariables de la muestra categórica como un diagrama de caja. Aquí, se comparan los valores de los factores 1-3 para cada punto de tiempo de los pacientes con SCA y control. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Análisis de las características del MOFA. Después de la ejecución de los análisis posteriores (04_Downstream_Factor_Analysis.ipynb, 05_Downstream_Investigate_Features.ipynb) se generan varios gráficos. Todos los gráficos aquí visualizan el Factor 2 de MOFA: (A) FIG04_Top_Feature_Overview_per_Factor: El mapa de calor (izquierda) muestra para cada vista el porcentaje de varianza capturado por el factor seleccionado. Los diagramas de barras (derecha) indican la relevancia de las características de las diferentes vistas para el factor. A la izquierda, se proporciona la cantidad total de características de una vista específica dentro del 1% superior de las características de mayor clasificación en todas las vistas del factor. A la derecha, se da el porcentaje, dividiendo el número total entre el 1% superior por el número total de características de esa vista. (B) FIG05_Heatmap_Feature_Overview: El mapa de calor (izquierda) muestra el 1% de las características del CD4 con la clasificación más alta. Tipo de célula TCM: los valores de expresión normalizados de cada muestra comparando los pacientes del grupo 'Control' (CCS y no CCS) con los diferentes puntos temporales para los pacientes 'SCA'. El diagrama de barras (derecha) muestra el peso de las entidades. La dirección del signo del peso se indica antes a la izquierda antes de los nombres de los tipos de celda: '+' peso del factor positivo; '-' peso negativo del factor. (C) FIG06_Pathway_and_Genes: muestra el peso del 25% de los genes con mayor clasificación para el factor que pertenecen a las vías de interleucina enriquecidas. En el mapa de calor de la parte superior, se promedian en todas las vistas, y en el mapa de calor de la parte inferior se muestra por vista. Haga clic aquí para ver una versión más grande de esta figura.
Figura complementaria 1: Efectos de la armonización de datos. La figura muestra FIG03_Overview_Variance_Decomposition para varias configuraciones diferentes de preprocesamiento de datos: visualización de la varianza explicada de los factores MOFA estimados dentro de las diferentes vistas. Mapa de calor (izquierda): muestra para cada vista el porcentaje de la varianza total de una vista que es capturada por un factor. Diagrama de barras (derecha): muestra para cada vista el porcentaje total de varianza que capturan todos los factores. (A) La configuración ('MI_v1') en base a la cual se han analizado los resultados biológicos posteriores en figuras anteriores (parámetros establecidos como en los archivos de configuración predeterminados en el repositorio clonado). (B) La misma configuración de preprocesamiento que en 'MI_v1' con la modificación de que no se aplica ninguna normalización de cuantiles por características (los parámetros se establecen como en los archivos de configuración de ejemplo en la carpeta 'config_examples' del repositorio). Se agrega una captura de pantalla de la advertencia de salida del modelo MOFA para esta configuración al gráfico a continuación. (C) La descomposición de la varianza resultante cuando no se aplican pasos de preprocesamiento y todos los datos se utilizan como entrada sin ningún preprocesamiento o filtrado de características (los parámetros se establecen como en el archivo de configuración de ejemplo en la carpeta 'config_examples' del repositorio). Se agrega una captura de pantalla de la advertencia de salida del modelo MOFA para esta configuración al gráfico a continuación. Haga clic aquí para descargar este archivo.
Figura complementaria 2: Configuración de MOFA - Efecto de la cantidad de factores. Las cifras resultantes generadas por el script '07_Compare_Models.ipynb' utilizando varias configuraciones diferentes para ejecutar el modelo MOFA. (A) '03_MOFA_configs.csv': Ejemplo de las diferentes configuraciones utilizadas para ejecutar el script '03_Run_MOFA.ipynb' especificando varias cantidades diferentes de factores (10,15,20,25). '07_Comparison_configs.csv': Ejemplo de cómo especificar el fichero de entrada de configuración para la ejecución del script '07_Compare_Models.ipynb'. (B) 'FIG07_Variance_Model_Comparison' que muestra la varianza total explicada para cada vista (eje Y) para los diferentes modelos en todos los factores especificados en el modelo. C) «FIG07_Factor_Correlations» que muestra la correlación de los valores de la muestra factorial entre las diferentes configuraciones. Haga clic aquí para descargar este archivo.
Figura complementaria 3: Configuración de MOFA - Efecto de las vistas de ponderación. Las cifras resultantes generadas por el script '07_Compare_Models.ipynb' utilizando varias configuraciones diferentes para ejecutar el modelo MOFA. (A) '03_MOFA_configs.csv': Ejemplo de las diferentes configuraciones utilizadas para ejecutar el script '03_Run_MOFA.ipynb' especificando el parámetro 'weighting_of_views' para que sea 'TRUE' (MI_v1_MOFA_weighted) o 'FALSE' (MI_v1_MOFA). '07_Comparison_configs.csv': Ejemplo de cómo especificar el fichero de entrada de configuración para la ejecución del script '07_Compare_Models.ipynb'. (B) 'FIG07_Variance_Model_Comparison' que muestra la varianza total explicada para cada vista (eje Y) para los diferentes modelos en todos los factores especificados en el modelo. (C) 'FIG07_Feature_Correlations' que muestra la correlación de los pesos de los factores de característica entre las diferentes configuraciones. Haga clic aquí para descargar este archivo.
Figura 4 complementaria: Efecto de integración multiómica, utilizando solo datos proteómicos. Los patrones resultantes capturados por los factores latentes cuando solo se utilizan datos de proteómica como entrada. (A) FIG04_Factor_Association_Numerical_Features: Correlación de Pearson de los valores de los factores con las variables clínicas (PCR, CK). (B) FIG04_Factor_Association_Categorical_Features: Comparación de los valores de los factores de cada punto temporal de los pacientes SCA y control. Haga clic aquí para descargar este archivo.
Legajo Complementario 1: Supplementary_File_
Running_Pipeline_with_Exemplary_Data. Las descripciones sobre cómo ejecutar la canalización en los datos de ejemplo y las salidas esperadas se proporcionan en un archivo complementario proporcionado adicionalmente. Haga clic aquí para descargar este archivo.
Archivo de video complementario 1: Captura de pantalla de video del protocolo. Haga clic aquí para descargar este archivo.